Playwright보다 2배 빠르고 토큰을 80% 더 효율적으로 사용하는 Stagehand v4
Stagehand는 Playwright의 브라우저 자동화 API를 바탕으로 AI 에이전트에 맞춘 SDK입니다. 브라우저 내부 확장 프로그램, 접근성 트리 기반 컨텍스트 축소, 배치 명령과 캐싱을 활용해 Playwright 대비 2배 빠른 실행과 80% 높은 토큰 효율을 목표로 하며 TypeScript·Python·Go를 지원합니다.
Stagehand는 Playwright의 브라우저 자동화 API를 바탕으로 AI 에이전트에 맞춘 SDK입니다. 브라우저 내부 확장 프로그램, 접근성 트리 기반 컨텍스트 축소, 배치 명령과 캐싱을 활용해 Playwright 대비 2배 빠른 실행과 80% 높은 토큰 효율을 목표로 하며 TypeScript·Python·Go를 지원합니다.
동일한 노트북에서 Gemma 4 소형 양자화 모델을 CPU와 4GB GTX 1650 Ti로 번갈아 서빙한 결과, GPU 디코드 속도가 평균 4.27배 빨랐습니다. 모델의 대형 임베딩 테이블이 호스트 메모리에 남는 구조 덕분에 4GB GPU만으로도 충분히 적재할 수 있었습니다.
두 개의 LLM이 같은 작업을 독립적으로 검토한 뒤 근거를 교환하게 하는 AdversarialDebate를 소개합니다. 초기에는 논쟁처럼 보이는 대화의 89%가 연극에 불과했지만, 독립 판정과 구조화된 반론을 적용한 v0.2.0에서는 2,333개 데이터 행 기준 88.7%의 이진 일치율을 기록했습니다.
Apple이 2027년 사용할 DRAM 가격으로 기가비트당 2달러를 사실상 수용하면서 아이폰 가격이 다시 오를 가능성이 커지고 있습니다. AI 데이터센터용 메모리 수요가 소비자 기기용 생산능력을 압박해 수요·공급 격차가 2028년 상반기까지 이어질 수 있다는 분석입니다.
ISTA-DASLab이 512-expert MoE 모델 Qwen3.8-Flash-Next를 GSQ와 RCO로 비균일 양자화해 2.40·2.50·3.00 bpw GGUF로 공개했습니다. IQ3_XXS는 BF16 대비 4.7배 작으면서 AIME25 점수가 같고, Q2_0은 IQ2_XS보다 프롬프트 처리량이 3.4배 높습니다.
Higgsfield는 대규모 언어 모델(LLM) 학습을 위해 GPU 노드 할당, 실험 큐 관리, 분산 샤딩, 학습 모니터링, GitHub Actions 연동을 제공하는 오픈소스 프레임워크입니다. PyTorch FSDP와 DeepSpeed ZeRO-3를 지원하며, 여러 노드에서 대규모 모델을 학습하고 체크포인트를 관리하는 흐름을 단순화합니다.
Grant Sanderson은 AI가 증명을 생성하는 시대에 수학의 목표를 인간의 이해로 다시 정의하고, 문제의 동기와 맥락까지 설명하는 ‘motivated explanation’을 증명에 준하는 연구 성과로 인정하자고 제안합니다. 이를 위해 미해결 설명 문제, 설명 중심 저널, 채용·종신재직 평가의 변화가 필요하다고 주장합니다.
AI를 사용한 사실을 공개했다가 면접에서 탈락한 개발자가, 같은 면접에서 AI를 사용하는 면접관을 봤다고 말합니다. 글은 코딩 평가가 문법 암기보다 AI의 오류를 판별하고 결과를 통제하는 판단력을 측정해야 한다고 주장합니다.
Apple의 M5 Ultra는 Geekbench 7 Metal에서 M3 Ultra 평균보다 최대 59% 높은 366,744점을 기록했고, OpenCL 성능은 NVIDIA GeForce RTX 4080에 근접합니다. M6도 M5 평균보다 최대 34% 높은 93,217점을 기록했습니다.
Cua는 AI 에이전트가 Linux·macOS·Windows의 데스크톱 애플리케이션과 브라우저를 조작하도록 하는 오픈소스 도구 모음입니다. 격리된 클라우드 데스크톱, 로컬 macOS VM, 에이전트 평가·학습용 Cua-Bench를 함께 제공합니다.
GPT-6 Astra가 1918년 독일군이 사용한 ADFGVX 방식의 미해독 무선 메시지를 해독했다고 보고합니다. 모델은 당시 사용 기록이 남은 암호 키를 적용해 영국 순양함의 세바스토폴 도착과 연합군 함대의 후속 이동을 담은 문장을 복원했으며, 관련 항해 기록과의 일치도 확인했습니다.
Intel 연구진이 모델의 가중치나 출력값을 바꾸지 않고 저장 형식만 개선하는 BITCOS를 제안했습니다. 0 가중치의 비율을 별도로 활용해 한 체크포인트를 1.485비트로 저장했으며, 하드웨어에 따라 디코딩 처리량이 CPU에서 최대 18%, GPU에서 최대 27% 향상됐습니다.
OpenAI의 AI 가속기 칩 Jalapeño는 최대 13.4페타플롭스의 4비트 연산과 15.4TB/s 메모리 대역폭을 제공하며, Nvidia GB300보다 엔드투엔드 지연 시간을 최대 3.6배 줄이는 것을 목표로 합니다. 설계 과정에서는 LLM을 고수준 합성, 검증, 소프트웨어 최적화에 활용해 아키텍처 구상부터 첫 실리콘까지 20개월 이내에 진행했습니다.
Toone은 자연어로 복잡하고 장시간 실행되는 AI 에이전트 워크플로를 만들고, 각 단계를 확인·수정·디버깅한 뒤 중단한 지점부터 재개할 수 있는 macOS 앱입니다. OpenAI 또는 Anthropic 계정을 연결해 결정적 실행과 관찰 가능성을 확보하는 것을 목표로 합니다.
코딩 에이전트의 지침을 하나의 거대한 파일에 항상 넣는 대신, 작업에 필요한 규칙을 무엇을·어디에·언제라는 기준으로 나눠 필요한 순간에만 불러오는 점진적 공개를 설명합니다. 28,721개 저장소 분석과 AGENTS.md, CLAUDE.md, skills, 경로 설정 사례를 바탕으로 컨텍스트 경쟁을 줄이는 방법과 새롭게 생기는 지침 관리 문제를 다룹니다.
ApplySeed는 스타트업 프로필을 바탕으로 지원 자격에 맞는 액셀러레이터와 펀딩 프로그램을 찾고, 각 지원서에 맞춰 답변을 작성해 주는 서비스입니다. 사용자는 덱이나 메모, ChatGPT 프롬프트로 정보를 입력한 뒤 결과를 검토하고 직접 제출할 수 있습니다.
Pushary는 AI 코딩 에이전트가 권한 승인이나 추가 답변을 기다리며 멈추는 문제를 Mac 노치와 잠금 화면, 모바일 앱으로 해결합니다. Claude Code·Codex·Cursor 등 여러 도구의 승인과 질문을 한곳에서 처리하고, 도구별 자동 승인 정책과 감사 기록도 제공합니다.
Wasmer 기술 면접을 위해 엣지 배포, 대시보드, 내구성 워크플로 시스템까지 준비했지만, 간단한 캐시 파일의 수동 코드 리뷰에서 코드의 문제를 발견하고도 설명하지 못해 고전합니다. 글쓴이는 AI를 활용한 개발 역량과 기초 코드를 직접 읽고 설명하는 능력 사이의 간극, 그리고 AI 시대에 맞지 않는 채용 방식이 무엇인지 되묻습니다.
MosMos는 개인의 생각과 여러 사람이 참여한 대화를 음성으로 받아 실제 문서 작업에 활용할 수 있도록 만드는 음성 글쓰기 도구입니다. 자연어 받아쓰기, 사용자 지정 문체, 웹 검색, 개인 용어집, 화자 구분과 타임스탬프 기반 회의 정리 기능을 제공합니다.
미 연방법원이 구글의 광고 기술 시장 독점을 인정하면서도 사업 분할은 명령하지 않았습니다. 대신 경쟁 기술과의 상호운용성, 광고 경매 데이터 공개, 내부 감시관 도입을 요구했습니다.