Playwright보다 2배 빠르고 토큰을 80% 더 효율적으로 사용하는 Stagehand v4
Stagehand는 Playwright의 브라우저 자동화 API를 바탕으로 AI 에이전트에 맞춘 SDK입니다. 브라우저 내부 확장 프로그램, 접근성 트리 기반 컨텍스트 축소, 배치 명령과 캐싱을 활용해 Playwright 대비 2배 빠른 실행과 80% 높은 토큰 효율을 목표로 하며 TypeScript·Python·Go를 지원합니다.
Stagehand는 Playwright의 브라우저 자동화 API를 바탕으로 AI 에이전트에 맞춘 SDK입니다. 브라우저 내부 확장 프로그램, 접근성 트리 기반 컨텍스트 축소, 배치 명령과 캐싱을 활용해 Playwright 대비 2배 빠른 실행과 80% 높은 토큰 효율을 목표로 하며 TypeScript·Python·Go를 지원합니다.
동일한 노트북에서 Gemma 4 소형 양자화 모델을 CPU와 4GB GTX 1650 Ti로 번갈아 서빙한 결과, GPU 디코드 속도가 평균 4.27배 빨랐습니다. 모델의 대형 임베딩 테이블이 호스트 메모리에 남는 구조 덕분에 4GB GPU만으로도 충분히 적재할 수 있었습니다.
Docling은 PDF, DOCX, PPTX, XLSX, HTML, 이미지, 오디오·비디오 등 다양한 형식의 문서를 분석하고 생성형 AI가 활용하기 좋은 구조로 변환하는 오픈소스 도구입니다. 레이아웃·표·코드·수식·OCR을 지원하며 Markdown, HTML, JSON 등으로 내보내고 LangChain, LlamaIndex, MCP와 연동할 수 있습니다.
두 개의 LLM이 같은 작업을 독립적으로 검토한 뒤 근거를 교환하게 하는 AdversarialDebate를 소개합니다. 초기에는 논쟁처럼 보이는 대화의 89%가 연극에 불과했지만, 독립 판정과 구조화된 반론을 적용한 v0.2.0에서는 2,333개 데이터 행 기준 88.7%의 이진 일치율을 기록했습니다.
ISTA-DASLab이 512-expert MoE 모델 Qwen3.8-Flash-Next를 GSQ와 RCO로 비균일 양자화해 2.40·2.50·3.00 bpw GGUF로 공개했습니다. IQ3_XXS는 BF16 대비 4.7배 작으면서 AIME25 점수가 같고, Q2_0은 IQ2_XS보다 프롬프트 처리량이 3.4배 높습니다.
Higgsfield는 대규모 언어 모델(LLM) 학습을 위해 GPU 노드 할당, 실험 큐 관리, 분산 샤딩, 학습 모니터링, GitHub Actions 연동을 제공하는 오픈소스 프레임워크입니다. PyTorch FSDP와 DeepSpeed ZeRO-3를 지원하며, 여러 노드에서 대규모 모델을 학습하고 체크포인트를 관리하는 흐름을 단순화합니다.
AI를 사용한 사실을 공개했다가 면접에서 탈락한 개발자가, 같은 면접에서 AI를 사용하는 면접관을 봤다고 말합니다. 글은 코딩 평가가 문법 암기보다 AI의 오류를 판별하고 결과를 통제하는 판단력을 측정해야 한다고 주장합니다.
Cua는 AI 에이전트가 Linux·macOS·Windows의 데스크톱 애플리케이션과 브라우저를 조작하도록 하는 오픈소스 도구 모음입니다. 격리된 클라우드 데스크톱, 로컬 macOS VM, 에이전트 평가·학습용 Cua-Bench를 함께 제공합니다.
이번 주에는 Python 기반 libp2p의 WebRTC-Direct 상호운용성 문제와 소켓 누수를 수정하고, Go 기반 agent-orchestrator의 파일 경로·GitHub SCM 폴링 문제를 다뤘습니다. ICE 자격 증명 경쟁 조건, 연결 종료 누수, 잘못된 PR 재조회, .git/info/exclude 누적 문제를 포함해 8개 커밋과 11개 PR을 진행했습니다.
OpenStock은 Next.js와 MongoDB, Finnhub, TradingView를 조합해 주가 검색·관심 종목·기업 정보·시장 뉴스·알림을 제공하는 오픈소스 주식 시장 앱입니다. 이메일 인증과 개인화 뉴스 요약, Docker 실행을 지원하지만 데이터 지연과 거래소별 제공 범위는 각 공급자 정책의 영향을 받습니다.
tapflow가 브라우저와 시뮬레이터 사이에서 텍스트를 복사·붙여넣기하는 과정을 비동기 프로토콜로 구현한 사례를 설명합니다. 고정 지연 대신 sentinel과 상태 확인을 사용하고, 브라우저의 사용자 제스처·보안 컨텍스트·타임아웃 제약까지 함께 다룹니다.
Toone은 자연어로 복잡하고 장시간 실행되는 AI 에이전트 워크플로를 만들고, 각 단계를 확인·수정·디버깅한 뒤 중단한 지점부터 재개할 수 있는 macOS 앱입니다. OpenAI 또는 Anthropic 계정을 연결해 결정적 실행과 관찰 가능성을 확보하는 것을 목표로 합니다.
코딩 에이전트의 지침을 하나의 거대한 파일에 항상 넣는 대신, 작업에 필요한 규칙을 무엇을·어디에·언제라는 기준으로 나눠 필요한 순간에만 불러오는 점진적 공개를 설명합니다. 28,721개 저장소 분석과 AGENTS.md, CLAUDE.md, skills, 경로 설정 사례를 바탕으로 컨텍스트 경쟁을 줄이는 방법과 새롭게 생기는 지침 관리 문제를 다룹니다.
ApplySeed는 스타트업 프로필을 바탕으로 지원 자격에 맞는 액셀러레이터와 펀딩 프로그램을 찾고, 각 지원서에 맞춰 답변을 작성해 주는 서비스입니다. 사용자는 덱이나 메모, ChatGPT 프롬프트로 정보를 입력한 뒤 결과를 검토하고 직접 제출할 수 있습니다.
CauterRule v0.3.0은 40개 코퍼스와 2개 모델을 대상으로 4,768개 trajectory-run을 완료한 필드 테스트 보고서입니다. per-trajectory timeout, 비재시도 타임아웃, 토큰 상한, 격리, 종료 시 취소라는 다섯 가지 방어 장치로 멈춘 요청 하나가 전체 평가를 막지 않게 했으며, 호출별 토큰 사용량도 비용으로 환산했습니다.
Pushary는 AI 코딩 에이전트가 권한 승인이나 추가 답변을 기다리며 멈추는 문제를 Mac 노치와 잠금 화면, 모바일 앱으로 해결합니다. Claude Code·Codex·Cursor 등 여러 도구의 승인과 질문을 한곳에서 처리하고, 도구별 자동 승인 정책과 감사 기록도 제공합니다.
Wasmer 기술 면접을 위해 엣지 배포, 대시보드, 내구성 워크플로 시스템까지 준비했지만, 간단한 캐시 파일의 수동 코드 리뷰에서 코드의 문제를 발견하고도 설명하지 못해 고전합니다. 글쓴이는 AI를 활용한 개발 역량과 기초 코드를 직접 읽고 설명하는 능력 사이의 간극, 그리고 AI 시대에 맞지 않는 채용 방식이 무엇인지 되묻습니다.
MosMos는 개인의 생각과 여러 사람이 참여한 대화를 음성으로 받아 실제 문서 작업에 활용할 수 있도록 만드는 음성 글쓰기 도구입니다. 자연어 받아쓰기, 사용자 지정 문체, 웹 검색, 개인 용어집, 화자 구분과 타임스탬프 기반 회의 정리 기능을 제공합니다.
NAT나 제한된 네트워크 뒤의 로컬 서비스를 공개 도메인과 HTTPS로 노출하는 터널링 도구·서비스를 비교한 큐레이션 목록입니다. Cloudflare Tunnel, frp, Pangolin, WireGuard 기반 오버레이 VPN 등 수십 가지 선택지를 클라이언트 요구사항, 프로토콜, 자동 인증서, 셀프호스팅 여부와 함께 정리합니다.
AI 도구로 빠르게 만든 애플리케이션을 곧바로 production-grade나 battle-tested라고 부르는 것은 신뢰성의 서로 다른 축을 혼동하는 일입니다. Resilient는 예상한 오류를 견디도록 설계됐다는 뜻이고, battle-tested는 실제 운영 장애와 예측하지 못한 조건을 겪고 수정한 이력까지 포함해야 합니다.