Playwright보다 2배 빠르고 토큰을 80% 더 효율적으로 사용하는 Stagehand v4

Hacker News

Stagehand는 Playwright의 브라우저 자동화 API를 바탕으로 AI 에이전트에 맞춘 SDK입니다. 브라우저 내부 확장 프로그램, 접근성 트리 기반 컨텍스트 축소, 배치 명령과 캐싱을 활용해 Playwright 대비 2배 빠른 실행과 80% 높은 토큰 효율을 목표로 하며 TypeScript·Python·Go를 지원합니다.

4GB 노트북 GPU가 Gemma 4에서 12코어 CPU보다 4.3배 빠릅니다

dev.to

동일한 노트북에서 Gemma 4 소형 양자화 모델을 CPU와 4GB GTX 1650 Ti로 번갈아 서빙한 결과, GPU 디코드 속도가 평균 4.27배 빨랐습니다. 모델의 대형 임베딩 테이블이 호스트 메모리에 남는 구조 덕분에 4GB GPU만으로도 충분히 적재할 수 있었습니다.

AI가 코딩하는 동안 무엇을 하시나요? 저는 AI끼리 논쟁하게 합니다

dev.to

두 개의 LLM이 같은 작업을 독립적으로 검토한 뒤 근거를 교환하게 하는 AdversarialDebate를 소개합니다. 초기에는 논쟁처럼 보이는 대화의 89%가 연극에 불과했지만, 독립 판정과 구조화된 반론을 적용한 v0.2.0에서는 2,333개 데이터 행 기준 88.7%의 이진 일치율을 기록했습니다.

higgsfield-ai/higgsfield — 수십억~수조 파라미터 모델 학습을 위한 내결함성·고확장성 GPU 오케스트레이션 및 머신러닝 프레임워크

GitHub

Higgsfield는 대규모 언어 모델(LLM) 학습을 위해 GPU 노드 할당, 실험 큐 관리, 분산 샤딩, 학습 모니터링, GitHub Actions 연동을 제공하는 오픈소스 프레임워크입니다. PyTorch FSDP와 DeepSpeed ZeRO-3를 지원하며, 여러 노드에서 대규모 모델을 학습하고 체크포인트를 관리하는 흐름을 단순화합니다.

수학이 증명 이상이라면, 나머지도 더 제대로 평가해야 합니다

Hacker News

Grant Sanderson은 AI가 증명을 생성하는 시대에 수학의 목표를 인간의 이해로 다시 정의하고, 문제의 동기와 맥락까지 설명하는 ‘motivated explanation’을 증명에 준하는 연구 성과로 인정하자고 제안합니다. 이를 위해 미해결 설명 문제, 설명 중심 저널, 채용·종신재직 평가의 변화가 필요하다고 주장합니다.

GPT-6 Astra, 제1차 세계대전 독일 무선 암호를 해독하다

Hacker News

GPT-6 Astra가 1918년 독일군이 사용한 ADFGVX 방식의 미해독 무선 메시지를 해독했다고 보고합니다. 모델은 당시 사용 기록이 남은 암호 키를 적용해 영국 순양함의 세바스토폴 도착과 연합군 함대의 후속 이동을 담은 문장을 복원했으며, 관련 항해 기록과의 일치도 확인했습니다.

Intel, 가중치를 하나도 바꾸지 않고 1.58비트 LLM을 1.485비트로 압축

Reddit

Intel 연구진이 모델의 가중치나 출력값을 바꾸지 않고 저장 형식만 개선하는 BITCOS를 제안했습니다. 0 가중치의 비율을 별도로 활용해 한 체크포인트를 1.485비트로 저장했으며, 하드웨어에 따라 디코딩 처리량이 CPU에서 최대 18%, GPU에서 최대 27% 향상됐습니다.

OpenAI는 자체 LLM으로 Jalapeño 칩을 어떻게 설계했나

Hacker News

OpenAI의 AI 가속기 칩 Jalapeño는 최대 13.4페타플롭스의 4비트 연산과 15.4TB/s 메모리 대역폭을 제공하며, Nvidia GB300보다 엔드투엔드 지연 시간을 최대 3.6배 줄이는 것을 목표로 합니다. 설계 과정에서는 LLM을 고수준 합성, 검증, 소프트웨어 최적화에 활용해 아키텍처 구상부터 첫 실리콘까지 20개월 이내에 진행했습니다.

점진적 공개(Progressive Disclosure): 무엇을, 어디에, 언제, 왜 적용할까요?

dev.to

코딩 에이전트의 지침을 하나의 거대한 파일에 항상 넣는 대신, 작업에 필요한 규칙을 무엇을·어디에·언제라는 기준으로 나눠 필요한 순간에만 불러오는 점진적 공개를 설명합니다. 28,721개 저장소 분석과 AGENTS.md, CLAUDE.md, skills, 경로 설정 사례를 바탕으로 컨텍스트 경쟁을 줄이는 방법과 새롭게 생기는 지침 관리 문제를 다룹니다.

ApplySeed — 액셀러레이터에서 시드 투자 유치하기

Product Hunt

ApplySeed는 스타트업 프로필을 바탕으로 지원 자격에 맞는 액셀러레이터와 펀딩 프로그램을 찾고, 각 지원서에 맞춰 답변을 작성해 주는 서비스입니다. 사용자는 덱이나 메모, ChatGPT 프롬프트로 정보를 입력한 뒤 결과를 검토하고 직접 제출할 수 있습니다.

Pushary — Mac 노치에서 모든 에이전트에 접근합니다

Product Hunt

Pushary는 AI 코딩 에이전트가 권한 승인이나 추가 답변을 기다리며 멈추는 문제를 Mac 노치와 잠금 화면, 모바일 앱으로 해결합니다. Claude Code·Codex·Cursor 등 여러 도구의 승인과 질문을 한곳에서 처리하고, 도구별 자동 승인 정책과 감사 기록도 제공합니다.

스스로 바보가 되는 법 101 — AI 의존이 기술 면접에서 드러낸 것

dev.to

Wasmer 기술 면접을 위해 엣지 배포, 대시보드, 내구성 워크플로 시스템까지 준비했지만, 간단한 캐시 파일의 수동 코드 리뷰에서 코드의 문제를 발견하고도 설명하지 못해 고전합니다. 글쓴이는 AI를 활용한 개발 역량과 기초 코드를 직접 읽고 설명하는 능력 사이의 간극, 그리고 AI 시대에 맞지 않는 채용 방식이 무엇인지 되묻습니다.

MosMos — 회의 전·중·후에 작동하는 음성 글쓰기

Product Hunt

MosMos는 개인의 생각과 여러 사람이 참여한 대화를 음성으로 받아 실제 문서 작업에 활용할 수 있도록 만드는 음성 글쓰기 도구입니다. 자연어 받아쓰기, 사용자 지정 문체, 웹 검색, 개인 용어집, 화자 구분과 타임스탬프 기반 회의 정리 기능을 제공합니다.