4GB 노트북 GPU가 Gemma 4에서 12코어 CPU보다 4.3배 빠릅니다

dev.to

동일한 노트북에서 Gemma 4 소형 양자화 모델을 CPU와 4GB GTX 1650 Ti로 번갈아 서빙한 결과, GPU 디코드 속도가 평균 4.27배 빨랐습니다. 모델의 대형 임베딩 테이블이 호스트 메모리에 남는 구조 덕분에 4GB GPU만으로도 충분히 적재할 수 있었습니다.

higgsfield-ai/higgsfield — 수십억~수조 파라미터 모델 학습을 위한 내결함성·고확장성 GPU 오케스트레이션 및 머신러닝 프레임워크

GitHub

Higgsfield는 대규모 언어 모델(LLM) 학습을 위해 GPU 노드 할당, 실험 큐 관리, 분산 샤딩, 학습 모니터링, GitHub Actions 연동을 제공하는 오픈소스 프레임워크입니다. PyTorch FSDP와 DeepSpeed ZeRO-3를 지원하며, 여러 노드에서 대규모 모델을 학습하고 체크포인트를 관리하는 흐름을 단순화합니다.

개발 로그 #21 — WebRTC-Direct 강화와 SCM 누수 해결

dev.to

이번 주에는 Python 기반 libp2p의 WebRTC-Direct 상호운용성 문제와 소켓 누수를 수정하고, Go 기반 agent-orchestrator의 파일 경로·GitHub SCM 폴링 문제를 다뤘습니다. ICE 자격 증명 경쟁 조건, 연결 종료 누수, 잘못된 PR 재조회, .git/info/exclude 누적 문제를 포함해 8개 커밋과 11개 PR을 진행했습니다.

Intel, 가중치를 하나도 바꾸지 않고 1.58비트 LLM을 1.485비트로 압축

Reddit

Intel 연구진이 모델의 가중치나 출력값을 바꾸지 않고 저장 형식만 개선하는 BITCOS를 제안했습니다. 0 가중치의 비율을 별도로 활용해 한 체크포인트를 1.485비트로 저장했으며, 하드웨어에 따라 디코딩 처리량이 CPU에서 최대 18%, GPU에서 최대 27% 향상됐습니다.

OpenAI는 자체 LLM으로 Jalapeño 칩을 어떻게 설계했나

Hacker News

OpenAI의 AI 가속기 칩 Jalapeño는 최대 13.4페타플롭스의 4비트 연산과 15.4TB/s 메모리 대역폭을 제공하며, Nvidia GB300보다 엔드투엔드 지연 시간을 최대 3.6배 줄이는 것을 목표로 합니다. 설계 과정에서는 LLM을 고수준 합성, 검증, 소프트웨어 최적화에 활용해 아키텍처 구상부터 첫 실리콘까지 20개월 이내에 진행했습니다.

디바이스를 기다려야 했던 클립보드 브리지

dev.to

tapflow가 브라우저와 시뮬레이터 사이에서 텍스트를 복사·붙여넣기하는 과정을 비동기 프로토콜로 구현한 사례를 설명합니다. 고정 지연 대신 sentinel과 상태 확인을 사용하고, 브라우저의 사용자 제스처·보안 컨텍스트·타임아웃 제약까지 함께 다룹니다.

Warez: 불법 복제의 인프라와 미학

Hacker News

이 책은 BitTorrent와 The Pirate Bay로 대표되는 공개적 불법 복제의 이면에서 활동해 온 Warez Scene의 역사와 운영 인프라를 다룹니다. BBS에서 FTP 서버로 이어진 변화, 고유한 규칙과 예술적 형식, 무료 배포를 둘러싼 공동체적 해석과 경쟁적 서열 문화의 긴장을 분석합니다.

점진적 공개(Progressive Disclosure): 무엇을, 어디에, 언제, 왜 적용할까요?

dev.to

코딩 에이전트의 지침을 하나의 거대한 파일에 항상 넣는 대신, 작업에 필요한 규칙을 무엇을·어디에·언제라는 기준으로 나눠 필요한 순간에만 불러오는 점진적 공개를 설명합니다. 28,721개 저장소 분석과 AGENTS.md, CLAUDE.md, skills, 경로 설정 사례를 바탕으로 컨텍스트 경쟁을 줄이는 방법과 새롭게 생기는 지침 관리 문제를 다룹니다.

Resilient와 Battle-Tested는 같은 말이 아닙니다

dev.to

AI 도구로 빠르게 만든 애플리케이션을 곧바로 production-grade나 battle-tested라고 부르는 것은 신뢰성의 서로 다른 축을 혼동하는 일입니다. Resilient는 예상한 오류를 견디도록 설계됐다는 뜻이고, battle-tested는 실제 운영 장애와 예측하지 못한 조건을 겪고 수정한 이력까지 포함해야 합니다.

SpaceX는 어떻게 Raptor 엔진을 간결하게 만들었나

Hacker News

SpaceX의 Raptor 엔진은 full-flow staged combustion이라는 기본 구조를 유지하면서 센서·배관·밸브·플랜지·열 차폐 구조를 재설계해 Raptor 1의 복잡한 외형에서 Raptor 3의 매끈한 형태로 진화했습니다. 그 결과 Raptor 3는 Raptor 1보다 약 35% 높은 추력을 내지만, 내부 복잡성과 시동 문제는 여전히 남아 있습니다.

AI는 실제로 API를 어떻게 호출하는가? — 처음부터 이해하는 Tool Calling

dev.to

Foundation model은 스스로 코드를 실행하지 않고, 호출할 도구와 입력을 구조화된 요청으로 출력합니다. 애플리케이션이 실제 함수를 실행해 결과를 돌려주면 모델이 답변을 완성하며, 글에서는 Amazon Bedrock의 Converse API로 날씨·날짜 도구, 프롬프트 주입, MCP까지 단계적으로 설명합니다.

스틸맨: AI 에이전트가 복잡성을 감수할 만해지는 순간

dev.to

대부분의 AI 에이전트는 LLM 호출을 끼운 결정적 파이프라인에 가깝다고 지적한 뒤, 진짜 자율성이 필요한 좁은 조건을 정리합니다. 런타임에 새 경로가 발견되고, 분기 공간을 미리 열거할 수 없으며, 자율 영역을 최소화하고, 모든 결정을 저렴하게 검증·기록할 수 있어야 합니다.

MacSentinel — Mac을 느리게 만드는 원인을 찾아 안전하게 정리하는 네이티브 도구

Product Hunt

MacSentinel은 Mac 모니터링, 진단, 저장 공간 분석, 정리를 하나의 네이티브 워크플로로 묶은 유틸리티입니다. 단순히 시스템 지표를 보여주는 데 그치지 않고 로컬에서 속도 저하의 원인을 설명하며, 50개 카테고리에 걸친 500개 이상의 앱 규칙을 담은 Smart Care로 안전한 정리를 돕습니다. Pro 버전은 구독이 아닌 일회성 구매로 제공됩니다.

Wild vs Mold 벤치마킹 — 두 링커의 성능 측정 결과가 엇갈린 이유를 파헤치다

Lobsters

Mold가 링커 벤치마크에 Wild를 처음 포함하면서 Wild가 상당히 느린 것으로 나타났고, 이는 Wild 측이 8월 초에 공개한 결과와 정면으로 배치됩니다. Wild의 저자 David Lattimore가 두 벤치마크의 설정 차이를 하나씩 통제해가며 재현 실험을 한 결과, 출력 파일 삭제 여부·파일시스템·fork 동작 같은 측정 조건과 Mold 자체의 최근 성능 개선이 차이의 대부분을 설명했습니다.

AI 코딩 어시스턴트가 세션을 넘어 같은 실수를 반복하지 않게 하려면 — 여섯 메모리 시스템의 '결과 피드백 입력' 비교

dev.to

AI 코딩 어시스턴트가 이전 세션에서 수정된 실수를 새 세션에서 반복하는 문제를 다룹니다. 저자는 Cognee, Mem0, Letta, Supermemory, Zep, Mnemoverse 여섯 메모리 시스템의 공식 문서를 읽고 '리콜 결과에 부정적 판정을 전달하는 공개 입력'이 있는지를 비교했습니다. 결론은 입력의 존재 여부가 아니라, 그 입력이 무엇에 붙어 있고 다음 읽기에서 실제로 무엇이 바뀌는지가 갈림길이라는 것입니다.