최신 글

AI 에이전트가 사실을 읽고도 기록하지 않은 이유

Indie Hackers

회의록을 전략 보고서로 바꾸는 멀티 에이전트 파이프라인에서, 전체 점수는 양호했지만 경쟁사 관련 사실이 반복해서 누락됐습니다. 작성자는 중간 단계의 분류 기준에서 누락 원인을 찾고 수정했으며, 항목별 평가와 작은 표본의 한계도 함께 짚습니다.

LLM 4,768회 실행에서 단 한 번의 스윕도 잃지 않기 — 타임아웃·멈춤·비용을 견디는 필드 테스트 러너 만들기

dev.to

CauterRule v0.3.0은 40개 코퍼스와 2개 모델을 대상으로 4,768개 trajectory-run을 완료한 필드 테스트 보고서입니다. per-trajectory timeout, 비재시도 타임아웃, 토큰 상한, 격리, 종료 시 취소라는 다섯 가지 방어 장치로 멈춘 요청 하나가 전체 평가를 막지 않게 했으며, 호출별 토큰 사용량도 비용으로 환산했습니다.