최신 글

ThinkingCap Qwen3.8-27B 공개 — 추론 토큰 평균 37% 절감

Reddit

BottleCap AI가 Qwen3.8-27B를 바탕으로 추론 토큰을 줄인 ThinkingCap 모델을 공개했습니다. 자체 평가에서 평균 추론 토큰은 37.2% 감소했고 정확도는 86.6%에서 85.8%로 낮아졌습니다. vLLM·SGLang 배포와 MTP 자기 추측 디코딩도 지원합니다.

Mercury 2.5, 초당 770토큰 생성

Hacker News

Inception의 Mercury 2.5는 출력 속도 780.8토큰/초를 기록했지만, Artificial Analysis Intelligence Index 점수는 12로 비슷한 가격대 추론 모델의 중앙값과 같습니다. Hacker News에서는 빠른 응답이 유용한 작업이 있다는 의견과, 품질이 낮으면 속도와 가격의 이점도 제한적이라는 지적이 맞섰습니다.