Claude Haiku 5.5
Claude Haiku 5.5 공개 — 더 빠르고 저렴한 소형 모델
Anthropic이 고속·대량 처리 작업을 겨냥한 소형 모델 Claude Haiku 5.5를 공개했습니다. Haiku 4.5보다 작업 비용을 평균 약 75% 낮췄고, 10만 토큰 이하 요청은 입력 100만 토큰당 0.10달러, 출력은 0.50달러입니다. 벤치마크와 활용 사례를 두고 비용 기준, 실제 성능, 가격 구간에 관한 논의가 이어졌습니다.
- 주제
에디터 노트
"90% 저렴해졌다"는 헤드라인과 달리, 새 토크나이저가 토큰을 30% 가까이 더 쓰니 체감 할인은 숫자만큼 크지 않습니다. 10만 토큰 컷오프를 둔 가격 구간도 HN에서 논쟁이 됐습니다. 에이전트 워크로드에는 금방 초과한다는 지적과, 요약·compaction 같은 일회성 작업에는 충분하다는 반박이 맞섭니다. 더 큰 그림이 있습니다. Epoch AI 통계에 따르면 같은 성능을 내는 데 드는 비용이 2023년 이후 분기마다 47%씩 떨어졌습니다. "그럼 왜 AI 요금은 여전히 비싸냐"는 반문에 누군가 Jevons paradox를 꺼낸 대목이 인상적입니다. 싸질수록 더 쓰게 되는 겁니다.
AI 요약
Anthropic이 반복적이고 비용에 민감한 작업을 겨냥한 Claude Haiku 5.5를 출시했습니다. 요약, 문맥 압축, 데이터베이스 질의, 분류 작업을 비롯해 실시간 고객 지원과 브라우저 사용처럼 응답 속도가 중요한 작업을 대상으로 합니다. 코딩에서는 Opus 5.5나 Sonnet 5.5의 하위 에이전트(subagent)로 활용하는 방안도 제시했습니다. Anthropic은 표준 속도 기준으로 지금까지 공개한 모델 가운데 가장 빠르다고 밝혔습니다.
성능과 추론 설정
공개된 벤치마크에서 Haiku 5.5는 지식 업무 지표 GDPval-AA v2.1에서 1620점을 기록했습니다. Haiku 4.5의 735점보다 높고, GPT-6 Luna의 1437점보다도 높지만 Sonnet 5.5의 1840점에는 못 미칩니다. 컴퓨터 사용(OSWorld 2.1)은 72.4%로 Haiku 4.5의 15.7%, Luna의 48.9%를 웃돌았습니다. 에이전트 코딩(Terminal-Bench 4.0)은 39.2%로, 이전 Haiku의 0%와 Luna의 16.4%보다 높았으며 Sonnet의 70.6%보다는 낮았습니다. Anthropic은 복잡한 에이전트 코딩에는 Sonnet이나 Opus가 여전히 더 적합하고, Haiku는 범위가 좁고 이전 모델로는 비용 부담이 컸던 작업에 맞는다고 설명합니다.
Haiku 계열 가운데 처음으로 조정 가능한 effort 설정을 제공합니다. 사용자는 비용을 아끼거나 추론 성능을 높이는 방향으로 설정을 선택할 수 있습니다. Anthropic은 여러 effort 단계에서의 벤치마크 결과도 공개했으며, 상세 평가 절차와 결과는 Haiku 5.5 System Card에 안내했습니다.
가격과 제품 변경
10만 토큰 이하 프롬프트의 입력 가격은 100만 토큰당 0.10달러, 출력은 0.50달러입니다. 10만 토큰을 넘으면 각각 0.50달러와 2.50달러로 올라갑니다. Haiku 4.5와 비교하면 10만 토큰 이하 요청은 가격이 90% 낮고, 그보다 긴 요청은 50% 낮습니다. Anthropic은 이전 Haiku 요청의 약 90%가 10만 토큰 이하였다고 밝혔습니다. 다만 새 토크나이저는 같은 작업에 Haiku 4.5보다 토큰을 조금 더 쓰므로, 실제 작업 비용은 토큰 단가만으로 결정되지 않습니다.
Sonnet 5.5의 캐시 읽기 가격도 100만 토큰당 0.20달러에서 0.10달러로 절반 낮췄습니다. Anthropic은 캐시 읽기가 토큰 사용량에서 큰 비중을 차지하는 만큼, 에이전트 작업 대부분에서 Sonnet 5.5 실행 비용이 약 20% 줄어든다고 설명합니다. Claude Max와 Team 구독자에게는 Claude Platform에서 쓸 월간 API 크레딧도 제공합니다. Max 5x는 월 100달러, Max 20x는 200달러이며 Team은 사용자들이 함께 쓰는 크레딧으로 최대 500달러를 받습니다. Python 및 TypeScript SDK에는 컴퓨터 사용과 브라우저 사용 기능을 베타로 추가합니다.
보안과 이용 가능성
Anthropic의 평가에서 Haiku 5.5는 Haiku 4.5보다 정렬(alignment) 지표 대부분이 개선됐고, 오용에 협조하는 경향도 줄었습니다. 사이버 보안 보호 조치는 Haiku 4.5보다 제한적이지만 일부 최신 모델보다는 덜 엄격합니다. 방어 목적 작업을 더 넓게 허용하되 침투 테스트 등 공격자가 활용할 가능성이 높은 기법은 차단한다고 밝혔습니다. 생물학 관련 보호 조치는 Sonnet 및 Opus 계열과 같으며, 위해를 일으킬 가능성이 있다고 판단한 요청을 제한합니다. 모델은 Claude Platform과 Amazon Web Services, Google Cloud, Microsoft Azure에서 이용할 수 있습니다.
Hacker News 반응
- @TheAmazingRace — AI 언어 모델에도 무어의 법칙에 해당하는 흐름이 있는지 궁금합니다. 이 기술은 얼마나 자주, 어떤 일정으로 개선될 것으로 보나요?
- @himata4113 — 이틀마다 정보 밀도가 두 배가 되나요? 진지하게 말하면, 소형 모델이 작동하는 방식을 생각해 보면 추론으로 쓸모없는 정보를 유도해낼 수 있어서 그 정보를 잊고 모델을 작게 만들 수 있게 된 것 같습니다. 대신 작업을 풀 때 추론 토큰이 더 필요합니다.
- @istjohn — Epoch AI에 따르면, 2023년 이후 일정 수준의 AI 성능을 달성하는 비용이 분기마다 약 47%, 연간 13배씩 낮아졌습니다.
- @FooBarWidget — 그렇다면 AI 구독은 왜 여전히 그렇게 비싸고, 보조금이 끝나는 와중에 AI 지출은 계속 치솟나요?
- @jstummbillig — 점점 더 유용해지고 있고, 대체하는 대상인 사람의 노동 시간이 훨씬 비싸기 때문입니다.
- @srdjanr — 더 저렴한 모델 대신 더 똑똑한 모델을 쓰는 것도 있고, 토큰 사용량도 크게 늘고 있습니다. 전형적인 제본스 역설입니다.
- @minimaxir — 가격 책정이 조금 이상합니다. 10만 토큰은 에이전트를 쓸 때 금방 넘길 만큼 낮은 기준이고, 이 가격 구간은 Haiku에만 적용됩니다. 일반 생성이나 Jev 같은 분류 작업에는 좋은 가격이지만, 에이전트 작업에는 빨리 기준을 넘을 수 있습니다. 그래도 Haiku 4.5보다는 훨씬 저렴합니다.
- @tripleee — 1.5배 또는 2배 가격을 적용해도 Luna가 여전히 절반 가격이네요. Anthropic의 가격 전략이 이상합니다. 아주 똑똑한 모델이 필요하지 않으면 Luna를 쓰겠습니다.
- @usef- — 토큰 비용만 보는 건가요, 작업을 완료하는 데 드는 비용은 보지 않는 건가요? 기사 벤치마크에서는 작업 하나를 끝내는 비용이 Luna보다 낮게 나왔습니다. 그 결과가 얼마나 일반적인지는 지켜봐야겠지만요.
- @sfkgtbor — Sonnet의 캐시 읽기 가격 인하가 반갑습니다.
- @minimaxir — GPT-6.1 Sol의 비용 및 캐시 가격에 맞추려면 사실상 필요했던 조치입니다. 이전 캐시 가격으로는 Sonnet 5.5보다 Opus 5.5를 쓸 이유가 전혀 없었습니다.
- @patrickwdaly — 다들 Haiku를 어떻게 쓰나요? 저는 거의 선택하지 않습니다.
- @steve_adams_86 — 문서를 저렴하게 파싱할 때 좋습니다. 제가 만든 몇 가지 스킬과 플러그인에서는 Claude에게 낮은 추론이 필요한 단순 작업을 Haiku에 맡기도록 지시합니다.
- @dannyw — Haiku 5.5는 Luna보다 확실히 낫습니다. Anthropic에는 요약, 문맥 압축, RAG 보조 작업에 쓸 만한 저렴한 모델이 부족했습니다. 이런 단발성 작업은 10만 토큰 아래에 들어가는 경우가 많습니다.
- @WinstonSmith84 — 실제 사용에서 확실히 더 똑똑한지는 아직 지켜봐야 합니다. 10만 토큰 아래에서는 Luna와 가격이 같지만, 제 에이전트 작업은 10만 토큰 아래에 들어가지 않아 발표된 차트보다 다섯 배 비싸집니다.
- @d1l — 직장에서 속도가 중요한 단순 작업 몇 가지에 Haiku 4.5를 쓰고 있습니다. 5.5를 시험했는데 결과가 형편없고 프롬프트 내용이 새어 나오기도 했습니다. 더 느리기도 합니다. 저렴하긴 하지만 균형을 잘못 잡은 것 같습니다.
- @saretup — 이유가 궁금합니다. Haiku 4.5는 오랫동안 성능과 비용의 균형점에서 멀리 떨어져 있었습니다. 새 모델에 맞춰 작업 프롬프트를 수정해야 할 수도 있습니다.
- @jjcm — 이미지에서 HTML을 만드는 작업으로 시험했습니다. 복잡한 UI를 구현하기엔 충분하지 않았습니다. Haiku 5.5는 작업을 살펴본 뒤 바로 Opus 5.5에 위임했습니다. 자신이 잘하지 못하는 일을 아는 셈입니다. 그래도 빠르며, 작은 하위 에이전트 작업이나 범위가 명확한 일에 적합해 보입니다.
- @twostorytower — 디자인이 보기 좋은지가 중요한 게 아닙니다. 주어진 디자인을 코드로 재현하는지가 중요합니다. Opus 5.5는 거의 픽셀 단위로 맞췄지만 Haiku는 전혀 다른 결과물을 만들었습니다.
- @simonw — 여러 추론 단계로 자전거를 탄 펠리컨 SVG를 만들어 봤습니다. 낮은 단계에서는 자전거 프레임을 망쳤지만, 중간·높음·매우 높음·최대 단계에서는 제대로 만들었습니다. 최대 단계는 5분 9초가 걸리고 3.3826센트였습니다. 가장 저렴한 낮은 단계는 7초, 0.0936센트였습니다.
- @luketaylor — 도움말 문서 표현이 혼란을 드려 죄송합니다. Claude Agent SDK를 구독과 함께 쓰는 기능은 이번 변경으로 제거되지 않았다고 문서를 수정했습니다.
원문: Anthropic / 번역·요약: Trawling