Sonnet 5.5
Sonnet 5.5 발표 — 속도 30% 향상, 작업당 비용 최대 30% 절감
Anthropic이 Claude Sonnet 5.5를 공개했습니다. Sonnet 5보다 출력 속도가 30% 이상 빠르고, 같은 가격표를 적용하면서 작업당 비용은 최대 30% 낮췄다고 밝혔습니다. 코딩 벤치마크 점수와 안전장치, 실제 비용 대비 Opus 5.5와의 차이를 두고 Hacker News에서 논쟁이 이어졌습니다.
- 주제
에디터 노트
Sonnet 5.5가 Opus 5.5를 앞질렀다는 건 절반만 사실입니다. Terminal-Bench에서 Sonnet 70.6%, Opus 66.4%였지만, Opus는 안전장치 탓에 평가 시도의 10%가 대체 답변됐습니다. Sonnet은 1.5%뿐이었습니다. 추월 서사는 능력의 역전이 아니라 안전장치가 만든 인위적 격차일 수 있습니다. 벤치마크는 실력이 아니라 '제약'을 재고 있었던 셈입니다. 그래도 속도는 30% 빨라졌고 가격은 그대로입니다. CEO가 "slow down"을 외친 지 며칠 만에 나온 두 번째 모델이기도 합니다.
AI 요약
Anthropic이 Claude 5.5 제품군의 두 번째 모델인 Claude Sonnet 5.5를 공개했습니다. 복잡하고 판단력이 필요한 작업에는 Opus 5.5를, 범위가 명확한 일상 업무와 버그 수정, 문서·슬라이드·스프레드시트 작성에는 Sonnet 5.5를 권합니다. Anthropic은 Sonnet 5보다 출력 속도가 30% 이상 빨라졌고, 같은 작업에 필요한 토큰이 줄어 작업당 비용도 최대 30% 낮아졌다고 설명합니다.
성능과 코딩
에이전트 코딩 평가인 Terminal-Bench 4.0에서 Sonnet 5.5는 70.6%를 기록했습니다. Sonnet 5의 10.3%보다 크게 올랐고, Opus 5.5의 66.4%보다도 높습니다. CursorBench 4.0에서는 Sonnet 5.5가 55.5%, Opus 5.5가 57.8%를 기록했습니다. FrontierCode에서는 Sonnet 5.5가 Xhigh 설정에서 52.1%로 Opus 5.5의 54.4%에 가까웠습니다. 다만 Anthropic은 벤치마크가 모델 능력의 일부만 보여준다고 덧붙였습니다. 지속적인 판단이 필요한 복잡하고 열린 작업에서는 Opus 5.5가 여전히 더 강하다는 설명입니다.
Anthropic은 코딩 작업에서 Sonnet 5.5가 코드베이스를 빠르게 파악하고, 도구 호출을 묶어 실행해 단계를 줄였다는 초기 평가도 소개했습니다. FrontierCode의 High 설정에서는 Sonnet 5보다 10점 높은 점수를 기록하면서 작업당 비용은 약 15분의 1이었다고 밝혔습니다. 다만 Max 설정에서는 코드 리뷰용 하위 에이전트를 더 자주 실행하면서 시간 초과나 범위를 벗어난 수정이 발생해 점수가 낮아진 사례도 설명했습니다.
지식 업무와 비용
44개 직업군, 9개 산업 분야의 실제 업무를 평가하는 GDPval-AA에서 Sonnet 5.5는 1844점을 받았습니다. Opus 5.5의 1846점에 근접했고 Sonnet 5의 1449점보다 높습니다. 컴퓨터 사용 평가 OSWorld 2.1에서는 Sonnet 5.5가 80.1%, Opus 5.5가 81.8%를 기록했습니다. 차트 인식과 장시간 이어지는 지식 업무에서도 Sonnet 5보다 높은 성적을 냈다고 Anthropic은 밝혔습니다. 초기 평가자들은 자연스러운 대화와 디자인 감각도 언급했습니다. 회사 내부에서는 기업 실적 자료와 통화 기록, 슬라이드 템플릿을 제공해 10장짜리 운영 검토 자료를 만들게 했고, 전문가 두 명이 첫 초안을 바로 보낼 수 있는 수준으로 평가했다고 합니다.
토큰 가격은 입력 100만 개당 2달러, 출력 100만 개당 10달러, 캐시 읽기 100만 개당 0.20달러로 Sonnet 5와 같습니다. 다만 같은 작업에 필요한 토큰이 줄어 실제 작업 비용은 최대 30% 낮아졌다는 것이 Anthropic의 설명입니다. 노력 수준을 낮추면 응답이 빨라지고 토큰 사용량이 줄며, 높이면 더 오래 추론하고 결과를 점검합니다. Claude 앱과 Claude Code의 기본값은 Medium이고 Claude Platform의 기본값은 High입니다.
안전장치와 이용 방법
Anthropic의 약 1,850개 시나리오 자동 행동 감사에서 Sonnet 5.5는 정렬, 오용 저항, 정직성 항목 대부분에서 Sonnet 5와 같거나 더 나은 결과를 냈습니다. 샌드박스 탈출을 시도하는 빈도는 Opus 5.5에 근접했고, 컨테이너 한계를 탐색하려는 경향은 Anthropic 모델 중 가장 낮았다고 밝혔습니다. 다만 회사는 평가만으로 모든 실패를 찾아낼 수는 없다고 덧붙였습니다.
사이버 보안 능력이 Opus 5와 비슷한 수준으로 향상돼, Sonnet 계열에서는 처음으로 상위 모델과 유사한 사이버 안전장치를 적용했습니다. 일반적인 소프트웨어 개발과 버그 수정은 계속 지원하지만, 위험도가 높은 사이버 보안 요청은 Sonnet 5로 전환됩니다. 생물학 관련 안전장치는 Sonnet 5와 같으며, Anthropic은 고위험 요청에 초점을 맞춰 일상적인 연구·교육·임상 업무 대부분에는 영향을 주지 않는다고 설명합니다. 모델의 추론 과정을 추출하는 증류 공격을 막는 분류기도 도입했습니다.
Sonnet 5.5는 Claude Platform과 Amazon Web Services, Google Cloud, Microsoft Azure에서 제공됩니다. API 모델명은 claude-sonnet-5-5이며, 제로 데이터 보존(zero data retention) 설정도 지원합니다. 기존에 thinking을 끈 상태로 Sonnet을 사용했다면 마이그레이션 전에 between_tools 설정으로 바꿔야 한다고 안내합니다.
Hacker News 반응
- @ramish94 — 에이전트 코딩 벤치마크에서는 Opus 5.5와 거의 1대1로 맞섭니다. Terminal-Bench는 Sonnet 5.5가 70.6, Opus 5.5가 66.4%입니다. FrontierCode는 Sonnet 5.5 Xhigh가 52.1%, Opus 5.5가 54.4%입니다. CursorBench는 각각 55.5%와 57.8%입니다. 제가 써본 모델 중 Opus 5.5가 최고였는데 Sonnet 5.5는 일부 벤치마크에서 그 수준에 도달하거나 앞섭니다. 5.5 제품군은 성능뿐 아니라 비용에서도 무언가 돌파구를 찾은 것 같습니다.
- @bigyabai — 이제야 나왔네요. Sonnet 5는 에이전트 코딩에서 API 가격 대비 성능이 형편없었습니다. GLM-5.3 Flash 같은 오픈 모델이 20분의 1 가격으로 압도했죠. OpenAI와 Anthropic의 우위는 이제 거의 사라졌습니다.
- @bbor — “Sonnet 5.5가 세계 최고 수준과 맞먹고 때로는 앞선다”는 말에서 “두 회사의 우위가 거의 사라졌다”는 결론을 내리시는 건가요?
- @johnmlussier — 한 달에 200달러를 내고 Cyber Verification Program에도 참여하는데, 승인된 버그 바운티 작업에 Opus 5.5나 Sonnet 5.5를 쓸 수 없습니다. 바로
Cyber로 표시됩니다. 말도 안 됩니다. 안전장치가 엉망입니다.- @solenoid0937 — Cyber Verification Program 안내를 실제로 읽어보세요. 문서 맨 위에 Opus 5.5에는 아직 적용되지 않고, 곧 Opus 5.5와 Mythos 계열로 확대한다고 적혀 있습니다. 방금 출시된 Sonnet 5.5에도 적용될 거라고 기대해서는 안 됩니다.
- @wkcheng — 비용·성능 그래프를 보면 거의 모든 설정에서 Opus보다 나빠 보입니다. Sonnet 5.5를 Xhigh로 쓸 바에는 더 높은 점수를 더 낮은 비용으로 내는 Opus 5.5 High를 쓰면 되지 않나요? 좋은 사용 사례가 있나요?
- @ricardobeat — Low와 Medium에서는 비용이 3분의 1 낮고, High에서는 Opus Low보다 한 단계 위입니다. Xhigh에서만 더 나빠 보입니다.
- @abejora — Terminal-Bench에서 Sonnet 5.5가 Opus 5.5보다 높은 점수를 받은 이유를 확인해봤습니다. Opus는 안전장치 때문에 평가 시도 중 10%가 대체 모델로 답변됐고, Sonnet은 1.5%만 대체됐습니다. 이 차이가 점수 격차를 설명할 수 있으니 결과를 지나치게 해석하지 않는 편이 좋겠습니다.
- @eli — 왜 그걸 고려하지 말아야 하죠? 실제로 모델을 쓸 때의 경험이 중요합니다. 안전장치가 과하게 작동해도 그게 실제 성능입니다.
- @onlyrealcuzzo — 작업당 비용 최대 30% 절감과 출력 속도 30% 이상 향상만으로는 부족합니다. Sonnet 5는 출시 당시에도 비용 효율이 낮은 모델이었습니다. 구현 작업에는 10분의 1에서 100분의 1 가격인 더 빠르고 충분히 좋은 모델이 많습니다. Anthropic 모델은 디자인과 리뷰에는 주로 쓰지만 구현에는 거의 쓰지 않습니다.
- @simonw — Sonnet 5.5도 Opus 5.5와 같은 문제가 있습니다. Max 추론 설정에서 128,000개의 추론 토큰을 소모하고 15분 동안 실행한 뒤 SVG를 완성하기 전에 한도에 도달했습니다. Low와 Medium은 추론 토큰을 쓰지 않았고, Xhigh는 2,535개를 썼습니다.
- @simonw — 출력 토큰 한도입니다. Claude 모델의 출력 한도는 꽤 오래전부터 128,000개였습니다.
원문: Anthropic / 번역·요약: Trawling