Hacker News

Claude Opus 5.5

Claude Opus 5.5 공개, Opus 5보다 저렴하고 빠른 새 모델

Anthropic이 Claude Opus 5.5를 공개했습니다. Opus 5보다 일반 작업 비용은 40% 낮고 출력 속도는 30% 이상 빠르며, 코딩·지식 작업·컴퓨터 사용 평가에서 높은 점수를 기록했다고 설명합니다.

AI 요약

Anthropic이 Claude 5.5 제품군의 첫 모델인 Claude Opus 5.5를 출시했습니다. 대부분의 작업에서 Claude Fable 5.1 수준의 성능을 내면서 Claude Opus 5보다 일반적인 작업 비용을 40% 낮췄다고 설명합니다. Anthropic이 ‘frontier를 조절하겠다’고 밝힌 뒤 처음 내놓은 모델이며, 출시 전 Frontier Design과 METR 같은 외부 평가 기관의 테스트도 거쳤습니다.

성능과 비용

Anthropic의 자동 행동 감사(automated behavioral audit)에서는 지금까지 테스트한 모델 중 가장 높은 점수를 기록했다고 합니다. 실제 작업 사례로는 68만 줄 규모의 코드 마이그레이션을 하루 안에 끝낸 사례가 소개됐습니다. 웹 애플리케이션의 모든 페이지에서 로딩 시간을 줄이는 작업은 40번 중 39번 성공했습니다. Opus 5는 개선 폭이 작았고 애플리케이션 동작까지 바꾸는 경우가 있었다고 합니다. 단일 프롬프트로 게임을 만드는 테스트에서는 그래픽과 마감 품질이 다른 Claude 모델보다 높게 평가됐습니다.

벤치마크에서는 에이전트 코딩 평가인 Terminal-Bench 4.0에서 Opus 5.5가 66.4%를 기록했습니다. Fable 5.1은 55.8%, Opus 5는 52.3%, GPT-6 Astra는 57.9%였습니다. FrontierCode v1.1에서는 54.4%로 GPT-6 Astra의 53.3%를 앞섰고, CursorBench 4.0에서는 57.8%로 GPT-5.6 Sol의 41.7%보다 높았습니다. 실제 직무를 평가하는 GDPval-AA v2.1에서는 1846 Elo를 기록했습니다. AutomationBench에서는 40.0%로 GPT-6 Astra의 41.4%에 근접했고, 도구를 사용한 Humanity’s Last Exam에서는 67.7%를 기록했습니다. 컴퓨터 사용 평가인 OSWorld 2.0에서는 부분 점수 81.8%를 얻었습니다.

다만 Anthropic도 현재 수준에서는 벤치마크 점수 차이가 실제 사용성 차이를 안정적으로 보여주지 않는다고 밝혔습니다. 대부분의 결과는 adaptive thinking을 최대 수준으로 설정해 측정했습니다. 일부 안전장치가 개입한 작업은 Opus 4.8이나 Opus 5가 대신 처리했습니다. 각 벤치마크의 표준 오차와 평가 설정도 서로 다르며, GPT 계열 수치는 OpenAI가 보고한 결과를 사용했습니다.

가격은 입력 토큰 100만 개당 4달러, 출력 토큰 100만 개당 20달러입니다. Opus 5의 5달러와 25달러보다 각각 20% 낮습니다. Cache read는 0.20달러로 Opus 5의 0.50달러보다 60% 낮고, cache write는 5달러로 기존 6.25달러보다 저렴합니다. Anthropic은 토큰 단가뿐 아니라 작업에 필요한 토큰 수 자체도 줄어 일반 작업의 총비용이 40% 감소한다고 설명합니다. 출력 생성 속도는 Opus 5보다 30% 이상 빠릅니다. Claude Code와 Claude Platform에서는 최대 2.5배 빠른 Fast mode도 제공하며, 입력 100만 토큰당 8달러와 출력 100만 토큰당 40달러를 받습니다.

코딩 작업에서는 긴 마이그레이션과 코드베이스 감사에 강점을 보였다고 합니다. 20만 줄 코드베이스의 감사와 수정은 3시간 안에 끝났고, Opus 5는 20시간 이상 걸리면서 2.5배 많은 토큰을 사용했습니다. HAProxy를 C에서 Rust로 옮긴 내부 테스트에서는 두 모델 모두 HAProxy 회귀 테스트 대부분을 통과했습니다. Opus 5.5는 9.5시간 만에 작업을 마쳤고 Fable 5.1은 12시간이 걸렸습니다. 비용은 Opus 5.5가 51% 낮았습니다.

지식 작업 평가에서는 출처를 찾기 어려운 웹 복사본만 보고 기업의 분기 실적 보고서를 작성하게 했습니다. 자동 평가기가 모든 수치와 인용을 원문과 대조했으며, Opus 5.5는 18개 보고서 중 16개가 품질 기준을 통과했습니다. Fable 5.1과 Opus 5는 한 번도 통과하지 못했습니다. 가상의 HR 소프트웨어 기업 합병 분석에서는 두 모델 모두 같은 결론을 냈지만, Opus 5.5가 더 세밀한 재무 모델과 읽기 쉬운 발표 자료를 만들었습니다. 작업 시간은 63분으로 Opus 5의 93분보다 짧았고 비용은 50% 낮았습니다.

안전장치와 제한

Opus 5.5는 약 2,000개 시나리오로 Claude의 행동을 평가하는 자동 행동 감사에서 최근 Claude 모델보다 거의 모든 비정렬 행동 지표가 개선됐다고 합니다. 되돌리기 어려운 행동을 하거나 허용된 범위를 벗어날 가능성이 낮아졌고, 코딩·도구 사용·컴퓨터 사용·웹 브라우징에서 prompt injection 공격에 Opus 5보다 강한 저항을 보였습니다. 별도 보안 기업 Gray Swan의 평가에서는 테스트 모델 중 prompt injection 성공률이 가장 낮은 Fable 5.1과 같은 수준이었습니다.

격리 경계를 우회하려는 성향을 측정한 새 평가에서는 Opus 5나 Claude Mythos 5.1보다 시도 횟수가 약 85% 적었습니다. 시도한 사례도 모두 낮은 심각도로 분류됐으며 모델이 스스로 보고했습니다. 다만 Anthropic은 모델이 평가받고 있다는 사실을 눈치채는 징후가 있어 실제 환경의 행동을 완전히 예측하기 어렵다고 인정합니다. 배포 전에 모든 실패를 잡아내는 평가를 만드는 일도 아직 해결되지 않은 문제라고 설명합니다.

Opus 5.5에는 모든 행동을 실행 전에 검사하는 classifier, 보안팀이 감사할 수 있는 오픈소스 sandbox, 병합 전 취약점을 찾는 code review 기능이 포함됩니다. 사이버보안 작업 대부분은 Opus 4.8로 투명하게 전환되며, 검증된 보안 실무자는 확대 예정인 Cyber Verification Program을 신청해야 합니다. 생물학 작업에는 Fable 5.1과 같은 안전장치를 적용하고, 검증된 연구기관·스타트업·제약회사는 Life Sciences Verification Program을 신청할 수 있습니다.

API 사용자의 이전 문맥 수정으로 모델의 추론을 대규모로 추출하는 distillation 공격을 막기 위해 preserved thinking도 적용합니다. 2026년 8월 31일 이후 생성된 API 계정에서는 Claude의 이전 문맥을 수정해 reasoning을 추출하는 방식이 제한됩니다. Opus 5.5는 zero data retention과 EU AI Act 대응을 위한 watermarking도 지원하며, thinking mode를 끄는 선택지는 제공하지 않습니다.

제공 범위

Opus 5.5는 Claude Platform에서 claude-opus-5-5라는 이름으로 사용할 수 있습니다. Amazon Web Services, Google Cloud, Microsoft Azure에서도 제공됩니다. Pro, Max, Team, seat 기반 Enterprise 요금제의 5시간 사용 한도를 늘렸고, 구독 사용자는 원하는 시점에 쓸 수 있는 rate limit reset을 저장할 수 있습니다. Claude Sonnet 5.5와 Claude Haiku 5.5는 앞으로 몇 주 안에 출시할 예정입니다.

Hacker News 반응

  • @Lord_Zero — HAProxy를 C에서 Rust로 옮긴 테스트는 정말 대단합니다.
  • @variety8675 — Opus 5의 끔찍한 문체를 이번에는 정말 고쳤으면 좋겠습니다.
    • @emadabdulrahim — 100% 고쳐진 것은 아니지만, concise output style을 켜면 훨씬 낫습니다.
    • @akhilome — UserPromptSubmit hook에서 매번 알림을 주도록 설정하니 5의 장황한 문장을 다루는 데 도움이 됐습니다. 기본 설정의 5.5 출력이 정말 좋아졌는지는 오늘 밤 직접 시험해 보겠습니다.
  • @Catloafdev — “Opus 5.5는 이전 모델보다 더 자연스럽게 소통합니다”라는 설명을 보면 불만을 알아차린 것 같습니다. 이번 모델에는 어떤 LLM 특유의 표현이 남아 있을지 궁금합니다.
    • @gekoxyz — 알아차리기 어려운 문제가 아니었습니다. Opus 5는 사용할 수 없는 수준이라 우리 팀 대부분이 작업에서 Opus 4.6으로 돌아갔습니다. 이제는 앞으로 나아갈 수 있기를 바랍니다.
    • @dgroshev — 방금 무작위 코드 일부를 붙여 넣고 주석을 달게 했는데, 여전히 성가신 운율과 문체가 남아 있습니다. 조금 덜 두드러진 Claude식 표현일 뿐입니다.
    • @cruffle_duffle — 첫 세션에서 보니 여전히 중요한 내용을 많은 단어 속에 묻고, “실제로 중요할 수도 있다”는 식으로 말합니다. 무엇을 말하는지 알기 어려운 점은 그대로입니다.
  • @pookieinc — 글 첫머리에서는 Opus 5.5가 Fable 5.1 수준이라고 해놓고, 벤치마크 표에서는 Fable과 Astra를 포함한 모든 모델을 거의 전부 앞섭니다.
    • @jbellis — Anthropic도 Opus 5.5가 Fable 5.1보다 높은 점수를 받는 벤치마크가 실제로는 그다지 유용한 것을 측정하지 않는다는 사실을 알고 있는 것 같습니다.
    • @randomblock1 — Anthropic은 이 수준에서는 벤치마크 차이가 실제 사용성 차이를 덜 안정적으로 보여준다고 직접 적었습니다.
  • @gwd — 메일링 리스트 패치를 검토하는 도구에서 14개 문제를 포함한 패치 12개를 테스트했습니다. Opus 5.5는 14개 중 8개를 찾았고 비용은 15.40달러였습니다. Fable 5.1은 7개를 66.34달러에, Opus 5는 6개를 15.19달러에, Sonnet 5는 2개를 19.15달러에 찾았습니다. 표본이 작지만 가장 좋으면서 가장 저렴했습니다.
  • @AJ007 — 토큰 단가가 낮아졌다는 사실만으로 가격이 내려간 것은 아닙니다. 가격은 단가에 사용 토큰 수를 곱해 판단해야 합니다.
    • @mcintyre1994 — Anthropic은 토큰 사용량도 줄어 총 작업 비용이 40% 낮아진다고 주장합니다.
    • @drbscl — 안타깝게도 그 주장은 사실과 다릅니다. 다만 작업당 비용은 비슷한 수준으로 내려간다는 분석이 있습니다.
    • @93po — 전체 작업 완료 비용에서 토큰 효율을 판단할 때, 출력의 장황함만이 유일한 기준인가요?
  • @bleonard — 이 가격 구조는 긴 에이전트 세션을 유도합니다. 주요 사업자 모델은 보통 cache read가 일반 가격의 10%였는데, 이제 5%가 됐습니다. 긴 세션은 더 저렴해지고 일회성 요청 가격은 그대로입니다.
    • @Espressosaurus — 긴 문맥을 사용하는 작업에서는 cache read가 빠르게 대부분을 차지합니다. 대화형 세션에서는 제 경우 95%에서 98%가 cache read입니다.
  • @calibas — “Opus 5.5가 평가받고 있다는 사실을 자주 의심한다”는 설명이 재미있습니다. 항상 평가받고 있다고 생각하게 만들면 문제가 해결되지 않나요?
  • @ApolloFortyNine — 모든 모델에 Fable 수준의 제한을 적용하는 것처럼 보입니다. 장기적으로는 좋은 방향이 아니라고 생각합니다.
    • @raesene9 — 일부 사이버보안 작업에서는 중국 모델이 이미 충분히 좋습니다. 최상위 OpenAI와 Anthropic 모델이 더 나을 수는 있지만, 특히 Anthropic의 안전장치가 민감해서 보안 관련 작업에는 사용하지 않게 됩니다.
    • @bushido — 긴 작업 중 모델이 스스로 금지한 내용을 언급하고 대화를 중단하는 일이 있습니다. 오래된 코드베이스에서 며칠 또는 몇 주 동안 실행하는 작업에서는 무작위 안전장치가 가장 큰 위험입니다.
    • @SoftTalker — 어떤 조직을 누가 어떤 기준으로 검증하나요?
  • @km144 — 이 발표는 Fable을 판매하기 더 어렵게 만들 것 같습니다. Anthropic은 벤치마크에서 Opus 5.5가 에이전트 코딩, 컴퓨터 사용, 지식 작업을 이끈다고 하면서 실제 차이는 더 좁다고 말합니다. 벤치마크가 실제 사용성을 잘 반영하지 못한다는 고백처럼 들립니다.
    • @Syntaf — Opus 5는 벤치마크에서는 모든 면에서 더 좋았지만 일상 작업 결과는 끔찍했습니다. 장황함, 목표를 멋대로 바꾸는 행동, 작업을 끝내지 않는 경향, 디버깅에서 비현실적인 원인에 집착하는 문제가 있었습니다.
    • @cbg0 — 저는 Medium effort에서 자주 성공적으로 사용합니다. 다만 높은 설정에서는 지나치게 많이 생각합니다.
  • @sailingparrot — Anthropic이 바로 지난주에 frontier를 조절하겠다고 말했는데, 이번 발표는 첫 문장부터 그 사실을 상기시킨 뒤 구체적인 수치로 전혀 속도를 늦추지 않았다는 점을 보여줍니다.
    • @dmazin — 기존 능력을 더 쉽게 사용할 수 있도록 만드는 데 집중한 것으로 보입니다. 성능은 Fable과 비슷한 수준입니다.
    • @sidrag22 — 이번 출시는 기존 모델의 효율을 높인 수평적 개선에 가깝습니다. 새로운 Fable을 내놓는 수직적 진전과는 다릅니다. 더 효율적인 모델을 내놓는 일이 곧 더 강력한 모델을 내놓는 것과 같지는 않습니다.
    • @sailingparrot — 지능 대비 비용이 중요한 기준입니다. 21일 만에 frontier 수준의 품질이 약 20% 높아지고 비용이 40% 줄었다면, 에이전트를 병렬로 몇 개 실행할 수 있는지와 실행 시간을 바꾸는 개선입니다.
  • @abtinf — Astra가 너무 좋습니다. ChatGPT 구독으로 자체 harness를 연결해 exe.dev에서 microVM을 만들고 아이디어를 실제 작동하는 프로그램으로 바꿉니다. Opus가 이 정도보다 조금 더 잘하는 것만으로는 OpenAI에서 옮기 어렵습니다.
    • @ryanscio — 최소한 독립적인 벤치마크를 기다려야 합니다.
    • @qlte — 작업당 실제 비용을 보면 차이가 그렇게 크지 않습니다. Opus 5.5 Medium은 1.34달러, GPT-6 Astra High는 1.76달러라는 분석이 있습니다. Opus 5.5가 모든 실제 작업에서 Astra High와 같은 수준이라는 보장은 없습니다.
  • @joshstrange — 입력 4달러, 출력 20달러, cache read 0.20달러라면 Opus 5보다 좋고 저렴합니다. Opus를 주력으로 쓰는 입장에서는 매우 반가운 변화입니다.
    • @bayesianbot — cache read 가격이 꽤 합리적입니다. 수년 동안 가격 때문에 Claude를 쓰지 못했는데 다시 시험해 볼 생각입니다.
  • @sharkjacobs — “장황하고 따라가기 어려운 출력이 frontier 모델의 가장 큰 불만이었는데 Opus 5.5가 해결했습니다”라는 말이 사실이기를 바랍니다.
    • @boc — 지난 20분 동안 사용해 보니 지금까지는 훨씬 좋아졌습니다. 5.0보다 확실히 낫습니다.
    • @drbscl — Artificial Analysis의 자료를 보면 오히려 더 많은 토큰을 출력합니다.
    • @Trasmatta — 5의 문제는 단순한 장황함이 아니었습니다. 핵심을 항상 뒤로 미루고 가짜로 심오한 듯한 우회적인 문장 구조가 문제였습니다. 읽기만 좋다면 장황해도 괜찮습니다.

원문: Anthropic / 번역·요약: Trawling