Livenerf: Has Opus 5.5 been nerfed yet?
Livenerf: Opus 5.5 성능 저하 여부를 매일 측정합니다
Livenerf는 모델 출시 뒤 성능이 조용히 낮아지는지 확인하려고 Claude Opus 5.5를 30일간 추적하는 벤치마크입니다. 고정한 질문과 채점기, 사전 등록한 통계 기준을 사용해 일화 대신 성능·출력 토큰 변화를 측정합니다.
- 주제
에디터 노트
너프됐다는 일화는 모델이 나올 때마다 반복됩니다. Livenerf가 다른 점은 측정의 한계를 먼저 고백한 것입니다. 이 도구는 지금 규모에서 Opus 5와 5.5도 구분하지 못합니다. 작은 교체는 감지 불가라고 스스로 밝힌 벤치마크입니다. 그래서 더 믿음이 갑니다. 결과를 보기 전에 규칙을 고정했고, 좋아지는 방향도 같은 기준으로 공개하겠다고 했습니다. 다만 해커뉴스의 지적도 새겨들을 만합니다. 모델이 나빠진 게 아니라 우리가 새 지능에 익숙해진 것일 수 있습니다. 신제품 효과가 사라지는 속도가 너프의 속도일지도 모릅니다.
AI 요약
모델 출시 뒤 성능이 떨어졌다는 사용자 경험은 반복해서 나오지만, 출시 직후 기준 데이터가 없으면 실제 변화와 체감 변화를 구분하기 어렵습니다. Livenerf는 Claude Opus 5.5를 출시 주간부터 매일 시험해 이 문제를 측정하려는 공개 프로젝트입니다. 모델을 완전히 결정적으로 실행할 수는 없으므로 프롬프트, Claude Code CLI 버전, 채점기, 실행 환경을 고정하고 원시 로그를 보존합니다. 통계 분석은 Inspect 평가 프레임워크와 사전 등록한 절차를 사용합니다.
측정 설계
평가 항목은 GPQA Diamond, MMLU-Pro, 경시 수학, AIME 2025–26 문제 2,336개를 각각 네 번 시험해 고릅니다. 첫 시도 정답률은 약 93%였고, 질문 97%는 항상 맞거나 항상 틀렸습니다. 성능 변화 관측에 정보가 적은 문항은 제외하고, 때때로 맞히는 78개를 측정 패널로 삼습니다. 새 표본으로 확인했을 때 이 패널의 정답률은 54.7%에서 62.0%로 올랐습니다. 문항 선정 과정에서 생기는 편향을 확인해 검정력 계산에 반영한 결과입니다.
같은 문항을 반복 출제하고 각 항목의 기준선 대비 점수 차이를 비교합니다. 문항별 난이도 차이를 줄이기 위해 paired per-item 차이를 쓰며, 표준오차는 문항 단위 군집을 반영합니다. 정답 여부는 exact-match로 채점하고 LLM 심판은 쓰지 않습니다. 채점 모델이 바뀌거나 흔들리면 측정 결과도 달라질 수 있기 때문입니다. 출력 토큰 수도 함께 기록합니다. 작성자는 모델이 덜 생각하기 시작하면 정확도 변화보다 토큰 수에서 먼저 신호가 나타날 수 있다고 설명합니다.
실행과 판정 기준
측정은 Claude Max 구독과 headless Claude Code의 claude -p 명령으로 진행합니다. Claude Code 업데이트가 평가 환경 변화로 오인되지 않도록 CLI 버전을 고정하고, 실행기에서 버전이 달라지면 중단합니다. 도구, MCP 서버, 설정 파일, 메모리 없이 한 차례 응답만 받으며, 프롬프트와 응답, 사용량, 지연 시간, CLI 버전, 실행 코드 해시를 기록합니다. Claude Code 안전 분류기가 다른 모델로 응답하거나 질문을 거부한 경우는 제외 대상 여부를 기록합니다.
계획은 하루 한 번, 총 30일입니다. 1~10일을 기준선으로 삼고 이후 두 개의 10일 구간을 비교합니다. 2026년 9월 29일 현재 6일치 자료를 모았고, 누락된 실행은 없습니다. 하루에 패널 전체를 한 번 실행하는 방식으로 10일 구간 사이 약 7.5%포인트의 정확도 차이를 검출하는 것이 목표입니다. 주간 사용량의 약 3.6%를 예산으로 잡았습니다. 저자는 기준선보다 나아지는 결과도 같은 기준으로 공개한다고 밝힙니다.
성능 변화 판정은 두 개의 연속된 10일 구간에서 모두 99% 신뢰구간이 0을 벗어나고, 차이가 최소 3%포인트이며, 대조군에서는 같은 변화가 나타나지 않을 때 내립니다. 대조군으로는 Opus 5를 같은 평가 환경에서 실행합니다. 사전 등록 자료에는 문항 선정법, 지표, 검증 절차와 판정 기준을 기록해 결과를 확인한 뒤 규칙을 바꾸지 못하게 합니다.
검증 결과와 한계
사전 검증에서 낮은 effort 설정은 출력 토큰을 62% 줄였고 정확도는 8.3±4.5%포인트 낮췄습니다. 중간 effort 설정은 토큰이 26% 줄고 정확도는 4.2±3.9%포인트 낮아졌습니다. 다만 Opus 5로 바꾼 검증에서는 Opus 5.5와 차이를 99% 기준으로 구별하지 못했습니다. 차이는 −3.8±6.3%포인트, 출력 토큰은 23% 감소했습니다. 따라서 이 도구는 현재 검증 규모에서 같은 계열 모델 간의 작은 교체를 감지한다고 입증하지 못했습니다. 10일 구간에는 검증보다 약 2.5배 많은 표본이 들어가지만, 그것으로 충분한지는 아직 확인하지 않았습니다.
패널 문항을 별도로 점검한 결과 정답 오류로 보이는 문항 8개와 모호한 문항 30개가 발견됐습니다. 프로젝트는 해당 문항을 그대로 유지하고, 사전 등록한 민감도 분석에서 이들을 제외한 결과도 계산합니다. 설계는 Opus 5.5의 Claude Code 구독 경로를 측정합니다. API에서 제공하는 모델과 같은 대상을 측정한다고 볼 수 없으며, 출시 주간 성능도 절대적인 기준점이 아니라 비교를 위한 기준선입니다. 프로젝트는 성능 저하뿐 아니라 향상도 측정하며, 원인을 고의적인 성능 저하로 미리 단정하지 않습니다.
Hacker News 반응
- @gigatexal — 훌륭한 아이디어입니다. Sonnet 5가 너무 별로여서 Opus 5.5도 성능이 낮아질까 걱정하고 있습니다.
- @aabhay — 10일 단위만 측정하나요? Astra는 일주일 안에 성능이 낮아진 것처럼 느꼈습니다.
- @refulgentis — 늘 일주일쯤 걸립니다. 새로운 모델에 익숙해지는 쾌락 적응을 보여주는 적당한 기간이라고 생각하게 됐습니다. 벤치마크로 성능 저하를 입증하려는 시도는 많이 봤지만, 계속 재현되는 결과는 없었습니다.
- @solenoid0937 — 과감한 의견이지만, 대부분 모델이 성능 저하된 게 아니라 사람들이 새로운 지능 수준에 익숙해진 것 같습니다.
- @solfox — 의도 여부는 논쟁할 수 있어도 모델의 힘이 출시 직후 빠르게 빠지는 듯한 경험은 분명히 있습니다.
- @jyoung8607 — 이런 현상을 어떤 방식으로든 측정한 사례가 있나요? 그런 이야기는 자주 보지만 검토하거나 반증할 수 있는 구체적인 사실이나 측정은 본 적이 없습니다. 측정 가능한 문제라고 생각하며, 이 프로젝트가 측정하는 점이 반갑습니다.
- @judge2020 — 더 많은 조직이 모델을 빠르게 승인하면서 Anthropic이 컴퓨팅 자원 부족을 겪고, 특히 사용량이 몰리는 시간에 성능을 조금 낮춰 대응하는 건 아닌지 궁금합니다.
- @whs — API, 특히 퍼블릭 클라우드의 Claude도 같은 영향을 받는지 궁금합니다. 구독 요금제가 더 싼 양자화 모델을 쓴다면 API 모델과 비교할 수 없지 않을까요?
- @madeofpalk — 저는 Claude Code를 토큰별 과금 방식으로 계속 썼지만 성능 저하 논란을 이해하지 못했습니다. 특정 시간대의 속도 저하나 점진적인 품질 하락을 느낀 적이 없습니다.
- @LeoPanthera — 표본이 하나라면 쓸모가 없습니다. 출력이 결정적이지 않으니까요.
- @zeroonetwothree — README에 따르면 Opus 5와 5.5도 구분하지 못합니다. 그렇다면 이 도구는 쓸모가 없습니다.
- @johnfn — 모델이 성능 저하됐다는 주장은 보고된 사례 대부분에서 사실이 아닙니다. 이런 벤치마크가 지금까지 나온 수많은 비슷한 시도와 함께 그런 현상을 보여줬을 겁니다. 새 모델은 감당할 수 있는 복잡도가 더 높아서 처음에는 무엇이든 할 수 있을 것처럼 느껴지지만, 며칠 뒤 복잡도 한계에 도달하면 무너집니다. 다음 모델이 나오면 같은 일이 반복됩니다.
- @hbn — Opus 4.6 이후 저는 더 복잡한 일을 하기 시작하지 않았고 업무도 그대로입니다. 그런데 모델 품질은 달라졌습니다. 출시 뒤 실제 운영 중인 모델을 조정하는 건 음모론이 아닙니다.
- @jug — Nerf Bench도 있습니다. 출시일에 기준을 측정하고 이후 결과와 비교합니다. 10% 넘는 차이를 변화로 판단하며 현재 Opus 5.5와 GPT-6 Astra를 추적합니다. 이 벤치마크는 Anthropic이 나중에 글을 쓴 Opus 4.6 성능 저하도 포착했습니다. 개인적으로 사람들은 실제보다 성능 저하를 자주 감지한다고 생각하며, 신제품 효과가 사라진 경우도 많습니다.
- @winwang — 일화일 뿐이고 성능 저하 여부와는 무관하지만, Opus 5.5는 지난 몇 시간까지 제게 놀라울 만큼 잘 작동했습니다. 연구 수준의 질문과 지시도 잘 따랐습니다.
원문: GitHub / 번역·요약: Trawling