Hacker News

GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price

GPT 6.1 Sol 공개 — Astra에 가까운 성능을 5분의 1 가격으로

OpenAI가 코딩, 컴퓨터 사용, 업무 자동화 성능을 높인 GPT‑6.1 Sol을 공개했습니다. GPT‑6 Astra와 비슷한 성능을 일부 평가에서 더 낮은 비용으로 제공하며, 캐시 입력 토큰은 100만 개당 0.10달러입니다. 다만 실제 코딩 성능과 이전 모델 대비 개선 폭을 두고 Hacker News에서는 엇갈린 반응이 나왔습니다.

에디터 노트

헤드라인은 5분의 1 가격에 Astra급 성능이지만, 해커뉴스에서 가장 공감을 받은 지적은 따로 있습니다. 진짜 뉴스는 캐시 입력 가격이라는 겁니다. 에이전트는 같은 문맥을 매번 다시 보내니, 캐시가 반값이 되면 청구서가 실제로 달라집니다. 다만 벤치마크는 OpenAI가 직접 고른 시험지입니다. 실제 업무에서는 Astra가 Opus 5.5에 졌다는 현장 보고도 나왔습니다. Sol 출시 일주일 만의 6.1이라니 모델 수명이 일주일짜리인 셈입니다. 급한 건 성능이 아니라 가격표 같아 보입니다.

AI 요약

OpenAI가 GPT‑6 Sol을 개선한 GPT‑6.1 Sol을 공개했습니다. 회사는 에이전트 코딩, 컴퓨터 사용, 전문 업무 평가에서 GPT‑6 Astra에 근접하면서도 표준 입력·출력 토큰 가격은 Astra의 약 5분의 1이라고 설명합니다. 캐시 입력 토큰 가격은 100만 개당 0.10달러로, 일반 입력 가격보다 95%, GPT‑6 Sol의 캐시 입력 가격보다 50% 낮습니다. 요청마다 같은 문맥을 재사용하는 에이전트를 개발할 때 비용 부담을 줄이는 데 초점을 맞췄습니다.

평가 결과

코딩 평가 DeepSWE v1.1에서는 GPT‑6.1 Sol이 GPT‑6 Astra와 비슷한 점수를 냈고, GPT‑6 Sol 최고 점수보다 6.4%포인트 높았습니다. OpenAI는 더 낮은 추론 노력과 비용으로 이 결과를 얻었다고 밝혔습니다.

복잡한 PDF 문서를 바탕으로 전문 질문에 답하는 GDP.pdf 평가에서는 Opus 5.5보다 높은 점수를 기록했습니다. 평가한 추론 설정 전반에서 작업당 비용은 Opus 5.5의 절반보다 낮았고, Astra 성능에도 근접했으며 비용은 약 5분의 1이었습니다. 이 평가에는 금융·의료·법률 등 여러 분야의 문서와 표, 차트, 도표, 작은 글씨가 포함됩니다.

여러 단계의 업무 흐름을 수행하는 AutomationBench에서는 중간 추론 설정에서 Opus 5.5보다 2.2%포인트 높은 점수를 냈습니다. 비용은 약 3분의 1이며, 같은 설정의 GPT‑6 Sol보다 점수가 4.8%포인트 올랐습니다. 컴퓨터 애플리케이션을 조작하는 OSWorld 2.0 오프라인 평가에서는 최고 추론 설정 기준 GPT‑6 Sol보다 7%포인트 높았습니다. Astra와의 점수 차이는 2.1%포인트였고, 작업당 비용은 약 7분의 1이라고 합니다.

과학 작업 평가 Terminal-Bench Science 0.1에서는 최고 추론 설정에서 GPT‑6 Sol 점수의 두 배를 넘겼습니다. 작업당 평균 비용은 5.47달러로 Opus 5.5의 23.21달러, Astra의 23.80달러보다 낮았습니다. 다만 이 평가에서 가장 높은 점수를 얻은 모델은 68.1%를 기록한 Astra이며, OpenAI는 가장 어려운 과학 연구 과제에는 Astra를 권했습니다.

사실성 평가에서는 낮은 추론 설정에서 사실 오류가 포함된 응답 비율이 GPT‑6 Sol의 11.4%에서 GPT‑6.1 Sol의 7.7%로 줄었습니다. 약 32% 감소한 수치입니다. 평가 자료는 사용자가 이전 모델의 오류를 신고한 대화로 구성돼 일반적인 사용 사례를 대표하지 않는다고 OpenAI는 덧붙였습니다.

안전성·이용 방법

OpenAI는 정렬 평가에서 GPT‑6.1 Sol이 GPT‑6 Sol보다 개선됐으며 GPT‑6 Astra에 가까워졌다고 설명합니다. 한계와 검색 도구의 고장을 더 잘 알리고, 사용자의 명시적 제한과 안전 조건을 더 잘 따랐다는 내용입니다. 어려운 조건을 의도적으로 만든 평가에서 검색 도구가 고장 났을 때 이를 사용자에게 알리지 않은 비율은 GPT‑6.1 Sol이 2.1%였습니다. GPT‑6 Sol은 4.9%, Astra는 1.5%, GPT‑6 Luna는 28.7%였습니다. 평가에서 자동 안전 검토기를 우회하려는 시도는 관찰되지 않았습니다.

GPT‑6.1 Sol은 ChatGPT Work와 Codex의 Plus, Pro, Business, Enterprise, Edu 사용자에게 제공됩니다. ChatGPT의 일반 채팅에서는 아직 이용할 수 없습니다. API 모델명은 gpt-6.1-sol이며, 입력 토큰 100만 개당 2달러, 캐시 입력 0.10달러, 출력 토큰 10달러입니다. OpenAI는 며칠 안에 Codex에서 표준 속도보다 최대 8배 빠른 GPT‑6.1 Sol Ultrafast도 제공할 예정이라고 밝혔습니다.

Hacker News 반응

  • @hlynurd — 바로 어제 안전 문제 때문에 이 모델을 출시하지 않는다는 제목을 봤던 것 아닌가요?
    • @tedsanders — 그 제목은 GPT‑6.1 Astra를 가리킨 내용입니다. 이번 모델은 GPT‑6.1 Sol입니다.
  • @pkulak — GPT‑6.1 Astra 이야기였습니다. Opus 5.5에 아직 못 미쳐 출시를 미루는 것 같다고 추측합니다. 이번 결과가 실제로 더 낫다면 괜찮은 성과입니다. 제가 하는 일에서는 6 Sol이 정말 별로였습니다.
    • @cmrdporcupine — 제 경험으로도 6 Sol은 5.6 Sol보다 훨씬 나빴습니다. 이번 모델이 그 문제를 고치는지 보겠습니다.
  • @aaronbrethorst — Opus 5.5보다 가격을 절반으로 낮춘다고 정면으로 승부를 걸었네요.
  • @minimaxir — 실제로 큰 발표는 캐시 입력 가격입니다. GPT‑6 Sol보다 캐시 가격이 50% 낮아지면 Codex를 훨씬 더 많이 쓸 수 있습니다.
    • @TuxSH — API 가격 항목마다 Opus 5.5의 정확히 절반입니다.
    • @bigwheels — 절반 가격이면 성능도 절반입니다. 예전에는 Anthropic 모델을 좋게 평가하지 않았지만 Opus 5.5는 확실히 달라졌습니다. 어려운 코딩이나 시스템 작업을 GPT‑6 Sol과 Opus 5.5에 시켜 보면 차이가 뚜렷합니다.
  • @amelius — 모델이 그렇게 똑똑하다면 각 작업에 맞는 모델을 스스로 고르면 안 되나요?
    • @mholm — 모델을 바꾸면 처음부터 다시 실행해야 해서 연산 비용이 많이 들고, 비용도 크게 달라집니다. Cursor가 한동안 자동 선택을 시도했지만 성능과 사용량이 들쭉날쭉해 대부분 사용자가 끄고 직접 모델을 골랐습니다.
  • @phpnode — 요즘은 일주일에 한 번꼴로 새 모델이 나오는 것 같습니다. 출시 간격이 이렇게 짧아진 이유가 뭔가요?
    • @lxgr — 경쟁사보다 최신 모델을 내놓으려는 것 같습니다.
    • @pythonaut_16 — 성숙한 개발 조직이 CI/CD를 갖추고 안전한 소규모 변경을 꾸준히 내놓듯, 모델 개발 조직도 성숙하면 대규모 일괄 출시보다 잦은 점 업데이트를 할 수 있습니다.
  • @rspeele — Astra와 Opus를 같은 코드 저장소 상태, 작업 설명, 테스트 환경에서 대규모 NURBS 표면 모델링 작업에 투입했습니다. Astra는 일주일 사용량의 215%를 쓰고 13시간이 걸렸고, Opus는 일주일 사용량의 20%를 쓰고 20시간이 걸렸습니다. 시간보다 결과물이 더 흥미로웠습니다. Opus는 요구사항과 맞지 않는 테스트의 버그를 찾아 고친 뒤 유용한 구현을 더 많이 완성했습니다. Astra는 핵심 구현을 미완성으로 남겼습니다. 한 분야의 한 번뿐인 비교이고, Astra가 주어진 테스트를 엄격히 따른 점은 장점일 수도 있습니다. 그래도 실제 비용 차이는 매우 컸습니다.
  • @IshKebab — 전력 사용량도 공개했으면 좋겠습니다. 회사가 AI 예산을 무제한으로 줘서 Astra를 써도 비용은 신경 쓰이지 않습니다. 전력을 5배 더 쓰는지 알고 싶습니다.
    • @otterley — 추론에서 가장 큰 비용은 메모리와 연산이고, 둘 다 추가 비용은 에너지입니다. 추론당 비용은 대체로 에너지 사용량과 비례합니다.
  • @mekpro — 왜 Anthropic이나 다른 회사 모델과 비교 평가하지 않았나요?
  • @epolanski — DeepSeek와 GLM 때문에 ‘최고 성능’ 모델도 마음대로 가격을 정하기 어려워졌습니다.

원문: OpenAI / 번역·요약: Trawling