Hacker News

GPT-6 Sol and Luna

GPT-6 Sol·Luna 공개 — 가격은 절반, 캐싱 효율은 개선

OpenAI가 GPT-6 계열의 중간·경량 모델 Sol과 Luna를 공개하고 API 가격을 이전 GPT-5.6 모델보다 50% 낮췄습니다. 업무 자동화·코딩·컴퓨터 사용 성능과 프롬프트 캐싱 개선치를 제시했으며, Hacker News에서는 낮은 가격을 반기는 반응과 구독 사용량·실사용 성능을 따져야 한다는 의견이 함께 나왔습니다.

AI 요약

OpenAI가 GPT-6 Astra에 이어 GPT-6 Sol과 GPT-6 Luna를 공개했습니다. Astra의 학습 방식과 전문 업무, 사실성, 코딩, 컴퓨터 사용, 정렬(alignment) 분야의 개선을 더 빠르고 저렴한 모델에 적용했다고 설명합니다. API 가격은 GPT-5.6 Sol의 입력 100만 토큰당 4달러, 출력 20달러에서 각각 2달러와 10달러로 낮아집니다. GPT-5.6 Luna의 입력 가격은 0.20달러에서 0.10달러로, 출력 가격은 1.20달러에서 0.50달러로 내려갑니다. 발표문은 두 모델 모두 이전 가격보다 50% 저렴하다고 밝혔습니다.

업무 자동화와 사실성

업무용 앱 47개와 도구를 활용해 영업, 마케팅, 운영, 지원, 재무, 인사 작업을 끝까지 수행하는 AutomationBench에서 GPT-6 Sol은 xhigh 추론 설정으로 33.2%를 기록했습니다. 작업당 비용은 0.27달러입니다. 발표문이 비교한 Claude Opus 5 max는 26.9%에 작업당 비용이 Sol의 11.1배였습니다. Sol은 GPT-6 Astra low의 30.3%도 웃돌았습니다. 다만 Claude Fable 5.1 점수에는 작업 약 40%에서 발생한 Opus 5 대체 실행 비용이 빠져 있어, 실제 비용보다 낮게 집계됐을 수 있다고 OpenAI는 주석을 달았습니다.

복잡한 전문 업무를 평가하는 Agents’ Last Exam에서는 Sol max가 56.4%를 기록했습니다. OpenAI는 Claude Opus 5가 해당 평가에서 기록한 최고 점수보다 높고, 작업당 비용은 60% 낮다고 설명합니다. 회사 내부의 사실성 평가에서는 사용자가 과거 답변의 오류를 신고한 비식별 대화를 사용했습니다. Sol은 이전 모델보다 오류를 약 절반으로 줄여 Astra 수준에 가까워졌고, Luna도 개선됐다고 밝혔습니다. 이 평가는 일반적인 사용 상황을 대표하지 않으며, 오류가 나도록 유도한 대화를 대상으로 한다는 점도 덧붙였습니다.

코딩과 컴퓨터 사용

실제 코드베이스에 병합할 수 있는 변경 사항을 만드는지 평가하는 FrontierCode에서 Sol은 GPT-5.6 Sol보다 개선됐고, Claude Fable 5.1 xhigh와 비슷한 성능을 더 낮은 비용으로 냈다고 합니다. 복잡한 소프트웨어 엔지니어링 작업을 평가하는 DeepSWE v1.1에서는 Sol max가 68.8%를 기록했습니다. Claude Fable 5가 xhigh에서 낸 최고점 69.9%보다 1.1%포인트 낮지만, 작업당 비용은 약 80% 낮다고 설명합니다. Luna max는 66.6%로 Claude Opus 5와 Fable 5의 medium 설정에 견줄 만한 점수를 냈으며, 작업당 비용은 각각 93%, 96% 낮았습니다.

컴퓨터 사용 평가 OSWorld 2.0 offline에서는 Sol xhigh가 60.5%를 기록해 Claude Opus 5 medium의 60.3%와 비슷한 점수를 냈습니다. OpenAI가 제시한 Sol의 작업당 비용은 약 80% 낮습니다. Luna max는 GPT-5.6 Sol medium보다 높은 점수를 내면서 비용은 10분의 1이라고 밝혔습니다. 다만 Astra가 여전히 컴퓨터 사용 분야의 최고 모델이라는 설명도 함께 제시했습니다.

프롬프트 캐싱과 이용 방식

OpenAI는 기본 프롬프트 캐싱 적중률을 높였으며, 캐시된 입력 토큰은 90% 할인된다고 설명합니다. 개발자는 Prompt Caching Dashboard에서 캐시된 입력량과 변화를 확인할 수 있고, 진단 도구로 캐시가 빗나간 원인을 살필 수 있습니다. 대화 중 추론 강도를 바꾸거나 도구를 켜고 꺼도 기존 문맥을 캐시에 재사용할 수 있게 했으며, 명시적 캐시 구간을 지정하는 기능도 제공합니다. GitHub는 이 개선으로 OpenAI 모델에 보낸 수십억 건의 요청에서 새로 처리해야 하는 프롬프트 토큰 비중이 최근 몇 달 동안 50% 넘게 줄었다고 전했습니다.

API 모델 식별자는 gpt-6-sol, gpt-6-luna입니다. 두 모델은 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 이용자에게 제공됩니다. Free와 Go 이용자는 데스크톱 앱에서 Luna를 쓸 수 있습니다. 일반 ChatGPT에는 아직 제공되지 않으며 순차적으로 배포할 예정이라고 밝혔습니다.

Hacker News 반응

  • @hehimself — 주요 업체들의 가격 인하가 반갑습니다.
    • @madduci — Qwen4가 발표됐기 때문입니다.
    • @blovescoffee — 중국 모델뿐 아니라 Anthropic과 다른 연구 성과를 압박하려는 목적도 있습니다. 그런 압박이 가격을 낮추는 데 도움이 됩니다.
  • @Cu3PO42 — GPT-5.6 가격과 비교해 50% 내린 점이 반갑습니다. Luna는 입력 토큰 100만 개당 0.10달러, 출력 토큰 100만 개당 0.50달러라니 정말 놀랍습니다. 편집: Azure나 AWS에서 제공되는지는 글에 없습니다. 나중에 추가될 거라 예상하지만, 제공되지 않는다면 흥미롭겠습니다.
    • @yreg — API 가격 인하가 구독제 사용량 증가로 이어지나요? 아는 분 있나요?
  • @Readerium — Opus 5.5가 더 나은 것 아닌가요? 두 모델의 점수를 함께 보여줄 수 있나요?
    • @hehimself — Sol 6은 Opus 5.5와 직접 맞붙는 모델이 아닙니다. 가격이 50% 저렴합니다.
    • @Readerium — 캐시 읽기 가격은 100만 토큰당 0.20달러로 같으니 50% 저렴해지는 건 아닙니다. 비용의 절반이 캐시 읽기라고 가정하면 25% 정도 저렴하겠습니다.
    • @blovescoffee — 비용은 캐시에 저장되지 않은 입력에서 대부분 나옵니다.
  • @nickandbro — 가격이 정말 놀랍습니다. Luna에게 10일 동안 목표를 맡겨도 한도에 걸리지 않을 수 있겠습니다.
    • @physicallyIllfr — 왜 그런 일을 하시나요? 장시간 목표를 맡기는 건 야생 동물을 코드베이스에 풀어놓는 것과 비슷하지 않나요? 사람들이 코드 품질을 신경 쓰기는 하나요?
    • @thimabi — 모든 작업에 최고급 지능이 필요한 건 아닙니다. 쉽지만 번거로운 작업이라면 Luna가 꽤 잘할 수 있습니다.
  • @m_fayer — 올해 내내 에이전트를 써왔지만, 제게는 5.6 Sol이 딱 맞았습니다. 말로 소통하는 방식과 엔지니어링 감각이 잘 맞아서 마치 호흡이 맞는 동료처럼 느껴졌습니다. 처음으로 애착이 생긴 모델입니다. 후속 모델이 기술적으로 더 나아도 함께 일하는 느낌은 달라질까 걱정됩니다. JetBrains처럼 믿을 수 있고 예측 가능한 회사가 중요한 도구를 만들던 시절이 그립습니다.
    • @redox99 — 저도 같습니다. 추가 지능이 필요하지 않은 상황에서는 GPT-6 Astra가 오히려 퇴보처럼 느껴졌습니다.
    • @jeffnash — 저도 구체적인 코드 변경을 부탁하면 Sol이 코드베이스를 리팩터링하며 다른 길로 빠지는 경우가 있었습니다. Terra는 대량 변경을 묵묵히 수행하는 실무형 모델이었습니다. Luna는 조금 멍청해서 실수가 있었고요. GPT-6 Luna가 나아졌는지 보겠습니다.
  • @Readerium — DeepSWE에서 Sol 6이 Sol 5.6보다 점수가 낮아 보입니다. 이상하네요!
  • @recitedropper — 제가 본 Hacker News 글 가운데 조작된 여론처럼 보이는 정도가 가장 심합니다. 가격 인하를 언급한 제 이전 댓글은 신고로 표시되기 전까지 이 글에서 가장 많은 추천을 받았습니다. 게시 26분 만에 댓글 89개가 달렸고, 글이 올라온 지 한 시간 안에 댓글이 상단에 놓였습니다. Opus 5.5 발표 직후 올라온 글이기도 합니다. 판단은 여러분께 맡기겠습니다.
    • @tomhow — 여론 조작의 증거는 없습니다. 언급한 댓글은 활동 이력이 있는 계정에서 올라왔고, 서로 다른 위치의 이용자가 썼습니다. OpenAI와 연결됐다는 증거도 없습니다. 사람들이 모델과 가격에 진심으로 들뜬 것처럼 보입니다.

원문: OpenAI / 번역·요약: Trawling