Reddit

OpenAI rolls out upgraded prompt caching and reduced cached input rates for GPT-6

OpenAI, GPT-6 프롬프트 캐싱 개선과 캐시 입력 요금 인하 발표

OpenAI가 GPT-6 계열의 프롬프트 캐싱을 개선해 30분 안에 재사용되는 공통 프롬프트 접두부에 캐시 할인을 적용합니다. 캐시 적중률 대시보드와 미스 진단 도구도 제공하며, 도구 설정과 추론 수준을 조정해도 캐시를 유지하는 방법을 안내합니다.

AI 요약

GPT-6 기반 에이전트는 코드베이스 리팩터링이나 문서·발표 자료 작성처럼 복잡한 작업을 여러 시간 이어갑니다. 에이전트 애플리케이션은 앞선 요청의 지침, 도구 정의, 문맥을 다음 API 요청에도 반복해서 전달합니다. OpenAI는 이 공통 문맥의 계산 결과를 캐시에 저장해 응답 시간을 줄이고, 캐시된 입력 토큰에 최대 90% 할인을 적용한다고 설명합니다.

GPT-6 계열에서는 기본 캐시 적중률을 높인 프롬프트 캐싱 시스템을 도입했습니다. 30분 안에 재사용되는 적격 공통 접두부에 캐시 할인을 적용하며, 개발자가 캐시 상태를 확인하고 미스 원인을 찾거나 캐시할 프롬프트 범위를 정하도록 도구도 추가했습니다.

캐시 적중률 확인과 미스 진단

Prompt Caching Dashboard에서는 애플리케이션 입력 중 캐시에서 처리된 양을 확인합니다. 시간에 따른 적중률을 추적하고 입력 구성 차트에서 캐시된 토큰과 캐시되지 않은 토큰을 비교할 수 있습니다. 적중률이 갑자기 떨어졌는지, 애플리케이션 변경이 캐싱 성능에 어떤 영향을 줬는지 살펴보는 데 쓰입니다.

예상하지 못한 캐시 미스가 발생하면 진단 도구로 최근 응답과 요청을 비교합니다. 모델, 도구, 설정, 입력 중 무엇이 달라져 캐시 재사용을 막았는지 확인하며, 영향받은 토큰 수 추정치도 제공합니다. 예시 응답에서는 미스 원인이 tools_changed로 표시되고, 재사용 가능 토큰과 캐시 미스 토큰이 각각 5,629개로 나옵니다.

애플리케이션에 맞춰 캐시 최적화

명시적 캐시 브레이크포인트를 설정하면 재사용할 프롬프트 접두부를 고를 수 있습니다. 갱신된 가이드는 접두부의 캐시 유효 시간과 도구·입력 변경이 재사용에 미치는 영향을 설명합니다.

GPT-6 모델에서는 응답 사이에 추론 수준을 바꿔도 캐시를 유지할 수 있습니다. 요청 수준의 추론 설정은 그대로 두고 configuration_update를 덧붙이면 됩니다. 어려운 작업에서는 추론 수준을 높이고, 간단한 후속 작업에서는 낮추는 식으로 조정합니다.

도구나 지침이 바뀌어도 이전 문맥을 재사용하려면 도구 정의와 스키마, 순서를 안정적으로 유지하라고 권합니다. 사용 가능한 도구는 정의를 삭제하는 대신 allowed_tools로 제한하거나, 도구가 필요하지 않을 때 tool_choicenone으로 설정할 수 있습니다. 새 지침은 기존 내용을 교체하는 대신 문맥 뒤쪽에 개발자 메시지로 추가합니다.

요청이 들어오기 전에 공통 지침, 도구 정의, 참고 자료를 처리하는 캐시 예열(prewarming)도 소개합니다. 이렇게 하면 사용자가 질문한 뒤 기다리는 시간을 줄일 수 있습니다. OpenAI는 대시보드와 진단 도구를 이용하고, 가이드에 따라 캐시 적중률을 개선하라고 안내합니다.

Reddit 반응

  • @u/onehedgeman — 제 생각에는 이 분야에서 OpenAI가 시장 우위를 점하는 이유입니다. 정말 잘하고 있습니다.
    • @u/Actual__Wizard — 이런 움직임은 정말 놀랍습니다. 제삼자 캐시를 쓰고 싶어 하는 사람은 많지 않을 테니 OpenAI에 큰 이점이 될 수도 있습니다. 이제 캐시가 있는데 쓰지 않는 건 말이 안 됩니다. 저는 보통 이 회사를 많이 비판하지만, 이건 좋은 아이디어라고 진심으로 생각합니다.
    • @u/2Norn — 네, 이 점에서는 경쟁사보다 약 60% 낫습니다.
  • @u/Gigaslavx — 개선은 분명히 있다고 봅니다. 그래도 마케팅 자료보다는 검증된 제삼자 리뷰를 더 믿고 싶습니다.
  • @u/Maximum-Face9536 — GPT-6 Sol은 Plus 사용자의 일반 Chat 모드에 언제 들어오나요?
    • @u/fyn_world — 재미있는 점은 아직 안 들어온다는 겁니다. 저도 잘 모르겠습니다. 기대하지는 않습니다.
    • @u/Thomas-Lore — Chat에서 왜 쓰고 싶으신가요? 일반 Sol보다 작아서 배경지식이 적고, 그 밖에는 개선이 없을 가능성이 높습니다.
  • @u/iamaiimpala — 제가 놓친 건가요, 이건 API에만 적용되나요? Codex 사용에도 적용되면 좋겠습니다.
    • @u/LargeLanguageModelo — 저도 같은 질문을 하러 왔습니다.
  • @u/Ok_Barracuda_1161 — 캐시 입력 요금 인하의 출처가 있나요? 여기에도 API 요금 문서에도 안 보입니다. 여전히 90%로 보입니다.
  • @u/br_k_nt_eth — 코딩이 아닌 사용 사례에는 어떤 영향을 주거나 개선을 가져오나요?
    • @u/ShittyFrogMeme — 저희는 프로덕션 기능에 OpenAI 모델을 씁니다. 프롬프트 캐싱은 모델을 고를 때 가장 중요한 고려 사항 중 하나입니다. TTL 연장, 캐싱 대시보드, 캐시를 깨뜨리지 않고 사용 가능한 도구를 바꾸는 기능은 큰 도움이 됩니다. 전에는 대시보드를 직접 만들어야 했는데, 이제 공식 도구가 생겼습니다. 프롬프트 캐싱에서 OpenAI는 큰 우위를 점하고 있으며, 이 점은 저희가 모델을 선택하는 이유이기도 합니다. 이번 변경은 반갑고, 작은 스타트업인 저희에게 연간 수백만 달러를 아껴 줍니다.
  • @u/Aranthos-Faroth — 캐시 대시보드 정말 멋집니다. 좋네요.
  • @u/rgb328 — 20x는 아직 쓸 수 없는데 Astra 법률 서비스, 새 모델 시리즈, 가격 인하로 수요가 늘어나는 상황에서 연산 자원을 어떻게 마련하는 건가요? 그런데 20x를 위한 연산 자원은 없나요?
    • @u/vplatt — 아마 아직 확장 중일 겁니다. 출시했다고 해서 문제에 대비하지도 않고 모든 인프라에 한꺼번에 적용했을 것 같지는 않습니다. 인프라 대부분은 아직 이전 세대 모델에서 돌아가고, 시간이 지나며 옮길 거라고 봅니다.
  • @u/vplatt — 온갖 논란 속에서도 OpenAI가 이 싸움에서 좋은 쪽처럼 보이는 이유가 뭘까요? 가격을 낮추고 캐싱을 개선하면 가격을 더 낮출 여지도 생깁니다. Claude 팬들은 좀 속고 있는 것 같다는 생각이 듭니다.
  • @u/Morning_Gecko24 — 이상적인 조건이 아닌 환경에서도 캐시 적중률이 유지된다면 에이전트 루프에 꽤 큰 변화입니다. 도구 인자 몇 개만 달라지는 프롬프트를 적중으로 어떻게 계산하는지 궁금합니다. 가격이 바뀌면 팀이 긴 문맥을 더 유지하게 될까요, 아니면 여전히 적극적으로 줄일까요?

원문: OpenAI / 번역·요약: Trawling