Decisions API is in public beta
Decisions API 공개 베타 시작
OpenAI가 텍스트와 이미지를 빠르게 분류하고 점수화하는 Decisions API를 공개 베타로 출시했습니다. 조건의 참일 확률, 고정 선택지 중 하나, 기준에 따른 점수를 반환하며, 입력 토큰당 100만 개에 0.10달러를 받고 출력 토큰 요금은 없습니다.
- 주제
AI 요약
OpenAI의 Decisions API는 텍스트나 이미지 입력에 대해 정해진 형태의 판단을 반환하는 공개 베타 API입니다. Responses API보다 10배 빠르다고 소개하며, 콘텐츠 분류와 요청 라우팅, 업무 우선순위 지정 같은 용도를 제시합니다. 현재 사용할 수 있는 모델은 gpt-6-luna 하나이며, 전용 POST /v1/decisions 엔드포인트를 호출합니다.
요청과 질문 유형
요청은 모델(model), 질문에 공통으로 제공할 입력(input), 평가할 질문 목록(questions)으로 구성합니다. 각 질문에 고유한 이름을 붙이면 응답의 answers 배열에서 결과를 식별할 수 있습니다. 서로 독립적인 질문은 한 요청에 함께 넣어 같은 입력을 평가하고, 앞선 질문 결과에 따라 달라지는 판단은 요청을 나눠야 합니다.
질문 유형은 세 가지입니다. predicate는 ‘제품에 눈에 보이는 손상이 있는가’처럼 조건이 참일 확률을 0~1로 반환합니다. choice는 사용자가 제공한 고정 선택지 중 하나를 고르고 각 선택지의 확률과 confidence를 함께 제공합니다. choice에는 범주마다 값과 적용 설명을 지정하며, 분류에 들어맞지 않는 입력을 처리하도록 other 같은 대체 선택지를 두라고 안내합니다.
score는 심각도처럼 순서가 있는 단계에 입력을 맞춥니다. 단계별 기준을 낮은 순서부터 정의하면 각 단계의 확률과 confidence를 받고, 점수는 단계 인덱스의 확률 가중 평균으로 계산합니다. 단계 인덱스는 0부터 시작하므로 결과가 정수 단계 사이에 놓일 수도 있습니다. 문서의 예시에서는 세 단계 확률이 0.1, 0.7, 0.2일 때 점수가 1.1입니다.
입력과 결과 해석
이미지는 HTTP 또는 HTTPS URL이나 file_id로 전달하지 못합니다. 이미지 데이터를 base64로 인코딩해 data URL로 넣고, 사용자 메시지에서 input_text와 input_image를 함께 전달합니다. 각 질문은 관찰 가능한 기준에 맞춰 작성하고, 서로 다른 관심사를 분리하며, 인접한 점수 단계의 기준도 구별하라고 권합니다.
predicate의 확률은 조건이 참이라는 모델의 추정치입니다. 이를 그대로 정답률로 간주하기보다 실제 애플리케이션의 라벨이 붙은 예시로 임계값을 정해야 합니다. 오탐과 미탐의 비용을 따져 라우팅, 필터링, 검토 기준을 설정하라는 설명입니다. 구조화된 여러 필드나 설명문을 생성할 때는 Responses API의 Structured Outputs를, 도구 호출이 필요할 때는 function calling을 쓰라고 구분합니다.
가격과 제공 조건
gpt-6-luna 입력은 100만 토큰당 0.10달러이며 출력 토큰 요금은 없습니다. 캐시 읽기·쓰기 요금도 없지만, 지역 처리 프리미엄과 긴 컨텍스트 입력 배수가 적용될 수 있습니다. 적격 고객은 Zero Data Retention(ZDR)과 HIPAA 사용을 지원받고, 미국과 유럽(EEA 및 스위스)에서 데이터 상주와 지역 처리를 이용할 수 있습니다. 공개 베타이며 몇 주 안에 정식 출시할 예정이라고 안내합니다.
Hacker News 반응
- @lab14 — Jev와 비교하면 가격은 어떤가요?
- @jerrygenser — 입력 100만 토큰당 0.10달러 대 0.042달러입니다. 둘 다 출력은 무료입니다.
- @mritchie712 — 이미 이미지 입력을 지원하네요. Jev에서 제가 처음 발견한 큰 격차였습니다.
- @simonw — OpenAI가 이런 엔드포인트를 정의하면 다른 제공업체의 사실상 표준이 되는 경우가 많아서, /v1/decisions 엔드포인트가 눈에 띕니다.
- @chupchap — ML 시절의 분류 모델과는 무엇이 다른가요?
- @sethaurus — 완전히 범용적인 모델이라는 설명입니다. 작업마다 분류 모델을 학습하거나 조정하고 선택하는 수고를 줄일 수 있습니다.
- @AM1010101 — 보정은 얼마나 잘 되나요? 90%라면 실제로 열 번 중 아홉 번 맞는다는 뜻인가요? Jev는 이 부분에 상당한 노력을 기울인 것 같은데 Luna가 잘 보정됐는지는 분명하지 않습니다.
- @OutOfHere — 간단한 결정에는 쓸 수 있지만, 실제 문제는 여러 속성과 하위 구조를 포함한 정형 출력이 필요한 경우가 많습니다. 결정을 스무 번 따로 요청하면 스무 결과 사이의 일관성을 잃을 수 있습니다.
- @Topfi — 제 평가에서는 Jev보다 느리고 비쌌으며, 제 작업에서는 성능도 낮았습니다. 다만 사용 사례가 제한적이고 초기 평가라서 다른 사람의 결과도 궁금합니다.
- @brianyu8 — 제 예시를 predicate 질문으로 재현했더니 주택 대출 계산기와 ‘house hunting’ 태그는 두 번 모두 0.99, S&P 500 기사와 ‘investing’ 태그는 두 번 모두 1.0이 나왔습니다. 예상과 다른 요청 사례가 있으면 함께 살펴보겠다고 했습니다.
- @Shank — Jev는 실제 규정 준수 요건을 충족하지 못하지만 OpenAI 모델은 충족합니다. 규정 준수가 필요한 고객은 선택의 여지 없이 OpenAI를 고를 수 있습니다.
- @mikeryan — 캔의 찌그러짐을 알아내는 용도라면 제조 품질 관리가 있습니다. 자동화 도구로 찌그러진 캔을 생산 라인에서 걸러냅니다.
- @agentdev001 — gpt-6-luna 기반이라 입력 창이 100만 토큰이고 이미지도 받는다고 합니다. 제 테스트에서는 종단 간 지연 시간이 160~175ms였고, 최악의 5%는 285ms였습니다.
원문: OpenAI / 번역·요약: Trawling