Milliseconds.ai — Fast AI decisions on text and images, via one API
Milliseconds.ai — 텍스트와 이미지로 빠른 AI 판단을 내리는 단일 API
Milliseconds.ai는 텍스트와 이미지를 받아 라벨, 구조화된 필드, 분류·라우팅 결정을 반환하는 API입니다. 소형 모델 decision-machine-1을 사용하며 입력 토큰 100만 개당 $0.04, 출력 토큰 무료 정책을 제공합니다.
- 주제
AI 요약
Milliseconds.ai는 긴 문장을 생성하기보다 애플리케이션에 바로 넣을 짧은 판단을 빠르게 반환하는 API로 소개됩니다. 텍스트나 이미지를 보내면 라벨, 카테고리, 구조화된 필드와 결정을 돌려줍니다. 예시로 이메일을 담당 팀에 배정하기, 송장에서 청구서 번호·공급업체·총액 추출하기, 반품 요청이 정책에 맞는지 판정하기, 이미지가 핫도그인지 확인하기를 제시합니다.
API와 가격
서비스의 중심 모델은 decision-machine-1입니다. 분류, 정보 추출, 정책 판단을 한 API에서 처리하며 TypeScript와 Python SDK, CLI를 함께 제공합니다. 입력 토큰 100만 개당 가격은 $0.04이고 출력 토큰은 무료입니다. 테스트 키에는 매달 1억 2,500만 개의 입력 토큰을 무료로 제공하며 카드 등록도 요구하지 않습니다.
CloudRaker 제품에서 분리한 소형 모델 API
Milliseconds.ai는 CloudRaker의 Paperwork API에서 쓰던 기능을 독립 API로 분리한 서비스입니다. Paperwork API는 문서를 파싱하고 분류하며, 필드를 추출하고, 원문과 대조해 명세를 확인하는 플랫폼입니다. 팀은 수개월 동안 이 제품 안에서 소형 모델을 사용해 왔습니다.
개발팀은 자체 오픈 웨이트 Vision Language model인 rakedoc-nano가 ParseBench benchmark에서 Fable 바로 뒤인 VLM 2위를 기록하고 있다고 설명합니다. 이후 TypeSafe AI가 Jev를 출시하면서 같은 기능을 독립적으로 원하는 개발자가 많다는 점을 확인했고, 기존 문서 처리용 기능을 별도 서비스로 제공하기로 했습니다.
출시 과정과 인프라
독립 API를 실제로 공개하는 데 걸린 시간은 이틀입니다. 모델, 인증, 결제 시스템이 이미 있었기 때문에 새로 만든 부분은 요청 처리 경로였습니다. 기존 인프라가 모델 추론보다 더 오래 걸리는 문제가 있어 요청 경로를 다시 구성했습니다. 서비스는 CloudRaker가 이미 운영하던 인프라에서 실행되며, SOC-2 Type 2 인증을 충족한다고 설명합니다. 자체 추론 환경을 운영하므로 까다로운 컴플라이언스와 엔터프라이즈 요구에도 대응할 수 있다고 덧붙입니다.
제품이 겨냥하는 작업
이 API는 이메일 분류, 송장 필드 추출, 반품 정책 확인처럼 결과가 짧고 정해진 작업에 맞습니다. 결과를 if문, 데이터베이스 필드, 라우팅 규칙에 바로 넣는 흐름을 전제로 합니다. 팀은 부트스트랩 방식으로 회사를 운영하고 있으며, 먼저 자체 제품에 필요해 만든 도구를 외부 개발자에게 공개했다고 설명합니다.
Product Hunt 반응
- @baptistelaget — 헌터 여러분, 안녕하세요. 오늘 milliseconds.ai를 출시합니다. 텍스트와 이미지로 빠른 AI 판단을 내리는 단일 API입니다. 저희는 작은 답이 필요한 소프트웨어를 만드는 데 많은 시간을 씁니다. 이 이메일을 어느 팀에 보낼지, 송장 번호·공급업체·총액이 무엇인지, 반품 요청이 정책에 맞는지, 핫도그인지 판단하는 작업입니다. 마지막 항목도 중요한 엔터프라이즈 업무입니다. 이런 답은 보통 if문, 데이터베이스 필드, 라우팅 규칙으로 들어갑니다. 그런데 ‘Certainly!’로 시작하는 긴 문단은 이런 작업에 놀랄 만큼 도움이 되지 않습니다.
저희는 수개월 동안 CloudRaker의 Paperwork API 안에서 소형 모델을 사용해 왔습니다. Paperwork API는 문서를 파싱하고 분류하며, 필드를 추출하고, 원문과 대조해 명세를 확인하는 플랫폼입니다. 저희의 오픈 웨이트 Vision Language model인 rakedoc-nano는 여전히 ParseBench benchmark에서 VLM 중 2위를 기록하고 있으며, 바로 앞에는 Fable이 있습니다.
저희는 이 기능들이 더 큰 무언가의 구성 요소라고 늘 생각했습니다. 그러다 TypeSafe AI가 Jev를 출시했습니다. 이 출시를 놓쳤을 가능성은 0%라고 생각하지만요. 그 출시 덕분에 이런 기능을 자기 제품 안에서 쓰고 싶어 하는 개발자가 얼마나 많은지 알게 됐습니다. 저희는 문서 처리에 사용하던 기능을 개발자들이 애플리케이션 전반에서 쓸 수 있도록 milliseconds.ai라는 집을 마련했습니다.
독립 API를 공개하는 데는 이틀이 걸렸습니다. 모델, 인증, 결제 시스템은 이미 있었습니다. 인프라가 추론 자체보다 오래 걸리지 않도록 요청 처리 경로를 다시 만든 작업이 대부분이었습니다.
지금 API로 만들 수 있는 작업은 decision-machine-1을 사용한 분류, 추출, 판단입니다. 텍스트나 이미지를 보내면 애플리케이션에서 사용할 라벨, 구조화된 필드, 결정을 받을 수 있습니다. API, TypeScript·Python SDK, CLI로 시작할 수 있습니다. 가격은 입력 토큰 100만 개당 $0.04이고 출력 토큰은 무료입니다. 테스트 키에는 매달 1억 2,500만 개의 입력 토큰을 무료로 제공하며 카드도 필요하지 않습니다.
기존의 검증된 인프라에서 실행하고 SOC-2 Type 2를 준수합니다. 자체 추론 환경을 운영하므로 가장 까다로운 컴플라이언스와 엔터프라이즈 요구에도 대응할 수 있습니다. 저희는 작은 부트스트랩 팀이며, 직접 필요해서 만든 도구에서 이 서비스가 자랐습니다. 여러분이 어디에 활용할지 보고 싶습니다.
현재 애플리케이션에서 카테고리, 필드, 참·거짓 판단 하나를 얻으려고 LLM을 기다리고 있나요? 그 사용 사례를 알려 주세요. 기술, 재구축 과정, 비용 구조에 관한 질문에도 답하겠습니다.
- @german_merlo1 — 🙌🏻 🙌🏻 🙌🏻 🙌🏻 🙌🏻 축하합니다, Baptiste!
- @baptistelaget — 감사합니다, @german_merlo1 🎉
- @zeng — 정말 멋진 제품입니다!
- @baptistelaget — 감사합니다, @zeng. 응원해 주셔서 고맙습니다!
- @galdayan — 가격 책정 방식이 눈에 들어왔습니다. 출력 토큰이 무료이고 입력 토큰에만 비용을 내는 방식은 classify·route·decide 용도에 잘 맞습니다. 핵심은 긴 문단이 아니라 짧은 라벨을 돌려받는 것이니까요. 저희도 통화 중에 라우팅할지, 에스컬레이션할지, 계속 진행할지를 실시간으로 판단해야 하는 비슷한 문제가 있습니다. 이런 상황에서는 큰 모델의 지연 시간만으로도 그 순간을 놓칠 수 있어서 소형 모델이라는 접근이 중요합니다. decision-machine-1을 직접 호스팅하거나 엣지에서 실행할 수 있나요? 1초 미만의 제약이 있는 경우에 현재는 API로만 제공하나요?
원문: Product Hunt / 번역·요약: Trawling