tokens too cheap to meter
토큰 가격이 계량하기도 어려울 만큼 낮아지고 있습니다
기계학습 추론 비용이 하드웨어·소프트웨어·모델 개선으로 빠르게 낮아지고 있으며, 작업당 비용은 토큰 단가보다 더 큰 폭으로 줄고 있다고 분석합니다. 글쓴이는 모델이 도구보다 저렴해지면 소프트웨어에 지능을 내장하는 사례가 늘고, 값싼 지능이 개발과 산업의 선택지를 바꿀 수 있다고 전망합니다.
- 주제
AI 요약
기계학습 모델을 쓰는 비용은 해마다 몇 자릿수씩 떨어지고 있습니다. 글쓴이는 향후 1~2년 안에 대규모 언어 모델(LLM)이 제품을 넘어 컴퓨팅 인프라 곳곳에 들어가고, 3~6년 뒤에는 보급형 하드웨어에서도 지금의 최상급 모델에 가까운 성능을 낼 가능성을 제시합니다. 앞으로 AI 활용을 제한하는 요인은 토큰 수보다 모델 품질과 접근성이 될 것이라는 전망입니다.
토큰 가격보다 작업당 비용을 봐야 합니다
모델은 보통 입력·출력 토큰 수에 따라 요금을 매기지만, 토큰당 가격이 꾸준히 낮아지는 것은 아닙니다. 특히 최상급 모델은 그렇습니다. 대신 같은 작업을 끝내는 데 드는 비용은 빠르게 줄고 있습니다. 작은 모델은 토큰당 가격이 낮아도 같은 결과를 내려고 더 많은 토큰을 쓰거나 초안을 고쳐야 할 수 있기 때문입니다.
글쓴이가 제시한 2025년 모델 비교에서는 같은 수준의 작업을 수행하는 비용이 연초보다 연말에 낮아졌고, 같은 비용으로 수행하는 작업의 질도 높아졌습니다. 2026년 비교에서는 지능 수준이 비슷한 상태에서 비용이 100분의 1가량으로 줄었다고 설명합니다. 이 비교는 벤치마크 점수와 작업 비용의 파레토 전선에 기반합니다. 점수는 높고 비용은 낮은 모델이 유리하며, 점선 아래 모델은 고려할 이유가 적다는 해석입니다.
비용 하락을 만드는 세 가지 변화
첫째는 하드웨어입니다. GPU의 전력 효율을 로그 그래프로 나타낸 자료에서 직선은 효율의 지수적 증가를 뜻하며, 글쓴이는 약 2년마다 효율이 두 배가 되는 추세를 설명합니다. 둘째는 추론 엔진입니다. 모델을 GPU에서 실행하는 소프트웨어인 vLLM은 2024년 9월 0.5.4 버전에서 2025년 12월 0.11.1 버전으로 바뀌는 동안 서빙 작업의 에너지 효율이 약 40% 개선됐습니다. NVIDIA의 MLPerf 스택은 2.0에서 2.1 사이 최대 50% 효율 향상을 보였고, Intel은 MLPerf 6.0에서 6.1 사이 처리량이 2.4배 늘었다고 발표했습니다. 다만 처리량 증가는 효율과 같은 지표가 아니므로 글쓴이도 직접 비교에는 한계가 있다고 덧붙입니다.
셋째는 모델 구조입니다. 모든 매개변수를 입력마다 계산하는 밀집 모델(Dense)과 달리, 전문가 혼합(Mixture-of-Experts, MoE)은 필요한 전문가 층만 활성화합니다. 글쓴이는 벤치마크 성능을 유지하면서 매개변수 규모를 60억 개에서 8억 개로 줄인 사례를 소개합니다. 다만 MoE 모델도 전문가를 메모리에 올려야 하므로 로컬 실행에서 이점이 제한될 수 있습니다.
메모리 사용량을 줄이는 구조도 소개합니다. 트랜스포머는 입력 내용을 층마다 기억하는 반면, 맘바(Mamba)는 입력의 손실 있는 요약을 기억합니다. 맘바와 트랜스포머를 결합한 모델은 긴 문맥을 처리하는 데 필요한 메모리를 크게 줄입니다. 예를 들어 Nemotron-H-47B는 3~4비트 양자화 상태에서 32GB VRAM으로 100만 토큰 이상을 처리할 수 있습니다. 글쓴이가 비교한 Llama-3.1 60B는 비슷한 품질로 같은 토큰 수를 처리하는 데 거의 120GB가 필요합니다.
분류 전용 모델과 도구의 결합
모든 AI 작업에 문장을 생성하는 LLM이 필요한 것은 아닙니다. TypeSafe AI의 Jev는 텍스트를 생성하지 않고, 미리 정한 선택지에 대한 확률을 출력하는 모델입니다. 셸 명령이 시스템 프롬프트를 위반하거나 파괴적 변경을 일으키는지 묻고 0~100% 확률로 답할 수 있습니다. 가격표에는 입력 토큰 100만 개당 0.042달러, 출력은 무료로 표시돼 있습니다. 회사도 이 가격이 지속 가능한지는 장기적으로 확인해야 한다고 밝혔습니다.
Jev를 활용한 jgrep은 검색어와 의미가 비슷한 텍스트를 찾아 확률을 매깁니다. 글쓴이가 소개한 예에서는 Hacker News 제목 994개를 대상으로 설명 하나를 검색하는 데 4.6초와 0.012달러가 들었습니다. 설명 세 개를 동시에 검색해도 시간은 같았다고 합니다. 오픈 웨이트 모델 Laya는 로컬 실행이 가능하고 미세 조정 후 Jev보다 빠르고 정확할 수 있지만, 직접 설치해야 하고 성능을 끌어내려면 머신러닝 지식이 필요합니다. 입력 문맥도 512바이트로 제한됩니다.
글쓴이는 모델·하드웨어·추론 엔진의 개선을 합쳐 지난 1년 동안 토큰 비용이 약 2.5자릿수 규모로 감소했다고 추정합니다. 모델은 작업당 비용을 약 100분의 1로 줄였고, 하드웨어는 토큰당 에너지 효율을 약 1.3배, 추론 엔진은 약 1.4배 높였다는 계산입니다. 새 구조는 같은 메모리에 넣을 수 있는 토큰을 5배 이상 늘리며, 분류 전용 모델은 비용을 추가로 1~2자릿수 줄일 수 있다고 봅니다.
모델이 도구보다 싸지면
글쓴이는 모델 비용을 도구 실행에 드는 전기 요금과 비교합니다. GPT-5.6 Luna의 토큰 가격을 기준으로 도구 호출 한 번에 1만 토큰을 쓴다고 가정하면 비용은 약 0.3센트입니다. 노트북 전력과 뉴욕·네덜란드의 전기 요금을 바탕으로 계산했을 때 grep은 모델 호출보다 약 4.5자릿수, HTML 파싱은 3.5자릿수, cargo build는 1.5자릿수 저렴합니다. 다만 이 계산은 대략적인 추정이며, 서버 소프트웨어는 처리량에 맞춰 튜닝하므로 전력을 더 쓸 수 있다고 설명합니다.
모델이 도구보다 저렴해지면 도구 안에 모델을 넣는 선택지가 생깁니다. 글쓴이는 머신러닝을 활용하는 적응형 빌드 스케줄러를 예로 듭니다. 효율이 높아지면 사용량도 늘어나는 제번스 역설(Jevons Paradox)과 유발 수요(induced demand)도 함께 언급합니다. 토큰 하나가 싸져도 전체 추론 수요가 줄어든다고 단정할 수 없다는 뜻입니다.
값싼 지능이 바꿀 수 있는 일
글쓴이는 토큰 비용이 낮아져도 최상급 모델의 품질에는 여전히 가격이 붙을 것으로 봅니다. 어려운 작업은 프런티어 모델이 맡고, 일반 작업은 오픈 웨이트 모델이나 할인 요금제가 맡는 구도가 가능하다는 전망입니다. 값싼 계산 자원이 늘면 보안 위험이 커지고, GPU 대여와 관리형 서비스 수요가 늘며, 소프트웨어 개발에서 알고리즘보다 요구사항·테스트·사용자 인터페이스가 더 어려운 과제가 될 수 있다고도 씁니다.
소프트웨어를 선택하는 방식도 달라질 수 있습니다. 기존 제품을 쓰거나, 쓰지 않거나, 비슷한 제품으로 바꾸는 선택에 더해 LLM에 필요한 소프트웨어를 만들어 달라고 요청하는 선택이 생겼습니다. 글쓴이는 개인에게 맞춘 소프트웨어를 만들기 쉬워지는 한편, 규제와 전환 비용이 높은 산업에서는 기존 업체가 유리할 수 있다고 덧붙입니다. 다만 앞으로의 사용처와 변화에 대해서는 확신하지 않으며, 값싼 계산 자원뿐 아니라 값싼 지능이 보편화되는 상황을 준비해야 한다고 마무리합니다.
Lobsters 반응
- @mysteriouspants — 모델이 도구보다 싸지면, 도구 실행 비용도 추론 비용과 비슷한 곡선으로 내려가지 않는 이유가 있나요?
- @tuxes — 글쓴이는 grep 대신 jgrep을 쓰는 사례를 듭니다. 텍스트 모음에서 스핑크스 고양이를 찾는다면 정규식으로 검색할 수 있습니다. 하지만 “스핑크스 고양이”, “그 털 없는 고양이들”, “那种没有毛的猫的品种” 같은 표현까지 찾으려면 정규식으로 처리하기가 갑자기 어려워집니다. 파서를 쓰더라도 많은 파싱 작업이 필요합니다. 고양이 품종 책이든 수학 책이든 같은 양의 계산을 해야 합니다. 반면 jgrep은 물리학 논문이나 Lobsters 댓글처럼 검색어와 관련이 낮은 문서에는 계산을 덜 쓰는 방식으로 효율을 얻습니다. 물론 일부 결과를 놓칠 수 있지만, 사용 목적에 따라 정규식이나 파서보다 덜 놓치면서 계산과 에너지를 적게 쓸 수도 있습니다.
- @roflmaoqwerty — 토큰당 가격이 내려간다는 사실은 어떻게 확인하나요? AI 연구소가 하는 말을 그대로 믿는 건가요?
- @tuxes — LLM은 벤치마크로 평가하며, 벤치마크에서는 지능 단위당 비용이 크게 낮아지는 모습을 볼 수 있습니다. 제 경험과도 맞습니다.
- @gulbanana — 이 글이 나온 뒤 미국 LLM 업체에서 가격 대비 성능이 더 개선됐습니다. 새 Claude Opus, GPT Luna, GPT Sol은 업체가 공개한 벤치마크 기준으로 이전 모델보다 저렴하고 성능도 좋습니다. 지금까지는 추세가 이어지고 있습니다.
원문: jyn.dev / 번역·요약: Trawling