Ember-1
Ember-1 — Kimi K3의 답변 품질을 유지하며 토큰 사용량을 줄인 모델
Fireworks Research가 Kimi K3를 바탕으로 불필요한 추론을 줄인 Ember-1을 공개했습니다. 벤치마크와 두 고객의 실제 코딩 트래픽에서 품질을 유지하면서 작업당 토큰을 약 35~50% 절감했다고 밝혔습니다. 모델 가중치 공개 여부와 비용·품질 검증 범위는 토론에서 쟁점이 됐습니다.
- 주제
AI 요약
Fireworks Research가 Kimi K3를 바탕으로 Ember-1을 만들었습니다. 목표는 추론 강도를 낮춰 품질을 희생하는 대신, 학습을 통해 불필요한 추론을 줄이는 것입니다. Fireworks는 공개 벤치마크, 고객 두 곳의 실제 코딩 트래픽 A/B 테스트, 사내 업무에서 품질이 유지됐다고 설명합니다. Ember-1은 Serverless에서 Research Preview로 제공하며, 약 2주간 공개한 뒤 커뮤니티 수요에 따라 계속 제공할지 결정합니다.
추론 토큰을 줄이는 학습
Fireworks는 자동 코딩을 대규모로 운영할 때 Kimi K3의 긴 추론 기록이 비용 부담이라고 들었습니다. 추론 강도 설정을 낮추면 품질이 크게 떨어졌고, 토큰을 줄이면서 품질을 지키려면 모델 자체가 더 효율적으로 추론하도록 학습해야 했습니다. 팀은 50회가 넘는 학습 실험과 200회 이상의 평가를 진행하고, 정확도를 유지하면서 추론 길이를 줄이는 학습 알고리즘을 개발했다고 밝혔습니다. 실험은 GPU를 미리 마련하거나 관리할 필요가 없는 Fireworks Serverless Training에서 수행했습니다.
추론 모델은 생성 토큰의 상당 부분을 답변이 아니라 내부 추론에 씁니다. Fireworks는 Kimi K3의 경우 그 비중이 때로 90%를 넘는다고 설명합니다. 에이전트 작업에서는 이전 추론 기록이 다음 요청의 문맥에 반복해서 들어갑니다. 요청이 이어질수록 문맥이 대략 제곱에 비례해 커지므로, 초기에 생성한 긴 추론이 다음 호출마다 다시 읽히고 비용에도 반영됩니다.
모든 추론을 없애는 것이 목표는 아닙니다. 가정을 다시 살피거나 피드백을 반영하고, 결과를 앞선 결정과 연결하는 자기 성찰은 오류를 바로잡는 데 도움이 됩니다. 학습에서는 수학, 코딩, 지시 이행, 대화, 검색, 도구 사용, 소프트웨어 엔지니어링을 다뤘습니다. 단일 과제와 여러 차례 상호작용하는 과제를 함께 사용하고, 환경에서 얻은 피드백으로 다음 행동을 계획하도록 했습니다. Fireworks는 실패한 시도에서도 길고 비생산적인 추론을 억제한다고 덧붙였습니다.
벤치마크와 실제 트래픽 결과
Fireworks에 따르면 공개 벤치마크 7종과 고객 2곳의 운영 트래픽에서 Kimi K3의 추론을 35~50% 줄여도 정확도 하락이 없었습니다. Doximity의 의사 검증 벤치마크인 Bedside Bench에서는 공개·폐쇄 모델을 포함해 작업당 비용과 성능을 비교했으며, Ember-1이 새로운 파레토 프런티어를 형성했다고 주장했습니다. 비용은 Kimi K3의 공개 API 요금인 입력 토큰 100만 개당 3달러, 캐시 입력 0.30달러, 출력 15달러를 기준으로 계산했습니다.
세부 비교표에는 Terminal Bench 2.1, SWE-bench Verified, SWE-Interact, DeepSWE 1.1, τ-2 Bench Airline 결과가 실렸습니다. 예를 들어 SWE-bench Verified에서 Kimi K3 최대 추론 설정은 93.2%, Ember-1은 92.2%를 기록했고, Ember-1은 K3 최대 설정보다 비용을 15.5%, 68.1달러 줄였다고 표기했습니다. DeepSWE 1.1에서는 K3 최대 설정 66.4%, Ember-1 75.2%였으며 비용은 23.7%, 126.9달러 감소했습니다. Fireworks는 표본이 50개를 넘는 벤치마크에서 Ember-1이 K3 최대 설정과 비슷한 품질을 더 낮은 비용으로 내거나 K3 낮은 추론 설정을 앞섰다고 설명합니다.
고객 두 곳의 실제 코딩 작업에서도 작업당 토큰을 약 35% 줄였고, 작업 완료율과 성공 점수, 실패율 등 후속 지표는 유지되거나 개선됐다고 밝혔습니다. 한 고객은 테스트 뒤 Ember-1을 운영에 투입했고, 기본 모델을 대체하도록 확대할 계획입니다. 한 사례의 비교 수치로는 Kimi K3의 점수 0.751, 23.8단계, 출력 토큰 49.3K에 비해 Ember-1은 점수 0.753, 21.4단계, 출력 토큰 29.9K였습니다. 추론 토큰은 71.3%, 전체 토큰은 39% 줄었습니다. 사내 코딩 업무에서도 개발자들이 모델 변경을 알아채지 못한 채 토큰을 덜 썼다는 것이 Fireworks의 설명입니다.
제공 방식과 논쟁거리
Ember-1은 Fireworks의 자체 모델이며, Kimi K3와 함께 Serverless에서 제공됩니다. Fireworks는 Ember-1 맞춤 학습 지원도 시작해 기업이 자체 데이터와 작업에 맞춘 토큰 효율 모델을 만들 수 있다고 밝혔습니다. 다만 글은 학습 절차를 폭넓게 설명하면서도 구체적인 알고리즘과 재현에 필요한 세부 사항은 거의 공개하지 않았습니다. 댓글에서는 모델 가중치를 공개하지 않는 점과 Kimi K3 라이선스의 범위, Fireworks가 고객 데이터를 학습에 쓰지 않는다는 설명에 대한 신뢰도 문제도 제기됐습니다.
Hacker News 반응
- @andsoitis — 추론 모델은 생각을 너무 많이 합니다. 분석 마비는 인간의 지능뿐 아니라 다른 지능도 억누릅니다.
- @AraneaDev — 그렇다면 선택의 역설도 적용될지 궁금해집니다. 선택지가 많을수록 고른 결과에 만족하기 어려워집니다.
- @minimaxir — 일부 중국 모델은 생각 기록에 답변 전체를 먼저 출력하고, 사용자에게도 같은 답을 다시 내놓습니다. 중복입니다.
- @monkey_monkey — 글에서 파레토 프런티어를 충분히 언급하지 않은 것 같습니다. 요즘 AI 글마다 이 말이 나오는데, 제가 전에는 못 알아챘던 건가요?
- @AnodicElegy — ‘가격 대비 성능이 좋다’는 말은 너무 구어체라고 생각했나 봅니다.
- @swiftcoder — 이 분야에서 구어체를 다시 썼으면 좋겠습니다. 얼마 전까지만 해도 기술 업계 사람 대부분은 누가 ‘파레토 프런티어’를 말하면 어리둥절했을 겁니다.
- @user43928 — 처음 듣는 벤치마크에서 파레토 프런티어라니요. Kimi K3가 추론 토큰을 덜 쓰게 된 것만으로는 별로 흥미롭지 않습니다. 원래 Kimi K3보다 라이선스가 덜 개방적이라면 더 그렇습니다.
- @tomrod — 잘 만들었고 좋은 개선입니다. 파레토 프런티어가 무엇을 뜻하는지 더 분명히 설명해야 합니다. 벤치마크는 이야기의 절반만 보여줍니다. 토큰을 줄이면서 어떤 능력이 떨어졌는지 알고 싶습니다. 예를 들어 전에는 Go를 아주 잘했는데 이제는 못하게 된 식의 차이가 있었나요?
- @drob518 — 그런 차이를 차트로 만들기는 어렵습니다.
- @intothemild — 그러니까 공개 가중치 모델로 학습한 다음 가중치는 공개하지 않는다는 말이군요. 제가 제대로 읽었나요?
- @netvarun — 엄밀히 말하면 Kimi K3의 가중치 라이선스는 오픈 웨이트가 아닙니다. 제한이 많아서 BSL이나 FSL 같은 ‘소스 공개’ 라이선스에 비슷한 ‘가중치 공개’로 분류하겠습니다.
- @Evidlo — ‘가중치 공개’입니다.
- @kingstnap — 글을 읽어도 실질적인 정보가 거의 없습니다. ‘작업과 환경 피드백’, ‘온폴리시 계획과 학습’, ‘피드백이 결정과 결과를 연결한다’는 표현은 실제로 무엇을 했는지 말하지 않으면서 투자자를 현혹하기 딱 좋습니다. Cursor Composer 2.5 글은 온폴리시 자기 증류를 설명했는데, 그게 진짜 유용한 정보였습니다.
- @qeternity — 이건 분명 좋습니다. 하지만 요즘 주된 추론 비용인 에이전트 코딩에서는 디코드보다 프리필 비용이 더 큽니다. DeepSeek가 프리필과 캐시를 공격적으로 최적화하는 이유 중 하나입니다.
- @riquito — 작업당 비용 차트는 유용하면서도 낯설게 느껴집니다. 1달러로 90%를 달성하는 모델과 2달러로 95%를 달성하는 모델 중 무엇이 낫나요? 마지막 10%나 5%를 얻는 데 비용이 얼마나 드는지가 중요합니다. 결국 100%까지 드는 비용이 중요하지만, 90%짜리 해법이 나머지를 채우는 데 더 많은 비용을 요구할 수도 있습니다.
- @swiftcoder — 자기 업무 영역에서 마지막 5%가 중요한지 아는 게 중요합니다. 일상적인 소프트웨어 개발에서는 그렇지 않은 경우가 많아 저렴한 모델을 잘 활용할 수 있습니다. 반면 새로운 연구에서는 마지막 5%에 드는 비용을 감수할 만합니다.
- @tangled — Fireworks는 여러 클라우드 사업자 사이에서 용량을 조정하고, 대량 구매로 가격을 낮추며, 운영 비용을 줄이는 추론 제공업체라고 생각했습니다. 그런데 금방 뒤처질 모델을 만드는 데 왜 비용을 쓰는지 모르겠습니다. 고객과 채용을 위한 광고인가요, 아니면 선두권을 계속 노리나요?
- @danielmarkbruce — 목표는 돈을 버는 것입니다. 기존 추론 모델을 후처리해 같은 결과를 더 적은 추론 토큰으로 내면 비용이 줄어듭니다. 체계적으로 할 수 있는지, 다른 회사보다 잘할 수 있는지는 불분명합니다. 마케팅일 수도 있지만, 전략 자체가 터무니없지는 않습니다.
- @k__ — 수직 통합입니다.
- @soerxpso — 토큰을 절반 쓰더라도 토큰당 가격이 두 배라면 왜 관심을 가져야 하나요?
- @bigmadshoe — 작업당 토큰 수를 신경 쓰기 때문입니다. 자동차 연료 가격만 보고 연비를 무시하는 것과 같습니다.
- @verdverm — 같은 가격이라고 봅니다. Fireworks의 Kimi K3와 Ember-1 가격은 입력 3달러, 캐시 입력 0.30달러, 출력 15달러로 같습니다. 월요일에 Ember-1을 써 보고 연비가 좋아진 걸 느끼길 바랍니다.
- @tukHelix — Fireworks가 모델 연구팀을 운영한다는 걸 이번에 처음 알았습니다. 오픈 웨이트 모델을 제공하는 업체라서 고객 데이터를 학습에 쓰지 않을 거라고 생각해 DeepSeek V4 Flash를 맡겼는데, 이제는 다시 생각하게 됩니다.
- @bradfa — 서비스 약관과 이 글을 읽어 보면 우려가 해소될 것 같습니다.
- @noodletheworld — 별로 관련 없어 보입니다. ‘학습에 쓰지 않는다’는 말을 믿으라는 것뿐입니다. 이 글은 결국 광고입니다. 기업용 자체 데이터 학습 지원을 시작한다고 홍보하잖아요.
원문: Fireworks Research / 번역·요약: Trawling