Hugging Face

Aleph-Alpha/Kolibri-1

Aleph Alpha, 독일어·영어 특화 MoE 추론 모델 Kolibri 1 공개

Aleph Alpha가 독일어와 영어에 특화한 78B 매개변수 Mixture-of-Experts 모델 Kolibri 1을 공개했습니다. 토큰마다 활성화되는 매개변수는 3.46B이며, 최대 1M 토큰 문맥과 추론 모드, 도구 호출을 지원합니다.

AI 요약

Aleph Alpha가 독일어와 영어를 중심으로 학습한 오픈 웨이트 모델 Kolibri 1을 공개했습니다. 78.1B 매개변수 Mixture-of-Experts(MoE) 구조지만 토큰당 활성 매개변수는 3.46B입니다. 회사는 적은 추론 연산량으로 긴 문서 처리와 에이전트형 도구 사용을 지원하도록 설계했다고 설명합니다. 가중치는 Apache 2.0 라이선스로 공개했으며, 모델 카드에는 학습 방식과 데이터 구성, 평가 결과, 실행 방법을 함께 기록했습니다.

구조와 긴 문맥

모델은 50개 층으로 구성되며, MoE 층마다 공유 전문가 1개와 라우팅 전문가 384개를 둡니다. 토큰마다 라우팅 전문가 6개를 선택합니다. 주의(attention)는 sliding-window와 전체 문맥을 보는 GQA를 4:1 비율로 섞습니다. Sliding-window 층은 현재 토큰과 앞선 512개 토큰을 살핍니다. 위치 인코딩은 이 층에만 적용해, 위치 스케일링 없이 문맥 길이를 늘릴 수 있도록 했습니다.

학습 단계별 시퀀스 길이는 사전 학습 16,384토큰, 중간 학습 65,536토큰, 긴 문맥 확장 262,144토큰입니다. 품질과 서빙 효율을 1,048,576토큰까지 검증했지만, 지연 시간과 처리량이 중요하거나 복잡한 작업에는 262,144토큰 이하를 권장합니다. 모델 전체를 메모리에 올려야 하므로 FP8 가중치 기준 메모리 사용량은 약 78GB입니다. 최소 구성은 A100 80GB 두 장 또는 H100 SXM5 두 장 등이며, 권장 구성은 H100 SXM5 두 장, H200 두 장, B200 한 장 또는 B300 한 장입니다.

학습 데이터와 비용

사전 학습에는 영어 약 62.5%, 독일어 약 23.9%, 코드 약 13.6%로 구성된 20T 토큰의 데이터가 쓰였습니다. 이후 3.44T 토큰으로 중간 학습을 진행하고, 201B 토큰을 사용해 긴 문맥에 맞췄습니다. 데이터에는 선별한 웹 문서와 고품질 자료, 합성 재작성·번역 데이터가 포함됩니다. 데이터 정제 과정에서는 URL 및 휴리스틱 필터링, 중복 제거, 품질 분류, 개인정보 제거를 수행했다고 밝혔습니다.

독일어 형태와 합성어 처리를 고려해 128,000개 어휘의 UniBPE 토크나이저도 개발했습니다. 모델 카드에 따르면 독일어는 바이트당 4.7토큰, 영어는 4.2토큰 수준으로 처리합니다. 사전 학습은 NVIDIA B200 768장으로 21일간 진행했고, 중간 학습에는 5일, 긴 문맥 학습에는 13시간이 들었습니다. 세 단계 학습의 에너지 사용량 추정치는 데이터센터 효율을 반영해 약 950MWh입니다. 이 추정치는 SFT와 강화학습을 포함하지 않습니다.

사후 학습은 지도 미세 조정(SFT)과 강화학습(RL)으로 나뉩니다. 사용자는 reasoning effort를 none, low, medium, high로 지정할 수 있습니다. 독일어 추론을 위해 번역된 프롬프트와 독일어 답변을 학습했고, 도구 호출·터미널 작업·코드 수정·검색 증강 생성(RAG) 환경도 훈련에 포함했습니다. 답변을 모르는 상황에서 보류하도록 하는 데이터와 학습 환경도 마련했다고 설명합니다.

성능과 서빙

모델 카드의 평가표에서 Kolibri 1은 영어·독일어 종합 점수 75.5와 70.8을 기록합니다. AIME 2025 점수는 영어 96.9, 독일어 87.5이고, LiveCodeBench v6는 85.9입니다. 에이전트 평가에서는 Tau2-Bench Telecom 94.7, TerminalBench 2.1 27.7, SWE-Bench Verified 66.4를 제시합니다. 점수는 각 모델의 문맥 길이와 권장 샘플링 설정을 적용한 평가 결과이며, 에이전트·도구 사용이 불가능하거나 입력이 문맥 한도를 넘으면 해당 모델의 점수를 보고하지 않았다고 덧붙입니다.

서빙에는 Aleph Alpha의 vLLM 플러그인이 포함된 aleph-alpha-inference 패키지가 필요합니다. 실행 시 reasoning parser와 tool-call parser를 지정하고 자동 도구 선택을 켭니다. OpenAI 호환 Chat Completions 요청에서 도구 스키마를 전달할 수 있으며, 추론 모드와 도구 호출을 함께 사용할 수 있습니다. 모델은 사람의 검토를 거치는 보조·업무 흐름을 대상으로 합니다. 회사는 자율적으로 검토 없이 행동하는 시스템이나 고위험 의사결정에 쓰지 말고, 애플리케이션 단계에서 출력 검증과 안전장치를 적용하라고 안내합니다.

원문: Hugging Face / 번역·요약: Trawling