yandex/AliceAI-Foundation-80B-A3B-Base
Yandex AliceAI Foundation 80B-A3B Base 공개 — 토큰당 3B 파라미터를 활성화하는 하이브리드 MoE 모델
Yandex가 전체 80B 파라미터 중 토큰마다 3B만 활성화하는 AliceAI Foundation Base 모델을 공개했습니다. 262,144토큰 컨텍스트를 지원하며 러시아어 사실 지식, 수학, 추론 평가와 Transformers·vLLM 실행법을 함께 제공합니다.
- 주제
AI 요약
Yandex가 하이브리드 attention과 Mixture of Experts(MoE) 구조를 결합한 AliceAI-Foundation-80B-A3B-Base를 공개했습니다. 전체 파라미터는 80B지만 토큰마다 3B만 활성화하며, 최대 262,144토큰 컨텍스트를 지원합니다. 모델은 처음부터 학습했으며, 학습 코퍼스와 아키텍처, 하이퍼파라미터를 새로 구성했습니다. 복잡한 추론과 도구 사용 데이터도 별도로 준비했고, 주요 설계 선택은 각각 2조 토큰 규모의 독립적인 사전 학습으로 검증했습니다.
모델 구조
모델의 hidden size는 2,048, vocabulary size는 129,024이며 48개 레이어를 사용합니다. 전체 구조는 12개 그룹으로 나뉘고, 각 그룹은 KDA(Kernelized Differential Attention)와 MoE 조합 3개 뒤에 Gated Attention과 MoE 조합 1개를 배치합니다. KDA에는 query head 32개와 KV head 32개가 있으며, 각 head 차원은 128이고 convolution kernel size는 4입니다. Gated Attention은 query head 16개, KV head 2개, query head 차원 256으로 구성합니다.
MoE는 512개 expert 중 Top-K 10개와 공통 expert 1개를 선택합니다. Expert의 intermediate dimension은 512이며, MTP(Multi-Token Prediction) 레이어 1개도 포함합니다. 토큰별 활성 파라미터가 3B에 그치므로 80B급 전체 모델보다 추론 시 계산량을 줄이는 설계지만, 실제 메모리 요구량은 전체 가중치와 실행 환경에 좌우됩니다.
벤치마크
제공된 비교표는 모두 내부 평가 인프라에서 vLLM으로 측정했습니다. 첫 번째 표는 t=0 설정을 사용했고, 두 번째 표는 t=1과 repetition_penalty 1, presence_penalty 1.5를 적용했습니다.
러시아어 사실 지식 평가에서 AliceAI는 WikiWebFacts 5-shot 86.5점, HardMultiQA 5-shot 67.9점을 기록했습니다. 비교 대상인 DeepSeek-V4-Flash-Base는 각각 83.2점과 65.4점이었고, Qwen3.5-35B-A3B-Base는 62.4점과 47.2점이었습니다. 반면 영어 사실 지식 평가인 TriviaQA에서는 79.0점으로 GLM-4.5-Air-Base 83.5점, Nemotron-3-Super-120B-A12B-Base 89.8점, DeepSeek-V4-Flash-Base 89.4점보다 낮았습니다.
교육 분야에서는 EduBench Russian 74.2점, Literature 73.8점, History 82.0점, English 76.1점을 기록했습니다. 전문가 지식 평가에서는 Medicine 63.6점, Law의 어려운 세트 49.6점입니다. 수학에서는 MATH-500 91.1점으로 비교 모델 가운데 가장 높았지만, EduBench Math에서는 Qwen3.5가 80.0점으로 AliceAI의 79.3점보다 높았습니다. 프로그래밍 평가에서는 LiveCodeBench v5-6 CoT 1-shot 50.5점, BigCodeBench 48.3점을 기록했습니다. BigCodeBench에서는 DeepSeek 49.1점과 Nemotron 48.8점이 더 높았습니다.
추론 설정을 바꾼 두 번째 표에서는 AIME 2026 pass@32가 96.7점으로 Qwen3.5와 같았고, HMMT 2026 February pass@32는 96.9점으로 Qwen3.5의 87.9점보다 높았습니다. IMO Answerbench pass@8은 88.7점, LiveCodeBench v5-6 pass@1은 60.4점, pass@8은 82.9점입니다. Codeforces CPP pass@8에서는 68.9점으로 Qwen3.5의 73.7점보다 낮았습니다. 128k 컨텍스트 평가에서는 FinQA 74.1점, LongMemEval 64.6점을 기록했습니다. 러시아어 사실 지식과 일부 수학·추론 평가에서 강점을 보이지만, 모든 벤치마크에서 가장 높은 점수를 기록한 모델은 아닙니다.
Transformers와 vLLM 실행
Transformers 실행에는 transformers 5.16.1, accelerate 1.14.0, flash-linear-attention 0.5.0이 필요합니다. GPU에서 KDA 레이어를 처리하려면 KDA를 지원하는 flash-linear-attention이 필요합니다. 모델과 토크나이저를 trust_remote_code=True로 불러오고, 모델 dtype은 bfloat16, device map은 auto로 지정하는 예제를 제공합니다.
vLLM 실행에는 Docker와 NVIDIA Container Toolkit이 필요합니다. 제공된 Docker 예시는 GPU 4장을 사용하고 tensor parallel size를 4로 지정합니다. attention backend는 FLASH_ATTN, FlashAttention 버전은 2로 설정하며 MTP speculative decoding에서 speculative token 1개를 사용합니다. 서버를 실행한 뒤 OpenAI 호환 /v1/completions 엔드포인트로 요청을 보낼 수 있고, 예시 요청은 temperature 0과 max_tokens 32768을 사용합니다. 모든 GPU를 사용하려면 Docker의 GPU 지정값과 tensor parallel size를 환경에 맞게 바꿔야 합니다.
토크나이저와 추가 학습
토크나이저는 tokenizer.model을 사용하는 LlamaTokenizer이며 SentencePiece BPE 방식입니다. [COT_ENABLE], [COT_START], [COT_END]와 도구 호출 표식은 Hugging Face의 special token이 아니라 vocabulary에 들어 있는 일반 atomic token입니다. tokenizer_config.json의 legacy 값은 공백 처리를 맞추기 위해 false로 고정되어 있으므로 true로 덮어쓰지 말아야 합니다.
에이전트 데이터는 OpenAI Messages 형식을 사용합니다. 한 trajectory에는 system, user, assistant, tool, meta 역할을 넣고, 사용 가능한 도구 정의는 tools 필드에 별도로 기록합니다. 학습 전에 chat_template.jinja로 reasoning trace, 도구 설명, 함수 호출과 실행 결과를 텍스트로 렌더링합니다. 이 템플릿은 SFT와 RL 데이터 준비에 쓰도록 제공하지만, base 모델에 하나의 대화 형식을 강제로 적용하지 않기 때문에 tokenizer_config.json의 chat_template로 지정하지 않았습니다.
저장소에는 PEFT 기반 LoRA 추가 학습 예제인 finetune_lora.py도 포함되어 있습니다. 예제는 고정된 tatsu-lab/alpaca 데이터셋 revision을 사용하고 응답 부분만 학습하며 LoRA adapter만 저장합니다. 모델 규모 때문에 FSDP2가 필요하고, 예시는 80GB GPU 4장 구성입니다. --mixed_precision no는 FP32 모델을 뜻하지 않습니다. 기본 가중치는 BF16으로 로드하고 LoRA 파라미터는 PEFT에서 FP32로 관리합니다. RAM 효율 로딩에서는 rank 0만 전체 checkpoint를 읽고, 나머지 프로세스는 meta device에서 모델을 만든 뒤 FSDP2로 shard를 받습니다.
사용 범위
AliceAI-Foundation-80B-A3B-Base는 추가 post-training이나 alignment를 거치지 않은 pretrained base 모델입니다. 연구, 실험, 추가 학습을 주된 용도로 삼으며 사용자 제품과 서비스에 바로 투입하는 완성형 모델로 제공하지 않습니다. production 환경에 적용하려면 시나리오에 맞춘 자체 평가와 추가 학습, 동작 조정, 제어 절차가 필요합니다.
원문: Hugging Face / 번역·요약: Trawling