Hugging Face

NaiveAI/Naive-N0.5-Flash

Naive-N0.5-Flash — 100만 토큰 문맥을 지원하는 오픈 가중치 MoE 모델

NaiveAI가 코딩과 AI 연구개발을 겨냥한 오픈 가중치 모델 Naive-N0.5-Flash를 공개했습니다. 309B MoE 모델에 희소 어텐션 구조를 적용해 100만 토큰 문맥을 지원하며, 모델 가중치와 추론 코드는 MIT 라이선스로 배포합니다.

AI 요약

NaiveAI가 코딩과 AI 연구개발을 겨냥한 오픈 가중치 모델 Naive-N0.5-Flash를 공개했습니다. MiMo-V2.5를 기반으로 총 309B 파라미터 중 토큰당 15.5B를 활성화하는 Mixture-of-Experts(MoE) 모델입니다. 가장 큰 특징은 전체 어텐션 층 없이 100만 토큰 문맥을 지원하도록 Sliding-Window Attention(SWA)과 DeepSeek Sparse Attention(DSA)을 결합한 구조입니다.

SWA와 DSA를 결합한 어텐션

모델은 48개 Transformer 층으로 구성됩니다. 대부분은 Sliding-Window Attention을 사용하며, 각 토큰에서 앞쪽 128개 토큰만 참조합니다. 긴 문맥에서도 토큰별 디코딩 비용이 문맥 길이에 따라 커지지 않도록 설계한 방식입니다. 나머지 일부 층은 DeepSeek Sparse Attention을 사용해 먼 과거의 정보를 선택적으로 참조합니다.

네트워크는 6개 층짜리 모듈 여덟 개로 구성됩니다. 일반 모듈은 SWA 층 다섯 개 뒤에 DSA 층 하나를 배치합니다. 첫 모듈의 첫 층도 DSA로 바꿔 전체적으로 SWA 39개, DSA 9개를 둡니다. DSA는 경량 인덱서가 전체 기록을 살펴 토큰 점수를 매기고, 실제 어텐션 계산은 선택된 상위 2,048개 토큰에만 수행합니다. 다만 인덱서가 전체 기록을 훑고 전체 KV 캐시도 보유하므로, 과거 토큰을 모두 없애는 방식은 아닙니다. 모델 설명은 이 구조가 어텐션 계산량과 메모리 접근을 줄인다고 밝힙니다.

기존 DSA 구현의 Multi-head Latent Attention(MLA) 대신 Grouped-Query Attention(GQA)을 적용하고 KV 그룹 네 개를 사용합니다. SWA와 DSA 모두 sink bias를 포함합니다. 모델 개발 과정에서는 이 어텐션 구조에 맞추는 작업도 이어 학습의 목표로 삼았습니다.

3.25조 토큰 학습과 추론

Naive-N0.5-Flash는 네이티브 100만 토큰 문맥을 지원하는 상태로 총 3.25조 토큰을 학습했습니다. 구성은 인덱서 워밍업 500억 토큰, 희소 어텐션 학습 3조 토큰, 학습률 감소 단계 2,000억 토큰입니다. 제작진은 이 과정을 통해 새 어텐션 구조에 모델을 적응시키고 코딩 및 AI 연구개발 역량을 높였다고 설명합니다.

추론 시스템 NaiveRT에는 메가 커널 융합, Programmatic Dependent Launch(PDL), 추측 디코딩을 적용했습니다. 제작진이 제시한 속도는 Standard 모드에서 사용자당 초당 50토큰, Ultrafast 모드에서 초당 최대 2,000토큰입니다. 두 수치는 시스템 설명에 담긴 제작진의 주장으로, 게시물 본문에는 측정 환경이나 모드별 비교 수치가 자세히 제시되지 않습니다.

평가와 배포 조건

평가에는 별도 언급이 없는 한 Claude Code 2.1.207을 사용했습니다. 문맥 길이는 100만 토큰, temperature는 1.0, top-p는 0.95로 설정했고, 평가 도구는 기본 파일 입출력과 Bash만 제공했습니다. 여러 벤치마크의 비교 점수는 다른 모델 블로그나 리더보드, 시스템 카드에서 가져왔다고 밝혔습니다. 본문에는 결과 그래프가 언급되지만 구체적인 점수 표는 포함하지 않아, 여기서는 수치 비교를 덧붙이지 않습니다.

가중치와 추론 코드는 MIT 라이선스로 공개합니다. FP8 혼합 정밀도 추론을 지원하며, 사용에는 FP8을 지원하는 NVIDIA GPU가 필요합니다. 모델 가중치 용량은 약 315GB이고 추론을 위해 추가 GPU 메모리도 확보해야 합니다. API도 제공할 예정이며, 가격은 입력 100만 토큰당 0.10달러, 출력 100만 토큰당 0.40달러, 캐시 읽기 100만 토큰당 0.01달러로 안내합니다. 기반 모델 MiMo-V2.5를 공개한 Xiaomi MiMo 팀, DSA를 개발한 DeepSeek 팀, 추론 인프라를 제공한 SGLang 팀에도 감사를 표했습니다.

원문: Hugging Face / 번역·요약: Trawling