nvidia/NVIDIA-Nemotron-Labs-3-Competitive-Coding-550B-A55B-NVFP4 · Hugging Face
NVIDIA, 경시 프로그래밍 특화 Nemotron 모델 공개
NVIDIA가 경시 프로그래밍과 알고리즘 문제 풀이에 맞춘 550B 파라미터 모델 Nemotron-Labs-3-Competitive-Coding을 공개했습니다. GLM-5.2가 만든 추론 데이터로 한 차례 미세조정하고 GenCorrect를 결합해 IOI 2026 실전 평가에서 535.4점을 기록했지만, 이 성적은 모델 단독이 아니라 반복 생성·평가 절차를 함께 적용한 결과입니다.
- 주제
AI 요약
NVIDIA가 Nemotron-3-Ultra-550B-A55B를 경시 프로그래밍에 맞게 미세조정한 Nemotron-Labs-3-Competitive-Coding을 공개했습니다. 총 550B 파라미터 중 추론 시 활성화되는 파라미터는 55B이며, 최대 262,144토큰 문맥을 지원합니다. 일반 대화나 범용 코딩 에이전트보다 알고리즘 문제 풀이, 코드 추론 연구, 벤치마크 평가에 초점을 맞춘 모델입니다.
학습 데이터와 방법
모델은 GLM-5.2가 생성한 추론 기록 477,642개를 이용해 한 차례 지도 미세조정(SFT)을 거쳤습니다. 데이터는 대회 문제 22,000개를 바탕으로 하며, 16개 지역·국제 경시 프로그래밍 대회 문제를 포함합니다. 어려운 문제에 더 많은 생성 결과를 배정했고, 모델이 앞서 만든 풀이를 다시 다듬는 자기 개선 기록도 넣었습니다. NVIDIA는 이 교사 모델이 DeepSeek-V4-Flash 기반 변형보다 정확도가 높고 생성 길이는 약 30% 짧아 교사로 선정했다고 설명합니다.
학습은 AdamW를 사용했고 전역 배치 크기는 64, 최고 학습률은 1.5×10⁻⁵입니다. 최대 패킹 시퀀스 길이는 262,144토큰이며, 128대의 NVIDIA GB300-288GB GPU에서 텐서 병렬화 8로 학습했습니다. 체크포인트에는 추가 강화학습이나 별도 증류 단계를 적용하지 않았습니다.
GenCorrect와 평가 결과
평가에서 모델은 GenCorrect라는 추론 시점 연산 전략과 함께 사용됐습니다. 여러 풀이 후보를 생성한 뒤 토큰 셰어링(token-shingle) 다양성에 따라 대표 후보를 추립니다. 후보를 평가기에 제출하고, 하위 문제별 점수와 서로 보완되는 기준 풀이를 다음 생성 라운드에 반영합니다. 정해진 제출 예산 안에서 후보 생성과 평가를 반복하는 폐쇄 루프 방식입니다. 따라서 보고된 점수는 단일 응답 모델의 성능과 구분해 봐야 합니다.
공개된 결과는 IOI 2025에서 GenCorrect 5라운드 적용 시 600점 만점에 502.0점, ICPC 2025에서 12문제 중 9.6문제 해결입니다. LiveCodeBench Pro의 Pass@1은 74.5%입니다. IOI 2026에서는 대회 시간·인터넷 접근·제출 제한을 따르는 실전 사전 평가에서 535.4점을 기록했습니다. 금메달 기준인 361.12점과 최고 인간 참가자의 498.27점을 넘겼지만, 단 한 번의 실험이며 공식 IOI 순위 결과는 아닙니다. IOI 2025는 개발 벤치마크로 활용됐습니다.
추론 성능과 배포
실전 배포에서는 NVFP4로 양자화하고 FP8 KV 캐시를 사용했으며, prefix caching은 끄고 MTP(Multi-Token Prediction)는 5로 설정했습니다. NVIDIA가 제시한 처리량은 GPU당 초당 736.8토큰이며, IOI 2025 Score@1은 52.8%였습니다. 비양자화 BF16 기준은 GPU당 초당 199.1토큰, Score@1은 59.4%였습니다. 점수 일부를 감수하고 속도를 높여 GenCorrect가 대회 시간 안에 큰 후보 묶음을 처리하도록 한 구성입니다.
배포는 vLLM과 CUDA 기반 NVIDIA GPU 환경을 전제로 하며, 모델 카드는 Blackwell GB300을 대상으로 한 설정을 제공합니다. 라이선스는 OpenMDW License Agreement 1.1입니다. 모델 카드도 범용 채팅이나 생산용 코딩 보조 도구가 아니라 코드 추론 및 추론 시점 연산 연구용으로 안내하며, 실제 적용 전에는 용도에 맞는 평가와 안전장치가 필요하다고 명시합니다.
Reddit 반응
- @u/coder543 — 모델을 한 번만 학습해 얼마나 개선할 수 있는지 도전받았다면 무엇을 하겠습니까? 이보다 더 잘할 수 있습니까? 여기 사람들은 NVIDIA가 이 모델을 자기들에게 팔려는 것처럼 말합니다. NVIDIA는 그러려는 게 아닙니다. 분명한 연구 프로젝트입니다. 이런 연구가 흥미롭지 않다면 그냥 지나가면 됩니다. NVIDIA가 이 모델을 다음에 쓸 모델이라고 주장하는 곳은 어디에도 없습니다. 에이전트 코딩이 아니라 경시 프로그래밍과 수학이라는 아주 구체적인 분야에 특화됐습니다. NVIDIA가 자기 모델을 써야 한다고 주장할 때는 Nemotron 4가 나올 겁니다. 이건 그저 연구용 결과물입니다.
- @u/Charming_Support726 — 맞습니다. 연구를 위한 NVIDIA의 기여입니다. 학습 데이터와 방법론이 커뮤니티에 더 중요하기도 합니다. Fable을 1060에서 돌릴 방법을 찾는 전형적인 Reddit 사용자는 대상 독자가 아닙니다.
- @u/FoxiPanda — https://huggingface.co/nvidia/Nemotron-4-340B-Instruct 말씀이신가요? 농담으로 하는 말이지만 NVIDIA의 Nemotron 버전 이름은 좀 엉망이네요.
- @u/coder543 — 네… 이름을 정말 못 짓습니다. 3년 전 원조 Nemotron 3도 잊지 마세요. https://huggingface.co/nvidia/nemotron-3-8b-chat-4k-rlhf 지금 Nemotron 3와는 관련이 없습니다.
- @u/fastheadcrab — 좋은 발견입니다, OP. NVIDIA가 가까운 시일 안에 Kimi K3 같은 모델도 증류해보길 바랍니다.
- @u/Nota_ReAlperson — Qwen 3.5 397B와 거의 비슷한 수준인데, 이쪽은 훨씬 크고 활성 파라미터도 더 많으며 몇 달 늦었습니다. 연구 프로젝트로는 흥미롭습니다. 오픈 웨이트만이 아니라 오픈 소스이기도 합니다. 다만 현재 최고 오픈 웨이트 모델보다는 조금 뒤처지는 것 같습니다. NVIDIA가 기초 모델만 학습한다고 생각했는데 후처리 학습을 했다는 점은 흥미롭습니다.
- @u/AsianPotatos — GenCorrect와 다른 기법을 시연하는 데 더 가까운 것 같습니다.
- @u/arcanemachined — 이 모델의 전체 학습 파이프라인도 공개됐나요?
- @u/unknown-one — 새 Super 120B가 필요합니다.
- @u/jacek2023 — https://github.com/ggml-org/llama.cpp/pull/25444 아시나요?
- @u/geldonyetich — 제 메모리에 넣을 수 있는 것보다 파라미터가 네 배쯤 많네요. 약 10.5개월 뒤에 봅시다.
- @u/XiRw — 경시 프로그래밍과 NVIDIA라는 말을 한데 쓰면 안 됩니다. 전반적으로 좋은 모델이긴 하지만, 저는 Qwen 3.6이 Nemotron 3 Ultra보다 좋은 결과를 내게 했습니다.
- @u/AriyaSavaka — 긴 이름의 모델이 다시 나와서 좋네요.
- @u/Ok_Warning2146 — Terminal Bench v4 점수를 기다립니다.
- @u/ExcuseAccomplished97 — 코딩 면접에서 부정행위하기 좋은 모델이 또 나온 건가요? /s
- @u/mountainyoo — 좋긴 한데, 무엇과 비교하면 되나요?
- @u/Boogertard — 또 다른 NemoTrash네요! 어서 주가를 20% 더 올려주세요!
원문: Hugging Face / 번역·요약: Trawling