Hugging Face

autotrust/GEV-26B-Decide-NVFP4

GEV-26B-Decide의 NVFP4 양자화 체크포인트

AutoTrust가 GEV-26B-Decide의 라우팅 전문가 MLP 3,840개를 NVFP4로 양자화한 체크포인트를 공개했습니다. 가중치 용량은 49.5GB에서 18GB로 줄고 vLLM 기준 GPU 메모리는 51.1GiB에서 17.1GiB로 감소합니다. GPQA Diamond와 HLE 결과 차이는 실행 간 변동 범위 안에 있다고 설명합니다.

AI 요약

AutoTrust가 공개한 저장소는 GEV-26B-Decide의 라우팅 전문가 MLP만 NVFP4로 양자화한 체크포인트입니다. 30개 레이어에 있는 전문가 128개씩, 총 3,840개 MLP가 대상입니다. 어텐션, 각 레이어의 dense MLP, 라우터, 비전 타워, lm_head, System 1 어댑터, 결정 헤드와 온도값은 bf16 상태로 유지합니다. 양자화 적용 범위를 전문가에 한정해 System 1 어댑터를 다시 학습할 필요가 없습니다.

메모리와 평가 결과

가중치 다운로드 용량은 bf16 모델의 49.5GB에서 18GB로 줄었습니다. vLLM에서 가중치에 필요한 GPU 메모리도 51.1GiB에서 17.1GiB로 66% 감소합니다. 작성자는 24GB GPU에서 짧은 컨텍스트로 모델 전체를 실행할 수 있고, 32GB RTX 5090이나 48GB 카드에서는 더 긴 컨텍스트 또는 동시 요청을 고려할 수 있다고 안내합니다. 실제 메모리 설정은 카드에 맞춰 --gpu-memory-utilization과 MAX_MODEL_LEN을 조정해야 합니다.

비교 표의 GPQA Diamond 점수는 bf16 43.9%, NVFP4 44.9%입니다. HLE 객관식 점수는 각각 8.4%, 9.7%입니다. 다만 두 평가 모두 실행 간 변동이 약 ±7%포인트인 198개 문항 기준이므로, 작성자는 차이가 실행 간 잡음 범위에 있다고 설명합니다. 전체 Decision Index 평가는 bf16 모델로 진행했으며, NVFP4 비교는 GPQA Diamond와 HLE 두 항목에 한정됩니다. NVFP4 전문가에서 Adaptive thinking을 사용한 성능은 다시 평가하지 않았습니다.

양자화 방식과 실행 환경

NVFP4는 4비트 부동소수점 형식입니다. 16개 값마다 FP8 E4M3 스케일을 적용하고, 텐서마다 FP32 스케일을 둡니다. 전문가별 gate·up·down projection을 양자화하며, vLLM에서 gate와 up을 결합하므로 두 projection은 텐서 스케일을 공유합니다. 전문가 활성화 스케일은 GEV의 System 1 보정 분할에서 뽑은 프롬프트 3,072개로 보정했습니다.

체크포인트는 NVIDIA ModelOpt NVFP4 레이아웃을 사용합니다. 작성자는 nvidia/Gemma-4-26B-A4B-NVFP4와 같은 제외 목록을 적용했으며, vLLM이 설정 파일에서 양자화 방식을 읽으므로 별도 플래그 없이 로드한다고 설명합니다. B200에서 테스트한 경로는 SM100의 네이티브 W4A4이며 FlashInfer TRT-LLM NVFP4 MoE 커널을 사용합니다. RTX PRO 6000, RTX 5090, DGX Spark용 SM12x 경로와 H100·H200·A100용 Marlin W4A16 경로는 이 저장소에서 테스트하지 않았습니다.

내려받기와 실행

Hugging Face CLI로 hf download autotrust/GEV-26B-Decide-NVFP4 --local-dir GEV-26B-Decide-NVFP4를 실행한 뒤 MODEL_DIR=GEV-26B-Decide-NVFP4 bash GEV-26B-Decide-NVFP4/serve.sh로 서버를 시작합니다. 서버는 vLLM을 사용하며 기본 주소는 포트 8000입니다. 이 모델의 vLLM 구성에는 Gemma-4 지원 빌드와 Gemma-4의 tied lm_head에 LoRA를 적용하는 패치가 필요합니다. 저장소는 System 1 결정 API와 기본 모델의 System 2 추론을 함께 제공하지만, 양자화 저장소에서 새로 비교한 성능 수치는 GPQA Diamond와 HLE에 한정됩니다.

원문: Hugging Face / 번역·요약: Trawling