autotrust/GLM5.3-Flash-E224-DGX-Spark
DGX Spark용 GLM-5.3-Flash 축소 빌드 — 전문가 224개로 줄이고 NVFP4 적용
GLM-5.3-Flash의 라우팅 전문가를 레이어당 288개에서 224개로 줄이고 전문가 가중치에 NVFP4를 적용한 비공식 모델입니다. 가중치가 141 GiB라 DGX Spark 두 대나 180 GB 이상 Blackwell GPU에서 실행할 수 있으며, 정확도와 성능 측정은 B200에서 이뤄졌습니다.
- 주제
AI 요약
autotrust가 공개한 모델은 zai-org/GLM-5.3-Flash를 바탕으로 만든 비공식 파생 모델입니다. 각 레이어에서 라우팅 전문가 288개 중 224개를 Neural Architecture Search(NAS)로 골라 유지하고, 전문가 가중치에는 NVFP4를 적용했습니다. 토큰마다 활성화하는 파라미터 수는 18B로 유지합니다. 전체 가중치는 151.5 GB, 약 141 GiB입니다. 원본 어휘 154,880개와 비전 타워도 그대로 남겼습니다.
메모리와 하드웨어
가중치 크기 덕분에 모델은 ConnectX-7로 연결한 DGX Spark 두 대에서 실행하도록 설계됐습니다. 노드마다 가중치 약 70.5 GiB를 차지하고, 작성자는 설정에 따라 노드당 약 40 GiB를 KV 캐시와 활성화 메모리에 남길 수 있다고 계산합니다. 128 GB 메모리를 갖춘 DGX Spark 한 대에는 가중치만으로도 들어가지 않습니다. 180 GB 이상 메모리를 갖춘 B200이나 GB200 한 대에서도 구동할 수 있습니다.
DGX Spark의 GB10은 노드당 273 GB/s 메모리 대역폭을 제공합니다. 글은 이 환경의 디코딩이 메모리 대역폭에 묶인다고 설명합니다. 토큰당 읽는 활성 파라미터는 줄지 않지만, 메모리에 상주하는 전문가 수가 줄어 KV 캐시와 배치에 더 많은 공간을 할당할 수 있습니다. 전문가 외에 어텐션, 공유 전문가, 임베딩, 비전 타워는 BF16으로 유지합니다. NVFP4는 16개 원소 단위 그룹과 e4m3 그룹 스케일, fp32 텐서 스케일을 사용합니다.
벤치마크와 검증 범위
정확도와 처리량은 모두 단일 NVIDIA B200에서 측정했습니다. DGX Spark 실기기에서 검증한 결과는 아닙니다. Spark의 메모리 수치도 측정값이 아니라 가중치 크기를 토대로 계산했으며, 실제 Spark 처리량은 B200보다 낮을 것으로 안내합니다. 글에서 제시한 대역폭 비교는 B200 약 8 TB/s, Spark 노드당 273 GB/s입니다.
B200에서 GPQA-Diamond는 reasoning_effort=max, 163,840토큰 예산으로 90.9%(180/198)를 기록했습니다. AIME 2025 pass@1은 같은 수준의 최대 추론 예산에서 88.3%(106/120)였고, 30문제 중 29문제를 네 번의 샘플 가운데 한 번 이상 풀었습니다. HumanEval은 샘플링에서 98.2%, greedy decoding에서 95.7%였습니다. C-Eval은 84.0%, 이미지가 포함된 MMMU는 73.6%입니다. GPQA-Diamond와 AIME 결과는 비교 대상으로 삼은 RedHatAI NVFP4 모델과 비슷한 수준이지만, 모든 수치는 단일 실행이라 글은 ±2~3%포인트 정도의 변동을 고려하라고 안내합니다. GPQA-Diamond의 낮은 추론 예산에서는 점수가 약 78%로 더 낮고, 최대 예산을 쓸 때 차이가 줄어듭니다.
MTP 추측 디코딩
저장소에는 원본 GLM-5.3-Flash의 MTP(Multi-Token Prediction) 레이어도 수정 없이 포함했습니다. BF16 형식이며 전문가 288개를 모두 담아 17 GB를 차지합니다. vLLM에서 별도 draft 모델로 불러오며, 작성자는 MTP 사용 전후의 정확도 차이가 측정 오차 범위 안이라고 보고합니다.
B200 단일 스트림 측정에서 추측 토큰 두 개를 쓰면 디코딩 속도는 초당 136토큰에서 250토큰으로 올라 1.85배가 됐습니다. 반면 동시 요청 32개에서는 MTP를 켰을 때 전체 처리량이 약 16% 줄고 중앙값 TTFT가 0.8초에서 6.4초로 늘었습니다. draft 가중치가 KV 캐시 공간을 줄이는 영향입니다. 글은 동시 요청이 적은 대화형 사용에는 MTP를 권하고, 높은 동시성의 배치 작업에는 끄도록 안내합니다.
실행 구성
두 Spark를 연결할 때는 ConnectX-7 인터페이스를 지정하고 vLLM의 tensor parallelism 크기를 2로 설정합니다. 안내된 예시는 vLLM 0.30.0 이상, transformers 5.16.1 이상을 요구하며 VLLM_USE_DEEP_GEMM=0 설정을 포함합니다. 163,840토큰 컨텍스트와 동시 요청 8개를 지정한 실행 예시도 제공합니다. MTP를 켜면 노드마다 draft 가중치 약 8.5 GB를 추가로 잡아야 합니다. 연결이 느리거나 불안정하면 tensor parallelism 대신 pipeline parallelism을 시도하는 대안도 설명합니다.
프로젝트는 Z.ai나 NVIDIA가 제작하거나 보증한 모델이 아니며 MIT 라이선스를 따릅니다. 모델 응답에는 부정확하거나 편향되거나 안전하지 않은 내용이 포함될 수 있으므로, 배포 전에 용도에 맞춰 평가하라고 안내합니다.
원문: Hugging Face / 번역·요약: Trawling