Hacker News

Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

RTX 4090 같은 일반 PC에서 Qwen 3.8 Flash Next 125B를 초당 100토큰으로 실행하기

오픈소스 프로젝트 Strata는 Qwen3.8-Flash-Next 125B를 일반 PC에서 실행하도록 추론 엔진과 모델 배치를 구성합니다. RTX 5070에서 양자화 설정에 따라 초당 53~94토큰을 생성했다고 보고하며, 속도뿐 아니라 낮은 정밀도에서 품질이 유지되는지를 두고 커뮤니티 논쟁도 이어졌습니다.

AI 요약

Strata는 대형 언어 모델 Qwen3.8-Flash-Next를 소비자용 PC에서 실행하는 오픈소스 프로젝트입니다. 모델은 보통 수백 GB급 그래픽 메모리가 필요한 125B 매개변수 규모지만, Strata는 그래픽카드 메모리와 시스템 RAM, CPU를 함께 활용해 실행합니다. 프로젝트 설명에 따르면 그래픽카드는 자주 쓰는 전문가(expert)를 보관하고, RAM은 전체 전문가를 담으며, CPU도 계산에 참여합니다. SSD에는 큰 조회 테이블을 둡니다. 모델은 전체 24,576개 전문가 중 토큰마다 10개를 사용한다고 소개합니다. 작은 보조 모델이 다음 토큰을 예측하고 큰 모델이 한꺼번에 검증하는 방식으로, 프로젝트 측은 일반 생성 속도가 1.6~1.8배 빨라진다고 설명합니다.

성능과 하드웨어

프로젝트는 RTX 5070 12GB, Ryzen 5 7600, RAM 64GB 시스템과 Radeon RX 9070 XT 16GB, Ryzen 9 3900X, RAM 47GB 시스템에서 측정한 결과를 공개했습니다. NVIDIA 시스템에서는 Q2_0 설정이 초당 94토큰 생성, 입력 처리 초당 2,650토큰을 기록했습니다. IQ2_XS는 79토큰과 2,090토큰, IQ3_XXS는 62토큰과 1,750토큰, IQ3_S는 53토큰과 1,620토큰입니다. 코딩용 Coder 모델은 55토큰과 2,180토큰을 기록했습니다. AMD 시스템에서는 Q2_0이 60토큰 생성, 1,160토큰 입력 처리였고, IQ2_XS는 52토큰과 1,110토큰, Coder는 44토큰과 1,420토큰이었습니다. 입력 처리 수치는 32K 토큰 프롬프트 기준입니다.

양자화 설정마다 모델 크기와 실행 속도, 품질 사이의 균형이 달라집니다. 프로젝트는 RAM 32GB에는 Coder, 48GB에는 IQ2_XS 또는 Q2_0, 64GB에는 IQ2_XS나 IQ3 계열을 권합니다. 가장 큰 설정은 RAM 96GB 이상을 제시합니다. Coder는 전문가 절반을 제거한 코딩 모델로, 제작자 측 SWE-bench Verified 점수는 전체 모델의 91%라고 안내합니다. 대신 코드 외 작업과 중국어를 포함한 CJK 텍스트 처리에서는 약점이 있다고 설명합니다. 실행에는 VRAM 12GB 이상, 시스템 RAM 32GB 이상, 디스크 여유 공간 약 80GB가 필요합니다. 모델 다운로드 용량은 약 70GB입니다.

설치와 연결

Windows에서는 START-HERE.bat을 실행하고 Linux에서는 ./setup.sh를 실행합니다. 설치 프로그램이 GPU를 확인하고 모델과 컨텍스트 크기, 이미지 입력 여부를 묻습니다. 모델을 내려받아 실행하면 브라우저에서 127.0.0.1:8080으로 대화할 수 있습니다. OpenAI 호환 API 주소는 http://127.0.0.1:8080/v1이며, Anthropic API를 쓰는 앱에는 별도 메시지 경로를 안내합니다. Claude Code, Cursor, Codex 같은 코딩 도구와 연결할 수 있고 MCP 서버를 통해 AI 도구가 Strata를 시작하거나 중지하는 기능도 소개합니다. 기본 설정은 한 번에 요청 하나를 처리하며, 병렬 요청을 늘리면 12GB 카드에서는 각 요청이 느려질 수 있습니다. 긴 대화의 첫 입력은 3만 토큰당 약 1분이 걸린다고 안내합니다.

속도와 품질을 둘러싼 논쟁

Hacker News 댓글에는 RTX 4090에서 초당 124토큰을 얻었다는 사용자가 있는 한편, 낮은 비트 양자화가 실제 작업의 정확도를 떨어뜨릴 수 있다는 지적도 나왔습니다. 일부 사용자는 IQ3 계열이 Qwen 3.8 27B보다 더 나은 결과를 냈다고 했고, 다른 사용자는 설정이나 긴 컨텍스트에서 오탈자와 지시 무시를 경험했다고 밝혔습니다. 한 사용자는 IQ2 설정에서 웹 호출 도구가 잘못된 URL을 반복 생성했지만 IQ3_XXS에서는 문제가 사라졌다고 보고했습니다. 속도 수치만으로 실사용 품질을 판단하기 어렵다는 의견과, 양자화 모델도 실제 코딩 작업에서 경쟁력 있다는 경험담이 함께 제시됐습니다.

재현성을 따지는 댓글도 있었습니다. 한 사용자는 50장 이미지에서 물체 좌표를 찾는 테스트를 진행해 Strata의 중앙 오차가 154.8픽셀, 평균 오차가 168.8픽셀이었다고 보고했습니다. 같은 GGUF와 비전 어댑터를 llama.cpp에서 실행했을 때는 각각 46.5픽셀과 81.4픽셀이었다고 덧붙였습니다. 단일 테스트 결과이므로 일반화하기 어렵지만, Strata가 지원하는 이미지 기능을 별도로 검증해야 한다는 사례입니다.

설치 스크립트를 AI 에이전트에 맡기도록 안내하는 문구에는 보안 우려도 나왔습니다. 댓글에서는 스크립트를 내려받아 검토하는 절차, 의존성을 고정한 패키지 관리, 해시 검증이 각각 논의됐습니다. 설치가 간편하더라도 실행 스크립트와 권한 요구를 확인해야 한다는 점은 로컬 추론 도구를 도입할 때 고려할 사항입니다.

Hacker News 반응

  • @snehesht — 사용해 봤는데 예상보다 훨씬 잘 작동했습니다. 제 컴퓨터는 NVIDIA 4090, DDR5 128GB, Ryzen 7950x3d이고 초당 124토큰이 나옵니다. 공유하려고 댓글을 남깁니다.
    • @proc0 — Qwen 3.8 27B와 비교하면 어떤가요? 하네스를 사용해 증류 모델과 전체 MoE 모델을 비교하고 싶습니다.
    • @geye1234 — 저는 27B가 더 정확하다고 느낍니다. FP8로 실행해서 그런 걸 수도 있습니다. Flash Next는 컨텍스트가 150K쯤 되면 철자를 틀리기 시작하고, 때때로 .md 파일 지시를 무시합니다. 다른 분들도 그런가요?
    • @anon373839 — 그건 정상적인 현상이 아니라고 확인해 드릴 수 있습니다. NVIDIA NVFP4 양자화를 사용하고 있나요? 다른 NVFP4 양자화 모델도 있지만 품질이 같지는 않습니다. 보정 데이터 품질이 정말 중요합니다.
  • @esafak — 양자화 모델의 실효 지능을 계산한 사람이 있나요? 양자화 모델 벤치마크를 공개하는 일이 표준이 되어야 한다고 생각합니다.
    • @nsagent — 최근 논문은 양자화로 인한 성능 저하가 조건에 따라 크게 달라진다고 보고합니다. 4비트는 대체로 성능을 보존하지만 2비트에서는 폭넓은 성능 저하가 나타나는 경우가 많습니다. 이 저장소는 2비트 양자화와 가장 작고 빠른 모델의 전문가 제거를 사용합니다.
  • @quietFalcon — MoE 오프로딩에서 생성 속도는 비교적 쉬운 쪽입니다. 컨텍스트 16K 정도에서 프롬프트 처리는 어느 정도인가요?
    • @merbanan — Q2_0은 RTX 2060 8GB VRAM에서 컨텍스트 128K일 때 생성 초당 33토큰, 프롬프트 처리 초당 약 600토큰입니다. ISTA IQ3_XXS는 생성 초당 약 21토큰, 프롬프트 처리 초당 약 240토큰입니다.
  • @deadbunny — “이 PC에 Strata를 설치해 줘”라는 문구를 보고 나니, bash로 파이프하는 방식이 나쁘다는 생각이 들었습니다.
    • @snehesht — 처음에는 저도 놀랐습니다. 설치 전에 setup.py와 setup.sh 파일을 확인해야 했습니다.
  • @Jackson__ — 간단한 이미지 50장으로 물체의 정확한 좌표를 출력하는 비전 벤치마크를 시험했습니다. Strata는 중앙 오차 154.8픽셀, 평균 오차 168.8픽셀이었습니다. 같은 GGUF와 비전 어댑터를 llama.cpp에서 실행하니 각각 46.5픽셀과 81.4픽셀이었습니다.
  • @Jeeetendra — IQ3_S에서 Q2_0으로 낮추면 실제 코딩 작업에서 품질이 얼마나 떨어지나요?
    • @Luker88 — 하드웨어가 제한돼 표준 llama.cpp와 Unsloth 양자화 모델을 시험했습니다. Q1은 때때로 엉뚱한 결과를 냈고 IQ2에서도 그런 일이 훨씬 드물게나마 있었습니다. 제가 실행할 수 있는 최대 설정인 IQ3_XXS에서는 그런 문제가 더는 없지만, 쓸 수 있는 컨텍스트 창이 줄어듭니다.
  • @lxe — 왜 이런 전문가 캐싱 기능이 기본 llama.cpp에 들어가지 않았나요? 별도의 코드베이스가 필요한 이유가 있나요?
    • @hgoel — 주류 추론 엔진은 이런 기능을 통합하는 속도가 느린 편입니다. 여러 시스템과 모델을 지원하면서 수치 정확성까지 보장하기가 복잡하기 때문입니다.
  • @mrinterweb — RTX 4090 한 장과 DDR4 128GB를 사용합니다. 3토큰 MTP에서 초당 110토큰이 넘게 나옵니다. 컨텍스트 60K/260K로 시험 중입니다. 결과는 Qwen 3.8 Q5 27B와 적어도 비슷한 수준인 것 같습니다.

원문: Hacker News / 번역·요약: Trawling