Reddit

Swift 1.5 27b: Swift Qwen just got faster

Swift 1.5 27B: 더 빠르고 짧게 추론하는 Swift Qwen

Swift 1.5은 Qwen3.8-27B를 바탕으로 에이전트·코딩 작업 성능을 높이고, 추론 토큰을 줄였다고 소개한 모델입니다. BF16 원본부터 GGUF, MLX, AWQ·GPTQ, FP8·NVFP4 등 다양한 변형이 공개됐으며, Reddit에서는 추론 속도와 양자화에 따른 품질, 라이선스가 화제가 됐습니다.

AI 요약

Swift 1.5은 Qwen3.8-27B를 기반으로 만든 모델입니다. 제작자는 Swift 1.0보다 에이전트 작업과 코딩 작업에서 성능이 강해졌고, 답변 과정에 쓰는 추론 토큰은 줄었다고 설명합니다. BF16 가중치와 여러 양자화 버전을 함께 공개했습니다.

배포 형식

Hugging Face 컬렉션에는 BF16 원본과 llama.cpp·LM Studio·Ollama용 GGUF가 올라와 있습니다. Apple Silicon용 3·4·5비트 MLX 버전도 제공하며, NVIDIA용 NVFP4·FP8과 vLLM용 AWQ·GPTQ, AMD GPU용 FP8 버전도 포함합니다. 일부 버전은 비전 입력을 지원하고, 3비트 MLX 버전은 텍스트 전용입니다. NVFP4를 기본 지원하려면 Blackwell GPU가 필요하다고 안내합니다.

Reddit 반응

  • @u/sleight42 — 생각을 덜 망설이고 디코딩도 빨라져서, 응답이 짧아지는 효과까지 합치면 큰 이득입니다. 벤치마크를 조금 돌려 봤는데, 3090에서 4XS로 초당 약 55토큰을 얻었습니다.
    • @u/andreasntr — 낮은 컨텍스트 길이에서는 디코딩 속도가 약간 더 빠른 걸 확인했습니다. 단일 AMD 7900 XTX를 사용합니다.
    • @u/Miserable-Dare5090 — 모델이 각 요청에서 올바른 판단을 하려면 추론이 중요하다는 점은 알고 있나요? 추론은 메모장 같은 역할을 합니다. 실제 생각은 아닙니다.
    • @u/mailto_devnull — 벤치마크 결과를 보면 그렇지 않습니다. 모델이 생각하는 과정은 중요하고 실제로 도움이 됩니다. 다만 자신을 덜 의심할 뿐입니다. 나머지는 낭비되는 토큰입니다.
  • @u/silenceimpaired — 또 Apache 2나 MIT가 아니라 자체 라이선스군요.
    • @u/putrasherni — 일반적인 사용에는 지장이 없습니다.
  • @u/sToeTer — IQ3_XXS, MTP 없는 버전을 시험했습니다. 12GB VRAM에서 모델 전체를 올릴 수 있었고, 4070 Super에서 초당 약 15토큰이 나왔습니다. 하지만 세밀하고 모호하지 않은 코딩 계획을 수행하게 했더니 실수가 많았고, 이를 고치는 동안 실수를 더 만들었습니다. 10GB 버전과 일반 Unsloth Q4_K_S 사이의 품질 차이가 컸습니다.
  • @u/N34257 — FP8, R9700 두 장, vllm-radiance와 DFlash2 조합으로 코드 생성에서 프리필 초당 5,100토큰, 디코딩 초당 130토큰 이상을 얻었습니다. 생각이 간결해져서 작업이 거의 대화형으로 느껴집니다.
    • @u/N34257 — magiccodingman의 vllm-radiance 빌드와 realderpz의 FP8 Swift 1.5 양자화를 쓰고 DFlash2를 켰습니다. Threadripper 3세대 시스템이라 PCIe 대역폭이 넉넉합니다. x8/x8 연결과 설정을 바꾸지 않은 카드라면 프리필 초당 4,000토큰, 생성 초당 110~115토큰 정도를 예상합니다.
  • @u/jinnyjuice — 이 모델은 일반 27B 모델에 Sharp 채팅 템플릿을 적용한 것과 무엇이 다른가요?
    • @u/luckyj — Sharp 템플릿은 시스템 프롬프트에 간결하게 답하라는 지시를 넣는 것 같습니다. Swift와 Thinkingcap은 과도한 생각을 유발하는 가중치를 실제로 조정한 듯합니다. 물론 그보다 복잡하겠지만 제가 이해한 내용은 그렇습니다.

원문: Hugging Face / 번역·요약: Trawling