Reddit

You can just merge Qwen3.6 & 3.8 27B to get decent performance with much fewer token generation

Qwen3.6과 3.8 27B를 병합해 토큰 생성을 줄인 모델

JetBrains가 Qwen3.6-27B와 Qwen3.8-27B의 체크포인트를 50대 50으로 보간한 파생 모델을 공개했습니다. 추가 학습이나 미세조정은 하지 않았으며, 100개 코딩 과제 내부 벤치마크의 결과와 토큰 효율을 소개하는 자료를 안내하지만, 모델 카드에는 구체적인 수치가 없습니다.

AI 요약

JetBrains가 Alibaba Cloud의 Qwen 모델을 바탕으로 만든 비공식 파생 모델을 공개했습니다. Qwen3.6-27B와 Qwen3.8-27B의 체크포인트 파라미터를 절반씩 선형 보간했습니다. 추가 학습이나 미세조정, 학습 데이터 사용은 없으며, 체크포인트 병합과 배포 형식 변환·양자화만 진행했습니다.

병합 방식과 배포

계산식은 0.5 × Qwen3.6-27B + 0.5 × Qwen3.8-27B입니다. 보간 과정에서는 float32 누산을 사용했습니다. 설정, 토크나이저, 프로세서, 채팅 템플릿은 Qwen3.8-27B를 유지합니다. 정확한 원본 리비전과 병합 설정은 merge-manifest.json에 기록했습니다.

모델은 BF16, GGUF, MLX 4-bit, MTP MLX 4-bit 형식으로 제공됩니다. Apache License 2.0을 따르며, 원본 Qwen 라이선스와 저작권 표기도 유지합니다. JetBrains는 Alibaba Cloud나 Alibaba Group의 후원·승인을 받은 모델이 아니라고 명시했습니다.

벤치마크와 토큰 효율

모델 카드에는 JetBrains의 100개 내부 코딩 과제에서 완료한 작업 수와 출력 토큰 수를 비교한 결과가 있다고 설명합니다. 다만 구성별 추론 설정이 서로 다르며, 방법론과 맥락은 별도 글에서 확인하도록 안내합니다. 모델 카드에 비교 수치 자체는 제시하지 않아, 이 자료만으로 성능과 토큰 절감 폭을 판단하기는 어렵습니다.

Reddit 반응

  • @u/No-Refrigerator-1672 — 벤치마크가 있나요? 다른 두 미세조정 모델은 방법론을 적용해 토큰을 30~40% 줄이면서 Qwen3.8 벤치마크 결과의 95%를 냈습니다. 제대로 미세조정한 모델 대신 이 병합 모델을 선택할 이유가 뭔가요?
    • @u/somthing_tn — 실제로 벤치마크는 있습니다. 저는 다른 사람들이 이 방식을 어떻게 시험할지 궁금합니다. 가중치를 같은 비율로 병합했을 뿐이고 추가 사후 학습은 없다고 합니다. 0.5, 0.5 비율을 바꾸거나 레이어마다 다른 비율을 적용하면 어떨지도 알고 싶습니다.
  • @u/mailto_devnull — 같은 계열 모델에서 부모 모델의 특성을 물려받는 자식 모델을 만들 수 있다면, 어떤 특성이 더 나은지 살펴볼 새로운 아이디어가 열립니다. 지능과 추론을 조절해 창의성에 영향을 주는 식도 상상할 수 있습니다. 이 모델은 3.6보다 낫고 3.8보다 못하니 사실상 3.7 같네요.
    • @u/PositiveBit01 — 질문은 이미 있는 최선의 모델인 3.8을 두고 왜 이걸 쓰느냐는 뜻으로 이해했습니다. 게시글 작성자는 토큰을 훨씬 적게 쓴다고 했습니다. 조건이 같다면 토큰이 적을수록 빠릅니다. 다만 병합으로 각 모델의 좋은 특성만 골라낼 수 있다고는 생각하지 않습니다. 평균처럼 병합에 맞는 연산을 적용한 뒤 결과를 확인하는 방식입니다.
  • @u/Felladrin — Qwen3.6-27B와 Qwen3.8-27B를 병합한 bigattichouse/QwenMix-3.7도 있습니다. 8월에 만들어졌습니다.
  • @u/Dany0 — 이건 JetBrains의 실수입니다. 같은 작업이 이미 있었고 결과도 더 나빴습니다. 낮은 추론 설정의 병합 모델을 낮은 추론 설정의 Qwen3.8과 비교하지만, Qwen3.8은 낮은 설정보다 중간 설정에서 전체적으로 토큰을 더 많이 씁니다. 낮은 추론 설정은 자동완성이나 코드 일부 수정에 쓰고, 그런 작업은 추론을 아예 끄는 편이 낫습니다.
    • @u/drsupermrcool — 이 한 가지 결과가 별로여도 상관없습니다. 대부분 개발자가 쓰지 않을 수 있다는 점에는 동의합니다. 더 큰 맥락에서 JetBrains는 자체 제품을 만들며 역량을 쌓고 있습니다. 개발자들은 Microsoft 제품과 클라우드 모델을 많이 쓰는데, JetBrains는 IDE에서 로컬 모델을 제공하는 대안을 내놓고 있습니다.
  • @u/Last-Health3222 — 평균 점수는 사라진 동작을 감출 수 있습니다. 저희는 병합을 하진 않았지만 프롬프트 계산량을 줄이는 작은 모델 변경을 했습니다. 검증 손실은 좋아지고 벤치마크 평균은 0.580 대 0.581로 비슷했으며, 32K 패스키 점수도 99%를 유지했습니다. 그런데 긴 프롬프트에서 여덟 개 도구 스키마 중 t5를 호출시키자 점수가 0.97에서 0.27로 떨어졌습니다. 평균 점수에는 아무런 징후도 없었습니다. 병합 결과를 믿기 전에 도구 호출처럼 실제 작업을 시험하세요.
  • @u/jabulari — 응답당 토큰 수인가요, 작업을 해결할 때까지 쓴 토큰 수인가요? 에이전트 코딩에서는 둘이 반대로 움직일 수 있습니다.

원문: JetBrains Hugging Face 모델 카드 / 번역·요약: Trawling