Lemonade fixes AMD APU model streaming, drops OpenMOSS ROCm as ~40x slower than Vulkan
Lemonade, AMD APU 모델 스트리밍 수정 — Vulkan보다 약 40배 느린 OpenMOSS ROCm 지원 중단
Lemonade 2026.40 RC는 AMD APU에서 스트리밍 모델을 실행할 때 고정 vRAM 할당량 대신 GTT 풀을 기준으로 메모리를 확인하도록 수정합니다. 같은 하드웨어에서 Vulkan보다 약 40배 느린 OpenMOSS ROCm 백엔드는 성능 문제가 해결될 때까지 지원을 중단합니다.
- 주제
AI 요약
Lemonade 2026.40 릴리스 후보(RC)는 AMD 내장 GPU(APU)의 모델 스트리밍 지원을 손봅니다. 기존에는 스트리밍 모델 실행에 필요한 메모리를 계산할 때 APU가 주소 지정할 수 있는 GTT 풀 대신 고정 vRAM 할당 구간을 확인했습니다. 이 때문에 메모리가 충분한 AMD Ryzen AI Max(Strix Halo)에서도 DeepSeek-V4-Flash-IQ2XXS-DS4 같은 모델이 실행되지 않는 문제가 있었습니다.
OpenMOSS ROCm 백엔드 지원 중단
Windows와 Linux에서 OpenMOSS의 ROCm 백엔드를 제거합니다. 같은 하드웨어에서 해당 백엔드의 성능이 Vulkan 백엔드보다 약 40배 느린 결과가 나왔습니다. 기사에 따르면 OpenMOSS ROCm 코드 경로에서 CPU 폴백이 일부 발생한 것으로 보이며, 성능 격차의 원인으로 지목됐습니다. 제대로 수정될 때까지 ROCm 지원을 중단합니다.
그 밖의 변경
이번 RC에는 JetBrains Junie용 새 런치 에이전트도 추가됩니다. 앞서 나온 Lemonade 2026.39.1은 vRAM 자동 퇴출 설정 기능과 소규모 변경 사항을 포함합니다. 이 버전은 연도와 주차를 사용하는 새 버전 체계의 첫 안정판입니다.
원문: Phoronix / 번역·요약: Trawling