Reddit

Lemonade fixes AMD APU model streaming, drops OpenMOSS ROCm as ~40x slower than Vulkan

Lemonade, AMD APU 모델 스트리밍 수정 — Vulkan보다 약 40배 느린 OpenMOSS ROCm 지원 중단

Lemonade 2026.40 RC는 AMD APU에서 스트리밍 모델을 실행할 때 고정 vRAM 할당량 대신 GTT 풀을 기준으로 메모리를 확인하도록 수정합니다. 같은 하드웨어에서 Vulkan보다 약 40배 느린 OpenMOSS ROCm 백엔드는 성능 문제가 해결될 때까지 지원을 중단합니다.

AI 요약

Lemonade 2026.40 릴리스 후보(RC)는 AMD 내장 GPU(APU)의 모델 스트리밍 지원을 손봅니다. 기존에는 스트리밍 모델 실행에 필요한 메모리를 계산할 때 APU가 주소 지정할 수 있는 GTT 풀 대신 고정 vRAM 할당 구간을 확인했습니다. 이 때문에 메모리가 충분한 AMD Ryzen AI Max(Strix Halo)에서도 DeepSeek-V4-Flash-IQ2XXS-DS4 같은 모델이 실행되지 않는 문제가 있었습니다.

OpenMOSS ROCm 백엔드 지원 중단

Windows와 Linux에서 OpenMOSS의 ROCm 백엔드를 제거합니다. 같은 하드웨어에서 해당 백엔드의 성능이 Vulkan 백엔드보다 약 40배 느린 결과가 나왔습니다. 기사에 따르면 OpenMOSS ROCm 코드 경로에서 CPU 폴백이 일부 발생한 것으로 보이며, 성능 격차의 원인으로 지목됐습니다. 제대로 수정될 때까지 ROCm 지원을 중단합니다.

그 밖의 변경

이번 RC에는 JetBrains Junie용 새 런치 에이전트도 추가됩니다. 앞서 나온 Lemonade 2026.39.1은 vRAM 자동 퇴출 설정 기능과 소규모 변경 사항을 포함합니다. 이 버전은 연도와 주차를 사용하는 새 버전 체계의 첫 안정판입니다.

원문: Phoronix / 번역·요약: Trawling