최신 글

llama.cpp, 호스트 메모리에 둔 MoE 전문가를 위한 GPU 캐시 추가

Reddit

호스트 메모리에 있는 Mixture of Experts(MoE) 전문가 가중치를 GPU의 LRU 캐시에 보관하고, 캐시 적중 시 GPU에서 계산하는 llama.cpp 변경입니다. VRAM이 부족한 시스템에서 생성 속도가 빨라진 사례가 있지만, 캐시 적중률과 PCIe 대역폭에 따라 오히려 느려지기도 하며 이 PR 구현은 단일 GPU만 지원합니다.