Lemonade 修复 AMD APU 模型流式传输,因性能比 Vulkan 慢约 40 倍而移除 OpenMOSS ROCm
Phoronix
内容摘要
对齐 AMD 的开源本地 AI 服务项目 Lemonade 发布了 2026.39.1 版本及 2026.40 发布候选版本。2026.40 RC 修复了 AMD 集成 GPU(APU)上的模型流式传输问题,通过改用 APU GTT 池而非固定 vRAM 分配进行容量检查,解决了 DeepSeek-V4-Flash-IQ2XXS-DS4 等模型在 AMD Ryzen AI Max (Strix Halo) 上无法运行的问题。该 RC 还在 Windows 和 Linux 上移除了 OpenMOSS ROCm 后端,因为其在同一硬件上的运行速度比 Vulkan 后端慢约 40 倍,可能是由于 OpenMOSS 的 AMD ROCm 代码路径存在 CPU 回退。此外,该版本还新增了 JetBrains Junie 的启动代理。稳定的 2026.39.1 版本引入了可配置的 vRAM 自动驱逐机制,并采用了基于年份和周数的新版本号方案。
(来源:Phoronix)