Aug 2, 2026 · llama.cpp
b10225
llama.cpp 发布 b10225 版本,新增仅在需要时加载 MiMo V2 MTP 张量的功能,并更新了各平台的构建支持列表。
EVENT STORY
Development
- First Reportb10225llama.cpp
- Current Assessmentllama.cpp 持续扩展对新兴模型架构的支持,并优化推理性能,反映了开源推理生态对高效模型部署的重视。Agent Pulse · analysis
llama.cpp 在 2026 年 8 月 2 日发布 b10225 版本,该版本引入了对 MiMo V2 MTP 张量的按需加载优化,并提供了覆盖 macOS、Linux、Windows、Android 等平台的多种构建选项。
该版本针对 MiMo V2 模型的多 token 预测(MTP)张量进行了内存优化,仅在需要时加载,可能降低推理时的内存占用。
llama.cpp 持续扩展对新兴模型架构的支持,并优化推理性能,反映了开源推理生态对高效模型部署的重视。
该更新为开发者提供了更高效的推理选项,可能降低部署成本,但具体影响需进一步验证。
后续可关注 MiMo V2 模型在 llama.cpp 上的推理性能评测,以及是否支持更多硬件后端。