b10635
llama.cpp 发布 b10635 版本,为 MoE 在 sm_60 上解除 mmq 阻塞,并为 dp4a 和旧版 cuda 复制 mmq-config-pascal,同时降低非 dp4a pascal 上 Q2_K、Q4_K、Q5_K、Q6_K 的占用。该版本提供多种平台构建,包括 macOS、Linux、Windows、Android 等。
发展脉络
- 首次出现b10635llama.cpp
- 当前判断llama.cpp 持续维护多平台构建,包括 CPU、Vulkan、ROCm、OpenVINO、SYCL 等,显示开源推理生态对多样硬件和操作系统的广泛支持。Agent Pulse · 分析
llama.cpp 发布 b10635 版本,主要针对旧 GPU 架构(Pascal)优化 MoE 模型的矩阵乘法量化(mmq),并降低特定量化级别的占用。
该版本针对 sm_60(Pascal 架构)解除 MoE 的 mmq 阻塞,并针对 dp4a 和旧版 cuda 复制配置,表明开发者正在扩展对旧硬件的支持。降低非 dp4a Pascal 上 Q2_K、Q4_K、Q5_K、Q6_K 的占用,可能提升旧 GPU 上的推理性能。
llama.cpp 持续维护多平台构建,包括 CPU、Vulkan、ROCm、OpenVINO、SYCL 等,显示开源推理生态对多样硬件和操作系统的广泛支持。
该更新可能提升旧 GPU 用户的推理体验,扩大 llama.cpp 的用户基础,但商业价值有限。
未来可能继续优化旧 GPU 架构上的 MoE 推理,并可能扩展对更多量化级别的支持。可关注后续版本是否进一步改善 Pascal 架构的性能。