2026年8月8日 · llama.cpp
b10330
llama.cpp 发布 b10330 版本,新增 CUDA 内核融合 rms_norm、mul、rope 及 view、set_rows 操作,并添加广播权重测试用例,同时检查内存范围。该版本支持多种平台,包括 macOS Apple Silicon、Linux(CPU、Vulkan、ROCm、OpenVINO、SYCL)、Android、Windows(CPU、CUDA、Vulkan、OpenVINO、SYCL、HIP)等。
EVENT STORY
发展脉络
- 首次出现b10330llama.cpp
- 当前判断llama.cpp 作为开源推理引擎,持续优化内核融合,反映了社区对推理性能的极致追求,可能推动边缘设备上的 LLM 部署。Agent Pulse · 分析
llama.cpp 发布 b10330 版本,通过 CUDA 内核融合 rms_norm、mul、rope 等操作,提升推理性能,并扩展了多平台支持。
该版本聚焦于 CUDA 内核融合,将 rms_norm、mul、rope 等操作合并,可能减少内核启动开销和内存访问,从而提升推理效率。同时添加了内存范围检查,可能增强安全性。
llama.cpp 作为开源推理引擎,持续优化内核融合,反映了社区对推理性能的极致追求,可能推动边缘设备上的 LLM 部署。
该优化可能降低推理成本,提升用户体验,增强 llama.cpp 在开源推理引擎中的竞争力,吸引更多开发者和企业采用。
未来可能看到更多针对不同硬件(如 ROCm、Vulkan)的融合优化,以及更广泛的算子融合覆盖,进一步提升推理速度。