2026年8月10日 · llama.cpp
b10336
llama.cpp 发布 b10336 版本,重构了多个 WGSL 文件并简化了 flash_attn 的 WGSL 实现。该版本提供 macOS、iOS、Linux、Android、Windows 和 openEuler 等多个平台的构建产物,其中部分平台(如 macOS Intel、openEuler)被标记为 DISABLED。
EVENT STORY
发展脉络
- 首次出现b10336llama.cpp
- 当前判断llama.cpp 持续迭代其多平台支持,包括对 Vulkan、ROCm、OpenVINO、SYCL 等后端的覆盖,反映了开源推理生态对多样化硬件适配的重视。Agent Pulse · 分析
llama.cpp 在 2026 年 8 月 10 日发布 b10336 版本,主要工作是重构 WGSL 着色器文件并简化 flash_attn 的 WGSL 实现,同时更新了各平台的构建产物列表。
该版本专注于 WGSL 代码重构,可能旨在提升 WebGPU 后端在 flash attention 计算上的性能或可维护性,但证据未提供具体性能数据。
llama.cpp 持续迭代其多平台支持,包括对 Vulkan、ROCm、OpenVINO、SYCL 等后端的覆盖,反映了开源推理生态对多样化硬件适配的重视。
该版本通过简化代码和扩展平台支持,可能降低开发者在不同硬件上部署 llama 模型的成本,但证据未提供直接商业影响。
后续可关注该重构是否带来 WebGPU 后端在推理速度或内存占用上的可量化改进,以及是否影响其他后端的一致性。