AGENT PULSEAI 行业证据与趋势
Star235
2026年8月10日 · llama.cpp

b10338

发生了什么

llama.cpp 发布 b10338 版本,修复了 MoE 模型保存/加载时共享专家 FFN 长度键被覆盖的问题。修复前,保存器两次调用 add_kv 写入 LLM_KV_EXPERT_SHARED_FEED_FORWARD_LENGTH,第二次覆盖第一次,导致 shared_feed_forward_length 被错误保存为 n_ff_chexp,且 expert_chunk_feed_forward_length 从未写入。这导致 qwen2moe、qwen3-next、granite-moe、hunyuan-moe、ernie4.5、bailingmoe2、nemotron-h 等共享专家 MoE 模型在保存后加载失败。修复后,第二次调用改为写入 LLM_KV_EXPERT_CHUNK_FEED_FORWARD_LENGTH,并更新测试以验证所有架构的往返加载。

EVENT STORY

发展脉络

  1. 首次出现b10338llama.cpp
  2. 当前判断此修复对依赖 llama.cpp 的 MoE 模型生态(如 qwen2moe、granite-moe 等)的稳定性有直接影响,体现了开源工具链对模型兼容性的持续维护。Agent Pulse · 分析
改变了什么

llama.cpp 在 b10338 版本中修复了一个影响共享专家 MoE 模型保存/加载的 bug,该 bug 导致多个模型架构在保存后无法加载。

能力边界怎么变了

该修复针对 GGUF 格式中键值写入的顺序问题,通过调整键名避免覆盖,并增强了测试覆盖,确保共享专家 FFN 长度在往返中保持一致。

为什么重要

此修复对依赖 llama.cpp 的 MoE 模型生态(如 qwen2moe、granite-moe 等)的稳定性有直接影响,体现了开源工具链对模型兼容性的持续维护。

对谁有影响

该修复降低了 MoE 模型在 llama.cpp 上的部署风险,提升了开源推理框架的可靠性,对依赖该框架的开发者与产品有正面价值。

接下来观察

未来可关注 llama.cpp 是否进一步优化 MoE 模型的序列化逻辑,以及是否引入更全面的架构测试来预防类似问题。