AGENT PULSEAI Industry Evidence & Trends
Star235
Aug 15, 2026 · Kimi-K3

b10448

What Happened

llama.cpp 发布 b10448 版本,新增 Kimi-K3 文本模型支持。该模型采用混合 KDA(线性)+ MLA(完整)注意力,架构与 Kimi-Linear-48B 类似,但额外包含跨层残差注意力、潜在 MoE、situ 激活、MLA 输出门和全秩 KDA 门。K3 的 text_config 报告为 KimiLinearForCausalLM,因此路由基于顶层名称。KDA 衰减门有两种形式,由 gate_lower_bound 选择,K3 设置为 -5.0。跨层残差使用 ggml_dsv4_hc_pre,仅支持 CPU 和 CUDA。路由专家以 mxfp4-pack-quantized 压缩张量形式提供,与 ggml 的 MXFP4 位兼容。

EVENT STORY

Development

  1. First Reportb10448llama.cpp
  2. Current Assessmentllama.cpp 快速集成 Kimi-K3 表明开源社区对新兴模型架构的响应速度加快,可能推动更多模型采用混合注意力设计。K3 的架构创新可能影响其他模型开发者的设计选择,尤其是在注意力机制和 MoE 的融合方面。Agent Pulse · analysis
What Changed

llama.cpp 在 b10448 版本中新增了对 Kimi-K3 文本模型的支持,该模型采用混合线性注意力与 MLA 的架构,并引入了多项创新组件,如跨层残差注意力、潜在 MoE 和 situ 激活。K3 的 KDA 门控机制通过 gate_lower_bound 参数实现两种形式,且跨层残差操作目前仅支持 CPU 和 CUDA。路由专家使用 MXFP4 量化,与现有格式兼容。

How the Capability Boundary Shifted

Kimi-K3 的架构在 Kimi-Linear-48B 基础上增加了五项特性,表明线性注意力模型正在向更复杂的混合设计演进,可能旨在平衡效率与表达能力。KDA 门的 gate_lower_bound 参数切换激活函数而非简单截断,暗示对衰减行为的精细控制。跨层残差仅支持 CPU/CUDA 可能限制其在部分设备上的部署,但 MXFP4 量化兼容性有助于推理优化。

Why It Matters

llama.cpp 快速集成 Kimi-K3 表明开源社区对新兴模型架构的响应速度加快,可能推动更多模型采用混合注意力设计。K3 的架构创新可能影响其他模型开发者的设计选择,尤其是在注意力机制和 MoE 的融合方面。

Who It Affects

Kimi-K3 的集成可能增强 llama.cpp 对最新模型的支持,吸引更多开发者使用该推理框架,从而巩固其在开源生态中的地位。对于 Kimi 团队,模型的快速适配可能促进其技术生态的扩展和采用。

What to Watch Next

后续可关注 Kimi-K3 在 llama.cpp 中的推理性能评测,以及跨层残差操作对 Metal/Vulkan 的支持进展。此外,KDA 门的两种形式在不同任务上的效果差异值得进一步研究,可能影响未来线性注意力模型的设计。