AGENT PULSEAI 行业证据与趋势
Star235
2026年7月25日 · SGLang

v0.5.16

发生了什么

SGLang v0.5.16 发布,包含 574 个 PR,来自 169 位贡献者。新特性包括:DSpark 置信度驱动推测解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s(TP8 B300, bs=1);Inkling 多模态 MoE 模型支持(975B 参数,1M 上下文),在 Blackwell 上达到 71.7k tok/s 输入和 171.0 tok/s 每用户解码;新增 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型;UnifiedRadixTree 成为 SWA、Mamba 和 DSA 模型的默认实现。

EVENT STORY

发展脉络

  1. 首次出现v0.5.16SGLang
  2. 行业反馈Ruff v0.16.0Simon Willison
  3. 当前判断SGLang 持续集成多种新模型和优化,反映了开源推理框架对多样化和高效推理支持的重视,可能推动更多模型采用类似优化。Agent Pulse · 分析
改变了什么

SGLang v0.5.16 发布,带来 DSpark 推测解码算法和 Inkling 多模态 MoE 模型支持,显著提升推理性能。

能力边界怎么变了

DSpark 通过置信度驱动的推测解码,动态调整验证窗口,在 DeepSeek-V4-Pro 上实现 383.7 tok/s,表明推测解码在大型模型上的效率提升。Inkling 模型结合滑动窗口、全注意力和 Mamba2 线性注意力,并引入 NVFP4 MoE,展示了混合架构在长上下文多模态任务中的潜力。

为什么重要

SGLang 持续集成多种新模型和优化,反映了开源推理框架对多样化和高效推理支持的重视,可能推动更多模型采用类似优化。

对谁有影响

SGLang 作为开源推理引擎,通过支持新模型和优化,降低了部署先进模型的成本,可能吸引更多开发者采用,增强其在推理框架市场的竞争力。

接下来观察

可验证下一信号:DSpark 算法在其他模型上的性能报告,或 Inkling 模型在更多硬件上的基准测试。