v0.5.16
SGLang v0.5.16 发布,包含 574 个 PR,来自 169 位贡献者。新特性包括:DSpark 置信度驱动推测解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s(TP8 B300, bs=1);Inkling 多模态 MoE 模型支持(975B 参数,1M 上下文),在 Blackwell 上达到 71.7k tok/s 输入和 171.0 tok/s 每用户解码;新增 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5 等模型;UnifiedRadixTree 成为 SWA、Mamba 和 DSA 模型的默认实现。
Development
- First Reportv0.5.16SGLang
- Industry ResponseRuff v0.16.0Simon Willison
- Current AssessmentSGLang 持续集成多种新模型和优化,反映了开源推理框架对多样化和高效推理支持的重视,可能推动更多模型采用类似优化。Agent Pulse · analysis
SGLang v0.5.16 发布,带来 DSpark 推测解码算法和 Inkling 多模态 MoE 模型支持,显著提升推理性能。
DSpark 通过置信度驱动的推测解码,动态调整验证窗口,在 DeepSeek-V4-Pro 上实现 383.7 tok/s,表明推测解码在大型模型上的效率提升。Inkling 模型结合滑动窗口、全注意力和 Mamba2 线性注意力,并引入 NVFP4 MoE,展示了混合架构在长上下文多模态任务中的潜力。
SGLang 持续集成多种新模型和优化,反映了开源推理框架对多样化和高效推理支持的重视,可能推动更多模型采用类似优化。
SGLang 作为开源推理引擎,通过支持新模型和优化,降低了部署先进模型的成本,可能吸引更多开发者采用,增强其在推理框架市场的竞争力。
可验证下一信号:DSpark 算法在其他模型上的性能报告,或 Inkling 模型在更多硬件上的基准测试。