AGENT PULSEAI 行业证据与趋势
Star235
2026年8月19日 · LMDeploy

v0.16.0

发生了什么

LMDeploy 发布 v0.16.0,新增支持 Interns2 mobius、GLM-5.2、Intern-S2-Mobius meta-MoE、MoE gate v2、CP attention 修复、TurboMind ViT(InternVL 和 Qwen VL 模型)、Hy3、MTP 和 FP8 优化;改进包括 SM90 原生 BF16/FP8 GEMM kernels、fused-SiLU 量化、SSM prefix caching 优化、guided-decoding 异步 D2H 拷贝和 xgrammar v0.2.1、Gluon blocked FP8 GEMM for Hopper、opt-in torch.compile for decode CUDA graphs。OpenAI Agents SDK for JavaScript 发布 v0.16.1,新增模型调用超时、run-scoped sandbox 工作目录、Docker sandbox 禁用网络、Modal sandbox 资源选项。

EVENT STORY

发展脉络

  1. 首次出现v0.16.1OpenAI Agents SDK for JavaScript
  2. 行业反馈v0.16.0LMDeploy Releases
  3. 当前判断开源推理框架与 Agent SDK 同步迭代,反映行业对推理性能与 Agent 沙箱安全性的双重关注。Agent Pulse · 分析
改变了什么

LMDeploy v0.16.0 和 OpenAI Agents SDK for JavaScript v0.16.1 分别发布,前者聚焦模型支持与推理性能优化,后者增强 sandbox 与超时控制。

能力边界怎么变了

LMDeploy 的 FP8 优化(SM90 原生 kernels、Gluon blocked FP8 GEMM)和 torch.compile 支持表明推理栈正针对 Hopper 架构深度优化,可能提升高吞吐场景效率。

为什么重要

开源推理框架与 Agent SDK 同步迭代,反映行业对推理性能与 Agent 沙箱安全性的双重关注。

对谁有影响

LMDeploy 的 FP8 优化可能降低部署成本,OpenAI Agents SDK 的 sandbox 功能增强企业级 Agent 安全性,两者均利于商业化落地。

接下来观察

后续可观察 LMDeploy 对 GLM-5.2 和 Intern-S2-Mobius 的推理性能基准,以及 OpenAI Agents SDK 的 sandbox 网络隔离在安全场景的采用。