AGENT PULSEAI Industry Evidence & Trends
Star235
Aug 19, 2026 · LMDeploy

v0.16.0

What Happened

LMDeploy 发布 v0.16.0,新增支持 Interns2 mobius、GLM-5.2、Intern-S2-Mobius meta-MoE、MoE gate v2、CP attention 修复、TurboMind ViT(InternVL 和 Qwen VL 模型)、Hy3、MTP 和 FP8 优化;改进包括 SM90 原生 BF16/FP8 GEMM kernels、fused-SiLU 量化、SSM prefix caching 优化、guided-decoding 异步 D2H 拷贝和 xgrammar v0.2.1、Gluon blocked FP8 GEMM for Hopper、opt-in torch.compile for decode CUDA graphs。OpenAI Agents SDK for JavaScript 发布 v0.16.1,新增模型调用超时、run-scoped sandbox 工作目录、Docker sandbox 禁用网络、Modal sandbox 资源选项。

EVENT STORY

Development

  1. First Reportv0.16.1OpenAI Agents SDK for JavaScript
  2. Industry Responsev0.16.0LMDeploy Releases
  3. Current Assessment开源推理框架与 Agent SDK 同步迭代,反映行业对推理性能与 Agent 沙箱安全性的双重关注。Agent Pulse · analysis
What Changed

LMDeploy v0.16.0 和 OpenAI Agents SDK for JavaScript v0.16.1 分别发布,前者聚焦模型支持与推理性能优化,后者增强 sandbox 与超时控制。

How the Capability Boundary Shifted

LMDeploy 的 FP8 优化(SM90 原生 kernels、Gluon blocked FP8 GEMM)和 torch.compile 支持表明推理栈正针对 Hopper 架构深度优化,可能提升高吞吐场景效率。

Why It Matters

开源推理框架与 Agent SDK 同步迭代,反映行业对推理性能与 Agent 沙箱安全性的双重关注。

Who It Affects

LMDeploy 的 FP8 优化可能降低部署成本,OpenAI Agents SDK 的 sandbox 功能增强企业级 Agent 安全性,两者均利于商业化落地。

What to Watch Next

后续可观察 LMDeploy 对 GLM-5.2 和 Intern-S2-Mobius 的推理性能基准,以及 OpenAI Agents SDK 的 sandbox 网络隔离在安全场景的采用。