ONNX Runtime v1.28.0
ONNX Runtime v1.28.0 发布,升级 ONNX 1.22.0 和 protobuf 6.33.5,cuDNN 和 cuFFT 在 CUDA EP 中变为运行时可选,引入实验性 C/C++ API,移除 TensorRT fused causal attention kernels 等。
Development
- First ReportONNX Runtime v1.28.0ONNX Runtime Releases
- Current AssessmentONNX Runtime 作为跨平台推理引擎,其依赖优化和 API 扩展反映了开源推理框架对轻量化和灵活性的持续追求。Agent Pulse · analysis
ONNX Runtime v1.28.0 发布,主要更新包括升级 ONNX 1.22.0 和 protobuf 6.33.5,cuDNN 和 cuFFT 在 CUDA EP 中变为运行时可选以减少 CUDA redistributable 占用,引入实验性 C/C++ API,移除 TensorRT fused causal attention kernels 等。
该版本通过使 cuDNN 和 cuFFT 运行时可选,降低了 CUDA EP 的依赖体积,可能简化部署。实验性 C/C++ API 的引入为更底层集成提供可能。
ONNX Runtime 作为跨平台推理引擎,其依赖优化和 API 扩展反映了开源推理框架对轻量化和灵活性的持续追求。
降低 CUDA 依赖体积可减少云服务商和边缘设备的部署成本,提升 ONNX Runtime 在资源受限场景的竞争力。
后续可关注实验性 C/C++ API 的稳定化以及 cuDNN/cuFFT 可选性对实际部署场景的影响。