Aug 12, 2026 · llama.cpp
b10369
llama.cpp 的 b10369 版本为 pocket-tts 添加了支持,将转置卷积实现为 GEMM + col2im,以解决深度可分离上采样导致的图节点过多和内核启动开销问题。CUDA 上每帧生成时间下降 80%,CPU 上下降 50%,输出与先前实现逐样本匹配,相关性为 0.999994,帧数相同。
EVENT STORY
Development
- First Reportb10369llama.cpp
- Current Assessmentllama.cpp 持续优化 TTS 模型推理性能,表明开源社区在边缘设备上部署实时语音合成的能力正在增强。Agent Pulse · analysis
llama.cpp 发布 b10369,优化 pocket-tts 解码器,通过将转置卷积折叠为 GEMM + col2im 形式,显著降低生成时间,同时保持输出一致性。
该优化将深度可分离上采样从逐通道卷积和拼接改为批量矩阵乘法加 col2im,减少了图节点数量,降低了内核启动开销,从而提升推理效率。
llama.cpp 持续优化 TTS 模型推理性能,表明开源社区在边缘设备上部署实时语音合成的能力正在增强。
该优化降低了 TTS 推理的计算成本,可能使实时语音合成在低功耗设备上更可行,推动相关应用落地。
未来可能进一步优化其他 TTS 或生成模型的卷积操作,或将该技术应用于更多硬件平台,以提升实时性能。