返回全部动态

GPT-Live 底层拆解:OpenAI 如何将音频帧延迟降至旧系统 p50 水平

原标题:GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟

雷峰网 AI科技评论研究质量 83

AI 摘要

OpenAI 发布 GPT-Live 工程文章,详细披露新版 ChatGPT 语音系统的架构改造,包括多路实时传输网络、自定义 WARP 协议、模型实例迁移和双模型协作等。新系统将 p95 音频帧延迟降至旧系统 p50 水平,并将 WebRTC 通道启动从 6 次往返缩短至 1 次。文章指出实时性依赖系统调度而非单纯模型速度,并提示了持续推理成本等未公开数据。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

0 作者丨郑佳美 编辑丨岑 峰 在实时语音交互中,延迟是唯一的“死线”。 文字回答慢几百毫秒,用户顶多觉得体验不佳;但音频只要卡顿一次,那种“非人”的割裂感就会瞬间摧毁信任。为了解决这个工程顽疾,OpenAI 耗时 6 个月重做了整个语音系统。 刚刚,OpenAI 发布了一篇 GPT-Live 工程文章,详细披露了新版 ChatGPT 语音系统背后的架构改造。其中最值得注意的一组数据是:新的媒体系统,其 p95 音频帧延迟已经降到了旧系统 p50 的水平。 这意味着,新系统中最慢的 95% 的音频帧,现在都能跑得和旧系统中最快的 50% 音频帧一样的顺滑。 虽然 OpenAI 没有公布具体毫秒数,但这个结果说明,改造主要压缩了那些偶发但明显的慢帧。 现在的 GPT-Live 不再等待用户说完一句话再开始工作,而是让声音持续进入模型,模型生成的语音也持续返回用户。搜索、工具调用和复杂推理则被移到另一条异步路径。 01 GPT-Live 首先改掉的是音频在服务器中的传输方式。 长期以来,开发者的通常做法是将语音 Agent 视为“语音转文字->模型推理->文字转语音”的单体推理系统,过去的


发布时间:2026-08-06 21:47
抓取时间:2026-08-07 00:09
来源机构:雷峰网
阅读原文leiphone.com