如何用六个月构建响应式语音 AI 的实时系统
如何用六个月构建响应式语音 AI 的实时系统
事件/产品概述
OpenAI 于 2026 年 8 月发布了第三代语音系统 GPT-Live,旨在实现与 AI 的连续语音交互。与传统的回合制语音系统不同,GPT-Live 采用“无轮次”语音模型和低延迟架构,让对话更即时、更自然。该系统的核心能力包括:全双工语音模型(可同时听和说),以及在需要深度推理或工具调用时无缝切换至 GPT-5.5 等前沿模型,而不会打断对话流。OpenAI 工程师 Justin Uberti 和 Zahan Malkani 在官方博客中详细介绍了这套系统从架构设计到工程落地的全过程,开发周期仅为六个月。
关键技术点
1. 从回合制转向流式处理
传统语音 AI 架构继承自文本 LLM 的回合制模式,每一轮对话被看作一个离散的音频块。级联系统中,语音识别(STT)、大语言模型(LLM)和语音合成(TTS)依次串行执行,不仅延迟高,还会丢失语调、节奏等副语言信息。后来的语音到语音(speech-to-speech)模型虽然直接处理音频,但仍然依赖“回合检测器”(turn detector)来决定何时开始推理,本质上仍是回合制。
GPT-Live 将语音模型置于对话控制中心,音频连续流入和流出模型,而深度推理和工具调用则异步进行。系统的主要任务是维持一个不间断的媒体循环,其他操作(如调用前沿模型、持久化会话)都移出实时路径。
2. 有状态推理与动态上下文管理
要实现连续音频流,推理系统必须具备状态性。GPT-Live 构建了专门用于持续对话的有状态推理系统,并解决了两个关键问题:
- 模型实例无缝切换:当需要迁移会话时,系统会预先启动一个替代模型实例,用当前会话上下文预填充(prefill),然后并行运行新旧实例,待新实例完全就绪后再切换,避免媒体中断。
- 动态上下文压缩:长对话可能超出模型上下文窗口。传统做法是压缩上下文,但会失效 KV 缓存,导致重新预填充延迟。GPT-Live 将压缩视为另一种受管迁移:在原模型继续对话的同时,系统压缩上下文并准备新的模型实例,完成后无感切换。
3. 媒体流与应用逻辑分离
系统架构明确区分了“媒体快速路径”和“应用逻辑”:
- 音频在客户端和语音模型之间通过专用快速路径传输。
- 委派、工具调用等业务逻辑在异步 RPC 边界之后执行,避免阻塞媒体流。
- 这种分离使得应用层可以自由定制工具、策略和后端行为,而不影响实时媒体前端。
4. 传输与推理层面的低延迟优化
- Go 替换 Python asyncio:媒体前端和推理逻辑采用 Go 编写,帧传输平滑度显著提升,新系统的 p95 延迟与旧系统的 p50 持平。
- WebRTC 传输基础:WebRTC 专为低延迟媒体设计,能容忍丢包、时钟漂移和连接变化。延迟到达的包可通过轻微拉伸音频来补隙,再短暂加速播放以回归实时。
5. 异步委派机制
GPT-Live 可调用 GPT-5.5 等外部模型进行深度推理,但需要保证委派结果及时返回且不阻塞对话。原文指出这涉及路由、提示词构建等多个环节的延迟优化,但具体实现细节原文未展开说明。
对数据科学 / AI Agent 落地的意义
GPT-Live 的架构对 AI Agent 的实时交互场景具有直接参考价值:
- 实时交互不再受限于文本轮次:语音作为最自然的交互方式,若 Agent 能实时听和说,将大幅降低人机协作的摩擦。
- 异步委派模式是 Agent 的重要范式:让“说话”与“思考”解耦,Agent 可以在回应时继续后台推理,类似人类“边想边说”。
- 状态管理与会话连续性:有状态推理、上下文压缩和实例热切换,为长时间运行的 Agent 会话提供了工程样板。
- 架构关注点分离:将实时路径与业务逻辑分离,使得 Agent 功能迭代不牺牲响应速度,是生产级系统设计的优秀案例。
我的技术点评
OpenAI 这篇博客披露的价值不在于“六个月”的速度,而在于系统性地拆解了实时语音 AI 的工程难题。把回合检测器从音频路径中移除,看似简单,实则需要全链路配合:有状态推理、动态上下文压缩、并行实例切换、传输协议优化——任何一个环节掉链子都会让用户体验崩塌。
特别值得注意的是 p95 达到旧系统 p50 这一指标,这反映了从 Python asyncio 到 Go 的工程红利,也说明在实时场景下语言运行时对调度延迟的影响不可忽视。另外,将上下文压缩做成一种“受管迁移”而非“停机重来”,体现了对状态化服务运营的深思熟虑。
当然,原文对委派机制的具体延迟优化描述较少,模型内部的采样策略、语音活动检测(VAD)是否完全被全双工模型替代等问题也语焉不详。但作为一篇工程博客,它已经给出了足够多的架构决策线索,值得做实时语音 Agent 的团队反复品味。
原文链接
How we built a realtime system for responsive voice AI in six months
