01 它是干嘛的
Realtime API 面向「像真人打电话一样」的语音交互:音频直接进、音频直接出,不用先转文字再合成语音。它支持随时打断(全双工),让 AI 的语气、停顿、情绪都更像真人对话,适合做语音助手与电话客服。
02 为什么会有它
以前的语音助手,总像在跟一个反应慢半拍的人讲话
早先做语音对话,要把流程拼成三截:先把你的话转成文字(语音识别),再把文字交给大模型想出回答,最后把回答文字合成为语音播出来。每一截都要等上一截全部完成。
这样拼出来的对话有三个毛病。第一是慢:你说完要等它转文字、思考、再合成,回话总慢半拍。第二是不能打断:它说话时你插嘴它就听不见,只能等它讲完。第三是丢了语气:文字里没有声调、情绪、停顿,AI 听起来永远平平淡淡,像在念稿。
Realtime API 把这三段合并成一条直通车的通道:声音进来直接送到模型,模型边听边想,直接把声音回给你。你可以在它说话时随时插话,它会停下来听你说。延迟降下来了,语气也保住了,对话才终于像对话。
03 它怎么工作
关键是「一条长期开着的声音通道」:连接一旦建立就持续保持,音频小片段实时双向流动,模型边收边说,而不是一问一答式的整段往返。
一次实时语音对话,声音是怎么来回跑的
- 1① 建立持久连接
客户端与模型之间建立起一条一直开着的双向通道,而不是每说一句话都重新发一个请求。
- 2② 音频流式进入
你的声音被切成很小的时间片,边录边传,模型不等你说完整句就开始处理。
- 3③ 边听边理解
模型直接在有声内容上理解语义和语气,无需先完整转成文字再思考,省掉了中间环节的等待。
- 4④ 流式生成语音
模型的回答也以声音片段的形式边说边发,客户端收到一小段就播一小段,首句响应极快。
- 5⑤ 支持打断与轮转
检测到你在说话时立即停止播报并转入聆听,同时用机制标记「谁在说、说到哪」,实现自然的抢话与接话。
04 谁在用它
音箱、玩具、车载系统里做自然的语音交互,响应快、能插话。
AI 接听电话,实时识别客户诉求并应答,语气自然,必要时转人工。
和 AI 用外语实时对话,随时打断纠正,练口语比读课本有效得多。
帮视障用户用语音获取信息,或做成能聊天陪伴的语音应用。
边说边译,用于会议、旅行等需要即时沟通的场景。
05 怎么用
需要写代码,通常用 WebSocket 接入;平台也提供更简单的语音对话组件来降低门槛。
- 01在平台创建密钥,并确认账户已开通对应的实时语音权限。
- 02建立到实时接口的持久连接(WebSocket),把音频格式和会话参数配置好。
- 03采集麦克风声音为规定格式的小片段,边采集边发送。
- 04接收模型回传的音频片段并播放,同时处理打断与轮转的事件。
- 05在会话里设置角色、语气、可用工具,让助手回答风格符合你的产品。
- 06上线前压测延迟与并发,语音对延迟比文字敏感得多。
避坑提示
- !实时语音按音频时长计费,比纯文字贵不少,长时间开着连接要注意成本。
- !网络抖动会让声音卡顿,生产环境要处理断线重连与音频缓冲。
- !语音里没有「撤回」,打断时机处理不好会显得很生硬,轮转逻辑要仔细调。
- !涉及录音的场景注意隐私告知与合规,用户得事先知情且能选择。
06 关键概念
- 全双工
- 双方可以同时听和说,像打电话,而不是对讲机那样一人一句轮流。
- 流式(Streaming)
- 数据边产生边传输,不等整段准备好,所以响应更快。
- 轮转(Turn-taking)
- 判断「现在该谁说」,是自然对话里最容易被忽略的关键机制。
- 延迟
- 从你说完到听到回应的时间,语音对话里超过一秒就会明显别扭。