Realtime 实时语音接口

Realtime API

让 AI 能像打电话一样和你实时对话,你随时打断它,它也随时回应你。

人工智能与模型出现时间 · 2024按输入与输出的音频时长计费,另有文字部分按 token 计费,整体高于纯文本接口。实时语音语音对话低延迟全双工
看官方文档

01 它是干嘛的

Realtime API 面向「像真人打电话一样」的语音交互:音频直接进、音频直接出,不用先转文字再合成语音。它支持随时打断(全双工),让 AI 的语气、停顿、情绪都更像真人对话,适合做语音助手与电话客服。

02 为什么会有它

以前的语音助手,总像在跟一个反应慢半拍的人讲话

早先做语音对话,要把流程拼成三截:先把你的话转成文字(语音识别),再把文字交给大模型想出回答,最后把回答文字合成为语音播出来。每一截都要等上一截全部完成。

这样拼出来的对话有三个毛病。第一是慢:你说完要等它转文字、思考、再合成,回话总慢半拍。第二是不能打断:它说话时你插嘴它就听不见,只能等它讲完。第三是丢了语气:文字里没有声调、情绪、停顿,AI 听起来永远平平淡淡,像在念稿。

Realtime API 把这三段合并成一条直通车的通道:声音进来直接送到模型,模型边听边想,直接把声音回给你。你可以在它说话时随时插话,它会停下来听你说。延迟降下来了,语气也保住了,对话才终于像对话。

03 它怎么工作

关键是「一条长期开着的声音通道」:连接一旦建立就持续保持,音频小片段实时双向流动,模型边收边说,而不是一问一答式的整段往返。

语音助手:从「你说话」到「它说话」的五段流水线只把唤醒后的片段送上去结果交给合成麦克风持续收音唤醒词检测在本机完成,不上传语音转文字把声音变成文本意图理解「开灯」= 执行设备指令执行动作调用设备或服务语音合成把回复文字说成话扬声器你听到的回应唤醒词检测必须跑在本地:否则麦克风听到的一切都要上传,既费电又没有隐私可言。识别核心本地 / 设备动作
这张图在这里要看的是上下两条并行流动的箭头:音频不再走完「录音 → 转文字 → 回答 → 合成」的长链,而是在同一条通道里双向实时流动,这就是它低延迟、能被打断的原因。

一次实时语音对话,声音是怎么来回跑的

  1. 1
    ① 建立持久连接

    客户端与模型之间建立起一条一直开着的双向通道,而不是每说一句话都重新发一个请求。

  2. 2
    ② 音频流式进入

    你的声音被切成很小的时间片,边录边传,模型不等你说完整句就开始处理。

  3. 3
    ③ 边听边理解

    模型直接在有声内容上理解语义和语气,无需先完整转成文字再思考,省掉了中间环节的等待。

  4. 4
    ④ 流式生成语音

    模型的回答也以声音片段的形式边说边发,客户端收到一小段就播一小段,首句响应极快。

  5. 5
    ⑤ 支持打断与轮转

    检测到你在说话时立即停止播报并转入聆听,同时用机制标记「谁在说、说到哪」,实现自然的抢话与接话。

04 谁在用它

语音助手与智能硬件

音箱、玩具、车载系统里做自然的语音交互,响应快、能插话。

电话客服

AI 接听电话,实时识别客户诉求并应答,语气自然,必要时转人工。

语言学习陪练

和 AI 用外语实时对话,随时打断纠正,练口语比读课本有效得多。

无障碍与陪伴

帮视障用户用语音获取信息,或做成能聊天陪伴的语音应用。

实时翻译

边说边译,用于会议、旅行等需要即时沟通的场景。

05 怎么用

需要写代码,通常用 WebSocket 接入;平台也提供更简单的语音对话组件来降低门槛。

  1. 01在平台创建密钥,并确认账户已开通对应的实时语音权限。
  2. 02建立到实时接口的持久连接(WebSocket),把音频格式和会话参数配置好。
  3. 03采集麦克风声音为规定格式的小片段,边采集边发送。
  4. 04接收模型回传的音频片段并播放,同时处理打断与轮转的事件。
  5. 05在会话里设置角色、语气、可用工具,让助手回答风格符合你的产品。
  6. 06上线前压测延迟与并发,语音对延迟比文字敏感得多。

避坑提示

  • !实时语音按音频时长计费,比纯文字贵不少,长时间开着连接要注意成本。
  • !网络抖动会让声音卡顿,生产环境要处理断线重连与音频缓冲。
  • !语音里没有「撤回」,打断时机处理不好会显得很生硬,轮转逻辑要仔细调。
  • !涉及录音的场景注意隐私告知与合规,用户得事先知情且能选择。

06 关键概念

全双工
双方可以同时听和说,像打电话,而不是对讲机那样一人一句轮流。
流式(Streaming)
数据边产生边传输,不等整段准备好,所以响应更快。
轮转(Turn-taking)
判断「现在该谁说」,是自然对话里最容易被忽略的关键机制。
延迟
从你说完到听到回应的时间,语音对话里超过一秒就会明显别扭。

07 容易混淆的对比

「识别 + 大模型 + 合成」拼接方案实现灵活、可分别替换各家组件,但延迟高、丢语气、难打断。
传统电话机器人依赖预设话术与按键选择,成本低但僵硬,理解不了自由表达。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态