01 它是干嘛的
Siri 是苹果设备上的语音助手,让用户用自然说出来的话去完成操作。它背后是一条语音处理流水线:先把声音转成文字,再判断你想做什么,然后去执行,最后用合成的人声把结果说给你听。近年来越来越多的环节被放到设备本地完成,以兼顾响应速度与隐私。
02 为什么会有它
在语音助手出现之前,想查个天气都要掏手机点好几下
开车、做饭、手上有活的时候,根本腾不出手去解锁手机、点开应用、输入关键词。这些「一句话就能问清楚」的小事,操作成本却很高,尤其在双手被占用时几乎无法完成。
早期的语音识别也不太争气:口音、背景噪音、说话没有停顿,都会让它听错。听错之后它往往只会回复「我没听懂」,无法追问澄清,用户试几次就放弃了。
语音助手的目标是让设备接受「自然说出来的话」,而不是死记硬背的指令。你要先把它叫醒,它把你的声音变成文字,猜出你想干什么,去执行,再用合成语音回答你。
03 它怎么工作
这是「唤醒词检测 → 语音转文字 → 意图理解 → 执行动作 → 语音合成回复」五段流水线,每一段都有本地与云端的分工,越关键的识别环节越倾向放在设备上完成。
从你喊出唤醒词到它开口回答,中间经过哪几步
- 1① 唤醒词检测
设备一直用极低功耗的方式听着一个很短的词,只有听到它才正式启动,避免把你的日常对话一直上传。
- 2② 语音转文字
把你说的话转成文字。这一步要在有噪音、有口音的情况下尽量认准,很多时候就在设备本地完成。
- 3③ 意图理解
判断你这句话想做什么,是查天气、设闹钟还是给某个人发消息,同时把对象、时间、地点等关键信息提取出来。
- 4④ 执行动作
系统调用对应的能力去完成任务,比如创建提醒、播放音乐、搜索资料,或调起某个第三方应用。
- 5⑤ 语音合成回复
把结果转成自然的人声播报出来;如果没听懂,会追问一句让你补充信息,而不是直接失败。
- 6⑥ 端云协同
敏感或需要即时响应的部分尽量在设备上做,需要更多知识与更强理解时,才把请求送到云端处理。
04 谁在用它
开车、做饭、双手不便时,用一句话完成设置提醒、拨电话、播放音乐等操作。
直接说出时间与事项,比手动点开应用逐项填写快得多,也更不容易漏。
用语音开关灯、调温度、控制窗帘等设备,属于典型的「不想走过去按」场景。
口述一段消息发给指定联系人,或直接说名字拨号,省去打字与翻通讯录。
对行动不便或视力受限的用户,语音交互是重要的辅助手段,能显著降低操作门槛。
05 怎么用
在支持的设备上开启后即可使用;说话完整、包含关键信息,命中率会明显提高。
- 01在系统设置里找到 Siri 相关选项并开启,按提示录入唤醒词。
- 02选择用唤醒词、侧边键或按钮来唤起,按自己的使用习惯决定。
- 03直接说出请求,例如「明天早上七点提醒我吃药」,注意带上时间与事项。
- 04一次没听懂时可以换一种更完整的说法,或补充关键信息重新提问。
- 05在隐私设置里关闭锁定时使用等选项,减少设备在锁屏状态下被误唤起的可能。
- 06开发者:用系统提供的意图框架,让自己的应用支持语音唤起与快捷指令。
import AppIntents
// 定义一个用户可以用语音触发的动作
struct StartFocusIntent: AppIntent {
static var title: LocalizedStringResource = "start focus mode"
// 声明这个动作需要从这句话里提取一个参数
@Parameter(title: "minutes")
var minutes: Int
func perform() async throws -> some IntentResult {
// 在这里调用你自己的业务逻辑,例如开启专注计时
// try await FocusManager.start(minutes: minutes)
return .result()
}
}避坑提示
- !唤醒词会持续占用麦克风做低功耗监听,介意的话可以只保留按键唤起方式。
- !复杂任务(多步操作、生成长文本)通常仍会力不从心,别指望它替代手动操作。
- !开放麦克风权限等于让设备持续听环境音,请按实际需要决定是否长期开启。
06 关键概念
- 唤醒词
- 一句特定的短词,只有听到它语音助手才正式启动。
- 语音识别(ASR)
- 把说出来的话转成文字的技术,是整条流水线的入口。
- 自然语言理解(NLU)
- 从文字里推断出你想干什么,并提取对象、时间等关键信息。
- 语音合成(TTS)
- 把文字转成听起来自然的人声,用于播报回复结果。