语音模式(Beta)
Beta 功能:语音模式目前处于 Beta 阶段,默认关闭。你需要在 设置 → 常规 → 实验功能 中开启「语音模式」开关后,才会在界面中看到语音相关入口。
语音模式让你用自然语音与 AI 对话——说出唤醒词唤起收音,说完后自动转文字发送,AI 的回复也可以自动朗读出来。全程不需要碰键盘,适合在走动、休息或不想打字的场景下使用。
核心能力
语音模式围绕「讲→听→答→读」的闭环设计,主要包含以下能力:
| 能力 | 说明 |
|---|---|
| 唤醒词触发 | 在语音模式中说出预设的唤醒词(默认「小码」),应用即开始收音——同音字也能识别,无需精确匹配 |
| 语音转文字(STT) | 你的语音被实时转写成文字,说完后自动发送给 AI(无需再点发送按钮) |
| 回复朗读(TTS) | AI 回复后自动转为语音播报,也可手动点击完成栏的喇叭按钮朗读 |
| 语音操控 | 遇到选择题或权限审批时,可以直接用语音回答「选第三个」或「允许」 |
| 多语言识别 | 支持中文、英文、日语、韩语、粤语五种语言的识别与混合 |
快速开始
1. 开启语音模式
- 进入 设置 → 常规,滚动到底部的 实验功能 区块。
- 打开 语音模式 开关。
- 开关生效后,输入框工具栏的发送按钮左侧会出现一个麦克风按钮(语音模式入口),同时设置页导航中会出现「语音」页签。
2. 下载模型
首次使用语音模式需要下载语音识别(STT)与语音合成(TTS)模型:
- 进入 设置 → 语音。
- 在「识别模型」区域,选择你需要的语言并点击对应模型的下载按钮。
- 在「合成模型」区域,选择你需要的语音合成模型并下载(合成模型下载后可调节音色与语速)。
- 下载完成后,点击模型卡片的设为使用即可激活。
模型下载一次后即可离线使用,无需重复下载。建议至少下载一个 STT 模型和一个 TTS 模型。
3. 开始语音对话
- 点击输入框工具栏的麦克风按钮进入语音模式——此时界面中央会弹出语音面板,显示当前状态。
- 首次进入时模型会加载片刻(显示「模型加载中…」),加载完成后提示「说「小码」开始对话」。
- 说出唤醒词 「小码」(默认,可在设置中修改):
- 唤醒成功后播放一段应答语(可自定义),然后开始收音。
- 收音中说话,面板显示「正在听…」。
- 说完后静音超过静音判定时长(默认 1.5 秒),系统自动将语音转成文字发送给 AI。
- AI 回复后,若开启了自动朗读,回复内容会自动转为语音播报。
语音面板
进入语音模式后,输入框上方会展开一个语音面板,实时反映当前状态:
| 状态 | 面板提示 | 说明 |
|---|---|---|
| 模型加载中 | 「模型加载中…」 | 首次进入或切换模型时短暂出现 |
| 等待唤醒 | 「说「小码」开始对话」 | 正在监听唤醒词 |
| 录音中 | 「正在听…」 | 已唤醒,正在收音并转写 |
| 播报中 | 「正在播报回复…」 | AI 回复正在朗读 |
| 停止播报 | 「停止播报」按钮 | 点击可中断当前朗读 |
面板上还有以下操作:
- 退出语音模式:点击面板右上角的退出按钮或再次点击输入框的麦克风按钮,即可退出语音模式,恢复常规键盘输入。
- 打开语音设置:点击面板上的齿轮图标可直接跳转到语音设置页。
- 停止播报:AI 朗读时点击「停止播报」可中断当前朗读。
审批卡与选择题的语音交互
当 AI 发送权限审批卡或选择题时,语音模式下可以直接用语音作答:
- 权限审批:说出「允许」或「拒绝」,应用会自动匹配对应操作。也可以说「小码,允许」来先唤醒再下达指令。
- 选择题(Ask 卡):说出「选第三个」或「第一个」即可选择对应选项;多选题可以说「第一个和第三个」。卡片内容与选项序号会一并读出,方便了解当前要决定什么。
语音消息气泡
发送语音或收到语音后,对话区会显示音频气泡:
- 点击气泡上的播放按钮可回放语音内容。
- 右键点击气泡,菜单包含:
- 复制内容:复制语音转写的文字
- 隐藏文本 / 显示文本:切换是否显示语音转写的文字内容
- 语音转文字:将语音重新转写为文本
定时执行与语音模式
语音模式下不影响已挂载的定时执行消息——到点的定时消息会正常在后台发送,AI 的回复会按设置自动朗读或静默等待。
下一步
- 语音设置 — 配置唤醒词、模型、音色语速等
- 对话面板 — 了解图形界面的完整对话交互
- 常规设置 → 实验功能 — 管理实验性功能开关

