Skip to content

语音模式(Beta)

Beta 功能:语音模式目前处于 Beta 阶段,默认关闭。你需要在 设置 → 常规 → 实验功能 中开启「语音模式」开关后,才会在界面中看到语音相关入口。

语音模式让你用自然语音与 AI 对话——说出唤醒词唤起收音,说完后自动转文字发送,AI 的回复也可以自动朗读出来。全程不需要碰键盘,适合在走动、休息或不想打字的场景下使用。

相关基础:对话面板多任务分屏


核心能力

语音模式围绕「讲→听→答→读」的闭环设计,主要包含以下能力:

能力说明
唤醒词触发在语音模式中说出预设的唤醒词(默认「小码」),应用即开始收音——同音字也能识别,无需精确匹配
语音转文字(STT)你的语音被实时转写成文字,说完后自动发送给 AI(无需再点发送按钮)
回复朗读(TTS)AI 回复后自动转为语音播报,也可手动点击完成栏的喇叭按钮朗读
语音操控遇到选择题或权限审批时,可以直接用语音回答「选第三个」或「允许」
多语言识别支持中文、英文、日语、韩语、粤语五种语言的识别与混合

快速开始

1. 开启语音模式

  1. 进入 设置 → 常规,滚动到底部的 实验功能 区块。
  2. 打开 语音模式 开关。
  3. 开关生效后,输入框工具栏的发送按钮左侧会出现一个麦克风按钮(语音模式入口),同时设置页导航中会出现「语音」页签。

2. 下载模型

首次使用语音模式需要下载语音识别(STT)与语音合成(TTS)模型:

  1. 进入 设置 → 语音
  2. 在「识别模型」区域,选择你需要的语言并点击对应模型的下载按钮。
  3. 在「合成模型」区域,选择你需要的语音合成模型并下载(合成模型下载后可调节音色与语速)。
  4. 下载完成后,点击模型卡片的设为使用即可激活。

模型下载一次后即可离线使用,无需重复下载。建议至少下载一个 STT 模型和一个 TTS 模型。

3. 开始语音对话

  1. 点击输入框工具栏的麦克风按钮进入语音模式——此时界面中央会弹出语音面板,显示当前状态。
  2. 首次进入时模型会加载片刻(显示「模型加载中…」),加载完成后提示「说「小码」开始对话」。
  3. 说出唤醒词 「小码」(默认,可在设置中修改):
    • 唤醒成功后播放一段应答语(可自定义),然后开始收音。
    • 收音中说话,面板显示「正在听…」。
  4. 说完后静音超过静音判定时长(默认 1.5 秒),系统自动将语音转成文字发送给 AI。
  5. AI 回复后,若开启了自动朗读,回复内容会自动转为语音播报。

语音面板

进入语音模式后,输入框上方会展开一个语音面板,实时反映当前状态:

状态面板提示说明
模型加载中「模型加载中…」首次进入或切换模型时短暂出现
等待唤醒「说「小码」开始对话」正在监听唤醒词
录音中「正在听…」已唤醒,正在收音并转写
播报中「正在播报回复…」AI 回复正在朗读
停止播报「停止播报」按钮点击可中断当前朗读

面板上还有以下操作:

  • 退出语音模式:点击面板右上角的退出按钮或再次点击输入框的麦克风按钮,即可退出语音模式,恢复常规键盘输入。
  • 打开语音设置:点击面板上的齿轮图标可直接跳转到语音设置页。
  • 停止播报:AI 朗读时点击「停止播报」可中断当前朗读。

审批卡与选择题的语音交互

当 AI 发送权限审批卡或选择题时,语音模式下可以直接用语音作答:

  • 权限审批:说出「允许」或「拒绝」,应用会自动匹配对应操作。也可以说「小码,允许」来先唤醒再下达指令。
  • 选择题(Ask 卡):说出「选第三个」或「第一个」即可选择对应选项;多选题可以说「第一个和第三个」。卡片内容与选项序号会一并读出,方便了解当前要决定什么。

语音消息气泡

发送语音或收到语音后,对话区会显示音频气泡

  • 点击气泡上的播放按钮可回放语音内容。
  • 右键点击气泡,菜单包含:
    • 复制内容:复制语音转写的文字
    • 隐藏文本 / 显示文本:切换是否显示语音转写的文字内容
    • 语音转文字:将语音重新转写为文本

定时执行与语音模式

语音模式下不影响已挂载的定时执行消息——到点的定时消息会正常在后台发送,AI 的回复会按设置自动朗读或静默等待。


下一步