Skip to content

语音设置

入口: 侧边栏 → 设置语音

语音设置页面仅当在常规设置 → 实验功能中开启了「语音模式」后才可见。关闭后该页签隐藏,但已下载的模型与设置保留。

语音设置集中管理唤醒词、语音识别(STT)与语音合成(TTS)模型、播报行为等所有与语音模式相关的配置。所有修改即时生效,无需重启应用。


唤醒词

作用: 定义语音模式中用于唤醒收音的触发词。说出该词后应用开始收音并将语音转为文字。

默认值: 小码

操作: 在输入框中直接编辑,失焦(点击其他区域或按 Tab)后自动保存。

唤醒词支持模糊拼音容错——同音字(如「小马」「晓码」)也能识别,不要求精确匹配。修改后立即生效,下次唤醒时使用新词。


唤醒应答语

作用: 唤醒成功后,系统用语音回复这句话,提示你已经开始收音。应答播报期间不计入静音判定,避免误触发自动发送。

默认值: 留空(关闭应答)

操作: 在输入框中编辑应答文案,失焦后自动保存。留空则唤醒后直接开始收音、不播放应答语。

示例: 设置为「在呢,请说」——唤醒后听到「在呢,请说」即可开始说话。


静音判定时长

作用: 说完话后静音超过该时长,系统自动将语音转文字并发送。

默认值: 1.5 秒

可选范围: 0.5 秒 ~ 5 秒(步长 0.1 秒)

操作: 拖动滑杆调整,释放后自动保存。数值越小发送越快,但可能在短暂停顿(思考)时误触发;数值越大留给你的思考时间越长。


识别语言

作用: 过滤 STT 模型列表,只显示支持所选语言的模型。

可选值: 全部 / 中文 / 英文 / 日语 / 韩语 / 粤语

操作: 在下拉列表中选择。此设置仅用于筛选模型列表,不影响已选模型的识别能力——模型本身的语言支持由其规格决定。


识别模型(语音转文字 / STT)

作用: 选择将语音转写成文字的 AI 模型。每个模型卡片显示其名称、支持的语言与文件大小。

操作:

  1. 点击模型卡片上的下载按钮(显示文件大小,如「240 MB」),下载完成后按钮变为设为使用
  2. 已下载的模型可点击设为使用激活,卡片上会显示「使用中」标记。
  3. 点击下载进度环可取消下载;已下载的模型可点击删除按钮移除本地文件。

建议至少下载一个识别模型,否则语音模式无法将语音转为文字。


合成模型(文字转语音 / TTS)

作用: 选择将 AI 回复朗读出来的语音合成模型。

设置项:

设置说明
模型选择与 STT 模型相同,下载后点击「设为使用」激活;支持多款中文 / 多语种 TTS 模型
音色数字编号(0~500),不同编号对应不同音色。具体音色效果取决于所选模型,部分模型仅有单个音色
语速0.5 倍 ~ 2.0 倍(步长 0.1),1.0 倍为正常语速
试听点击「试听」按钮,用当前设置的音色与语速朗读一段预览文案

操作: 先下载并设为一个合成模型,激活后下方会展开音色 / 语速调节与试听区。音色编号与语速在调节后自动保存。


播报时继续监听

作用: 控制 AI 朗读回复期间是否继续检测唤醒词。

默认值: 开启

状态表现
开启播报期间仍监听唤醒词,可随时打断并用语音下达新指令
关闭播报期间不检测唤醒词(彻底避免回声误触发),打断只能点面板上的停止播报按钮

语音模式自动朗读回复

作用: 控制语音模式中 AI 回复是否自动转为语音播报。

默认值: 开启

状态表现
开启AI 每条回复完成后自动朗读出来
关闭AI 回复仅显示为文字,不自动朗读;可在完成栏点击朗读回复喇叭按钮手动播报

下一步