语音设置
入口: 侧边栏 → 设置 → 语音
语音设置页面仅当在常规设置 → 实验功能中开启了「语音模式」后才可见。关闭后该页签隐藏,但已下载的模型与设置保留。
语音设置集中管理唤醒词、语音识别(STT)与语音合成(TTS)模型、播报行为等所有与语音模式相关的配置。所有修改即时生效,无需重启应用。
唤醒词
作用: 定义语音模式中用于唤醒收音的触发词。说出该词后应用开始收音并将语音转为文字。
默认值: 小码
操作: 在输入框中直接编辑,失焦(点击其他区域或按 Tab)后自动保存。
唤醒词支持模糊拼音容错——同音字(如「小马」「晓码」)也能识别,不要求精确匹配。修改后立即生效,下次唤醒时使用新词。
唤醒应答语
作用: 唤醒成功后,系统用语音回复这句话,提示你已经开始收音。应答播报期间不计入静音判定,避免误触发自动发送。
默认值: 留空(关闭应答)
操作: 在输入框中编辑应答文案,失焦后自动保存。留空则唤醒后直接开始收音、不播放应答语。
示例: 设置为「在呢,请说」——唤醒后听到「在呢,请说」即可开始说话。
静音判定时长
作用: 说完话后静音超过该时长,系统自动将语音转文字并发送。
默认值: 1.5 秒
可选范围: 0.5 秒 ~ 5 秒(步长 0.1 秒)
操作: 拖动滑杆调整,释放后自动保存。数值越小发送越快,但可能在短暂停顿(思考)时误触发;数值越大留给你的思考时间越长。
识别语言
作用: 过滤 STT 模型列表,只显示支持所选语言的模型。
可选值: 全部 / 中文 / 英文 / 日语 / 韩语 / 粤语
操作: 在下拉列表中选择。此设置仅用于筛选模型列表,不影响已选模型的识别能力——模型本身的语言支持由其规格决定。
识别模型(语音转文字 / STT)
作用: 选择将语音转写成文字的 AI 模型。每个模型卡片显示其名称、支持的语言与文件大小。
操作:
- 点击模型卡片上的下载按钮(显示文件大小,如「240 MB」),下载完成后按钮变为设为使用。
- 已下载的模型可点击设为使用激活,卡片上会显示「使用中」标记。
- 点击下载进度环可取消下载;已下载的模型可点击删除按钮移除本地文件。
建议至少下载一个识别模型,否则语音模式无法将语音转为文字。
合成模型(文字转语音 / TTS)
作用: 选择将 AI 回复朗读出来的语音合成模型。
设置项:
| 设置 | 说明 |
|---|---|
| 模型选择 | 与 STT 模型相同,下载后点击「设为使用」激活;支持多款中文 / 多语种 TTS 模型 |
| 音色 | 数字编号(0~500),不同编号对应不同音色。具体音色效果取决于所选模型,部分模型仅有单个音色 |
| 语速 | 0.5 倍 ~ 2.0 倍(步长 0.1),1.0 倍为正常语速 |
| 试听 | 点击「试听」按钮,用当前设置的音色与语速朗读一段预览文案 |
操作: 先下载并设为一个合成模型,激活后下方会展开音色 / 语速调节与试听区。音色编号与语速在调节后自动保存。
播报时继续监听
作用: 控制 AI 朗读回复期间是否继续检测唤醒词。
默认值: 开启
| 状态 | 表现 |
|---|---|
| 开启 | 播报期间仍监听唤醒词,可随时打断并用语音下达新指令 |
| 关闭 | 播报期间不检测唤醒词(彻底避免回声误触发),打断只能点面板上的停止播报按钮 |
语音模式自动朗读回复
作用: 控制语音模式中 AI 回复是否自动转为语音播报。
默认值: 开启
| 状态 | 表现 |
|---|---|
| 开启 | AI 每条回复完成后自动朗读出来 |
| 关闭 | AI 回复仅显示为文字,不自动朗读;可在完成栏点击朗读回复喇叭按钮手动播报 |
下一步
- 语音模式 — 语音模式完整功能介绍与使用指南
- 常规设置 → 实验功能 — 管理实验性功能开关
- 对话面板 — 了解图形界面的对话交互

