「语音输入」功能详解
什么是「语音输入」?
「语音输入」可以将你说的内容识别为文字,用于快速输入任务、补充要求或唤起「千问办公」。
相比键盘输入,「语音输入」更适合你想要描述当前页面内容、记录临时想法,以及不方便打字的场景。
「语音输入」能做什么?
| 能力 | 说明 |
|---|---|
| 语音转文字 | 将说话内容识别为文字 |
| 快捷键输入 | 通过单按键或组合键开始、停止录音 |
| 全局语音输入 | 在其他支持文字输入的应用中使用语音输入 |
| 语音唤起 | 通过语音快捷键唤起「千问办公」并提交任务 |
| 识别润色 | 自动修正错别字,优化口语表达 |
| 声纹识别 | 优先识别你的声音,降低周围人声干扰 |
| 常用词纠正 | 添加人名、产品名和专业术语,提高识别准确率 |
| 历史记录 | 查看近期语音输入内容 |
什么时候用?
| 场景 | 任务 |
|---|---|
| 描述较长任务 | 口述任务背景、目标和交付要求 |
| 记录临时想法 | 快速记录会议后的想法和待办 |
| 编辑消息或文档 | 口述钉钉消息、邮件和工作汇报 |
| 边看边问 | 查看报表、网页或文档时直接提问 |
| 连续修改产物 | 对生成结果继续提出修改要求 |
| 不方便打字 | 通勤、站立办公或使用外接麦克风时输入 |
什么时候不适合用?
以下情况不建议你使用语言输入,建议你使用键盘输入。
- 密码、验证码、账号等敏感信息
- 需要精确输入代码、公式或大量数字
- 环境嘈杂或多人同时讲话
- 内容较短,且需要逐字准确表达
如何使用「语音输入」?
开启「语音输入」
客户端左侧边栏底部账户头像 > 设置 > 语音输入
开启「语音输入」开关。首次使用时,如果系统弹出麦克风或其他权限提示,请你按照页面指引完成授权。

设置语音快捷键
你可以选择单按键或组合键作为语音快捷键。
默认语音快捷键为右侧Command ⌘ /Ctrl 。

使用时:
- 按一次快捷键,开始录音;
- 说出需要输入的内容;
- 再按一次快捷键,结束录音;
- 检查识别结果并发送。
建议你选择不容易与其他应用冲突的快捷键。
使用全局语音输入
开启全局语音输入后,你可以在其他应用的文字输入位置使用语音输入。
相当于你多了一个语音转文字的“小助手”。

例如:
- 在钉钉中编辑消息
- 在文档中记录想法
- 在浏览器表单中填写内容
- 在其他办公软件中输入文字
使用前,应先将光标放在你需要输入文字的位置。

使用语音唤起「千问办公」
开启语音唤起千问办公后,连续按两次语音快捷键,你就可以随时唤起「千问办公」,并将与语音和当前屏幕截图交给「千问办公」执行。

使用示例:
连续按两次语音快捷键(默认为右侧Command ⌘ /Ctrl )唤起 > 说任务要求 > 点击 ✅

这种方式会将以下内容一起交给「千问办公」:
- 你说出的任务要求。
- 当前屏幕快照。
因此,它特别适合你“边看边问”。

例如,在查看销售报表时你可以说:
在查看商品页面时你可以说:
如果你不希望当前屏幕内容进入任务,建议你使用普通语音输入,不要使用语音唤起。
三种语音使用方式有什么区别?
| 使用方式 | 主要作用 | 是否使用当前屏幕 |
|---|---|---|
| 普通语音输入 | 在「千问办公」中输入任务 | 否 |
| 全局语音输入 | 在其他应用中输入文字 | 否 |
| 语音唤起「千问办公」 | 唤起「千问办公」并结合当前页面执行任务 | 是 |
如何优化语音识别效果?
输入设备
客户端左侧边栏底部账户头像 > 设置 > 语音输入 > 选择输入设备

你可以选择语音输入使用的麦克风。
如果你连接了耳机、外接麦克风等设备,请检查当前选择的输入设备是否正确。
你不确定时可以选择自动。
开启语音识别润色
客户端左侧边栏底部账户头像 > 设置 > 语音识别润色

语音识别润色会自动修正错别字,并优化你的口语表达。
例如,原始口述内容:
帮我看一下这个表,然后找一下有问题的数据,最后做个总结。
润色后可能整理为:
请分析当前表格,找出异常数据,并生成总结。
适合:
- 编辑正式消息
- 描述较长任务
- 生成邮件或文档
- 减少口头语和重复表达
如果你说的内容涉及数字、名称、条款或需要保留原话,建议发送前检查识别结果。
开启声纹识别
客户端左侧边栏底部账户头像 > 设置 > 语音输入 > 开启声纹识别

声纹识别会优先识别你的声音,降低周围人声的干扰。
适合办公室、会议室等多人环境,但不能保证完全过滤其他声音。
设置自动发送

使用页面指定的“ DJI Mic Mini 2 合作套装”进行语音输入时,可以开启自动发送。
开启后:
- 单击开始录音
- 再次单击结束录音
- 识别结果自动发送给「千问办公」
自动发送减少了确认步骤,适合你熟悉语音输入后使用。
涉及数字、收件人或重要操作时,建议你关闭自动发送,先检查识别结果。
添加常用词纠正

你可以添加容易识别错误的专有名词和专业术语,例如:
- 千问办公
- 钉钉
- 产品和品牌名称
- 同事、客户姓名
- 行业缩写
- 专业术语
建议你只添加经常使用且容易识别错误的词,不必录入所有普通词语。
查看历史记录

可以在历史记录中查看近期语音输入内容。
- 保留30天;
- 最多保存100条。
历史记录适合临时找回输入内容,不建议作为长期资料存储。你的重要内容应保存到任务、文档或个人网盘。
怎样用语音描述清楚任务?
推荐使用以下顺序:
做什么+基于什么+输出什么+限制条件
例如:
复杂任务可以分段表达:
最佳实践
- 开口前明确目标,并按目标 > 背景 > 输出要求 > 限制条件的顺序表达
- 单轮聚焦一个任务,避免中途切换话题
- 将人名、品牌名、专业术语加入自定义词库以提升识别准确率
- 正式文稿开启识别润色,需要逐字记录时关闭
- 涉及数字、日期、金额、收件人的内容,发送前人工复核
- 嘈杂环境优先使用耳机或外接麦克风
- 触发语音唤起前,先关闭或遮挡屏幕上的敏感信息(该操作会附带屏幕快照)
注意事项
- 语音识别结果可能受到口音、语速、噪声和设备质量影响
- 识别润色可能调整原始措辞,不适合要求逐字记录的场景
- 声纹识别只能降低环境人声干扰,不能保证完全隔离
- 自动发送会跳过人工检查,重要任务应谨慎开启
- 语音唤起会同时提交当前「屏幕快照」
- 输入他人的个人信息或企业敏感信息前,请确认已获得相应授权
- 具体录音、识别和数据处理规则以产品隐私政策为准
常见问题
为什么无法开始「语音输入」?
检查以下设置:
- 是否已经开启「语音输入」
- 是否选择了正确的输入设备
- 系统是否允许「千问办公」访问麦克风
- 快捷键是否与其他应用冲突
为什么识别结果中经常出现错别字?
可以尝试:
- 使用更清晰的麦克风
- 降低环境噪声
- 适当放慢语速
- 将专有名词添加到常用词纠正
- 开启语音识别润色
语音输入和语音唤起有什么区别?
语音输入主要将说话内容转换为文字;语音唤起会打开「千问办公」,并将语音内容和当前屏幕快照一起作为任务上下文。
为什么说话内容被重新组织了?
可能是开启了语音识别润色。该功能会修正错别字并优化口语表达。如果需要保留原始措辞,可以关闭润色。
声纹识别可以完全屏蔽其他人的声音吗?
不能。声纹识别用于优先识别你的声音、降低环境人声干扰,但识别结果仍可能受到周围声音影响。
使用语音一定会自动发送吗?
不一定。普通语音输入通常可以先检查识别结果;自动发送仅在开启对应设置并使用页面指定设备时生效。
为什么全局语音输入没有出现在目标应用中?
检查是否已开启全局语音输入,并确认光标已经位于可输入文字的位置。如果系统弹出权限提示,还需要按照提示完成授权。
语音历史记录可以长期保存吗?
当前页面显示语音记录保留30天、最多100条。需要长期保存的内容,应及时写入任务、文档或个人网盘。