ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Cherry Studio 语音输入输出:3 步开启桌面语音交互

Cherry Studio 语音输入输出:3 步开启桌面语音交互 Cherry Studio 语音输入输出3 步开启桌面语音交互【免费下载链接】cherry-studioAI productivity studio with smart chat, autonomous agents, and 300 assistants. Unified access to frontier LLMs项目地址: https://gitcode.com/GitHub_Trending/ch/cherry-studio想象一下你坐在桌前对着 Cherry Studio 说了一句话AI 的回答直接从音箱里读出来全程没碰键盘。这就是 Cherry Studio 的语音输入输出功能——把打字提问、盯着屏幕读答案换成开口说、耳朵听。下面带你从零把它用起来。语音交互到底解决了什么麻烦先说清楚它省了什么力气。你大概率遇到过这三种情况打字太慢问题想清楚了手指还在键盘上打草稿灵感凉了半截。长内容难输入想把一段长文档、会议记录丢给 AI 处理复制粘贴排版乱、打字更累口述一遍反而最快。手和眼睛被占着在做饭、开车、站着演示时根本没法低头打字免手动操作才是刚需。语音交互就是给桌面端语音助手设置补上动嘴代替动手这一层。Cherry Studio 里语音能力走的是模型市场供应商Model Provider提供两类模型——语音合成TTSText-to-Speech把文字念出来和语音识别ASRAutomatic Speech Recognition把说的话变成文字。你在 Cherry Studio 里挂上对应供应商的模型输入输出两条链路就都通了。一条链路看懂数据怎么流动一张图看懂整条链路上图为 Cherry Studio 主进程与界面之间的消息传递架构语音能力挂在这条通路上用大白话走一遍麦克风录下你的声音ASR 模型把它转成文字这段文字和你手打的消息走的是同一条路。文字交给大模型LLMLarge Language Model负责理解和回答的那部分推理过程和平时聊天完全一样。模型输出的回答再交给 TTS 模型变成一段音频从你电脑的扬声器放出来。关键点在于语音只是入口和出口的换装中间的理解与推理没有任何特殊逻辑。所以只要你的文字提问能用语音提问也一定能用。三步开启 Cherry Studio 语音输入输出第一步开启麦克风权限系统层面Windows设置 → 隐私和安全性 → 麦克风确保 Cherry Studio 的开关是开的。macOS系统设置 → 隐私与安全性 → 麦克风给 Cherry Studio 打勾。第一次调用时如果弹出授权框点允许。应用层面打开 Cherry Studio 的设置 → 模型管理确认你已经添加并配置好带语音speech和语音转文字transcription能力的供应商模型——模型列表的筛选栏里就有这两个标签数量大于 0 才说明能力就位。第二步选择识别语种识别语种直接决定 ASR 准不准全程说中文选zh-CN全程说英文选en-US中英混着说选你的主语言多数引擎对夹杂的另一种语言也有一定容错。第三步点按钮开始说话在输入区点麦克风图标 → 开始说话 → 说完再点一次或等它自动停转写结果会填进输入框你确认无误后正常发送即可。发送后若开启了语音回复回答会直接念出来。浏览器内核的识别引擎核心就是这一小段调用知道它的存在即可不需要你动手写// 桌面端调用系统识别引擎的最小配置 const recognition new SpeechRecognition() recognition.lang zh-CN // 识别语种 recognition.continuous false // 说完即停适合单次提问 recognition.interimResults true // 边说边出预览文字 recognition.start()进阶调参让识别更准、声音更自然跑通之后配置再微调几个参数听感和识别率都会有明显差别参数名默认值调高效果调低效果语速 rate1.0声音更急长回答更省时间但可能显得赶声音更慢适合听长文档、生词多的内容音量 volume1.0更响亮适合嘈杂环境更安静适合深夜听音调 pitch1.0音色更年轻音色更沉稳低沉识别语种 lang跟随系统——按主要语言设定——设定错误是识别差的第一嫌疑合成侧的关键参数就集中在一次调用里// 让 TTS 按你选好的音色和语速念出回答 const utterance new SpeechSynthesisUtterance(answer) utterance.voice pickedVoice // 选中的音色 utterance.rate 1.1 // 语速1.0 为正常 utterance.pitch 1.0 speechSynthesis.speak(utterance)调参小建议先固定音色只动语速找到不赶不拖的那个值再收尾。中文音色念英文术语时容易拗口可以把术语改成拼音写法或中英分句。长回答建议语速略高于 1.0短回答保持 1.0 更自然。用不了先看这 5 个问题1. 麦克风没反应 / 没有授权弹窗九成是权限没给。去系统隐私设置里确认 Cherry Studio 的麦克风开关然后重启应用。授权框错过一次的话开关常停在未询问状态。2. 识别率低转写驴唇不对马嘴按顺序排查语种设置是否和实际说话语言一致最常被忽略环境是否太吵试试靠近麦克风或换安静的地方是否咬字太快稍微放慢识别引擎对清晰短句友好得多。3. 有识别但没有声音输出先别怀疑模型依次检查系统音量与输出设备选对没有 → 应用里是否真的挂载了语音speech类型的模型 → 换一款 TTS 模型试试。三者都正常还无声大概率是模型请求报错点开消息气泡旁的错误详情看具体信息。4. 中英混说识别乱把lang固定成你的主语言比如zh-CN纯英文段落单独说一句。多数引擎对 10% 左右的夹杂词能容忍但整句切换就会崩。5. 延迟高说完要等很久延迟主要花在 ASR 转写和 TTS 请求上。可以换响应更快的供应商模型网络差时先切到更近的接入点长内容分段说比一口气说三分钟体验好得多。延伸参考想了解主进程与界面之间消息怎么传递docs/references/ai/core-architecture.md想看模型能力筛选speech / transcription 标签的实现src/renderer/pages/settings/ProviderSettings/ModelList/想深入看哪块代码可以从src/renderer/pages/settings/ProviderSettings/ModelList/ModelTypeFilterTabs.tsx入手语音模型的能力入口就定义在那一行的筛选列表里。【免费下载链接】cherry-studioAI productivity studio with smart chat, autonomous agents, and 300 assistants. Unified access to frontier LLMs项目地址: https://gitcode.com/GitHub_Trending/ch/cherry-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表