语音能力总览
听得懂、说得出、有人形——通千算智的语音链路与配置全景
通千算智的语音能力分三层,可以只用其中一层,也可以全开:
| 能力 | 说明 | 关键配置 |
|---|---|---|
| 听(语音输入 ASR) | 说话代替打字,控制台麦克风按钮 / 语音消息 | speech_recognition、voice_to_text |
| 说(语音合成 TTS) | 把回复读出来,可挑音色、可克隆 | text_to_voice、tts_voice_id、voice_reply_voice |
| 形(数字人形象) | 网页端形象跟着语音开口(平台扩展能力) | 由平台侧配置 |
三步开起来
配置里把 speech_recognition 设为 true,并选定识别引擎(voice_to_text)。
设置 text_to_voice 与 tts_voice_id;想让"收到语音就回语音",把 voice_reply_voice 设为 true。
浏览器只在安全上下文(HTTPS 或 localhost)下允许麦克风。用 IP+HTTP 访问时,
麦克风按钮点了没反应通常就是这个原因。
支持的引擎
语音识别(voice_to_text):openai、ali(阿里云)、baidu、azure、google、xunfei、linkai
语音合成(text_to_voice):openai、ali(阿里云)、baidu、azure、google、xunfei、
elevenlabs、minimax、tencent、zhipuai、edge(免费、无需 Key)、pytts(纯离线)、custom(自建)
🔍
语音输入(ASR)
麦克风按钮、语音消息、引擎选型与常见故障
🧠
语音合成(TTS)
引擎、音色、什么时候回复语音、情绪与语速
🔑
音色克隆
用一段录音生成专属音色
👁️
数字人形象
让形象跟着语音开口(零 GPU 方案)
成本提示:edge 引擎完全免费但音色固定;商用音色建议用云端引擎(按时长计费)。
如果只是"偶尔听一下",先开 ASR、TTS 用 edge 试水,成本几乎为零。