首页 / 文档 / 语音 / 语音能力总览

语音能力总览

听得懂、说得出、有人形——通千算智的语音链路与配置全景

通千算智的语音能力分三层,可以只用其中一层,也可以全开:

能力 说明 关键配置
听(语音输入 ASR) 说话代替打字,控制台麦克风按钮 / 语音消息 speech_recognition、voice_to_text
说(语音合成 TTS) 把回复读出来,可挑音色、可克隆 text_to_voice、tts_voice_id、voice_reply_voice
形(数字人形象) 网页端形象跟着语音开口(平台扩展能力) 由平台侧配置

三步开起来

配置里把 speech_recognition 设为 true,并选定识别引擎(voice_to_text)。

设置 text_to_voice 与 tts_voice_id;想让"收到语音就回语音",把 voice_reply_voice 设为 true。

浏览器只在安全上下文(HTTPS 或 localhost)下允许麦克风。用 IP+HTTP 访问时, 麦克风按钮点了没反应通常就是这个原因。

支持的引擎

语音识别(voice_to_text):openai、ali(阿里云)、baidu、azure、google、xunfei、linkai

语音合成(text_to_voice):openai、ali(阿里云)、baidu、azure、google、xunfei、 elevenlabs、minimax、tencent、zhipuai、edge(免费、无需 Key)、pytts(纯离线)、custom(自建)

成本提示:edge 引擎完全免费但音色固定;商用音色建议用云端引擎(按时长计费)。 如果只是"偶尔听一下",先开 ASR、TTS 用 edge 试水,成本几乎为零。