音色克隆
用一段录音生成专属音色,让数字员工用"你们公司的人"的声音说话
音色克隆(Voice Enrollment)的目的是:录一段样音 → 得到一个音色 ID → 之后合成都用这个音色。
流程
10 秒以上的清晰人声录音(同一人、无背景音乐、无多人对话)。
在平台侧上传样本,服务商返回一个 voice_id(永久有效,可反复使用)。
把 tts_voice_id 设为该音色 ID,引擎选对应的服务商,试听确认。
样本要求(决定成败的一步)
| 项目 | 要求 |
|---|---|
| 时长 | ≥ 10 秒(低于阈值直接拒绝,不要指望"短一点也能行") |
| 格式 | mp3 / wav / m4a 主流格式 |
| 体积 | 建议 ≤ 20 MB |
| 内容 | 单一说话人、语速平稳、无回声、无 BGM |
| 加分项 | 如果能提供「录音里说了什么」的文本(transcript),还原度通常更高 |
注意
合规红线:克隆他人音色必须取得本人明确授权。用于对外客服、电话外呼等场景时, 应当让听众知道对面是 AI。这不是"技术建议",是法律风险。
音色 ID 的工程细节
- 音色是资产:克隆出来的 ID 落库保存,可长期复用,不必每次重新克隆。
- 换服务商 = 音色失效:音色 ID 只在对应服务商有效。迁移服务商时必须提示重新克隆,不要静默失败。
- 多引擎路由:平台侧的音色 ID 通常带前缀标识来源引擎,便于"同一个助手在不同引擎间切换"。
- 失败要显式:克隆失败必须报错,不能生成一个默认音色冒充成功——用户会以为"克隆没效果"。
什么时候值得做克隆
| 场景 | 建议 |
|---|---|
| 企业对外数字员工(统一品牌声音) | ✅ 值得,一次投入长期使用 |
| 个人助手陪伴 | ✅ 有情感价值 |
| 临时演示 | ❌ 用现成音色即可 |
| 客服电话外呼 | ⚠️ 必须做合规审查 |