讯飞语音合成(Text To Speech,业内常简称讯飞 TTS)是科大讯飞通过讯飞开放平台对外提供的文字转语音服务:开发者调用在线语音合成 WebSocket 接口或长文本合成接口,把一段文本实时转换成音色、语速、语调均可配置的自然人声[1]。它也是国内 IVR 呼叫中心、读屏软件与有声内容生产链条中出现频率相当高的商用合成引擎。
一、从实验室到产业底座:一条按年头排开的积累曲线
看懂一款 TTS 引擎的可靠程度,光听两段 demo 不够,更值得看的是它的时间纵深——合成效果可以靠一次模型升级追上来,但音色资产、工程稳定性和行业适配是逐年沉淀的。
- 1999 年科大讯飞在合肥成立,创始团队来自中国科技大学人机语音通信实验室,创业方向从一开始就锁定智能语音。[5]
- 2008 年公司在深圳证券交易所上市,成为国内语音技术领域最早的上市公司之一,语音合成长期是其电信级业务的基本盘。
- 2010 年讯飞开放平台上线,语音合成与语音识别是最早一批对第三方开发者开放的能力,移动 App 内嵌 TTS 的第一波需求由此被承接。
- 近年在线语音合成扩展出中英粤多语种、川豫陕东北等多方言与十余个小语种发音人,并上线发音人自训练平台:上传 10~15 分钟合规录音即可自动化训练专属音色。[4]
这条曲线的实际意义在于:今天接入的接口背后,是一套已经跑过电信外呼、车载导航、智能硬件等大规模场景的工程体系,而不是一个刚从论文里走出来的原型。
二、音色库、情感风格与方言:把「能力清单」拆到参数级
音色库:免费底盘加付费特色层
官方服务说明明确列出了免费赠送的基础发音人:小燕、许久、小萍、小婧、许小宝,覆盖标准男女声与童声;特色发音人则按年授权,文档示例价格为 2 万元/年,实际以控制台报价为准[2]。长文本接口文档还给出了带明确风格标签的新一代音色:
| 发音人 | 参数值 vcn | 风格定位 |
|---|---|---|
| 希涵 | x4_yeting | 游戏影视解说女声 |
| 关山-专题 | x4_guanshan | 专题片、纪录片男声 |
| 千雪 | x4_qianxue | 阅读听书女声 |
| 豆豆 | x4_doudou | 男童声,儿童内容常用 |
| 聆小臻 | x4_lingxiaozhen_eclives | 电商直播广告女声 |
所谓「情感能力」,在这套体系里主要体现为风格化的发音人和可调参数:语速、音量、音高各有 0~100 共 101 档(默认 50),另有背景音开关 bgs、数字读音策略 rdn、英文读音策略 reg 等,足以在同一个音色上调出播报感或讲述感的差异[1]。更细的情感档位因音色而异,以控制台发音人列表为准。
方言与小语种:一张少见的覆盖网
SDK 文档列出的中文语种与方言包括:普通话、英文、粤语、四川话、湖南话、河南话、东北话、陕西话、台湾普通话、山东话、湖北话、合肥话、内蒙古方言[5]。小语种新增日语、韩语、法语、俄语、西班牙语、德语、巴西葡萄牙语、意大利语、越南语、泰语、印地语、乌尔都语、维吾尔语、藏语等,但必须在控制台先开启小语种发音人,否则接口直接报 11200 错误[1]。对区域市场客服、方言短视频这类需求,这张覆盖网在国内供应商里属于明显靠前的位置。
三、场景选型表:无障碍、有声书、IVR 各自该怎么配
同一套引擎在不同场景里的正确打开方式差别很大,直接决定成品质量与成本:
四、横向对比:面对 Azure、ElevenLabs、火山引擎时的真实位置
| 维度 | 讯飞 TTS | Azure TTS | ElevenLabs | 火山引擎 TTS |
|---|---|---|---|---|
| 中文方言 | 川、豫、陕、东北等十余种,覆盖面突出 | 有中文方言音色但数量较少(以微软文档为准) | 以英文见长,中文方言薄弱 | 主打普通话,方言有限 |
| 表现力路线 | 风格化音色 + 参数细调,稳定耐听 | SSML 风格体系庞大 | 声音克隆与情绪张力强,英文尤佳 | 流行音色多,短视频适配好 |
| 超长文本 | 长文本接口约 10 万字符/次 | 批量合成管道成熟 | 项目制长文支持 | 支持长文本合成 |
| 计费结构 | 基础音色免费 + 特色音色按年授权 + 套餐 | 按字符用量计费 | 订阅制额度 | 按量付费为主 |
| 更适合 | 国内 IVR、方言与政企场景 | 全球化多语言应用 | 英文内容与克隆需求 | 直播、短视频量产 |
一句话概括取舍:如果业务主体在中国大陆、且绕不开方言播报或电话线路,讯飞的确定性更高;如果主力市场在海外或强依赖英文克隆表现力,再考虑另外三家,具体能力边界均以各家官方文档为准。
五、接入方式:WebSocket 五步走与五个高频坑
- 注册讯飞开放平台账号并完成实名认证,进入控制台。
- 创建应用,拿到 APPID、APIKey、APISecret 三元组,后续签名全靠它们。
- 在「在线语音合成 → 发音人授权管理」里添加目标发音人;可试用的发音人试用期为添加后的 15 天[2]。
- 按文档的 HMAC 签名规则构造鉴权 URL,向 wss://tts-api.xfyun.cn/v2/tts 建立 WebSocket 连接[1]。
- 发送 base64 编码的文本帧,循环接收音频帧、base64 解码并按序拼接;要 mp3 流式返回记得置 sfl=1[1]。
六、常见问题
小燕、许久、小萍、小婧、许小宝五个基础发音人由官方免费赠送,新接入也有试用额度;特色发音人按年授权收费,价格以控制台实时报价为准[2]。
在线流式接口单次限 8000 字节以内(约 2000 汉字);整章、整篇的长内容应改走长文本语音合成接口,单次上限约 10 万字符[3]。
可以。发音人自训练平台接受 10~15 分钟、无噪音无背景音的 wav 录音(单次最多 10 个文件、总量以平台提示为准),自动训练完成后提交 APPID 与版权声明申请商用,通过后即可按接口调用[4]。
商用前提是购买对应发音人授权或套餐;自训练音色在「申请商用」审核通过后,版权归属音频提供方,其余权利义务以官方协议为准[4]。
先换发音人再调参数是官方给出的第一建议:不同音色的自然度差异远大于参数影响;其次检查语速是否压到极端档位,并为文本补充标点帮助引擎断句[1]。
官方区分在线与离线两条产品线:在线版效果好、发音人多,离线版响应快、适合无网设备,具体可授权的离线音色列表以官网为准[2]。