讯飞语音合成 · TTS

让机器开口说话这件事,讯飞做了二十多年:语音合成能力版图与接入实战

最后更新 2026-08-25类型:文字转语音 API适合:开发者 / 产品经理

访问官网 ↗

讯飞语音合成(Text To Speech,业内常简称讯飞 TTS)是科大讯飞通过讯飞开放平台对外提供的文字转语音服务:开发者调用在线语音合成 WebSocket 接口或长文本合成接口,把一段文本实时转换成音色、语速、语调均可配置的自然人声[1]。它也是国内 IVR 呼叫中心、读屏软件与有声内容生产链条中出现频率相当高的商用合成引擎。

一、从实验室到产业底座:一条按年头排开的积累曲线

看懂一款 TTS 引擎的可靠程度,光听两段 demo 不够,更值得看的是它的时间纵深——合成效果可以靠一次模型升级追上来,但音色资产、工程稳定性和行业适配是逐年沉淀的。

  • 1999 年科大讯飞在合肥成立,创始团队来自中国科技大学人机语音通信实验室,创业方向从一开始就锁定智能语音。[5]
  • 2008 年公司在深圳证券交易所上市,成为国内语音技术领域最早的上市公司之一,语音合成长期是其电信级业务的基本盘。
  • 2010 年讯飞开放平台上线,语音合成与语音识别是最早一批对第三方开发者开放的能力,移动 App 内嵌 TTS 的第一波需求由此被承接。
  • 近年在线语音合成扩展出中英粤多语种、川豫陕东北等多方言与十余个小语种发音人,并上线发音人自训练平台:上传 10~15 分钟合规录音即可自动化训练专属音色。[4]

这条曲线的实际意义在于:今天接入的接口背后,是一套已经跑过电信外呼、车载导航、智能硬件等大规模场景的工程体系,而不是一个刚从论文里走出来的原型。

二、音色库、情感风格与方言:把「能力清单」拆到参数级

音色库:免费底盘加付费特色层

官方服务说明明确列出了免费赠送的基础发音人:小燕、许久、小萍、小婧、许小宝,覆盖标准男女声与童声;特色发音人则按年授权,文档示例价格为 2 万元/年,实际以控制台报价为准[2]。长文本接口文档还给出了带明确风格标签的新一代音色:

发音人参数值 vcn风格定位
希涵x4_yeting游戏影视解说女声
关山-专题x4_guanshan专题片、纪录片男声
千雪x4_qianxue阅读听书女声
豆豆x4_doudou男童声,儿童内容常用
聆小臻x4_lingxiaozhen_eclives电商直播广告女声

所谓「情感能力」,在这套体系里主要体现为风格化的发音人和可调参数:语速、音量、音高各有 0~100 共 101 档(默认 50),另有背景音开关 bgs、数字读音策略 rdn、英文读音策略 reg 等,足以在同一个音色上调出播报感或讲述感的差异[1]。更细的情感档位因音色而异,以控制台发音人列表为准。

方言与小语种:一张少见的覆盖网

SDK 文档列出的中文语种与方言包括:普通话、英文、粤语、四川话、湖南话、河南话、东北话、陕西话、台湾普通话、山东话、湖北话、合肥话、内蒙古方言[5]。小语种新增日语、韩语、法语、俄语、西班牙语、德语、巴西葡萄牙语、意大利语、越南语、泰语、印地语、乌尔都语、维吾尔语、藏语等,但必须在控制台先开启小语种发音人,否则接口直接报 11200 错误[1]。对区域市场客服、方言短视频这类需求,这张覆盖网在国内供应商里属于明显靠前的位置。

三、场景选型表:无障碍、有声书、IVR 各自该怎么配

同一套引擎在不同场景里的正确打开方式差别很大,直接决定成品质量与成本:

场景关键诉求建议配置思路
无障碍读屏 / 信息播报低延迟、全天候稳定、成本可控免费基础发音人起步,配合离线 SDK 兜底弱网环境(离线音色库以官网为准)
有声书 / 长文章整本书一次成稿、少人工干预改用长文本语音合成接口:单次上限约 10 万字符,支持拼音标注;注意音频在云端只保存 7 天,要及时下载[3]
IVR 电话客服电话线路窄带宽、实时性优先采样率取 8k(auf=audio/L16;rate=8000),编码选 speex 或 opus 压缩格式[1]
短视频 / 广告配音记忆点强、风格夸张选用解说、直播广告类风格音色,叠加 bgs 背景音减少「干声感」

四、横向对比:面对 Azure、ElevenLabs、火山引擎时的真实位置

维度讯飞 TTSAzure TTSElevenLabs火山引擎 TTS
中文方言川、豫、陕、东北等十余种,覆盖面突出有中文方言音色但数量较少(以微软文档为准)以英文见长,中文方言薄弱主打普通话,方言有限
表现力路线风格化音色 + 参数细调,稳定耐听SSML 风格体系庞大声音克隆与情绪张力强,英文尤佳流行音色多,短视频适配好
超长文本长文本接口约 10 万字符/次批量合成管道成熟项目制长文支持支持长文本合成
计费结构基础音色免费 + 特色音色按年授权 + 套餐按字符用量计费订阅制额度按量付费为主
更适合国内 IVR、方言与政企场景全球化多语言应用英文内容与克隆需求直播、短视频量产

一句话概括取舍:如果业务主体在中国大陆、且绕不开方言播报或电话线路,讯飞的确定性更高;如果主力市场在海外或强依赖英文克隆表现力,再考虑另外三家,具体能力边界均以各家官方文档为准。

五、接入方式:WebSocket 五步走与五个高频坑

  1. 注册讯飞开放平台账号并完成实名认证,进入控制台。
  2. 创建应用,拿到 APPID、APIKey、APISecret 三元组,后续签名全靠它们。
  3. 在「在线语音合成 → 发音人授权管理」里添加目标发音人;可试用的发音人试用期为添加后的 15 天[2]
  4. 按文档的 HMAC 签名规则构造鉴权 URL,向 wss://tts-api.xfyun.cn/v2/tts 建立 WebSocket 连接[1]
  5. 发送 base64 编码的文本帧,循环接收音频帧、base64 解码并按序拼接;要 mp3 流式返回记得置 sfl=1[1]
踩坑清单(全部来自官方文档明示事项):①单次文本必须小于 8000 字节(约 2000 汉字),长文请先分句;②tte 编码参数与文本实际编码不一致时,会合成出「无意义音频」,表现为一堆噪声;③错误码 11200 通常意味着发音人未授权、授权到期或交互量超限;④小语种未在控制台开启就直接调用必然报错;⑤小燕等部分经典发音人使用 CSSML 静音标记时不支持 Unicode 编码,其余多数发音人可直接用「你好[p500]」这类简单标记插入停顿[1]

六、常见问题

讯飞 TTS 是免费的吗?

小燕、许久、小萍、小婧、许小宝五个基础发音人由官方免费赠送,新接入也有试用额度;特色发音人按年授权收费,价格以控制台实时报价为准[2]

一次最多能转多少字?

在线流式接口单次限 8000 字节以内(约 2000 汉字);整章、整篇的长内容应改走长文本语音合成接口,单次上限约 10 万字符[3]

能用我自己录制的声音吗?

可以。发音人自训练平台接受 10~15 分钟、无噪音无背景音的 wav 录音(单次最多 10 个文件、总量以平台提示为准),自动训练完成后提交 APPID 与版权声明申请商用,通过后即可按接口调用[4]

合成出来的音频可以商用吗?版权归谁?

商用前提是购买对应发音人授权或套餐;自训练音色在「申请商用」审核通过后,版权归属音频提供方,其余权利义务以官方协议为准[4]

合成结果听起来像机器人怎么办?

先换发音人再调参数是官方给出的第一建议:不同音色的自然度差异远大于参数影响;其次检查语速是否压到极端档位,并为文本补充标点帮助引擎断句[1]

离线环境能用吗?

官方区分在线与离线两条产品线:在线版效果好、发音人多,离线版响应快、适合无网设备,具体可授权的离线音色列表以官网为准[2]

参考资料

  1. 来源:讯飞开放平台《在线语音合成 API 文档》
  2. 来源:讯飞开放平台《在线语音合成服务说明》
  3. 来源:讯飞开放平台《长文本语音合成 API 文档》
  4. 来源:讯飞开放平台《发音人自训练平台使用指南》
  5. 来源:讯飞开放平台《在线语音合成 Android SDK 文档》
  6. 来源:Microsoft Learn《Azure 语音服务:文本转语音》
  7. 来源:ElevenLabs 官方文档站
  8. 来源:火山引擎《语音合成》产品页
青衣网络 AI 观察团队 · 最后更新 2026-08-25 · 本文基于公开官方文档整理,能力与价格细节以官网为准