讯飞智作
把 虚拟数字人、超拟人 TTS 与智能剪辑 装进一个创作台——输入文字或录音,就能产出带数字人讲解的音视频,让没有拍摄团队的人也能稳定产出专业内容。
一句话定义
讯飞智作 是科大讯飞旗下的 AIGC 音视频内容创作平台,基于语音合成、虚拟数字人与星火大模型等核心 AI 技术,为教学培训、产品营销、新闻发布等场景提供高效的音视频生成服务[1]。它主打「无需专业技能,即可快速完成多场景音视频内容制作」:在虚拟 AI 演播室输入文本或录音,一键输出音视频作品,官方称 1 分钟长度视频约 3 分钟内渲染出稿[2]。
一、能力画廊:它能做出哪些「作品」
讯飞智作不是单一功能,而是一组可组合的创作能力。下面用画廊方式呈现它最常见的产出形态。
AI 虚拟人视频
在虚拟演播室输入文本或录音,一键完成音视频输出;内置上百款 2D/3D 虚拟形象,涵盖商务、休闲、专业主播等风格。
精品声音复刻
一句话即可复刻声音,让 AI 替你发声;上百个高品质音库覆盖新闻播报、纪录片、视频解说等多种风格与多语种。
秒级数字分身
上传 1 分钟视频即可秒级构建数字分身,5 分钟视频可定制专属虚拟数字人形象,沉淀个人声音与形象资产。
讯飞配音 TTS
基于全球领先 TTS 能力,输入文本、选择发音人即可一键生成专业音频,支持音量、语速、语调与换气标记调节。
虚拟人直播 / 交互机
AI 虚拟人直播机支持长时智能播、跨平台;交互机形象逼真、随时打断、低延迟,适用于客服与导览。
视频翻译与对口型
支持视频智能翻译与精准对口型,快速生成英、日、韩等多语种海外内容,适配全球化推广。
二、落地案例:五个行业的真实用法
讯飞智作的价值在场景里才看得清。下面按行业拆解它具体解决了什么麻烦。
口播新闻与公告
无需真人出镜,用数字人形象快速生成新闻播报、企业动态、政策解读、公告通知等口播视频,打造专业、统一的传播内容,支持多场景模板与 AI 配音。
PPT 一键转视频
上传 PPT 即可一键生成教学视频,数字人完成讲解、配音与画面呈现,大幅降低课程制作门槛,帮助老师与企业快速实现内容数字化与规模化培训。
种草与品牌短视频
结合 AI 数字人、智能配音、多模板创作与文生视频能力,无需复杂剪辑即可快速生成产品种草、品牌推广视频,支撑高频内容输出与营销转化。
多语种海外内容
通过视频智能翻译与精准对口型,快速生成英语、日语、韩语等多语种海外推广内容,帮助企业高效适配全球市场,提升国际传播效率。
三、两种创作形态:视频与音频怎么选
讯飞智作同时覆盖「AI+视频」与「AI+音频」两条线。下面把两者的适用边界对齐,方便你按内容形态选型。
| 维度 | AI + 视频(数字人) | AI + 音频(讯飞配音) |
|---|---|---|
| 产出形态 | 带数字人讲解的视频成片 | 专业配音音频 |
| 核心能力 | 虚拟人形象、声音复刻、智能剪辑 | 超拟人 TTS、多音库、韵律调节 |
| 典型场景 | 新闻播报、培训、营销短视频 | 有声阅读、纪录片、视频解说 |
| 制作门槛 | 输入文本/录音,模板套用 | 输入文本,选发音人即生成 |
| 多端支持 | Web 端创作演播室 | Android、Web 双端 |
| 渲染速度 | 1 分钟视频约 3 分钟出稿 | 文本即生成,实时试听 |
四、产品亮点与使用边界
2026 年 WAIC 上,讯飞智作携多项核心能力亮相,呈现 AI 在内容生产领域的落地价值。它的亮点集中在「低门槛」与「可定制」。
一张图生成数字人
支持上传一张照片生成专属数字人形象,一句话复刻声音,形象逼真、自然流畅,普通人也能拥有数字分身与声音资产。
多场景模板
覆盖新闻、培训、营销、短视频等多场景,套用即可快速成片,大幅降低专业拍摄与剪辑成本。
一站式生产
智能配音、数字人主播、视频素材一体化制作,从文案到成片在同一平台内闭环。
开放与生态
提供 API 接入与多端接口,灵活部署,并联合产业伙伴共建虚拟人生态,满足不同场景应用需求。