悟道启示录:把参数规模推上世界之巅的一次中国尝试

北京智源人工智能研究院 · 超大规模预训练模型系列 · 2021 年发布

访问官网 ↗

史料梳理向长文 · 引用 7 处公开来源 · 含时间线与开源成果清单

“如果将大模型和所有的 AI 应用相连接……全社会将形成一个智能能力生产和使用的网络,即‘智网’。大模型就是下一个 AI 的基础平台。”

—— 时任智源研究院理事长张宏江,2021 北京智源大会[3]

悟道(WuDao)是北京智源人工智能研究院(BAAI)牵头研发的超大规模预训练模型系列:「悟道 1.0」于 2021 年 3 月 20 日发布,被称为中国首个超大规模智能模型;两个月后的 6 月 1 日,「悟道 2.0」以 1.75 万亿参数亮相,为当时全球参数规模最大的预训练模型[2][5]。它是中国“通用人工智能路线”叙事中绕不开的一章。

从建院到万亿参数:一条时间线

  1. 北京智源人工智能研究院成立,采用“民间出资、政府支持、学术自治”的新型研发机构模式,此后成为北京 AI 版图中的关键节点。

  2. CPM-1 问世:26 亿参数的中文预训练语言模型,支持简单对话、文章生成等任务,被视为悟道体系的前奏[6]

  3. 「悟道 1.0」发布,训练出中文、多模态、认知、蛋白质预测四大方向的系列模型,被官方称为中国首个超大规模智能模型[4]

  4. 2021 北京智源大会开幕日,「悟道 2.0」发布:1.75 万亿参数,是 GPT-3 的十倍,打破此前谷歌 Switch Transformer 创造的 1.6 万亿纪录,官方称其在多项国际基准上取得领先[2]

  5. 智源与新华社、美团、小米、快手、搜狗、360、寒武纪、第四范式、好未来、智谱华章等 22 家单位签署产业生态合作,并倡议组建大模型技术创新生态联盟[3]

  6. 悟道进入 3.0 阶段:“悟道·天鹰”(Aquila)语言大模型与“悟道·视界”视觉大模型系列陆续发布并开源[1],智源的研究重心也转向更广泛的 AGI 议题。

参数规模怎么读:三个数字的定性拆解

1.75 万亿悟道 2.0 参数量,约为 GPT-3 的 10 倍
4.9 TB训练语料总量(中英双语+图文)
22 家首批产业生态战略合作单位

先说数据构成:悟道 2.0 在中英双语共 4.9TB 清洗后的数据上训练,其中包含 WuDaoCorpora 的 1.2TB 中文文本、2.5TB 中文图文,以及 Pile 数据集的 1.2TB 英文文本[2]。英文媒体当时的报道同样采用了这一口径,并称其为“迄今最大的语言 AI 系统”[5]

再说必须补上的一句技术注脚:悟道 2.0 采用的是混合专家(MoE)架构,而 GPT-3 是稠密(dense)模型——两者的参数并不在同一口径上。维基百科条目明确提醒,基于参数量的直接对比并不能等同于质量对比,万亿级 MoE 的实际表现可能与小它数百倍的稠密模型相当[5]。这不是贬低:FastMoE 高效训练框架正是悟道团队的原创贡献之一,还曾在国产神威超算平台上部署[4]。理解了这一点,才能既承认它的工程分量,也不被“全球最大”四个字带偏。

四个“文”字辈:悟道 1.0 的家族分工

文源中文语言

面向中文的大规模生成式语言模型,解决中文语料占比偏低的行业痛点。

文澜多模态

中文图文对齐的多模态模型,让机器“看图说话”,后续演化出开放研究版本。

文汇认知

面向认知任务的超规模新型预训练模型,承担推理与问答方向探索。

文溯生物预测

蛋白质结构预测方向的模型,把大模型方法延伸到生命科学基础研究。

这套“四兄弟”命名出自发布方对模型矩阵的划分[4]。放在今天看,“一个研究院同时押注四个方向”的做法颇为超前,也预示了大模型后来按模态分工演化的行业格局。

比模型更持久的遗产:开源生态盘点

开源成果说明
WuDaoCorpora 语料库配套建设的大规模中文语料数据库,含中文文本、多模态与对话数据集,对外提供数据支撑[2]
CPM 系列CPM-1(26 亿)与 CPM-2(110 亿及 1980 亿 MoE 版)中英双语模型,代码与权重对外开放[6]
EVA 对话模型28 亿参数的开放域中文对话预训练模型,在悟道对话数据集(WDC)上训练。
CogView 文生图40 亿参数的中文多模态生成模型,早于当前文生图热潮两年面世。
BriVL 多模态模型首个中文通用图文大规模预训练模型之一,在图文检索任务上表现优异。
FastMoE 框架降低 MoE 训练门槛的开源分布式训练框架,支持多种均衡策略。
天鹰 Aquila / 视界系列悟道 3.0 阶段的语言与视觉大模型,延续“发布即开源”的路线[1]

这份清单解释了一个现象:即便“悟道”这个名字的热度随时间消退,它沉淀的数据集、训练框架与模型权重,仍在后来几年的中文开源社区里持续流通。

历史意义评估:得分与存疑

它确实做到了

  • 把“炼大模型”从论文话题变成国家级基础设施议程,“大模型+大算力”路线由此获得政策与产业双重背书[3]
  • 建成当时全球最大的中文语料库并开放,补上了中文 AI 的数据短板;
  • 以 MoE 工程实践和 FastMoE 框架积累了分布式训练的公共知识;
  • 带动了一批生态伙伴与人才流向后来的大模型创业浪潮。

它没能回答的

  • 参数规模的宣传口径与用户体验之间存在落差,MoE 与稠密模型的对比争议至今仍被讨论[5]
  • 没有演化出一个像 GPT 系列那样面向公众的对话产品,影响力停留在研究与产业侧;
  • 商业化路径依赖合作企业各自落地,“智网”愿景未在其自身体系内闭环;
  • 后续迭代声量减弱,公众记忆逐渐让位于 2023 年之后的对话式产品。

公允地说,悟道的角色更像“铺路石”而非“终点站”:它验证了中国团队组织超大规模训练的能力,把语料、算力、联盟这些要素摆上了桌面。两年后国产大模型的集体爆发里,能隐约看到这条路的方向盘痕迹。

常见问题

  • 悟道模型现在还能使用吗?

    悟道体系的多个组成部分以开源形式留存:CPM、EVA、CogView 等模型代码与权重托管在 GitHub,天鹰、视界等新系列亦已开源,可在其官方渠道与代码仓库获取[6]。是否提供在线服务以官网为准。

  • 1.75 万亿参数为什么听起来比 ChatGPT 还大?

    因为口径不同。悟道 2.0 是 MoE 架构,参数分散在众多“专家”网络中,每次推理只激活一部分;GPT-3 是稠密模型,参数全部参与计算。维基百科条目特别指出,参数量的直接对比不能等同于能力对比[5]

  • 悟道和 ChatGPT 是什么关系?

    没有直接关系。悟道早于 ChatGPT 近两年发布,走的是学术机构牵头的开源研究路线;ChatGPT 则是 OpenAI 的商业对话产品。两者共同之处在于都验证了“大模型+大算力”这条技术路线的潜力。

  • 智源研究院是一家什么机构?

    它是 2018 年成立于北京的新型研发机构,由民间资金与政府支持共同运转,不隶属某一家企业。除悟道外,它还发起了智源大会、智源社区等学术公共品,研究范围覆盖视觉、认知、生命模拟等多个方向。

  • 回看悟道,它对中国 AI 行业最大的价值是什么?

    多数评论会指向两点:一是把超大规模训练的组织经验留在国内,二是把高质量中文语料变成公共资源。前者决定了“能不能造”,后者决定了“用什么造”——这两块基石在 2023 年之后的国产大模型竞争中反复被用到。

参考资料

  1. 来源:北京智源人工智能研究院官网·研究成果页(悟道系列与开源说明)https://www.baai.ac.cn/zh-cn/research
  2. 来源:国家科技传播中心《全球最大的超大规模智能模型“悟道2.0”发布》(2021-06)https://www.ncsti.gov.cn/kjdt/ztbd/xydrgzn/lbt_848/202106/t20210602_33563.html
  3. 来源:人民网《第三届北京智源大会开幕 全球最大智能模型“悟道2.0”发布》(2021-06)http://finance.people.com.cn/n1/2021/0603/c1004-32121141.html
  4. 来源:澎湃新闻《从“大炼模型”到“炼大模型”:1.75万亿参数,全球最大预训练模型“悟道2.0”问世》https://www.thepaper.cn/newsDetail_forward_12927359
  5. 来源:Wikipedia - Wu Dao 条目https://en.wikipedia.org/wiki/Wu_Dao
  6. 来源:GitHub - BAAI-WuDao 开源仓库(CPM/EVA/CogView/BriVL 等)https://github.com/BAAI-WuDao/Code
  7. 来源:智源研究院英文官网https://www.baai.ac.cn/english.html

青衣网络 AI 观察团队 · 最后更新 2026-08-25