澜舟科技 Langboat // 孟子 Mengzi 开源模型 访问官网 ↗
  • 轻量化预训练模型
  • BERT / T5 兼容
  • 多任务 Zero-Shot
  • Apache-2.0 开源
  • 中文 NLP
  • 金融 / 多模态

「10 亿参数干翻千亿模型」背后的孟子开源体系,到底开放了什么

2021 年 7 月,中文语言理解权威评测 CLUE 总榜被一家刚露面的创业公司刷新:澜舟科技用只有十亿(1B)参数的「孟子」轻量化模型,越过了此前由腾讯、搜狗、华为、阿里达摩院等巨头以百亿、千亿参数刷出的纪录。这件事本身已经够反常识,更关键的是——澜舟很快把这套模型家族开源了出来。本文带你逐一看清,孟子开源到底给了开发者哪些可以白嫖、可以商用的真东西。

一句话认识它:孟子(Mengzi)是澜舟科技(Langboat,2021 年 6 月由创新工场孵化、NLP 领域资深科学家周明创立)自研的轻量化中文预训练模型家族[1],核心理念是「小而精」而非「越大越好」,以远低于主流大模型的参数规模追求可低成本落地的工业级效果[2];其开源仓库集中托管在 GitHub 的 Langboat 组织下,覆盖文本理解、可控生成、多模态与中文版 BLOOM 裁剪等多个方向,并同时发布在 Hugging Face 与魔搭社区(ModelScope)[3]

一组「反共识」的开源模型家族

孟子开源最直观的价值,是一口气把多种架构、多种任务的模型都放了出来,而且刻意保持与社区主流架构兼容:BERT 系可直接替换现有权重,T5 系可无缝接入既有生成管线。下面按模块逐一拆解每个开源成员到底能干什么。

Mengzi-BERT-base

110M · 自编码 BERT 架构

通用中文自然语言理解底座,兼容原生 BERT 结构,可直接替换已有 BERT 权重用于文本分类、命名实体识别、关系抽取、阅读理解等任务,是整套家族里被调用最多的基础件[3]

Mengzi-BERT-base-fin

110M · 金融领域继续训练

在 Mengzi-BERT-base 之上用金融语料(金融新闻、公告、研报)继续训练,专门面向金融新闻分类、研报情感分析、公告信息抽取等垂直场景,比通用底座更懂行业黑话。

Mengzi-T5-base

220M · 编码-解码 T5 架构

可控文本生成模型,兼容 T5 结构,擅长文案生成、新闻生成、研报生成等「带条件」的生成任务;与 GPT 式续写定位不同,它更适合先定义任务再产出,而非自由接龙。

Mengzi-T5-base-MT

220M · 27 数据集 / 301 prompt 多任务

多任务版本,用 27 个数据集与 301 种 prompt 混合训练,提供出色的 Zero-Shot 与 Few-Shot 能力,曾在 ZeroCLUE 与 FewCLUE 双榜排名第一,一个模型就能覆盖情感分类、实体抽取、新闻分类等多类任务[4]

Mengzi-Oscar-base

110M · 多模态图文

基于 Mengzi-BERT-base 的多模态模型,在百万级图文对上训练,用于图片描述(image caption)与图文互检,是家族里少有的「看懂图」的成员。

Mengzi-GPT-neo-base

125M · 自回归 GPT 架构

基于中文语料从头训练的 GPT-Neo 风格续写模型,定位是文本续写类任务的 baseline,也常用于教学与对比实验,方便研究者快速验证思路。

BLOOM-zh 中文裁剪系列

389M ~ 6.4B · 多档位

把多语言 BLOOM 按中文语料裁剪出 389M、800M、1.4B、2.5B、6.4B 等多个中文版本,显著降低显存需求,让中小团队也能跑起较大规模的中文生成模型。

Guohua-Diffusion

国画风 · 文生图

基于 Stable Diffusion v1 微调的国画风格文图生成模型,把孟子的能力从语言拓展到视觉,证明这套开源体系并非只停留在 NLP 一亩三分地。

需要厘清:孟子开源模型与澜舟后来的商用「孟子大模型 / 孟子言道」企业级产品是两回事。前者是放出来的预训练权重与基线模型,偏研究与轻量落地;后者是叠加了行业数据、Agent 与企业服务的付费平台,二者定位不同,别把开源权重当成完整商用大模型来用。

一条典型工作流:从 clone 仓库到上线推理

孟子开源之所以对工程友好,很大程度上因为它完全走在 Hugging Face transformers 的标准轨道上。下面是一套最常见的落地流程,你不必另学一套私有框架。

  1. 选模型看清单:先到 GitHub 的 Langboat/Mengzi 仓库核对模型清单与参数量,明确自己要的是理解(BERT 系)、可控生成(T5 系)还是多任务(T5-MT),避免选错架构导致后续返工[3]
  2. 装依赖:执行 pip install transformers 即可,无需编译 CUDA 扩展;如需在百度生态使用,仓库也给出 PaddleNLP 加载示例,但要注意 PaddleNLP 版本并非澜舟官方产品,效果与责任不在官方承诺范围内。
  3. 加载权重:BertModel.from_pretrained("Langboat/mengzi-bert-base")T5ForConditionalGeneration.from_pretrained("Langboat/mengzi-t5-base") 直接拉取,Hugging Face 与魔搭社区都同步了权重,国内网络可优先走 ModelScope 镜像。
  4. 下游微调:BERT 系在自有标注数据上做几轮 fine-tune 即可用于分类、抽取;T5 系则构造输入-输出对做序列到序列训练,金融、营销等垂直领域用领域语料继续训练能明显提分。
  5. Prompt 驱动(多任务模型):若用 Mengzi-T5-base-MT,可借助 301 种 prompt 模板直接做 Zero-Shot / Few-Shot,很多时候无需标注数据就能先跑通原型,再决定是否投入微调。
  6. 部署推理:轻量化参数(最小仅 60M 的蒸馏版)对显存友好,可部署在普通显卡甚至边缘设备;推理用标准 pipeline 接口封装成服务,配合模型量化进一步降本。

场景对照表:什么任务用哪个孟子模型

模型一多就容易犯选择困难。这张表把高频任务直接映射到推荐模型,帮你少走弯路。

任务类型推荐模型架构关键说明
文本分类 / 情感分析Mengzi-BERT-baseBERT直接替换现有 BERT 权重,迁移成本最低
金融新闻分类 / 研报抽取Mengzi-BERT-base-finBERT金融语料继续训练,行业术语更准
命名实体 / 关系抽取Mengzi-BERT-base 或 T5-MTBERT / T5结构化抽取优先 BERT;零样本可用 T5-MT
营销文案 / 新闻生成Mengzi-T5-baseT5可控生成优于 GPT 式续写,输出更贴任务
多任务一模型通吃Mengzi-T5-base-MTT527 数据集 + 301 prompt,Zero/Few-Shot 双榜第一
图片描述 / 图文检索Mengzi-Oscar-base多模态百万图文对训练,图文互检可用
文本续写 / baselineMengzi-GPT-neo-baseGPT自回归续写,适合做对照实验
较大规模中文生成BLOOM-zh 系列解码多档位裁剪,按需选显存友好版本

和主流开源大模型比,孟子开源的差异在哪

今天提到开源大模型,很多人第一反应是百川、通义千问、ChatGLM 这类动辄数十亿到数百亿参数的对话模型。孟子开源走的是另一条路,二者的取舍值得讲清楚。

孟子开源的立身之本

  • 轻量可落地:核心成员仅 60M~220M,单机显卡即可训练与推理,中小企业与科研个人都负担得起,不像超大模型那样「训练贵、部署更贵」。
  • 架构兼容:严格对齐 BERT / T5,已有项目几乎零改动就能换上孟子权重,迁移摩擦极小。
  • 多任务与零样本:T5-MT 一个模型覆盖数十种任务,配合 prompt 模板即可上手,省去逐个训练的成本。
  • 垂直友好:金融版、营销版等继续训练版本,对行业语料做了专门适配。

它有意不做的

  • 不追参数规模:孟子刻意不做千亿级对话基座,因此没有原生超长对话与强推理能力,不能直接当 ChatGPT 平替。
  • 非统一对话入口:各模型按任务切分,没有像百川 / 千问那样开箱即用的「一个聊天框」体验。
  • 训练代码未开源:官方明确表示因与内部基础设施耦合较紧,暂无计划开源训练代码,想复现需自行实现。
  • PaddleNLP 版非官方:社区移植的 PaddleNLP 权重不是澜舟产品,效果与责任不归官方。

简言之,如果你要的是「低成本把 NLP 能力嵌进现有业务」,孟子开源非常对口;如果你要的是「开箱即聊的通用大模型」,那它本就不是为此设计。把它和百川、千问摆在同一个擂台比对话,其实是用错了坐标系。

三个最容易踩的坑

01

把 T5 当 GPT 用。Mengzi-T5-base 是编码-解码结构、做可控生成,不擅长自由续写;想续写文案请用 Mengzi-GPT-neo-base 或 BLOOM-zh 系列,否则会出现「生成到一半接不上」的尴尬。

02

忘了给多任务模型写 prompt。Mengzi-T5-base-MT 的威力来自 301 种 prompt 模板,不写 prompt 直接丢句子,效果会大打折扣;上线前务必对照仓库 README 把任务模板补齐。

03

误以为金融模型数据免费可商用。金融版训练数据来自网页爬取的金融新闻、公告、研报,模型权重虽开源,但原始语料的版权与合规边界不在开源许可覆盖范围内,商用前请自行评估数据源合规。

常见问答

孟子开源模型和澜舟商用的「孟子大模型」是什么关系?

孟子开源是澜舟放出的预训练权重与基线模型集合,偏向研究与轻量落地,采用 Apache-2.0 等宽松协议;商用「孟子大模型 / 言道」企业平台则在开源底座之上叠加行业数据、Agent 与付费服务。二者同源不同层,开源权重不等于完整商用大模型。

它和原生 BERT、T5 兼容吗,老项目能直接换吗?

完全兼容。孟子明确保持与 BERT、T5 一致的模型结构,Mengzi-BERT-base 可直接替换现有 BERT 权重,Mengzi-T5-base 可无缝接入既有 T5 生成管线,迁移几乎零成本,这也是它工程友好的核心原因。

开源协议允许商用吗?

主要模型以 Apache License 2.0 发布,允许商业使用、修改与再分发,但需保留版权与许可声明,且不提供任何担保;具体以各模型仓库 LICENSE 文件为准,金融语料与第三方移植版的合规边界需自行确认。

本地最低要什么配置才能跑起来?

很轻。最小蒸馏版 Mengzi-BERT-L6-H768 仅 60M,普通笔记本 CPU 也能推理;220M 的 T5 系列在入门级显卡上即可微调。相比动辄需要多卡A100的超大模型,孟子对硬件极其友好。

多任务模型 Mengzi-T5-base-MT 到底强在哪?

它在 mengzi-t5-base 上用 27 个数据集、301 种 prompt 做多任务混合训练,提供强 Zero-Shot / Few-Shot 能力,曾登顶 ZeroCLUE 与 FewCLUE 双榜;一个模型即可覆盖情感分类、实体抽取、新闻分类、广告文案等多种任务,大幅降低逐个训练的成本。

和百川、通义千问这类开源大模型比该怎么选?

百川、千问主打数十亿到数百亿参数的对话与通用能力,开箱即聊;孟子主打十亿级以内的轻量、垂直、可嵌入业务。要通用对话选前者,要把 NLP 能力低成本嵌进现有系统、尤其金融与多任务场景,孟子更对路,二者坐标系不同不宜硬比。

权重除了 GitHub 还能在哪下?

除 GitHub 的 Langboat/Mengzi 仓库外,模型同步发布在 Hugging Face 的 Langboat 组织与魔搭社区(ModelScope),国内网络可优先走 ModelScope 镜像;部分模型也提供 PaddleNLP 加载示例,但那是社区移植、非官方产品。

参考资料

  1. 来源:澜舟科技官方新闻——周明博士报告与孟子轻量化模型开源说明(CLUE 登顶、四个开源模型清单):https://www.langboat.com/about/news/2021102401
  2. 来源:arXiv 技术报告《Mengzi: Towards Lightweight yet Ingenious Pre-trained Models for Chinese》(Zhang, Zhang, Chen, Guo, Hua, Wang, Zhou, 2021):https://arxiv.org/abs/2110.06696
  3. 来源:GitHub — Langboat/Mengzi 官方开源仓库(全部模型清单、参数量、下载链接与 README):https://github.com/Langboat/Mengzi
  4. 来源:Hugging Face — Langboat 组织下的孟子系列模型(Mengzi-T5-base-MT 等权重与调用示例):https://huggingface.co/Langboat/mengzi-t5-base-mt
  5. 来源:魔搭社区 ModelScope — 孟子 T5 多任务模型(27 数据集、301 prompt 训练说明与推理代码):https://modelscope.cn/models/langboat/mengzi-t5-base-mt/summary
  6. 来源:科技日报数字报——《AI 正快速向认知智能迈进》(孟子轻量化模型登顶 CLUE 及 HICOOL 2021 获奖报道):https://digitalpaper.stdaily.com/http_www.kjrb.com/kjwzb/html/2021-11/30/content_526136.htm
  7. 来源:搜狐科技——《AI 企业「澜舟科技」自研开源语言大模型》(孟子开源模型家族与商业化路径报道):https://www.sohu.com/a/646875470_114778

青衣网络 AI 观察团队 · 最后更新 2026-08-25 | 本文基于澜舟科技官方公开信息与第三方权威报道整理,用于帮助开发者了解孟子开源模型的定位、能力边界与适用场景;模型清单、协议与下载地址随时可能调整,实际使用请以官方仓库与 LICENSE 文件最新内容为准。