一篇论文说清:为什么「小模型 + 好数据」,把 Llama-70B 按在地上摩擦
当整个行业都在比谁的参数量更大、谁烧的显卡更多时,零一万物在 2024 年 3 月挂上 arXiv 的这篇《Yi: Open Foundation Models by 01.AI》,给出的答案有点「反常识」:模型的性能,主要不来自参数规模,而来自被工程化打磨过的数据质量。它用一份只有 34B 参数的开源模型,在多个权威榜单上超过了参数量数倍于自己的对手,并把「数据工程」第一次写成了可复制的方法论。
一句话认识它:《Yi: Open Foundation Models by 01.AI》是零一万物(01.AI)团队于 2024 年 3 月 7 日提交、2025 年 1 月 21 日更新至 v3 的开源基础模型技术报告[1],系统披露了 Yi 模型家族(基于 6B 与 34B 预训练语言模型,并扩展出对话、200K 长上下文、深度上采样与视觉语言模型)的架构、训练基础设施与数据工程方法[1];论文把性能提升主要归因于一套级联去重与质量过滤的数据管线,并用 3.1 万亿 token 的中英双语语料完成了预训练[1]。
「堆参数」之外的另一条路:六张不规则差异卡
读懂这篇论文,关键不在于它有多大,而在于它在哪几个维度上和主流做法「不一样」。下面这六张卡片大小错落,对应论文里真正构成 Yi 差异化的六个支点——它们彼此不等权,有的决定上限,有的只是工程补充。
01数据工程优先,而非参数优先
论文开宗明义:Yi 系列能力「 primarily to its data quality resulting from our data-engineering efforts」。这不是口号——团队搭建了可评价、可扩展的智能数据处理管线,从 100 多 T 的原始数据里筛出 3T 高质量语料,并通过级联去重(cascaded deduplication)与质量过滤(quality filtering)保证干净度[1]。也就是说,先把「喂什么」做对,再谈「模型多大」。
023.1T token 中英双语
预训练语料规模为 3.1 万亿 token 的英文与中文混合语料,这是双语能力的基础,也是它在中文榜单(C-Eval、CMMLU)能压过一众英文优先模型的根本原因[1]。
03post-Chinchilla 过训练
论文明确称其模型-数据组合落在「post Chinchilla optimal regime」:用更多 token(约 3T)去过度训练一个相对小的 34B 模型,换取更低的推理成本与更强的性价比,而非盲目追大模型[1]。
04少于 1 万条「人工逐条验证」的指令数据
微调阶段,Yi 没有堆量,而是「polish a small scale(less than 10K)instruction dataset over multiple iterations,such that every single instance has been verified directly by our machine learning engineers」。即每条对齐样本都经过机器学习工程师直接核验,通过多轮打磨保证质量,而非靠海量弱标注数据凑数[1]。这解释了为什么 Yi-Chat 在人类偏好评测(AlpacaEval、Chatbot Arena)上表现突出。
05经典 Transformer + 精细优化
架构上 Yi 没有另起炉灶,而是站在经典 Transformer 之上,配合 Grouped-Query Attention、SwiGLU 等成熟优化,把工程稳定性与效率放在第一位[1]。
06200K 与深度上采样
通过轻量级持续预训练把上下文扩到 200K 并展示出强劲的「大海捞针」检索能力;又证明「通过持续预训练扩展预训练检查点的深度」能进一步提升性能,由此诞生了 Yi-9B 这类深度上采样变体[1]。
需要厘清:这篇「论文」是技术报告(technical report),不是某款可直接对话的 App。它描述的是模型家族的训练方法与能力边界;真正要上手,用的是论文配套的权重、代码与零一万物后续推出的对话/编程/多模态产品。论文本身采用 Apache 2.0(代码)与 Yi Series Models License(权重)双许可,权重对学术研究完全开放并支持免费商用申请。
从立项到 v3:Yi 家族的发展时间线
把论文放回公司叙事里,会看得更清楚:Yi 不是一次性发布的成品,而是一条「先基座、再扩展、再商业化」的演进路线。下面按时间梳理关键节点。
01.AI 零一万物成立
由李开复博士(Kai-Fu Lee)领衔创立,总部位于北京,定位 AI 2.0 大模型公司;据维基百科记载,其外部支持者包括阿里巴巴与小米的关联资本,成立约八个月后估值即突破 10 亿美元、跻身独角兽行列[5]。
Yi-34B 开源首发,登顶双榜
零一万物正式开源发布首款预训练大模型 Yi-34B(340 亿参数、中英双语),在阿里云魔搭社区 ModelScope 首发;以 70.72 分登顶 Hugging Face 英文预训练开源榜,并在 C-Eval 中文榜超越全球所有开源模型,成为「双料冠军」,同时公布可支持 200K 上下文窗口的版本计划[7]。
技术论文 v1 提交 arXiv
《Yi: Open Foundation Models by 01.AI》以 arXiv:2403.04652 首次提交,系统披露 6B/34B 基座、对话、长上下文、深度上采样、视觉语言五大方向的训练细节与评测结果[1]。
Yi-Coder 与 Yi-Lightning 接力
9 月推出覆盖 52 种编程语言、支持 12.8 万 token 上下文的编程模型 Yi-Coder;10 月发布千亿参数 MoE 模型 Yi-Lightning,在 LMSYS 国际盲测榜单排名世界第六、中国第一,并凭借每百万 token 约 0.14 美元的低成本刷新性价比记录[5]。
论文更新至 v3
arXiv 版本于 2024 年 12 月 30 日、2025 年 1 月 21 日两次更新至 v3,补充并校准了模型配置、评测与能力扩展章节,成为今日引用的权威底稿[1]。
从基座走向企业级落地
随着万智企业大模型平台、企业级多智能体等产品发布,零一万物把开源 Yi 底座的能力延伸到 ToB/ToG 的产业落地,形成「开源模型 + 商业平台」的双轮结构[4]。
Yi 模型家族一览表
论文本身聚焦 6B/34B 基座及其四类扩展,但结合零一万物后续公开信息,下表把整个 Yi 家族的关键成员、定位与出处整理成一目了然的对照。所有颜色均走变量,暗色模式自动切换卡片底色。
| 成员 | 参数 / 类型 | 核心特征 | 上下文 | 主要出处 |
|---|---|---|---|---|
| Yi-6B | 60 亿 · 基座 | 适合个人与研究用途的双语基础模型,轻量易部署 | 4K(基座) | arXiv:2403.04652[1] |
| Yi-34B | 340 亿 · 基座 | 中英双语、多项 SOTA,以更小尺寸超越 LLaMA2-70B / Falcon-180B | 4K(基座) | arXiv:2403.04652[1] |
| Yi-34B-Chat | 340 亿 · 对话 | 在基座上经少于 1 万条人工核验指令微调,人类偏好突出 | 4K | arXiv:2403.04652[1] |
| Yi-34B-200K | 340 亿 · 长上下文 | 轻量持续预训练扩展到 200K,约可处理 40 万汉字,大海捞针检索强 | 200K | DataLearner 模型卡[8] |
| Yi-VL | 视觉语言 | 聊天语言模型 + ViT 编码器,将视觉表征对齐到语言语义空间 | 4K | arXiv:2403.04652[1] |
| Yi-9B | 90 亿 · 深度上采样 | 由 Yi-6B 复制第 12–28 层做深度上采样,持续预训练后性能进一步提升 | 4K | arXiv:2403.04652[1] |
| Yi-Coder | 15 亿 / 90 亿 · 编程 | 覆盖 52 种编程语言,支持 12.8 万 token 上下文的编码助手 | 128K | Wikiwand 词条[5] |
| Yi-Lightning | 千亿 · MoE | LMSYS 盲测世界第六、中国第一,每百万 token 约 0.14 美元 | 商用规格 | Wikiwand 词条[5] |
和 Llama、DeepSeek 到底差在哪
很多人把 Yi、Llama、DeepSeek 都归到「开源大模型」一类,但三者的出发点并不相同。下面用左右对照,把 Yi 最该被记住的差异挑出来——不夸大,也不抹平真实差距。
Yi 的打法
- 数据工程优先:把性能提升归结为可复制的数据管线,而非单纯堆参数[1]。
- 小模型过训练:34B 配 3.1T token 走 post-Chinchilla 路线,推理更省、性价比更高。
- 双语原生:中英并重,中文榜单优势明显,适合中英混合场景。
- 精标对齐:少于 1 万条逐条人工核验的指令数据,呼应高质量而非高数量。
对照参照系
- Llama(Meta):同用经典 Transformer,但 Yi-34B 以约 1/2、1/5 的参数量在多项基准上超过 LLaMA2-70B、Falcon-180B,靠的是过训练与数据质量[1]。
- DeepSeek:同为国产自研开源路线,亦强调数据与方法;Yi 的论文则把「数据工程」写成独立章节,方法论披露更集中。
- 共同短板:论文坦言 Yi 在 GSM8k、MBPP 等数学与代码评测上略逊于 GPT 系列,因预训练有意保留通用能力、未过度加入数学/代码数据。
客观提醒:论文披露的基准对比以 2023–2024 年公开榜单为准,大模型迭代极快,今天的实际排名已变化;本页只还原论文与当时发布的事实,不构成对当前能力的断言。引用数据时请以最新官方评测为准。
常见问答
《Yi 技术论文》到底是什么,是某个 App 吗?
不是 App。它是零一万物团队发表在 arXiv 上的开源基础模型技术报告(编号 2403.04652),系统讲述 Yi 模型家族的训练方法、数据工程与评测。想真正使用模型,要下载对应权重或调用零一万物的对话/编程产品。
论文里最核心的观点是什么?
一句话:模型能力主要取决于被工程化打磨过的数据质量,而不是参数规模。论文用「级联去重 + 质量过滤」的数据管线,从 100 多 T 原始数据中筛出 3.1T 高质量中英双语语料完成预训练,这是 Yi 差异化的根源。
为什么 34B 的小模型能打过 70B 甚至 180B 的大模型?
关键在于「post-Chinchilla 过训练」:用远超计算最优(约 1T)的 3.1T token 去训练一个相对小的 34B 模型,换取更强性能与更低推理成本。论文明确称这种组合落在 post Chinchilla optimal regime,在多个基准上超过了 LLaMA2-70B、Falcon-180B。
200K 上下文、约 40 万汉字是真的吗?
论文披露通过轻量级持续预训练将上下文扩展到 200K,并展示了强悍的「大海捞针」检索表现;第三方模型卡与媒体发布稿也记载 Yi-34B-200K 可处理约 40 万汉字的超长文本,适合多文档阅读与超长知识库构建。
Yi 和 Llama、DeepSeek 的根本区别在哪?
三者都走开源路线,但 Yi 把「数据工程优先、小模型过训练、双语原生、精标对齐」写成可复制的方法论,并以更小参数量取得越级表现;数学与代码评测上则坦承弱于 GPT 系列,属于有意取舍而非能力缺失。
论文与模型权重可以商用吗,许可怎么算?
代码采用 Apache 2.0,预训练权重采用 Yi Series Models License,对学术研究完全开放,并支持申请免费商业授权。具体条款、可商用范围与合规要求以官方许可文本与零一万物官网公告为准。
零一万物这家公司靠不靠谱,背景是什么?
01.AI(零一万物)由李开复博士于 2023 年创立,总部在北京,外部支持者包括阿里巴巴、小米相关资本,成立约八个月估值即破 10 亿美元成为独角兽;其开源模型曾登顶 Hugging Face 与 C-Eval,后续推出 Yi-Coder、Yi-Lightning 及万智企业平台。
参考资料
- 来源:arXiv 论文原文《Yi: Open Foundation Models by 01.AI》(arXiv:2403.04652,v1 2024-03-07 / v3 2025-01-21):https://arxiv.org/abs/2403.04652
- 来源:01.AI 官方 GitHub 代码仓库(Yi 系列模型实现、配置与权重发布):https://github.com/01-ai/Yi
- 来源:Hugging Face 官方模型库(01-ai 组织,Yi-34B / Yi-VL / Yi-Coder 等权重):https://huggingface.co/01-ai
- 来源:零一万物官方网站(公司主体、发展时间线与 Yi 产品矩阵介绍):https://www.lingyiwanwu.com/about.html
- 来源:Wikiwand / 维基百科 — 01.AI 公司词条(成立时间、李开复创立、估值与产品序列):https://www.wikiwand.com/en/01.AI
- 来源:36氪 — 零一万物开源大模型 Yi-34B 报道(登顶 Hugging Face、C-Eval 双料冠军):https://m.36kr.com/p/2508237952516101
- 来源:央广网 — 零一万物大模型 Yi-34B 报道(200K 上下文、训练成本下降 40%):https://tech.cnr.cn/techph/20231106/t20231106_526476893.shtml
- 来源:DataLearner AI — Yi-34B-200K 模型卡(参数、上下文长度与许可信息):https://datalearner.com/ai-models/pretrained-models/Yi-34B-200K
青衣网络 AI 观察团队 · 最后更新 2026-08-25 | 本文基于 arXiv 论文及零一万物公开资料整理,用于帮助读者理解 Yi 技术报告的方法论与能力边界;基准排名、产品矩阵与许可条款随时可能更新,实际使用请以官方最新公告与许可文本为准。