INTERN · SHANGHAI AI LABORATORY

书生大模型全景解读:一条语言线、一条视觉线,与一个实验室的开源棋局

访问官网 ↗

深度综述 · 含 FAQ 结构化数据 · 最后更新 2026-08-25

书生大模型(Intern 系列模型)是上海人工智能实验室推出的开源大模型体系的统称,其中语言模型线为书生·浦语(InternLM),多模态线为书生·万象(InternVL),外围还有评测、微调、部署等配套工具,官方称之为贯穿数据、预训练、微调、部署、评测五大环节的全链条开源体系[2]。「Intern」这个前缀既是「实习生」的缩写,也寄托着实验室对模型持续学习成长的期待。

01先看全家福:书生体系到底有多少成员

很多文章把「书生」直接等同于浦语,这是不准确的。按官方口径,书生是一个品牌家族,语言只是其中一条线。下表按公开资料整理主要成员,最新名单以官网为准[1]

成员定位一句话说明
书生·浦语 InternLM语言大模型家族最早成名的开源大语言模型系列,从中轻量级起步逐步扩展规格[5]
书生·万象 InternVL多模态大模型以视觉基础模型为底座、与大语言模型对齐的图文理解系列,官方称其为世界领先的开源多模态模型之一[1]
书生·浦语数学 / InternThinker 等专项与强推理方向如 2024 年初开源的 InternLM2-Math 数学模型[3],以及 2024 年末随浦语向社会开放时发布的强推理模型 InternThinker[6]
Intern-S 系列科学多模态方向面向科学研究的科学多模态大模型方向,具体版本与规格以官网发布为准[7]
司南 OpenCompass评测体系一站式大模型评测平台,收录大量评测集与题目,保障成绩可复现[2]
XTuner / LMDeploy / Lagent训练与部署工具链分别覆盖微调、压缩部署与智能体框架环节,多数支持免费商用[4]

02浦语线:从 7B 起步的语言主力军

书生·浦语是整个家族里故事最完整的一条线。它的打法可以概括为「中轻量级优先、全链条陪跑」:不追求首发最大参数,而是把几亿人到几百亿人都用得起的规格做扎实,再用工具链降低开发者的使用门槛。几个关键节点值得记住:

  • 2023 年中首代开源:以七十亿参数的基础与对话版本起步,是国内较早完整开放权重和训练细节的大语言模型之一。
  • 2024 年 1 月 InternLM2 换代:数据与训练管线升级,同期开源的 InternLM2-Math 以中轻量级参数刷新了开源模型的数学能力上限,还首次同时支持形式化数学语言与解题过程评价[3]
  • 2024 年中 InternLM2.5:提供 1.8B、7B、20B 多档规格,其中对话版出现主打百万级 token 上下文的 1M 变体,模型清单可在官方仓库逐条核对[5]
  • 2024 年末向社会开放并引入强推理:书生·浦语网页版向公众开放,界面同期发布强推理模型 InternThinker,主打数学、代码等复杂推理任务中的反思与纠错能力[6]
  • 此后持续迭代:仓库标题已列出 InternLM3 等后续世代,新版本的规格与许可请以 Release 记录为准[5]

03万象线:让模型看懂图的那一半

如果说浦语解决「读写」,万象 InternVL 解决的就是「看图」。它从放大视觉基础模型这一研究思路出发,把视觉侧编码器与语言模型对齐,逐步发展出覆盖不同参数规模的开源多模态家族。对使用者而言,万象线的价值在于:文档截图理解、图表问答、界面操作理解这类「图进文出」任务,可以直接用一个开源模型闭环,而不必再拼接 OCR 加语言模型的两段式方案。各代版本的尺寸矩阵与跑分更新频繁,动手选型前建议直接查看官方渠道的当前清单[1],本文不做具体数字转述以免过时。

两条线的关系不是并列而是互补:万象的视觉侧需要语言模型做推理中枢,浦语的对话体验也因多模态输入而拓宽场景。这也是为什么书生体系坚持把两线放在同一个品牌下运营——单点模型易被超越,成体系的组合才是护城河。

04横向参照:与 Qwen、Llama 怎么比

对 Qwen 通义千问两者同为中文基因浓厚的开源系,Qwen 背靠阿里巴巴的商业云生态,规格货架更全;书生的差异点在「实验室属性」——评测体系、训练工具与模型出自同一团队,端到端复现门槛更低。
对 Llama 系列Llama 是全球生态最大的开源权重系,第三方适配几乎无处不在;书生在中文语料处理与本土合规上更顺手,且工具链文档以中文为主,国内团队的上手成本明显更小。
共同趋势三方都在往长上下文、强推理与多模态三个方向卷。对使用者来说,与其站队,不如把三家当同一批「可自托管的基础设施」,按任务切换。

以上为定性观察而非基准测试结论;各家迭代极快,选型请以最新官方评测与自有业务实测为准。

05商用之前:三件必须确认的事

一查许可证。实验室多次强调相关模型与工具「免费商用」[2],但不同仓库、不同版本的具体协议文本可能存在差异,商用前请打开目标版本仓库的 LICENSE 与 Model Card 逐条确认。

二对规格。参数规模、上下文长度、是否含对话版,这些字段在 Hugging Face 与魔搭的组织页都有逐版本列表[8][9],别凭记忆下单算力。

三留证据。把决定采用的版本号、协议快照存档,方便后续审计与复现。

06常见问题

书生大模型和 InternLM 是什么关系?

书生是上海人工智能实验室大模型成果的品牌统称,InternLM(书生·浦语)是其下的开源语言模型系列;此外还有万象多模态、专项数学与强推理模型以及评测训练工具链等成员。

浦语和万象两条线怎么分工?

浦语负责纯文本的理解与生成,万象负责图像等多模态输入的理解,二者在同一家族内互补,很多应用会把它们组合成「图进文出」的完整链路。

书生系列可以免费商用吗?

实验室在发布 XTuner 等全链条工具时明确提供免费商用,但个别仓库或版本的协议文本可能不同,商用前应以对应仓库 LICENSE 与 Model Card 为准。

与 Qwen、Llama 相比应该选谁?

三者都是主流开源选择:追求中文与本土工具链顺滑可选书生系,需要最庞大的第三方生态可考虑 Llama,想要丰富的现成规格与云端配套可评估 Qwen;最终建议以自有业务实测为准。

如何第一时间跟进新版本?

关注 intern-ai.org.cn 官网、InternLM 的 GitHub 组织以及 Hugging Face、魔搭上的官方组织页,新版本通常会在这些渠道同步发布。

参考资料

  1. 来源:书生大模型官方网站(书生·浦语、书生·万象等产品入口)intern-ai.org.cn
  2. 来源:上海人工智能实验室《发布大模型训练工具箱 XTuner,大幅降低训练成本》(全链条开源体系表述)shlab.org.cn
  3. 来源:上海人工智能实验室《书生成数学「课代表」,开源发布书生·浦语数学》shlab.org.cn
  4. 来源:InternLM 官方 GitHub 组织(xtuner、lmdeploy、lagent 等仓库)github.com/InternLM
  5. 来源:InternLM 系列模型官方仓库(历代版本清单与 Release 记录)github.com/InternLM/InternLM
  6. 来源:金台资讯(网易号)《上海人工智能实验室开放「书生·浦语」大模型》163.com
  7. 来源:书生大模型对话站点(Intern-S 系列在线入口)chat.intern-ai.org.cn
  8. 来源:Hugging Face · internlm 官方组织页huggingface.co/internlm
  9. 来源:魔搭社区 · 上海人工智能实验室官方组织页modelscope.cn
青衣网络 AI 观察团队 · 最后更新 2026-08-25