DeepSeek(深度求索)是什么?
2026 年最全面的中文介绍
从公司背景、创始团队,到 V3 / R1 / V4 / R2 核心模型、MoE·MLA·GRPO 技术架构与开源定价策略,一文读懂这家重塑全球大模型格局的中国 AI 公司。
一句话定义
DeepSeek(深度求索),全称杭州深度求索人工智能基础技术研究有限公司,是2023 年 7 月由梁文锋(Liang Wenfeng)创立的中国人工智能研究公司,脱胎于量化私募幻方量化(High-Flyer)。公司以「推动通用人工智能(AGI)」为使命,并以 MIT / Apache 2.0 等宽松许可证开源全部大模型权重,凭借远低于行业的训练与推理成本,在 2025—2026 年迅速成为全球最具影响力的开源大模型厂商之一。
一、公司概况
DeepSeek 是一家以研究驱动、开源优先为核心理念的 AI 实验室。与多数以订阅或闭源 API 变现的前沿实验室不同,DeepSeek 将「把世界级模型免费开放给所有人」作为核心策略,主要产出是可直接下载、部署与商用的模型权重,而非消费级产品本身。
基础信息
| 项目 | 内容 |
|---|---|
| 公司全称 | 杭州深度求索人工智能基础技术研究有限公司 |
| 英文名 | DeepSeek / DeepSeek AI |
| 成立时间 | 2023 年 7 月[5] |
| 创始人 / CEO | 梁文锋(Liang Wenfeng) |
| 总部 | 中国 · 杭州 |
| 母公司 / 资金来源 | 脱胎于幻方量化(High-Flyer),早期完全由其注资 |
| 团队规模 | 约 160 人(2025),2026 年首轮融资后计划大幅扩招 |
| 使命 | 推动通用人工智能(AGI) |
| 官网 | deepseek.com · 开源主页 github.com/deepseek-ai |
创始人与团队哲学
梁文锋同时是幻方量化的联合创始人,在创办 DeepSeek 前已深耕 AI 驱动的量化交易系统。他倾向于招募年轻人才与跨学科背景成员,押注长期研究而非短期商业化,并曾公开表示 DeepSeek「没有 immediate 的变现计划」。2026 年,他在一场投资人闭门会议中明确表示:「DeepSeek 只有一条主线,即通往通用人工智能(AGI)。」
二、发展历程时间线
三、核心模型家族
DeepSeek 围绕不同任务构建了多个模型系列,开发者可按场景选择通用、推理、代码或多模态版本。
1. DeepSeek-V 系列(通用 / 旗舰)
V 系列是通用主力线,擅长写作、分析、指令遵循与工具调用。当前旗舰为 DeepSeek-V4:
- V4-Pro:1.6 万亿总参数、490 亿激活参数,支持 100 万 token 上下文窗口,在 SWE-bench Verified 达 80.6%,数学与竞赛代码测评超越当前所有开源模型。
- V4-Flash:2840 亿总参数、130 亿激活参数,更轻更快,适合高并发、低延迟场景。
2. DeepSeek-R 系列(推理)
R 系列是推理专精模型,通过强化学习在回答前进行多步「思维链」推理。代表为 DeepSeek-R1(2025 年 1 月,逼近 o1)与 DeepSeek-R2(2026 年开源权重推理模型,约 1310 亿参数 MoE,MMLU 达 92%+,API 价格较 R1 再降约 40%)。
3. 专项模型
- DeepSeek-Coder:代码专项,广泛用于 IDE 插件、代码审查。
- DeepSeek-VL / DeepSeek-OCR:多模态与文档识别。
- DeepSeekMath / Prover:数学与定理证明。
主要模型参数速览
| 模型 | 类型 | 总参数 | 激活参数 | 上下文 | 状态 |
|---|---|---|---|---|---|
| DeepSeek-V3 | 通用 | 671B | 37B | 128K | 已发布 |
| DeepSeek-R1 | 推理 | 671B | 37B | 128K | 已发布 |
| DeepSeek-V4-Pro | 通用旗舰 | 1.6T | 49B | 1M | 已发布 |
| DeepSeek-V4-Flash | 通用轻量 | 284B | 13B | 1M | 已发布 |
| DeepSeek-R2 | 推理开源 | ~131B | ~22B | 128K | 已发布 |
四、核心技术架构
DeepSeek 的「高性能 / 低成本」并非偶然,而是源于三项相互咬合的架构创新:
1. 混合专家架构(MoE, Mixture of Experts)
模型被拆分为大量细粒度「专家」子网络,每个 token 仅激活其中一小部分,从而在总参数极大的同时保持低推理成本。DeepSeek 进一步引入细粒度专家切分与共享专家,并用无辅助损失负载均衡(Auxiliary-Loss-Free Load Balancing)避免传统 MoE 的负载失衡与质量下降。
2. 多头潜在注意力(MLA, Multi-head Latent Attention)
标准注意力需为每个 token 保存完整的键值(KV)缓存,长上下文下内存暴涨。MLA 将 KV 缓存压缩高达 93%,使消费级硬件也能跑超长上下文,显著降低部署门槛。
3. 群体相对策略优化(GRPO, Group Relative Policy Optimization)
R 系列推理能力的关键训练方法。相比依赖海量人工标注思维链,GRPO 通过「组内相对奖励」让模型在试错中自发学会推理策略,更可扩展、更便宜。
五、商业模式与 API 定价
DeepSeek 采用「开源免费 + 低价 API」双轨策略:
- 开源权重:所有主要模型以 MIT / Apache 2.0 发布,可免费下载、微调与本地部署。
- 云端 API:通过 api.deepseek.com 提供 OpenAI 兼容接口,价格远低于闭源前沿模型。
- 在线助手:chat.deepseek.com 提供免费对话,含快速模式与深度推理(专家)模式。
据 2026 年公开数据,V4-Pro 输入价格约 0.435 美元 / 百万 token,约为同类闭源模型的几十分之一;2026 年 5 月 API 价格再降约 75%,成为当时最便宜的前沿级模型。对话提供 Non-think(直接响应)/ Think(高结构化推理)/ Think Max(扩展穷尽推理)三种模式。
六、开源战略与行业影响
DeepSeek 是少数以「完全开源」对抗闭源巨头的实验室,其影响包括:
- 降低 AI 门槛:开发者可在本地或私有云部署世界级模型,满足数据合规与隐私需求。
- 重塑性价比认知:以极低成本训练 / 推理印证「开放」路线的可行性,倒逼闭源厂商降价。
- 推动推理平权:R 系列蒸馏小模型(约 7B–70B)让个人与小团队也能跑强推理。
- 引发资本市场重估:R1 发布曾单日蒸发英伟达约 6000 亿美元市值。
七、与主流模型的对比
| 维度 | DeepSeek-V4-Pro | OpenAI(闭源前沿) | Claude(闭源前沿) |
|---|---|---|---|
| 开放性 | 开源权重(MIT) | 闭源 | 闭源 |
| 上下文窗口 | 1M token | 约 200K–1M(随版本) | 约 200K–1M(随版本) |
| API 价格 | 约 0.435 美元 / 百万输入 token | 显著更高(约数十倍) | 显著更高 |
| 本地部署 | 支持 | 不支持 | 不支持 |
| 推理能力 | 逼近前沿 | 前沿 | 前沿 |
八、如何使用 DeepSeek
方式一:网页 / App 免费对话
访问 chat.deepseek.com 或下载移动 App,注册后即可使用,支持快速模式与深度推理模式。
方式二:调用 API(OpenAI 兼容)
设置 API Key 并将请求指向 DeepSeek 的 Base URL,现有 OpenAI SDK 代码仅需替换 base_url 即可复用:
export DEEPSEEK_API_KEY="your_key_here"
curl https://api.deepseek.com/v1/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-v4-pro","messages":[{"role":"user","content":"用中文解释什么是 MoE 架构"}]}'
方式三:本地部署开源权重
从 GitHub 或 Hugging Face 拉取权重,使用 vLLM / transformers 等框架在自有 GPU 上部署,满足数据隐私与合规要求。
九、常见问题(FAQ)
Q1:DeepSeek 是什么公司?
A:DeepSeek(深度求索)是一家中国人工智能研究公司,全称杭州深度求索人工智能基础技术研究有限公司,于 2023 年 7 月由梁文锋创立,脱胎于幻方量化(High-Flyer),以 MIT / Apache 2.0 等宽松 License 开源全部大模型权重,使命是推动通用人工智能(AGI)。
Q2:DeepSeek 的创始人是谁?
A:由梁文锋(Liang Wenfeng)创立,他同时是幻方量化的联合创始人,在创办 DeepSeek 前长期从事 AI 驱动的量化交易系统研发。
Q3:DeepSeek 最强模型是哪个?
A:截至 2026 年,旗舰通用模型为 DeepSeek-V4 系列(V4-Pro 1.6 万亿总参数 / 490 亿激活 / 100 万 token 上下文;V4-Flash 2840 亿总参数 / 130 亿激活)。推理方向则有 DeepSeek-R2 等开源权重推理模型。
Q4:DeepSeek 模型真的开源吗?
A:是的。全部主要模型均以开源权重发布,采用 MIT、Apache 2.0 等宽松许可证,开发者可在 Hugging Face 与 GitHub 自由下载、微调、本地部署与商用。
Q5:DeepSeek 相比 OpenAI、Claude 有什么优势?
A:核心优势是「性价比」与「开放性」——在多项推理、数学、代码基准上逼近甚至持平闭源前沿模型,同时 API 价格显著更低,并提供可本地部署的开源权重。
Q6:DeepSeek 是免费的吗?
A:在线对话(chat.deepseek.com)与开源权重下载均免费;云端 API 按 token 计费,但单价远低于同类闭源模型。
十、参考资料与权威来源
- DeepSeek 官网:deepseek.com
- 开源主页(GitHub):github.com/deepseek-ai
- 模型权重(Hugging Face):huggingface.co/deepseek-ai
- DeepSeek-R1 / V3 技术报告(arXiv):arXiv:2501.12948 · arXiv:2412.19437
- 维基百科「DeepSeek」词条:en.wikipedia.org/wiki/DeepSeek