2026年计算机行业DeepSeek:加速迭代的开源大模型引领者
- 来源:兴业证券
- 发布时间:2026/02/14
- 浏览次数:381
- 举报
计算机行业DeepSeek:加速迭代的开源大模型引领者.pdf
计算机行业DeepSeek:加速迭代的开源大模型引领者。DeepSeek:长期主义,引领开源模型生态。1)引领开源模型生态,重塑AI产业格局。深度求索(DeepSeek)于2023年7月正式成立,由梁文锋旗下的量化投资机构幻方量化设立。2025年1月20日,推理模型DeepSeek-R1凭借更低的训练成本以及领先的模型能力,打破国外模型的垄断地位,加速AI技术平权,深刻影响了全球AI产业格局。2)组织架构扁平,团队年轻化。DeepSeek团队规模不到140人,组织架构扁平,核心技术人员主要来自国内顶尖高校。3)估值方面:深度求索坚守长期主义,不以短期商业利益为导向,至今未进行过外部融资,截至2...
DeepSeek:长期主义,引领开源模型生态
1.1、引领开源模型生态,重塑 AI 产业格局
DeepSeek:引领开源大模型发展,重塑全球 AI 发展格局。深度求索 (DeepSeek) 于 2023 年 7 月正式成立,由梁文锋旗下的量化投资机构幻方量化设立,专注于 AI 大语言模型的开发。2025 年 1 月 20 日,推理模型 DeepSeek-R1 凭借更低的 训练成本以及领先的模型能力,深刻影响了全球 AI 产业发展,R1 发布后 1 周内 DeepSeek App 实现用户数增长超 1 亿。DeepSeek 持续以算法优化和工程创新 加速 AI 技术平权,基于 OpenRouter 平台数据,2024 年 11 月至 2025 年 11 月 期间,DeepSeek 的累计调用量为 14.37 万亿 Token,位居全球开源大模型榜首。

DeepSeek V 系列注重成本效率,R 系列注重推理性能。DeepSeek V 系列模型 为基础模型,注重成本及推理效率的优化;R 系列为推理模型,基于 V 系列基础 模型进行后训练,显著提升了模型在数学、代码生成、复杂逻辑推理等任务中的 表现。 1)模型方面:2024 年 1 月,公司发布首个大模型 DeepSeek LLM 67B 通用大 语言模型。2024 年 5 月,公司推出 DeepSeek-V2,基于 MoE 架构,大幅提 升模型训推效率,API 定价下降至 GPT-4 Turbo 的百分之一。2024 年 12 月, 公司推出 DeepSeek-V3,训练成本仅 557 万美元,性能表现比肩 GPT-4。 2025 年 1 月,公司发布推理模型 DeepSeek-R1 正式版,推理性能比肩 GPTo1。2025 年以来,DeepSeek 推出多个迭代版本,数学、推理、长上下文、 多模态等方面的能力持续提升。 2)产品方面:DeepSeek-R1 发布带动 DeepSeek App 活跃用户数快速增长。 DeepSeek App 上线 20 天全球日活 DAU 达到 2161 万,成为当时全球增速 最快的 AI 应用。根据 Questmobile 数据,DeepSeek App 2025 年周活跃用 户规模位列国内 AI 原生 App 第二,达到 8156 万。
1.2、团队追求极致创新,公司估值超万亿
组织架构扁平,最大化释放个人创新能力。自成立以来,公司以开发真正的通用 人工智能(AGI)作为目标,追求模型的底层创新而非快速进行 AI 应用的商业化 变现。DeepSeek-V3 技术报告的致谢部分显示,共有 139 名工程师参与了项目, 公司组织架构扁平,内部不存在层级和跨部门设置,对于算力资源、人力资源的 调用十分灵活。 汇集国内顶尖高校人才,团队年轻化。DeepSeek 的创始人梁文锋是九章资产、 幻方量化两家百亿量化私募的创始人及实际控制人,公司的工程师和研发人员几 乎都来自清华大学、北京大学、中山大学、北京邮电大学等国内顶尖高校,鲜少 有海外背景。团队高度年轻化,以应届和毕业 1-2 年的人为主,亦有不少博士在 读生。
股权结构方面,梁文锋拥有绝对控制权。1)股权方面,梁文锋直接和间接控制深 度求索约 84%的股权。2)控制权方面,梁文锋持股宁波程普有限公司 68.21%的 股权,拥有绝对控制权;宁波程普为宁波程信和宁波程恩的普通合伙人(GP), 拥有实际决策权;通过以上方式,梁文锋实现了对深度求索的控制。3)激励方面, 宁波程信作为股权激励平台,其作为宁波程恩的有限合伙人 (LP),具备分红权。

DeepSeek 估值超 1 万亿元,理论利润率较高。幻方量化为深度求索提供了充足 的研发预算和算力资源,深度求索至今仍没有进行过外部融资。1)估值层面,根 据 IT 之家引用的《2025 全球独角兽企业 500 强报告》信息,截至 2025 年 9 月 30 日,DeepSeek 估值达到 1.05 万亿元,在人工智能领域位列全球第三,仅次 于 OpenAI (2.1 万亿元)和 Anthropic (1.28 万亿元)。2)收入及利润层面,2025 年 3 月,DeepSeek 披露了 2025 年 2 月 27 日 24 点至 2 月 28 日 24 点的成本及 理论收入情况:成本侧,DeepSeek-V3 和 R1 的所有服务均使用 H800 GPU,假 设租用一颗 H800 芯片的成本为 2 美元/小时,则其总成本为 87072 美元/天;收 入侧,如果所有Token都以DeepSeek-R1的价格计费,理论上总收入将为562027 美元/天,毛利率达到 85%。但同时,DeepSeek 指出实际收入将少于理论值,因 为 V3 模型定价较低且部分服务免费或以折扣价提供。
1.3、长期主义守初心,V 和 R 系列持续迭代
DeepSeek V 系列、R 系列持续迭代,模型能力稳步提升。深度求索坚守长期主 义,不追逐短期商业利益,形成 “不融资、不盲从、死磕 AGI”的独特范式。2024 年 12 月,公司推出 DeepSeek-V3 模型,模型总参数规模达到 671B,基于 MoE 架构优化以及 MLA 技术等,实现了模型训练成本大幅降低、推理效率大幅提升。 2025 年 2 月,基于 DeepSeek-V3-base 基础模型及大规模强化学习,公司发布 并开源推理模型 DeepSeek-R1,性能对标 OpenAI-o1,推理成本仅为 OpenAI-o1 的约 1/30。2025 年,公司 V 系列、R 系列模型进行了多次小版本迭代,在长文 本、数学、编程及通用推理、Agent 等方面的能力持续提升。
复盘:低成本部署,推动 AI 应用落地“奇点”
2.1、V3:极致降本,指明模型进化第二路径
DeepSeek-V3 实现大模型低成本、高性能。DeepSeek-V3 的核心亮点在于,在 算力资源有限、大幅降低训练及推理成本的情况下,仍能实现一流的模型性能。 V3 模型采取 MoE 架构,总参数规模达到 671B,激活参数规模 37B。模型在 14.8T token 上进行了预训练,通过算法、架构、硬件的协同优化,在大模型内存效率、 成本效益、推理速度等方面取得了突破。 1)优化自研 MoE 架构,模型参数规模大幅提升。MoE 架构实现了在计算量没有 显著提升的情况下,模型参数大幅增长。论文数据显示,V3 的参数规模达到 671B, 相较于 V2 版本的 236B 提升了 2 倍,总计算成本约为 250GFLOPS/token,而 72B、405B 的模型分别需要 394、2448GFLOPS/token。此外,V3 版本对于 MoE 架构的优化主要在于大幅增加了专家数量,实现了更高的专家专业化程度、解决 了专家负载不均衡的问题。 2)多头潜在注意力机制 (MLA)显著降低推理内存消耗。相较于传统的多头注意 力机制(MHA),MLA 显著压缩了 KV cache(键值缓存),大幅提升了模型的推 理效率,同时保持模型性能不变甚至更优。论文数据显示,DeepSeek-V3 每个 token 的 KV 缓存仅需 70 KB,远低于 LLaMA-3.1 405B 的 516KB 和 Qwen-2.5 72B 的 328KB。 3)FP8 混合精度技术大幅降低了模型训练成本。DeepSeek-V3 验证了 FP8 在大 规模模型训练的可用性,在不增加额外开销的情况下扩大了模型训练规模且不影 响模型训练质量。4)多 token 预测显著提升了推理效率和生成速度。模型采用 MTP (Multi-Token Prediction Module)方法,提升了训练效率,同时使模型在推理时可以进行预先 规划,更好地预测未来的 token。

DeepSeek-V3 推动训练成本和推理成本的极致优化。1)训练成本优化:根据 DeepSeek 论文,DeepSeek-V3 仅使用 2048 个 H800 GPU 训练了 2 个月,耗费 280 万 GPU 小时,约 557.6 万美金。相比之下,Meta 旗下 Llama 3 405B 消耗 了 3084 万 GPU 小时 (对应训练成本超过 6000 万美元),OpenAI 的 GPT-4o 模 型的训练成本约为 1 亿美元。2)推理成本优化:在保证模型性能的前提下,更低 的内存和计算需求使得 DeepSeek-V3 模型在本地化部署及端侧 AI 等计算资源相 对受限的场景中具备显著优势;在长上下文推理、多轮对话场景中具备更高的成 本效益。
DeepSeek-V3.2 实现长文本训练和推理效率的大幅提升。1)V 系列继续推动模 型训推效率提升,DeepSeek-V3.2 引入 DSA(DeepSeek Sparse Attention)稀 疏注意力机制,在几乎不影响模型输出效果的前提下,实现了长文本的训练和推 理效率大幅提升。2)模型训练借鉴强化学习技术,数学、代码等推理能力以及 Agent 能力显著提升。DeepSeek-V3.2 整体推理能力达到 GPT-5 水平,模型支持 思考模式下的工具调用,在智能体评测中达到了开源模型的最高水平。
2.2、R1:推理能力领先,推动 AI 应用落地
DeepSeek-R1 推理能力显著提升,降低强化学习对标注数据的依赖。2025 年 1 月 20 日,深度求索正式发布 DeepSeek-R1 模型,并同步开源模型权重。 DeepSeek-R1 模型基于 DeepSeek-V3 Base 基础模型进行训练,性能逼近 OpenAI-o1 正式版,推理成本仅为 OpenAI-o1 的约 1/30。 1)DeepSeek-R1-Zero 验证纯强化学习能够实现推理能力。传统推理模型的强 化学习训练依赖于人类高质量标注数据和监督微调(SFT),而DeepSeek-R1-Zero 基于 DeepSeek-V3 Base 基础模型,采用了基于奖励规则的纯强化学习进行训练, 模型自我发展出了反思、探索、多步验证等复杂推理行为,在数学、代码等可验 证任务方面的推理能力得到显著提升。 2)基于少量 SFT 数据+多轮强化学习,DeepSeek-R1 推理能力显著提升。 DeepSeek-R1 在 DeepSeek-R1-Zero 的基础上,整合了拒绝抽样、冷启动数据、 非推理数据等,继承了 R1-Zero 的推理能力,同时增强了模型在写作、事实、翻 译等开放场景的性能。
DeepSeek-R1 推理能力对标 OpenAI-o1。测评结果显示,DeepSeek-R1 在多个 基准测试上的水平显著优于 DeepSeek-V3,在数学、代码、自然语言推理等任务 上,性能比肩甚至超越 OpenAI-o1 正式版。1)数学:DeepSeek-R1 在 AIME2024 的得分达到 79.8 (超过 o1 的 79.2),在 MATH500 的得分达到 97.3 (超过 o1 的 96.4)。2)编码:DeepSeek-R1 在 Codeforces 的得分达到 96.3(接近 o1 的 96.6),SWE Verified 的得分达到 49.2(超过 o1 的 48.9)。
编辑:火腿肠-
标签
- 计算机
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 房地产行业专题报告:城市更新推动高质量发展.pdf
- 6 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 9 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年春季港股及海外中资股投资策略:分化与回归
- 5 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 6 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 7 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 8 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 9 2026年春季海外宏观展望:结构性“滞胀”
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 4 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 5 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 6 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 10 2026年中期医药生物行业投资策略:AI新药加速推进
