2025年计算机行业专题研究报告:DeepSeek推动“算力平权”,关注端侧AI和Agent投资机会

  • 来源:国金证券
  • 发布时间:2025/02/08
  • 浏览次数:717
  • 举报
相关深度报告REPORTS

计算机行业专题研究报告:DeepSeek推动“算力平权”,关注端侧AI和Agent投资机会.pdf

计算机行业专题研究报告:DeepSeek推动“算力平权”,关注端侧AI和Agent投资机会。DeepSeek近期推出V3/R1/Janus-Pro等多款大模型,凭借卓越性能和创新技术,在行业内引发强烈反响,效果显著“出圈”。其中V3正式训练成本仅为557.6万美元,约为GPT-4预算的1/20;R1性能比肩OpenAIo1,但API服务定价为每百万输入tokens1元(缓存命中)/4元(缓存未命中),每百万输出tokens16元,远低于OpenAIo1。我们认为DeepSeek的突破标志着国产大模型技术迈入全球领先行列,其低成本特性将带动AI应用...

1. DeepSeek 强势崛起,国产大模型技术大幅跃升

DeepSeek 近期推出了多款大模型,凭借卓越性能和创新技术,迅速在行业内引发强烈反 响,效果显著“出圈”。我们认为 DeepSeek 的突破标志着国产大模型技术迈入全球领先 行列,其低成本特性将带动 AI 应用加速落地。 2024 年 12 月深度求索推出 DeepSeek-V3,以极低的训练成本,实现了与国际顶尖模型 相媲美的性能。具体而言,DeepSeek-V3 在知识类任务(MMLU, MMLU-Pro, GPQA, SimpleQA)上的水平相比前代 DeepSeek-V2.5 显著提升,接近当前表现最好的模型 Claude-3.5-Sonnet-1022;长文本测评、代码生成、数学方面平均表现超过其他模型;中 文能力与 Qwen2.5-72B 相近。 DeepSeek-V3 采用 MoE 架构,参数规模 671B,激活 37B,在 14.8T token 上进行了预 训练。根据 DeepSeek-V3 论文,其正式训练成本仅为 557.6 万美元,约为 GPT-4 预算 的 1/20。模型完全开源,API 价格为每百万输入 tokens 0.1 元(缓存命中)/ 1 元(缓 存未命中),每百万输出 tokens 2 元,显著低于 Claude 3.5 Sonnet 和 GPT-4o。

2025 年 1 月 20 日,深度求索发布正式版 DeepSeek-R1 模型,是基于 V3 基础模型进行 微调和强化学习得到的,模型同步开源并实现性能再度提升,在数学、代码、自然语言推 理等任务上,性能比肩 OpenAI o1 正式版。此外,深度求索还在 R1 的基础上蒸馏了 6 个开源小模型,其中 32B 和 70B 模型在多项能力上实现了对标 OpenAI o1-mini 的效 果。DeepSeek-R1 API 服务定价为每百万输入 tokens 1 元(缓存命中)/ 4 元(缓存未 命中),每百万输出 tokens 16 元,价格远低于 OpenAI-o1。

DeepSeek-V3 和 R1 均具备低成本和高性能的特点,在使用经典 Transformer 解码器模 块堆叠和 GPT-2/3 的架构范式基础上进行了多种算法创新。

低成本:DeekSeek-V3/R1 模型降低训练成本主要依赖模型压缩、并行计算和提升硬 件使用效率等方法。

模型压缩:包括使用多层注意力(Multi-Layer Attention, MLA)和 FP8 混合精 度训练等。 1)MLA:传统 Transformer 中每一层都需要完整的计算和存储,其中的 Key 和 Value 矩阵往往占用大量内存空间,而 MLA 通过压缩和复用前序层的 K、V 来 减少内存占用和计算量。DeepSeek 通过 Key/Value 的低秩压缩使得的训练内存 占用减少了 20-30%,此外还通过对 Query 的低秩压缩,减少了计算过程中的 激活内存占用。 2)FP8 混合精度训练框架:FP8 用 8 个二进制位来表示数字的格式,相比传统 的 FP32 和 FP16 格式,精度有所降低,但是占用空间小、计算快。DeepSeek 在采用 FP8 格式时,采用了“混合精度”的方案,即在 8 位/16 位/32 位之间切 换,相较原始方法计算速度提升一倍,并显著降低内存消耗。

并行计算:在系统架构层面,DeepSeek 使用了专家并行训练技术,通过将不 同的专家模块分配到不同的计算设备上同时进行训练,提升了训练过程中的计 算效率。在计算和通信重叠方面,DeepSeek 创新使用 DualPipe 方法进行多任 务并行处理,能够让模型在进行计算的同时,在后台已经开始准备下一步需要 的数据传输。这种设计确保了通信开销被很大程度地隐藏在计算过程中,极大 提升了整体效率。根据 DeepSeek 的技术报告,DualPipe 算法减少了 50%的 计算气泡,有效隐藏了通信开销。 此外,DeepSeek-V3/R1 还进行无辅助损失负载均衡、跨节点通信优化,全面提升 模型训练效率、降低训练成本。

高性能:DeepSeek-V3 模型的高性能源于参数量较大、训练数据质量高,并使用 MTP技术进行架构革新,而R1在 V3 基础模型上进行蒸馏,进一步提升了模型能力。

参数量:DeepSeek-V3 的总参数量有 671B,每个 token 激活 37B 参数。整体 参数总量比 Llama 3.1 的 405B 高,也远超 Qwen 2.5 的 72B。在 Scaling Law 尚未碰壁的情况下,较高的模型参数量利于性能提升。

数据精筛:DeepSeek-V3 采用了更多元化的数据获取策略。基础训练数据来源 于经过严格筛选的 CommonCrawl 语料库,研发团队还引入大规模的代码数据 集、数学推理数据、科学文献等。在数据清洗环节,DeepSeek 采用了专有的 数据过滤算法,删除低质量、不完整的数据。团队还通过数据混合采样策略和 课程学习方法,进一步优化了训练过程中的数据使用效率。

多 token 预测(MTP):传统语言模型一次只预测一个 token 的范式,使用 MTP 后模型会同时预测多个连续位置的 token。这种并行预测机制不仅提高了训练效 率,还让模型能够更好地捕捉 token 之间的依赖关系。在保持输出质量的同时,模型整体性能提升 2-3%。

SFT 微调和大规模强化学习:R1在 V3 的基础模型上进行 SFT 微调和强化学习, 继承了 V3 的低成本特性,并在推理方面表现更优。R1 的训练分为两个阶段: 1)有监督微调(SFT):这一环节使用 2 类数据,一是来自中间推理模型生成 的 60 万个长思维链推理示例,二是 20 万个来自 V3 模型生成的与非推理训 练样本相关的数据。其中,中间模型是使用强化学习方法对 V3 的基础版本 进行训练得到的,其推理能力已经与 OpenAI o1 相近,在训练过程中模型 思维链长度逐步增加。在微调过程中,DeepSeek 还引入数千条高质量、包 含长思维链的冷启动数据,显著提升了模型的可读性和多语言处理能力。 2)通用强化学习:针对非推理类应用场景进行了扩展优化——通过引入实用性 奖励模型与安全性奖励模型(类似 Llama 模型的机制)对相关应用的提示 进行多维评估。这种复合奖励机制确保模型在扩展应用边界时,既能保持输 出有效性,又能遵循安全伦理规范。

除 V3/R1 外,DeepSeek 在 2025 年 1 月 28 日凌晨,再发两款多模态框架——Janus-Pro 和 JanusFlow。图像理解和图像生成统一的多模态模型训练难度较高,而 DeepSeek 通 过为模型配置双头编码器,分别单独负责理解和创作,成功突破训练瓶颈;规避了 ImageNet 数据集不真实的问题,直接使用真实的文生图数据进行训练,使得训练时间减 少 40%、生成质量提升 35%、模型对真实场景的适应性大幅提升。

Janus-Pro 是一款统一多模态理解与生成的创新框架,包括 1.5B 和 7B 两个模型, Janus-Pro 运用 Transformer 架构,将文本、图像、音频等多种模态的数据进行统 一处理,实现对不同模态信息的理解与生成。在图像生成领域,Janus-Pro 在基准测 试中表现优于 OpenAI 的 DALL-E 3 以及 Stable Diffusion 3 Medium 等;在多模态 理解领域,其在 MMBench 评分超过此前最佳水平。

JanusFlow-1.3B 是多模态理解模型,参数量仅为 1.3B,将基于视觉编码器和 LLM 的理解框架与基于 Rectified Flow 的生成框架直接融合,实现了两者在单一 LLM 中 的端到端训练。JanusFlow-1.3B 在视觉理解和生成任务上均超过此前同规模的统一 多模态模型。

2. 推理侧算力成本降低之后:算力普及化井喷+端侧/Agent 加速落地

2.1 Deepseek 对算力影响几何?—推理成本较 o1 降数量级,有望推动算力普及化井喷

Deepseek 性能对齐 OpenAI 最新模型水平,推理成本相比 o1 降数量级。Deepseek 的推 理成本低至每百万 Token 0.14 美元,相比 OpenAI-o1-mini 低了一个数量级。Deepseek 的 LLM(如 V3、R1)基于混合专家(MOE)和多重潜在注意力(MLA)架构,显著降 低训练和推理成本(训练成本仅为 Meta Llama 的 10%,推理成本为 OpenAl 的 1/7)。 在探讨大模型成本优化与算力需求之间的关系时,我们发现这两者并不是简单的此消彼长, 而是相互促进、共同发展的关系。微软首席执行官曾引用“杰文斯悖论”来阐释这一现象, 杰文斯在其著作《煤炭问题》中指出,随着蒸汽机效率的提升,煤炭的消耗量反而增加了。 这一悖论的核心在于:技术进步提高了资源的使用效率,而效率的提高降低了资源的使用 成本,进而刺激了资源需求的增长。这种增长有时甚至超过了效率提升所带来的节约,最 终导致资源总消耗量的增加。 我们认为,工业革命的本质是以新一代生产力工具的大范围应用为核心,以主体能源为基 础动力的全局性经济范式转型。历史上共发生过三次工业革命,我们认为,本轮通用型人 工智能发展浪潮有望启动第四次工业革命: 第一次技术革命:生产力工具:蒸汽机;主体能源类型:煤炭。 第二次技术革命:生产力工具:内燃机;主体能源类型:石油。 第三次技术革命:生产力工具:计算机;主体能源类型:电力。 第四次技术革命:生产力工具:通用人工智能;主体能源类型:算力。

历史上历次技术革命所涉及的主体能源都会随新一代生产力工具广泛应用而呈现能源需 求持续上行的阶段,以煤炭和石油两种一次化石能源为例说明: 以瓦特蒸汽机的大范围应用为代表的第二次技术革命最早在英国展开,后续逐渐扩散 至欧洲大陆和美国。1860 年起,英国煤炭消耗量上行约一个世纪,达峰之后逐渐回 落,1860~1920 年英国煤炭消耗量的快速爬升主要受益于蒸汽机在铁路运输、纺织、 制造、采矿等各行业的广泛应用(1882 年以后同时受益于煤电厂的兴建)。 以内燃机的大范围应用为代表的第三次技术革命最早在美国和德国展开,后续逐渐扩 散至欧陆各国。1920 年起,美国原油生产量持续保持高速爬升,1970s,美国国内 石油开采量放缓,对海外原油进口飙升,国内石油需求持续增长。

在当今数字经济中,算力的重要性堪比“水电煤”。Deepseek 的技术方向和开源定位, 正是推动算力普及化革命的关键因素。我们认为,高资源使用效率不仅不会减少算力的消 耗,反而可能因为使用成本的降低,刺激了更大的算力需求,最终导致算力总消耗量的增 加。

模型算力效率的突破,虽然看似会影响单位计算的价格,进而压缩高性能芯片供应商的利 润空间,但从长远来看,这将加速人工智能的普及和创新,带来算力需求的更大量级提升。 定价的持续走低有望带来更快的商业化落地,进而衍生出更多的微调和推理需求,逐步激 活全球 AI 应用及算力发展。因此,技术进步提高了资源使用的效率,不仅没有减少这种 资源的消耗,反而因为使用成本降低,刺激了更大的需求,最终导致资源使用总量反而上 升。

2.2 端侧 AI:Deepseek 推动端侧推理成本压缩,眼镜+耳机+学习机+玩具四面开花

Deepseek 对推理算力的压缩能够降低端侧 AI 成本。近日,英特尔公布,Deepseek 目前 能够在英特尔产品上运行,也可以在 AI PC 上实现离线使用。在其最新发布的酷睿 Ultra 200H(Arrow Lake H)平台上,Deepseek-R1-1.5B 模型能够顺利运行,在因式分解演 示中,能够迅速演绎逻辑思维,并最终解决数学难题,突破难关。小米、比亚迪等企业迅 速接入 API,特斯拉中国区客服宣布测试 Deepseek 语音助手,称其“中文理解能力优于 现有系统”。OPPO、荣耀宣布年内推出搭载 Deepseek 轻量版模型的智能眼镜,可实现 实时同声传译和 AR 导航。

AI 眼镜:有望成为最能承载 AI 应用的新硬件产品,参与玩家众多,深耕手机算法的 计算机厂商有望受益。目前该赛道的玩家包括 AR 眼镜厂商、互联网大厂、手机厂商、 AI 创业公司等,在 2025 CES 中参展的 AI 及 AR 眼镜数量达到 47 个,提供的主要 功能包括拍摄、AR 显示、语音交互、翻译等,竞争较为激烈。根据 Wellsenn 预测, 2025 年全球 AI 智能眼镜将进入新品密集发布期,出货量有望达 400 万副,到 2030 年出货量有望增长至 8000 万副。AI 眼镜在软件技术方面与智能手机有较多相似之处, 在手机领域布局较深的产业链公司有望收益:比如雷鸟 V3 使用虹软科技的 AI 视觉 算法猎鹰影像系统;闪极 AI 拍拍镜由云天励飞提供万物识别功能、由科大讯飞提供 复杂环境语音识别、多语言翻译等核心技术。

AI 耳机:主要提供办公效率辅助功能,多款产品接入第三方大模型。目前 AI 耳机赛 道中的玩家包括:1)传统手机厂商如华为、小米、三星等,AI 耳机通常与手机绑定, 可以用于唤醒手机端智能体;2)传统耳机制造商,如飞利浦、纽曼等,使用腾讯、 百度等第三方大模型,可唤醒对应的手机 APP;3)互联网及 AI 厂商,科大讯飞相 关团队自 2011 年起专注 AI+耳机领域,最新推出的 Pro2 提供三种录音转写、viaim ai 助理、多语种翻译等功能,产品定位商务人群价格较高。各家 AI 耳机均定位为生产 力工具,提供同传翻译、语音转文字等功能,功能较为局限,若后续能够拓展至生活 娱乐场景、AI 语音交互等功能延伸至耳机端侧、或与其他硬件融合,则相关产品销 量有望大幅提升。

AI 学习机:学习平板销量稳步增长,融合 AI 功能的高端学习机占比提升明显。根据洛图科技数据,2024 年,中国学习平板市场全渠道销量为 592.3 万台,同比 2023 年增长 25.5%,受到学生寒暑假影响,6 月、12 月销量较高;全年销售额为 190.6 亿元,同比 2023 年增长 37.6%。学习平板线上市场的零售量达 393.7 万台,在全渠 道中的占比为 66.5%;学而思、作业帮、科大讯飞为线上销售额 top3,市场份额分 别为 28%、25%、13%。从价格区间来看,价格在 6,000 元以上的高端学习机多搭 载更优质的教学资源和 AI功能,24 年其线上市场份额达 12%,较 23 年增加 5.4pct, 在这一细分市场中,学而思和科大讯飞的贡献较大,分别位列线上市场的销量和销售 额首位。

AI 玩具:目前发布的产品核心功能基本一致,包括语音识别、自然语言处理和机器 学习,希望通过拟人、拟动物,以及拟 IP 的方式,与用户进行视/听/触多维度交互。 受到功能和 IP 溢价影响,AI 玩具的价格差异较大。相较于 AI 眼镜、AI 学习机、智 能音箱等产品,AI 玩具依托玩偶、宠物和知名 IP 为载体,能够提供更多陪伴和情感 支持,该领域更容易出现爆款产品,比如官方售价449元的AIGC玩具挂件 BubblePal, 开售首月 GMV 突破 400 万。

2.3 AI Agent:强推理模型性能持续提升,Agent 应用落地有望全面提速

智能体(Agent)指一种能够独立执行任务、做出决策并与其他系统或用户交互的软件程 序或算法。智能体可以执行各种任务,从简单的自动化任务到复杂的决策支持系统。Agent 能够接受用户的自然语言请求,具有主动性,能够自动拆解任务并在多个应用程序中无缝 协作。例如,它可以从 Word 中提取信息、总结网页、处理 PDF 文件,并在 PowerPoint 中创建幻灯片,最终通过 Teams 发送。 在图形用户界面(GUI)的背景下,Agent 可以通过屏幕截图和小部件树(widget trees) 来感知 GUI 状态,并执行操作以模仿用户行为,如鼠标点击、键盘输入或手机上的触摸 手势。 在 2023 年 LLM 模型出现之前,GUI Agent 的工作范围和能力均受到较大限制。自那 时起,基于 LLM 的方法在网络、移动和桌面环境等不同平台上蓬勃发展,推动了该领域 众多创新成果的诞生。

Deepseek R1 显著降低了大语言模型的技术门槛,AI Agents 的应用前景变得更加广阔。

2.4 AI 安全:大模型厂商急需全方位加强防护,网安及信创板块迎来布局机会

在人工智能时代,AI 大模型得到了广泛应用,但随之而来的安全问题也日益凸显,安全 需求变得极为迫切,这背后蕴藏着巨大的市场空间与机会。以 DeepSeek 为代表的国产 模型,凭借技术优势在竞争激烈的 AI 领域迅速崛起,然而也因此遭受了网络恶意攻击, 这警示着大模型厂商提升网络安全能力已刻不容缓。面对不断升级的网络攻击手段,以及 AI 本身可能被用于发动更复杂攻击的风险,国产模型急需全方位加强网络安全防护,构 建完善的安全体系。 这种严峻的形势为网安和信创产业链带来了广阔的市场需求与技术挑战。AI 企业需要加 大网络安全和自主可控相关投入、引进专业人才、优化技术,网络安全公司恰好能凭借专 业能力与丰富经验,为 AI 企业提供定制化的安全解决方案,助力其提高系统的安全性与 稳定性。政府与行业协会制定相关法律法规和行业标准,也需要网络安全公司提供专业支 持与技术参考。根据 Techopedia 数据,2023 年全球基于 AI 的网络安全市场规模为 243 亿美元,预计 2027 年将达 650 亿美元,2023-2027 年 CAGR 约 27.9%。

未来,随着 AI 技术持续发展,一方面,网络安全公司在保障 AI 大模型安全方面将扮演愈 发关键的角色,带来业绩增量;另一方面,网络安全公司也亟需降本增效的路径,而以 DeepSeek 为代表的优秀国产化大模型将无疑是网安公司的优先合作伙伴,发展国产化安 全垂类模型工具能力,从而实现安全检测与防护能力提升的同时实现降本增效。 国内多家网络安全公司积极拥抱 AI 技术进步带来的业务需求,接入 DeepSeek 优化自身 安全产品。其中,奇安信自主研发的 QAX 安全大模型已全面完成了 DeepSeek 的深度接 入,率先将其引入到威胁研判、安全运营、渗透测试和漏洞管理、身份与访问管理、网络 钓鱼防护、恶意软件和勒索软件防护、数据泄露防护、安全培训、供应链安全等场景之中, 并展现出了卓越表现,其中安全专业问答整体性能分数提升约 16%,极大提升了智能威 胁分析和决策的准确度。另外,永信至诚依托在网络靶场和数字安全测评领域的深厚技术 积累与业务实践成果,构建春秋 AI 测评「数字风洞」平台,基于标准化测评数据和海量业务场景模版,实现对 AI 智能产品智能度、安全度和匹配度的综合测评,通过以模测模、 以模强模,简化测评流程,提高测评效率。平台内置了覆盖 18 个知识领域和 300 万余测 评题目的智能评估体系,能够测评从基本知识应用到复杂推理能力的具体表现。帮助企业 了解产品的实际认知能力,确保在业务场景中被准确应用。

另外,以 deepseek 为主的 AI 大模型的自主可控迫在眉睫,除了软件核心组件自主可控 以外,硬件产业链的国产替代需求旺盛。2025 年是十四五收官之年,预期信创推进政策 及配套财政支持政策快速落地,预计上半年信创产业链相关公司的订单回暖将会出现重要 信号。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至