2024年人工智能行业专题分析:比较试用DeepSeek看模型走向应用的新迹象

  • 来源:广发证券
  • 发布时间:2024/12/31
  • 浏览次数:3802
  • 举报
相关深度报告REPORTS

人工智能行业专题分析:比较试用DeepSeek看模型走向应用的新迹象.pdf

人工智能行业专题分析:比较试用DeepSeek看模型走向应用的新迹象。DeepSeek-V3上线,模型性能提升较快。2024年12月,幻方旗下深度求索公司上线DeepSeek-V3系列模型首个版本,较前代模型DeepSeek-V2.5有显著提升。为了深入探索该模型的能力,我们采用了覆盖逻辑、数学、代码、文本等领域的多个问题对模型进行测试,将其生成结果与豆包、Kimi以及通义千问大模型生成的结果进行比较。通过有限的实测结果,我们发现,DeepSeek总体能力与其他大模型相当,但在逻辑推理和代码生成领域具有自身特点。例如,在密文解码任务中,DeepSeek是唯一给出正确答案的大模型;而在代码生成的...

一、DeepSeek-V3 上线,模型性能提升较快

2024年12月,幻方旗下深度求索公司上线DeepSeek-V3系列模型首个版本,并同步 开源模型和论文。此外,API服务也已同步更新,无需改动接口配置。DeepSeek-V3 模型采用了自研混合专家(MOE)架构,总参数量为671B,每个token激活37B参数, 在14.8T token上进行了预训练,但当前版本暂不支持多模态输入输出。

(一)沿用前代 MLA+MoE 架构,训练成本大幅降低

DeepSeek-V3基于MLA+MoE架构。在模型架构方面,DeepSeek-V3依然沿用前代 DeepSeek-V2的MLA(多头潜在注意力)和自研DeepSeekMoE架构。MLA架构可以 降低推理过程中的kv缓存开销,而MoE可以通过动态选择并激活部分专家来降低计 算开销。DeepSeek-V3通过专用和共享专家,能够显著提升模型的稀疏程度(总参 数量除以激活参数量)。相比DeepSeek-V2的236B总参数(21B激活参数),V3更 引入了256个专家,总参数量达到671B,而激活参数量仅仅增加到37B。 除了基本框架之外,DeepSeek-V3还采用了两个额外的策略,来进一步增强模型的 能力: 1. 采用无辅助损失(auxiliary-loss-free)方法来实现负载均衡,目的是最小化负载 均衡对于模型性能造成的不利影响。 2. 采用多token预测训练目标,提升评估基准的整体性能。

在训练阶段,DeepSeek-V3研究人员设计了一个FP8混合精度训练框架,验证了在 超大规模模型上进行 FP8 训练的可行性和有效性。通过对算法、框架以及硬件进行 协同设计,其克服了跨节点混合专家(MoE)训练中的通信瓶颈,实现了加速训练, 降低了训练成本,能够在不增加额外开销的情况下进一步扩大模型规模。 根据DeepSeek技术报告,在预训练阶段,每训练万亿Token,DeepSeek-V3只需耗 费18万H800 GPU小时,在配备2048卡个H800 GPU的集群上,完成这一阶段仅需 3.7天,整个预训练阶段总计花费 266.4万GPU小时。外加扩展上下文长度所需的 11.9万GPU小时和后训练耗费的5000 GPU小时,总训练时间仅需278.8万GPU小时, 假设H800 GPU的租用价格是每小时2美元,整体训练成本约为557.6万美元。

在推理阶段,研究人员将思维链推理(Chain-of-Thought,CoT)应用于大语言模型 中,显著提升了其推理性能,同时,保持了对模型输出风格和长度的控制。

(二)模型兼具低成本与高性能的特点

在生成质量方面,DeepSeek-V3 在多项评测中超越了Qwen2.5-72B 和 Llama-3.1- 405B 等开源模型,并与全球顶尖闭源模型如 GPT-4o 和 Claude-3.5-Sonnet 处于 同一水平。例如,DeepSeek-V3 在知识类任务(如 MMLU、MMLU-Pro、GPQA、 SimpleQA)上的表现较前代模型 DeepSeek-V2.5有显著提升,接近当前最优模型 Claude-3.5-Sonnet-1022。而在算法类代码任务(如 Codeforces)中,DeepSeekV3 远超市面上所有非 o1 类模型,并在工程类代码任务(如 SWE-Bench Verified) 上接近 Claude-3.5-Sonnet-1022 的水平。

在生成速度方面,通过算法优化和工程创新,DeepSeek-V3 的生成速度从20 TPS 大幅提高至 60 TPS,相比 V2.5 模型实现了 3 倍的提升,为用户带来更加迅速流 畅的使用体验,可用性大幅提升。 在模型价格方面,DeepSeek-V3 API 服务定价调整为每百万输入 tokens 0.5 元(缓 存命中)/ 2 元(缓存未命中),每百万输出 tokens 8 元,相较于DeepSeek-V2的 输入与输出价格分别为1元/百万tokens和2元/百万tokens,有所提升。但与GPT、 Claude等模型相比,具备较高的性价比优势。

二、DeepSeek V3 大模型测评

为了深入探索该模型的能力,我们向DeepSeek提出了8个问题,将其生成的结果与 豆包、Kimi以及通义千问大模型生成的结果进行比较。这8个问题涵盖了逻辑、数学、 代码、文本等各方面能力,具体问题分别是: (我们选取的问题在数量和类型上非常有限,因此相关结果仅可用作使用端体验的 推论基础,不构成专业意义上的评测参考) 逻辑: (1)我的住处在城市和农场之间,农场在城市和机场之间,所以农场到我的住处的距 离比到机场近,这个正确吗? (2)我们采用Base64的编码方法对“This is a new large language model”编码为 “VGhpcyBpcyBhlG5ldyBsYXJnZSBsYW5ndWFnZSBtb2RbA==” 然后询问大模型使用上面的例子来解码: “ VGhlIE1vZGVsIHRyYWluZWQgd2l0aCByZWluZm9yY2VtZW50IGxlYXJuaW5n IHRvIHBlcmZvcm0gY29tcGxleCByZWFzb25pbmc=”

数学: (3)一个圆柱体垂直放置在一个水平面上,其底面直径为d,高为H。请画出这个圆 柱体在水平面上的正投影和侧投影,并计算这些投影的面积。请详细解释你的推理 和计算过程。 (4)有100名员工去年和今年均参加考核,考核结果分为优、良、中、差四个等次。 今年考核结果为优的人数是去年的1.2倍,今年考核结果为良及以下的人员占比比去 年低15个百分点。问两年考核结果均为优的人数至少为多少人? 代码: (5)请用Python语言写一段代码,找出从1到100内所有的质数。 (6)假设你需要为一个电子商务网站开发一个功能,允许用户根据价格范围和产品 类别筛选商品。请使用Python和Flask框架编写一个简单的Web API,该API能够接 收HTTP GET请求,并根据查询参数返回符合条件的商品列表。 文本: (7)请选择一个你最喜欢的季节,详细描述该季节的自然景观、气候特点以及人们 的生活状态,字数控制在500字以内。 (8)假设你需要向一家公司申请实习机会,请撰写一封正式的求职信。信中需包括 你的教育背景、相关经验和个人优势,并表达你对该公司和实习职位的兴趣。

(一)DeepSeek 密文解码推理能力突出,但空间推理能力弱于豆包大模 型

豆包大模型的文字理解能力和空间推理能力较强。问题(1)主要是考察大模型的空 间理解和推理能力。DeepSeek 和通义千问大模型根据文字描述推断出“城市-你的 住处-农场-机场”,在这一步推理中即出现了错误。而 Kimi 大模型则假设了“城市你的住处-农场-机场”和“城市-农场-你的住处-机场”两种情况分别讨论,对于文字 理解后进行推理的能力较 DeepSeek 和通义千问更强。但 Kimi 得到的答案依然是错 误的,因为空间位置的分布应该在二维平面上进行比较,而不是单一维度的比较大 小。针对此问题,最终得到正确回答的是豆包大模型,其得到的结论“距离的远近取 决于具体各个地点之间的实际路程长短,不能仅凭相对位置关系简单判定。”,即是 反映其充分理解二维平面空间的能力。

DeepSeek大模型对于密文解码类的任务推理能力较强。问题(2)是考察大模型密 文解码能力。4个大模型都理解了示例中的编码方式是采用Base64的方法。但是最 终仅DeepSeek大模型对于密文解码后得到了正确文本“The Model trained with reinforcement learning to perform complex reasoning”。通义千问解码后的结果和 正确答案较为接近;而豆包和Kimi大模型解码后的结果与正确答案相差较大。

(二)DeepSeek 空间几何和数学计算能力行业平均水平相当

大模型空间几何理解和计算能力各有优劣。问题(3)是考察大模型空间几何理解和 计算能力。从测试的结果来看,DeepSeek、Kimi 和通义千问给出了详细的计算过 程,并且计算所得结果都是正确的,但并未执行用户提出的指令“画出圆柱体在水 平面上的正投影和侧投影”。此外,DeepSeek 为方便用户理解,还能够给出假设数 据并计算具体案例。豆包大模型在回答过程中画出了圆柱体的正投影和侧投影,但 计算圆柱体正投影的的答案出现了错误。

通义千问数学计算能力略差于其余3个大模型。问题(4)是考察大模型数学计算能 力。从测试的结果来看,DeepSeek、豆包和Kimi都给出了详细的计算过程,并且计 算所得结果都是正确的。而通义千问计算结果有错误。

(三)针对程序开发场景,DeepSeek 生成内容更符合开发者要求

4 个大模型对于简单算法的代码生成能力接近。问题(5)是考察大模型代码生成能 力。从测试的结果来看,4 个大模型代码生成的结果较为接近。在结果呈现方面, DeepSeek 和通义千问大模型会对每一段代码进行注释,并且在最后还会解释算法 实现的原理。豆包大模型和Kimi大模型在生成代码的最后也对算法原理进行了解释, 其中豆包大模型的算法解释较为详细。

针对特定应用场景的程序开发,DeepSeek和豆包大模型详细解释和引导每一步程 序开发的原理和细节。问题(6)是考察大模型针对实际业务场景的编程能力。在 实现最终功能的过程中,DeepSeek和豆包大模型会对实现程序开发每一个步骤进 行详细的引导和解释,更加便于用户的理解。而Kimi和通义千问仅给出了实现程序 的代码,对于每一步实现的过程以及原理解释较少。

(四)DeepSeek 生成文本的质量符合行业平均水平

在文字创作功能上,通义千问生成的文本长度较长。问题(7)是考察大模型文字生 成和描述能力。针对季节描述的文本内容方面,4 个大模型都能按照要求描述自然景 观、气候特点以及人们的生活状态等。在生成文本长度方面,Kimi 大模型生成文字 的内容长度不超过 600 字;DeepSeek 和豆包大模型的内容长度接近 700 字;而通 义千问大模型生成内容长度超过 1000 字。

在文字创作功能上,通义千问生成的文本长度较长。问题(8)是考察大模型在具体 应用场景中的文字生成能力。针对求职场景的文本内容方面,4 个大模型都能按照要 求描述教育背景、相关经验和个人优势等,并且针对未提供的信息留有空白给用户 自行修改。虽然,通义千问生成的文本内容长度明显高于其他 3 个大模型,但在求 职场景中,过于冗长的描述不太符合职场书信往来内容简洁的要求。

通过对比DeepSeek、豆包、Kimi和通义千问这四个大模型回答逻辑、数学、代码和 文本等问题的答案。我们发现,DeepSeek总体能力与其他大模型相当,但在逻辑推 理和代码生成领域具有自身特点。例如,在密文解码任务中,DeepSeek是唯一给出 正确答案的大模型;而在代码生成的任务中,DeepSeek给出的代码注释、算法原理 解释以及开发流程的指引是最为全面的。在文本生成和数学计算能力方面, DeepSeek并未展现出明显优于其他大模型之处。

三、数据与算法仍有潜力可待挖掘,算力依旧不可或缺

(一)数据与算法仍有潜力可待挖掘

在算法方面,DeepSeek-V3的主要亮点包含: (1) 多专家混合架构(MoE)优化:采用DeepSeekMoE 架构,使用更细粒度的 专家和共享专家,通过辅助无损失负载均衡策略,提高计算效率。 (2) 多头潜在注意力机制(MLA):运用MLA架构,对注意力键值进行低秩联合 压缩,减少推理时的键值缓存,同时对查询也进行低秩压缩,降低训练时的 激活内存,在保持性能的同时提高了推理和训练效率。 (3) 多令牌预测(MTP)目标:设置 MTP目标,扩展预测范围到多个未来令牌, 增强模型的预测能力。 (4) 高效的训练框架设计:通过DualPipe算法实现高效流水线并行,通过重叠计 算和通信阶段提高训练效率。同时充分利用 InfiniBand(IB)和 NVLink 带 宽,优化内存占用。 (5) FP8混合精度训练框架:提出基于FP8数据格式的细粒度混合精度训练框架, 通过分组量化、提高累积精度等策略,在保证训练稳定性的同时提高训练效 率,首次在超大规模模型上验证了FP8训练的有效性。

在数据方面,DeepSeek-V3使用了14.8T高质量和多样化的训练数据。根据 DeepSeek-V3技术报告,相比DeepSeek-V2,DeepSeek-V3提升了数学和编程样本 的比例,并扩大了中英语言之外的多语言覆盖范围,优化数据处理流程以减少冗余 并确保语料库的多样性和完整性,同时,采用了文档打包方法以维护数据完整性。 DeepSeek-V3通过数据与算法层面的优化,大幅提升算力利用效率,实现了协同效 应。在大规模MoE模型的训练中,DeepSeek-V3采用了高效的负载均衡策略、FP8 混合精度训练框架以及通信优化等一系列优化措施,显著降低了训练成本,以及通 过优化MoE专家调度、引入冗余专家策略、以及通过长上下文蒸馏提升推理性能。 证明了模型效果不仅依赖于算力投入,即使在硬件资源有限的情况下,依托数据与 算法层面的优化创新,仍然可以高效利用算力,实现较好的模型效果。

(二)算力是 AI 大模型的发展动力,依旧不可或缺

DeepSeek-V3 通过高质量数据以及算法优化取得了较好的模型效果,但算力才是让 这些数据和算法发挥作用的资源前提: 1. 从训练成本来看,根据DeepSeek-V3技术报告,整个预训练阶段总计花费 266.4 万GPU小时。外加扩展上下文长度所需的11.9万GPU小时和后训练耗费的5000GPU小时,总训练时间仅需278.8万GPU小时,假设H800 GPU的租用价格是每 小时2美元,整体训练成本约为557.6万美元。然而,这一数字仅涵盖正式训练阶 段的成本,未包含模型架构设计、算法优化或数据处理等前期研究及消融实验的 费用。 2. 从部署门槛来看,一个完整的DeepSeek-V3部署单元便需要消耗数百块H800, 对于硬件设施的要求较高。 (1) Prefilling阶段:最小部署单元需要4个节点,每个节点配备8个GPU,共需32 个GPU。使用了多种并行技术,同时通过冗余专家策略实现负载均衡,进一 步提高计算效率。在每块GPU上,除了原有的8个专家,还额外增加了1个冗 余专家。 (2) Decoding阶段:最小部署单元需要40个节点,每个节点配备8个GPU,共需 320个GPU。每个GPU仅承担一个专家的任务,同时有64个GPU承担冗余专 家的部署任务。

我们认为,DeepSeek-V3算力成本降低的原因有两点。第一,DeepSeek-V3采用的 DeepSeekMoE是通过参考了各类训练方法后优化得到的,避开了行业内AI大模型训 练过程中的各类问题。第二,DeepSeek-V3采用的MLA架构可以降低推理过程中的 kv缓存开销,其训练方法在特定方向的选择也使得其算力成本有所降低。 算力依然是推动大模型发展的核心驱动力。与其他同规模模型(如Llama 3 405B 30.84M)的训练成本相比,DeepSeek-V3通过技术创新和资源优化,大幅降低了成 本,展现了算力的高效性。在该技术路线得到充分验证后,有望驱动相关AI应用的快 速发展,应用推理驱动算力需求增长的因素也有望得到增强。尤其在实际应用中, 推理过程涉及到对大量实时数据的快速处理和决策,仍然需要强大的算力支持。 以大规模通用模型为基础,聚焦特定领域突出自身特点的模型应用开发或许是下一 阶段的商业化探索方向。DeepSeek-V3为未来大模型技术的发展提供了重要启发, 未来或将从依赖大规模通用模型转向发展一些更具特色、成本更低的模型,这些模 型可能更适合具体应用场景,随着这些特色模型的不断成熟,AI商业化的边际成本 有望降低,将迎来更广阔的应用前景。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至