2026年计算机行业AI模型系列(三):DeepSeek V4和Kimi K2.6,性能跃升,国产算力适配加快

  • 来源:广发证券
  • 发布时间:2026/04/28
  • 浏览次数:597
  • 举报
相关深度报告REPORTS

计算机行业AI模型系列(三):DeepSeek V4和Kimi K2.6,性能跃升,国产算力适配加快.pdf

计算机行业AI模型系列(三):DeepSeekV4和KimiK2.6,性能跃升,国产算力适配加快。KimiK2.6和DeepSeekV4陆续发布,性能跃升。①26年4月24日,DeepSeek发布V4模型,拥有百万字超长上下文,在Agent能力、世界知识和推理性能上均实现国内与开源领域的领先。根据官方技术文档,在百万token场景下,V4-Pro单token推理算力降至V3.2的27%,KVcache占用降至10%;V4-Flash则进一步压缩至10%和7%。②26年4月20日,月之暗面发布KimiK2.6。K2.6强调长程代码任务和AgentSwarm编排能力。在官方博客示例中,K2.6曾在...

DeepSeek V4 发布:长上下文能力突破,开源模 型进入百万 token 原生时代

事件:2026 年 4 月 24 日,DeepSeek 发布 V4模型,拥有百万字超长上下文, 在 Agent 能力、世界知识和推理性能上均实现国内与开源领域的领先。本次发布 的 V4 系列包括 DeepSeek V4-Pro 与 DeepSeek V4-Flash,均支持 1 M 上下文。 其中,V4-Pro 总参数 1.6T、激活 49 B,定位高难度推理、复杂分析和 Agent 任 务;V4-Flash 总参数 284B、激活 13B,更强调效率与部署成本。两款模型均提供 不同推理强度档位,便于用户在效果、时延和成本之间做权衡。

(一)模型架构创新:从 Attention 瓶颈到上下文稀疏化

DeepSeek V4 引入了新的混合注意力机制。传统 Transformer 在序列长度持续上 升后,计算和显存压力都会明显增加,这也是超长上下文长期难以真正落地的核心 约束。V4 的改进方向,正是针对这一瓶颈。

根据官方技术文档,V4 将 CSA(Compressed Sparse Attention 与 HCA( Heavily Compressed Attention) 两类注意力机制结合使用,CSA 先对 KV cache 做压缩,再进行稀疏选择;HCA 采用更高压缩率,但保留密集注意力计算; 同时叠加滑动窗口分支,以保留局部依赖关系。整体思路并不是简单把窗口做大, 而是在信息保留和计算成本之间重新分配资源。 从结果看,这套机制本质上是把 Attention 由“全量计算”改成“压缩后有选择地计 算”,从而降低长序列中的无效访存和冗余计算。与此前主要依赖 MoE 做参数侧 稀疏化不同,V4把优化重点进一步推进到序列处理路径,核心目标是降低长上下文 场景下的底层计算与访存开销。

除注意力机制外,V4 还引入 mHC 以增强深层网络训练稳定性,使用 Muon 优化 器提升收敛效率,并配合FP4量化感知训练、并行框架和 KV cache 管理做工程适 配。单看某一项改动并非完全全新,但几项升级围绕“长上下文可训练、可推理、可 复现”协同展开,说明V4更偏向模型结构与工程实现的协同优化。 后训练部分同样是 V4 能力提升的重要来源。按照官方报告描述,V4延续了先专才 化、再统一收敛的思路,但将 V3.2 中的混合强化学习阶段替换为OPD(On-Policy Distillation),即先按数学、代码、Agent 等方向训练专家,再把不同能力蒸馏回统 一模型。这种‘先拆分、再整合’的路径,有助于减少多任务直接混训时的能力牵 制,尤其适合当前推理、工具使用和代码任务差异较大的模型阶段。对产业观察而 言,这意味着模型优化正在从单一通用指标,转向更注重任务结构的后训练组织方 式。

此外,在具体应用方向上,DeepSeek V4 也对 Agent 场景做了较多工程化优化。 官方报告提到的重点包括工具调用格式调整、长链任务中的上下文保留,以及用于 训练和评测的 DSec 沙箱基础设施等,以及针对 Claude Code 、OpenClaw、 OpenCode、CodeBuddy 等主流的 Agent 产品进行了适配和优化,在代码任务、 文档生成任务等方面表现均有提升。

(二)模型性能:开源第一梯队,与闭源前沿仍有差距

从能力结构看,DeepSeek V4 可归入当前开源模型第一梯队,其优势主要体现在长 上下文效率和开源模型综合能力提升上,但在通用知识和复杂 Agent 任务上,与 头部闭源模型仍有一定差距。整体来看,DeepSeek V4虽仍落后GPT-5.4与Gemini3.1约3–6个月,但差距显著缩小。在性能逐步收敛的背景下,效率、成本和部署能 力的重要性进一步提升。 通用知识方面,V4 领先多数开源模型。V4-Pro-Max 在 SimpleQA-Verified 上取得 57.9,显著高于多数开源模型,但与 Gemini-3.1-Pro High 的 75.6 仍有差距;在数 学、STEM、竞赛型代码的测评也大体呈现开源领先、闭源仍强的格局。 Agent 能力方面,V4 较前代大幅提升,但与海外顶尖模型仍存差距。官方报告显 示,V4-Pro-Max 在 SWE Verified 上达到 80.6,与 Gemini-3.1-Pro High 持平; 但在 Terminal Bench 2.0、Toolathlon 等更强调复杂交互和工具调用的任务上,较 GPT-5.4 及部分闭源模型仍有差距。 长上下文方面,V4 的差异化最为明确。在 1M token 场景下,V4-Pro 单 token 推 理 FLOPs 约为 V3.2 的 27%,KV cache 约为其 10%;V4-Flash 则进一步降至 约 10% 和 7%。同时,LongBench-V2、MRCR 1M、CorpusQA 1M 等长上下文 任务较前代也有明显提升。

(三)价格与效率:长上下文成本实现结构性下降,性价比优势延续

对比海外模型,V4-Pro 与 GPT-5.5、GPT-5.4、Claude Opus 4.7、Gemini 3.1 Pro 同样支持 1M 上下文长度,但价格端更低。DeepSeek 官方定价显示,V4-Pro 支 持 1M 上下文,缓存未命中输入/输出价格分别为 12元/24元每百万 token;相比之 下,OpenAI GPT-5.5 API 标价为 $5/$30 每百万 token,Claude Opus 4.7 为 $5/$25 每百万 token。因此,在长文档处理、代码库级理解、多轮 Agent 调用等 高 token 消耗场景中,V4-Pro在单位token成本上具备优势。 对比国内模型,阿里 Qwen3.6-Max、Kimi K2.6、GLM-5.1、MiniMax-M2.7 等高端 模型在价格端同样具备竞争力,但上下文窗口多集中在约 200K–256K 区间。 DeepSeek V4 将国产旗舰模型推入 1M 上下文阵营,更适合复杂 Agent、长程推 理和超长文本任务——V4-Pro 可以承接复杂 Agent、长程推理、超长文本处理和代 码仓库级理解等高上下文依赖任务;V4-Flash 则在轻量Agent、批量文本处理和成 本敏感型场景中具备应用潜力有望在轻量 Agent、批量文本处理和成本敏感型场景 中形成更高性价比路径。

DeepSeek V4 的核心边际变化并非绝对参数规模扩张,而是长上下文推理效率的 系统性改善。根据官方技术文档,在 100 万 token 场景下,V4-Pro 单 token 推 理FLOPs降至V3.2的27%,KV cache占用降至10%;V4-Flash则进一步压缩至10% 和7%。这意味着在上下文窗口显著放大的同时,单位推理开销并未线性膨胀,长上下文应用从可运行逐步向可部署过渡。 在旗舰模型普遍向长上下文、Agent 化和复杂任务执行方向演进的背景下, DeepSeek V4 已具备与海外头部模型进行部分能力对比的基础,同时延续了较为突 出的成本优势。后续其在代码生成与理解、长文档处理、企业知识库、多文档研究和 Agent 工作流等场景中的落地表现,将成为验证模型商业价值的关键。 V4-Pro-Max 在部分能力上已接近闭源前沿模型,V4-Flash 则提供了更高性价比路 径。其意义不只在于 benchmark 提升,更在于通过开源生态、长上下文能力和低单 位 token 成本,有望压缩闭源模型在部分高token消耗场景中的价格溢价。

Kimi K2.6 发布,全面精进代码和 Agent 集群能力

事件:2026 年 4 月 20 日,Moonshot AI 发布 Kimi K2.6。K2.6 强调长程代码任 务、Agent 自主执行、多模态输入和 Agent Swarm 编排能力。根据官方微信公众 号,Kimi K2.6 已通过 Kimi.com、Kimi App、API 与 Kimi Code 提供使用,并定 位为具备开源编码、长程执行和 Agent Swarm 能力的新一代模型。 Kimi API 文档 显示,K2.6 支持文本、图像和视频输入,支持思考/非思考模式以及对话/Agent 任 务,上下文长度为 256K。

(一)模型架构创新:从单模型推理走向多模态 Agent 编排

Kimi K2.6 的技术主线围绕 Agentic Coding、多模态理解和并行任务编排展开。 根据 K2.5 官方技术报告,K2.5 通过联合文本-视觉预训练、zero-vision SFT、联合 多模态 RL,以及 Agent Swarm 机制,强化文本、视觉、推理和工具调用之间的协 同;Agent Swarm 可将复杂任务拆解为异构子问题并行执行。 从 K2.6 的公开信息看,这一思路被进一步工程化。官方博客称,K2.6 的 Agent Swarm 可动态拆解任务,并由自创建的领域子 Agent 并发执行;其规模从 K2.5 的 100 个子 Agent、1,500 步,扩展到 K2.6 的 300 个子 Agent、4,000 步协同 执行。因此, Kimi 的核心优化方向,是把复杂 Agent 工作流从单条长链路改造成 多 Agent 横向扩展,通过并行搜索、并行文档分析、并行代码修改和并行内容生成 降低端到端任务时间。 在多模态方向上,Kimi K2.6 延续了 K2.5 的多模态路线。根据官方技术文档,K2.5 模型采用 MoonViT-3D、MLP projector 与 Kimi K2 MoE 语言模型组合,并通过图 文视频联合训练实现视觉与语言能力的协同增强;其视频理解中还通过时序压缩, 在同一上下文窗口下处理更长视频。K2.6 进一步明确其支持文本、图像和视频输入, 这使其更适合前端生成、视觉转代码、视频理解和多模态 Agent 场景。

(二)模型性能:代码与 Agent 场景突出

从能力结构看,Kimi K2.6 的差异化主要体现在 长程代码、复杂工程任务和自主 Agent 执行。官方博客显示,K2.6 面对不同编程语言(如 Rust、Go、Python)和 任务场景(如前端、运维、性能优化)均具备更可靠的泛化能力;在官方博客示例 中,K2.6 曾在 12 小时以上连续执行、4000 多次工具调用和 14 轮迭代中完成本 地模型推理优化任务。 在企业和开发者侧反馈中,K2.6 在工程可靠性上也有所提升。例如 CodeBuddy 内 部评测显示,K2.6 代码生成准确率提升 12%,长上下文稳定性提升 18%,工具调 用成功率达到 96.60%;Vercel 反馈称其在 Next.js benchmark 上提升超过 50%, 并认为其性价比适合 Agentic Coding 和前端生成。这些数据更多来自合作方和内 部评估,但能反映 K2.6 的产品化方向:不是追求单一问答 benchmark,而是强化 长时间、多步骤、真实工程环境中的完成率和稳定性。 Agent 能力方面,K2.6 强调持续执行和主动协作。官方博客提到,K2.6 可在 OpenClaw、Hermes 等自主 Agent 场景中运行,并在内部案例中支持 5 天自主工 程工作流,覆盖监控、事故响应和系统运维等任务,表明 Kimi K2.6 的 Agent 能力 更偏向真实工作流执行,而不只是一次性工具调用。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至