2026年第8周计算机行业周报:春节海内外大模型更新全梳理!壁仞科技深度发布!
- 来源:申万宏源研究
- 发布时间:2026/02/24
- 浏览次数:190
- 举报
计算机行业周报:春节海内外大模型更新全梳理!壁仞科技深度发布!.pdf
计算机行业周报:春节海内外大模型更新全梳理!壁仞科技深度发布!春节期间,国内外大模型厂商持续更新,在多模态、Agent能力以及传统的基准测试中均有所提升。除了能力的提升,成本优化、真实的复杂任务解决能力成为近期模型迭代的整体技术趋势。我们认为,2026年大模型货币化进程将加速推进,Agent、多模态为应用落地的重点方向。应用形态的改变意味着AI从Chatbot、Copilot等对话式的交互模式进一步向未来形态演进,产生更加视觉化的用户体验和互动方式,降低用户的使用门槛。Agent方面,Skills风靡,可自主编排与调用外部API、软件等多样化工具,弥补了大模型数据滞后和无法直接操作系统的短板;...
国内外大模型纷至,AI 加速迈向下一阶段
事件:春节期间,国内外大模型厂商持续更新,在多模态、Agent 能力以及传统的基 准测试中均有所提升。除了能力的提升,成本优化、真实的复杂任务解决能力成为近期模 型迭代的整体技术趋势。 我们认为,2026 年大模型货币化进程将加速推进,Agent、多模态为应用落地的重点 方向。应用形态的改变意味着 AI 从 Chatbot、Copilot 等对话式的交互模式进一步向未来形 态演进,产生更加视觉化的用户体验和互动方式,降低用户的使用门槛。同时,单位时间 内、单次 AI 任务消耗的算力将大幅提升,AI 应用加速落地。
1.1 国内:推理效率、Agent 能力、多模态并进
事件:1)智谱发布开源大模型 GLM-5,参数规模扩大,编程能力对齐 Opus 4.5;2) Minimax 发布开源模型 M2.5,编程、工具调用和搜索、办公等生产力场景达到/刷新行业 SOTA;3)字节跳动发布视频大模型 Seedance2.0,支持四模态输入,音频同步、镜头 语言等多维度提升,实现“导演级”视频生成,更贴合工业级应用;4)字节跳动发布豆 包大模型 2.0,多模态能力持续增强,企业级 Agent、Coding 能力提升。5)阿里发布 Qwen-3.5 系列模型,推理效率大幅提升。 2 月 12 日,智谱发布并开源新一代大模型 GLM-5。模型参数从 GLM-4.7 的 355B(激 活 32B)扩展至 744B(激活 40B),预训练数据从 23T 提升至 28.5T,用更多算力提升 通用智能基座。 从代码向工程能力演进,GLM-5 在 Coding 与 Agent 能力上取得开源 SOTA 。当前, 大模型正在从写代码、写前端,进化到写工程、完成大任务,即从“Vibe Coding”变革 为“Agentic Engineering”。在全球权威的 Artificial Analysis 榜单中,GLM-5 位居全球 第四、开源第一。其能力的提升来自于: 参数规模扩展:从 355B(激活 32B)扩展至 744B(激活 40B),预训练数据从 23T 提升至 28.5T,更大规模的预训练算力显著提升了模型的通用智能水平。 异步强化学习:构建全新的“Slime”框架,支持更大模型规模及更复杂的强化学习 任务,提升强化学习后训练流程效率;提出异步智能体强化学习算法,使模型能够持续从 长程交互中学习,充分激发预训练模型的潜力。 稀疏注意力机制:首次集成 DeepSeek Sparse Attention,在维持长文本效果无损的 同时,大幅降低模型部署成本,提升 Token Efficiency。
具体来看,GLM-5 编程能力对齐 Claude Opus 4.5。在主流基准测试中取得开源模型 SOTA 分数。在 SWE-bench-Verified 和 Terminal Bench 2.0 中分别获得 77.8 和 56.2 的 开源模型 SOTA 分数,性能超过 Gemini 3 Pro。在前端、后端、长程任务等编程开发任务 上显著超越 GLM-4.7(平均增幅超过 20%),能够以极少的人工干预自主完成 Agentic 长 程规划与执行、后端重构和深度调试等系统工程任务,使用体感逼近 Opus 4.5。 Agent 方面,GLM-5 具备 SOTA 级长程任务执行。GLM-5 在 Agent 能力上实现开源 SOTA,在多个评测基准中取得开源第一:在 BrowseComp(联网检索与信息理解)、 MCP-Atlas(工具调用和多步骤任务执行)和 τ²-Bench(复杂多工具场景下的规划和执行) 均取得最佳表现,这些能力表明GLM-5在保持目标一致性、进行资源管理、处理多步骤依 赖关系等能力上较为领先,是 Agentic Engineering 实现的核心。 2 月 12 日,Minimax 发布开源模型 Minimax M2.5。M2.5 是 MiniMax 推出的 10B 激 活参数轻量级旗舰大模型,主打编程与 Agentic 能力。M2.5 在编程、工具调用和搜索、办 公等生产力场景都达到或者刷新了行业的 SOTA,比如 SWE-Bench Verified(80.2%), Multi-SWE-Bench(51.3%),BrowseComp(76.3%)。
编程领域:像架构师一样思考和构建。M2.5 支持超过 10 种语言,在数十万个真实环 境中进行了训练,胜任各类复杂系统开发的全流程。覆盖Web、Android、iOS、Windows、 Mac 等多平台的全栈项目,包含 Server 端 API、功能逻辑、DataBase 等,而不仅仅是 “前端网页 demo”。 M2.5 具备架构思考和构建能力,比如模型演化出了原生 Spec 行为:在动手写代码前, 以架构师视角主动拆解功能、结构和 UI 设计,实现完整的前期规划。在编程核心测试中 M2.5 达到了与 ClaudeOpus 系列类似水平,在多语言相关的任务 Multi-SWE-Bench 上, M2.5 取得第一。

办公领域:真正的场景落地交付。通过与金融、法律、社会科学等领域的行业专家合 作,M2.5 将行业的隐性知识带入到模型的训练流程之中,使得其在 Word、PPT、Excel 金融建模等办公高阶场景中取得了显著的能力提升。 评测层面,Minimax 构建了内部的 Cowork Agent 评测框架(GDPval-MM),以两两 对比的方式评估模型的交付质量和轨迹的专业性,同时监控全流程的 token 费用,估算模 型在生产力场景中的实际效益。在与主流模型的对比中,它取得了 59.0% 的平均胜率。
效率与性价比共存。M2.5 的原生服务速度达到每秒 100 token(几乎为其他前沿模型 的两倍)。加上强化学习对高效推理的激励,其在复杂任务上的时间节省效果明显。以运 行 SWE-Bench Verified 为例,M2.5 完成每个任务平均消耗 352 万 token,端到端运行时 间从 31.3 分钟缩短至 22.8 分钟,速度提升 37%。这一速度与 Claude Opus 4.6 相当,但 单任务总成本仅为后者的十分之一。 M2.5 共有两个性能相同但速度不同的版本:1)M2.5-Lightning:稳定吞吐量每秒 100 token,每百万输入 token 0.3 美元,输出 2.4 美元。2)M2.5:吞吐量每秒 50 token, 价格减半。按照输出价格计算,50 TPS 的版本价格是 Opus、Gemini 3 Pro 以及 GPT5 这些模型的 1/10-1/20。 2 月 12 日,字节跳动发布视频大模型 Seedance2.0。该模型基于双分支扩散 Transformer 架构,首次实现了四模态输入(文本、图像、视频、音频)的协同处理, (此前为文本+图像双模态输入)Web 端可生成最长 15 秒、2K 分辨率的音视频同步视频。 从 AI 视频生成迈向 AI 导演。相比 1.5 版本,Seedance2.0 的生成质量大幅提升,其 在复杂交互和运动场景下的可用率更高,在角色一致性、物理真实性、多镜头叙事和原生 音频同步四个维度实现了质的飞跃,更加贴合工业级创作场景的需求: 原生视听同步:与早期需要单独音频后期制作的模型不同,Seedance2.0 在生成视频 内容的同时生成同步的音频,包括场景音效、多种语言(同时支持口型同步)、空间音频 等能力。
多镜头叙事:与传统的 AI 视频生成器通常生成单个连续的镜头不同,Seedance2.0 能够将叙事概念分解为多个镜头,做到如电影拍摄般的“分镜感”,且在角色一致性、环 境(包括光影、天气、场景细节等)、叙事连贯性上保持高度一致。 风格多样性:Seedance 2.0 支持广泛的视觉风格,包括:照片级写实渲染、动漫/动 画美学、水彩和绘画风格、黑色电影和复古胶片外观、抽象和实验视觉效果等。 在真实的横向测试中,Seedance2.0 在视频生成模型中表现突出。在相同提示词输 入的前提下,Seedance2.0 在人物动作细节、叙事一致性、影片风格与情绪渲染上,相较 于国内外同类竞品,表现均较为优异。
2 月 14 日,字节跳动发布豆包大模型 2.0。豆包 2.0 系列包含 Pro、Lite、Mini 三款通 用 Agent 模型和 Code 模型,灵活适配各类业务场景。整体来看,豆包大模型 2.0 在多模 态理解、企业级 Agent、推理和代码能力上有较大提升: 更强多模态理解:在多模态感知、高精度文字提取、图表理解、空间理解、运动理解、 视觉知识和推理、长视频理解等方面表现出色。Seed2.0Pro 在 MathVista、MathVision、 MathKangaroo、MathCanvas 等数学推理基准上达到业界最优水平。同时,在 LogicVista、 VisuLogic 等视觉解谜与逻辑推理基准上,Seed2.0Pro 得分较 Seed1.8 显著提升。

在 VLMsAreBiased、VLMsAreBlind、BabyVision 等基准中,Seed2.0 取得了业界最 高分,说明它在面对不同类型的视觉输入时,仍能保持准确且可信的感知和判断能力。
企业级 Agent 能力:模型能更好支持对技能(Skills)的理解和应用,Function Call 、 多轮指令遵循、搜索和工具调用能力显著增强,格式输出更稳定,支持灵活的上下文管理, 更好地支持企业级复杂、长程任务,在数据分析和客服 Agent 等企业场景中表现出色。 编程和代码能力优化:Seed-2.0 引入了专用的 Code 版模型(Doubao-Seed-2.0- Code),针对程序员场景进行优化,与 IDE 和 TRAE 等工具结合更高效。在代码理解、 生成和长上下文代码推理方面表现更强,支持更复杂的编码任务。 2 月 16 日,阿里发布 Qwen3.5-Plus 和 Qwen3.5-397B-A17B 两款新模型。3.5-Plus 版本定位为 Qwen3.5 系列最新大语言模型,3.5-397B-A17B 定位为 Qwen3.5 开源系列旗 舰大语言模型。两款模型均支持文本和多模态任务。 推理效率大幅提升,最大推理吞吐提升 19 倍。Qwen3.5 实现底层模型架构的革新, 首次将线性注意力(Gated Delta Networks)与稀疏混合专家(MoE)相结合。其中, Qwen3.5-Plus 版本总参数为 397B,激活仅 17B,在保持能力的同时优化速度与成本。 Qwen3.5-397B-A17B 在推理、编程、智能体能力与多模态理解等全方位基准评估中 表现优异,为 Agent 落地奠定坚实基础;Qwen3.5 性能超过万亿参数的 Qwen3-Max 模 型,部署显存占用降低 60%,推理效率大幅提升,最大推理吞吐量可提升至 19 倍。
我们认为,国内大模型依旧保持大模型迭代与 AI 应用落地的紧密结合。整体来看:1) 从“技术竞速”转向“价值竞速”:本轮更新中,模型普遍强调解决实际问题的“实干能 力”,如 GLM-5、MiniMax M2.5 聚焦复杂编程与系统工程,Seedance 2.0 瞄准影视、电 商等垂直行业应用。2)Agent 成为核心赛道:国内外模型均加强对长程、复杂任务自主 规划与执行能力的优化,标志着竞争进入“Agent 时代”。3)开源生态持续繁荣:国产模 型如 GLM-5、Ming-Flash-Omni 2.0 等选择开源,正在构建技术底座并挑战闭源模型的定 价权。4)成本与性能的平衡:在提升能力的同时,维持较低的 tokens 成本,推动大模型 规模化商用。
1.2 海外:性能提升的同时开始注重“性价比”
事件:1)Anthropic 发布 Claude Sonnet 4.6,计算机使用能力快速提升,性能接近 旗舰款 Opus 4.6,API 定价仅为 1/5,性价比显著提升。2)谷歌发布 Gemini 3.1 Pro:核 心推理能力领先,成绩较上代模型翻倍。 2 月 17 日,Anthropic 发布 Claude Sonnet 4.6,模型采用稀疏激活的混合专家架构, 总参数量达 1 万亿,每次前向传播仅激活 320 亿参数,在保持高性能的同时提升推理效率。 新模型在编程、操作电脑、长文本推理、智能体规划、知识工作和设计等方面实现全面 升级。 定位“高性能与高性价比”的平衡。Sonnet 4.6 定价与 Sonnet 4.5 相同,仍为每百万 token 输入 3 美元、输出 15 美元,Sonnet 4.6 的性能已接近 Anthropic 的旗舰模型 Opus 4.6 水平,但 API 定价仅为其五分之一。Sonnet 4.6 的定价策略为本次发布的最重磅看 点,此前需要使用 Opus 级模型才能达到的(包括办公任务等)现在通过 Sonnet 4.6 即 可获得。对于目前大量进行 API 调用的 Agent 使用企业而言,带来了较大的成本节降。 计算机使用能力提升,具备高级 GUI 自动化操作能力。Sonnet 4.6 在 OSWorld 基准 测试中从 4.5 版本的 61.4%跃升至 72.5%,与 Opus 4.6 的 72.7%基本持平,可执行网页表 单填写、表格导航、跨应用操作等复杂任务。此外,在 GDPval 办公任务测试中 Elo 评分 达 1633,支持多步骤任务分解、工具调用和自主决策。

2 月 19 日,谷歌发布 Gemini 3.1 Pro。Gemini 3.1 Pro 在核心推理能力上实现了显著 提升,成为解决复杂问题更智能、更强大的基础模型。在业界公认高难度的ARC-AGI-2通 用智能基准测试中,Gemini 3.1 Pro 获得了 77.1%的高分,超越 Claude、GPT 模型,且 成绩相较 Gemini 3 Pro 实现翻倍提升。 推理性能大幅提升的同时,定价不变。Gemini 3.1 Pro 保持 Gemini 3 Pro 的定价策略: 每百万 tokens 输入 2 美元起,输出 12 美元起。与 Sonnet 4.6 类似,谷歌在能力提升的同 时保持价格不变,即为 API 调用用户免费升级了推理能力。
我们认为,大模型竞赛的焦点从单纯的性能比拼,转向真实复杂任务的解决能力与性 价比。当前大模型行业正从通用能力比拼,转向真实世界复杂任务的处理能力,海外大模 型在推理、工程化、多模态理解等核心能力上不断发力突破;同时,在定价策略上突出 “性价比”,在不大幅牺牲性能的情况下,突出性能与成本的平衡。
编辑:火腿肠-
标签
- 计算机
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 房地产行业专题报告:城市更新推动高质量发展.pdf
- 6 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 9 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年春季港股及海外中资股投资策略:分化与回归
- 5 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 6 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 7 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 8 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 9 2026年春季海外宏观展望:结构性“滞胀”
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 4 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 5 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 6 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 10 2026年中期医药生物行业投资策略:AI新药加速推进
