2026年人工智能行业专题:大模型发展趋势复盘与展望

  • 来源:国信证券
  • 发布时间:2026/01/06
  • 浏览次数:138
  • 举报
相关深度报告REPORTS

人工智能行业专题(14):大模型发展趋势复盘与展望.pdf

人工智能行业专题(14):大模型发展趋势复盘与展望。复盘美股科技巨头过去三年股价走势,AI叙事不断递进。23年OpenAI领先全球开启AI加速度,微软受益于OpenAI独家合作,估值抬升明显。24年市场低估模型进步空间,叙事转向推理侧,认为应用公司最优,Meta坐拥社交垄断生态(潜在Agent入口)和广告场景,股价为除英伟达以外PE唯一抬升的巨头。(24年2月,英伟达业绩会估计数据中心收入约40%来自推理。)同年云厂商由于大幅增加资本开支但供给受限,云收入传导有延迟,三大CSP估值略有所回落。25年模型差距与OpenAI明显收敛,谷歌后来居上,生态优势为市场追逐。26年我们认为ScalingL...

美股科技巨头股价和资本开支复盘展望

美股科技巨头走势复盘:过去三年AI领涨叙事不断演绎

23年:OpenAI领先全球开启AI加速度,微软受益于OpenAI独家合作,估值抬升明显。 全年五家巨头股价在22年大幅回撤后,均出现明显利润修复。

24年:市场低估模型进步空间,叙事转向推理侧,认为应用公司最优,Meta坐拥社交 垄断生态(潜在Agent入口)和广告场景,股价为除英伟达以外PE唯一抬升的巨头。 (24年2月,英伟达业绩会估计数据中心收入约40%来自推理。)同年云厂商由于大幅 增加资本开支但供给受限,云收入传导有延迟,三大CSP估值略有所回落。

25年:模型差距与OpenAI明显收敛,谷歌后来居上,生态优势为市场追逐。上半年云 厂商供给逐步释放,收入端呈现加速,AI需求景气度持续。下半年巨头逐步上修全年 和26年Capex预期,市场开始担忧AI投资ROI,以及模型能力提升潜力,Scaling Law 是否见顶。除谷歌外,巨头估值均出现回落。

26年预测:Scaling Law持续,模型厂商打开差异化应用市场,模型推理侧需求或进 入放量拐点。模型和算力或为最优投资方向。

美股科技巨头走势复盘——英伟达

英伟达在23-25年的上涨过程中经历了几轮震荡和调整,主因皆为估值达到高位后,市场对竞争、需求确定性、排产节奏等边际变化因素更加敏感,但随后英伟达均通过强劲的业绩表现回应了质疑。1)23年5月-12月:经历Q1大幅上涨后,市场普遍质疑①估值过高,②美国限制出口风险,③其他公司的竞争;2)24年中至25年4月持续震荡,一方面业绩继续强劲,北美CSP持续上修资本开支,另一方面B系列发货推迟、竞争问题(TPU等)、以及DeepseekR1出现后带来对算力需求的质疑都造成公司股价的波动。

美股科技巨头走势复盘:25年AI叙事变化,拥抱最确定的方向

北美AI叙事的变化:拥抱最确定的方向。年初市场陷入Scaling law放缓的论调,Deepseek发布后质疑CAPEX强度,因此英伟达领跌,选择最先AI落地广告兑现的Meta。Q2各公司持续上修资本开支,继续坚定“大力出奇迹”,结合英伟达业绩兑现,市场重新拥抱算力。Q3开始伴随谷歌反垄断压制解除,同时Gemini模型领先,用户持续增长,结合对OpenAI海量算力订单的质疑,市场对谷歌达成共识。全年来看,Meta由于在模型训练投入收效甚微,亚马逊由于在资本开支、自研芯片、模型的落后,二者成为表现最差的两家公司。

资本开支展望:电力成为制约CAPEX增长的核心因素

随着资本开支的持续增加,北美数据中心的用电需求急剧增加,26年预计CAPEX增长的限制因素将从缺芯更多转向缺电,微软CEO曾表示微软手里囤积着成堆的英伟达AI芯片,却因为缺电、缺空间,只能让这些昂贵的GPU在仓库里“吃灰”。据FERC(美国联邦能源管理委员会)预测,24年美国夏季用电负载峰值为929GW,预计到2029年5年时间将累计新增120GW。而据Grid Strategies估计,120GW的增量中大约80GW来自数据中心。

电力供给无法与需求增量匹配带来用电缺口:1)为了实现环保目标,北美有大量煤电厂需要退役;2)数据中心配套的变压器、输电线等设施的建设周期长达5-8年;3)电力需求要求冗余,这进一步推高了对电网的供给量要求。

面对电力缺口,目前各公司通过:1)与能源公司紧密绑定,例如谷歌收购Intersect Power,亚马逊收购了Talen Energy位于Susquehanna 核电站旁的数据中心园区。绑定之后通过“计量表后”(behind-the-meter)供电方式——直接将电力接入数据中心,绕过公共电网,以弥补供能缺口;2)像海外寻找电力支撑,例如欧洲、亚太等电力资源相对丰富的区域;3)采用租赁电力资源充足的数据中心。

模型架构继续演化,Scaling law延续,多模态+长文本更成熟

模型发展趋势:23年从“技术奇点”向“产业爆发”

Scaling law红利期,OpenAI领先优势明显。23年各模型厂商的模型版本快速迭代,基本在半年时间就能完成一个大版本的升级,主要是由于预训练阶段的scaling law尚未触及数据瓶颈,通过扩展参数能够实现模型性能的快速提升,具备先发优势的OpenAI在23年通过GPT-4确立了模型在逻辑推理、复杂指令遵循上的SOTA基准。

模型仍以文本为主导,多模态雏形出现。OpenAI作为技术的领导者推出了视觉理解模型GPT-4V,以及基于扩散模型的视频模型DALLE·3,嵌入ChatGPT产品,增加其图像、视频能力,谷歌的原生多模态模型Gemini也在23年末正式推出。

基于Transformer架构的大语言模型应用场景以Chatbot为主。受限于推理能力和上下文长度,在编程等场景中仅具备本科学生级别基本代码能力,可处理中等难度问题,但仍然主要依赖网页端一问一答、手动改代码。

模型参数和训练数据量持续增长。根据DeepMind团队22年提出的Chinchilla Scaling法则,每增加 1 倍的参数量,对应的训练数据量(Tokens)也应该增加 1 倍,且最佳配比应为每10亿(1B)参数,至少需要200亿(20B)Tokens的数据进行训练。在使用合成数据后,模型预训练的数据量得到持续提升,根据lifearchitect.ai,预计海外目前头部模型最大参数量均已达到2万亿以上,马斯克曾提到26年的Grok5将达到6万亿参数,而对应的训练数据也扩张到100万亿以上。但在目前的部分论文中已证明(例如《AI models collapsewhentrained on recursively generated data》),随着合成数据使用的增加,会导致模型出现崩溃,因此拥有稀缺数据资源的模型厂商更有机会取得模型能力的明显提升。

模型发展趋势:24年多模态、推理模型开始涌现

24年OpenAI继续引领了模型发展的两大核心趋势:1)文本以外,图像、视频更强的模型开始涌现,包括GPT-4o为代表的多模态模型,但能力并未完善,GPT-4o的生图能力实际延期一年上线,同时OpenAI也在年初推出了视频模型Sora,谷歌5月发布Veo此后包括可灵、即梦等应用陆续上线;2)以GPT-o1(9月)为代表的推理模型方向。预训练的Scaling law开始边际放缓,GPT-o1引入了模型的慢思考能力,通过思维链(CoT)在给出最终答案前进行内部思考,利用推理时间的延长提升模型能力上限,在数据、编程、推理等领域提升显著。但模型上下文追踪、工具调用能力不足,agent 能力未落地(当时 SWE bench 仅能修复 1%-5%现实世界 GitHub 任务)。

Claude、Gemini、Llama等模型开始缩小与OpenAI的差距。在 LMSYS Chatbot Arena榜单中,24年初Claude 3 Opus首次完成了对GPT系列模型的超越,此后开源模型Llama3、Gemini也达到接近Openai旗舰模型的能力。

编程能力提升,Cursor开始出圈。年中Claude 3.5开始展现出在逻辑推理和编程方面的领先优势,结合无基础编程的破圈,Cursor的ARR迅速从23年末的100万美元增长至1亿美元。

模型厂发展路线分化,格局动态演进

OpenAI:C端份额领先,明年将发力企业业务

OpenAI从一开始就坚持“消费者优先”的 2C战略。主要原因是:1)早期模型的稳定 性和能力,并不足以支撑大多数企业级应 用;而现在,它们正在达到这个门槛;2) OpenAI具备先发优势,一旦占据C端市场也 会更容易进入B端市场。因此,今年OpenAI 企业业务的增长速度,已经超过了消费者 业务,26年的战略重点也会是企业业务。

记忆是OpenAI的护城河。奥特曼在12月17 日Big Technology Podcast的采访中表示, 相比模型性能更重视粘性,认为chatgpt的 用户粘性和护城河来自习惯、一致性和个 人体验积累出的信任感。由于ChatGPT最先 抢占市场构建起了超过8亿用户的基本盘, 用户在ChatGPT有更多的历史交流记录,也 意味着回答能够更贴近用户的需求。

模型能力来看,1)OpenAI各方面能力相对 更加均衡,无明显短板,但没有突出特色。 2)尽管今年OpenAI模型能力突破并不明显, 但仍需观察有望26Q1上线的OpenAI下一代 模型基于英伟达B系列芯片训练后显示出的 性能表现。

Anthropic:Coding能力突出,是代码开发场景的首选

Coding能力突出,是代码开发场景的首选。Anthropic 的势头起于 2024 年 6 月发布的Claude Sonnet 3.5,到了2025年 2 月的 Claude Sonnet 3.7 更是首次展示出“Agent 优先”的 LLM 雏形。到 2025 年5 月,随着ClaudeSonnet4、Opus 4 以及 Claude Code 的推出,其领先优势已被彻底坐实。根据Anthropic数据,44%的流量都是与计算机和数学类职业相关,细分的使用场景中前三名的分别是调试 Web 应用程序、解决技术问题以及构建专业商业软件。此外,根据MenloVentures,目前Anthropic在企业大模型API市场份额达到32%,Coding市场份额则达到42%。

Anthropic的逐步赶超尤其是在编程领域的优势主要得益于1)创始人Amodei对于编程场景的重视;2)编程和推理场景由于有确定性的答案,因此尤其在RLVR出现后能得到明显的能力提升。Amodei认为代码能力= 顶级逻辑能力,在代码中磨练出的“解决复杂问题的能力” ,可以直接迁移到生物医学、法律、数学和金融等严谨学科中。

推理需求有望爆发,看好编程、Agent等应用

推理侧需求:Tokens消耗量持续增长,编程是主要需求

推理需求主要反映在 tokens消耗的增长上,根 据大模型聚合平台 OpenRouter数据,25年的 周tokens消耗量已从年初 的5000亿增长至年末的 3.67万亿。从tokens消耗 结构看,编程是主要驱动 因素,并且从单次请求的 tokens结构来看,编程也 是主要的增长驱动力,与 编程相关的任务一直需要 最大的输入上下文。

推理侧需求:25年更多使用场景聚焦在大模型企业内部

尽管外部需求快速增长,但从结构上看,25年各模型厂商的消耗更多还是聚焦于自身业务发展。例如谷歌Gemini,我们测算其内部消耗占比约90%,OpenAI的模型tokens消耗则更多用于ChatGPT,国内阿里、字节Tokens消耗也都以内部场景占比更多。

展望26年,1)随着模型在多模态领域的突破,在视频、音频等场景的用量增加,预计推理侧将迎来Tokens的进一步大幅增长(文本1个汉字大约消耗1个token,1秒1080p 24帧视频消耗2.5万个tokens,1张图像大约消耗4000个tokens);2)随着模型厂商率先完成自身业务接入大模型,26年对外的需求和用量占比将增加。

Manus:通用Agent,上线8个月ARR达到1亿美元

Manus是一款通用Agent,其功能包括网站开发、PPT制作、图片设计、广泛研究、操作浏览器等。与目前的Chatbot类产品相比,Manus能够直接执行任务并交付结果,而非仅提供建议,设定目标后自主规划路径,无需持续监督,并且直接生成可用的应用、报告和演示文稿。

25年3月发布,5月开放注册后首日用户突破100万。10月Manus 1.5发布,任务完成时间从 15 分钟缩短到4 分钟以下。商业模式上结合固定订阅费用与基于积分(Credit)的使用量计费。12月ARR超过1亿美元,累计处理Tokens超过147万亿,创建8000万+ 虚拟电脑实例。12月30日,Meta以数十亿美元估值对Manus完成收购,公司创始人肖弘出任Meta 副总裁,蝴蝶效应保持独立运作。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至