2026年软件与服务行业:软件板块深度回调,寻找错杀的机会

  • 来源:中信建投证券
  • 发布时间:2026/03/27
  • 浏览次数:107
  • 举报
相关深度报告REPORTS

软件与服务行业:软件板块深度回调,寻找错杀的机会.pdf

软件与服务行业:软件板块深度回调,寻找错杀的机会。当前软件板块的恐慌性无差别杀跌,为基于壁垒深度的分化定价提供了窗口。我们建议沿“壁垒攻防属性”进行配置:①核心超配"进攻性壁垒"标的,壁垒本身成为AI时代新增长基础的公司(如Palantir,ServiceNow);②关注"防御→进攻转型"窗口,传统壁垒坚固但需验证AI收入转化的公司(如SAP,Salesforce);③回避壁垒衰减时间常数短的标的,低复杂度+浅层数据的公司(如Five9,UiPath)。关注OpenAI、Anthropic与咨询公司合作进展,企业软件公司...

行业概况:软件板块估值回调至多年低位

当前美股软件板块正经历自 2020 年 3 月以来定价最不合理的“结构性恐慌”。尽管 Anthropic 发布的 Claude Code/Cowork 等工具引发了“AI 将吞噬 SaaS”的末日叙事,导致软件板块估值中位数降至 3.2x EV/Rev,远低 于疫情前 7.8x 的历史均值 ,但这种恐慌忽略了不同软件品类间的深度分化。软件正从“赋能人类的工具”向 “交付结果的数字员工”跃迁。未来价值将向拥有垂直数据、业务 Know-How 及基础设施地位的厂商聚集,而 缺乏壁垒的“UI 包装型软件”将面临灭绝。

逻辑上看,企业软件的价值不在于代码本身(从 SaaS 的高毛利可以看出),如果价值真的体现在代码 上,这些公司一开始就不可能发展到如此规模。它们早在几年前就被开源软件或发展中国家廉价软件工程师的 竞争淘汰了。事实上,根据哈佛大学 2024 年的报告《Open Source Software: The $9 Trillion Resource Companies Take for Granted》1,开源社区为企业节约了 8.8 万亿美元的开发成本,约 96%的商业程序都包含一些由面向公 众的技术论坛创建、修改或免费分发的代码。尽管如此,企业仍为商用/企业版付费,用于支持、安全、合 规、集成和 SLA。OSS 常采用 open-core 模式:核心免费,企业特性/托管/服务收费。96%组织增加或维持 OSS 使用,但主要驱动是成本降低(53%),同时面临技能、集成、安全挑战,导致混合使用而非完全替代。 目前的 Vibe Coding 工具很大程度上降低了开发维护软件的成本,但与开源软件类似的,企业软件安全、合 规、集成和 SLA 的价值并非被完全颠覆。

Frontier Model Labs 受模型层同质化挤压(任何模型难以取得长期优势),API 价格通缩,尽管 Token 量指 数级别增长,但是 OpenAI 披露的单位 GW 的收入过去 3 年维持平稳2,(考虑付费用户比例轻微下降,但用户 ARPU 提升),迫使模型 Labs 需要向下游应用层渗透(但不意味着必然成功)。

软件公司典型的竞争壁垒包括迁移成本,网络效应,流程能力,专有数据等。其中 1)迁移成本分为代码转 译、决策成本,企业架构转型中最困难的往往是决定转型,一旦决策后,代码迁移的时间和金额成本并没有特 别高,一些复杂系统的迁移周期长主要是,例如 Oracle 数据链接下游多个业务系统,ERP 系统链接采购、库存、 生产制造等多个模块,一旦迁移往往涉及整个系统的重构,除非新架构带来效率质的飞跃,否则决策层难以决 定迁移。Gartner 的研究表明7,83%的数据迁移项目要么彻底失败,要么显著超出分配的预算和时间线,导致失 败的主要原因并非代码转译本身。用户对系统实施的抵制被一致认为是这一高失败率的关键原因8。 2)网络效应基本不受影响,Harvey9和 Hebbia 正在构建金融和法律协作空间,将服务提供商、客户以及他 们的代理人连接到同一个系统:使用这些平台的人员和代理人越多,平台的价值就越高。Harvey 的联合创始人 Winston Weinberg 和 Gabe Pereyra 认为法律 AI 的未来将是律所与客户之间的协作,律所还可以共享定制的工作 流和 Playbook,让客户生成初稿或获得结构化指导,同时保留律师监督的好处。跨组织的法律团队可以在安全 的共享空间中协作。律所和客户可以在单一安全空间中并肩工作,以获得更好的成果和更深层的关系。使用这 些平台的人员和代理越多,平台的价值就越高。 3)流程能力基本不受影响。Harvey 在 Workflow Builder 发布博客中提到10,这个工具可以把律所的专有 知识变成结构化、可复用的系统;创新与知识团队可以设计出反映本所专有的 Agents。此外,底层模型更强, 不会把应用层压扁11;相反,任务更复杂后,编排、上下文管理、子代理分工、格式控制和可观测性变得更值钱。 它们会增强应用层的功能 ,因为真正的难点从来不在于原始的智能,而在于如何运用这些智能。 4)专有数据仍然非常重要。Hebbia 与 FactSet 的合作让用户把结构化市场/公司/估值数据,和 Hebbia 自己 的历史交易数据、内部外部文档一起用;与 Preqin 的合作允许客户把 一级市场数据和内部/第三方数据合并, 用于尽调、筛选交易、benchmark、relationship mapping、portfolio monitoring;与 Fitch Solutions 的合作则让客户把评级、发行人研究跟 VDR 材料放进单一工作流。当模型本身趋于通用后,真正稀缺的不是“能不能生成”, 而是谁能把高质量数据、内部资料、权限和工作流拼接成可执行系统12。 综上所述,AI 对软件的冲击并非整齐划一,而是根据工作流复杂度与数据护城河深度呈现分化①高复杂度 + 深层数据,代表标的 ServiceNow (NOW),其本质是确定性系统。②低复杂度 + 深层数据,代表标的 HubSpot (HUBS)。虽然拥有数据,但因工作流简单,AI 会显著提升单人产出,导致“席位制”计费逻辑崩塌。即便平台留 存,收入规模也可能因席位缩减而面临结构性压缩。③低复杂度 + 浅层数据,代表标的 Five9 (FIVN)、 Freshworks (FRSH),其核心价值已被 Claude Cowork 的开源插件覆盖,护城河极薄。

模型层是否正在加速同质化?

叙事回归基本面,模型层面是否正在同质化?MIT、微软、Amazon、波士顿大学的研究团队针对 Openrouter 披露的模型采用数据,发现尽管开源模型比闭源模型更便宜,通常价格可以低至闭源模型的 90%(如果用作者 独立构建的 intelligence 指标标准化模型性能以后),但闭源模型在平台上的采用占比仍然高达 75%,只有 25% 的用量来自开源模型。

这一结果与经济学的同质化供需市场假设相违背,原因可能有 1)模型并非完全同质化,2)模型同质 化,但基于公开 benchmark 构建 Intelligence index并未很好的捕捉模型之间的性能差异,例如风格一致性、在 测试集外的性能差异、服务稳定性等。

研究团队对于 Openrouter 模型价格的回归分析显示,模型性能(基于公开 benchmark 构建)、开源与否、 支持推理、上下文窗口合计解释价格的 42.5%,如果补充模型固定效应(粘性)则解释力度提升至 61.5%。

而对于模型使用量的回归分析,价格对用量的影响解释程度仅有 34%,模型的固定效应解释程度合并后可 以达到 97%(模型型号、模型提供商的粘性)。 需要注意,由于各家模型厂商都有一些 secret sauce 用于模型评估/训练迭代,所以模型的固定效应包含了 一部分公开 benchmark 未捕捉的性能差异,剩余的影响因素才是模型本身的粘性。论文在最严谨的设定下测算 出的短期需求价格弹性为-1.11。这意味着,价格每下降 1%,调用量只增加约 1.11%。

在经济学中,弹性的参照系如下:缺乏弹性(0 到 -1):必需品(如食盐、胰岛素、短期的汽油)。价 格怎么变,大家都得买。单位弹性(约 -1):常规商品(如普通的衣服、住房)。价格降一点,销量按比例 涨一点。富有弹性(-2 到 -5 或更低):替代品极多的商品(如某个特定品牌的矿泉水、相邻不同加油站的 汽油) 大模型市场的粘性主要表现为“以品牌为中心的竞争”,一方面生态内部的极低转换成本,跨生态的极高 转换成本。当 Anthropic 推出与 Claude 3.5 价格相同但性能更强的 Claude 3.7 时,用户会立即放弃旧版本并 迁移到新版本。对于开发者而言,在同一个代码库里把 API 调用的模型名称从 claude-3-5-sonnet 改为 claude-3-7-sonnet 几乎没有成本。但这种替换几乎没有对同时期的 GPT-4o 或 Gemini 2.0 造成任何明显的份 额挤压。这证明用户被牢牢锁定在了各自的品牌生态墙内。如果市场没有粘性,Claude 3.7 的发布理应立刻抽 干其他所有竞争对手的流量。因此模型层面高度同质化的判断并不准确,当前模型供应商存在一定粘性,但其 粘性在绝对的性能差距下也无法阻挡客户的流失,例如 Ramp AI 结合信用卡数据反馈的美国企业 IT 支出中 Anthropic 的份额在 2025 年下半年以来明显提升。

与一般的企业软件不同,企业软件的毛利率极高,一般在 60-90%区间,其边际成本主要是少量算力/存储+ 流程包装,而且扩展性比较强。但模型厂商不同,根据 The Information 披露,Anthropic、OpenAI 2025 年的毛利 率在 30-40%,其中 OpenAI 24 年毛利率为 40%,25 年毛利率为 33%,Anthropic 24 年毛利率为-94%,25 年毛 利率提升至 40%(但低于预期的 50%)。OpenAI 及 Anthropic 分别预计在 29 年/28 年达到 70%/75%的毛利率。 我们需要理解 25 年毛利率不及预期的原因,进而判断中期毛利率提升的假设是否合理。结合 The Information 报道,Anthropic 严重依赖第三方云基础设施。财务数据显示,其在 Google 和 Amazon 服务器上为付费客户运 行 AI 模型的实际推理成本,比内部预期高出了整整 23%。当 Anthropic 推出诸如 Claude 3.5 到 3.7 的升级, 或推出如 Claude Code 这样针对复杂编程和办公场景的功能时,用户提交的任务变得极其庞大和复杂。虽然API 标价没变,但单次任务占用云端 GPU/TPU 的时长和算力远超预期,直接侵蚀利润空间。如果把免费用户 的推理成本也算作 COGS,其综合毛利率会进一步跌至 38% 左右。OpenAI 也提到,为了提供更聪明的回答(尤 其是 o1、o3 等具备深度思考能力的模型),模型在后台需要生成海量的 Reasoning Token,API 单价虽然没变, 架构优化例如量化压缩、MoE稀疏激活等降低单 Token 成本,但最终毛利率仍然受到挤压。 总结来看,模型层过去 2-3 年仍然在加速同质化,尽管对于领先模型其形成了一定需求粘性(体现为溢价), 但这种锁定效应更多建立在 OpenAI、Anthropic 持续保持第一梯队(性能不至于被拉开太多)的前提下,同时 OpenAI、Anthropic 也在缩短模型迭代周期。最终体现为顶尖模型仍然有一定价格溢价,但是领先周期缩短,所 以这类溢价不足以支撑毛利率维持稳定趋势,我们总体上认可模型层同质化的判断,模型厂商需要向基础设施、 应用层拓展以巩固商业模式。

模型向应用层的扩张,AI 是否会吞噬一切?

当任务转向文本和知识工作时,最新的研究引入了“错误代价(Price of Error)”来对比人类与大模型。2025 年发表的论文《Economic Evaluation of LLMs》提出,衡量 AI 成本不能只看 API Token 的价格,必须将“AI 犯 错带来的业务损失”和“AI 延迟的时间成本”换算成美元,与人类工资进行对比。1)在高价值场景(如医疗诊断、 金融合规),“错误代价”极高。研究发现,一旦单次错误的代价超过 0.01 美元,部署最昂贵、最聪明的前沿大 模型(或直接雇佣人类)的经济效益,远远超过使用便宜但容易出错的开源小模型。2)在低价值场景(如电商 客服),错误代价低(约 1 美元),此时 AI 的推理成本远低于人类客服的时薪底线。 论文核心思路是引入条件约束,错误代价:模型犯一次错,会导致业务损失多少钱。延迟代价:模型每多 卡顿/延迟一秒钟,用户流失带来的经济损失是多少。弃权代价:模型回答“我不知道”并将任务转交给人工处 理时,需要支付的人工成本。 研究人员利用贝叶斯定理结合了真实的美国医疗诉讼数据:①医疗事故诉讼的平均赔偿额约为 50 万美元。②这些诉讼中约 2/3 源于真实的医疗错误。③医生每年遇到诉讼的概率是 7.4%(约 13.5 年遇到一次),在此 期间医生大约做出 100,000 次诊断。④每年约有 1/20 的成年人经历误诊,综合推算单次诊断发生错误的概率约 为 1/100 。将这些概率代入公式计算,得出在医疗诊断场景下,AI犯一次错的预期经济损失$333。这个具体的 数字为后续选择昂贵的高端模型提供了坚实的财务背书。 论文研究的核心结论是对于低容错率场景,必选推理模型,且模型准确率从 90%提升至 95%,可能意味着 价格可以提升数十倍乃至百倍(节约经济损失)。而这种在特定领域性能的提升往往来自后训练,结合查晟 (Amazon AGI 专家)的访谈反馈,在医疗、法律、复杂软件工程等高容错代价的垂直领域,传统的“微调(SFT)” 已经被逐渐抛弃。真正实现准确率质变的路径,是“基于连续预训练(Mid-training)注入知识”与“基于强化学 习(RL)的后训练(Post-training)激发推理”的深度结合。 结合公开数据我们逐一验证假设的合理性,①根据 Hampton & King15,全美 2025 年医疗诉讼平均赔偿金额 在 45.6 万美元/起,总共 10,028 起医疗诉讼,涉及赔偿金额 45.7 亿美元,但各州差异较大。②结合《Characteristics and Trends of Medical Diagnostic Errors in the United States》针对 1998-2018 美国 22 万份医疗诉讼的研究16,诊断 错误导致的诉讼占比 26.8%,治疗、手术相关的诉讼占比达 52.0%。③高风险科室的医生每年遭遇诉讼的比例是 7.4%17。④误诊的概率实际上远高于 5%,25 年的一项研究18反馈平均误诊率达 9.7%,中位数为 13.6%。如果我 们基于调整后的数据进行计算在医疗诊断场景下,AI犯一次错的预期经济损失为$63/$45,主要波动来自于诊断 错误占比从 67%下降至 26.8%。尽管 AI 犯错的预期经济损失下降至$45-63/次,但仍然远高于阈值(优先采用性 能最高的推理模型,即使考虑延迟和替换人工成本)。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至