2025年AI行业Agent专题报告:智能体基建厚积薄发,商业化应用曙光乍现

  • 来源:西南证券
  • 发布时间:2025/04/27
  • 浏览次数:513
  • 举报
相关深度报告REPORTS

AI行业Agent专题报告:智能体基建厚积薄发,商业化应用曙光乍现.pdf

AI行业Agent专题报告:智能体基建厚积薄发,商业化应用曙光乍现。AI发展阶段从推理者走向智能体,模型底座智能水平提升。目前,AI发展水平正从推理者向智能体Agent演进,AI产品逐步能够理解目标、具备外部记忆和推理能力,相关智能体产业链正经历从模型能力提升到应用商业化的系统性跃迁。AI大模型能力由预训练、后训练、测试时三条扩展曲线推进,其中,预训练奠定模型内部智能上限,后训练及测试时扩展分别释放模型在特定领域和推理方面的潜力,当前基础模型迭代放缓,逐步从训练扩展向测试时扩展转变,主次曲线迎来切换,从而对大规模集群依赖程度下降、推理算力需求攀升,更加聚焦AI产品的商业化能力和生态建设。中间工...

一、AI发展阶段:从推理者转向智能体,开始学会调用工具

AI等级:AI发展水平划为五大等级,当前正从推理者转向智能体

模型多维能力持续提升,AI从推理者转向智能体。根据OpenAI对AI发展的理解和定义,AI水平可 分为五大等级:一是聊天机器人(Chatbot),能够用自然语言进行对话;二是推理者,基于推理模 型,解决人类级别的智力问题;三是智能体(Agent),能够代表用户采取行动;四是创新者;五是 组织。过去,在ChatGPT等聊天机器人产品推出时,大模型通常采取一次性推理,用户与聊天机 器人的交互形式呈现为简单的一问一答。而在推理模型的不断发展之下,AI模型逐渐能够与自己对 话,实现内部思考,具备推理能力。当前,随着大模型在交互/认知/泛化/自主等多维度能力持续 提升,AI正从推理者转向智能体,逐步具备采取行动及处理任务的能力,智能体产品加速推进。

AI产品目前处于中间过渡形态,智能体有望革新交互效率。过去,传统聊天机器人只能执行明确指 令,用户需要逐次下达任务指令,AI模型根据一个指令进行一个动作;当前,中间形态的AI产品已 初步具备目标理解和推理能力,可以根据用户的模糊需求主动采取一部分行动,但仍然需要依赖用 户反馈进行下一步操作;未来,真正的AI智能体将能够根据最终目标自主规划任务步骤、调用多种 工具、识别错误并给出修正策略,具备完成任务的能力。

Agent等级:初阶能够使用工具,高阶可自主完成长时任务

智能体(Agent)=大模型(LLM)+记忆(Memory)+主动规划(Planning)+工具使用(Tool use)。  大模型:在基于LLM的智能体中,LLM充当智能体的大脑。 主动规划:可以将大型任务分解为子任务,并规划执行任务的流程,同时能够对任务执行的过程进 行思考和反思,从而决定是继续执行任务,或判断任务完结并终止运行。 记忆:短期记忆指在执行任务的过程中的上下文,会在子任务的执行过程产生和暂存,在任务完结 后被清空;长期记忆即可以长时间保留的信息,一般指外部知识库,可用向量数据库存储或检索。 工具使用:为智能体配备工具API,如计算器/搜索工具/代码执行器/数据库查询工具等,从而与物 理世界实现交互,解决实际问题。

自主决策能力是基础,解决长时任务是关键。根据智能体“推理+记忆+使用工具+规划”的四大 核心能力来看,截至目前,聊天机器人产品逐步具备推理能力,副驾驶和工具型助手可以建立外部 记忆,但仍然不具备使用工具和自主规划的能力,只能根据用户指令按步骤执行,不属于能够自主 决策的智能体。根据CBInsights研究,具备一定自主决策能力的智能体可分为两大等级。1)初级 Agent:AI模型可以通过编排组合,把重复性高、需要一定灵活性的任务从人替换成数字员工,实 现任务的自动化,在该阶段,Agent尚不具备完全开放的决策空间,自主决策范围主要局限于任务 流程和有限选项之中,决策行为将受到安全条件、访问权限等限制,是有限决策的智能体。2)高 级Agent:智能体不只是LLM calling的组合,而是能够更自主、更主动地规划,完成多步骤、长 时任务,可以在多个选项之间做出自主选择,不需要人工指示,实现高度自治。

Agent产业链:智能体基建厚积薄发,商业化应用曙光乍现

模型层:Agent本质是大模型能力的工程化载体,大模型智能水平仍是打造Agent的底层支撑,未 来依旧需要通过预训练、后训练和测试时计算进行扩展。 中间层:Agent产业链的中间层工具正加速构建,数据库、身份治理、通信协作等成为重要议题。 应用层:Agent应用形态随着以上底层大模型和中间原生基础设施的发展逐步从构想更加贴近现实。

基础设施加速发展推动新应用诞生,新应用积极引导基础设施下一步健全方向。智能体生态正在经 历波浪式发展进程,每一波创新应用的诞生,都会带动基础设施的迭代升级,底层技术的进步又会 进一步催生出更智能的应用,如OpenAI的GPT系列(从GPT-1到GPT-4)和o系列(从o1到o3) 模型、Anthropic的Claude模型(Sonnet-3迭代至3.7)、谷歌Gemini模型(从1.5Pro迭代至2.5 Pro)。智能体中间层则陆续出现LangChain、Tool Calling、MCP和A2A等工具;应用层相继出 现Cursor、Claude Desktop、OpenAI Operator等。新应用对基础设施提出更复杂的需求,基础 设施的进步又将反哺新的智能体应用,两者相互塑造、共同演进,加速AI的商业化落地。

二、Agent模型层:底座智能水平提升,推理能力成为核心

AI模型扩展法则:扩展法则迎来范式转变,主次扩展曲线逐步切换

扩展法则迎来范式转变,推理模型迭代节奏加速。从OpenAI旗下AI模型迭代进程来看: 2018年6月至2023年3月——预训练扩展阶段:OpenAI大模型预训练快速推进,在五年内从 GPT-1迭代至GPT-4模型,模型基础能力2023年3月之后,预训练扩展进程逐渐放缓,截至目前仍 未推出下一代预训练大模型GPT-5。 2023年下半年至2024年5月——后训练扩展阶段:基于微调技术开始打磨多模态、上下文等能力, 提升特定指标性能。 2024年9月至今——测试时扩展阶段:2024年9月OpenAI-o1模型预览版亮相,标志正式进入推 理模型时代;2025年4月17日,OpenAI推出完整版o3模型和o4-mini模型,截至目前,半年内已 迭代多次,测试时扩展正加速发展。

预训练扩展:三要素影响模型性能,高质量数据成为瓶颈

算力决定Transformer模型性能上限,模型参数与训练数据比例影响模型最佳性能。根据OpenAI 和Google相关研究,模型性能随着模型参数大小、训练数据集大小、计算量的增加而提高。对于 基于Transformer架构的大语言模型,模型性能三要素的关系为C≈6N*D,其中,N代表模型参数 规模,D代表预训练数据集大小;C代表预训练算力资源。大语言模型若要获得最佳性能,需同时 扩展三大要素。当其中一个因素受限时,模型的智能表现可以随着另外两个因素的增加而变好,但 边际效应会逐步递减。在给定预训练计算量的情况下,可以确定最佳的参数量和数据集之比,从而 确定模型的最佳能力。因此,在总计算量越多的情况下,模型能力的上限会越高。然而当前模型参 数量与数据量的扩展比例尚存争议,OpenAI在论文中指出模型参数规模比数据集大小更重要,两 者比例在0.73 : 0.27时计算效率最优;谷歌论文则认为模型参数和数据大小同等重要,随着预训练 计算资源的增加,模型参数量和训练数据量应该等比例增长。

后训练扩展:微调技术持续创新,打造模型特定性格

后训练扩展:在后训练期间不断自我改进,强化特定任务能力。后训练是在预训练之后,通过使用 人工反馈、强化学习等方法来进一步提升模型响应能力。在后训练阶段,模型通常会根据反馈机制 进行微调,相较于预训练阶段的全数据集训练,后训练的计算需求较低,不需要在庞大的训练样本 上迭代,而是基于模型已经学习到的知识进行微调,根据反馈在后训练期间不断进行自我改进,选 择性地对某些任务或场景实现强化。

微调技术持续创新:OpenAI于2024年12月发布会推出o1强化微调、偏好微调等技术。1)强化 微调(Reinforcement Fine-Tuning):通过结合强化学习和监督微调,针对特定领域打造专家模 型。在强化微调技术下,开发人员只需利用少量训练数据即可创建特定领域的专家模型,通过使用 几十到几千个高质量数据,模型能够通过强化学习自行探索和学习如何推理复杂任务。2)偏好微 调(Preference Fine-Tuning):通过使用直接偏好优化(DPO)来比较模型响应对,教会模型区 分偏好和非偏好输出,有助于在语气、风格和创造性等主观任务上尤为有效。

三、Agent中间层:中间工具厚积薄发,开发者生态积极构建

MCP:定义工具接口标准,打造新一代上下文通信协议

MCP:链接模型上下文信息与智能工具,建立上下文协议行业标准。2024年11月,Anthropic发 布Model Context Protocol(MCP),MCP是一种用于在AI系统中管理和交换模型上下文信息的 协议,旨在不同的AI模块、系统或模型之间共享环境、状态和上下文数据。自推出以来,MCP迅 速成为AI原生应用的重要基础设施,从结构框架层面来看,传统API与MCP之间存在显著差异:1) 传统API:基于经典的“客户端–服务端”架构,客户端发起请求,服务器处理并返回响应,传统 API充当二者之间的中介,开发者通常需要分别集成多个服务接口,单独处理认证、数据格式和通 信协议,带来较高的集成与维护成本,易出现响应机制不一致等问题。2)MCP:遵循“客户端服务器”架构,由MCP主机/MCP客户端/MCP服务器三个核心组件组成,专为AI系统设计,通过 标准化协议传递模型所需的上下文数据,使模型能够高效调用工具,提升AI模型的理解与执行能力。

A2A:开放智能体互联通信,优化新一代智能体网络协议

A2A:链接客户端与远程智能体通信,加速企业内部系统协同工作。2025年4月9日,谷歌推出全 新开放协议Agent2Agent(A2A),允许AI代理跨生态系统协作。A2A协议旨在让不同来源、不同技 术的AI智能体能够安全高效地交换信息,并协同执行跨企业平台或应用的复杂任务。A2A协议是对 Anthropic上下文协议MCP的补充,MCP为智能体提供链接工具与上下文的标准,A2A则侧重于 智能体之间的交互与协作,帮助智能体之间的高效沟通。工作原理方面,A2A用于促进客户端智能 体和远程智能体之间的通信,其中,用户存在于协议中,主要的作用是用于认证和授权;客户端智 能体负责制定和传达任务;远程智能体则负责执行任务或采取行动。

四、Agent应用层:初代产品加速创收,商业化应用曙光乍现

Agent类别:把握“通用”与“垂类”两大应用方向

同步打磨通用与专业能力,交叉渗透横向与垂直市场。1)跨行业AI代理(Horizontal AI Agent): 随着AI技术的发展、以及基于过去通用SaaS产品的历史经验,当前已有众多初创企业针对多种行 业或领域打造AI通用智能体,如Sierra (客服代理)、Cursor (软件开发智能体),可提供跨行业智能 服务。2)垂类AI代理(Vertical AI Agent):针对某个具体行业或垂直市场提供专业智能体,如AI 金融研究创企Boosted.ai、工业控制创企Composabl等,为特定客户类别制定个性化解决方案。 当前,以上两类智能体正加速发展,有望向各市场横纵渗透。

Agent赋能:把握“降低成本+提高效率+增强体验”三项赋能

从AI智能体赋能作用来看,主要集中于“降低成本+提高效率+增强体验”三大方向。其中,“降 低成本”可以帮助企业提升盈利能力,“提高效率”有望加强企业经营竞争力,“增强体验”则将 提升用户留存、扩大潜在市场规模,从而构建Agent的商业价值闭环。

赋能垂直业务:深入行业场景,扮演专业助手。垂类行业智能体主要用于处理专业复杂任务,垂类 行业涵盖电商、金融、医疗、工业等领域,扮演行业专家角色。在降低成本方面,Agent可以替代 部分专业岗位中的重复性或规则明确的劳动,例如保单文件初审、医学影像识别等,节省人力开销; 在提高效率方面,能够帮助流程节点的自动执行、加速专业信息流转;在增强体验方面,聚焦提升 客户互动体验,例如问诊智能引导、客户服务个性化推荐。相较于跨行业通用智能体,垂类行业智 能体的部署门槛相对更高,但赋能程度更深,是企业实现数智化转型的核心抓手。

Agent摩尔定律:处理任务长度每7月翻一倍,性能增长且成本下降

智能体处理任务长度正大幅提升,完成简单任务已具性价比。根据机构METR的研究《Measuring AI Ability to Complete Long Tasks》,目前超过80%由智能体成功完成的任务中,AI的推理成 本仅为人类专家的10%,其中,对于人类专家在30秒内完成的任务,使用AI的经济优势显著,目 前已可完成16个小时的软件任务,但在完成长时序现实世界任务方面,人类在整个工作循环中仍 然需要发挥较大作用和价值。在2025年4月17日OpenAI发布的o3和o4-mini模型中,o3和o4- mini在很多情况下比各自的前代o1与o3-mini更高效、更节省成本,在AME2025基准测试中,性 价比远超过前代模型。未来随着AI技术持续发展,AI在复杂任务面前有望同样具备性价比,从而推 动AI智能体进一步应用与渗透。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至