2025年人工智能行业专题报告:Operator和Manus打开AI Agent时代

  • 来源:国信证券
  • 发布时间:2025/03/13
  • 浏览次数:857
  • 举报
相关深度报告REPORTS

人工智能行业专题报告:Operator和Manus打开AI Agent时代.pdf

人工智能行业专题报告:Operator和Manus打开AIAgent时代。AIAgent是人机交互新范式。AIAgent是能够感知环境、进行决策、执行动作的智能体,在2023已顺应大模型浪潮而生,随着多模态等技术逐步成熟,当前各厂商持续推出相关产品,Agent已开始逐步进入各个场景的工作流中,成为人机协同新范式。根据RootsAnalysis预测数据,预计24年全球AIAgent市场规模为52.9亿美金,预计2035年达到2168亿美金,对应24-35年CAGR为40.15%。OpenAI推出Operator,AI正式迈入Agent时代。Operator由CUA新模型提供支持,其通过强化学习实...

AI Agent将成为人机协同新范式

全球AI快速发展推动人机协同

全球AI快速扩张,中美领先应用落地。2022年,以ChatGPT为代表的大语言模型出现,掀起了全球AI浪潮。2023年开始,大模型的多模态能力显著增强,模型可用性进一步提升,推动全球AI行业快速扩张。在基础模型层面,据斯坦福大学数据,2023年共发布149个基础模型,为2022年的两倍,模型数量快速增加。据中国信通院数据,中美两国在AI领域中处于领先地位。截至2024年,全球AI企业数量超3万家,其中美国企业超1万家,占比达34%,中国占全球的15%,位居第二。全球AI大模型数量为1328个(包含同一企业、同一模型的不同参数版本),美国的AI大模型数量占比44%,中国大模型数量占比为36%。随着大模型行业发展逐步成熟,厂商之间开始出现明显的价格竞争与市场份额抢占。同时,DeepSeek等开源模型的性能快速提升,开源与闭源模型之间差距逐步缩小,进一步刺激了各模型应用成本下降。在上述因素推动下,用户与AI协作的条件逐渐成熟,AI应用有望在2025年于中、美两国快速发展。

Agent为Copilot后的人机协同新范式

AI Agent(人工智能体)是一种能够感知环境、进行决策和执行动作的智能实体。不同于传统的人工智能,AI Agent具备通过独立思考、调用工具去逐步完成给定目标的能力。AI Agent和传统大模型的区别在于,大模型与人类之间的交互是基于prompt实现的,用户prompt是否清晰明确会影响大模型回答的效果,而AI Agent的工作仅需给定一个目标,它就能够针对目标独立思考并做出行动。

基于大模型的Agent不仅可以让每个人都有增强能力的专属智能助理,还将改变人类与AI协同的模式。随着大模型的发展,人类与模型的协同方式从最初的聊天机器人转变为Copilot,并逐步向Agent探索。Agent的落地将给AI应用带来颠覆性变化,打开AI在垂直行业渗透的入口。随着自然语言处理、机器学习和生成式AI的进步,AI Agent的多功能性和部署量将急剧增长。

Agent是当前AI发展重点方向

AI Agent将成为新一代智能交互范式。AI Agent是能够感知环境、进行决策、执行动作的智能体,在2023已顺应大模型浪潮而生,随着多模态等技术逐步成熟,当前各厂商持续推出相关产品,Agent已开始逐步进入各个场景的工作流中。根据Gartner预测,到2028年至少15%的日常工作由AI Agent自主完成,33%的企业软件也将保护AI Agent。

AI Agent需要具备三大核心能力。根据OpenAI前应用研究主管的经典定义,一个合规的Agent需要三大核心能力:规划,将复杂任务分解成一些列子步骤;工具使用,选取最合适的工具并熟练应用;记忆,既有短期记忆存储即时信息,又有长期记忆沉淀持久知识。目前Agent底层技术在持续进步,因此相关代表产品也在应运而生。

OpenAI 率先发布Operator智能体,AI进入Agent时代

OpenAI发布Operator智能体

OpenAI推出Operator智能体,模拟人类在电脑上的操作行为。2025年1月OpenAI上线了其首个AI Agent Operator,Operator能够模拟人类在电脑上的动作,如通过点击、滚动、输入等与电脑交互,并完成相关任务。Operator可以浏览网页、填写表格、订购商品、预定餐厅等,如输入餐厅预订要求后,Operator 会在分析需求后直接打开一个云端浏览器并执行搜索、查找、预定等相关操作。

Operator仍处于研究预览阶段。Agent是AI产业当前进步重要方向之一,应用准确率仍待持续提升。为了确保安全和迭代进度,目前Operator处于研究预览阶段,仅面向美国的 ChatGPT Pro(200 美元/月)用户,Plus 用户也不能体验,未来将进一步扩展用户。

Operator代表AI进入Agent时代

Operator代表OpenAI拉开L3级Agent时代序幕。OpenAI内部将AI发展阶段定义为5个阶段:聊天机器人(具备对话能力)、推理者(具备人类问题解决能力)、Agent(具备执行任务能力)、创新者(具备创造发明能力)、组织者(具备组织工作能力)。Operator实现了AI与数字系统的交互,将自动执行桌面任务成为可能,而非调用固定API,Agent成为AI发展的新阶段。

CUA是Operator工作的主要Agent。Computer-Using Agent(CUA)是一个计算机使用代理,其通过强化学习实现了GPT-4o的视觉能力与高级推理相结合,可以像人类一样完成与图形用户界面 (GUI)的交互。CUA将高级 GUI 感知与结构化问题解决相结合,将任务分解为多步骤计划,且会在出现问题时自动纠错。

Operator测试已取得较大进步

Operator测试数据优于前期SOTA,但与人类差距仍较大。OSWorld是一个用于评估多模态Agent的测试集,WebArena是用于评估Agent浏览器使用性能的测试集。测评结果显示,Operator在 OSWorld上实现了成功率38.1%;WebArena 上实现了58.1%的成功率;在 WebVoyager 上实现了 87% 的基于 Web 的任务的成功率,但是 WebVoyager大多数任务都相对简单。目前Operator超过了前期最优水平,但相比人类72%以上的成功率仍有较大差距。

Operator仍在持续进步中。目前Operator仍不完美,并且可能会犯错误。在内部测试数据,Operator在创建PPT和日历等复杂界面时会遇到挑战,在复杂的文本编辑方面表现较差 (成功率为 40%)。

Operator遵守严格的数据使用规范和法律要求

Open AI数据使用的政策

OpenAI 的基础模型(包括支持 ChatGPT 的模型)是使用三个主要信息源开发的:(1)互联网上公开的信息,(2)与第三方合作访问的信息,以及(3)用户或人类培训师和研究人员提供或生成的信息。

第三方公司:DoorDash、Instacart、OpenTable、Priceline、StubHub、Thumbtack、Uber 等。

数据来源:仅采集互联网上免费公开的信息,不主动搜索付费墙后或暗网中的数据。同时,采用过滤机制剔除仇恨言论、成人内容、以个人信息为主的网站和垃圾邮件等不希望模型学习或输出的信息,这些数据用于训练模型。

个人信息使用:虽然训练数据中可能包含个人信息,但OpenAI 不会主动搜集此类信息,也不会利用它们建立个人档案、联系用户、进行广告投放或推广产品。所有数据仅用于提升模型在预测、推理和解决问题方面的能力。

Operator需要遵循数据访问的法律法规

美国关于OpenAI的数据访问的法律法规涉及多个层面,包括隐私保护、数据安全、版权、特定领域数据保护等。这些规定要求其保护用户隐私、确保数据安全、实施数据最小化及敏感数据保护,同时禁止未经授权的数据访问和电子通信拦截,并严格遵守版权保护措施,同时还需确保人工智能决策过程的透明、公平并定期接受审计。 Operator必须遵守的数据使用规则:数据最小化、敏感数据保护、用户权力。

Operator已展现较多场景的应用潜力

Operator应用场景广泛

OpenAI Operator 的一些典型应用场景包括:旅行预订、购物、餐厅预订、行政任务、市场营销、与各行业合作。此外,OpenAI正与 DoorDash、Instacart、OpenTable 和 Priceline 等公司合作,以改进 Operator 在现实世界中的应用。这意味着Operator 的功能将不断完善,并更好地满足不同行业用户的需求。

案例1:使用Operator预订餐厅。 实现步骤:1)直接帮你找餐厅、看评分、订位置;2)遇到时间冲突会智能推荐其他时段;3)基本实现全自动化操作,只有在遇到登录、支付等操作时,Operator会将操作权交还给用户。

案例2:使用Operator网购下单。 实现步骤:1)上传购物要求或者购物清单照片 ;2)自动采购多平台比价,确保性价比最高 ;3)按需求加入购物车。

案例3:使用Operator订机票酒店 。实现步骤:1)一键搜索比价;2)推荐最佳方案;3)提交客户个人信息,完成订票。 以上操作基本由AI完成,只有在遇到登录、支付等操作时,Operator会将操作权交还给用户。

以上的案例中,Operator表现出强大的性能,仿佛是一个24小时的个人助理。该助理的最强技能是可以支持多任务并行处理,能同时接受指令,完成订餐、网购、搜集资料、做研究看新闻、做总结等操作。

案例4:Operator的多任务操作,根据用户想吃的食物,将所有食材都加入购物车。 实现步骤:1)搜集食物图片,解析食材;2)根据食材列好购物清单;3)登录购物网站进行比价,最后列出性价比最高的方案。以上操作中,Operator的逻辑和人类一样,看到实物图片、点击对应的按钮。这和其他使用API或者基于编程接口的Agent不同,它是基于文本的思维链进行推理。

中国团队推出全球首个通用AI Agent Manus,性能表现优异

全球首款通用型AI Agent产品发布

3月6日,来自中国的创业公司Monica正式对外发布通用型AI Agent产品Manus。据团队介绍,“Manus是全球第一款通用Agent产品,可以解决各类复杂多变的任务。无论用户需要深入的市场调研、繁琐的文件批量处理、个性化的旅行规划还是专业的数据分析,Manus都能通过独立思考和系统规划,在自己的虚拟环境中灵活调用各类工具——编写并执行代码、智能浏览网页、操作各类网页应用——为用户直接交付完整的任务成果,而非仅仅提供建议或答案。”

Manus在GAIA基准测试中取得了SOTA(State-of-the-Art)的成绩,显示其性能超越Open AI的同层次大模型。GAIA为FAIR、Meta、HuggingFace等于2023年发布的通用人工智能助手基准测试,提出了系列需要推理、多模态处理、网页浏览和工具使用等基本能力的现实世界问题。对于人类来说,这些问题在概念上很简单,但对大多数先进的人工智能来说却具有挑战性:测试中人类受访者正确率达92%,而配备插件的GPT-4仅获得15%。GAIA可以根据解决问题所需的步骤数量和所需的不同工具数量分为三个难度级别:1)Level 1:问题通常不需要工具,或最多使用一个工具,不超过 5 步; 2)Level 2:问题通常涉及更多步骤,大约在 5 到 10 步之间,且需要结合不同的工具; 3)Level 3:问题是为接近完美的通用助手设计的,需要执行任意长度的操作序列,使用任意数量的工具,并访问一般世界。

提供多种用例,通用型显著提升

根据官方网站信息,在GAIA基准测试中,Manus在所有三个难度级别上都取得了新的最先进(SOTA)表现。除了基准测试,Manus还在Upwork(自由职业者服务平台)和Fiverr(同上)等平台上解决真实世界的问题,并在Kaggle竞赛(数据科学与机器学习竞赛平台)中有着出色表现。

在实际使用当中,目前Manus官网已提供多种处理现实世界任务的案例,包括个性化旅行规划(整合旅行信息、为用户创建定制旅行手册)、深度股票分析(全面股票洞察)、保险政策比较(创建保险政策比较表)、供应商采购(找到最适合用户需求的供应商)、财务报告分析(研究和数据分析捕捉市场对特定公司的情绪变化)、专业数据整理(创业公司列表整理)、教育内容创建(为中学教师创建视频演示材料)等。目前,该产品还在内测之中,用户可在登录后申请加入内测。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至