OpenAI Operator智能体看点在哪?

OpenAI Operator智能体看点在哪?

最佳答案 匿名用户编辑于2025/04/25 11:42

OpenAI 率先发布Operator智能体,AI进入Agent时代。

OpenAI推出Operator智能体,模拟人类在电脑上的操作行为。2025年1月OpenAI上线了其首个AI Agent Operator,Operator能够模拟人类在电脑上的动作,如通过点击、滚动、输入等与电脑交互,并完成相关任务。Operator可以浏览网页、填写表格、订购商品、预定餐厅等,如输入餐厅预订要求后,Operator 会在分析需求后直接打开一个云端浏览器并执行搜索、查找、预定等相关操作。

Operator仍处于研究预览阶段。Agent是AI产业当前进步重要方向之一,应用准确率仍待持续提升。为了确保安全和迭代进度,目前Operator处于研究预览阶段,仅面向美国的 ChatGPT Pro(200 美元/月)用户,Plus 用户也不能体验,未来将进一步扩展用户。

Operator代表OpenAI拉开L3级Agent时代序幕。OpenAI内部将AI发展阶段定义为5个阶段:聊天机器人(具备对话能力)、推理者(具备人类问题解决能力)、Agent(具备执行任务能力)、创新者(具备创造发明能力)、组织者(具备组织工作能力)。Operator实现了AI与数字系统的交互,将自动执行桌面任务成为可能,而非调用固定API,Agent成为AI发展的新阶段。

CUA是Operator工作的主要Agent。Computer-Using Agent(CUA)是一个计算机使用代理,其通过强化学习实现了GPT-4o的视觉能力与高级推理相结合,可以像人类一样完成与图形用户界面 (GUI)的交互。CUA将高级 GUI 感知与结构化问题解决相结合,将任务分解为多步骤计划,且会在出现问题时自动纠错。

Operator测试数据优于前期SOTA,但与人类差距仍较大。OSWorld是一个用于评估多模态Agent的测试集,WebArena是用于评估Agent浏览器使用性能的测试集。测评结果显示,Operator在 OSWorld上实现了成功率38.1%;WebArena 上实现了58.1%的成功率;在 WebVoyager 上实现了 87% 的基于 Web 的任务的成功率,但是 WebVoyager大多数任务都相对简单。目前Operator超过了前期最优水平,但相比人类72%以上的成功率仍有较大差距。

Operator仍在持续进步中。目前Operator仍不完美,并且可能会犯错误。在内部测试数据,Operator在创建PPT和日历等复杂界面时会遇到挑战,在复杂的文本编辑方面表现较差 (成功率为 40%)。

OpenAI 的基础模型(包括支持 ChatGPT 的模型)是使用三个主要信息源开发的:(1)互联网上公开的信息,(2)与第三方合作访问的信息,以及(3)用户或人类培训师和研究人员提供或生成的信息。

第三方公司:DoorDash、Instacart、OpenTable、Priceline、StubHub、Thumbtack、Uber 等。

数据来源:仅采集互联网上免费公开的信息,不主动搜索付费墙后或暗网中的数据。同时,采用过滤机制剔除仇恨言论、成人内容、以个人信息为主的网站和垃圾邮件等不希望模型学习或输出的信息,这些数据用于训练模型。

个人信息使用:虽然训练数据中可能包含个人信息,但OpenAI 不会主动搜集此类信息,也不会利用它们建立个人档案、联系用户、进行广告投放或推广产品。所有数据仅用于提升模型在预测、推理和解决问题方面的能力。

美国关于OpenAI的数据访问的法律法规涉及多个层面,包括隐私保护、数据安全、版权、特定领域数据保护等。这些规定要求其保护用户隐私、确保数据安全、实施数据最小化及敏感数据保护,同时禁止未经授权的数据访问和电子通信拦截,并严格遵守版权保护措施,同时还需确保人工智能决策过程的透明、公平并定期接受审计。 Operator必须遵守的数据使用规则:数据最小化、敏感数据保护、用户权力。

OpenAI Operator 的一些典型应用场景包括:旅行预订、购物、餐厅预订、行政任务、市场营销、与各行业合作。此外,OpenAI正与 DoorDash、Instacart、OpenTable 和 Priceline 等公司合作,以改进 Operator 在现实世界中的应用。这意味着Operator 的功能将不断完善,并更好地满足不同行业用户的需求。

案例1:使用Operator预订餐厅。 实现步骤:1)直接帮你找餐厅、看评分、订位置;2)遇到时间冲突会智能推荐其他时段;3)基本实现全自动化操作,只有在遇到登录、支付等操作时,Operator会将操作权交还给用户。

案例2:使用Operator网购下单。 实现步骤:1)上传购物要求或者购物清单照片 ;2)自动采购多平台比价,确保性价比最高 ;3)按需求加入购物车。

案例3:使用Operator订机票酒店 。实现步骤:1)一键搜索比价;2)推荐最佳方案;3)提交客户个人信息,完成订票。 以上操作基本由AI完成,只有在遇到登录、支付等操作时,Operator会将操作权交还给用户。

以上的案例中,Operator表现出强大的性能,仿佛是一个24小时的个人助理。该助理的最强技能是可以支持多任务并行处理,能同时接受指令,完成订餐、网购、搜集资料、做研究看新闻、做总结等操作。

案例4:Operator的多任务操作,根据用户想吃的食物,将所有食材都加入购物车。 实现步骤:1)搜集食物图片,解析食材;2)根据食材列好购物清单;3)登录购物网站进行比价,最后列出性价比最高的方案。以上操作中,Operator的逻辑和人类一样,看到实物图片、点击对应的按钮。这和其他使用API或者基于编程接口的Agent不同,它是基于文本的思维链进行推理。

参考报告REPORT

人工智能行业专题报告:Operator和Manus打开AI Agent时代.pdf

人工智能行业专题报告:Operator和Manus打开AIAgent时代。AIAgent是人机交互新范式。AIAgent是能够感知环境、进行决策、执行动作的智能体,在2023已顺应大模型浪潮而生,随着多模态等技术逐步成熟,当前各厂商持续推出相关产品,Agent已开始逐步进入各个场景的工作流中,成为人机协同新范式。根据RootsAnalysis预测数据,预计24年全球AIAgent市场规模为52.9亿美金,预计2035年达到2168亿美金,对应24-35年CAGR为40.15%。OpenAI推出Operator,AI正式迈入Agent时代。Operator由CUA新模型提供支持,其通过强化学习实...

我来回答
分享至