2024年AI行业OpenAI o1专题分析:逻辑能力显著提升,推理侧算力消耗大幅增加
- 来源:中信建投证券
- 发布时间:2024/09/20
- 浏览次数:744
- 举报
AI行业OpenAI o1专题分析:逻辑能力显著提升,推理侧算力消耗大幅增加.pdf
AI行业OpenAIo1专题分析:逻辑能力显著提升,推理侧算力消耗大幅增加。OpenAI发布新的具有深度思考能力的o1推理模型,模型在复杂问题上花更多时间进行思考而非直接回应,具有改善和调整策略的能力,在科学、代码和数学等复杂问题上表现出色。OpenAIo1融合思维树和强化学习,实现思维模式的深度探索。Openo1在模型推理侧同样满足scalinglaw,即模型推理时间越久模型处理复杂问题能力愈强,通过不断的思维树检索和反复自我博弈,o1呈现出类人的逻辑思维潜力。由于推理过程的反复博弈,新架构下推理侧算力消耗将大幅增加。OpenAIo1具备深度思考能力,在复杂问题上表现出色。从ChatGPT爆...
大语言模型发展历史
2017年,Google在Transformer模型中引入注意力机制,在自然语言的理解和生成也取得了巨大的成功,当前已经成为自 然语言处理领域最常见的基础模型。 2022年底,OpenAI发布的具备类人对话体验的ChatGPT爆火整个社交网络,2023年3月,GPT-4能力再度提升,基础能力和 专业知识全面升级,微软亚洲研究院称GPT-4爆发出通用人工智能火花。 2023年,随着大语言模型进入到相对成熟的阶段,大模型逐步进入到多模态的发展阶段,GPT-4V具备了多模态输入的能 力,结合DALL·E等模型,GPT-4 turbo同时具备了多模态的输出能力。
提示词工程:提升回答效果
在大语言模型中,提示工程是指设计和编写提示文本,以引导模型生成符合特定要求的语言输出。提示工程可以包括选 择合适的词汇、语法、上下文和主题等元素,以及使用不同的技巧和策略来影响模型的生成行为和结果。 提示工程的作用: 提升大语言模型处理复杂任务场景的能力,如问答和算术推理能力。 通过提示工程设计、研发强大的工程技术,实现和大语言模型或其他生态工具的高效接轨。
概念一:思维链和思维树
思维链(CoT)提示通过中间推理步骤实现了复杂的推理能力。通过将其与少样本提示相结合,以获得更好的结果,以便 在回答之前进行推理的更复杂的任务。对于需要探索或预判战略的复杂任务来说,传统或简单的提示技巧是不够的。 Yao提出了思维树(Tree of Thoughts,ToT)框架,该框架基于思维链提示进行了总结,引导语言模型探索把思维作为 中间步骤来解决通用问题。思维树中思维由连贯的语言序列表示,这个序列就是解决问题的中间步骤。使用这种方法, 大语言模型能够自己对严谨推理过程的中间思维进行评估。大语言模型将生成及评估思维的能力与搜索算法(如广度优 先搜索和深度优先搜索)相结合,在系统性探索思维的时候可以向前验证和回溯。
概念二:强化学习
强化学习是人工智能重要的研究领域。强化学习中,有两个可以进行交互的对象:智能体和环境,智能体和环境交互以 获得经验,智能体从中学习执行最佳行动,从而最大化其奖励。 智能体(Agent)可以感知外界环境的状态(State)和反馈的奖励(Reward),并进行学习和决策。智能体的决策功能是指根 据外界环境的状态来做出不同的动作(Action),而学习功能是指根据外界环境的奖励来调整策略。 环境(Environment)是智能体外部的所有事物,并受智能体动作的影响而改变其状态,并反馈给智能体相应的奖励。 强化学习的基本要素包括:状态、动作、策略、状态转移概率、即时奖励。
Q-learning
Q-learning是人工智能领域的基本概念,特别是强化学习领域。它是一种无模型强化学习算法,旨在学习特定状态下动 作的价值。Q学习的最终目标是找到一个最优策略,定义在每个状态下采取的最佳行动,从而随着时间的推移最大化累积 奖励。 Q-learning基于Q函数的概念,也称为状态-动作值函数。该函数需要两个输入:状态和操作,它返回对预期总奖励的估 计,从该状态开始,采取该行动,然后遵循最优策略。
思维树+Q-learning=OpenAI o1
选择:从根节点开始,算法根据特定策略浏览有希望的子节点,直到到达叶节点为止。 扩展:在叶子节点处,除非它代表了博弈的终结状态,否则会添加一个或多个可行的新子节点,以说明未来可能采取的 行动。 模拟或评估:从新添加的节点开始,算法进行随机模拟--通常称为 “滚动”--通过任意选择棋步直到博弈结束,从而评 估节点的潜力。 反向传播:模拟后,结果(胜、负或和)会传播回根节点,更新每个遍历节点的统计数据(如胜、负),为未来决策提 供依据。
过程监督反馈奖励函数
奖励模型可用于强化学习流程来区分期望输出和不期望输出,研究如何有效训练可靠的奖励模型非常重要。 存在两种不同的奖励模型训练方法:结果监督和过程监督。结果监督奖励模型仅使用模型思路链的最终结果进行训练, 而过程监督奖励模型则会接收思路链中每一步的反馈,它提供更精确的反馈,因为指定了发生的错误的确切位置,它更 容易被人类解释,并且它更直接地奖励遵循人类认可的思路链的模型。在逻辑推理领域,使用结果监督训练的模型经常 使用错误的推理来得出正确的最终答案。 OpenAI构建了一个用于过程监督的PRM800K数据集,其中包括了75000个问题中的800000个解决步奏的标签,同时通过主 动学习策略降低了标签搜集的难度,数据获取效率大约提升了2.6倍。
OpenAI o1
OpenAI o1是经过强化学习训练来执行复杂推理任务的新型语言模型。o1在回答之前会思考,可以在响应用户之前产生一 个很长的内部思维链。该模型在作出反应之前,需要像人类一样,花更多时间思考问题。通过强化学习训练,大模型学 会完善自己的思维过程,尝试不同的策略,并认识到自己的错误。 在OpenAI的测试中,该系列后续更新的模型在物理、化学和生物学这些具有挑战性的基准任务上的表现与博士生相似。 OpenAI还发现它在数学和编码方面表现出色。在国际数学奥林匹克(IMO)资格考试中,GPT-4o仅正确解答了13%的问题, 而o1模型正确解答了83%的问题。模型的编码能力也在比赛中得到了评估,在Codeforces比赛中排名89%。
为了突出相对于GPT-4o的推理性能改进,OpenAI在一系列不同的人类考试和机器学习基准测试中测试了o1模型。实验结 果表明,在绝大多数推理任务中,o1的表现明显优于GPT-4o。o1在广泛的基准测试上比GPT-4o有所改进,包括54/57 MMLU子类别。
推理侧Scaling law的发现
推理过程中的Scaling Law:o1的性能随着更多的强化学习(训练时间计算)和更多的思考时间(测试时间计算)投入不断提 高,推理过程中的Scaling Law发现意味着大模型的逻辑推理能力有望大幅提升。 基于o1进行了初始化并进一步训练了其编程技能后,OpenAI 训练得到了一个非常强大的编程模型(o1- ioi)。该模型在 2024年国际信息学奥林匹克竞赛(IOI)赛题上得到了213分,达到了排名前49%的水平。并且该模型参与竞赛的条件与2024 IOI的人类参赛者一样:需要在10个小时内解答6个高难度算法问题,并且每个问题仅能提交 50 次答案。 当每个问题允许10000次提交时,即使没有任何测试时间选择策略,该模型也获得了362.14分——高于金牌门槛。
OpenAI o1的多个版本
OpenAI o1具备多个不同版本。OpenAI还发布了mini版OpenAI o1-mini,成本比o1-preview低80%。o1-mini在预训练期 间针对STEM推理进行了优化。在使用与o1相同的强化学习(RL)训练后,o1-mini在许多有用的推理任务上实现了相媲美的 性能,同时成本效率显著提高。
报告节选:



-
标签
- AI
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 10 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
