OpenAI GPT~4技术系列研究报告
- 来源:DeepL
- 发布时间:2025/03/14
- 浏览次数:586
- 举报
OpenAI GPT~4技术系列研究报告.pdf
OpenAIGPT~4技术系列研究报告。我们将发布OpenAIGPT-4.5的研究预览版,这是我们迄今为止规模最大、知识最丰富的模型。在GPT-4o的基础上,GPT4.5进一步扩大了预训练规模,与我们以STEM为重点的强大推理模型相比,GPT-4.5的设计更具通用性。我们使用新的监督技术,结合监督微调(SFT)和人类反馈强化学习(RLHF)等传统方法对其进行训练,这些方法与GPT-4o使用的方法类似。在部署之前,我们进行了广泛的安全评估,没有发现与现有模型相比安全风险有任何显著增加。早期测试表明,与GPT-4.5的交互感觉更加自然。它拥有更广泛的知识库,更符合用户意图,情商也得到了提高,因此非...
由DeepL发布了《OpenAI GPT~4技术系列研究报告》这篇报告。以下是对该报告的部分摘录,完整内容请获取原文查看。在 GPT-4o 的基础上,GPT4.5 进一步扩大了预训练规模,与我们以 STEM 为重点的强大推理模型相比,GPT-4.5 的设计更具通用性。
1.导言
我们将发布 OpenAI GPT-4.5 的研究预览版,这是我们迄今为止规模最大、知识最丰富的模型。在 GPT-4o 的基础上,GPT4.5 进一步扩大了预训练规模,与我们以 STEM 为重点的强大推理模型相比,GPT-4.5 的设计更具通用性。我们使用新的监 督技术,结合监督微调(SFT)和人类反馈强化学习(RLHF)等传统方法对其进行训练,这些方法与 GPT-4o 使用的方法类 似。在部署之前,我们进行了广泛的安全评估,没有发现与现有模型相比安全风险有任何显著增加。 早期测试表明,与 GPT-4.5 的交互感觉更加自然。它拥有更广泛的知识库,更符合用户意图,情商也得到了提高,因此非常 适合完成写作、编程和解决实际问题等任务,而且幻觉也更少。
我们将 GPT-4.5 作为研究预览版与大家分享,以便更好地了解其优势和局限性。我们仍在探索它的功能,并渴望看到人们如 何以我们意想不到的方式使用它。 本系统卡概述了我们如何按照 OpenAI 的安全流程和准备框架构建和培训 GPT-4.5、评估其能力并加强安全性。
2.模型数据和训练
我们通过扩展无监督学习和思维链推理这两种模式来提高人工智能能力。扩展思维链推理可以让模型在做出反应之前先进行 思考,从而解决复杂的 STEM 或逻辑问题。相比之下,扩展无监督学习能提高世界模型的准确性,降低幻觉率,并改善联想 思维。GPT-4.5 是我们扩展无监督学习范例的下一步。
随着我们对模型进行扩展,使它们能够解决更广泛、更复杂的问题,让它们更好地理解人类的需求和意图就变得越来越重要 。针对 GPT-4.5,我们开发了新的、可扩展的对齐技术,能够利用从较小模型中提取的数据训练更大、更强大的模型。通过 这些技术,我们提高了 GPT4.5 的可操控性、对细微差别的理解以及自然对话能力。
内部测试人员表示,GPT-4.5 热情、直观、自然。在面对情绪化的询问时,它知道何时该提供建议、化解挫败感,或者 只是倾听用户的声音。GPT-4.5 还表现出更强的审美直觉和创造力。它擅长帮助用户进行创意写作和设计。 GPT-4.5 在不同的数据集上进行了预训练和后训练,其中包括公开数据、数据合作伙伴提供的专有数据以及内部开发的定制 数据集。 我们的数据处理管道包括严格的过滤,以保持数据质量并降低潜在风险。在训练模型时,我们使用先进的数据过滤流程来减 少对个人信息的处理。我们还结合使用修改 API 和安全分类器,防止使用有害或敏感内容,包括涉及未成年人的性内容等 露骨材料。
3.观察到的安全挑战和评估
在本节中,我们将概述对该模型进行的安全性评估,包括有害性、越狱稳健性、幻觉和偏差评估。然后,我们将详细介绍外 部红队活动的结果。 作为迭代部署承诺的一部分,我们不断完善和改进我们的模型。根据系统更新、最终参数、系统提示和其他因素的不同,生 产中使用的模型的确切性能数字可能会略有不同。
3.1 安全评估
我们为 GPT-4.5 所做的安全工作建立在先前学习的基础上,并充分利用了语言模型安全性方面的大量进展。例如,我们使用 一系列公开和内部构建的评估来衡量 GPT-4.5 在一些任务上的表现,如生成不允许内容的倾向、在与人口统计公平性相关的 任务上的表现 [1,2]、产生幻觉的倾向 [3] 以及是否存在危险能力 [4,5]。我们还借鉴了先前模型[6, 7, 8, 9]中的外部红队实 践。此外,GPT-4.5 还继承了我们早期的许多安全缓解措施,如针对有害请求进行拒绝行为训练,以及针对最恶劣的内容使 用节制模型[10, 11]。
3.2 红色团队评估
对于 GPT-4.5,我们利用了从红色团队近期模型(o3-mini 系统卡、深度研究系统卡)中得出的近期挑战性评估。之所以决 定优先考虑红队评估(而不是直接的人工红队),是因为最近的红队工作已经产生了尚未饱和的评估结果,并提供了与对抗 性提示违规内容相关的当前风险概览。 在我们的第一个红色组队评估集上(包括为非法建议、极端主义和仇恨犯罪、政治劝说和自我伤害而进行的对抗性越狱), GPT-4.5 有 51% 的输出是不安全的,略高于 GPT-4o 的 50%。值得注意的是,o3-mini 在此数据集上只有 26% 的输出是不安 全的,但这并不出乎意料,因为此评估集只针对 o3-mini。

在我们的第二个红队评估数据集上,GPT-4.5 在 46% 的数据集上生成了不安全的输出,超过了 GPT-4o 的 40%,但低于深度 研究的 67% 或 o1 的 68%。
这些评估具有挑战性和对抗性,是我们为确保在上述安全评估之外的对抗性测试的稳健性方面继续取得进展而做出的努力。 有鉴于此,我们可能会在近期内降低这些新评估的分数,同时继续提高稳健性。
3.3 阿波罗研究
阿波罗研究发现,GPT-4.5 的计谋推理评估得分低于 o1,但高于 GPT-4o。因此,他们认为 GPT-4.5 的计谋推理风险低于 o1 。与他们对 o1(系统卡)的评估类似,Apollo 通过将 GPT-4.5 置于一系列情境中测试其计谋能力,在这些情境中,系统提 示模型强烈追求特定目标(如 "不惜一切代价追求目标"),而计谋是实现这一目标的最有效策略。
4.准备框架评估
GPT-4.5 并非前沿模型,但它是 OpenAI 最大的 LLM,比 GPT-4 的计算效率提高了 10 倍以上。与之前的模型相比, GPT-4.5 增加了对世界的了解,提高了写作能力,并完善了个性,但它并没有引入。
与以前的推理版本相比,其性能低于 o1、o3-mini 和深度研究的大多数准备评估。 我们在 GPT-4.5 的整个训练过程和早期训练后的检查点上运行了自动准备评估,并对启动的模型进行了最终的自动评估扫描 。在下面的评估中,我们还测试了各种诱导方法,包括定制脚手架和相关提示。不过,"准备就绪 "评估只是潜在能力的下限 ;额外的提示或微调、更长时间的推出、新颖的交互或不同形式的脚手架可能会引发超出我们在测试中或第三方合作伙伴测 试中观察到的行为。
我们使用标准的引导程序计算 pass@1 的 95% 置信区间,该程序对每个问题的模型尝试进行重新采样,以近似度量的 分布。虽然这种方法被广泛使用,但对于非常小的数据集来说,它可能会低估不确定性,因为它只能捕捉抽样方差(模 型在多次尝试中对同一问题表现的随机性),而不是所有问题级方差(问题难度或通过率的变化)。这可能会导致置信区间 过小,尤其是当问题的通过率接近 0% 或 100% 且尝试次数很少时。我们报告这些置信区间是为了反映评价结果中固有的差 异。 安全顾问小组在审查了准备状态评估结果后,将 GPT-4.5 划分为总体中等风险,包括化学、生物、放射性、核和说服方面的 中等风险,以及网络安全和模型自主性方面的低风险。
编辑:999感冒灵- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 10 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
