OpenAI GPT~4技术系列研究报告

  • 来源:DeepL
  • 发布时间:2025/03/14
  • 浏览次数:586
  • 举报
相关深度报告REPORTS

OpenAI GPT~4技术系列研究报告.pdf

OpenAIGPT~4技术系列研究报告。我们将发布OpenAIGPT-4.5的研究预览版,这是我们迄今为止规模最大、知识最丰富的模型。在GPT-4o的基础上,GPT4.5进一步扩大了预训练规模,与我们以STEM为重点的强大推理模型相比,GPT-4.5的设计更具通用性。我们使用新的监督技术,结合监督微调(SFT)和人类反馈强化学习(RLHF)等传统方法对其进行训练,这些方法与GPT-4o使用的方法类似。在部署之前,我们进行了广泛的安全评估,没有发现与现有模型相比安全风险有任何显著增加。早期测试表明,与GPT-4.5的交互感觉更加自然。它拥有更广泛的知识库,更符合用户意图,情商也得到了提高,因此非...

由DeepL发布了《OpenAI GPT~4技术系列研究报告》这篇报告。以下是对该报告的部分摘录,完整内容请获取原文查看。在 GPT-4o 的基础上,GPT4.5 进一步扩大了预训练规模,与我们以 STEM 为重点的强大推理模型相比,GPT-4.5 的设计更具通用性。

1.导言

我们将发布 OpenAI GPT-4.5 的研究预览版,这是我们迄今为止规模最大、知识最丰富的模型。在 GPT-4o 的基础上,GPT4.5 进一步扩大了预训练规模,与我们以 STEM 为重点的强大推理模型相比,GPT-4.5 的设计更具通用性。我们使用新的监 督技术,结合监督微调(SFT)和人类反馈强化学习(RLHF)等传统方法对其进行训练,这些方法与 GPT-4o 使用的方法类 似。在部署之前,我们进行了广泛的安全评估,没有发现与现有模型相比安全风险有任何显著增加。 早期测试表明,与 GPT-4.5 的交互感觉更加自然。它拥有更广泛的知识库,更符合用户意图,情商也得到了提高,因此非常 适合完成写作、编程和解决实际问题等任务,而且幻觉也更少。

我们将 GPT-4.5 作为研究预览版与大家分享,以便更好地了解其优势和局限性。我们仍在探索它的功能,并渴望看到人们如 何以我们意想不到的方式使用它。 本系统卡概述了我们如何按照 OpenAI 的安全流程和准备框架构建和培训 GPT-4.5、评估其能力并加强安全性。

2.模型数据和训练

我们通过扩展无监督学习和思维链推理这两种模式来提高人工智能能力。扩展思维链推理可以让模型在做出反应之前先进行 思考,从而解决复杂的 STEM 或逻辑问题。相比之下,扩展无监督学习能提高世界模型的准确性,降低幻觉率,并改善联想 思维。GPT-4.5 是我们扩展无监督学习范例的下一步。

随着我们对模型进行扩展,使它们能够解决更广泛、更复杂的问题,让它们更好地理解人类的需求和意图就变得越来越重要 。针对 GPT-4.5,我们开发了新的、可扩展的对齐技术,能够利用从较小模型中提取的数据训练更大、更强大的模型。通过 这些技术,我们提高了 GPT4.5 的可操控性、对细微差别的理解以及自然对话能力。

内部测试人员表示,GPT-4.5 热情、直观、自然。在面对情绪化的询问时,它知道何时该提供建议、化解挫败感,或者 只是倾听用户的声音。GPT-4.5 还表现出更强的审美直觉和创造力。它擅长帮助用户进行创意写作和设计。 GPT-4.5 在不同的数据集上进行了预训练和后训练,其中包括公开数据、数据合作伙伴提供的专有数据以及内部开发的定制 数据集。 我们的数据处理管道包括严格的过滤,以保持数据质量并降低潜在风险。在训练模型时,我们使用先进的数据过滤流程来减 少对个人信息的处理。我们还结合使用修改 API 和安全分类器,防止使用有害或敏感内容,包括涉及未成年人的性内容等 露骨材料。

3.观察到的安全挑战和评估

在本节中,我们将概述对该模型进行的安全性评估,包括有害性、越狱稳健性、幻觉和偏差评估。然后,我们将详细介绍外 部红队活动的结果。 作为迭代部署承诺的一部分,我们不断完善和改进我们的模型。根据系统更新、最终参数、系统提示和其他因素的不同,生 产中使用的模型的确切性能数字可能会略有不同。

3.1 安全评估

我们为 GPT-4.5 所做的安全工作建立在先前学习的基础上,并充分利用了语言模型安全性方面的大量进展。例如,我们使用 一系列公开和内部构建的评估来衡量 GPT-4.5 在一些任务上的表现,如生成不允许内容的倾向、在与人口统计公平性相关的 任务上的表现 [1,2]、产生幻觉的倾向 [3] 以及是否存在危险能力 [4,5]。我们还借鉴了先前模型[6, 7, 8, 9]中的外部红队实 践。此外,GPT-4.5 还继承了我们早期的许多安全缓解措施,如针对有害请求进行拒绝行为训练,以及针对最恶劣的内容使 用节制模型[10, 11]。

3.2 红色团队评估

对于 GPT-4.5,我们利用了从红色团队近期模型(o3-mini 系统卡、深度研究系统卡)中得出的近期挑战性评估。之所以决 定优先考虑红队评估(而不是直接的人工红队),是因为最近的红队工作已经产生了尚未饱和的评估结果,并提供了与对抗 性提示违规内容相关的当前风险概览。 在我们的第一个红色组队评估集上(包括为非法建议、极端主义和仇恨犯罪、政治劝说和自我伤害而进行的对抗性越狱), GPT-4.5 有 51% 的输出是不安全的,略高于 GPT-4o 的 50%。值得注意的是,o3-mini 在此数据集上只有 26% 的输出是不安 全的,但这并不出乎意料,因为此评估集只针对 o3-mini。

在我们的第二个红队评估数据集上,GPT-4.5 在 46% 的数据集上生成了不安全的输出,超过了 GPT-4o 的 40%,但低于深度 研究的 67% 或 o1 的 68%。

这些评估具有挑战性和对抗性,是我们为确保在上述安全评估之外的对抗性测试的稳健性方面继续取得进展而做出的努力。 有鉴于此,我们可能会在近期内降低这些新评估的分数,同时继续提高稳健性。

3.3 阿波罗研究

阿波罗研究发现,GPT-4.5 的计谋推理评估得分低于 o1,但高于 GPT-4o。因此,他们认为 GPT-4.5 的计谋推理风险低于 o1 。与他们对 o1(系统卡)的评估类似,Apollo 通过将 GPT-4.5 置于一系列情境中测试其计谋能力,在这些情境中,系统提 示模型强烈追求特定目标(如 "不惜一切代价追求目标"),而计谋是实现这一目标的最有效策略。

4.准备框架评估

GPT-4.5 并非前沿模型,但它是 OpenAI 最大的 LLM,比 GPT-4 的计算效率提高了 10 倍以上。与之前的模型相比, GPT-4.5 增加了对世界的了解,提高了写作能力,并完善了个性,但它并没有引入。

与以前的推理版本相比,其性能低于 o1、o3-mini 和深度研究的大多数准备评估。 我们在 GPT-4.5 的整个训练过程和早期训练后的检查点上运行了自动准备评估,并对启动的模型进行了最终的自动评估扫描 。在下面的评估中,我们还测试了各种诱导方法,包括定制脚手架和相关提示。不过,"准备就绪 "评估只是潜在能力的下限 ;额外的提示或微调、更长时间的推出、新颖的交互或不同形式的脚手架可能会引发超出我们在测试中或第三方合作伙伴测 试中观察到的行为。

我们使用标准的引导程序计算 pass@1 的 95% 置信区间,该程序对每个问题的模型尝试进行重新采样,以近似度量的 分布。虽然这种方法被广泛使用,但对于非常小的数据集来说,它可能会低估不确定性,因为它只能捕捉抽样方差(模 型在多次尝试中对同一问题表现的随机性),而不是所有问题级方差(问题难度或通过率的变化)。这可能会导致置信区间 过小,尤其是当问题的通过率接近 0% 或 100% 且尝试次数很少时。我们报告这些置信区间是为了反映评价结果中固有的差 异。 安全顾问小组在审查了准备状态评估结果后,将 GPT-4.5 划分为总体中等风险,包括化学、生物、放射性、核和说服方面的 中等风险,以及网络安全和模型自主性方面的低风险。

编辑:999感冒灵
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至