OpenAI GPT-4 公告及功能概述

TL;DR

OpenAI 发布了 GPT‑4,这是一款多模态(文本‑和‑图像)的大型语言模型,在模拟律师资格考试中取得前 10% 的成绩,并在广泛的专业和学术基准上表现出人类水平的性能;该模型正通过 ChatGPT、受限 API 和开源评估框架逐步推出。

核心技术进展

可预测的规模化与稳定训练

  • 在过去两年里,OpenAI 重建了其深度学习堆栈,并与 Azure 共同设计了一台专用于其工作负载的超级计算机。
  • GPT‑3.5 作为试运行;在训练 GPT‑4 之前修复了漏洞并改进了理论基础。
  • GPT‑4 的训练过程异常稳定,使 OpenAI 能够准确预测最终损失,甚至可以从使用 1,000‑10,000 倍更少算力的运行中外推下游任务的通过率。
  • 可预测的规模化被视为安全措施,使组织能够预估未来模型的能力。

多模态输入能力

  • GPT‑4 接受交错的文本和图像输入,并生成文本输出(包括代码),用于视觉‑语言任务。
  • 在标准学术视觉基准上的表现强劲,尽管图像模态仍处于研究预览阶段,尚未公开提供。
  • 测试时技术如 few‑shot 提示和 chain‑of‑thought 推理,最初为仅文本模型开发,也能提升图像输入任务的效果。

对齐与可控性改进

  • 通过六个月的迭代对齐,结合对抗测试和 ChatGPT 经验,达成了 OpenAI 模型迄今为止最佳的事实性、可控性和安全防护遵循度。
  • 系统消息让开发者(以及不久的 ChatGPT 用户)能够指定语气、冗长程度和风格,在政策范围内提供可定制的行为。
  • OpenAI 承认系统消息目前是最容易的越狱向量,并鼓励用户反馈以强化这些控制。

基准性能

人类水平的考试结果

  • GPT‑4 在模拟律师资格考试中得分位列前 10%,而 GPT‑3.5 则位于后 10%。
  • 未进行任务特定的训练;模型在公开可得的考试和近期练习题上进行评估。

标准语言模型基准

  • GPT‑4 超越现有的大型语言模型和大多数最先进(SOTA)系统,在传统机器学习基准上表现更佳。
  • 在 MMLU 套件(57 门学科、14,000 道多项选择题)中,GPT‑4 在 26 种测试语言中的 24 种上超越 GPT‑3.5 及其他 LLM(如 Chinchilla、PaLM),包括拉脱维亚语、威尔士语和斯瓦希里语等低资源语言。

事实性与安全性指标

  • 内部对抗性事实性评估显示,相比 GPT‑3.5,幻觉率降低了 40%。
  • 经过 RLHF 后训练,GPT‑4 在 TruthfulQA 上相较 GPT‑3.5 有显著优势,能够抵制常见误解,虽仍偶尔遗漏细微细节。

局限性

  • GPT‑4 仍会产生幻觉并出现推理错误;在许多真实场景下的可靠性低于人类。
  • 知识截止于 2021 年 9 月;模型不会从新经验中学习。
  • 在 RLHF 之后,置信度分数的校准会下降,尽管基础模型本身校准良好。
  • 输出中仍存在偏见,且可通过越狱技术诱导模型产生不允许的行为。

安全风险与缓解措施

  • 风险与之前的模型相似(有害建议、错误代码、错误信息),但因能力提升而被放大。
  • 超过 50 位来自 AI 对齐、网络安全、生物风险和国际安全领域的外部专家参与了对抗性测试,帮助收集数据以改进对危险请求的拒绝行为。
  • 在 RLHF 期间加入额外的安全奖励信号,训练 GPT‑4 零样本分类器惩罚不允许的内容;这使得对禁止请求的响应比 GPT‑3.5 减少了 82%,对敏感话题的合规性提升了 29%。
  • OpenAI 继续依赖部署时的安全措施(监控、滥用检测)以及模型层面的干预。

部署细节

ChatGPT Plus

  • GPT‑4 已向 chatgpt.com 上的 ChatGPT Plus 订阅者开放,使用上限会根据需求和系统性能进行调整。

API 访问

  • 仅文本的 GPT‑4 通过标准的 ChatCompletions API 提供;开发者需加入候补名单。
  • 定价:8,192‑token 上下文模型每 1k 提示 token $0.03、每 1k 完成 token $0.06;32,768‑token 上下文变体(gpt‑4‑32k)为 $0.06/$0.12。
  • 速率限制:默认 40k token/分钟,200 请求/分钟。
  • 研究人员可通过 Researcher Access Program 申请补贴访问。

OpenAI Evals 框架

  • OpenAI 发布了开源 OpenAI Evals 框架,用于创建和运行自动化基准测试。
  • Evals 在内部用于发现不足并防止回归;外部用户(如 Stripe)已利用它评估基于 GPT 的工具。
  • 仓库包含常见评估模式的模板,包括模型自行评分的 model‑graded evals。
  • 鼓励社区贡献,以扩展框架捕获的失败模式和困难任务集合。

含义与展望

  • GPT‑4 的多模态能力和改进的对齐标志着向更有用、更安全的 AI 助手迈出的重要一步。
  • 可预测的规模化和早期安全导向的训练旨在为未来模型能力提供更好的前瞻性,OpenAI 认为这对社会安全至关重要。
  • 持续存在的局限——幻觉、偏见、知识过时——凸显了在人类监督下使用模型的必要性,尤其是在高风险应用中。
  • 开源的 Evals 生态系统和协作式安全测试表明,AI 评估与风险缓解正向更广泛的社区参与转变。

本文忠实反映了 OpenAI 于 2023 年 3 月发布的 GPT‑4 公告,未添加或更改任何事实内容。

Sources