OpenAI GPT-4 发布

OpenAI 发布了 GPT-4,这是一个大型语言模型,与之前的 GPT-3.5 相比,它展现出了显著提高的推理能力、更广泛的通用知识以及在解决复杂问题时更高的准确性。此次发布标志着 OpenAI 扩展策略的延续,利用增加的数据和计算量来创建更复杂的深度学习模型。

高级推理与问题解决

GPT-4 在复杂推理任务和创意协作方面表现出卓越的性能。它可以生成、编辑和迭代技术及创意写作任务,例如创作歌曲或编写剧本,并能适应用户的特定写作风格。

在实际推理测试中,GPT-4 在调度和逻辑问题方面优于 GPT-3.5。例如,在一个需要协调三个人时间以进行 30 分钟会议的场景中,GPT-4 正确识别了共同的可用时间窗口(12 pm - 12:30 pm),而 GPT-3.5 则未能识别出正确的窗口。

标准化测试表现

GPT-4 在专业和学术考试的测试者百分位数得分中表现出显著提高:

  • Uniform Bar Exam: GPT-4 得分处于第 90 百分位数,而 GPT-3.5 为第 10 百分位数。
  • Biology Olympiad: GPT-4 (带有视觉功能) 得分处于第 99 百分位数,而 GPT-3.5 为第 31 百分位数。

安全与对齐改进

OpenAI 花费了六个月的时间专注于使 GPT-4 更安全且更符合人类意图(aligned)。根据内部评估,GPT-4 响应违规内容请求的可能性比 GPT-3.5 低 82%,产生事实性回答的可能性比 GPT-3.5 高 40%。

这些改进是通过几种关键方法实现的:

  • Training with Human Feedback: 该模型结合了更多的人类反馈,包括 ChatGPT 用户提交的数据,以及来自 50 多位 AI 安全与安全专家早期反馈。
  • Real-World Application: 从之前模型的实际部署中汲取的教训被整合到了安全研究和监控系统中。
  • GPT-4-Assisted Research: 该模型自身的推理和指令遵循能力被用于创建用于微调的训练数据,并用于迭代训练和监控的分类器。

基础设施与局限性

GPT-4 是在 Microsoft Azure AI 超级计算机上训练的,这些超级计算机也促进了其向全球用户的交付。

尽管有这些进步,OpenAI 承认 GPT-4 存在已知的局限性,包括社会偏见、幻觉以及容易受到对抗性提示词(adversarial prompts)的影响。公司旨在通过透明度、用户教育以及扩大公众输入以塑造未来模型来解决这些问题。

可用性

GPT-4 可通过 ChatGPT Plus 向用户提供,并作为 API 向开发者提供,以便构建应用程序和服务。

Sources