OpenAI 发布 IndQA 基准测试,用于印度语言和文化

OpenAI 已推出 IndQA,这是一个旨在评估 AI 模型如何就印度语言中的文化细微问题进行推理的基准测试。该工具旨在解决现有多语言基准测试的饱和问题以及缺乏能够捕捉印度人口特定文化、历史和社会背景的评估。

IndQA 框架与范围

IndQA 使用以 12 种语言原生编写的 2,278 个问题,评估跨 10 个文化领域的知识和推理能力。与选择题基准测试不同,IndQA 侧重于需要深入理解本地背景的推理密集型任务。

支持的语言和领域

该基准测试包括以下语言,特别包含 Hinglish 以考虑常见的代码切换模式:

  • 孟加拉语, 英语, 印地语, Hinglish, 卡纳达语, 马拉地语, 奥里亚语, 泰卢固语, 古吉拉特语, 马拉雅拉姆语, 旁遮普语, 和 泰米尔语。

涵盖的 10 个文化领域是:

  • 建筑与设计
  • 艺术与文化
  • 日常生活
  • 食物与美食
  • 历史
  • 法律与伦理
  • 文学与语言学
  • 媒体与娱乐
  • 宗教与灵性
  • 体育与休闲

数据结构

IndQA 数据集中的每个数据点由四个组成部分构成:

  1. 文化根植的提示: 以印度语言编写的问题。
  2. 英文翻译: 用于可审计性目的。
  3. 评分标准: 由专家编写的具体评分指南。
  4. 理想答案: 基于专家知识的预期响应。

技术方法与构建

IndQA 通过涉及 261 名领域专家的协作过程开发而成,包括记者、语言学家、学者和艺术家。构建过程遵循严格的流程,以确保基准测试对前沿模型保持挑战性。

专家作者与评审

母语水平的使用者和学科专家起草了与其特定地区和专长相关的困难、侧重推理的提示。这些响应在最终签 off 前经过了同行评审和迭代修正。

对抗过滤

为了防止基准测试饱和,OpenAI 应用了对抗过滤。问题经过 GPT-4o、OpenAI o3、GPT-4.5 和 GPT-5 的测试。仅保留这些模型中多数未能产生可接受答案的问题,以确保基准测试为未来进步提供空间。

基于评分标准的评分

IndQA 不采用简单匹配,而是使用加权评分标准系统。领域专家定义理想答案应包含或应避免的标准,并为每个标准分配分值。然后,基于模型的评分器根据满足的标准分值之和计算最终得分。

性能追踪与局限性

OpenAI 使用 IndQA 随时间追踪其模型的进步。虽然实验室指出 OpenAI 模型在印度语言方面已显著提升,但他们承认仍有很大的改进空间。

关键注意事项

  • 非语言排行榜: 由于问题在所有语言中不完全相同,IndQA 不能用于直接跨语言能力比较。其旨在衡量特定模型族或配置随时间的改进。
  • 对抗偏差: 由于问题选择过程专门过滤掉了 OpenAI 模型能够回答的问题,该基准对这些模型具有对抗性。这可能导致 OpenAI 模型在与非 OpenAI 模型的比较中处于不利地位。

战略意义

IndQA 为在其他代表性不足的语言和文化领域创建类似基准测试提供了蓝图。通过超越基于翻译的任务和选择题,IndQA 旨在为 AI 研究实验室提供一个 "北极星",以识别和解决文化推理和语言细微差别方面的具体失败。

SUMMARY: OpenAI 已推出 IndQA,这是一个由专家编写的、覆盖 12 种语言的 2,278 道题目的新基准测试,用于评估 AI 在印度语境下的推理能力和文化理解。

TITLE: OpenAI 发布 IndQA 基准测试,用于印度语言和文化

Sources