OpenAI 推出 IndQA 基準測試以評估印度語言與文化

OpenAI 已推出 IndQA,這是一個基準測試,旨在評估 AI 模型如何針對帶有文化細膩的印度語言問題進行推理。此工具解決了現有多語言基準測試的飽和問題,以及缺乏能夠捕捉印度人口特定文化、歷史與社會背景的評估。

IndQA 框架與範圍

IndQA 透過 12 種語言的本土編寫的 2,278 個問題,評估跨 10 個文化領域的知識與推理。與選擇題基準測試不同,IndQA 專注於需要深入理解當地情境的高推理負荷任務。

支援的語言與領域

該基準測試包含以下語言,特別包含 Hinglish 以考慮常見的代碼切換模式:

  • 孟加拉語、英語、印地語、Hinglish、卡納塔克語、馬拉地語、奧迪亞語、泰盧古語、古吉拉特語、馬拉雅拉姆語、旁遮普語、泰米爾語。

涵蓋的 10 個文化領域為:

  • 建築與設計
  • 藝術與文化
  • 日常生活
  • 食物與料理
  • 歷史
  • 法律與倫理
  • 文學與語言學
  • 媒體與娛樂
  • 宗教與靈性
  • 體育與休閒

資料結構

IndQA 集合中的每個資料點由四個組成部分構成:

  1. 具文化基礎的提示: 用印度語言撰寫的問題。
  2. 英文翻譯: 為審計目的提供。
  3. 評分規準: 專家撰寫的具體評分指南。
  4. 理想答案: 基於專家知識的預期回應。

技術方法與構建

IndQA 是透過涉及 261 名領域專家的協作過程開發而成,這些專家包括記者、語言學家、學者和藝術家。構建過程遵循嚴格的管道,以確保基準測試對前沿模型保持挑戰性。

專家撰寫與審查

母語級別的使用者和領域專家撰寫了與他們特定地區和專長相關的困難、以推理為導向的提示。這些回應經過同儕審查和迭代修正後,才最終簽 off。

對抗過濾

為防止基準測試變得飽和,OpenAI 應用了對抗過濾。問題會針對 GPT-4o、OpenAI o3、GPT-4.5 和 GPT-5 進行測試。只有當這些模型的多數未能產出可接受答案時,才會保留該問題,確保基準測試為未來進步提供空間。

基於規準的評分

IndQA 不採用簡單匹配,而是使用加權評分規準系統。領域專家定義理想答案應該包含或避免的標準,並為每個標準分配分數。然後,模型評分器根據滿足標準的分數總和計算最終分數。

效能追蹤與限制

OpenAI 使用 IndQA 追蹤其模型隨時間的進展。儘管實驗室指出 OpenAI 模型在印度語言方面已顯著提升,但他們承認仍有大幅改進的空間。

重要注意事項

  • 非語言排行榜: 由於問題在各語言間不完全相同,IndQA 無法用於直接跨語言比較能力。其旨在測量特定模型家族或配置隨時間的改進。
  • 對抗偏見: 由於問題選擇過程專門篩掉 OpenAI 模型能回答的問題,基準測試對這些模型具有對抗性。這可能使 OpenAI 模型在與非 OpenAI 模型比較時處於不利地位。

戰略意涵

IndQA 為在其他代表性不足的語言與文化領域創建類似基準測試提供了藍圖。透過超越翻譯任務和選擇題,IndQA 旨在為 AI 研究實驗室提供一個「北極星」,以識別並解決文化推理與語言細微差具體失誤。

Sources