Google DeepMind 測量通往 AGI 的進展:認知框架
Google DeepMind 已推出認知框架與分類法,為衡量通往人工通用智慧(AGI)的進展提供科學基礎。此框架旨在透過心理學、神經科學與認知科學的研究,解決 AI 系統中缺乏評估通用智慧的實證工具的問題。
通用智慧的認知分類法
此框架辨識出 10 項對通用智慧至關重要的認知能力。這些能力分類如下:
- 感知:處理並從環境中提取感官資訊。
- 生成:產生包括行動、語音與文字在內的輸出。
- 注意:將認知資源聚焦於相關資訊的能力。
- 學習:透過指導與經驗獲取新知識。
- 記憶:隨時間檢索與儲存資訊。
- 推理:使用邏輯推論得出有效結論。
- 後設認知:監控與了解自身的認知過程。
- 執行功能:認知彈性、抑制與規劃。
- 問題解決:為特定領域問題尋找有效解決方案。
- 社會認知:解讀社會資訊並在社交情境中作出適當回應。
三階段評估協議
為了將 AI 表現與人類能力進行基準比較,Google DeepMind 提出三階段評估協議:
- 階段 1:使用廣泛的認知任務套件評估 AI 系統在每項能力上的表現,並利用保留測試集防止資料污染。
- 階段 2:以具人口統計代表性的成年樣本收集相同任務的人類基線。
- 階段 3:將 AI 系統的表現相對於每項特定能力的人類表現分布進行映射。
透過 Kaggle 黑客松的實作
Google DeepMind 正與 Kaggle 合作,透過「Measuring progress toward AGI: Cognitive abilities」黑客松將此理論框架付諸實踐。此競賽邀請研究社群為目前評估差距最大的五項認知能力設計評估:學習、後設認知、注意、執行功能與社會認知。
參賽者使用 Kaggle 的 Community Benchmarks 平台,將評估測試於前沿模型上。黑客松提供總額 200,000 美元的獎金池,每個五個賽道的前兩名提交各獲得 10,000 美元獎勵,四個最佳總體提交則可獲得 25,000 美元的特別獎。提交時間為 3 月 17 日至 4 月 16 日,結果將於 6 月 1 日公布。