OpenAI GABRIEL:利用 GPT 擴展社會科學研究規模

OpenAI 的經濟研究團隊已發布 GABRIEL,這是一個開源的 Python 函式庫,旨在將非結構化的文字與影像轉換為量化測量。此工具套件讓經濟學家、社會科學家與資料科學家能夠在先前因手動標記耗時而無法達成的規模上分析質性資料。

質性資料的量化測量

GABRIEL 允許研究人員使用自然語言描述來定義測量。透過描述他們想要測量的內容,例如「how family-friendly is this job listing?」——工具會將此查詢一致地套用於成千上萬甚至百萬份文件,並為每份文件返回一個數值分數。

此自動化減少了資料標記的重複性工作,讓研究人員得以專注於高層次的專業:定義測量標準、驗證結果與得出結論。

主要功能與應用案例

GABRIEL 可應用於各種非結構化資料集,以提取結構化的證據。以下是一些應用案例:

  • Scientific Literature: 分析大量論文,以追蹤特定方法隨時間的演變。
  • Education: 衡量課程大綱中對特定科目或技能的關注程度。
  • Causality and History: 為歐洲各小鎮提取結構化的歷史細節。
  • Consumer Behavior: 發掘顧客評論中的模式,以辨識使用者最重視的項目。

OpenAI 表示,在其隨附的研究論文中,他們對 GPT 在多種應用案例中標記質性資料的能力進行了基準測試,發現其準確度相當高。

其他研究工具

除了核心測量之外,GABRIEL 還提供了一系列實用的資料管理與隱私工具:

  • Dataset Merging: 即使欄位不匹配,也能合併資料集。
  • Data Cleaning: 智慧去除重複記錄。
  • Passage Coding: 為特定文字段落進行編碼。
  • Theory Generation: 構思新的科學理論。
  • Privacy Preservation: 從文字中去識別個人資訊,以保護隱私。

可用性與取得方式

GABRIEL 以開源 Python 函式庫的形式在 GitHub 上提供,並附有 Google Colab 的教學 notebook。此工具套件設計給技術背景最少的使用者,也能讓學術社群輕鬆取得。

Sources