OpenAI GABRIEL:使用 GPT 扩大社会科学研究规模
OpenAI 经济研究团队发布了 GABRIEL,这是一款开源的 Python 库,旨在将非结构化文本和图像转化为定量测量。该工具包使经济学家、社会科学家和数据科学家能够在此前因手动标注耗时而难以实现的规模上分析定性数据。
定性数据的定量测量
GABRIEL 允许研究人员使用自然语言描述来定义测量指标。通过描述他们想要衡量的内容——例如,“这则招聘信息的家庭友好程度如何?”——该工具会在成千上万甚至数百万份文档中一致地应用此查询,并为每份文档返回一个数值分数。
这种自动化减少了重复的数据标注工作,使研究人员能够专注于高层次的专业工作:定义测量标准、验证结果以及得出结论。
关键功能与使用场景
GABRIEL 可应用于各种非结构化数据集,以提取结构化证据。使用场景示例包括:
- 科学文献: 分析大量论文,以追踪特定方法随时间的演变。
- 教育: 衡量课程大纲中对特定学科或技能的关注程度。
- 因果与历史: 为欧洲各小镇提取结构化的历史细节。
- 消费者行为: 在客户评论中发现模式,以识别用户最看重的内容。
OpenAI 表示,在其配套的研究论文中,他们对 GPT 在多个使用场景下标注定性数据的能力进行了基准测试,发现其准确率非常高。
其他研究工具
除了核心测量功能外,GABRIEL 还提供了一套实用的数据管理和隐私工具:
- 数据集合并: 即使列不匹配,也能合并数据集。
- 数据清洗: 智能去重记录。
- 段落编码: 对特定文本段落进行编码。
- 理论生成: 构思新的科学理论。
- 隐私保护: 对文本中的个人信息进行去标识,以保护隐私。
可用性与获取方式
GABRIEL 作为开源 Python 库在 GitHub 上提供,并附带了 Google Colab 中的教程笔记本。该工具包面向技术背景有限的用户设计,旨在让学术界易于使用。
Sources
- OriginalScaling social science research