tongjingqi/AI-Can-Learn-Scientific-Taste

We propose Reinforcement Learning from Community Feedback (RLCF), a training paradigm that uses large-scale community signals as supervision, and formulate scientific taste learning as a preference modeling and alignment problem.

解决的问题

它解决了教导 AI “科学品味”的挑战——即判断研究想法的潜在长期影响并提出可能具有影响力的新想法的能力。传统上,这种专家级的预见力是一种以人为中心的技能,难以量化或自动化。

工作原理

该项目使用称为社区反馈强化学习 (RLCF) 的训练范式,分为三个阶段:

  1. 社区偏好构建:通过匹配相同领域和时期论文,将来自 arXiv 的引用数据转换为成对的偏好信号。
  2. Scientific Judge:在这些配对上使用 Group Relative Policy Optimization (GRPO) 训练生成式奖励模型,以对摘要进行推理并预测哪篇论文具有更高的潜在影响。
  3. Scientific Thinker:使用 Scientific Judge 作为奖励模型(通过基于比较的 GRPO)来优化策略模型,从而根据给定论文的标题和摘要生成后续研究想法。

适用对象

面向对自动化科学发现、特定领域的奖励建模以及 RLHF/RLCF 在学术研究中的应用感兴趣的 AI 研究人员和科学家。

亮点

  • 高准确率:30B Scientific Judge 变体实现了 82.7% 的领域内准确率,优于 GPT-5.4 Thinking 等基准模型。
  • 时间泛化:该模型在判断未来年份(例如 2025 年的论文)的论文时保持高性能。
  • 跨领域迁移:学习到的判断力可以泛化到不同的科学领域(包括通过 bioRxiv 实现的生物学)和不同的社区指标(如 ICLR 同行评审)。
  • SciJudgeBench:包含一个大规模数据集,涵盖计算机科学、数学和物理学领域超过 720,000 个偏好对。

相关