tongjingqi/AI-Can-Learn-Scientific-Taste
We propose Reinforcement Learning from Community Feedback (RLCF), a training paradigm that uses large-scale community signals as supervision, and formulate scientific taste learning as a preference modeling and alignment problem.
解決する課題
「科学的なセンス」をAIに教えるという課題に取り組んでいます。これは、研究アイデアの潜在的な長期的影響を判断し、影響力を持つ可能性の高い新しいアイデアを提案する能力のことです。従来、このような専門的な洞察力は人間中心のスキルであり、定量化や自動化が困難でした。
仕組み
このプロジェクトでは、コミュニティからのフィードバックを用いた強化学習(RLCF)と呼ばれる訓練パラダイムを3つの段階で使用します:
- コミュニティの好みの構築: arXivの引用データを、同じ分野かつ同じ時期の論文をマッチングさせることで、ペアごとの好みの信号に変換します。
- Scientific Judge: これらのペアに対してGroup Relative Policy Optimization (GRPO) を用いて生成報酬モデルを訓練し、要旨を推論してどちらの論文がより高い潜在的影響力を持つかを予測します。
- Scientific Thinker: Scientific Judgeを報酬モデルとして使用し(比較ベースのGRPO経由)、与えられた論文のタイトルと要旨に基づいてフォローアップの研究アイデアを生成するようにポリシーモデルを最適化します。
対象者
自動化された科学的発見、専門領域向けの報酬モデリング、および学術研究へのRLHF/RLCFの適用に関心のあるAI研究者や科学者向けです。
ハイライト
- 高い精度: 30B Scientific Judgeバリアントは、ドメイン内精度で82.7%を達成し、GPT-5.4 Thinkingなどのベースラインを上回りました。
- 時間的汎化: このモデルは、将来の論文(例:2025年の論文)を判断する場合でも高いパフォーマンスを維持します。
- ドメイン間転移: 学習された判断力は、異なる科学分野(bioRxivを介した生物学を含む)や、ICLRの査読のような異なるコミュニティ指標にわたって汎化されます。
- SciJudgeBench: コンピュータサイエンス、数学、物理学にわたる720,000件以上の好みのペアを含む大規模なデータセットが含まれています。
関連
- Dispatch
- Dispatch
- Dispatch
- プロジェクト