tongjingqi/AI-Can-Learn-Scientific-Taste
We propose Reinforcement Learning from Community Feedback (RLCF), a training paradigm that uses large-scale community signals as supervision, and formulate scientific taste learning as a preference modeling and alignment problem.
解決的問題
它解決了教導 AI「科學品味」的挑戰——即判斷研究想法的潛在長期影響並提出可能具有影響力的新想法的能力。傳統上,這種專家級的預見力是一種以人為中心的技能,難以量化或自動化。
工作原理
該專案使用稱為社群回饋強化學習 (RLCF) 的訓練範式,分為三個階段:
- 社群偏好構建:透過匹配相同領域和時期的論文,將來自 arXiv 的引用數據轉換為成對的偏好訊號。
- Scientific Judge:在這些配對上使用 Group Relative Policy Optimization (GRPO) 訓練生成式獎勵模型,以對摘要進行推理並預測哪篇論文具有更高的潛在影響。
- Scientific Thinker:使用 Scientific Judge 作為獎勵模型(透過基於比較的 GRPO)來優化策略模型,從而根據給定論文的標題和摘要生成後續研究想法。
適用對象
面向對自動化科學發現、特定領域的獎勵建模以及 RLHF/RLCF 在學術研究中的應用感興趣的 AI 研究人員和科學家。
亮點
- 高準確度:30B Scientific Judge 變體實現了 82.7% 的領域內準確度,優於 GPT-5.4 Thinking 等基準模型。
- 時間泛化:該模型在判斷未來年份(例如 2025 年的論文)的論文時保持高性能。
- 跨領域遷移:學習到的判斷力可以泛化到不同的科學領域(包括透過 bioRxiv 實現的生物學)和不同的社群指標(如 ICLR 同行評審)。
- SciJudgeBench:包含一個大規模數據集,涵蓋電腦科學、數學和物理學領域超過 720,000 個偏好對。
相關
- Dispatch
- Dispatch
- Dispatch
- 專案