tongjingqi/AI-Can-Learn-Scientific-Taste
We propose Reinforcement Learning from Community Feedback (RLCF), a training paradigm that uses large-scale community signals as supervision, and formulate scientific taste learning as a preference modeling and alignment problem.
해결하는 문제
AI에게 "과학적 안목"을 가르치는 과제를 해결합니다. 이는 연구 아이디어의 잠재적인 장기적 영향력을 판단하고 영향력을 미칠 가능성이 높은 새로운 아이디어를 제안하는 능력을 의미합니다. 전통적으로 이러한 전문적인 통찰력은 인간 중심의 기술로, 정량화하거나 자동화하기 어려웠습니다.
작동 방식
이 프로젝트는 커뮤니티 피드백 기반 강화학습(RLCF)이라고 불리는 훈련 패러다임을 3단계로 사용합니다:
- 커뮤니티 선호도 구축: arXiv의 인용 데이터를 동일한 분야 및 기간의 논문을 매칭하여 쌍별 선호도 신호로 변환합니다.
- Scientific Judge: 이러한 쌍에 대해 Group Relative Policy Optimization (GRPO)를 사용하여 생성형 보상 모델을 훈련하여 초록을 추론하고 어떤 논문이 더 높은 잠재적 영향력을 가질지 예측합니다.
- Scientific Thinker: Scientific Judge를 보상 모델로 사용하여(비교 기반 GRPO를 통해) 주어진 논문의 제목과 초록을 바탕으로 후속 연구 아이디어를 생성하도록 정책 모델을 최적화합니다.
대상
자동화된 과학적 발견, 전문 분야를 위한 보상 모델링, 그리고 학술 연구에 대한 RLHF/RLCF 적용에 관심이 있는 AI 연구자 및 과학자를 위한 것입니다.
주요 특징
- 높은 정확도: 30B Scientific Judge 변형은 도메인 내 정확도 82.7%를 달성하여 GPT-5.4 Thinking과 같은 베이스라인을 능가했습니다.
- 시간적 일반화: 이 모델은 미래의 논문(예: 2025년 논문)을 판단할 때도 높은 성능을 유지합니다.
- 도메인 간 전이: 학습된 판단력은 다양한 과학 분야(bioRxiv를 통한 생물학 포함) 및 ICLR 피어 리뷰와 같은 다양한 커뮤니티 지표에 걸쳐 일반화됩니다。
- SciJudgeBench: 컴퓨터 과학, 수학, 물리학에 걸친 720,000개 이상의 선호도 쌍을 포함하는 대규모 데이터셋을 포함합니다.
관련
- Dispatch
- Dispatch
- Dispatch
- 프로젝트