OpenAI 初回証明提出
OpenAIは内部の推論モデルを用いて、First Proofチャレンジの全10問に挑戦しました。First Proofは、AIが専門領域で検証可能なエンドツーエンドの議論を生成できるかをテストすることを目的とした研究レベルの数学競技です。このマイルストーンは、モデルの長いチェーンの推論能力と、長年未解決だった問題に取り組む力を示しています。
First Proof問題におけるモデルのパフォーマンス
OpenAIは、モデルの証明試みのうち少なくとも5つ(具体的には問題4、5、6、9、10)が正しい可能性が高いと考えています。他のいくつかの試みはまだ審査中ですが、公式コメントやコミュニティの分析を受けて、問題2の試みが正しいという当初の見解は撤回されました。
‘現在、思考の厳密さを高めることを主な焦点とした新しいモデルを訓練しています。その目標は、モデルが何時間も連続して考え続け、結論に対して高い自信を保てるようにすることです。First Proofの問題が発表されたとき、これ以上ないテストベッドのように思えました… すでに問題#9と#10の2つを解くことができました。訓練が進むにつれ、能力はますます向上し、最終的に—私たちの推定では—少なくともさらに3つを解いたと考えています。’
方法論と人間の監督
証明試みは限定的な人間の監督の下で生成されました。プロセスにはいくつかの具体的な介入が含まれます:
- 戦略指導: 人間は、以前の試みで有望に見えた戦略を再試行することを提案しました。
- 洗練: モデルに、専門家のフィードバックに基づいて証明のセクションを拡張または明確化するよう求め、検証を支援しました。
- 検証支援: 内部モデルとChatGPTとの往復的なやり取りを利用して、フォーマット、スタイル、検証を行いました。
- 選択: 複数の試みがある場合、人間は判断に基づいて最良のバージョンを選びました。
OpenAIは、これは「高速スプリント」であり、プロセスが正式な評価の管理された環境を欠いていたことを認め、今後より厳格な枠組みのためにFirst Proofの主催者と協力したいと表明しています。
AI評価における最前線研究の役割
OpenAIは、最先端の新しい研究が次世代AIモデルを評価する最も効果的な方法であると主張しています。同社は、標準的なベンチマークでは研究の最も困難な側面を捉えきれないことが多いと指摘しています。例えば:
- 長い推論チェーンを持続させること。
- 適切な抽象化を選択すること。
- 曖昧さへの対処: 問題文の曖昧さに対処すること。
- 専門家の精査に耐える議論を作り出すこと。
推論能力の文脈
これらの結果は、数学と科学におけるAI推論の一連の進展に基づいています:
- 2025年7月: 汎用推論モデルが国際数学オリンピックで金メダルレベルの成績(35/42点)を達成しました。
- 2025年11月: 物理学、生物学、数学における科学の加速に対するGPT-5の能力に関するケーススタディが共有されました。
- 最近の進展: GPT-5.2は理論物理学におけるグルオン振幅式の候補表現を提案し、内部モデルによって正式に証明され、著者により検証されました。
Sources
- OriginalOur First Proof submissions