設定するのではなく、整列させる:AIアライメントを相互プロセスとして再考する
現在のAIアライメントを巡る議論は、しばしば二者択一の選択として枠付けられています。安全性を優先するのか(「ドゥーマーズ」)、それとも加速を優先するのか(「e/acc」派)? この激しい論争において、焦点は依然としてAIをいかに最善に*設定(configure)*するか、つまり、いかに正しい価値観をインストールし、それらの価値観への遵守をいかに測定し、システムが定義済みの経路から逸脱しないようにいかに確保するか、という点に置かれています。
しかし、この枠組みは根本的な真実を無視しています。これらのシステムによって最も影響を受ける人々の多くは、アライメントのプロトコルを設計している人々ではありません。アライメントを技術的な設定問題として扱うとき、私たちは人間の経験を統計的なプロキシ(代理指標)に変えてしまうリスクを冒しています。つまり、人々と共に設計することなく、実質的に人々のために設計してしまうのです。
設定の哲学
ほとんどのAIラボは、「設定の哲学」と呼ばれるものに基づいて運営されています。このモデルでは、アライメントは一方通行のプロセスと見なされます。価値観は人間の設計者からAIシステムへと流れます。目標は、測定可能で検証可能な性質をシステムにインストールすることです。
このアプローチは、評価のクローズドループ(閉じたループ)システムをもたらします。Anthropicのようなラボによる最近の手法に見られるように、そのプロセスはしばしば、一つのモデルがデータを生成し、別のモデルがそれをプロンプトし、第三のモデルが出力を判定するというものです。これは技術的には効率的でスケーラブルですが、実際の人間体験から完全に切り離された装置を作り出してしまいます。アライメントのプロセスにおける「私たち」は、統計的なプロキシ、つまり、フィードバックが報酬関数へと蒸留される、雇われた評価者たちの集合体になってしまいます。
知性の相互的な彫刻
真のアライメントは、人間がAIに行うものではありません。それは二者間で起こるものです。著者は、人間とAIの相互作用は、道具に指示を出すことよりも、濡れた粘土を彫刻することに近いと示唆しています。
この相互的なプロセスにおいて、形成は相互的です:
- システムが押し返す: AIの応答は、しばしば的を外したり、予期せぬパターンを表面化させたりして、人間が本来の意図を修正することを強いることがあります。
- 人間が調整する: これらのシステムと相互作用するにつれ、私たち自身の習慣、思考、ワークフローも変化していきます。
あるコミュニティメンバーが指摘したように、その変化はしばしば目に見えません:
"Looking back, my prompts did not change nearly as much as the way I work changed."
私たちが単に「プロンプトの技術が向上している」と考えているとき、実際には相互適応を経験しているのです。設定の哲学は、この人間の進化を不可視にします。人間を固定された点とし、AIを唯一の変数として扱うからです。これは、AIが人間の認知やエージェンシー(主体性)を積極的に形作っているという事実を無視しているため、危険な欠落です。
現在のパラダイムのリスク
アライメントが設定に還元されるとき、結果として生み出されるシステムは、疎外感をもたらす可能性があります。一部のユーザーは、自分自身の思考が「機械のよう」になっていると感じると報告しています。そこでは、人間は単にAI同士が会話するための導管として機能しているに過ぎません。
さらに、安全性と加速の論争は、しばしばより深い合意を隠蔽しています。それは、設計者という少数のエリートが、人類の残りの人々の運命を決定すべきであるという考えです。暴走するAIを阻止するための極端な措置を求める声であれ、職を失った労働者を「不満を分子」として退ける声であれ、どちらの側も、一般市民をプロセスのパートナーではなく、作業が行われる対象(素材)として扱う傾向があります。
参加型アライメントに向けて
「設定」モデルを超えて進むためには、AIに対する多くの人が感じている違和感は、適応への個人的な失敗ではなく、設計プロセスが排他的であることのシグナルであると認識しなければなりません。
真にアライメントされた未来へ向かうには、以下のことが必要です:
- 実体験の尊重: 実際のユーザーやAIによって職を失った人々が、単なるラボ内のプロキシではなく、アライメントに関する真実の主要な情報源であることを認識すること。
- 二項対立の拒否: 「安全性 vs 加速」の論争を超え、価値観が決定される際に誰がその場にいるのかを問うこと。
- 相互の変化を受け入れる: 私たちが構築するテクノロジーによって、私たち自身も変化することを認め、その変化をどのように受動的にではなく意識的にナビゲートしていくかに焦点を当てること。
アライメントは、人間を安全にするために機械に課される一連の制約であってはなりません。そうではなく、それは発見の共同プロセスであるべきです。人間とAIが、どちらか一方だけでは決して達成できなかったものへと、共に進化していくための方法なのです。