OpenAI、フィルイン・ザ・ミドル(FIM)向け言語モデルの効率的なトレーニングを発表

TL;DR

OpenAI は、標準的な自己回帰言語モデルが欠落したスパン(フィルイン・ザ・ミドル、FIM)を埋めることを学習できるデータ拡張手法を導入しました。この手法は、元の左から右への生成性能を維持しつつ、FIM を実用的なデフォルトのトレーニング目的にします。

FIM が重要な理由

モデルにフィルイン・ザ・ミドルを行わせる訓練は、編集、コード補完、インタラクティブな執筆といったユースケースでの有用性を拡大します。これらのシナリオでは、ユーザーがゼロから生成するのではなく、テキストを挿入または置換する必要があります。事前学習段階で FIM を組み込むことで、OpenAI は追加のファインチューニングやアーキテクチャ変更なしにこの能力を獲得できることを示しました。

コア手法:スパンシフト変換

この手法は、文書の中間から連続したスパンを選択し、同じ文書の末尾へ移動させることで訓練コーパスを変更します。モデルは、周囲のコンテキストが与えられた状態でシフトされたテキストを予測するターゲットとして学習します。このシンプルな変換により、元の左から右への順序はシフトされていない部分で保持され、インフィリングタスクが生成されます。

実証結果

  • 生成能力の低下なし:複数のモデルスケールにわたり、標準的な左から右への言語モデリングベンチマークにおけるパープレキシティは、広範な FIM 訓練後も変わりません。
  • 高いインフィル性能:変換例の割合が高いモデルは、OpenAI が公開した専用インフィリングベンチマークで競争力のある結果を達成します。
  • スケーラビリティ:このアプローチは小型から大型モデルまで一貫して機能し、変換がスケーリング法則に干渉しないことを示しています。

アブレーション研究とベストプラクティス設定

OpenAI は、以下の 3 つの主要ハイパーパラメータに対して体系的なアブレーションを実施しました。

  1. 変換頻度 – スパンシフトを適用する訓練例の割合。結果は、適度な頻度(例:30‑50%)がインフィルスキルと生成忠実度のバランスを取ることを示唆しています。
  2. スパン構造 – スパンの長さと位置を変化させた結果、両方をランダム化することで最も堅牢な性能が得られました。
  3. スパン選択方法 – ランダム選択がヒューリスティックや長さバイアスの戦略を上回り、実装がシンプルになります。

これらの実験から、OpenAI は次のデフォルトを推奨しています。

  • 訓練データの約半分に変換を適用する。
  • 事前定義された範囲(例:10‑50 トークン)内でスパン長を均一にランダム選択する。
  • 文書内でスパンをランダムに配置し、極端な開始位置や終了位置は避ける。

公開リソース

  • ベストインクラス FIM モデル:OpenAI は、API を通じて最高性能のインフィリングモデルを提供しており、開発者は直接フィルイン・ザ・ミドル予測を問い合わせることができます。
  • インフィルベンチマーク:評価データセットとスクリプトのスイートがオープンソース化され、FIM 能力に関する再現性のある研究を支援します。

将来の言語モデル開発への示唆

  • デフォルトのトレーニング目的:左から右への性能への影響が極めて小さいことから、OpenAI は将来の自己回帰モデルが FIM 訓練を標準的な実践として採用すべきと提案しています。
  • 効率向上:変換は計算オーバーヘッドが最小限で済むため、大規模事前学習パイプラインにとって魅力的です。
  • 汎用性の拡大:この手法はモデルに依存せず、任意の自己回帰アーキテクチャに適用可能であり、フィルイン機能の採用を業界全体で加速させる可能性があります。

"このデータ拡張は近年大きな関心を集めていますが、我々はこの方法で変換されたデータの大部分で訓練したモデルが、元の左から右への生成能力を損なわないことを広範に実証しています…" – OpenAI 著者

結論

OpenAI の効率的な FIM 訓練手法は、シンプルなデータセット変換だけで自己回帰言語モデルに堅牢なインフィリング能力を付与し、コアの生成力を損なわないことを示しました。公開されたモデル、ベンチマーク、推奨ハイパーパラメータは、コミュニティが将来の言語モデルにフィルイン・ザ・ミドル機能を統合するための明確な道筋を提供します。

Sources