OpenAI Neural GPU: 拡張と制限

OpenAIは、マルチディジットバイナリ加算やバイナリ乗算などのアルゴリズムを学習でき、任意の長さの入力に一般化するモデルであるNeural GPUを強化しました。慎重なカリキュラムを実装し、モデルサイズを増やすことで、研究者はNeural GPUがより幅広いアルゴリズム問題、特に10進表現を使用した算術演算を含む問題を今では解けるようになったことを発見しました。

カリキュラムとモデルサイズによるパフォーマンスの向上

Neural GPUが複雑なアルゴリズムを学習する能力は一般化です。研究者は、そのパフォーマンスを向上させるための2つの主要な方法を特定しました:

  • カリキュラム学習: トレーニングカリキュラムを慎重に設計することで、モデルはタスクをより効果的に学習できます。
  • モデルサイズの増加: モデルのサイズを増やすと、より多くのアルゴリズム問題を解く能力が向上します。ただし、これはメモリ効率の良い実装が必要であり、ナイーブなNeural GPUの実装はメモリを大量に消費するためです。

アルゴリズム機能の拡張

これらの改善により、Neural GPU Neural GPUは次のタスクを今では実行できるようになりました:

  • 10進算術: モデルは今ではすべての算術演算を学習し、引数が10進表現で与えられたときに任意の長さの数に一般化できるようになりました。これは以前は不可能でした。
  • 算術表現: The The Neural GPUは、オペランドの優先順位を尊重する必要がある複数のオペランドを含む長い算術表現を評価するように訓練できます。これらのタスクはバイナリ表現でのみ成功し、完全な精度を達成しませんでした。

障害モードと敵対的ような挙動

長い数に対してほぼ完璧な一般化を達成しているにもかかわらず、Neural GPUは非典型的で高度に対称な入力に対して特定の障害モードを示し続けます。これらの障害モードは、敵対的な例に似ています。

たとえば、2x2を正常に乗算できるNeural GPUは、000000…002 x 000000…002の正しい答えを計算できないことがあります。これは、100桁までの長い数の10進乗算で正常に訓練されているにもかかわらずです。

Sources