ソブリンAI:ノルウェーの国家言語モデル構築への野心
人工知能(AI)の探求は、しばしば一握りのグローバルなテック巨人の間の競争として捉えられます。しかし、それとは異なる種類の競争が浮上しています。それは「ソブリンAI(主権的AI)」の追求です。ノルウェーは現在、この動きの最前線に立っており、国立図書館(Nasjonlbiblioteket)が、ノルウェー語、歴史、および文化を理解し反映するために特別に設計された大規模言語モデル(LLM)を構築するという膨大な任務に取り組んでいます。
この取り組みは、グローバルに訓練された英語中心のモデルには、国家の遺産を真に表現するために必要なニュアンスが欠けているという根本的な信念に基づいています。図書館のITプラットフォーム責任者であるMarius Husnesは、ソブリンLLMを持たない国は、汎用モデルが現地語に記された文化的文脈を完全に捉えきれないため、不利な立場に置かれると主張しています。
データエンジン:アーカイブからパイプラインへ
ソブリンLLMの構築には、単なる計算資源以上のものが必要です。キュレーションされた高品質なデータセットが必要です。ノルウェー国立図書館は、この任務において独自の地位を占めており、同国の書籍、新聞、ウェブページに関する最大のデジタルコレクションを保有しています。2005年以来、図書館は20 PBのユニークなデータを蓄積しており、冗長性のある3-2-1形式で保存されています(合計ストレージ容量は60 PBに達します)。
しかし、このデータを保存アーカイブからトレーニングパイプラインへ移動させることは、大きなエンジニアリング上の課題を伴います。図書館の保存システムは耐久性とコストに最適化されており、読み取りレイテンシが高く、頻繁なアクセスを想定していない設計になっています。対照的に、AIのトレーニングには、高スループットかつ低レイテンシの並列データI/Oが必要です。
このギャップを埋めるため、図書館は2段階の処理アーキテクチャを実装しました:
- AIデータパイプライン: 複数のHuawei OceanStor Doradoオールフラッシュアレイ(合計2 PBのフラッシュ容量)を活用し、データの取り込み、クリーニング、重複排除、フォーマットの正規化、および検証のための低レイテンシ環境を構築しました。
- トレーニングクラスター: 準備が整ったデータは、ノルウェーの国家スーパーコンピュータであるSigma2 Oliviaシステムに移動されます。このHPE Cray Supercomputing EXシステムは、448個のGPUと64,512個のCPUコアを備え、5.3 PBのCray ClusterStor E1000ストレージシステムによってサポートされています。
国家AIの課題
ハードウェアを超えて、このプロジェクトは国家モデルの開発におけるいくつかの無視できない障害をハイライトしています:
- 評価: ソブリンなノルウェー語LLMを評価するための業界標準のツールは存在しません。言語の複雑さ(2つの表記形式、多様な方言、歴史的進化を含む)により、チームは独自の評価ツールをゼロから構築する必要があります。
- ガバナンス: このプロジェクトは、モデルへのアクセス権を誰が管理し、誰がその許容される使用方法を決定するかという、重要な政治的および制度的な問いを raised しています。
- オーケストレーション: 保存アーカイブ、オンプレミスのAI環境、および国家スーパーコンピュータという、3つの異なるシステム間でデータの流れを調整することは、継続的な技術的課題として残っています。
批判的な視点と反論
このプロジェクトは、技術的な観察者たちの間で、特にそのアプローチの必要性と効率性に関して、大きな議論を巻き起こしています。
ソブリンモデルは必要か?
一部の批判者は、グローバルプロバイダーのフロンティアモデルはすでに膨大な量の多言語データで訓練されているため、専用の国家モデルは冗長であると主張しています。他の人々は、モデルをゼロから構築するのではなく、ノルウェーが高品質なトレーニングデータセットを作成し、それをグローバルなモデルビルダーと共有することで、既存のモデルにおけるノルウェー文化の代表性を向上させるべきだと提案しています。
ハードウェアとリソースの懸念
技術的な懐疑論者は、割り当てられたハードウェア(具体的にはOliviaシステム上の448個のGPU)が、真に競争力のある、本格的なLLMをゼロから訓練するための十分な量であるか、あるいはプロジェクトが実際には既存のオープンソースモデルのファインチューニング(LoRA)を行っているだけなのかを疑問視しています。また、2 PBのフラッシュフラッシュストレージの規模についても議論があり、現代のデータ蓄積の基準では控えめであると主張する者もいれば、LLMのチェックポイント保存に使用される高性能NVMeフラッシュとして見れば、大規模な展開であると指摘する者もいます。
地政学的な側面
欧州の公共セクターのプロジェクトにおいてHuaweiのストレージを使用することは、西側のインフラにおける中国製ハードウェアに関する地政学的な緊張と制限を考慮すると、注目を集めています。しかし、一部の観察者によれば、ノルウェーの非EU加盟国としての地位が、調達の選択肢においてより多くの柔軟性を提供していると指摘されています。
結論:文化の守護者としてのAI
ノルウェーの実験は、単なる技術的な演習ではありません。それは、AIの時代において、国家が自らの知的および文化的主権を維持できるかどうかのテストです。Husnesは次のように述べています。「AIには、単なる構築者ではなく、守護者が必要です。」このプロジェクトが、有用なツールを作成することに成功するか、あるいはソブリンAIのソブリンAIのコストに関する教訓となるかに関にかかわらず、それは、同じジレンマに直面している他の非英語圏の国々にとって、一つの青写真(ブループリント)を提供しています。すなわち、どのようにして自らの言語と歴史が、少数のグローバル企業のアルゴリズムによって消去または希釈されるのを防ぐか、という点です。