OlmoEarth プラットフォーム: 惑星規模の地理空間推論
OlmoEarth プラットフォーム: 惑星規模の地理空間推論
OlmoEarth プラットフォームは、地理空間ファウンデーションモデルをファインチューニングと評価から大規模推論へ移行するために設計されたインフラストラクチャです。これにより、組織は約1日で大陸規模の領域にわたる数十テラバイトの画像を処理でき、1平方キロメートルあたりのコストをペニーの一部にまで抑えることができます。
衛星推論における課題の克服
地理空間推論は、データの巨大な規模と入力の複雑さにより、標準的なMLタスクとは異なります。1つのファインチューニングジョブはテラバイト規模のデータを含み、数時間実行されることがあり、複数のスペクトルバンド、センサータイプ、タイムステップを利用します。
Key technical hurdles include:
- データのヘテロジニティ: 画像は、投影、解像度、雲の覆い具合が異なるさまざまなプロバイダーから提供されます。
- アラインメント要件: 出力がマップであるため、各予測は周辺領域の座標グリッドと正確に整合している必要があります。
- I/O ボトルネック: 予測ジョブは、モデルの実行よりも画像のダウンロードと準備に時間を費やすことが多く、それにより高度に効率的なデータパイプラインが必要となります。
最適化されたハードウェア割り当て
To prevent expensive GPUs from being wasted on data preparation, the OlmoEarth Platform divides each inference job into three distinct stages, each mapped to the most cost-effective hardware:
- データ取得と前処理 (CPU, 高 I/O): このステージでは、画像を取得し、再投影、アラインメント、正規化を行い、高速ロードに最適化された形式で保存します。
- 推論 (GPU): プラットフォームはモデルのフォワードパスを実行し、最小限に処理された出力を直接ストレージに書き込みます。
- 後処理 (CPU): ウィンドウごとの出力を結合し、マスクまたはリスケーリングを適用し、結果を GeoJSON、GeoTIFF、Zarr などの形式でエクスポートします。
OlmoEarth Run を介したスケーラブルな実行
OlmoEarth Run、プラットフォームの実行レイヤーは、地理的領域を個々のコンピュートインスタンス(ワーカー)に適したサイズのパーティションに分割することで大規模ジョブを管理します。これらのパーティションはさらにモデル処理のための小さなウィンドウに細分されます。各ウィンドウは独立しているため、プラットフォームは数千のフォワードパスを並列に実行できます。
In a recent North America wildfire-risk map generation, the platform demonstrated the following scale:
- 並列性: ピーク時に約19,600 CPUと994 GPUを使用しました。
- スループット: ネットワークスループットは168 GB/sを超えました。
- 効率: 推定4,737時間のシリアルコンピュートを30.5時間のウォールクロック時間に短縮し、155倍のスピードアップを達成しました。
インテリジェントなデータインデックスと取得
To avoid overwhelming external STAC APIs (such as those from ESA or Microsoft Planetary Computer) with thousands of concurrent queries, the OlmoEarth Platform maintains its own internal metadata index.
メタデータ管理
- 更新メカニズム: インデックスは、AWS Open Dataに対してSNS通知により更新され、その他のプロバイダーについては数分ごとに上流インデックスをポーリングすることで更新されます。
- 効率的な取得: インデックスはシーンのメタデータとピクセルへのポインタを格納します。ランタイムでは、プラットフォームはクラウド最適化フォーマット(COGまたはZarr)に対してウィンドウ読み込みを行い、シーン全体をダウンロードする代わりに、パーティションに必要なバイトのみを取得します。
Best Practices for Data Providers
Based on the platform's development, the team recommends three best practices for publishing Earth observation data: queue-based notifications for new imagery, storage on major cloud platforms without bespoke rate limits, and the use of cloud-optimized formats that support ranged reads.
フォルトトレランスとリカバリ
The platform is designed for automatic recovery from the routine failures of distributed computing. Each task is executed within a runner Docker container that is provisioned dynamically.
Because every task is reentrant and idempotent, the platform handles intermittent failures—such as provider unavailability, missing imagery bands, or container crashes—through task tracking, automatic retries, and fallback to alternate providers. A separate monitoring process identifies stalled runners and restarts their tasks.
未来のロードマップ
Ai2 is expanding the OlmoEarth Platform to include several new capabilities:
- 自動化されたワークフロー: 新しい画像の登録に基づいて推論ジョブをスケジュールしたりトリガーしたりします。
- アラートシステム: 洪水や森林伐採などのイベントについてユーザーに通知するため、変更検出を実装します。
- エージェントic インターフェース: データキュレーションと特徴量エンジニアリングの技術的ハードルを下げるツールを開発中です。
- 効率の向上: より高速なモデルアーキテクチャの研究と、多くのタスクにおいてフルフォワードパスを置き換える専用のエンベディングモデルの開発。
- モダリティの拡張: 天気データ(ERA-5)および追加の衛星センサーを組み込みます。
- クラウドに依存しないデプロイ: 現在Google Cloud上で動作していますが、アーキテクチャは複数のクラウドをサポートし、パートナー独自のコンピュート環境へのデプロイも可能に設計されています。