Databricks と Hugging Face が Apache Spark を統合し、LLM のトレーニングを高速化
Databricks と Hugging Face は Apache Spark を Hugging Face のコードベースに直接統合し、ユーザーが Apache Spark のデータフレームから Hugging Face Datasets を作成できるようにしました。この統合により、Spark から Hugging Face データセットへのデータ移行にかかる時間が最大 40% 短縮され、Large Language Models (LLMs) のトレーニングおよびファインチューニングのパイプラインが効率化されます。
Dataset.from_spark() による直接的な Spark 統合
従来、Apache Spark のデータフレームから Hugging Face データセットへデータを移行するワークフローは、データをディスク上の Parquet ファイルに書き出し、再度そのファイルをデータセットにロードする必要がありました。このプロセスは、ディスクへの書き込み、ディスクからの読み込み、データの再生成が必要となり、リソース消費、時間、コストが増大する非効率的なものでした。
新しいアップデートにより、ユーザーは Dataset.from_spark() 関数を使用できるようになりました。これにより、Spark のデータフレームや Delta テーブルを直接 Hugging Face データセットにマッピングでき、中間の Parquet ファイルを省くことができます。
パフォーマンスベンチマーク
16GB のデータセットを使用したテストでは、処理時間が Parquet 手法で 22 分から Dataset.from_spark() で 12 分に短縮され、処理時間が 40%以上削減されました。
ドメイン固有 AI における戦略的重要性
Spark と Hugging Face の統合は、特定ドメイン向けに AI モデルを強化するために大規模データセットで複雑なデータ変換を行う必要がある組織にとって重要です。Spark のデータ処理エンジンのコスト効率とパフォーマンスに、Hugging Face データセットのメモリマッピングやスマートキャッシュ最適化を組み合わせることで、組織は独自データをより効率的に準備・活用し、モデルのチューニングに活かすことができます。
広範なオープンソース AI エコシステムへの貢献
この統合は、Databricks が Hugging Face のコードベースに対して計画している複数の貢献のうちの最初のものです。今後は Spark を通じたストリーミングサポートを追加し、データセットのロードをさらに高速化する予定です。
Hugging Face の統合に加えて、Databricks は他にもいくつかの AI 重視のオープンソース改善を実施しています。
- MLflow: transformers ライブラリ、OpenAI 統合、Langchain サポートを追加しました。
- Databricks SQL: OpenAI やその他のデプロイ済みモデルを SQL クエリに統合する AI Functions を導入しました。
- PyTorch Distributor: Databricks プラットフォーム上で分散 PyTorch トレーニングを簡素化するために、Spark 用の PyTorch ディストリビュータをリリースしました。