allenai/dolma
Data and tools for generating and inspecting OLMo pre-training data.
何を解決するか
Dolma は、機械学習モデルの事前学習のための大規模データセットをキュレートするための高性能な方法を提供します。ウェブコンテンツ、学術論文、コードなど多様なソースから数十億のドキュメントを処理・クリーニングし、高品質な学習コーパスを作成するという課題に対処します。
仕組み
このプロジェクトは2つの部分から構成されています:3兆トークン規模のオープンデータセットと、ツールキット。ツールキットは組み込みの並列処理機能を用いて、単一マシン、クラスタ、クラウド環境のいずれでもドキュメントを並列処理できます。人気のあるキュレート手法(Gopher や C4 など)に基づいた事前構築済みタガーモジュールを含み、高速なドキュメント重複除去に Rust で構築された Bloom フィルタを使用しています。
対象ユーザー
大規模言語モデルを構築する研究者や開発者で、事前学習用に膨大な量の生データをキュレート・クリーニング・重複除去するためのツールが必要な方々。
特徴
- 大規模オープンデータセット:ウェブ、学術、コードデータを含む3兆トークンの多様なデータにアクセス可能。
- 高性能:数十億のドキュメントを並列処理可能。
- クラウドネイティブ:AWS S3互換ストレージをサポートし、さまざまなコンピューティング環境で動作。
- 即時利用可能なタガーモジュール:すぐに使える標準的なキュレートタガーモジュールを内蔵。
- 高速重複除去:Rust を使用して高速な重複ドキュメント削除を実現。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト