allenai/dolma

Data and tools for generating and inspecting OLMo pre-training data.

解決的問題

Dolma 提供了一種高性能的方法,用於為機器學習模型的預訓練建立大型數據集。它解決了從網頁內容、學術論文、程式碼等多樣來源處理與清理數十億文件的挑戰,以建立高品質的訓練語料庫。

工作原理

此專案由兩部分組成:一個規模龐大的 3 兆 token 開放資料集與一個工具包。該工具包利用內建的平行處理能力,可在單機、叢集或雲端環境中並行處理文件。它包含基於流行篩選方法(如 Gopher 和 C4)的預建標記器,並使用基於 Rust 的 Bloom filter 實現快速文件去重。

適用對象

需要工具來對海量原始資料進行篩選、清理與去重,以用於預訓練的大規模語言模型研究人員與開發者。

主要亮點

  • 大規模開放資料集:可存取包含多樣化網路、學術與程式碼資料的 3 兆 token 資料。
  • 高效率:能夠並行處理數十億文件。
  • 雲原生:支援 AWS S3 相容儲存,並可在各種運算環境中運作。
  • 即用型標記器:內建可立即使用的標準篩選標記器。
  • 快速去重:使用 Rust 實現高速文件重複項刪除。

相關

  • 專案
  • 專案
  • 專案
  • 專案