PolymathicAI/the_well
A 15TB Collection of Physics Simulation Datasets
解決的問題
提供一個大規模且標準化的數值物理模擬資料庫,以加速計算科學領域機器學習模型的開發。透過提供15TB的多樣化時空資料,消除取得高品質模擬資料以訓練能預測物理系統的代理模型的障礙。
如何運作
本專案由一個Python套件組成,使用者可使用與PyTorch相容的 WellDataset 類別,透過Hugging Face串流或本地下載,將物理資料集載入訓練流程。包含16個資料集,涵蓋流體動力學、生物系統、超新星爆炸等領域。此外,還提供一個基準測試套件,內含預先實作的代理模型(如FNO)與訓練指令碼,用以評估模型在這些物理系統上的表現。
適用對象
需要大規模、多樣化訓練資料的PDE(偏微分方程)代理模型與計算物理領域的研究人員及機器學習工程師。
亮點
- 龐大規模:涵蓋16個多樣化的物理資料集,總計15TB資料。
- 廣泛領域涵蓋:包含從聲學散射到星際磁流體等各類模擬。
- 彈性資料存取:支援本地下載與直接從Hugging Face串流。
- 整合基準測試:內建訓練框架與預先訓練的基線模型檢查點,方便快速比較。
相關
- Dispatch
- 專案
- 專案
- 專案
- 專案