sapientinc/HRM-Text

HRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.

解決的問題

HRM-Text 解決了從頭預訓練基礎模型所伴隨的高昂運算與資料成本。它能夠使用比傳統縮放定律所建議的顯著更少的運算量(減少 130-600 倍)與資料量(減少 150-900 倍)來建立 1B 參數的文字生成模型,使基礎模型預訓練能以低得多的成本(約 1,000 美元)實現。

運作原理

本專案實作了一個透過任務完成與潛在空間推理來強化的分層循環架構(HRM)。該框架利用數個高效能元件來最佳化訓練:

  • 架構: 一個支援多種配置的分層循環模型,包含標準 Transformer 包裝器與數個遞迴基線。
  • 訓練管線: 使用 PyTorch FSDP2 進行分散式訓練,在注意力路徑上使用 FlashAttention 3 核心,並使用 PrefixLM 序列打包來提升效率。
  • 資料處理: 整合了附帶的 data_io 管線,用於預訓練語料庫的清理、分詞與分層抽樣。
  • 工具: 包含用於推論的編譯生成引擎、用於標準基準測試(如 MMLU 和 GSM8k)的評估腳本,以及將檢查點匯出為 Hugging Face Transformers 格式的轉換工具。

適用對象

本專案專為想要從頭預訓練自家基礎模型,但不具備大規模 LLM 通常所需之龐大基礎設施與運算預算的 AI 研究人員與開發者而設計。

亮點

  • 極致效率: 在 16 張 H100 GPU 上耗時約 46 小時預訓練 1B 模型,成本不到 1,500 美元。
  • 高效能: 在推理與知識任務上具備競爭力的基準測試結果(例如,XL 模型在 GSM8k 上達到 84.7%)。
  • 全生命週期支援: 提供從資料準備、預訓練到評估與 SFT(監督微調)的完整管線。
  • 靈活架構: 支援多種模型大小(B 到 XXL)以及各種循環與基於 Transformer 的架構。

相關

  • 專案
  • 專案
  • 專案
  • 專案