sapientinc/HRM-Text
HRM-Text is a 1B text generation model based on the HRM architecture, strengthened by task completion and latent space reasoning.
解决的问题
HRM-Text 解决了从头预训练基础模型所伴随的高昂计算与数据成本。它能够使用比传统缩放定律所建议的显著更少的计算量(减少 130-600 倍)与数据量(减少 150-900 倍)来创建 1B 参数的文本生成模型,使基础模型预训练能以低得多的成本(约 1,000 美元)实现。
工作原理
本项目实现了一个通过任务完成与潜在空间推理来强化的分层循环架构(HRM)。该框架利用数个高性能组件来优化训练:
- 架构: 一个支持多种配置的分层循环模型,包含标准 Transformer 包装器和数个递归基线。
- 训练流水线: 使用 PyTorch FSDP2 进行分布式训练,在注意力路径上使用 FlashAttention 3 内核,并使用 PrefixLM 序列打包来提升效率。
- 数据处理: 集成了附带的
data_io流水线,用于预训练语料库的清理、分词与分层抽样。 - 工具: 包含用于推理的编译生成引擎、用于标准基准测试(如 MMLU 和 GSM8k)的评估脚本,以及将检查点导出为 Hugging Face Transformers 格式的转换工具。
适用对象
本项目专为想要从头预训练自家基础模型,但不具备大规模 LLM 通常所需之庞大基础设施与计算预算的 AI 研究人员与开发者而设计。
亮点
- 极致效率: 在 16 张 H100 GPU 上耗时约 46 小时预训练 1B 模型,成本不到 1,500 美元。
- 高性能: 在推理与知识任务上具备竞争力的基准测试结果(例如,XL 模型在 GSM8k 上达到 84.7%)。
- 全生命周期支持: 提供从数据准备、预训练到评估与 SFT(监督微调)的完整流水线。
- 灵活架构: 支持多种模型大小(B 到 XXL)以及各种循环与基于 Transformer 的架构。
相关
- 项目
- 项目
- 项目
- 项目