google-deepmind/regress-lm

Library for sequence-to-sequence numeric prediction, applicable to any tokenizable input, and allows pretraining and fine-tuning over multiple tasks.

解决的问题

RegressLM 简化了执行序列到序列数值预测的过程。它允许用户从可分词的输入(如文本或图像)中预测浮点数值(回归),使模型能够处理非结构化数据,以预测特定的性能指标或结果。

工作原理

该库提供了一个框架,用于预训练和微调模型,这些模型可以从输入序列中解码数值预测。它支持多种编码器架构,包括 T5Gemma、Mamba 和 Performer,以支持长上下文(高达 100K+ 个标记)。用户可以从零开始,也可以使用第三方预训练模型,系统还支持多目标预测,即同时预测多个数值。

适用人群

专为需要将非结构化的可分词数据映射到精确数值的开发者和研究人员设计,例如从基于文本的系统状态中预测 GPU 内核延迟或系统性能指标。

主要亮点

  • 灵活的输入支持:支持字符串和图像等可分词输入。
  • 多目标预测:能够解码多个数值目标的连接标记序列。
  • 长上下文能力:与 Mamba 和 Performer 编码器集成,支持超过 100,000 个输入标记。
  • 迁移学习:支持在大规模数据集上进行预训练,然后在特定任务上进行微调。
  • 架构选项:兼容 T5Gemma 编码器和自定义解码器。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目