google-deepmind/regress-lm
Library for sequence-to-sequence numeric prediction, applicable to any tokenizable input, and allows pretraining and fine-tuning over multiple tasks.
解決的問題
RegressLM 簡化了執行序列到序列數值預測的過程。它允許使用者從可分詞的輸入(如文字或影像)中預測浮點數值(回歸),使模型能夠處理非結構化資料,以預測特定的效能指標或結果。
工作原理
該套件提供了一個框架,用於預訓練和微調模型,這些模型可從輸入序列中解碼數值預測。它支援多種編碼器架構,包括 T5Gemma、Mamba 和 Performer,以支援長上下文(高達 100K+ 標記)。使用者可從零開始,也可使用第三方預訓練模型,系統還支援多目標預測,即同時預測多個數值。
適用對象
專為需要將非結構化的可分詞資料映射到精確數值的開發者與研究人員設計,例如從文字型系統狀態中預測 GPU 核心延遲或系統效能指標。
主要亮點
- 靈活的輸入支援:支援字串與影像等可分詞輸入。
- 多目標預測:能夠解碼多個數值目標的連接標記序列。
- 長上下文能力:與 Mamba 和 Performer 編碼器整合,支援超過 100,000 個輸入標記。
- 遷移學習:支援在大型資料集上進行預訓練,然後在特定任務上進行微調。
- 架構選項:相容 T5Gemma 編碼器與自訂解碼器。
相關
- 專案
- 專案
- 專案
- 專案
- 專案