google-deepmind/regress-lm

Library for sequence-to-sequence numeric prediction, applicable to any tokenizable input, and allows pretraining and fine-tuning over multiple tasks.

해결하는 문제

RegressLM은 시퀀스에서 시퀀스로의 수치 예측을 간소화합니다. 텍스트나 이미지와 같은 토큰화 가능한 입력에서 부동소수점 값을 예측(회귀)할 수 있게 해주며, 비구조화된 데이터를 처리하여 특정 성능 지표나 결과를 예측할 수 있도록 합니다.

작동 방식

이 라이브러리는 입력 시퀀스에서 수치 예측을 디코딩할 수 있는 모델의 사전 학습 및 미세 조정을 위한 프레임워크를 제공합니다. T5Gemma, Mamba, Performer 등 다양한 인코더 아키텍처를 지원하며, 긴 컨텍스트(100K+ 토큰)를 처리할 수 있습니다. 사용자는 처음부터 시작하거나, 사전 학습된 제3자 모델을 사용할 수 있으며, 여러 수치 값을 동시에 예측할 수 있는 다중 목적 예측도 지원합니다.

대상 사용자

비구조화된 토큰화 가능한 데이터를 정밀한 수치 값으로 매핑해야 하는 개발자 및 연구자에게 적합합니다. 예를 들어, 텍스트 기반 시스템 상태에서 GPU 커널 지연 시간이나 시스템 성능 지표를 예측할 때 유용합니다.

주요 특징

  • 유연한 입력 지원: 문자열과 이미지 등 토큰화 가능한 입력을 처리합니다.
  • 다중 목적 예측: 여러 수치 타겟을 연결된 토큰 시퀀스로 디코딩할 수 있습니다.
  • 긴 컨텍스트 기능: Mamba 및 Performer 인코더와 통합되어 10만 개 이상의 입력 토큰을 지원합니다.
  • 전이 학습: 대규모 데이터셋에서 사전 학습한 후 특정 작업에 대해 미세 조정할 수 있습니다.
  • 아키텍처 선택지: T5Gemma 인코더 및 사용자 정의 디코더와 호환됩니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트