aisingapore/sealion

South-East Asia Large Language Models

해결하는 문제

SEA-LION은 대규모 언어 모델에서 동남아시아(SEA) 언어와 문화의 부족한 표현을 해결합니다. 지역의 다양한 맥락을 더 잘 이해할 수 있도록 설계된 오픈소스 모델 패밀리를 제공하며, 동남아시아 지역 내 소외된 인구 집단과 저자원 언어를 위한 모델을 제공합니다.

작동 방식

프로젝트는 다양한 모델 버전에서 다양한 학습 전략을 활용하여 지역 특화를 달성합니다:

  • 스クラ치에서의 사전 훈련: v1에서 사용되어 지역 기반의 기초 지식을 구축합니다.
  • 계속 사전 훈련(CPT): v2, v3, v4에서 사용되어 기존 오픈소스 기초 모델(Llama, Gemma 등)을 동남아시아 지역에 맞게 적응시킵니다.
  • 지도 기반 미세 조정(SFT): 지시, 추론, 멀티모달 버전의 모델을 생성하는 데 사용됩니다.
  • 지식 증류 및 모델 병합: v4.5에서 사용되어 고용량 추론 및 에이전트 도구 사용 기능을 제공합니다.

대상 사용자

동남아시아의 문화와 언어에 민감한 LLM이 필요한 개발자 및 연구자, 그리고 검색, 추론, 멀티모달 작업을 위한 오픈소스 지역 모델을 찾는 사람.

주요 특징

  • 다양한 모델 패밀리: 텍스트 기반 LLM, 최대 256K 컨텍스트 창을 가진 멀티모달 VLM(시각-언어 모델), 지역 검색을 위한 전용 임베딩 모델 포함.
  • 지역 기반 안전성 레이어: 동남아시아 지역의 문화적 맥락에 맞춘 진단 테스트를 갖춘 전용 안전 모델인 SEA-Guard 포함.
  • 지역 기반 벤치마킹: SEA-HELM 및 SEA-BED을 사용하여 지역 언어 및 맥락에서 높은 성능을 보장합니다.
  • 오픈소스 정신: 사전 훈련 및 미세 조정 데이터, 훈련 코드, 평가 벤치마크를 모두 오픈 액세스로 제공.

관련