aisingapore/sealion

South-East Asia Large Language Models

何を解決するか

SEA-LIONは、大規模言語モデルにおける東南アジア(SEA)言語および文化的背景の不足を補うものです。地域の多様な文脈をよりよく理解できるように設計されたオープンソースモデルのファミリーを提供し、東南アジア地域における代表されていない人口集団や低リソース言語に特化しています。

どう動くか

プロジェクトは、異なるモデルバージョンでさまざまな学習戦略を採用して地域特化を実現しています:

  • スクラッチからの事前学習: v1で使用され、地域固有の基礎知識を構築します。
  • 継続的事前学習(CPT): v2、v3、v4で使用され、既存のオープンソースの基礎モデル(LlamaやGemmaなど)を東南アジア地域に適応させます。
  • 教師あり微調整(SFT): 指示対応、推論、マルチモーダルバージョンのモデル作成に使用されます。
  • 知識蒸留とモデル統合: v4.5で使用され、高容量の推論能力およびエージェント型ツール利用機能を実現します。

対象ユーザー

東南アジアの文化・言語に適応したLLMが必要な開発者や研究者、またリトリーバル、推論、マルチモーダルタスク向けのオープンソース地域モデルを探している人。

特徴

  • 多様なモデルファミリー: テキストベースのLLM、最大256Kのコンテキスト窓を持つマルチモーダルVLM(視覚言語モデル)、地域リトリーバル向けの専用埋め込みモデルを含む。
  • 地域特化セーフティレイヤー: 東南アジア地域に文化的に適した診断テストを備えた専用セーフティモデル「SEA-Guard」を搭載。
  • 地域ベンチマーク評価: SEA-HELMおよびSEA-BEDを用いて、地域言語および文脈における高いパフォーマンスを保証。
  • オープンソースの精神: 事前学習および微調整データ、学習コード、評価ベンチマークをすべてオープンアクセスで提供。

関連