aisingapore/sealion

South-East Asia Large Language Models

解決的問題

SEA-LION 解決了大型語言模型中東南亞(SEA)語言與文化代表性不足的問題。它提供了一組開源模型,旨在更好地理解區域多樣性,服務於東南亞地區代表性不足的人群與低資源語言。

如何運作

該項目在不同模型版本中採用多種訓練策略以實現區域專化:

  • 從零開始預訓練: 在 v1 中使用,用於建構基礎的區域知識。
  • 持續預訓練(CPT): 在 v2、v3 和 v4 中使用,用於將現有的開源基礎模型(如 Llama 和 Gemma)適配至東南亞地區。
  • 監督微調(SFT): 用於創建指令、推理與多模態版本的模型。
  • 知識蒸餾與模型合併: 在 v4.5 中使用,以實現高容量推理與代理工具使用能力。

適用對象

需要在文化與語言上貼合東南亞的 LLM 的開發者與研究人員,以及尋求用於檢索、推理與多模態任務的開源區域模型的使用者。

主要亮點

  • 多樣化的模型家族: 包括文字型 LLM、最大支援 256K 上下文視窗的多模態 VLM(視覺-語言模型),以及用於區域檢索的專用嵌入模型。
  • 區域安全層: 包含 SEA-Guard,一個專為東南亞地區設計、具備文化敏感性診斷測試的安全模型。
  • 區域基準測試: 使用 SEA-HELM 和 SEA-BED 進行評估,確保在區域語言與語境中的高性能量表現。
  • 開源精神: 提供預訓練與微調資料、訓練程式碼以及評估基準的開放存取。

相關