aisingapore/sealion
South-East Asia Large Language Models
解決的問題
SEA-LION 解決了大型語言模型中東南亞(SEA)語言與文化代表性不足的問題。它提供了一組開源模型,旨在更好地理解區域多樣性,服務於東南亞地區代表性不足的人群與低資源語言。
如何運作
該項目在不同模型版本中採用多種訓練策略以實現區域專化:
- 從零開始預訓練: 在 v1 中使用,用於建構基礎的區域知識。
- 持續預訓練(CPT): 在 v2、v3 和 v4 中使用,用於將現有的開源基礎模型(如 Llama 和 Gemma)適配至東南亞地區。
- 監督微調(SFT): 用於創建指令、推理與多模態版本的模型。
- 知識蒸餾與模型合併: 在 v4.5 中使用,以實現高容量推理與代理工具使用能力。
適用對象
需要在文化與語言上貼合東南亞的 LLM 的開發者與研究人員,以及尋求用於檢索、推理與多模態任務的開源區域模型的使用者。
主要亮點
- 多樣化的模型家族: 包括文字型 LLM、最大支援 256K 上下文視窗的多模態 VLM(視覺-語言模型),以及用於區域檢索的專用嵌入模型。
- 區域安全層: 包含 SEA-Guard,一個專為東南亞地區設計、具備文化敏感性診斷測試的安全模型。
- 區域基準測試: 使用 SEA-HELM 和 SEA-BED 進行評估,確保在區域語言與語境中的高性能量表現。
- 開源精神: 提供預訓練與微調資料、訓練程式碼以及評估基準的開放存取。
相關
- 專案
- Dispatch
- 專案
- Dispatch
- Dispatch