aisingapore/sealion

South-East Asia Large Language Models

解决的问题

SEA-LION 解决了大型语言模型中东南亚(SEA)语言和文化代表性不足的问题。它提供了一组开源模型,旨在更好地理解区域多样性,服务于东南亚地区代表性不足的人群和低资源语言。

如何工作

该项目在不同模型版本中采用多种训练策略以实现区域专业化:

  • 从零开始预训练: 在 v1 中使用,用于构建基础的区域知识。
  • 持续预训练(CPT): 在 v2、v3 和 v4 中使用,用于将现有的开源基础模型(如 Llama 和 Gemma)适配到东南亚地区。
  • 监督微调(SFT): 用于创建指令、推理和多模态版本的模型。
  • 知识蒸馏与模型合并: 在 v4.5 中使用,以实现高容量推理和代理工具使用能力。

适用人群

需要在文化与语言上贴合东南亚的 LLM 的开发者和研究人员,以及寻求用于检索、推理和多模态任务的开源区域模型的用户。

主要亮点

  • 多样化的模型家族: 包括文本型 LLM、最大支持 256K 上下文窗口的多模态 VLM(视觉-语言模型),以及用于区域检索的专用嵌入模型。
  • 区域安全层: 包含 SEA-Guard,一个专为东南亚地区设计、具备文化敏感性诊断测试的安全模型。
  • 区域基准测试: 使用 SEA-HELM 和 SEA-BED 进行评估,确保在区域语言和语境中的高性能表现。
  • 开源精神: 提供预训练和微调数据、训练代码以及评估基准的开放访问。

相关