Falcon-Arabic:阿拉伯语语言模型的突破

技术创新研究所(TII)推出了 Falcon-Arabic,这是一款拥有 7B 参数的语言模型,为阿拉伯语自然语言处理(NLP)树立了新的性能基准。通过适配 Falcon 3 架构,该模型在阿拉伯语语法、数学推理和方言理解方面提供了最先进的能力,性能超越了规模高达四倍的模型。

技术架构与训练方案

Falcon-Arabic 是通过适配 Falcon 3-7B 多语言基础模型而非从头训练而开发的。之所以选择这种方法,是因为适配和多语言模型在 Open Arabic LLM Leaderboard 上始终表现出更高的效率和能力。

分词器和嵌入适配

由于 Falcon 3-7B 在分词器和嵌入层面缺乏原生阿拉伯语支持,TII 实施了两项主要修改:

  • 词汇扩展:在分词器中新增了 32,000 个阿拉伯语专用 token。
  • 基于相似性的初始化:采用一种基于文本相似性的全新嵌入初始化策略,将新阿拉伯语 token 映射到现有词汇表中语义相关的嵌入。这使模型能够继承先前关于推理模式和抽象概念的知识。

预训练课程

该模型使用 100% 原生阿拉伯语数据集进行持续预训练,以避免机器翻译内容常带来的文化偏见。训练遵循多阶段课程:

  1. 初始阶段:聚焦通用知识和方言丰富的阿拉伯语内容,以稳定模型。
  2. 后期阶段:强调数学推理、编码以及复杂问题求解。

性能基准

Falcon-Arabic 使用 OALL v2(Open Arabic LLM Leaderboard)进行评估,该基准包括六个多项选择任务(Arabic MMLU 原生与翻译、Arabic Exams、Alghafa、MadinahQA 和 Aratrust)以及一个生成式基准(Alrage)。

基础模型性能

Falcon-Arabic-7B-Base 在多个关键基准上领先,包括 Arabic MMLU、Exams、MadinahQA 和 Aratrust。它超越了同尺寸类别中所有现有的阿拉伯语 LLM,并且性能超过了规模高达四倍的模型。

指令模型性能

在预训练之后,模型经过后训练对齐,生成了 Falcon-Arabic-7B-Instruct。该过程包括:

  • 监督微调(SFT):使用高质量公共数据集和内部收集的原生阿拉伯语指令数据。
  • 直接偏好优化(DPO):一种强化学习方法,用于将输出对齐至人类在安全性、相关性和有用性方面的偏好。

Falcon-Arabic Instruct 在其尺寸类别中超越所有其他指令对齐的阿拉伯语 LLM,并且在指令遵循和开放式对话方面的性能超过了显著更大的模型。

能力与应用

Falcon-Arabic 支持 32,000 token 的上下文长度,适用于知识密集型任务和长文档处理。关键能力包括:

  • 检索增强生成(RAG):处理长上下文以提供有依据的答案。
  • 多语言能力:支持阿拉伯语、英语以及其他多种语言。
  • 方言理解:能够流利使用现代标准阿拉伯语(MSA)和多种地区方言。
  • 零样本翻译:尽管未专门微调,该模型仍展现出强大的机器翻译能力。

局限性

Falcon-Arabic 仍然受到常见 LLM 局限的影响,包括:

  • 幻觉:可能生成看似合理但实际上错误的信息。
  • 提示敏感性:性能会因提示的表述方式而变化。
  • 上下文长度:在处理极长上下文时性能会有所波动。

Sources