Falcon-H1-Arabic 发布说明
Hugging Face 推出了 Falcon-H1-Arabic,这是一系列三种先进的阿拉伯语语言模型(3B、7B 和 34B 参数),它们利用混合 Mamba-Transformer 架构在阿拉伯语自然语言处理中实现了最先进的性能。此版本显著扩展了上下文能力,并相比之前的版本提升了方言理解和推理。
混合 Mamba-Transformer 架构
Falcon-H1-Arabic 构建在 Falcon-H1 混合架构之上,该架构在每个块内并行集成了状态空间模型(Mamba)和 Transformer 注意力。两个组件的表示在块的输出投影之前融合。
此设计将 Mamba 在长序列上的线性时间可扩展性与注意力的精确长程建模相结合。对于阿拉伯语,此架构在扩展文本中提升了连贯性和推理能力,以适应其丰富的形态学和灵活的句子结构。
扩展上下文窗口
Falcon-H1-Arabic 大幅提升上下文限制,以支持对海量文档的分析,例如法律记录或技术文档。这些模型经过特定的后训练,以减轻“中间丢失”挑战,确保充分利用完整的上下文范围。
| 参数 | 上下文窗口 | 理想用途 |
|---|---|---|
| 3B | 128K tokens | 快速代理,高 QPS 系统,轻量级分析 |
| 7B | 256K tokens | 生产助手,推理,企业聊天 |
| 34B | 256K tokens | 长文档分析,研究,高风险任务 |
数据管道和方言多样性
这些模型在大约 3000 亿个 token 上进行训练,由阿拉伯语、英语和多语言内容几乎等比例混合而成,以保持全球推理和 STEM 能力。
数据管道的主要改进包括:
- 深度语言分析: 团队用多阶段质量过滤过程替换了启发式过滤,该过程针对阿拉伯语的正字法、形态学、变音符号和句法模式进行了定制。
- 方言覆盖: 数据集扩展以包含更广泛的真实世界阿拉伯语,包括埃及、黎凡特、海湾和马格里布方言,从而减少了对现代标准阿拉伯语(MSA)的不成比例依赖。
后训练和对齐
Falcon-H1-Arabic 经历两阶段后训练过程,以在不损害核心能力的前提下提升其能力:
- 监督微调(SFT): 模型暴露于高质量的阿拉伯语指令和精心策划的长上下文示例中,以学习遵循指令并在提供的信息基础上生成响应。
- 直接偏好优化(DPO): 此阶段优化对齐和对话质量,减少诸如漂移或在对话中忽略早期信息等失败模式。
基准性能
Falcon-H1-Arabic 在多个关键基准上实现了最先进的结果,通常优于规模显著更大的模型。
开放阿拉伯语 LLM 排行榜 (OALL)
- 3B 模型: 达到大约 62%,比 Gemma-4B、Qwen3-4B 和 Phi-4-mini 等小规模模型高出约十个百分点。
- 7B 模型: 得分 71.7%,超越约 10B 规模的模型,包括 Fanar-9B 和 Qwen3-8B。
- 34B 模型: 达到大约 75%,超越更大的系统,如 Llama-3.3-70B 和 AceGPT2-32B。
专项基准
- 3LM(STEM): 34B 模型在原生分割上达到大约 96%,在合成分割上达到大约 94%。
- ArabCulture: 34B 模型得分接近 80%。
- AraDice(方言): 34B 模型在各种方言上达到大约 53。
部署场景
- 3B 模型: 针对边缘部署、实时应用以及在延迟和成本至关重要的代理系统进行了优化。
- 7B 模型: 设计为生产聊天机器人、摘要管道和内容生成的通用工作马。
- 34B 模型: 面向需要最高精度和长程推理的高风险领域,例如医学摘要和法律分析。