Falcon 2 11B 发布说明

TII 已推出 Falcon 2,这是一代新型开源模型,具备 11B 参数的大型语言模型(LLM)和相应的视觉语言模型(VLM)。这些模型旨在为社区提供更小、更高效的模型,降低推理成本,同时在多语言和多模态方面保持高性能。

Falcon2-11B LLM 技术规格

Falcon2-11B 是一个预训练语言模型,使用超过 5 万亿标记的 RefinedWeb 数据进行训练,并辅以包括技术数据、代码和对话数据在内的精选语料库。

训练策略与数据

该模型采用四阶段策略进行训练,以逐步增加上下文长度并提升性能:

阶段 上下文长度 标记 (GT)
Stage 1 2048 4500
Stage 2 4096 250
Stage 3 8192 250
Stage 4 8192 500

数据来源包括 RefinedWeb-English 和 RefinedWeb-Europe,覆盖十种语言:捷克语 (cs)、德语 (de)、西班牙语 (es)、法语 (fr)、意大利语 (it)、荷兰语 (nl)、波兰语 (pl)、葡萄牙语 (pt)、罗马尼亚语 (ro) 和瑞典语 (sv)。

模型架构与训练流程

Falcon2-11B 使用基于 Transformer 的架构,具体规格如下:

  • Transformer 块: 60
  • 查询头: 32
  • 键/值头: 8
  • 头维度: 128
  • 并行注意力:
  • MLP 放大因子: 4

训练在 1,024 块 A100 40GB GPU 上进行,采用 3D 并行策略(TP=8,PP=1,DP=128)、ZeRO 和 Flash-Attention 2。模型使用 bfloat16 精度,并在第一阶段采用 AdamW 优化器和余弦衰减学习率调度。

Falcon2-11B LLM 性能评估

Falcon2-11B 在与更大模型以及其他 7B-11B 级别模型的比较中表现出竞争力。

英文及通用基准

在 Open LLM Leaderboard 任务中,Falcon2-11B 获得了 64.28 的平均得分,与 Gemma-7B(64.29)持平,并优于 Llama3-8B(62.38)和 Mistral-7B(60.97)。值得注意的是,零-shot 评估表明,尽管 Falcon2-11B 体积仅为 Falcon-40B 的四分之一,但其性能与体积更大的 Falcon-40B 相近。

多语言与编码能力

Falcon2-11B 在六种测试语言(德语、西班牙语、法语、意大利语、荷兰语和罗马尼亚语)上超越了 Falcon-40B 以及其他多语言模型。在代码生成方面,该模型在 HumanEval 基准的 Python 任务中通过率(pass@1)达到 29.59%,该数据来源于 BigCode Leaderboard。

Falcon2-11B 视觉语言模型(VLM)

Falcon2-11B VLM 将 LLM 的能力扩展至图像理解,使用户能够就视觉内容进行基于文本的聊天。

架构与训练

该 VLM 将预训练的 CLIP ViT-L/14 视觉编码器与经过聊天微调的 Falcon2-11B 模型相结合。为提升对小物体和细粒度细节的感知,它采用类似 LLaVA-Next 的动态高分辨率编码机制。

训练分为两个阶段:

  1. 预训练: LLM 和视觉编码器保持冻结,仅在 558K 图像-字幕对上训练多模态投影器,以将视觉嵌入映射到文本空间。
  2. 微调: 投影器和 LLM 权重在 1.2M 图像-文本指令数据上进行训练,包括多轮对话。

VLM 评估

Falcon2-11B VLM 在多个视觉基准上表现出色,平均得分为 74.4,超过 LLaVA-1.6(Vicuna-7B)的 72.1 和 LLaVA-1.6(Mistral-7B)的 73.3。

模型 MME GQA SQA POPE VQAv2 TextVQA MM-Bench SEED-IMG 平均
Falcon2-11B VLM 1589/343 64.5 74.9 88.4 82.1 66.7 72.0 72.3 74.4
LLaVA-1.6 (Vicuna-7B) 1519/332 64.2 70.1 86.5 81.8 64.9 67.4 70.2 72.1
LLaVA-1.6 (Vicuna-13B) 1575/326 65.4 73.6 86.2 82.8 67.1 70.0 71.9 73.8

许可

Falcon 2 模型在 TII Falcon 2 许可证下发布,这是一种基于 Apache 2.0 的宽松许可证,包含可接受使用政策,以确保负责任的 AI 部署。

Sources