主权 AI:挪威构建国家语言模型的雄心
人工智能的追求通常被描述为少数全球科技巨头之间的竞赛。然而,另一种竞赛正在兴起:对“主权 AI”的追求。挪威目前正处于这一运动的前沿,其国家图书馆(Nasjonlbiblioteket)正在承担一项艰巨的任务,即构建一个专门设计用于理解和反映挪威语言、历史和文化的超大规模语言模型(LLM)。
这一倡议源于一种根本性的信念,即全球训练的、以英语为中心的模型缺乏真正代表一个国家遗产所需的细微差别。正如图书馆 IT 平台负责人 Marius Husnes 所言,任何没有主权 LLM 的国家都处于劣势,因为通用模型无法完全捕捉当地语言中所描述的文化背景。
数据引擎:从存档到流水线
构建主权 LLM 不仅仅需要算力;它还需要经过策划的高质量数据集。挪威国家图书馆在此项任务中具有独特的优势,它拥有该国最大的书籍、报纸和网页数字收藏。自 2005 年以来,图书馆已积累了 20 PB 的独特数据,以冗余的 3-2-1 格式存储(总存储量为 60 PB)。
然而,将这些数据从保存存档转移到训练流水线面临着重大的工程挑战。图书馆的保存系统针对耐用性和成本进行了优化,这意味着它的读取延迟很高,且设计初衷是低频访问。相比之下,AI 训练需要高吞吐量、低延迟的并行数据 I/O。
为了弥补这一差距,图书馆实施了两个阶段的处理架构:
- AI 数据流水线: 利用总计 2 PB 闪存容量的多个 Huawei OceanStor Dorado 全闪存阵列,图书馆为数据摄取、清洗、去重、格式标准化和验证创建了一个低延迟环境。
- 训练集群: 数据准备就绪后,将被转移到挪威国家超级计算机 Sigma2 Olivia 系统。该 HPE Cray Supercomputing EX 系统配备了 448 个 GPU 和 64,512 个 CPU 核心,并由一个 5.3 PB 的 Cray ClusterStor E1000 存储系统提供支持。
国家级 AI 的挑战
除了硬件之外,该项目还凸显了在开发国家级模型时面临的几个非平凡的障碍:
- 评估: 目前还没有行业标准工具来评估主权挪威 LLM。该语言的复杂性——包括两种书写形式、各种方言和历史演变——要求团队必须从头开始构建自己的评估工具。
- 治理: 该项目引发了关于谁控制模型访问权限以及谁决定其允许用途的关键政治和制度问题。
- 编排: 在三个不同的系统——保存存档、本地 AI 环境和国家超级计算机——之间协调数据流,仍然是一个持续的技术挑战。
批判性视角与反论点
该项目在技术观察者中引发了重大辩论,特别是关于该方法的必要性和效率问题。
主权模型是否有必要?
一些批评者认为,全球供应商的前沿模型已经使用海量多语言数据进行训练,这使得专门的国家级模型显得多余。其他人则建议,与其从头开始构建模型,挪威应该专注于创建高质量的训练数据集,并与全球模型构建者共享这些数据,以提高现有前沿模型中挪威文化的代表性。
硬件与资源担忧
技术怀疑论者质疑,分配的硬件——特别是 Olivia 系统上的 448 个 GPU——是否足以从头开始训练一个真正具有竞争力的、功能完备的 LLM,或者该项目实际上是在对现有开源模型进行微调(LoRA)。此外,关于 2 PB 闪存存储的规模也有争议,有人认为按现代数据囤积标准来看这并不算大,而其他人则指出,对于用于 LLM 检查点(checkpointing)的高性能 NVMe 闪存而言,这是一个重大的部署。
地缘政治维度
在欧洲公共部门项目中应用 Huawei 存储也引起了关注,考虑到围绕中国硬件在西方基础设施中的地缘政治紧张局势和限制。然而,正如一些观察者所言,挪威的地位使其在采购选择上具有更多的灵活性。
结论:AI 作为文化守护者
挪威的实验不仅仅是一次技术练习;它是在 AI 时代一个国家能否保持其智力和文化主权测试。正如 Husnes 所言,“AI 需要守护者,而不仅仅是构建者。”无论该项目成功创建了一个实用的工具,还是作为一个关于主权 AI 成本的警示案例,它都为其他面临同样困境的国家提供了蓝图:如何确保其语言和历史不被少数几家全球性企业的算法所抹除或稀释。