Sovereign AI: Norway's Ambition to Build a National Language Model

인공지능을 향한 탐구는 종종 소수의 글로벌 기술 거물들 사이의 경쟁으로 묘사됩니다. 하지만 다른 종류의 경쟁이 나타나고 있습니다. 바로 "sovereign AI"의 추구입니다. 노르웨이는 현재 이 움직임의 최전선에 있으며, 국립 도서관(Nasjonlbiblioteket)은 노르웨이어, 역사, 문화를 이해하고 반영하도록 특별히 설계된 대규모 언어 모델(LLM)을 구축하는 거대한 과업을 수행하고 있습니다.

이 이니셔티브는 전 세계적으로 학습된 영어 중심 모델이 한 국가의 유산을 진정으로 대표하는 데 필요한 미묘한 차이를 결여하고 있다는 근본적인 믿음에 의해 추진됩니다. 도서관의 IT 플랫폼 책임자인 Marius Husnes는 sovereign LLM이 없는 국가는 일반 목적의 모델이 현지 언어에 기술된 문화적 맥락을 완전히 포착할 수 없기 때문에 불리한 위치에 처하게 된다고 주장합니다.

The Data Engine: From Archive to Pipeline

sovereign LLM을 구축하는 데는 단순한 컴퓨팅 파워 이상의 것이 필요합니다. 즉, 큐레이션된 고품질 데이터셋이 필요합니다. 노르웨이 국립 도서관은 국가 최대 규모의 도서, 신문, 웹 페이지 디지털 컬렉션을 보유하고 있어 이 작업에 독보적인 위치를 점하고 있습니다. 2005년부터 도서관은 20 PB의 고유 데이터를 축적해 왔으며, 이는 중복 방지를 위한 3-2-1 형식으로 저장되어 있습니다(총 60 PB의 저장 공간).

하지만 이 데이터를 보존용 아카이브에서 학습용 파이프라인으로 이동시키는 것은 상당한 엔지니어링 과제를 제시합니다. 도서관의 보존 시스템은 내구성과 비용에 최적화되어 있어 읽기 지연 시간이 높고 드문 액세스에 적합하도록 설계되었습니다. 반면, AI 학습에는 높은 처리량과 낮은 지연 시간의 병렬 데이터 I/O가 필요합니다.

이 격차를 메우기 위해 도서관은 2단계 처리 아키텍처를 구현했습니다:

  1. The AI Data Pipeline: 여러 대의 Huawei OceanStor Dorado all-flash arrays(총 2 PB의 플래시 용량)를 활용하여 데이터 수집, 정제, 중복 제거, 형식 정규화 및 검증을 위한 저지연 환경을 구축했습니다.
  2. The Training Cluster: 준비가 완료되면 데이터는 노르웨이의 국가 슈퍼컴퓨터인 Sigma2 Olivia 시스템으로 이동됩니다. 이 HPE Cray Supercomputing EX 시스템은 448개의 GPU와 64,512개의 CPU 코어를 갖추고 있으며, 5.3 PB Cray ClusterStor E1000 저장 시스템의 지원을 받습니다.

The Challenges of National AI

하드웨어 외에도, 이 프로젝트는 국가 모델 개발에 있어 몇 가지 중대한 장애물을 강조했습니다:

  • Evaluation: sovereign Norwegian LLM을 평가할 산업 표준 도구가 없습니다. 두 가지 표기법, 다양한 방언, 역사적 진화 등 언어의 복잡성으로 인해 팀은 자체적인 평가 도구를 처음부터 구축해야 합니다.
  • Governance: 이 프로젝트는 모델에 대한 접근 권한을 누가 통제하고 누가 허용 가능한 사용 범위를 결정할지라는 중요한 정치적 및 제도적 질문을을 던집니다.
  • Orchestration: 보존용 아카이브, 온프레미스 AI 환경, 국가 슈퍼컴퓨터라는 세 개의 서로 다른 시스템 간의 데이터 흐름을 조정하는 것은 여전히 진행 중인 기술적 과제입니다.

Critical Perspectives and Counterpoints

이 프로젝트는 기술적 관찰자들 사이에서, 특히 접근 방식의 필요성과 효율성에 관해 상당한 논쟁을 불러일으켰습니다.

Is a Sovereign Model Necessary?

일부 비판론자들은 글로벌 제공업체의 프론티어 모델들이 이미 방대한 양의 다국어 데이터를 학습하여, 전용 국가 모델이 불필요하다고 주장합니다. 다른 이들은 모델을 처음부터 구축하는 대신, 노르웨이의 역할이 고품질 학습 데이터셋을 구축하고 이를 글로벌 모델 제작자들과 공유하여 기존 프론티어 프론티어 모델 내에서의 노르웨이어의 대표성을 개선하는 데 집중해야 한다고 제안합니다.

Hardware and Resource Concerns

기술적 회의론자들은 할당된 하드웨어(특히 Olivia 시스템의 448개 GPU)가 진정으로 경쟁력 있는 완전한 LLM을 처음부터 학습시키기에 충분한지, 아니면 프로젝트가 실제로는 기존 오픈 소스 모델에 대한 미세 조정(LoRA)을 수행하고 있는 것인지 의문을 제기합니다. 또한 2 PB 플래시 저장 공간의 규모에 대해서도 논쟁이 있습니다. 일부는 현대적인 데이터 축적 기준에 따르면 규모가가 미미하다고 주장하는 반면, 다른 이들은 LLM 체크포인팅에 사용되는 고성능 NVMe 플래시의 경우 상당한 규모의 배포라고 언급합니다.

The Geopolitical Dimension

유럽 공공 부문 프로젝트에서 Huawei 저장 장치를 사용하는 것은 서구 인프라 내의 중국 하드웨어에 대한 지정학적 긴장과 제한 사항을 고려할 때 눈길을 끌었습니다. 하지만 일부 관찰자들은 노르웨이가 비 EU 회원국이라는 지점이 조모품 조달 선택에 있어 더 많은 유연성을 제공한다고 언급합니다.

Conclusion: AI as Cultural Custodianship

노르웨이의 실험은 단순한 기술적 연습이 아닙니다. 이는 한 국가가 AI 시대에 지적 및 문화적 주권을권을지를 유지할 수 있는지에 대한 테스트입니다. Husnes는 "AI에는 구축자뿐만 아니라 관리자가 필요합니다"라고 말합니다. 이 프로젝트가 유용한 도구를 만드는 데 성공하거나 sovereign AI의 비용에 대한 경고 사례가 될지라도, 이종의써블루프린트(blueprint)를 타국가(타국가)의 동일한 딜레마에 직면한 비영어권 국가들에게 제공합니다: 어떻게 하면 그들의 언어와 역사가 소수 글로벌 기업의 알고리즘에 의해 삭제되거나 희석되지 않도록 보장할 수 있을지에 대한 청사진사진을 제공합니다.

Sources