GPT-NL:荷蘭的主權語言模型
GPT-NL 透過主權 AI 生態系統建立荷蘭的數位自主性
GPT-NL 是由 TNO 與 SURF 以及荷蘭法醫研究所 (NFI) 合作開發的獨立荷蘭語言模型與生態系統。該計畫旨在透過建立具備完善治理、透明度以及對公共價值承諾的模型,減少對非歐洲 AI 供應商的依賴,確保荷蘭能掌控其 AI 基礎設施的技術、資料與倫理決策。
核心原則與治理
GPT-NL 以四項核心價值為設計基礎,確保模型可信且符合社會目標:
主權與控制
GPT-NL 在荷蘭與歐洲境內開發,提供對模型及其訓練資料的完整控制。此做法旨在使 AI 生態系統符合歐洲法律與社會目標,避免依賴外部供應商。
透明與開放
本計畫透過多項機制,強調從資料來源到模型的全程可見性:
- Open Source Code(開源程式碼):原始程式碼以開源方式發布。
- Dataset Insights(資料集洞見):訓練資料集的詳細資訊公開分享。
- Controlled Licensing(受控授權):模型權重以受控授權提供,以追蹤使用情況並管理更新或資料退出。
- Documentation(文件說明):所有關於資料收集、訓練以及偏見與倫理風險緩解的決策皆有清楚文件記錄。
可信度與資料完整性
為消除資料來源不明或侵犯版權的風險,GPT-NL 完全從頭訓練。資料收集過程遵循嚴格標準:
- 在訓練前進行匿名化與個人資料移除。
- 排除機密或有害內容。
- 保護智慧財產權。
- 防止資料集內的資料重複。
互惠與公平價值
GPT-NL 建立合法的資料供應鏈,透過內容委員會讓資料提供者與權利持有人積極參與。此模式確保部分收益回流給創作者,從價值抽取模式轉變為價值分享模式。
資源效率與公共資金
環境永續性
鑑於大型語言模型開發所需的高能源與用水量,該計畫聚焦於根據科學研究優化模型規模與訓練流程,以降低生態足跡。
財務支持
此計畫由荷蘭企業署 (RVO) 代表經濟事務與氣候政策部以公共資金支持,總撥款為 1350 萬歐元。
技術與策略批評
雖然計畫強調主權,但在技術社群中對其可行性與策略方向仍持懷疑態度。主要討論點包括:
預算與能力疑慮
批評者質疑 1350 萬歐元的預算是否足以從頭打造具競爭力的模型,有人認為此資金水平僅能達到類似 GPT-2 等較舊模型的能力。
主權與開源策略比較
部分觀察者認為真正的主權應聚焦於基礎設施(運算發生之處),而非模型架構。建議包括:
- 在現有高效能開放權重基線(如 Qwen 或 Kimi)之上構建,並針對特定代理功能進行微調。
- 在歐洲層面合作,而非各自為政,以達成規模法則所需的規模。
經濟與法規障礙
討論指出歐洲的法規目標(如 EU AI 法案)與 AI 開發的經濟現實之間存在落差。部分人士認為歐洲缺乏美國與中國的創投資金與「緊迫感」,可能阻礙主權模型與前沿模型的競爭力。
"我不斷看到這些「主權」語言模型……與其在「主權」聲稱上燒錢,國家研究實驗室應該專注於在穩固的基線上構建……並微調具備真實代理功能的前沿模型。"
"在我看來,收益分享模式比它是荷蘭的事更有趣。資料的使用與與資料提供者共享,是這些模型創建的固有部分,但卻未被充分討論。"