开源 AI 与全球数字主权之路
开源 AI 是实现全球主权的必然选择
开源 AI 是实现全球 AI 主权、文化多样性和长期安全的唯一可行路径,因为对于大多数国家和公司而言,专有系统过于昂贵且控制过于中心化。如果数字信息的调解由美国和中国大型科技公司的少数几个专有系统主导,将对民主、人权以及语言和文化多样性构成重大风险。
大多数国家缺乏独立构建前沿规模大语言模型 (LLMs) 的财力和技术人才。一个共享、协作的开源平台允许这些国家为全球系统做出贡献并从中受益,防止它们仅仅成为 AI 技术的使用者。
Project Tapestry 与联邦训练
Project Tapestry 是一个自下而上的合作伙伴联盟,旨在训练一个全球 AI 模型,同时保留数据主权。参与者不是分享原始数据,而是通过交换参数向量来为模型的训练做出贡献。
Project Tapestry 的关键特征包括:
- 开源协作:该项目托管在 GitHub 上,允许训练 LLMs 的专家进行协作,而无需正式授权。
- 联邦方法:它使各地区、学术机构和国家能够将其自身的文化材料数字化,并为全球人类知识库做出贡献,而不会损害数据隐私。
- 时间线:该项目目标是在 2027 年初进入生产阶段。
- 广泛支持:印度、日本、韩国、阿联酋、哈萨克斯坦、越南、英国、瑞士以及各种欧洲国家,以及 NVIDIA、AMD、Intel 和 IBM 等行业领导者,都已表现出早期兴趣。
开源 AI 的经济学逻辑
专有前沿规模模型目前在经济上是不可持续的的。为高级用户提供服务的成本往往远超订阅收入;例如,一个每月支付 200 美元的用户,为之提供服务的成本可能约为 15,000 美元。这种差距目前由投资者补贴,但长期可行性需要要么大幅提高价格,要么大幅降低推理成本。
对于发展中经济体,高端模型通常是不必要的。许多关键应用——例如为印度农民诊断作物病害的 AI 助手——可以由在本地运行的小型、高效模型驱动。只有当推理成本降低 20 到 100 倍时,这些应用才变得可行,而这一目标通过开源模型和通用硬件更容易实现。
挑战“生存风险”论调
关于 AI 本质上具有危险性、应当限制其以防止“坏人”制造生物武器或发起网络攻击的论点,往往被夸大了,并且类似于“中世纪的蒙昧主义”。
- 生物武器:制造生物武器的瓶颈不在于“配方”(这相对容易找到),而在于物理构建的巨大复杂性。
- 网络安全:开源 AI 提供了与攻击性能力相对应的防御能力,允许用户检测并加固其自身的系统弱点。
- 民主:基于推测性的威胁而限制 AI 的访问权限,被认为比技术本身的开放性对民主和人类文化构成的危险更大。
开源平台的历史先例
向开源 AI 的转变被视为是不可避免的,遵循了以往技术栈的轨迹。在 20 世纪 90 年代后期,互联网服务依赖于 Sun Microsystems、Dell 和 HP 等公司的专有硬件和软件。到 21 世纪初,这被通用硬件和开源软件栈所取代。同样,现代移动网络也严重依赖开源操作系统和软件栈。市场始终倾向于开源平台,因为它们它们更便宜、更安全,且更容易针对隐私进行本地化。