Subquadratic 与 1200 万 Token 上下文窗口的追求

大语言模型 (LLM) 的格局长期以来一直由与“上下文窗口”的斗争所定义——即模型在单个提示词中能够处理的信息量限制。虽然行业领导者已将这些限制推向了 100 万或 200 万 token,但一个新进者 Subquadratic 声称已通过 1200 万 token 的窗口打破了这一天花板。

这一飞跃代表了 AI 处理海量数据集方式的潜在范式转移,允许在无需进行激进的 RAG (Retrieval-Augmented Generation) 或复杂的切片策略的情况下,摄取整个代码库、数千页文档或详尽的法律档案。

Subquadratic 的承诺

Subquadratic 的核心价值主张是在巨大的 12M token 跨度内保持连贯性和检索准确性。在实际应用中,这将允许开发者将整个企业级规模的项目输入模型,使 AI 能够理解深层的架构依赖关系,而这些关系在较小的窗口或碎片化的检索方法中往往会丢失。

对许多人来说,这被视为 AI 数据压缩和处理领域的一次根本性演进。正如一位观察者所指出的,这种突破的影响可以与图像领域引入 JPG 格式相提并论——一种在不牺牲输出的基本效用的情况下,更高效地处理海量数据的方法。

技术怀疑论与“黑盒”问题

尽管有雄心勃勃的声明,技术社区仍然保持谨慎。主要的争议点在于缺乏正式的技术报告、白皮书或开源权重。在 AI 研究领域,这种规模的声明通常会伴随着“大海捞针”测试或对实现亚二次方缩放的注意力机制的详细解释。

Hacker News 上的社区成员表达了显著的怀疑态度,几位用户表示,只有在发布模型卡片或经过同行评审的论文后,他们才会相信这些声明。缺乏透明度通常归因于风险投资支持的初创公司性质,在这些公司中,专有优势被严密守护以维持投资估值。

对底层架构的推测

虽然 Subquadratic 尚未披露其方法论,但专家推测该技术可能依赖于先进的注意力机制。一种理论认为,它使用了具有基于内容的粒度的原生稀疏注意力,类似于在 DeepSeek 架构中看到的方案。通过避免标准自注意力机制的二次方成本——即计算需求随序列长度呈指数级增长——Subquadratic 可能正在利用线性或对数缩放方法来处理 12M token 的负载。

海量上下文的实用性

除了技术可行性之外,对于大多数用例而言,12M token 窗口是否真的必要,也存在争议。例如,Claude Code 等工具的用户指出,100 万 token 对于大多数编码任务通常已经足够。

这为 LLM 设计的未来提出了一个关键问题:目标是无限扩大上下文窗口,还是提高模型管理该上下文的效率?海量窗口的潜在替代方案包括:

  • Context Compaction: 总结之前的交互以节省空间。
  • Memory Tools: 实现模型可以动态查询的外部数据库。
  • Dynamic Windowing: 根据任务的复杂性调整上下文大小。

结论

Subquadratic 声称拥有 1200 万 token 窗口是一个大胆的断言,这可能会重新定义 AI 记忆的边界。然而,直到该公司超越营销声明并为其成就提供技术基础,它仍然是一个推测性的里程碑。企业专有秘密与科学验证的需求之间的紧张关系,继续成为当前 AI 军备竞赛的一个定义性特征。

Sources