GPU 经济:AI 推理计算、Groq‑Nvidia 合作伙伴关系以及 AI 超级周期
AI 超级周期造成计算瓶颈
AI 推理不再是近乎零的边际成本;每增加一位用户都会消耗大量计算资源,使得计算成为 AI 超级周期的限制因素。
Groq 的确定性 SRAM 架构提升了令牌效率
Grock 芯片采用数据流设计,配有一个编译器,预先确定每次计算的位置,提供丰富的 SRAM 带宽和确定性执行,这与依赖大规模计算阵列和较慢 HBM 内存的 GPU 根本不同。
拆分 prefill 和 decode 可解锁更多收益
通过将推理拆分为 prefill 和 decode 阶段,然后进一步将 decode 拆分为计算密集型和内存带宽密集型函数,Groq 可以将每个函数分配给最适合的硬件。
Groq‑Nvidia NVLink Fusion 合作伙伴关系产出 2.5× 更多令牌
将 Groq 芯片通过 NVLink Fusion 连接到 Nvidia GPU,使得组合系统在完全相同的功耗下能够产出两倍半更多的令牌,这一成果在 Nvidia 以 200 亿美元收购 Groq 时得到验证。
推理成本急剧下降而 AI 价值飙升
过去一年推理成本下降了约 90%,而在过去两年半下降了接近 99%,但为智能支付的意愿增长速度远快于此,将 OpenAI 和 Anthropic 之前的负毛利转变为强劲的正毛利。
代理工作负载和令牌消耗激增
推理模型和 AI 代理以抛物线速度消耗令牌,全球令牌使用量如今达到每周数万亿,推动对越来越多计算基础设施的需求。
基础设施扩容跟上需求
Anthropic 和 OpenAI 今年新增的计算资源超过过去十年所有实验室的总和,并且他们计划在明年再翻倍,这反映了 AI 基础设施的抛物线式扩张。
需要社会防护和广泛所有权
随着 AI 接近其指数增长曲线的末尾,由此产生的丰富将需要新的社会契约;Brad Gerstner 的 Invest America 提案旨在让每个孩子在经济中拥有所有权份额,以应对分配挑战。
Jensen 的 100× 挑战推动持续创新
Nvidia 的领导层推动团队在整个栈上实现 100× 的改进,使得源自 Groq 的团队能够尝试作为独立初创公司不可能完成的壮举,并确保芯片设计和系统集成的快速进展.