GPU 經濟:AI 推理運算、Groq‑Nvidia 合作夥伴關係與 AI 超級週期

GPU 經濟:AI 推理運算、Groq‑Nvidia 合作夥伴關係與 AI 超級週期

AI 超級週期創造運算瓶頸

AI 推理不再是近乎零的邊際成本;每增加一位使用者會消耗大量運算資源,使運算成為 AI 超級週期的限制因素。

Groq 的確定性 SRAM 架構提升 token 效率

Grock 晶片採用資料流設計,配合編譯器預先決定每次計算的位置,提供豐富的 SRAM 頻寬與確定性執行,這與依賴大型運算陣列及較慢 HBM 記憶體的 GPU 有根本不同。

拆分 Prefill 與 Decode 可進一步提升收益

透過將推理分割為 prefill 與 decode 階段,並進一步將 decode 拆分為計算密集型與記憶體頻寬密集型函式,Groq 能將每個函式分配給最適合的硬體。

Groq‑Nvidia NVLink Fusion 合作產出 2.5× 更多 token

透過 NVLink Fusion 將 Groq 晶片連接至 Nvidia GPU,使合併系統在相同功耗下能產出兩倍半的 token,這項成果在 Nvidia 以 200 億美元收購 Groq 時得到驗證。

推理成本驟降而 AI 價值飆升

過去一年推理成本已下降約 90 %,過去兩年半則接近 99 %,但為智慧付費的意願增長速度遠快於此,使得 OpenAI 與 Anthropic 先前的負毛利率轉為強勁的正毛利率。

代理工作負載與 token 消耗爆發式成長

推理模型與 AI 代理以拋物線速度消耗 token,全球 token 使用量目前已達到每週數十兆,推動對更多運算基礎設施的需求。

基礎設施擴充步調與需求同步

Anthropic 與 OpenAI 今年新增的運算資源超過過去十年所有實驗室的總和,且他們計畫明年再翻倍,這反映出 AI 基礎設施的拋物線式擴張。

需要社會防護與廣泛擁有權

隨著 AI 指數增長曲線接近尾聲,隨之而來的豐富將需要新的社會契約;Brad Gerstner 的 Invest America 提案旨在讓每個孩子在經濟中擁有所有權股份,以解決分配挑戰。

Jensen 的 100× 挑戰推動持續創新

Nvidia 的領導層推動團隊在全堆疊上實現 100× 的改進,使得源自 Groq 的團隊能嘗試作為獨立創業公司無法達成的壯舉,並確保晶片設計與系統整合的快速進步。

SUMMARY: AI 超級週期由爆炸式推理需求驅動,Groq 的確定性 SRAM 晶片透過 NVLink Fusion 與 Nvidia GPU 配對,每單位功耗可提供 2.5× 更多的 token,推理成本因而驟降,而 AI 價值增長更快,從而創造出永續的經濟模型。

TITLE: GPU 經濟:AI 推理運算、Groq‑Nvidia 合作夥伴關係與 AI 超級週期

Sources