Stop Shipping Distributed Systems: The Case for Local AI
在目前的軟體開發領域中,出現了一種普遍的趨勢:AI 的「API-first」方法。對於許多開發者來說,現在增加 AI 功能僅僅意味著在程式碼庫中加入一個對 OpenAI 或 Anthropic 的 API 調用。雖然這可以實現快速原型設計,但它引入了一個根本性的架構缺陷。透過依賴雲端託管模型來實現基本功能,開發者正無意中將簡單的 UX 增強功能轉變為複雜且脆弱的分散式系統。
這種依賴性使得軟體本質上變得脆弱。應用程式的核心功能現在取決於外部伺服器的運行時間、網路穩定性、信用卡有效性以及第三方限制。更重要的是,它從根本上改變了與用戶之間的隱私合約。一旦用戶內容被串流到第三方提供商,產品就會承擔大量的法律與倫理負擔——數據保留政策、同意審核以及持續的數據洩漏風險。
The Philosophy of Local-First AI
現代軟體的目標不應該是「AI 無處不在」,而應該是「實用的軟體」。對於許多常見的使用案例,前沿雲端模型提供的智能程度過於強大。當模型的主要任務是轉化用戶擁有的數據而非作為通用搜尋引擎時,在地端 AI 的表現最為出色。
考慮一下摘要文件、從筆記中提取行動項目或對文件進行分類等常見任務。在這些情況下,數據已經在設備上。將這些數據發送到維吉尼亞州的伺服器進行處理然後再傳回,不僅效率低下,而且毫無必要。透過將計算保留在本地,開發者可以透過架構來建立信任,而不是透過一份 2,000 字的隱私政策。
Practical Implementation: On-Device Intelligence
以 Apple 生態系統為主要例子,透過內建的模型 API,向在地端 AI 的轉向在技術上正變得可行。開發者不再需要請求非結構化 JSON 並寄望於模型遵循某種架構,現代工具允許開發者定義類型化的數據結構(例如 Swift structs)讓模型可以直接填充。
這種方法將 AI 從「新奇的聊天框」轉變為「值得信賴的子系統」。當輸出是類型化且可預測的時,UI 可以一致地渲染它,而不需要複雜的爬蟲或 regex patterns 來清理 Markdown blobs。例如,對於一個新聞聚合器,在地端模型可以生成一個「粗獷主義」摘要——僅包含事實,沒有廢話——而不需要任何伺服器轉向或用戶日誌。
The "Intelligence Gap" Debate
對於在地端 AI 最常見的反駁之一是,在地端模型單純就是沒有雲端對應模型那樣「聰明」。這在技術上是正確的,但對於特定任務而言通常是無關緊要的。
大多數應用程式功能不需要一個能通過律師考試或寫出莎士比亞作品的模型;它們需要一個能可靠地分類、摘要或標準化數據的模型。當任務被限制在頁面或文件已有的資訊中時,70B 參數的雲端模型與高度優化的在地端模型之間的差距會顯著縮小。
Counterpoints and Technical Hurdles
儘管在地端 AI 有其前景,但開發者與進階用戶社群也指出了幾個重大挑戰:
1. Hardware Constraints and Memory
許多人認為,對於真正實用的在地端 AI,硬體需求對一般消費者來說仍然太高。正如社群討論中所述:
"We need computers with 128gb or maybe even 192gb of memory before local use make sense... On my 36gb M3 the 24b Gemma model is nice. But the entire system gets allocated for that thing."
在 DRAM 成本下降或統一記憶體架構在主流中階設備中變得更普遍之前,高效能的在地端 AI 可能仍會是進階用戶的利基市場。
2. The "SOTA" Trap
向「頂尖技術 (SOTA)」模型的趨勢非常強大,因為它們可以減少提示工程 (prompt engineering) 的 「努力程度」。開發者經常選擇雲端 API,並非出於懶惰,而是因為前沿模型的卓越推理能力使得功能「直接就能用」而不需要太多調整。這造成了一個循環,開發者會為了每個任務都依賴最強大的模型,而不論該任務是否真的需要那種程度的智能。
3. Energy and Efficiency
一些批評者指出,內在地端推理 (local inference) 的能效比(相對於單位智能)可能低於數據中心推理,因為後者受益於大規模經濟規模與批次處理。在地端模型通常處理的是批次大小為 1 的任務,這比雲端農場使用的批次處理效率低得多。
The Path Forward: A Hybrid Future
最務實的途徑很可能是混合模式。產業正朝著以下模式發展:
- Local AI 處理私密且日常的任務:摘要、PII masking、以及基礎數據轉換。
- Cloud AI 預留給「前沿」任務:複雜推理、超大上下文窗口、以及高風險規劃。
為了實現這一轉型,產業需要 OS 層級的標準化 API——類似於 Chrome 中新興的 Prompt API——來允許作業系統優化不同應用程式之間的資源分配與批次處理。透過將 AI 視為在地端子系統優先,並將其視為雲端服務為次,我們可以回歸到建立快速、私密且具備根本韌性的軟體開發傳統。