Hacker News目標柱:追蹤AI進展與AGI的移動目標
追求人工通用智慧(AGI)的過程經常被形容為一種「移動目標」現象,即過去被認為不可能的能力如今已成為常態,導致觀察者重新定義成功的標準。最近一個由社群推動的專案「Goalposts」,匯集了Hacker News使用者設定的歷史挑戰,突顯了這種演變以及模型一次完成任務與可靠完成任務之間持續存在的差距。
AI基準的演變
AI基準已從簡單的數位任務轉變為複雜的現實世界互動。對2016年至2026年挑戰的分析顯示,社群所認為的「困難」問題已出現明顯轉變:
- 早期挑戰(2016–2024): 主要聚焦於圖靈測試、基本軟體工程,以及簡單的代理行為(例如:「幫我訂杯咖啡」)。
- 近期挑戰(2026): 轉向物理世界互動(例如:「打開一扇實體門」)、高階認知同理心(「令人信服地模擬人類的小氣」),以及根本性的科學發現(「提出全新的科學突破」)。
此轉變顯示,儘管數位模仿與程式碼生成已大致被視為已解決,AI進展的前沿已轉向世界模型建構與自主物理代理能力。
可靠性與隨機成功的區別
一個關鍵區別已浮現:模型透過暴力計算達成結果的能力,與其可靠執行任務的能力之間的差異。
"在許多情況下,我深信現今的LLM只要擁有無限的運算資源與無限次嘗試次數,至少能完成一次該任務……但這些情況並非例行發生,或模型目前無法穩定且可靠地完成該任務。"
這種差距在幾個特定的失敗模式中顯而易見:
- 空間推理: 儘管投票數顯示成功,使用者仍報告前沿模型(如Opus 5.5和5.6 Luna)在處理ASCII藝術時仍存在困難,經常誤認簡單形狀(例如:將腳誤認為機車)。
- 領域專精知識: 雖然LLM在程式設計方面表現出色(因訓練資料龐大),但在農業、建築、機械等專業物理領域常出現失敗,可能提供「災難性」的建議或虛構來源。
- 情境細節: AI工具在需要人類直覺的任務上仍顯吃力,例如根據對弈水平推測棋譜中的錯誤走法,以修正原本的記錄。
自動駕駛所需的「世界模型」
最爭議的目標之一是完全解決自動駕駛汽車問題。部分技術觀察者認為,僅靠模式辨識無法解決自動駕駛,而需要一個根本性的「世界模型」來進行預測。
該論點指出,區分無害物體(空的汽水罐)與關鍵危險物(磚塊)的能力,需要達到通用智慧(AGI中的「G」)層級的預測能力,以避免失敗。若缺乏全面的世界模型,AI無法可靠應對物理世界的不可預測性。
重新定義圖靈測試
社群對圖靈測試的看法已從二元的通過/失敗,轉變為對人類感知的細膩討論。有人認為測試本質上存在缺陷,因為人類經常無法區分一個高階的「鹦鹉」與一個有感知的實體,使測試成為衡量人類易受騙程度的指標,而非AI智慧的指標。
此外,現在區分標準圖靈測試與「對抗性」圖靈測試,後者要求模型在嚴密監控下長時間維持人類身分,許多認為此標準至今仍未達成。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch