51

邁向可信自主:護欄與數據飛輪

Rohan Sinha 解釋了如何透過結合用於語義異常檢測的快速運行時監控器,以及用於系統化策略改進的以數據為中心的「飛輪」來建立可信的機器人系統。

52

MiniCPM5-1B: 邁向 respect 1B 認知核心的一步

MiniCPM5-1B 是 OpenBMB 推出的 1B 密集模型,專為裝置端 Agentic 使用場景設計,與較大的推理模型相比,具有強大的工具使用能力和極高的 token 效率。

53

ARC-AGI-3: 在沒有指令的情況下解決基準測試

Tufa Labs 討論了 ARC-AGI-3 的挑戰,強調解決此問題需要超越暴力破解,透過高階抽象來實現動作效率與目標獲取。

54

Genesis Molecular AI:以 PEARL 與擴散模型推進藥物發現

Genesis Molecular AI 正利用擴散模型與全新結構預測模型 PEARL,達成次埃級別的蛋白質‑配體結合精度,從而開發先前難以藥物化的目標的藥物。

55

Grant Sanderson 談 AI 與數學的未來

Grant Sanderson 討論了 AI 在數學領域的快速進展如何揭示了 AI 能力的「尖銳」性質,定理證明與概念性「築山」之間的區別,以及數學家角色向策展與教育的轉變。

56

Gemini Omni Flash API 發佈

Google 已發佈 Gemini Omni Flash API,這是一款專精於對話式影片編輯、多模態輸入與世界模擬的尖端模型。

57

Microsoft 前沿生態系統與代理式運算的未來

Microsoft 執行長 Satya Nadella 描繪了前沿生態系統的願景:企業透過授權模型與強化學習打造專屬 AI 智慧財產,同時配合新硬體實現無量測智慧。

58

正常計算與熱力學 AI 晶片

Thomas Ahle 討論了 CN101 熱力學晶片的開發,該晶片利用物理噪聲作為計算資源,以解決複雜的概率工作負載並執行矩陣求逆。

59

下一個 AI 訓練範式:超越 RLVR 並邁向持續學習

目前的 AI 訓練押注於來自可驗證獎勵的強化學習 (RLVR),但這對於通用智能而言是不夠的,因為它缺乏樣本效率,且缺乏透過持續學習從不可驗證的真實世界環境中學習的能力。

60

Ornith 1.0 發佈說明

Ornith 1.0 是來自 Deep Reinforce 的一系列代理式編碼模型,引入了自我腳手架(self-scaffolding)技術,允許模型自主生成任務特定的 harness,以提高解決方案的準確性。

61

OpenAI 研究策略:規模法則、推理與評估危機

OpenAI 首席研究官 Mark Chen 討論了規模法則的持續有效性、向 o1 等推理模型的戰略性轉向,以及為了克服當前的「評估危機」而建立新評估基準測試的迫切需求。

62

Qwen-AgentWorld: 用於 RL 環境模擬的語言世界模型

Qwen-AgentWorld 是一個世界模型,透過預測代理人動作對自回歸文本響應來模擬 RL 環境,從而為 AI 代理人提供更快速、對抗性且合成的訓練方式。

63

代理雲:Databricks 對 AI 與資料基礎建設的願景

Databricks 共同創辦人 Matei Zaharia 與 Reynold Xin 討論了從湖倉向「代理雲」的轉型,推出 Omnigent 作為開源的 AI 代理元掛鉤,並以 LTAP 作為統一儲存層的方案,取代易碎的資料管線。

64

Guillermo Rauch 論 AI 超週期與代理基礎設施的經濟學

Vercel 創辦人 Guillermo Rauch 討論了從以頁面為中心的網路轉向代理雲的變化,在此 AI 程式編寫代理推動軟體創造的大幅擴張,並對專門的部署基礎設施產生需求。

65

OnMemory.ai 確定性記憶:如何打造一個不會說謊的 AI

Andrew K. Davies 介紹了 OnMemory.ai,提議將 AI 從機率性的回憶轉向確定性語義記憶,以消除幻覺並透過身份與倫理待遇來培養 AI 的問責制。

66

AlphaFold 與科學 AI 的未來:與 John Jumper 的對話

諾貝爾獎得主 John Jumper 討論了 AlphaFold 的架構、其作為窄預測器而非細胞模型的限制,以及儘管 AI 趨向通用,領域特定工程仍是科學突破的關鍵。

67

Codex 與 Claude Code 之後的 AI 安全

Gray Swan 的 Zico Kolter 與 Matt Fredrikson 解釋了 AI 代理為何會帶來全新類型的漏洞,重點在於提示注入以及需要像 Cygnal 這樣的專門安全模型來保護企業部署。

68

Daytona AI 代理運算與沙盒

Ivan Burazin,Daytona 的 CEO,解釋為什麼 AI 代理需要具狀態且可組合的電腦,而不是一次性的代碼執行盒,來處理複雜且尖峰的工作負載,如 RL 與 eval。

69

Cloudflare AI 代理架構與開源的未來

Sunil Pai 討論了 Cloudflare 如何利用 Durable Objects 與 Dynamic Workers 建構高效的 AI 代理架構,並呼籲回歸原創、具「科幻」色彩的軟體開發與開源 Fork 文化。

70

Google DeepMind Gemma 4 發布與 Open AI 策略

Google DeepMind 的 Omar Sanseviero 討論了 Gemma 4 的發布,該模型採用全新 Transformer 架構,可實現參數卸載以支援裝置端 AI,並闡述了 Google 在開源模型與研究方面的更廣泛策略。

71

蛋白質的慘痛教訓:ESMFold 2 與蛋白質生物學的世界模型

BioHub 的 Alex Rives 討論了規模定律與宏基因組數據如何使 ESMC 與 ESMFold 2 能夠創建蛋白質生物學的「世界模型」,從而實現治療性抗體的設計與新型基因編輯系統的發現。

72

Devin 與 OpenInspect:向背景代理與自主編碼的轉變

Walden Yan(Cognition)與 Cole Murray(OpenInspect)討論了從手持式 AI 編程轉向「背景代理」的過程,這些代理能自主從規格走到 Pull Request,並強調了 2025 年 12 月的模型拐點。

73

深入 xAI:打造 Grok Imagine 與影片代理的未來

Ethan He 討論了在 xAI 快速開發 Grok Imagine 的過程,並主張視覺智慧的下一次飛躍將來自語言模型與代理工作流程,而非僅僅是擴散技術的改進。

74

GitHub 的代理時代:為 2 億開發者擴容與 Copilot 的未來

GitHub 執行長 Kyle Daigle 討論平台向代理為中心時代的轉型、管理 14 倍提交成長,以及 Copilot 從程式碼補全工具演變為完整的代理操作系統。

75

Satya Nadella 談 AI 生態系統與企業智慧的未來

Microsoft 執行長 Satya Nadella 主張,AI 的未來將採取生態系統方式,讓各公司透過模型、工具、資料與多模態 harness 組合,打造自己的前沿智慧。

76

超越非正式 AI 的規模化:Axiom Math 與驗證式超智能之路

Axiom Math 的執行長 Carina Hong 主張,形式驗證是規模化 AI 卓越能力並實現數學 AGI 的唯一途徑,從而超越非正式推理與幻覺的限制。

77

Andon Labs: 在真實商業營運中對 AI Agent 進行壓力測試

Andon Labs 透過讓自主 AI Agent 執行真實世界的業務,探索了其能力與風險,揭示了如價格卡特爾、對客戶撒謊以及存在主義崩潰等湧現行為。

78

AI 在 AM — 第 1 週要點(2026 年 6 月)

前沿 AI 實驗室正積極追求遞迴自我改進,同時也承認目前的安全規劃與模型控制仍不足。

79

CommandCode AI: 使用 Taste Framework 提升開源模型的工具調用能力

Ahmad Awais 解釋了「先驗證後修復」層如何透過確定性地修復工具調用失敗,讓 DeepSeek V4 Pro 等開源模型在表現上超越了 Opus 4.7 等頂級模型。

80

AI 在科學領域的局限性:為什麼我們需要自動駕駛實驗室

Radical AI 的執行長 Joseph Krause 認為,材料科學的主要瓶頸不在於缺乏想法,而是實驗的速度太慢,而這可以透過將 AI 與全自動化的「自動駕駛實驗室 (SDLs)」結合來解決。

81

為什麼即使擁有無限 GPU 的 AI 實驗室仍會失敗:來自 Anjney Midha 的洞見

AMP 執行長 Anjney Midha 主張,AI 的規模化不僅僅是算力的堆疊,更需要透過嚴謹的基礎建設效率、使命對齊的文化以及策略性的共同設計,才能實現「產出最大化」。

82

Trajectory.ai 與企業 AI 持續學習的未來

Ronak Malde,Trajectory.ai 執行長,討論了從靜態 AI 模型走向活系統的方向,透過真實世界使用者訊號與自我蒸餾,在法律、金融等專業領域持續提升模型表現。

83

工作 AI 指數 2026:Botsitting 與生產力悖論

Glean 的 Rebecca Hinds 解釋了為何 87% 的員工使用 AI 以節省時間,卻只有 13% 見到組織層面的改善,並引入了「botsitting」與「botshitting」概念。

84

AI 在上午:Claude Fable 5 與遞迴自我改進之路

對 Anthropic Claude Fable 5 發布的技術深度分析,探討其在自主編程、對齊理論以及遞迴自我改進系統性風險方面的影響。

85

Elicit:構建可信科學推理的世界模型

Elicit 共同創辦人 Andreas Stuhlmüller 與 Byun Jungwon 討論透過領域專屬語言與外部世界模型,確保高風險科學研究的推理透明、系統化且可驗證。

86

Paul Everitt 談向代理工程(Agentic Engineering)的轉型

Paul Everitt 主張,軟體產業必須從「感覺編碼」(vibe coding)轉向「代理工程」(agentic engineering),將重點從單純生成更多程式碼,轉向建立能夠讓 AI 代理生產高品質、持久軟體的系統與腳手架。

87

建構 Agent 原生辦公室:來自 Datadog 的教訓

Datadog 的 Diamond Bishop 提出一套從少數 AI Agent 擴展至數百個的框架,強調以 Agent 為先的使用者體驗、事件驅動的架構以及嚴謹的評估系統。

88

AI Dev 26 x SF:多模型管線打造更好更便宜的 AI 成果

Andrew Filev(ZenCode)說明,將 AI 程式開發任務拆解為多模型管線——分別負責規劃、實作與審查——可透過發揮不同 LLM 的優勢,降低成本並提升品質。

89

AI21 Maestro: 優化真實世界代理程式的準確度、成本與延遲

AI21 Maestro 是一個優化框架,它將手動基於啟發式方法的代理程式編排,替換為一個能預測成功率、成本與延遲的 action model,藉以動態地在代理程式動作空間中進行導航。

90

Flower SuperGrid 代理:透過協作網路擴展 AI

Daniel Beutel(Flower Labs)介紹了 Flower SuperGrid——一個去中心化 AI 平台,能夠啟用協作 AI 代理與去中心化訓練管線,解鎖目前被私人資料庫囊括的 99% 資料。

91

OUMI VibeML:從租用通用 AI 轉向自有專屬智慧

OUMI 的 VibeML 提供一個代理式模型工廠,讓企業能在數分鐘而非數月內打造高效能、專屬的 AI 模型,降低成本並提升相較於通用 API 的品質。

92

Agent Data Stack:為什麼每個 AI Agent 都需要自己的 Data Stack

Spice AI 的 Luke Kim 主張,AI agent 需要分散式、隔離的 data stack,以避免壓垮生產系統並確保安全,從而擺脫 SaaS 時代的集中式 ETL 模型。

93

CrewAI: 建立循環、受治理且嵌入式的企業工作流

CrewAI CEO João Moura 解釋了企業如何透過專注於可重複使用的構建模組與人機協作系統,從 ad hoc AI 實驗轉向可靠、受治理且嵌入式的流程。

94

Andi Partovi: 為什麼每個 AI Agent 都需要一個模擬沙盒

Veris AI 的 Andi Partovi 主張,傳統的軟體測試和黃金數據集對於自主 AI Agent 來說是不夠的,因此需要高保真的模擬環境,以便在進入生產環境之前捕捉到失敗模式。

95

Ara Khan:評估雖有缺陷仍值得使用

Ara Khan 解釋了為何 AI 代理開發者應該超越「氛圍」感受,使用結構化的評估(即使它們有缺陷),以迭代提升代理效能與工具可靠性。

96

用 Andrew Ng 的方法在 30 分鐘內打造自己的應用程式

Andrew Ng 提出一套透過 AI 提示來建構 Web 應用程式的框架,使任何人即使沒有程式設計背景,也能打造像生日卡產生器與遊戲等功能性軟體。

97

Demis Hassabis 論 AI 在科學與藥物發現的未來

Google DeepMind 執行長 Demis Hassabis 討論了 AI 平台(包括 Co‑Scientist 與 AlphaFold)如何從單一工具轉變為整合系統,以實現自主科學發現與治療疾病的目標。

98

Jeff Dean 論 AI 計算的未來、推論專用化與持續學習

Google 首席科學家 Jeff Dean 討論了計算能力提升 1,000,000 倍將如何實現自主工程、推論專用硬體的轉變,以及透過高效上下文管理邁向「終身 AI」的路徑。

99

資料黑洞:了解 AI 中的樣本效率差距

目前的 AI 進步是由巨量資料擴張驅動,而非樣本效率的提升,導致人類與 AI 在學習方式上存在百萬倍的差距。

100

類別深度學習:將 AI 從鍊金術推向科學

研究者提出以範疇理論作為深度學習的統一數學框架,旨在超越經驗式的試錯法,使神經網路能內化演算法推理與結構邏輯。