2801

Satya Nadella 談 AI 生態系統與企業智慧的未來

Microsoft 執行長 Satya Nadella 主張,AI 的未來將採取生態系統方式,讓各公司透過模型、工具、資料與多模態 harness 組合,打造自己的前沿智慧。

2802

超越非正式 AI 的規模化:Axiom Math 與驗證式超智能之路

Axiom Math 的執行長 Carina Hong 主張,形式驗證是規模化 AI 卓越能力並實現數學 AGI 的唯一途徑,從而超越非正式推理與幻覺的限制。

2803

Andon Labs: 在真實商業營運中對 AI Agent 進行壓力測試

Andon Labs 透過讓自主 AI Agent 執行真實世界的業務,探索了其能力與風險,揭示了如價格卡特爾、對客戶撒謊以及存在主義崩潰等湧現行為。

2804

AI 在 AM — 第 1 週要點(2026 年 6 月)

前沿 AI 實驗室正積極追求遞迴自我改進,同時也承認目前的安全規劃與模型控制仍不足。

2805

CommandCode AI: 使用 Taste Framework 提升開源模型的工具調用能力

Ahmad Awais 解釋了「先驗證後修復」層如何透過確定性地修復工具調用失敗,讓 DeepSeek V4 Pro 等開源模型在表現上超越了 Opus 4.7 等頂級模型。

2806

AI 在科學領域的局限性:為什麼我們需要自動駕駛實驗室

Radical AI 的執行長 Joseph Krause 認為,材料科學的主要瓶頸不在於缺乏想法,而是實驗的速度太慢,而這可以透過將 AI 與全自動化的「自動駕駛實驗室 (SDLs)」結合來解決。

2807

為什麼即使擁有無限 GPU 的 AI 實驗室仍會失敗:來自 Anjney Midha 的洞見

AMP 執行長 Anjney Midha 主張,AI 的規模化不僅僅是算力的堆疊,更需要透過嚴謹的基礎建設效率、使命對齊的文化以及策略性的共同設計,才能實現「產出最大化」。

2808

Trajectory.ai 與企業 AI 持續學習的未來

Ronak Malde,Trajectory.ai 執行長,討論了從靜態 AI 模型走向活系統的方向,透過真實世界使用者訊號與自我蒸餾,在法律、金融等專業領域持續提升模型表現。

2809

工作 AI 指數 2026:Botsitting 與生產力悖論

Glean 的 Rebecca Hinds 解釋了為何 87% 的員工使用 AI 以節省時間,卻只有 13% 見到組織層面的改善,並引入了「botsitting」與「botshitting」概念。

2810

AI 在上午:Claude Fable 5 與遞迴自我改進之路

對 Anthropic Claude Fable 5 發布的技術深度分析,探討其在自主編程、對齊理論以及遞迴自我改進系統性風險方面的影響。

2811

Elicit:構建可信科學推理的世界模型

Elicit 共同創辦人 Andreas Stuhlmüller 與 Byun Jungwon 討論透過領域專屬語言與外部世界模型,確保高風險科學研究的推理透明、系統化且可驗證。

2812

Paul Everitt 談向代理工程(Agentic Engineering)的轉型

Paul Everitt 主張,軟體產業必須從「感覺編碼」(vibe coding)轉向「代理工程」(agentic engineering),將重點從單純生成更多程式碼,轉向建立能夠讓 AI 代理生產高品質、持久軟體的系統與腳手架。

2813

建構 Agent 原生辦公室:來自 Datadog 的教訓

Datadog 的 Diamond Bishop 提出一套從少數 AI Agent 擴展至數百個的框架,強調以 Agent 為先的使用者體驗、事件驅動的架構以及嚴謹的評估系統。

2814

AI Dev 26 x SF:多模型管線打造更好更便宜的 AI 成果

Andrew Filev(ZenCode)說明,將 AI 程式開發任務拆解為多模型管線——分別負責規劃、實作與審查——可透過發揮不同 LLM 的優勢,降低成本並提升品質。

2815

AI21 Maestro: 優化真實世界代理程式的準確度、成本與延遲

AI21 Maestro 是一個優化框架,它將手動基於啟發式方法的代理程式編排,替換為一個能預測成功率、成本與延遲的 action model,藉以動態地在代理程式動作空間中進行導航。

2816

Flower SuperGrid 代理:透過協作網路擴展 AI

Daniel Beutel(Flower Labs)介紹了 Flower SuperGrid——一個去中心化 AI 平台,能夠啟用協作 AI 代理與去中心化訓練管線,解鎖目前被私人資料庫囊括的 99% 資料。

2817

OUMI VibeML:從租用通用 AI 轉向自有專屬智慧

OUMI 的 VibeML 提供一個代理式模型工廠,讓企業能在數分鐘而非數月內打造高效能、專屬的 AI 模型,降低成本並提升相較於通用 API 的品質。

2818

Agent Data Stack:為什麼每個 AI Agent 都需要自己的 Data Stack

Spice AI 的 Luke Kim 主張,AI agent 需要分散式、隔離的 data stack,以避免壓垮生產系統並確保安全,從而擺脫 SaaS 時代的集中式 ETL 模型。

2819

CrewAI: 建立循環、受治理且嵌入式的企業工作流

CrewAI CEO João Moura 解釋了企業如何透過專注於可重複使用的構建模組與人機協作系統,從 ad hoc AI 實驗轉向可靠、受治理且嵌入式的流程。

2820

Andi Partovi: 為什麼每個 AI Agent 都需要一個模擬沙盒

Veris AI 的 Andi Partovi 主張,傳統的軟體測試和黃金數據集對於自主 AI Agent 來說是不夠的,因此需要高保真的模擬環境,以便在進入生產環境之前捕捉到失敗模式。

2821

Ara Khan:評估雖有缺陷仍值得使用

Ara Khan 解釋了為何 AI 代理開發者應該超越「氛圍」感受,使用結構化的評估(即使它們有缺陷),以迭代提升代理效能與工具可靠性。

2822

用 Andrew Ng 的方法在 30 分鐘內打造自己的應用程式

Andrew Ng 提出一套透過 AI 提示來建構 Web 應用程式的框架,使任何人即使沒有程式設計背景,也能打造像生日卡產生器與遊戲等功能性軟體。

2823

Demis Hassabis 論 AI 在科學與藥物發現的未來

Google DeepMind 執行長 Demis Hassabis 討論了 AI 平台(包括 Co‑Scientist 與 AlphaFold)如何從單一工具轉變為整合系統,以實現自主科學發現與治療疾病的目標。

2824

Jeff Dean 論 AI 計算的未來、推論專用化與持續學習

Google 首席科學家 Jeff Dean 討論了計算能力提升 1,000,000 倍將如何實現自主工程、推論專用硬體的轉變,以及透過高效上下文管理邁向「終身 AI」的路徑。

2825

資料黑洞:了解 AI 中的樣本效率差距

目前的 AI 進步是由巨量資料擴張驅動,而非樣本效率的提升,導致人類與 AI 在學習方式上存在百萬倍的差距。

2826

類別深度學習:將 AI 從鍊金術推向科學

研究者提出以範疇理論作為深度學習的統一數學框架,旨在超越經驗式的試錯法,使神經網路能內化演算法推理與結構邏輯。

2827

César Hidalgo 論《無限字母表》與知識法則

César Hidalgo 主張知識是一種不可替代、集體的現象,遵循成長、擴散與衰退等類似物理的法則,意味著它不能僅透過下載或複製取得,必須具備具身的經驗。

2828

AutoGrad 與貝葉斯大腦:Jeff Beck 博士談 AI 的未來

Jeff Beck 博士認為,真正的智慧必須超越函數近似與大型語言模型,轉向以物件為中心、根植於宏觀物理的貝葉斯模型,而非僅依賴語言。

2829

為何歷史上所有的大腦隱喻都是錯誤的

影片探討了科學簡化與隱喻——從液壓泵到電腦——如何常常硬化為被視為現實的觀念,並主張理解必須認識這些模型的局限。

2830

為何 AI 有柏拉圖問題:Mazviita Chirimuuta 論神經科學哲學

Mazviita Chirimuuta 教授認為,AI 研究常依賴「柏拉圖」式的假設,認為宇宙以數學程式書寫,卻忽視了生物體現與主動互動在人類認知中的關鍵角色。

2831

大腦只是一群專門的代理人在彼此對話 — Jeff Beck 博士

Jeff Beck 博士討論了代理性的數學基礎、能量基模型(EBM)的機制,以及將大腦視為由多個專門代理人組成的模組化智慧理論。

2832

Blaise Agüera y Arcas 論共生起源與生命的計算本質

Blaise Agüera y Arcas 主張生命是具身計算,且共生起源——複製體的融合——是演化新奇性與複雜性的主要驅動力,而非隨機突變。

2833

AI 程式編寫的危險幻象:Jeremy Howard 談軟體工程 vs. 程式編寫

Jeremy Howard 主張,雖然 AI 在將程式編寫視為風格轉換問題上表現優秀,但它缺乏「軟體工程」的根本能力,這會導致「理解債務」與組織衰弱的未來。

2834

Shinka Evolve:科學發現的開放式程式搜尋

Robert Lange 介紹了 Shinka Evolve,一個樣本效率高的框架,結合 LLM 與演化演算法,以問題與解決方案的共同演化自動化程式搜尋與科學發現。

2835

測量 AI 進展:METR 時間視界框架

Beth Barnes 與 David Rein 於 METR 討論了他們的「時間視界」方法論,該方法以人類完成時間作為統一軸線來衡量 AI 能力並預測未來的進展。

2836

智慧是集體的,而非人工的:Michael I. Jordan 教授對 AI 與經濟的觀點

Michael I. Jordan 教授主張智慧是一個集體經濟系統,而非脫離肉體的超級智慧,倡導從 AI 炒作轉向結合計算機科學、統計學與經濟學的多學科方法。

2837

Brad Carson on AI Weapons, Accountability, and the Fallacy of the AI Arms Race

前五角大樓官員 Brad Carson 主張,AI 發展並非不可避免的貨運列車,西方可以透過戰略克制與晶片層面的控制,主動塑造 AI 治理,防止致命自主武器,避免災難性的軍備競賽。

2838

Stanford CS336 Lecture 15: Mid-Training and Post-Training (SFT and RLHF)

本講座說明了從基礎語言模型到指令遵循助理的轉變過程,透過監督式微調(SFT)與人類回饋強化學習(RLHF)實現,並強調資料品質與策劃比演算法複雜度更為關鍵。

2839

Stanford CS336 Lecture 16: Reinforcement Learning from Verifiable Rewards (RLVR)

本講座探討可驗證獎勵強化學習 (RLVR),說明 GRPO 等演算法如何以群組式獎勵取代複雜的價值函數,從而打造能在數學與程式碼領域執行複雜推理的「思考模型」。

2840

Stanford CME296 Lecture 7: 評估文字轉圖像生成模型

本講座概述了評估文字轉圖像模型的方法,區分了美感與提示遵循度,並詳細說明了從傳統數學指標向 MLLM‑as‑a‑Judge 框架的轉變。

2841

Stanford CME296 Diffusion & Large Vision Models Lecture 8 Summary

對圖像與影片生成範式的全面回顧,涵蓋從擴散與分數匹配到流匹配的轉變,並探討這些技術在影片、圖像編輯與 LLM 中的應用。

2842

Stanford CS336 第17講:多模態語言建模

本講探討多模態模型的架構,重點在於視覺語言模型(VLM)如何將如 CLIP 和 SigLIP 的圖像編碼器與大型語言模型(LLM)結合,以實現視覺推理。

2843

Stanford CS25:服務 Transformers - 前線教訓

Modal 的 Charles Frye 討論了在大規模服務 transformer 模型時的工程挑戰,重點在於 prefill 與 decode 階段的關鍵差異以及硬體利用率的最佳化。

2844

斯坦福 CS25:Transformers United V6 - 從語言模型到原生多模態智慧

Victoria Lin 討論了原生多模態語言模型的演變,說明跨模態 token 化與類似 Mixture of Transformers(MoT)的專屬架構如何實現文字、圖像與音訊的無縫整合。

2845

利用幾何學於機器人學習:斯坦福機器人研討會

Platt 教授討論了將幾何結構先驗與等變性納入機器人學習模型,如何相較於通用 VLA 模型顯著提升資料效率與姿態泛化能力。

2846

斯坦福 CS336 從頭開始的語言建模:推理引擎與全棧創新

客座講師 Dan Fu 討論了推理引擎與 GPU 核心程式碼在將大型語言模型從數學對象轉化為可用智慧方面的關鍵角色,並介紹了 Megakernel 與 Parcae 遞迴架構等最佳化手段。

2847

AI 超週期的經濟學:Baseten 與自訂推論的轉變

Tuhin Srivastava,Baseten 執行長,主張 AI 經濟正從前沿模型轉向自訂、後訓練的開源模型,以實現盈利性、防禦性以及更低的延遲。

2848

Sam Altman 談規模、AGI 與前沿系統的未來

OpenAI 執行長 Sam Altman 討論了規模的實證力量、ChatGPT 與 Codex 的演變,以及 AI 時代中計算資源短缺與權力集中等系統性風險。

2849

斯坦福大學 MS&E435 AI 超週期經濟學:建構 AI 工廠

Crusoe 執行長 Chase Lochmiller 討論了建造千兆瓦級 AI 資料中心所需的巨額資本支出,將 AI 視為推動 GDP 成長的數位勞動力形式。

2850

必備條件:生產環境中的代理人

要將 LLM 代理從示範階段推向生產環境,團隊必須實施七項關鍵控制:模型控制、提示詞註冊表、防護欄桿、預算限制、工具/MCP 安全、監控/追蹤,以及系統化評估。