✷ 封存 · 11 個實驗室 · 3,049 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
Anthropic 結構化分類器:防禦通用越獄攻擊
Anthropic 宣布推出結構化分類器,這是一種新的輸入-輸出過濾系統,將通用越獄的成功率降至 5% 以下,同時僅帶來輕微的計算成本增加與 0.38% 的無害拒絕率上升。
OpenAI 國家安全原則與政府合作夥伴關係
OpenAI 已發布其國家安全原則,以提供公司在政府合作夥伴關係以及其技術在國家安全與執法領域使用方式的透明度。
OpenAI 對 SWE-Bench Pro 程式碼評估缺陷的分析
OpenAI 在審計發現約 30% 的基準任務因過於嚴格的測試與缺乏規範的提示等問題而損壞後,撤回了對 SWE-Bench Pro 的推薦。
Robostral Navigate 發佈說明
Mistral AI 推出了 Robostral Navigate,這是一款 8B 模型,讓機器人僅透過單一 RGB 相機即可自主導航複雜環境,在未見過的 R2R-CE 基準測試中達到了 76.6% 的成功率。
OpenAI Academy AI Skills Jam for K–12 Educators
OpenAI Academy 與 Walton Family Foundation 合作,推出 AI Skills Jam,為超過 1,600 名 K–12 教育工作者提供實作訓練,協助他們將 AI 融入教學與行政工作。
Hugging Face 原生速度 vLLM Transformers 建模後端
Hugging Face 已更新 transformers vLLM 後端,透過在執行時動態套用針對推理的層融合,使其吞吐量與自訂 vLLM 實作相當或更佳。
介紹 GPT‑Live‑1 與 GPT‑Live‑1 mini:OpenAI 的全雙工語音模型新突破
OpenAI 宣布推出 GPT‑Live‑1 與 GPT‑Live‑1 mini,這兩款全雙工語音模型可實現自然且可中斷的對話,並將複雜推理委派給 GPT‑5.5,已在全球範圍內向 ChatGPT 使用者推出。
Anthropic 與 AE Studio 推出用於雙用途知識控制的 GRAM
Anthropic 與 AE Studio 開發了梯度路由輔助模組(GRAM),這是一種將雙用途知識隔離到可移除隔間中的方法,旨在防止誤用,同時不犧牲通用模型的性能。
Hugging Face 與 Amazon SageMaker Studio 整合
Hugging Face 推出了與 Amazon SageMaker AI 的深層連結整合,讓開發者只需一次點擊即可從模型探索轉移至 SageMaker Studio 進行微調或部署。
Hugging Face Models on Foundry Managed Compute
Microsoft Foundry 現在整合了一個經過策展、每週更新的 Hugging Face 開放權重模型目錄,可透過一鍵部署至 Foundry Managed Compute,實現企業級運營。
智慧是免費的,現在怎麼辦?為代理人、由代理人以及由代理人設計的資料系統
BAIR 研究人員提出了一個新框架,用於重新設計資料系統以適應代理人工作負載、代理人狀態管理以及代理人驅動的系統合成,當 AI 推理成本趨近於零時。
Hugging Face 與 SkyPilot 整合,實現零出站費用的 AI 儲存
Hugging Face 與 SkyPilot 已完成整合,讓 AI 工作負載可以在任何雲端供應商上執行,且在讀取儲存在 Hugging Face Hub 上的模型與數據集時,無需支付任何出站費用。
MUFG 與 OpenAI 的 AI 原生轉型
MUFG 正與 OpenAI 合作,為 35,000 名員工實施 ChatGPT Enterprise,並開發 AI 驅動的客戶體驗,以轉型為 AI 原生金融集團。
澳洲付款Plus整合ChatGPT Enterprise與Codex
澳洲付款Plus(AP+)已部署ChatGPT Enterprise與Codex以加速技術調查、簡化複雜知識工作,並將產品原型製作時間從數週縮短至一天。
LeRobot v0.6.0 發佈說明 / 新功能
LeRobot v0.6.0 引入了世界模型策略、擴展的 VLA 模型庫、統一的獎勵模型 API,以及具有 DAgger 式人機協作修正功能的新部署 CLI。
PRX 數據策略:透過 VLM 重新標註與 Mosaic Streaming 擴展預訓練規模
Photoroom 詳細介紹了 PRX 的數據流水線,強調使用長篇 VLM 生成的標註、Lance 與 Mosaic Data Shards 的混合儲存策略,以及用於優化 7B 參數模型的高品質 JPEG 編碼。
vLLM × HPC-Ops:來自騰訊混元的高性能 Attention 與 MoE 後端
vLLM 現在已納入針對 NVIDIA Hopper H20 優化的 HPC-Ops Attention 與 MoE 後端,在 Hy3 上可提供高達 2.95× 的 Attention 加速與 1.59× 的 MoE 加速,並減少約 24% 的 TTFT 與 17% 的 TPOT。
Hugging Face Kernels 重大更新
Hugging Face 宣布其 Kernels 專案有重大更新,引入新的 kernel 儲存庫類型、受信任的發布者和程式碼簽署、改版的 CLI、更廣泛的框架支援,以及代理式 kernel 開發的基礎。
Anthropic 在 Claude 語言模型中發現了全域工作空間 (J-space)
Anthropic 宣布在 Claude 中發現了一種湧現的「J-space」,其功能作為內部、可報告推理的全域工作空間,實現了沉默思緒監控與新的安全工具。
Alberta 政府使用 Claude Code 在數小時內掃描並修復 4.66 億行程式碼
艾伯塔省政府部署了 Anthropic 的 Claude Code (Opus 和 Sonnet) 在 20 小時內掃描了 3,400 個儲存庫中的 4.66 億行程式碼,自動生成修復方案,並建立了持續的 AI 驅動安全審查,大幅縮短了原本需要數年才能完成的工作。
xAI Grok Voice 更新:21 種全新旗艦級語音
xAI 為 Grok Voice 發布了 21 種全新的多語言旗艦級語音,同時改進了原有的五種語音,並推出了 Grok Voice Agent Builder。
Google DeepMind 與 A24 研究合作夥伴關係
Google DeepMind 與 A24 已進入一項研究合作夥伴關係,以直接將 AI 創新融入創意過程,開發新的電影製作工作流程與技術。
Leanstral 1.5 發布:前沿的正式驗證模型
Mistral AI 發布 Leanstral 1.5,一款總參數 119 B、採用 Apache‑2.0 許可證的模型,在 miniF2F 上達成完全覆蓋,解決 587 題中的 672 題 PutnamBench 問題,並在開源程式碼中發現先前未知的錯誤。
Claude Fable 5 資安防護機制與越獄框架
Anthropic 詳細說明了用於防止 Claude Fable 5 資安濫用的安全分類器,並提出新的資安越獄嚴重程度(CJS)框架,以標準化 AI 越獄的評估方式。
Anthropic 恢復 Claude Fable 5 與 Mythos 5 的存取權
Anthropic 宣布,在美國出口管制解除後,Claude Fable 5 與 Mythos 5 已恢復上線,並詳細說明了新的安全分類器、業界越獄嚴重程度框架,以及與政府的擴展合作。
Claude Fable 5 與 Claude Mythos 5 正式推出 – 搭載安全防護機制的先進 Mythos 系列模型,支援分級存取
Anthropic 發布 Claude Fable 5,一款通用型 Mythos 系列 1 模型,在軟體工程、視覺與科學領域表現創紀錄;同時推出解鎖安全限制的 Claude Mythos 5,專為受信任的資安防衛人員與未來的生物學合作夥伴設計。
BAIR 2026 畢業生展示
Berkeley 人工智慧研究 (BAIR) 實驗室宣布了其 2026 屆博士畢業生,凸顯了機器人、大型語言模型、AI 安全與醫療領域的研究。
Hugging Face 與 Cerebras 即時語音 AI 使用 Gemma 4
Hugging Face 與 Cerebras 已開發出一個使用 Gemma 4 31B 的開放級聯語音到語音管線,以實現自然、低延遲的語音 AI 互動。
vLLM-Omni 為 Qwen3-Omni-30B-A3B-Instruct 推論服務進行的優化
vLLM-Omni 透過三階段流水線(Thinker、Talker、Code2Wav)提供 Qwen3-Omni-30B-A3B-Instruct 服務,並利用階段分解、CUDA Graphs、非同步分塊傳遞、非同步輸出、階段副本及熱路徑清理來提升吞吐量與降低延遲。
xAI Voice Agent Builder Beta Release
xAI 已推出 Voice Agent Builder beta 版,這是一個由 Grok Voice 提供技術支援的、用於創建生產級語音代理的無程式碼平台。
ScarfBench: 基準測試 AI 代理以進行企業 Java 框架遷移
IBM Research 推出 ScarfBench,一個開放的基準,用於評估 AI 代理遷移企業 Java 應用程式至 Spring、Jakarta EE 和 Quarkus 框架的能力。
Nano Banana 2 Lite 與 Gemini Omni Flash 發布
Google DeepMind 已發布 Nano Banana 2 Lite,用於高速且具成本效益的圖像生成;以及 Gemini Omni Flash,用於高品質影片生成與對話式編輯。
為什麼專業化在 AI 系統中是不可避免的
根據 Goldfeder 等人在 2026 年的研究,專業化是 AI 效能的結構性必要條件,因為有限資源使得集中容量比廣泛通用性更有效。
OpenAI Signals: 全球 ChatGPT 採用趨勢分析
OpenAI Signals 數據顯示,ChatGPT 使用在全球範圍內正在深化和擴展,用戶在註冊六個月後每日訊息量增加 50%,執行的任務種類翻倍。
Anthropic Frontier Red Team:壓力測試 AI 能力
Anthropic 的 Frontier Red Team 針對 AI 對網路安全、國家安全與自主系統的影響進行基於證據的分析,以預測未來風險。
Hugging Face 社群評估與 Every Eval Ever (EEE) 整合
Hugging Face 已將社群評估與 Every Eval Ever (EEE) 計畫整合,實現標準化評估結果的跨平台發布,並在模型頁面與詳細技術記錄之間建立直接連結。
OpenAI 核心傾印流行病學:修復 18 年前的 libunwind 錯誤
OpenAI 在其 Rockset 資料基礎設施中識別並解決了兩種不同的崩潰群體,包括一種無聲的硬體故障和 GNU libunwind 中罕見的 18 年前競爭條件。
OpenAI 推出 GeneBench-Pro 用於計算生物學推理
OpenAI 已發布 GeneBench-Pro,這是一個研究級基準,旨在評估 AI 代理在計算生物學中的高級科學判斷和迭代分析能力。
Genebench-Pro 內部:基因組 AI 基準測試的案例研究
OpenAI 的 Genebench-Pro 提供了一個專門的基準,用於評估 AI 模型在複雜基因組任務上的表現,涵蓋體細胞腫瘤學、功能基因組學和族群遺傳學的十個詳細案例研究。
Claude Science AI 工作台發布
Anthropic 發布 Claude Science,這是一款整合科學工具、管理可擴展運算並提供可審計研究成果的 AI 工作台,以加速科學發現。
DiScoFormer: 用於密度與分數的單一 Transformer,適用於各種分布
DiScoFormer 是一種新的基於 Transformer 的模型,能在單次前向傳遞中從一組資料點估計分布的密度與分數,且無需為新分布重新訓練。
OpenAI 映射歐洲 AI 勞動力機遇報告 2026
OpenAI 的 2026 年報告將其 AI 工作過渡框架擴展到 EU,發現大約 12% 的 EU 就業可能隨著 AI 增長,14% 面臨較高的近期自動化潛力,27% 可能重組,而 47% 則看到變化較不即時。
vLLM Semantic Router:透過微代理協作提升模型性能
vLLM 推出了 Semantic Router,這是一種服務層原語,將單次模型 API 調用轉化為微代理的受限協作,從而在複雜的基準測試中超越前沿模型。
Ollama 0.31: 透過多標記預測提升 Gemma 4 效能
Ollama 0.31 在 Apple Silicon 上為 Gemma 4 引入了多標記預測,在不改變模型輸出的情況下,將程式碼代理基準測試中的標記生成速度提升了近 90%。
HP Inc. 與 OpenAI 的策略合作夥伴關係
HP Inc. 正在利用 OpenAI Frontier 平台擴大其與 OpenAI 的策略合作夥伴關係,將 AI agents 和工作流部署到客戶支援、安全和軟體開發領域。
GPT-5.6 Sol 預覽:功能、防護與可用性
OpenAI 預覽了 GPT-5.6 Sol,其旗艦次世代模型,連同 Terra 和 Luna 一起,強調了更強的編碼、生物學和網路安全能力,並附有增強的防護措施以及對受信任合作夥伴的有限發布。
Hugging Face Jobs: 使用單一指令部署 vLLM 伺服器
Hugging Face 現在允許使用者透過 HF Jobs 使用單一指令在其基礎設施上部署私人且與 OpenAI 相容的 vLLM 端點,提供適合測試、評估和批次生成的按秒計費替代方案。
Anthropic 經濟指數週期報告 – 2026 年 6 月
Anthropic 的 2026 年 6 月經濟指數報告指出,Claude 的使用情況如今已遵循每日與每周的工作節奏,產生價值更高的成果且消耗更多計算資源,而自動化程度較高的使用者對人工智慧對其工作的影響表現出驚人樂觀。
OpenAI Codex 代理 AI 採用與影響
OpenAI 報告知識工作從短暫的聊天機器人互動透過 Codex 轉移到長期代理任務,非開發者採用自 2025 年 8 月以來增長高達 189 倍。
Gemini 3.5 Flash 電腦使用整合
Google DeepMind 已將電腦使用作為原生工具整合到 Gemini 3.5 Flash 中,使代理能夠在瀏覽器、行動裝置和桌面環境中看見、推理並採取行動。