101

為什麼專業化在 AI 系統中是不可避免的

根據 Goldfeder 等人在 2026 年的研究,專業化是 AI 效能的結構性必要條件,因為有限資源使得集中容量比廣泛通用性更有效。

102

OpenAI Signals: 全球 ChatGPT 採用趨勢分析

OpenAI Signals 數據顯示,ChatGPT 使用在全球範圍內正在深化和擴展,用戶在註冊六個月後每日訊息量增加 50%,執行的任務種類翻倍。

103

Hugging Face 社群評估與 Every Eval Ever (EEE) 整合

Hugging Face 已將社群評估與 Every Eval Ever (EEE) 計畫整合,實現標準化評估結果的跨平台發布,並在模型頁面與詳細技術記錄之間建立直接連結。

104

OpenAI 核心傾印流行病學:修復 18 年前的 libunwind 錯誤

OpenAI 在其 Rockset 資料基礎設施中識別並解決了兩種不同的崩潰群體,包括一種無聲的硬體故障和 GNU libunwind 中罕見的 18 年前競爭條件。

105

Genebench-Pro 內部:基因組 AI 基準測試的案例研究

OpenAI 的 Genebench-Pro 提供了一個專門的基準,用於評估 AI 模型在複雜基因組任務上的表現,涵蓋體細胞腫瘤學、功能基因組學和族群遺傳學的十個詳細案例研究。

106

OpenAI 推出 GeneBench-Pro 用於計算生物學推理

OpenAI 已發布 GeneBench-Pro,這是一個研究級基準,旨在評估 AI 代理在計算生物學中的高級科學判斷和迭代分析能力。

107

DiScoFormer: 用於密度與分數的單一 Transformer,適用於各種分布

DiScoFormer 是一種新的基於 Transformer 的模型,能在單次前向傳遞中從一組資料點估計分布的密度與分數,且無需為新分布重新訓練。

108

OpenAI 映射歐洲 AI 勞動力機遇報告 2026

OpenAI 的 2026 年報告將其 AI 工作過渡框架擴展到 EU,發現大約 12% 的 EU 就業可能隨著 AI 增長,14% 面臨較高的近期自動化潛力,27% 可能重組,而 47% 則看到變化較不即時。

109

vLLM Semantic Router:透過微代理協作提升模型性能

vLLM 推出了 Semantic Router,這是一種服務層原語,將單次模型 API 調用轉化為微代理的受限協作,從而在複雜的基準測試中超越前沿模型。

110

HP Inc. 與 OpenAI 的策略合作夥伴關係

HP Inc. 正在利用 OpenAI Frontier 平台擴大其與 OpenAI 的策略合作夥伴關係,將 AI agents 和工作流部署到客戶支援、安全和軟體開發領域。

111

GPT-5.6 Sol 預覽:功能、防護與可用性

OpenAI 預覽了 GPT-5.6 Sol,其旗艦次世代模型,連同 Terra 和 Luna 一起,強調了更強的編碼、生物學和網路安全能力,並附有增強的防護措施以及對受信任合作夥伴的有限發布。

112

Hugging Face Jobs: 使用單一指令部署 vLLM 伺服器

Hugging Face 現在允許使用者透過 HF Jobs 使用單一指令在其基礎設施上部署私人且與 OpenAI 相容的 vLLM 端點,提供適合測試、評估和批次生成的按秒計費替代方案。

113

OpenAI Codex 代理 AI 採用與影響

OpenAI 報告知識工作從短暫的聊天機器人互動透過 Codex 轉移到長期代理任務,非開發者採用自 2025 年 8 月以來增長高達 189 倍。

114

Gemini 3.5 Flash 電腦使用整合

Google DeepMind 已將電腦使用作為原生工具整合到 Gemini 3.5 Flash 中,使代理能夠在瀏覽器、行動裝置和桌面環境中看見、推理並採取行動。

115

NVIDIA NeMo AutoModel 加速 Mixture-of-Experts 模型的微調

NVIDIA NeMo AutoModel 透過在 Hugging Face Transformers v5 上加入 Expert Parallelism、DeepEP 與 TransformerEngine 核心,提供 3.4‑3.7 倍更高的訓練吞吐量與 29‑32% 更低的 GPU 記憶體使用量,以微調 Mixture-of-Experts 模型,且僅需一行 import 變更。

116

OpenAI 與 Broadcom 發表 Jalapeño LLM 推論晶片

OpenAI 與 Broadcom 推出了 Jalapeño,這是一款專為 LLM 推論優化的客製化 AI 加速器,旨在提高每瓦性能並降低運算成本。

117

Hugging Face FFASR 排行榜:評測遠場 ASR

Hugging Face 與 Treble Technologies 推出了 FFASR 排行榜,這是首個開放的社群驅動基準,用於量化近場與遠場 Automatic Speech Recognition (ASR) 在真實聲學環境中的效能差距。

118

GPT-5 Pro 在免疫學中:解決 T 細胞專化之謎

免疫學家 Derya Unutmaz 使用 GPT-5 Pro 解決了一個關於去氧葡萄糖如何影響 T 細胞專化的三年舊之謎,展示了該模型產生新穎生物學見解並預測未發表實驗結果的能力。

119

OpenAI 與 Appia 基金會:為先進 AI 建立共享標準

OpenAI 協助成立 Appia 基金會,開發開放、模組化的規範,將國際 AI 標準轉化為實務評估準則,以確保組織與司法管轄區之間的互通性。

120

Qwen-AgentWorld 發布:七個領域的語言世界模型及其對通用代理的影響

Qwen 推出 Qwen‑AgentWorld,一個模擬七種代理環境的語言世界模型,透過可控模擬與統一的下一狀態預測提升通用代理的效能。

121

Omio 對話式旅遊與 AI 原生運營

Omio 正利用 OpenAI 模型,從基於搜尋的旅遊規劃過渡到對話式商務,並將產品開發時間降低至先前水平的約 20%。

122

Hugging Face huggingface_hub 發布自動化

Hugging Face 透過實施使用開源工具和開放權重模型的 AI 驅動、人在迴圈中的 CI/CD 管道,將 huggingface_hub 的發布週期從 4-6 週轉換為每週一次。

123

在 Transformers.js 中實驗 Cross-Origin Storage API

Hugging Face 展示了 Transformers.js 如何使用實驗性的 Cross-Origin Storage API 以雜湊方式快取模型和 Wasm 資源,從而消除跨來源的重複下載。

124

vLLM-Omni TTS 推理工程

vLLM-Omni 為 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型進行了 TTS 推理工程,透過應用針對特定模型的優化來解耦延遲與吞吐量瓶頸,顯著提升了音訊吞吐量並降低了端到端延遲。

125

PP-OCRv6 發布:支援 50 種語言的 OCR,參數量從 1.5M 到 34.5M

PaddlePaddle 發布了 PP-OCRv6,一個支援 50 種語言、參數量從 1.5M 到 34.5M 的可擴展 OCR 模型家族。

126

OpenAI Patch the Planet 倡議

OpenAI 已推出 Patch the Planet,這是一項與 Trail of Bits 合作的 Daybreak 計畫,利用 AI 輔助的安全研究與人工審查,識別並修補關鍵開源軟體中的漏洞。

127

Daybreak: 為保護世界上每個組織的工具

OpenAI 宣布擴展 Daybreak,發布更新的 Codex Security 外掛、GPT‑5.5‑Cyber 的完整版本、網路夥伴計畫以及 Patch the Planet 計畫,以協助防禦者以機器速度尋找、驗證及修補漏洞。

128

Hugging Face 本地模型於 OpenClaw PR 分類

Hugging Face 展示了如何將 Gemma 4 與 Qwen 3.6 等本地模型部署於代理式 harness 中,實現對 OpenClaw 倉庫的 GitHub issue 與 pull request 進行即時、零成本的分流。

129

OpenAI Codex-maxxing 用於長期工作

OpenAI 已發布一篇白皮書,詳細說明了將 Codex 作為持續工作區以管理複雜、多提示工作流程及長期專案的策略。

130

三星電子部署 ChatGPT Enterprise 與 Codex

三星電子正在向韓國所有員工以及全球 Device eXperience (DX) 部門的所有員工部署 ChatGPT Enterprise 與 Codex,以提升研發、製造及企業職能的生產力。

131

MosaicLeaks:解決深度研究代理的隱私洩漏問題

Hugging Face 推出 MosaicLeaks 基準以及隱私感知深度研究(PA-DR)訓練方法,以防止研究代理透過外部網路查詢洩漏企業私密資料。

132

ChatGPT Enterprise 使用分析與支出控制更新

OpenAI 為 ChatGPT Enterprise 推出信用使用分析與更新的支出控制,協助組織追蹤信用消耗並在規模上管理 AI 成本。

133

提升 ChatGPT 的健康智慧

OpenAI 已使用 GPT-5.5 Instant 更新了 ChatGPT,該模型展現了與前沿 Thinking 模型相媲美的健康智慧,且在生產健康流量中的事實性問題減少了 71%。

134

OpenAI o3 Deep Research 罕見遺傳病診斷

研究人員使用 OpenAI o3 Deep Research,透過 AI 輔助研究工作流程,在 376 例未解決的罕見兒童遺傳病病例中達成額外 4.8% 的診斷產出。

135

Hugging Face PEFT:評估 LoRA 的替代方案

Hugging Face 對 PEFT 套件的基準測試顯示,雖然 LoRA 受到廣泛使用,但其他參數效率微調技術(如 OFT 與 Lily)在記憶體效率與測試準確度上,視任務而定,能夠超越 LoRA。

136

Hugging Face 在代理工具上的開放模型基準測試

Hugging Face 推出全新基準測試框架,用以評估不同模型規模與函式庫版本對程式碼代理使用軟體工具時的效率與成功率的影響。

137

Strands Robots 與 LeRobot 整合:從 Hugging Face Hub 資料集到實體機器人部署

Hugging Face 宣布 Strands Robots SDK 與 LeRobot 的整合,讓使用者能錄製機器人示範、推送至 Hub、在模擬環境中執行策略,並只需更改一個參數即可將相同程式碼部署到實體 SO-101 機器人,同時透過基於 Zenoh 的網狀網路協調多台機器人。

138

OpenAI AI 化學家:使用 GPT-5.4 改善 Chan‑Lam 耦合反應

OpenAI 與 Molecule.one 使用 GPT-5.4 與 Maria AI 代理人,自主發現並驗證了一種利用 TEMPO 改善一次性磺酰胺 Chan‑Lam 耦合產率的方法。

139

GLM-5.2:為長期任務打造

GLM-5.2 由 Z.AI 在 Hugging Face 發布,具備堅實的 1M 令牌上下文、透過 IndexShare 與 MTP 改進的架構、努力層級控制,且在長期編碼基準測試中展現強大的開源表現。

140

代理資源發現 (ARD) 規範與 Hugging Face 實作

Hugging Face 已推出代理資源發現 (ARD) 規範的參考實作,這是一項開放標準,允許 AI 代理人在執行時動態搜尋並整合工具、技能與其他代理人。

141

OpenAI 推出 LifeSciBench 以評估生命科學領域的具代理性 AI

OpenAI 已發布 LifeSciBench,這是一套包含 750 個由專家撰寫的任務的基準,旨在衡量 AI 系統如何處理複雜、真實的生命科學研究工作流程,而非僅僅回憶簡單事實。

142

Google DeepMind AI 加速規劃:英國住宅建設

Google DeepMind 正與英國政府合作,開發一款以 Gemini 為動力的 AI 規劃原型,旨在將住宅規劃申請的處理時間減半。

143

DeepMind AI 控制路線圖公告

DeepMind 發布了其 AI 控制路線圖,這是一個深度防禦框架,將內部 AI 代理視為內部威脅,並加入監控、監督與回應層,以保護日益強大的代理。

144

Qwen 機器人套件:統一的導航、操作與世界建模基礎模型

Qwen 推出了 Qwen‑Robot 套件——三個基礎模型(RobotNav、RobotManip、RobotWorld),將語言轉換為導航、操作和世界預測動作,使得在數十種形態下的統一代理機器人得以實現。

145

vLLM 語意路由器 Fusion 原語實現可程式化的多模型服務

vLLM 為其語意路由器引入了 Fusion 原語,使可程式化的多模型面板、評判與合成成為一等的服務模式。

146

OpenAI 部署模擬:使用真實對話重播進行發布前風險預測

OpenAI 推出了部署模擬,這是一種在發布前重播真實使用者對話給候選模型的方法,用以預測不良行為率並提升安全評估。

147

Qwen-RobotWorld:無限世界給具身代理人

Qwen-RobotWorld 是一個統一的世界模型,使用自然語言作為通用的動作介面,以實現跨情境的物理泛化,涵蓋 20 多種機器人形態。

148

Qwen-RobotManip:對齊解鎖機器人操作基礎模型的規模化

Qwen-RobotManip 是一個視覺-語言-動作(VLA)基礎模型,透過統一的對齊框架與人類到機器人的資料合成管線,實現了在多樣化機器人形態與分布外任務上的最先進泛化能力。

149

Qwen-RobotNav:可擴展的代理系統導航模型

Qwen-RobotNav 是基於 Qwen3-VL 的統一導航模型,透過將視覺上下文視為可在推論時控制的介面,實現在五個導航領域的最先進表現。

150

OpenAI 合作夥伴網路公告

OpenAI 已推出 OpenAI 合作夥伴網路,這是一個由 1.5 億美元投資支持的全球生態系統,旨在協助企業識別使用案例、重新設計工作流程,並大規模部署 AI 解決方案。