為什麼專業化在 AI 系統中是不可避免的
根據 Goldfeder 等人在 2026 年的研究,專業化是 AI 效能的結構性必要條件,因為有限資源使得集中容量比廣泛通用性更有效。
OpenAI Signals: 全球 ChatGPT 採用趨勢分析
OpenAI Signals 數據顯示,ChatGPT 使用在全球範圍內正在深化和擴展,用戶在註冊六個月後每日訊息量增加 50%,執行的任務種類翻倍。
Hugging Face 社群評估與 Every Eval Ever (EEE) 整合
Hugging Face 已將社群評估與 Every Eval Ever (EEE) 計畫整合,實現標準化評估結果的跨平台發布,並在模型頁面與詳細技術記錄之間建立直接連結。
OpenAI 核心傾印流行病學:修復 18 年前的 libunwind 錯誤
OpenAI 在其 Rockset 資料基礎設施中識別並解決了兩種不同的崩潰群體,包括一種無聲的硬體故障和 GNU libunwind 中罕見的 18 年前競爭條件。
Genebench-Pro 內部:基因組 AI 基準測試的案例研究
OpenAI 的 Genebench-Pro 提供了一個專門的基準,用於評估 AI 模型在複雜基因組任務上的表現,涵蓋體細胞腫瘤學、功能基因組學和族群遺傳學的十個詳細案例研究。
OpenAI 推出 GeneBench-Pro 用於計算生物學推理
OpenAI 已發布 GeneBench-Pro,這是一個研究級基準,旨在評估 AI 代理在計算生物學中的高級科學判斷和迭代分析能力。
DiScoFormer: 用於密度與分數的單一 Transformer,適用於各種分布
DiScoFormer 是一種新的基於 Transformer 的模型,能在單次前向傳遞中從一組資料點估計分布的密度與分數,且無需為新分布重新訓練。
OpenAI 映射歐洲 AI 勞動力機遇報告 2026
OpenAI 的 2026 年報告將其 AI 工作過渡框架擴展到 EU,發現大約 12% 的 EU 就業可能隨著 AI 增長,14% 面臨較高的近期自動化潛力,27% 可能重組,而 47% 則看到變化較不即時。
vLLM Semantic Router:透過微代理協作提升模型性能
vLLM 推出了 Semantic Router,這是一種服務層原語,將單次模型 API 調用轉化為微代理的受限協作,從而在複雜的基準測試中超越前沿模型。
HP Inc. 與 OpenAI 的策略合作夥伴關係
HP Inc. 正在利用 OpenAI Frontier 平台擴大其與 OpenAI 的策略合作夥伴關係,將 AI agents 和工作流部署到客戶支援、安全和軟體開發領域。
GPT-5.6 Sol 預覽:功能、防護與可用性
OpenAI 預覽了 GPT-5.6 Sol,其旗艦次世代模型,連同 Terra 和 Luna 一起,強調了更強的編碼、生物學和網路安全能力,並附有增強的防護措施以及對受信任合作夥伴的有限發布。
Hugging Face Jobs: 使用單一指令部署 vLLM 伺服器
Hugging Face 現在允許使用者透過 HF Jobs 使用單一指令在其基礎設施上部署私人且與 OpenAI 相容的 vLLM 端點,提供適合測試、評估和批次生成的按秒計費替代方案。
OpenAI Codex 代理 AI 採用與影響
OpenAI 報告知識工作從短暫的聊天機器人互動透過 Codex 轉移到長期代理任務,非開發者採用自 2025 年 8 月以來增長高達 189 倍。
Gemini 3.5 Flash 電腦使用整合
Google DeepMind 已將電腦使用作為原生工具整合到 Gemini 3.5 Flash 中,使代理能夠在瀏覽器、行動裝置和桌面環境中看見、推理並採取行動。
NVIDIA NeMo AutoModel 加速 Mixture-of-Experts 模型的微調
NVIDIA NeMo AutoModel 透過在 Hugging Face Transformers v5 上加入 Expert Parallelism、DeepEP 與 TransformerEngine 核心,提供 3.4‑3.7 倍更高的訓練吞吐量與 29‑32% 更低的 GPU 記憶體使用量,以微調 Mixture-of-Experts 模型,且僅需一行 import 變更。
OpenAI 與 Broadcom 發表 Jalapeño LLM 推論晶片
OpenAI 與 Broadcom 推出了 Jalapeño,這是一款專為 LLM 推論優化的客製化 AI 加速器,旨在提高每瓦性能並降低運算成本。
Hugging Face FFASR 排行榜:評測遠場 ASR
Hugging Face 與 Treble Technologies 推出了 FFASR 排行榜,這是首個開放的社群驅動基準,用於量化近場與遠場 Automatic Speech Recognition (ASR) 在真實聲學環境中的效能差距。
GPT-5 Pro 在免疫學中:解決 T 細胞專化之謎
免疫學家 Derya Unutmaz 使用 GPT-5 Pro 解決了一個關於去氧葡萄糖如何影響 T 細胞專化的三年舊之謎,展示了該模型產生新穎生物學見解並預測未發表實驗結果的能力。
OpenAI 與 Appia 基金會:為先進 AI 建立共享標準
OpenAI 協助成立 Appia 基金會,開發開放、模組化的規範,將國際 AI 標準轉化為實務評估準則,以確保組織與司法管轄區之間的互通性。
Qwen-AgentWorld 發布:七個領域的語言世界模型及其對通用代理的影響
Qwen 推出 Qwen‑AgentWorld,一個模擬七種代理環境的語言世界模型,透過可控模擬與統一的下一狀態預測提升通用代理的效能。
Omio 對話式旅遊與 AI 原生運營
Omio 正利用 OpenAI 模型,從基於搜尋的旅遊規劃過渡到對話式商務,並將產品開發時間降低至先前水平的約 20%。
Hugging Face huggingface_hub 發布自動化
Hugging Face 透過實施使用開源工具和開放權重模型的 AI 驅動、人在迴圈中的 CI/CD 管道,將 huggingface_hub 的發布週期從 4-6 週轉換為每週一次。
在 Transformers.js 中實驗 Cross-Origin Storage API
Hugging Face 展示了 Transformers.js 如何使用實驗性的 Cross-Origin Storage API 以雜湊方式快取模型和 Wasm 資源,從而消除跨來源的重複下載。
vLLM-Omni TTS 推理工程
vLLM-Omni 為 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型進行了 TTS 推理工程,透過應用針對特定模型的優化來解耦延遲與吞吐量瓶頸,顯著提升了音訊吞吐量並降低了端到端延遲。
PP-OCRv6 發布:支援 50 種語言的 OCR,參數量從 1.5M 到 34.5M
PaddlePaddle 發布了 PP-OCRv6,一個支援 50 種語言、參數量從 1.5M 到 34.5M 的可擴展 OCR 模型家族。
OpenAI Patch the Planet 倡議
OpenAI 已推出 Patch the Planet,這是一項與 Trail of Bits 合作的 Daybreak 計畫,利用 AI 輔助的安全研究與人工審查,識別並修補關鍵開源軟體中的漏洞。
Daybreak: 為保護世界上每個組織的工具
OpenAI 宣布擴展 Daybreak,發布更新的 Codex Security 外掛、GPT‑5.5‑Cyber 的完整版本、網路夥伴計畫以及 Patch the Planet 計畫,以協助防禦者以機器速度尋找、驗證及修補漏洞。
Hugging Face 本地模型於 OpenClaw PR 分類
Hugging Face 展示了如何將 Gemma 4 與 Qwen 3.6 等本地模型部署於代理式 harness 中,實現對 OpenClaw 倉庫的 GitHub issue 與 pull request 進行即時、零成本的分流。
OpenAI Codex-maxxing 用於長期工作
OpenAI 已發布一篇白皮書,詳細說明了將 Codex 作為持續工作區以管理複雜、多提示工作流程及長期專案的策略。
三星電子部署 ChatGPT Enterprise 與 Codex
三星電子正在向韓國所有員工以及全球 Device eXperience (DX) 部門的所有員工部署 ChatGPT Enterprise 與 Codex,以提升研發、製造及企業職能的生產力。
MosaicLeaks:解決深度研究代理的隱私洩漏問題
Hugging Face 推出 MosaicLeaks 基準以及隱私感知深度研究(PA-DR)訓練方法,以防止研究代理透過外部網路查詢洩漏企業私密資料。
ChatGPT Enterprise 使用分析與支出控制更新
OpenAI 為 ChatGPT Enterprise 推出信用使用分析與更新的支出控制,協助組織追蹤信用消耗並在規模上管理 AI 成本。
提升 ChatGPT 的健康智慧
OpenAI 已使用 GPT-5.5 Instant 更新了 ChatGPT,該模型展現了與前沿 Thinking 模型相媲美的健康智慧,且在生產健康流量中的事實性問題減少了 71%。
OpenAI o3 Deep Research 罕見遺傳病診斷
研究人員使用 OpenAI o3 Deep Research,透過 AI 輔助研究工作流程,在 376 例未解決的罕見兒童遺傳病病例中達成額外 4.8% 的診斷產出。
Hugging Face PEFT:評估 LoRA 的替代方案
Hugging Face 對 PEFT 套件的基準測試顯示,雖然 LoRA 受到廣泛使用,但其他參數效率微調技術(如 OFT 與 Lily)在記憶體效率與測試準確度上,視任務而定,能夠超越 LoRA。
Hugging Face 在代理工具上的開放模型基準測試
Hugging Face 推出全新基準測試框架,用以評估不同模型規模與函式庫版本對程式碼代理使用軟體工具時的效率與成功率的影響。
Strands Robots 與 LeRobot 整合:從 Hugging Face Hub 資料集到實體機器人部署
Hugging Face 宣布 Strands Robots SDK 與 LeRobot 的整合,讓使用者能錄製機器人示範、推送至 Hub、在模擬環境中執行策略,並只需更改一個參數即可將相同程式碼部署到實體 SO-101 機器人,同時透過基於 Zenoh 的網狀網路協調多台機器人。
OpenAI AI 化學家:使用 GPT-5.4 改善 Chan‑Lam 耦合反應
OpenAI 與 Molecule.one 使用 GPT-5.4 與 Maria AI 代理人,自主發現並驗證了一種利用 TEMPO 改善一次性磺酰胺 Chan‑Lam 耦合產率的方法。
GLM-5.2:為長期任務打造
GLM-5.2 由 Z.AI 在 Hugging Face 發布,具備堅實的 1M 令牌上下文、透過 IndexShare 與 MTP 改進的架構、努力層級控制,且在長期編碼基準測試中展現強大的開源表現。
代理資源發現 (ARD) 規範與 Hugging Face 實作
Hugging Face 已推出代理資源發現 (ARD) 規範的參考實作,這是一項開放標準,允許 AI 代理人在執行時動態搜尋並整合工具、技能與其他代理人。
OpenAI 推出 LifeSciBench 以評估生命科學領域的具代理性 AI
OpenAI 已發布 LifeSciBench,這是一套包含 750 個由專家撰寫的任務的基準,旨在衡量 AI 系統如何處理複雜、真實的生命科學研究工作流程,而非僅僅回憶簡單事實。
Google DeepMind AI 加速規劃:英國住宅建設
Google DeepMind 正與英國政府合作,開發一款以 Gemini 為動力的 AI 規劃原型,旨在將住宅規劃申請的處理時間減半。
DeepMind AI 控制路線圖公告
DeepMind 發布了其 AI 控制路線圖,這是一個深度防禦框架,將內部 AI 代理視為內部威脅,並加入監控、監督與回應層,以保護日益強大的代理。
Qwen 機器人套件:統一的導航、操作與世界建模基礎模型
Qwen 推出了 Qwen‑Robot 套件——三個基礎模型(RobotNav、RobotManip、RobotWorld),將語言轉換為導航、操作和世界預測動作,使得在數十種形態下的統一代理機器人得以實現。
vLLM 語意路由器 Fusion 原語實現可程式化的多模型服務
vLLM 為其語意路由器引入了 Fusion 原語,使可程式化的多模型面板、評判與合成成為一等的服務模式。
OpenAI 部署模擬:使用真實對話重播進行發布前風險預測
OpenAI 推出了部署模擬,這是一種在發布前重播真實使用者對話給候選模型的方法,用以預測不良行為率並提升安全評估。
Qwen-RobotWorld:無限世界給具身代理人
Qwen-RobotWorld 是一個統一的世界模型,使用自然語言作為通用的動作介面,以實現跨情境的物理泛化,涵蓋 20 多種機器人形態。
Qwen-RobotManip:對齊解鎖機器人操作基礎模型的規模化
Qwen-RobotManip 是一個視覺-語言-動作(VLA)基礎模型,透過統一的對齊框架與人類到機器人的資料合成管線,實現了在多樣化機器人形態與分布外任務上的最先進泛化能力。
Qwen-RobotNav:可擴展的代理系統導航模型
Qwen-RobotNav 是基於 Qwen3-VL 的統一導航模型,透過將視覺上下文視為可在推論時控制的介面,實現在五個導航領域的最先進表現。
OpenAI 合作夥伴網路公告
OpenAI 已推出 OpenAI 合作夥伴網路,這是一個由 1.5 億美元投資支持的全球生態系統,旨在協助企業識別使用案例、重新設計工作流程,並大規模部署 AI 解決方案。