封存 · 11 個實驗室 · 3,049 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

401

NVIDIA NeMo AutoModel 加速 Mixture-of-Experts 模型的微調

NVIDIA NeMo AutoModel 透過在 Hugging Face Transformers v5 上加入 Expert Parallelism、DeepEP 與 TransformerEngine 核心,提供 3.4‑3.7 倍更高的訓練吞吐量與 29‑32% 更低的 GPU 記憶體使用量,以微調 Mixture-of-Experts 模型,且僅需一行 import 變更。

402

Mistral AI 推出細粒度管理控制、作用域 API 金鑰與多帳戶連接器

Mistral AI 宣布推出新的連接器功能,包括正式版管理控制、作用域 API 金鑰、多帳戶連接器、除錯工具,以及在 Workflows 和 Vibe Code 中的整合,以提升企業 AI 工作負載的安全性與可靠性。

403

OpenAI 與 Broadcom 發表 Jalapeño LLM 推論晶片

OpenAI 與 Broadcom 推出了 Jalapeño,這是一款專為 LLM 推論優化的客製化 AI 加速器,旨在提高每瓦性能並降低運算成本。

404

Hugging Face FFASR 排行榜:評測遠場 ASR

Hugging Face 與 Treble Technologies 推出了 FFASR 排行榜,這是首個開放的社群驅動基準,用於量化近場與遠場 Automatic Speech Recognition (ASR) 在真實聲學環境中的效能差距。

405

GPT-5 Pro 在免疫學中:解決 T 細胞專化之謎

免疫學家 Derya Unutmaz 使用 GPT-5 Pro 解決了一個關於去氧葡萄糖如何影響 T 細胞專化的三年舊之謎,展示了該模型產生新穎生物學見解並預測未發表實驗結果的能力。

406

OpenAI 與 Appia 基金會:為先進 AI 建立共享標準

OpenAI 協助成立 Appia 基金會,開發開放、模組化的規範,將國際 AI 標準轉化為實務評估準則,以確保組織與司法管轄區之間的互通性。

407

Mistral OCR 4 發佈說明 / 有什麼新功能

Mistral AI 發佈了 Mistral OCR 4,這是一款高性能的文件解析模型,支持 170 種語言,並提供包括邊界框、區塊分類和置信度分數在內的結構化輸出。

408

Qwen-AgentWorld 發布:七個領域的語言世界模型及其對通用代理的影響

Qwen 推出 Qwen‑AgentWorld,一個模擬七種代理環境的語言世界模型,透過可控模擬與統一的下一狀態預測提升通用代理的效能。

409

vLLM-Omni TTS 推理工程

vLLM-Omni 為 Qwen3-TTS、VoxCPM2、Higgs Audio V3 和 Fish Speech S2 Pro 等模型進行了 TTS 推理工程,透過應用針對特定模型的優化來解耦延遲與吞吐量瓶頸,顯著提升了音訊吞吐量並降低了端到端延遲。

410

在 Transformers.js 中實驗 Cross-Origin Storage API

Hugging Face 展示了 Transformers.js 如何使用實驗性的 Cross-Origin Storage API 以雜湊方式快取模型和 Wasm 資源,從而消除跨來源的重複下載。

411

Omio 對話式旅遊與 AI 原生運營

Omio 正利用 OpenAI 模型,從基於搜尋的旅遊規劃過渡到對話式商務,並將產品開發時間降低至先前水平的約 20%。

412

Hugging Face huggingface_hub 發布自動化

Hugging Face 透過實施使用開源工具和開放權重模型的 AI 驅動、人在迴圈中的 CI/CD 管道,將 huggingface_hub 的發布週期從 4-6 週轉換為每週一次。

413

PP-OCRv6 發布:支援 50 種語言的 OCR,參數量從 1.5M 到 34.5M

PaddlePaddle 發布了 PP-OCRv6,一個支援 50 種語言、參數量從 1.5M 到 34.5M 的可擴展 OCR 模型家族。

414

Daybreak: 為保護世界上每個組織的工具

OpenAI 宣布擴展 Daybreak,發布更新的 Codex Security 外掛、GPT‑5.5‑Cyber 的完整版本、網路夥伴計畫以及 Patch the Planet 計畫,以協助防禦者以機器速度尋找、驗證及修補漏洞。

415

OpenAI Patch the Planet 倡議

OpenAI 已推出 Patch the Planet,這是一項與 Trail of Bits 合作的 Daybreak 計畫,利用 AI 輔助的安全研究與人工審查,識別並修補關鍵開源軟體中的漏洞。

416

Hugging Face 本地模型於 OpenClaw PR 分類

Hugging Face 展示了如何將 Gemma 4 與 Qwen 3.6 等本地模型部署於代理式 harness 中,實現對 OpenClaw 倉庫的 GitHub issue 與 pull request 進行即時、零成本的分流。

417

OpenAI Codex-maxxing 用於長期工作

OpenAI 已發布一篇白皮書,詳細說明了將 Codex 作為持續工作區以管理複雜、多提示工作流程及長期專案的策略。

418

三星電子部署 ChatGPT Enterprise 與 Codex

三星電子正在向韓國所有員工以及全球 Device eXperience (DX) 部門的所有員工部署 ChatGPT Enterprise 與 Codex,以提升研發、製造及企業職能的生產力。

419

MosaicLeaks:解決深度研究代理的隱私洩漏問題

Hugging Face 推出 MosaicLeaks 基準以及隱私感知深度研究(PA-DR)訓練方法,以防止研究代理透過外部網路查詢洩漏企業私密資料。

420

ChatGPT Enterprise 使用分析與支出控制更新

OpenAI 為 ChatGPT Enterprise 推出信用使用分析與更新的支出控制,協助組織追蹤信用消耗並在規模上管理 AI 成本。

421

提升 ChatGPT 的健康智慧

OpenAI 已使用 GPT-5.5 Instant 更新了 ChatGPT,該模型展現了與前沿 Thinking 模型相媲美的健康智慧,且在生產健康流量中的事實性問題減少了 71%。

422

OpenAI o3 Deep Research 罕見遺傳病診斷

研究人員使用 OpenAI o3 Deep Research,透過 AI 輔助研究工作流程,在 376 例未解決的罕見兒童遺傳病病例中達成額外 4.8% 的診斷產出。

423

Hugging Face 在代理工具上的開放模型基準測試

Hugging Face 推出全新基準測試框架,用以評估不同模型規模與函式庫版本對程式碼代理使用軟體工具時的效率與成功率的影響。

424

Hugging Face PEFT:評估 LoRA 的替代方案

Hugging Face 對 PEFT 套件的基準測試顯示,雖然 LoRA 受到廣泛使用,但其他參數效率微調技術(如 OFT 與 Lily)在記憶體效率與測試準確度上,視任務而定,能夠超越 LoRA。

425

Anthropic Project Fetch 第二階段

Claude Opus 4.7 展現出自主執行機器人控制任務的能力,速度約為人類團隊的 20 倍,標誌著向物理自主 AI 的轉變。

426

Grok for Word 發佈說明

xAI 已發佈 Grok for Word,這是一款免費的 Microsoft 365 外掛程式,讓使用者能夠生成結構化文件、進行網頁與 X 研究,並從外部連接器整合數據。

427

Grok 模型現已可在 Databricks Agent Bricks 上使用

xAI 已將 Grok 模型整合至 Databricks Agent Bricks 平台,讓企業能夠在受管存取權限下,針對 Lakehouse 數據構建運行 AI 代理。

428

Strands Robots 與 LeRobot 整合:從 Hugging Face Hub 資料集到實體機器人部署

Hugging Face 宣布 Strands Robots SDK 與 LeRobot 的整合,讓使用者能錄製機器人示範、推送至 Hub、在模擬環境中執行策略,並只需更改一個參數即可將相同程式碼部署到實體 SO-101 機器人,同時透過基於 Zenoh 的網狀網路協調多台機器人。

429

OpenAI AI 化學家:使用 GPT-5.4 改善 Chan‑Lam 耦合反應

OpenAI 與 Molecule.one 使用 GPT-5.4 與 Maria AI 代理人,自主發現並驗證了一種利用 TEMPO 改善一次性磺酰胺 Chan‑Lam 耦合產率的方法。

430

GLM-5.2:為長期任務打造

GLM-5.2 由 Z.AI 在 Hugging Face 發布,具備堅實的 1M 令牌上下文、透過 IndexShare 與 MTP 改進的架構、努力層級控制,且在長期編碼基準測試中展現強大的開源表現。

431

代理資源發現 (ARD) 規範與 Hugging Face 實作

Hugging Face 已推出代理資源發現 (ARD) 規範的參考實作,這是一項開放標準,允許 AI 代理人在執行時動態搜尋並整合工具、技能與其他代理人。

432

OpenAI 推出 LifeSciBench 以評估生命科學領域的具代理性 AI

OpenAI 已發布 LifeSciBench,這是一套包含 750 個由專家撰寫的任務的基準,旨在衡量 AI 系統如何處理複雜、真實的生命科學研究工作流程,而非僅僅回憶簡單事實。

433

Anthropic 在首爾開設辦公室,擴展韓國人工智慧生態系

Anthropic 已在首爾開設新辦公室,並與韓國科學技術資訊部簽署備忘錄,以推動人工智慧安全,並擴大 Claude 在韓國企業與研究機構中的應用。

434

Grok 4.3 在 Amazon Bedrock 上發布

xAI 已在 Amazon Bedrock 上正式提供 Grok 4.3,其具備 100 萬 token 的上下文窗口,並擁有前沿模型中最低的幻覺率。

435

Google DeepMind AI 加速規劃:英國住宅建設

Google DeepMind 正與英國政府合作,開發一款以 Gemini 為動力的 AI 規劃原型,旨在將住宅規劃申請的處理時間減半。

436

DeepMind AI 控制路線圖公告

DeepMind 發布了其 AI 控制路線圖,這是一個深度防禦框架,將內部 AI 代理視為內部威脅,並加入監控、監督與回應層,以保護日益強大的代理。

437

Qwen 機器人套件:統一的導航、操作與世界建模基礎模型

Qwen 推出了 Qwen‑Robot 套件——三個基礎模型(RobotNav、RobotManip、RobotWorld),將語言轉換為導航、操作和世界預測動作,使得在數十種形態下的統一代理機器人得以實現。

438

vLLM 語意路由器 Fusion 原語實現可程式化的多模型服務

vLLM 為其語意路由器引入了 Fusion 原語,使可程式化的多模型面板、評判與合成成為一等的服務模式。

439

OpenAI 部署模擬:使用真實對話重播進行發布前風險預測

OpenAI 推出了部署模擬,這是一種在發布前重播真實使用者對話給候選模型的方法,用以預測不良行為率並提升安全評估。

440

Qwen-RobotWorld:無限世界給具身代理人

Qwen-RobotWorld 是一個統一的世界模型,使用自然語言作為通用的動作介面,以實現跨情境的物理泛化,涵蓋 20 多種機器人形態。

441

Qwen-RobotManip:對齊解鎖機器人操作基礎模型的規模化

Qwen-RobotManip 是一個視覺-語言-動作(VLA)基礎模型,透過統一的對齊框架與人類到機器人的資料合成管線,實現了在多樣化機器人形態與分布外任務上的最先進泛化能力。

442

Qwen-RobotNav:可擴展的代理系統導航模型

Qwen-RobotNav 是基於 Qwen3-VL 的統一導航模型,透過將視覺上下文視為可在推論時控制的介面,實現在五個導航領域的最先進表現。

443

Anthropic Claude Code 使用報告 2026 年 6 月 – 對代理式編碼、專業知識與勞動影響的發現

Anthropic 分析了約 40 萬筆 Claude Code 使用會話(2025 年 10 月至 2026 年 4 月),發現使用者負責規劃任務,Claude 負責執行,成功率與各職業的專業軟體工程師相當,且領域專業知識——而非程式技能——是提升成功率與任務價值的關鍵因素。

444

Grok for PowerPoint 發佈說明

xAI 已發佈 Grok for PowerPoint,這是一款免費的 Microsoft 365 外掛程式,讓使用者能夠利用 Grok 的 AI 能力來生成簡報檔、研究內容並套用樣式。

445

Grok Imagine Video 1.5 發布說明

xAI 發布了 Grok Imagine Video 1.5,這是一款圖像轉影片模型,具備更優異的運動表現、物理真實感與內建音訊生成,且生成速度更快。

446

Grok Build Agent Dashboard 發佈

xAI 已在 Grok Build 中推出了 Agent Dashboard,這是一個集中化的管理介面,允許開發者同時監控、派遣與互動多個並行編碼會話。

447

OpenAI 合作夥伴網路公告

OpenAI 已推出 OpenAI 合作夥伴網路,這是一個由 1.5 億美元投資支持的全球生態系統,旨在協助企業識別使用案例、重新設計工作流程,並大規模部署 AI 解決方案。

448

OpenAI Academy 課程:在工作中推動 AI 採用

OpenAI 推出了三門新課程——AI 基礎、應用 AI 基礎與代理與工作流程——旨在協助組織建立 AI 流利度,並將個別任務的改進轉化為結構化、由代理協助的工作流程。

449

MiniMax M3 vLLM 支援:面向 1M 令牌多模態推理的 Day-0 服務

vLLM 已發布對 MiniMax M3 模型系列的 day-0 支援,使得能夠使用 MiniMax 稀疏注意力 (MSA) 高效服務 1M 令牌上下文與原生多模態推理。

450

Preply 與 OpenAI:以 AI 個人化語言學習

Preply 已整合 OpenAI API,打造課程洞察,這項工具透過自動化回饋與針對性練習,將 1 對 1 人類導師課程轉化為個人化的學習旅程。