封存 · 11 個實驗室 · 3,049 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

801

Hugging Face OpenClaw 遷移指南

Hugging Face 提供兩種方法——推理提供者與本地 llama.cpp 設定,將 OpenClaw 代理從受限的 Claude 模型遷移至開源替代方案。

802

Gemini 3.1 Flash Live 版本說明 / 新功能概覽

Google DeepMind 已推出 Gemini 3.1 Flash Live,一款高品質的音訊與語音模型,旨在提供自然即時的對話,具備更高精準度、降低延遲,且全球可用性擴大。

803

Google DeepMind 關於 AI 有害操控的研究

Google DeepMind 發布了一項新的研究報告與一套經實證驗證的工具組,用以衡量並降低 AI 被用於有害操控人類思想與行為的風險。

804

Lyria 3 Pro 發布:更長、具結構感知的音樂生成,遍及 Google 產品

DeepMind 宣布了 Lyria 3 Pro,一款能夠創建長達三分鐘、具結構感知的音樂生成模型,現已整合至 Google 產品,包括 Vertex AI、AI Studio、Google Vids、Gemini 與 ProducerAI。

805

OpenAI 模型規範:明確模型行為的框架

OpenAI 推出了模型規範,這是一個正式且公開的框架,旨在使預期的 AI 模型行為變得明確、可讀且可供使用者、開發者與研究人員修訂。

806

OpenAI 安全漏洞賞金計畫啟動

OpenAI 已啟動公開的安全漏洞賞金計畫,以識別超出傳統安全漏洞範疇的 AI 濫用與安全風險,特別針對代理風險、專有資訊洩漏與平台完整性。

807

Claude Code 自動模式:基於模型的權限防護機制,實現更安全的自主程式碼編寫

Anthropic 推出 Claude Code 自動模式,一種中間路線的權限系統,利用模型分類器核准動作,減少核准疲勞,同時防止危險的過度積極行為。

808

OpenAI 青少年安全政策套件與 gpt-oss-safeguard

OpenAI 發布了基於提示的安全政策以及開放權重的 gpt-oss-safeguard 模型,協助開發者在 AI 應用中實施符合年齡的青少年保護措施。

809

OpenAI 透過 Agentic Commerce Protocol 擴展 ChatGPT 的商品發現

OpenAI 透過擴充的 Agentic Commerce Protocol (ACP) 引入了加強的視覺購物與商品發現功能,簡化使用者尋找與比較商品的流程。

810

OpenAI 基金會更新

OpenAI 宣布,其基金會將在未來一年內於生命科學、經濟影響、AI 韌性與社群計畫等領域投資至少 10 億美元,以確保通用人工智慧(AGI)造福人類。

811

EVA 端對端語音代理評估框架

EVA 是一個全新的端對端框架,能同時評估語音代理的準確度與對話體驗,揭示任務成功與使用者滿意度之間的一致權衡。

812

vLLM Model Runner V2 版本說明 / 新功能

vLLM 推出了 Model Runner V2(MRV2),這是一個從頭重新實作的模型執行器,透過 GPU 原生、async‑first 與模組化的架構提升吞吐量並降低延遲。

813

Anthropic 經濟指數 2026 年 3 月報告:學習曲線

Anthropic 的 2026 年 3 月經濟指數報告顯示,Claude 的使用情境更加多元,低薪任務比例上升,且高使用年限使用者的成功率更高,顯示出『邊做邊學』的效應,以及潛在的技能偏向型影響。

814

Anthropic 機制設計:用於長時間執行應用程式開發

Anthropic 引入了一個三代理機制——規劃者、生成者與評估者——讓 Claude 能在數小時的運行中自主創造高品質的前端設計與全棧應用程式,解決了上下文限制與自我評估偏見的問題。

815

Mistral AI Voxtral TTS 發佈

Mistral AI 發佈了 Voxtral TTS,這是一個擁有 4B 參數的多語言文字轉語音模型,為企業級語音代理提供高自然度的語音生成和低延遲串流能力。

816

OpenAI Sora 2 安全框架

OpenAI 詳細說明了 Sora 2 的安全架構,重點在於來源訊號、基於同意的相似度管理,以及對音訊與影片的嚴格內容過濾。

817

Vibe Physics: 使用 Claude Opus 4.5 作為理論物理學的 AI 研究生

Schwartz 教授展示了 Claude Opus 4.5 可以在專家監督下執行前沿的理論物理研究,將原本需要一年的計算縮短至兩週。

818

用於科學計算的長期運行 Claude

Anthropic 證明了使用 Claude Opus 4.6 的為期數日的代理編碼工作流可以自動化複雜的科學計算任務,例如實現一個可微分的宇宙學 Boltzmann 解算器,將研究人員數月的努力縮短至幾天。

819

Anthropic 推出科學部落格以加速 AI 驅動的發現

Anthropic 推出了全新的科學部落格,致力於分享 AI 研究、實用的科學工作流程以及旨在加速科學進步的合作項目。

820

領域特定嵌入微調與 NVIDIA Nemotron – 一天內完成

NVIDIA 與 Hugging Face 發布了一個單 GPU、一天內完成的管線,對 Llama‑Nemotron‑Embed‑1B‑v2 模型進行合成領域資料的微調,實現超過 10% 的檢索提升,且在真實企業資料集上最高提升 26%。

821

OpenAI 內部程式碼代理監控系統

OpenAI 部署了一套以 GPT‑5.4 Thinking 為動力的監控系統,用以偵測內部程式碼代理的錯位與安全違規,並識別那些常僅在複雜、工具豐富的工作流程中才會顯現的行為。

822

OpenAI 收購 Astral

OpenAI 正收購 Astral,將其開源 Python 工具(包括 uv、Ruff 與 ty)整合至 Codex 生態系統,使 AI 代理能參與整個軟體開發生命週期。

823

Qwen3.5-Max-Preview 在 LMSys Arena 的發佈

Qwen 已將 Qwen3.5-Max-Preview 部署至 LMSys Arena,供社群評估,並於兩週內完成正式發布。

824

Hugging Face 開源狀況:2026 年春季

Hugging Face 報告稱,2025 年開源 AI 生態系統大幅擴張,特徵是中國在模型下載量上超過美國,且機器人領域迅速崛起成為最大的資料集類別。

825

Google DeepMind 測量通往 AGI 的進展:認知框架

Google DeepMind 已推出認知分類法與三階段評估協議,以實證方式衡量 AI 向人工通用智慧(AGI)的進展。

826

Mistral AI Forge: 企業級客製化尖端模型系統

Mistral AI 推出了 Forge,這是一個允許企業基於其專有機構知識構建並持續改進尖端 AI 模型的系統。

827

Holotron-12B 高吞吐量電腦使用代理

H 公司發布了 Holotron-12B,一款基於 NVIDIA Nemotron-Nano-2 VL 的多模態電腦使用模型,採用混合 SSM‑Attention 架構,以實現代理工作負載的高推理吞吐量。

828

OpenAI GPT-5.4 mini 與 nano 發布說明

OpenAI 已發布 GPT-5.4 mini 與 nano,這些高效能的小型模型將 GPT-5.4 的能力帶入高容量工作負載,顯著降低延遲與成本。

829

OpenAI 日本青少年安全藍圖

OpenAI 日本推出了日本青少年安全藍圖,這是一個將青少年安全置於便利與隱私之上,以保護年輕使用者免受 AI 相關風險的框架。

830

OpenAI 研究:員工如何使用 ChatGPT 獲取薪酬洞見

OpenAI 研究顯示,美國員工每日向 ChatGPT 發送近 300 萬條訊息,尋求薪資基準與補償指導,尤其是在高技能、資訊透明度低的職位。

831

Mistral Small 4 發佈說明 / 有什麼新功能

Mistral AI 已發佈 Mistral Small 4,這是一個採用 Apache 2.0 授權的統一開源模型,將推理、多模態與代理程式碼開發能力整合進單一且通用的架構中。

832

Mistral AI 與 NVIDIA 的合作夥伴關係:NVIDIA Nemotron 聯盟

Mistral AI 已作為創始成員加入 NVIDIA Nemotron 聯盟,利用 NVIDIA 的運算資源與 Mistral AI 的模型架構來共同開發開源的前沿 AI 模型。

833

Mistral AI Leanstral 發佈

Mistral AI 已發佈 Leanstral,這是一款專為 Lean 4 設計、具有 6B 活性參數的開源程式碼代理,旨在實現形式化驗證的程式碼與數學證明。

834

OpenAI Codex Security:為何系統避免使用 SAST 報告作為種子

OpenAI 的 Codex Security 會避免從靜態應用程式安全測試(SAST)報告開始,以防止分析過早收窄,並專注於驗證安全不變式在轉換鏈中是否真的成立。

835

BAIR 介紹 SPEX 與 ProxySPEX 用於可擴展的 LLM 互動發現

BAIR 已推出 SPEX 與 ProxySPEX,這兩種演算法結合訊號處理與編碼理論,能在大規模下辨識特徵、訓練資料與模型元件之間具影響力的互動。

836

P-EAGLE:vLLM 中的平行推測解碼

vLLM 引入了 P-EAGLE,一種平行推測解碼方法,能在單次前向傳播中生成所有草稿 token,於 NVIDIA B200 GPU 上相較於原始 EAGLE-3 提供最高 1.69 倍的加速。

837

Anthropic 專用特徵交叉編碼器 (DFC) 用於跨架構模型差異比對

Anthropic 研究人員開發了專用特徵交叉編碼器 (DFC),這是一種透過隔離獨特特徵來識別不同架構 AI 模型之間行為差異的工具,從而實現對「未知之未知」風險的檢測。

838

Anthropic Claude Partner Network 啟動

Anthropic 已啟動 Claude Partner Network,並投入首批 1 億美元,為協助企業採用 Claude 的組織提供培訓、技術支援和共同投資。

839

Mistral AI Rails Testing Agent

Mistral AI 使用 Vibe 開發了一款自主代理,能為 Ruby on Rails 單體架構自動生成並改進 RSpec 測試,在一個包含 275 個檔案的實驗中實現了 100% 的行覆蓋率與零 RuboCop 違規。

840

OpenAI 設計 AI 代理以抵禦提示注入

OpenAI 正在將其對提示注入的防禦策略轉變為將其視為社交工程問題,重點在於限制成功操縱的影響,而非僅依賴輸入過濾。

841

OpenAI Responses API 電腦環境更新

OpenAI 為 Responses API 配備了 Shell 工具與託管容器工作區,使模型能透過命令列介面與持續的執行時上下文執行真實世界的任務。

842

vLLM 中的 NVIDIA Nemotron 3 Super 支援

vLLM 現已支援 NVIDIA Nemotron 3 Super,這是一個擁有 1200 億參數的混合 MoE 模型,針對多代理 AI 進行優化,具備 100 萬 token 的上下文窗口以及高效的推理效能。

843

楽天將 OpenAI Codex 整合至工程流程以提升效率

楽天已將 OpenAI Codex 整合至其工程堆疊,實現了平均復原時間 (MTTR) 減少 50%,並將原本需耗時一季的開發專案壓縮至數週完成。

844

Wayfair OpenAI 整合案例研究

Wayfair 已將 OpenAI 模型整合至其內部系統,以自動化 3000 萬項商品的產品目錄標記,並透過 AI 驅動的工具 Wilma 簡化供應商支援。

845

介紹 Anthropic Institute

Anthropic 推出了 Anthropic Institute,這是一項由 Jack Clark 領導的跨學科研究工作,旨在研究並傳達加速的前沿 AI 開發所帶來的社會、經濟與法律挑戰。

846

OpenAI 指令層級改進與 GPT-5 Mini-R

OpenAI 推出了一個新的強化學習資料集 IH‑Challenge,用於訓練模型優先執行可信指令而非不可信指令,從而產生了具備更佳安全可導向性與提示注入韌性的 GPT‑5 Mini‑R 模型。

847

ChatGPT 數學與科學互動視覺化

OpenAI 在 ChatGPT 中推出了超過 70 個核心數學與科學概念的動態視覺說明,幫助使用者即時了解變數與公式之間的關係。

848

vLLM Semantic Router v0.2 Athena 發行說明 / 新功能

vLLM Semantic Router v0.2 Athena 引入了全新重建的模型堆疊、實驗性的 ClawOS 協調層,以及先進的模型選擇原語,將語意路由轉變為多代理部署的策略性系統大腦。

849

Hugging Face 儲存桶發布

Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,基於 Xet,能有效處理如檢查點與已處理資料等中間機器學習產物。

850

保持 Token 流動:來自 16 個開源 RL 庫的教訓

Hugging Face 調查了 16 個開源 RL 庫,發現非同步 RL 訓練將推理與訓練分離到不同的 GPU 池、使用 rollout 緩衝區,並以非同步方式推送權重;Ray 在協調層占主導,NCCL 廣播是常見的權重同步方法。