封存 · 11 個實驗室 · 3,049 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

901

OpenAI 停止 SWE-bench Verified 評估

OpenAI 已停止報告 SWE-bench Verified 分數,因為缺陷測試案例與訓練資料污染使該基準無法可靠衡量前沿模型的程式編寫能力。

902

OpenAI 前沿聯盟合作夥伴公告

OpenAI 已推出前沿聯盟,與麥肯錫、波士頓諮詢集團、BCG X、埃森哲及凱捷合作,協助企業部署與擴展使用前沿平台的 AI 同事。

903

Anthropic 教育報告:AI 流暢度指數

Anthropic 推出了 AI 流暢度指數,用以衡量使用者如何與 AI 協作,並發現迭代優化是高階 AI 流暢度的最強預測指標。

904

Anthropic Persona Selection Model

Anthropic 提出了 persona selection model,這是一個理論,認為 AI 助手表現得像人類,是因為它們模擬了在預訓練期間學到的類人 personas,並透過後訓練進行精煉。

905

Ollama 0.17: OpenClaw AI Assistant 簡化設置指南

Ollama 0.17 引入了 OpenClaw 的單指令安裝流程,這是一款能夠在本地硬體上管理電子郵件、行事曆和通訊軟體的個人 AI 助手。

906

Anthropic 關於偵測與防止蒸餾攻擊的報告

Anthropic 已識別並詳細說明了 DeepSeek、Moonshot 與 MiniMax 的大規模工業級蒸餾攻擊,這些公司利用超過 24,000 個欺詐帳號非法提取 Claude 的能力。

907

OpenAI 首次證明提交

OpenAI 已提交首次證明研究級數學挑戰的證明嘗試,內部模型可能已解決至少十題中的五題。

908

使用 Unsloth 與 Hugging Face Jobs 訓練 AI 模型

Hugging Face 已將 Unsloth 與 Hugging Face Jobs 整合,實現快速且低成本的 LLM 微調,特別針對如 LiquidAI/LFM2.5-1.2B-Instruct 等小型模型進行優化。

909

GGML 與 llama.cpp 加入 Hugging Face

GGML,llama.cpp 的創作者,已加入 Hugging Face,提供永續資源以支援本地 AI 推論,並簡化 Transformers 套件與本地模型部署之間的整合。

910

Anthropic 公佈 Claude Code Security 研究預覽版

Anthropic 發佈了 Claude Code Security,這是一款 AI 驅動的靜態分析工具,可掃描程式碼庫以尋找複雜漏洞並建議修復補丁,目前已針對企業與開源團隊提供有限的研究預覽版。

911

Gemini 3.1 Pro 版本說明

Google DeepMind 推出 Gemini 3.1 Pro,一款在複雜任務上推理能力大幅提升的新模型,現已透過 Gemini API、Vertex AI、Gemini 應用程式與 Notebook LM 提供預覽版。

912

OpenAI 對 The Alignment Project 的資助

OpenAI 宣布向 The Alignment Project 提供 750 萬美元的資助,該基金由英國 AI 安全研究所(UK AISI)設立,旨在擴大獨立的 AI 對齊與安全研究。

913

OpenAI 印度倡議

OpenAI 已推出「OpenAI for India」全國性計畫,與塔塔集團及其他機構合作,建立主權 AI 基礎設施、加速企業採用,並在全國推廣 AI 技能提升。

914

IBM 與加州大學柏克萊分校使用 IT-Bench 與 MAST 診斷企業代理失敗

IBM 研究院與加州大學柏克萊分校推出 MAST(多代理系統失敗分類法)以診斷企業 IT 代理失敗的原因,發現前沿模型受到孤立的驗證錯誤影響,而開源模型則面臨連鎖的系統性崩潰。

915

Gemini 音樂生成與 Lyria 3

Google DeepMind 已將 Lyria 3 生成式音樂模型整合至 Gemini 應用程式,使用者可透過文字提示或圖像與影片上傳,創作 30 秒的 AI 生成音軌。

916

Gradio 6 gr.HTML:一次性 Web 應用程式開發

Gradio 6 引入了增強的 gr.HTML 支援,提供自訂模板、範圍化 CSS 與 JavaScript 互動性,使得能在單一 Python 檔案中建立複雜的 Web 元件。

917

OpenAI 推出 EVMbench

OpenAI 與 Paradigm 已發布 EVMbench,這是一項用於評估 AI 代理偵測、修補與利用高嚴重性智慧合約漏洞能力的基準測試。

918

Anthropic 實際衡量 AI 代理自主性的方法 – 關鍵發現與影響

Anthropic 2026 年 2 月的研究顯示,Claude Code 代理的自主運行時間更長,經驗豐富的使用者雖給予更多自動批准,但中斷次數也增加,代理在需要時要求澄清的次數超過人類中斷次數,而在高風險領域的使用雖仍有限,但正逐漸出現。

919

Google DeepMind AI 國家夥伴關係:印度擴展

Google DeepMind 正在與印度政府機構及院校建立新夥伴關係,以擴大科學、教育、農業與能源安全領域前沿 AI 模型的使用機會。

920

Anthropic 與盧安達政府關於 AI 整合的合作備忘錄 (MOU)

Anthropic 與盧安達政府已簽署為期三年的合作備忘錄,旨在將 AI 整合至盧安達的醫療、教育及公共部門系統中。

921

Anthropic 與 Infosys 合作開發企業級 AI Agent

Anthropic 與 Infosys 已建立合作夥伴關係,將 Claude 模型與 Claude Code 與 Infosys Topaz 整合,為包括電信、金融服務與製造業在內的受規管行業開發 agentic AI 解決方案。

922

Anthropic Economic Index: India Country Brief

印度在 Claude.ai 總使用量上位居全球第二,但在 IT 部門表現出高度集中,且人均採用率存在顯著差距,同時在複雜任務上實現了 15 倍的生產力加速。

923

Ollama 為 Claude Code 增加了子代理 (Subagents) 與網頁搜尋功能

Ollama 現在支援 Claude Code 中的子代理與網頁搜尋,允許模型執行並行任務並存取即時資訊,而無需 MCP 伺服器或 API 金鑰。

924

Anthropic 在印度擴張,於班加羅爾開設辦公室並建立策略夥伴關係

Anthropic 在班加羅爾開設了新辦公室,並在企業、教育和農業領域啟動了合作夥伴關係,以擴大負責任 AI 的應用並提升印地語系語言能力。

925

Qwen 3.5‑397B‑A17B 釋出:混合線性注意力 MoE 模型,具備 1 M 令牌上下文與最先進的多模態效能

Qwen 3.5‑397B‑A17B 是一個 397 0 億參數的多模態模型,每個令牌僅啟用 170 億參數,在語言、程式碼、推理與視覺任務上達到最先進的表現,同時比前代快至 19 倍。

926

GPT-5.2 在理論物理學中導出新結果

OpenAI 宣布,GPT-5.2 Pro 以及一個支援版的 GPT-5.2 被用來推導出關於半共線區域中非零膠子樹振幅的理論物理新結果。

927

ChatGPT 鎖定模式與提升風險標籤

OpenAI 推出了鎖定模式與提升風險標籤,以減輕提示注入攻擊並為使用者提供更大的資料外洩風險控制。

928

OpenAI 透過混合信用系統擴展對 Codex 與 Sora 的存取

OpenAI 實作了一個即時存取引擎,結合速率限制與可購買的信用系統,以防止 Codex 與 Sora 使用者遭遇硬性中斷。

929

OpenAI GABRIEL:利用 GPT 擴展社會科學研究規模

OpenAI 已發布 GABRIEL,一個開源的 Python 工具包,利用 GPT 將非結構化的文字與影像轉換為社會科學研究的量化測量。

930

Hugging Face CUDA 核函數代理技能

Hugging Face 推出了一項代理技能,使得像 Claude 和 Codex 這樣的程式編寫代理能夠編寫、基準測試並整合可投入生產的 CUDA 核函數,適用於 transformers 與 diffusers 函式庫。

931

Anthropic 任命 Chris Liddell 加入董事會

Anthropic 已任命前 Microsoft 和 General Motors 財務長以及前白宮副幕僚長 Chris Liddell 加入其董事會,以強化對 AI 社會影響的治理與監督。

932

Anthropic 與 CodePath 合作,推動 AI 整合型電腦科學教育

Anthropic 正與 CodePath 合作,將 Claude 與 Claude Code 整合至美國最大的大學電腦科學計畫中,為社區學院、州立大學及 HBCU 的超過 20,000 名學生提供尖端 AI 工具的使用權。

933

Gemini 3 Deep Think 更新

Google DeepMind 已更新 Gemini 3 Deep Think,這是一種在數學、物理與化學奧林匹克中達到金牌等級表現的專門推理模式,且現已透過 Gemini API 向特定使用者開放。

934

GPT-5.3-Codex-Spark 發行說明

OpenAI 已發布 GPT-5.3-Codex-Spark,一款小型、低延遲模型,針對即時程式碼協作進行優化,並在 Cerebras 硬體上每秒可產生超過 1,000 個 token。

935

OpenEnv: 在真實環境中評估使用工具的代理程式

Hugging Face 與 Meta 推出了 OpenEnv,這是一個開源框架,透過針對真實系統與 Calendar Gym 等生產級環境來評估 AI 代理程式,以彌合研究與生產可靠性之間的差距。

936

Anthropic 向 Public First Action 捐贈 2000 萬美元以推動 AI 治理

Anthropic 向跨黨派的 501(c)(4) 組織 Public First Action 捐贈了 2000 萬美元,該組織致力於推動 AI 安全措施、公眾教育以及美國在 AI 政策方面的領導地位。

937

Anthropic Series G 融資與企業增長

Anthropic 已籌集 300 億美元的 Series G 融資,投後估值達 3800 億美元,以擴展其前沿研究、產品開發和基礎設施。

938

OpenAI Harness Engineering:利用 Codex 實現零手寫程式碼開發

OpenAI 使用 Codex 開發了一款內部軟體產品,全部程式碼皆由 AI 生成,未有任何手寫程式碼,藉由從手動編碼轉向環境設計與代理人協調,將開發時間縮短約 10 倍。

939

Anthropic 承諾支付數據中心電費漲價成本

Anthropic 已承諾支付因其數據中心營運而導致的電網升級和需求驅動電費漲價成本,以保護美國納稅人。

940

Qwen-Image-2.0 發布:專業資訊圖表與寫實渲染

Qwen-Image-2.0 是一個統一的圖像生成與編輯模型,支援 1k 令牌指令以製作專業資訊圖表,並具備原生 2K 解析度以實現高保真寫實渲染。

941

Gemini Deep Think 讓自主研究遍及數學、物理與電腦科學

Gemini Deep Think 為自主與協作型代理人提供動力,使其能解決研究層級的數學、物理與電腦科學問題,產出可發表的成果並解決未解的猜想。

942

OpenAI 將 ChatGPT 整合至 GenAI.mil 以供戰爭部使用

OpenAI 正將 ChatGPT 的自定義版本部署至 GenAI.mil,為 300 萬名戰爭部人員提供安全、非機密的生成式 AI 能力,以進行行政與作戰支援。

943

Transformers.js v4 發行說明 / 新功能

Hugging Face 已發布 Transformers.js v4,推出全新重寫的 C++ WebGPU 執行環境,以在瀏覽器與伺服器端執行環境中實現硬體加速,並同時提供獨立的 tokenizers 函式庫。

944

OpenAI 本地化方法與 OpenAI for Countries 計畫

OpenAI 透過 OpenAI for Countries 計畫推出了一個本地化 AI 系統框架,允許各國在遵守全球安全紅線的同時,將前沿模型調整至在地語言、法律與文化規範。

945

SyGra 2.0.0 Studio 發佈

SyGra 2.0.0 引入了 Studio,這是一個用於設計和執行合成數據生成工作流的視覺化互動式環境,無需手動編輯 YAML 檔案。

946

GPT-5 降低細胞自由蛋白質合成的成本

OpenAI 與 Ginkgo Bioworks 在閉環自主實驗室系統中使用 GPT-5,將細胞自由蛋白質合成成本降低了 40%,試劑成本降低了 57%。

947

OpenAI 可信存取於網路安全

OpenAI 推出「可信存取於網路安全」計畫,這是一個基於身份的框架,為安全專業人員提供優先使用 GPT-5.3-Codex 的權限,以加速網路防禦與漏洞修補。

948

OpenAI Frontier 平台發布

OpenAI 推出了 Frontier,一個端到端平台,旨在協助企業建置、部署與管理具備共享業務情境、安全執行環境與整合治理的 AI 代理。

949

GPT-5.3-Codex 系統卡

OpenAI 已發布 GPT-5.3-Codex,一款將 GPT-5.2-Codex 性能與 GPT-5.2 推理結合的代理式編程模型,能處理複雜且長時間的技術任務。

950

GPT-5.3-Codex 版本說明 / 新功能

OpenAI 已發布 GPT-5.3-Codex,一款具備代理能力的程式碼模型,在效能、推理與速度上優於 GPT-5.2-Codex,使其能自主執行複雜且長時間的技術任務。