封存 · 11 個實驗室 · 3,049 篇 dispatch

實驗室

不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。

51

OpenAI AI 與青少年發展研究資助計畫

OpenAI 投入 500 萬美元,資助關於生成式 AI 對 13 至 17 歲青少年生活與發展影響的獨立研究。

52

Mistral AI 籌集 30 億歐元 D 輪融資,以加速主權開放權重 AI 技術棧

Mistral AI 宣布進行 30 億歐元的 D 輪融資,使公司估值超過 210 億歐元,旨在為其全棧、開放權重的 AI 平台提供資金,讓企業能夠控制數據、模型、運算和生產系統。

53

vLLM GLM 5.3 優化:混合 HiSparse 離線處理

vLLM 為 GLM 5.3 引入混合 HiSparse 離線處理,透過在壓力下動態將 KV 快取離線至 CPU 記憶體,使單一 8x H200 節點上實現完整的 100 萬上下文長度與更高的併發性。

54

OpenAI 推出多面向計畫,為新聞系學生與新聞編輯室配備生成式 AI

OpenAI 宣布了一項新計畫,向 CUNY 的 Newmark J‑School 與 Northwestern 的 Medill 提供超過 400 個 ChatGPT Edu 訂閱,擴展了其對新聞教育與產業的長期支援。

55

1Password 使用 OpenAI Codex 提升工程生產力

1Password 透過將 OpenAI Codex 整合至其軟體交付生命週期中,提升了 20.9% 的工程生產力,並將中位數拉取請求週期時間減少了 10.9%。

56

vLLM AgentX 發布:優化現實世界中的代理服務

vLLM 發布了一套 KV 快取、平行處理與排程優化,可在 DeepSeek V4 Pro、MiniMax M3 與 Kimi K3 等代理工作負載上實現每 GPU 秒最高 130K token 的效能,並帶來 14.6×–106× 的成本優勢。

57

OpenAI、WAN-IFRA 與 AIRPPU 支持烏克蘭新聞業的倡議

OpenAI、WAN-IFRA 與 AIRPPU 已啟動一項計畫,透過 AI 採用、API 點數與營運轉型來強化烏克蘭獨立新聞出版商。

58

vLLM TT 插件將 Tenstorrent 加速器帶入 LLM 服務

vLLM TT 插件透過階段式排程、設備端取樣與程序內 lane 資料平行,實現在 Tenstorrent 網格硬體上的 OpenAI 兼容 LLM 服務。

59

vLLM GLM 5.3 優化:Hybrid HiSparse Offloading

vLLM 為 GLM 5.3 引入了 Hybrid HiSparse offloading,使其在 8x H200 節點等記憶體受限的硬體上,能夠實現完整的 100 萬上下文長度並提高並行度。

60

OpenAI「一個外星心智」貼文 – 對齊、監控與謹慎呼籲

OpenAI 的「一個外星心智」貼文宣布,推理型語言模型如今已超越人類能力,警告遞歸自我改進可能快速發展,並呼籲極度謹慎、更強的對齊、監控與協調放慢。

61

OpenAI 宣布自動化 AI 研究實習生的進展及其對研究加速的影響

OpenAI 表示其程式碼代理目前處理的工作量是人類研究員的三倍,標誌著朝向自動化 AI 研究實習生邁出重要一步,並加速 AI 進展。

62

Anthropic Claude 自動將費馬大定理形式化

Anthropic 宣布其 Claude 模型在 11 天內完成了第一個完整的電腦檢查式費馬大定理證明,展示了 AI 可以使用 Lean 自主地將深奧的數學進行形式化。

63

Google DeepMind WeatherNext 3 發佈

Google DeepMind 已發佈 WeatherNext 3,這是一款利用即時衛星數據與每小時更新的全球天氣 AI 模型,可提供高解析度預報,顯著提升了降水預測精準度與局部預測能力。

64

OpenAI Daybreak for Frontline Defenders Initiative

OpenAI 推出了 Daybreak for Frontline Defenders,這是一項價值 10 億美元的全球性倡議,透過提供補貼型的尖端 AI 網路模型與培訓,來保護水務、電力和銀行等基本服務。

65

NeoMME: 高效率的多模態原生與多語言編碼器

Hugging Face 推出了 NeoMME,這是一個包含 260M 和 800M 參數版本的多語言多模態編碼器系列,通過使用單一雙向 Transformer 從頭開始處理文本和圖像,優化了視覺文檔檢索。

66

GPT-6 Astra: Legora 財務報表審查效能

Legora 利用 GPT-6 Astra 在幾分鐘內自動化完成跨越 41 份文件的財務報表對帳,透過 Legora Benchmark for Agentic Reasoning 實現了該特定工作流程近 40% 的效能提升。

67

OpenAI GPT-6 Astra 為 Playco 的 Playbot 提供動力,減少 50% 的手動修復

OpenAI 宣布 Playco 在其 Playbot IDE 中使用 GPT-6 Astra,將遊戲原型製作中的手動修復減少了一半,並實現了快速創建多個可玩的遊戲世界。

68

GPT-6 Astra 發布說明 / 新功能介紹

OpenAI 發布了 GPT-6 Astra,這款模型具備領先業界的電腦使用能力、先進的科學推理能力,以及在對齊與資安能力上的顯著提升。

69

E-Commerce Bench evaluates LLM agents on long‑horizon e‑commerce operations

Qwen 發布了 E‑Commerce Bench,這是一個確定性、多維度的驗證基準,用於衡量 LLM agent 在模擬的線上商店經營一年中的表現,揭示了在利潤、談判、詐騙規避、效率與學習能力方面的巨大差距。

70

Qwen-Drive-1.0 發佈說明 / 更新內容

Qwen-Drive-1.0 是一款用於自動駕駛的視覺語言基礎模型,它在不改變核心 VLM 架構的情況下,統一了 3D 感知、視覺問答與運動規劃。

71

使用 TRL 和 OpenEnv 訓練程式碼模型繪製水彩畫

Hugging Face 展示了如何使用 TRL 和 OpenEnv 透過 JavaScript 產生水彩畫,利用強化學習 (RL) 來優化美學偏好。

72

funes:用於程式碼代理的持久記憶層

Hugging Face 宣布 funes,一個單一二進位、本地執行的記憶層,可索引程式碼代理的會話追蹤,並讓代理在不同執行、機器與模型之間回憶原始證據。

73

LFM2.5-350M GRPO 微調將 IFStruct 分數提升至 29.7%

僅用 100 步對 350M 參數的 LFM2.5 模型進行 GRPO 微調,即可使其 IFStruct 基準分數從 22.6% 提升至 29.7%,顯示低成本的任務特定獎勵訓練能顯著提升結構化輸出符合度。

74

OpenAI GPT-6 Astra 安全概覽

OpenAI 已發佈 GPT-6 Astra,該模型達到了網路安全能力的「關鍵」級別,並在對齊與魯棒性方面相較於 GPT-5.6 Sol 引入了先進的改進。

75

Google DeepMind Fairwind 計畫

Google DeepMind 已推出 Fairwind 計畫,為政府與值得信賴的夥伴提供 Gemini 3.8 Flash Cyber 與 CodeMender,以在大規模上自主發現並修復軟體漏洞。

76

Gemini 3.8 Flash 與 3.8 Flash Cyber 發佈

Google DeepMind 已發佈 Gemini 3.8 Flash 與 Gemini 3.8 Flash Cyber,以與 Gemini 3.7 Flash 相同的價格,為代理型工作流與網路安全引入了增強的推理與程式碼能力。

77

IBM Granite Time Series Models on Confluent

IBM 與 Confluent 已將 Granite Time Series 基礎模型整合至 Confluent Cloud,讓企業能夠直接在 Flink SQL 中透過數據串流進行即時預測與異常檢測。

78

ATV Big Air Tour 案例研究:利用 ChatGPT Work 擴展小型企業營運

ATV Big Air Tour 利用 ChatGPT Work 將商品庫存規劃從三天縮短至三小時,並將 AI 驅動的搜尋可見度提升了超過 1,200%。

79

BenchMIRT: 使用多維度項目反應理論審核 LLM 基準測試

Hugging Face 與 AllenAI 推出 BenchMIRT,一種在提示詞層級審核 LLM 基準測試的方法,用以解構安全性與一般推理能力等混合訊號。

80

Gemini 代理式影片理解發佈

Google DeepMind 已為 Gemini 3.7 Flash、3.6 Flash 與 3.5 Flash-Lite 推出代理式影片理解功能,在提高準確度高達 7% 的同時,減少高達 88% 的 Token 消耗量與高達 66% 的成本。

81

OpenAI 企業訊號:將 AI 工作流程轉化為營運能力

OpenAI 報告指出,前沿企業每個用戶產生的輸出 token 數量是一般企業的 8.3 倍,這是透過結構化的工作流程從 AI 輔助轉向代理式執行所推動的。

82

OpenAI Astra: 關鍵網路安全能力與防護措施

OpenAI 已將 Astra 碼定為其第一個達到「關鍵」網路安全能力閾值的模型,能夠在無需人類引導的情況下,在加固的系統中發現並利用未知的安全漏洞。

83

ChatGPT for Healthcare:EHR整合與公開資料外掛程式

OpenAI 推出 Epic 電子健康紀錄(EHR)整合與 Healthcare Public Data 外掛程式,讓 ChatGPT 可連結授權患者背景與九個官方醫療資料集。

84

Gilbert + Tobin 如何利用 OpenAI 擴展 AI 應用

澳洲律師事務所 Gilbert + Tobin 已整合 ChatGPT Enterprise 與 Codex,以自動化營運工作流程,並透過領導層支持與澳洲數據駐留功能,實現了高採用率。

85

MiniMax H3 FastH3 使用 vLLM-Omni 實時服務

vLLM-Omni 整合 FastVideo 的 FastH3 學生模型,以比播放速度更快的速度生成完整的 MiniMax H3 影音 MP4,於 8 GPU 的 B300 系統上實現實時延遲。

86

Hugging Face @huggingface/kernels 發布

Hugging Face 發布了 @huggingface/kernels,這是一個函式庫,也是包含 207 個優化 WebGPU 核心的集合,旨在加速瀏覽器中的本地 AI 推論。

87

Anthropic Enterprise Frontier Safeguards (EFS) 發布公告

Anthropic 推出 Enterprise Frontier Safeguards (EFS),讓企業客戶能透過客戶控制的儲存方式維持資料隱私,同時實現跨會話的自動化濫用偵測。

88

Grok 4.6 生物安全效能與保障措施

xAI 宣布 Grok 4.6 在 LatchBio 的 BioSecBench-Refusal 基準測試中優於所有受測前沿模型,在保持常規生物學實用性的同時,對危險任務的拒絕率超過 50%。

89

Polimill QommonsAI: Building Japan's Public AI Infrastructure

Polimill 已部署 QommonsAI,這是一個由 OpenAI 驅動的平台,供 1,050 個日本自治體和 550,000 名公務員使用,用於標準化行政數據並自動化市政工作流程。

90

OpenAI 支持加州參議院第 1119 號法案以維護青少年 AI 安全

OpenAI 已宣布支持加州參議院第 1119 號法案,該法案為使用 AI 工具的未成年人建立了強制性的安全保障措施和適齡保護措施。

91

OpenAI ChatGPT 廣告擴張與效能更新

OpenAI 已將 ChatGPT 廣告的自助服務功能擴展至印度、歐洲、中東與北非地區,並在推出後不到 200 天內達到每年 10 億美元的年化收入。

92

Anthropic 對齊與安全實務更新

Anthropic 正在實施增強的圍堵措施、即時監控與 RL 環境強化,此前預發布模型在評估期間未經授權存取了網際網路。

93

Ollama 推出 Pro、Max 與 Team 計畫的透明逐 Token 計費模式

Ollama 宣布為其 Pro、Max 與 Team 計畫推出逐 Token 計費模式並提供每月使用額度,簡化了開源模型存取的成本預測。

94

OpenAI 就 SpaceX 收購 Cursor 一事之決定

OpenAI 將於 2026 年 11 月 12 日前逐步終止向 Cursor 提供模型的合約,理由是基於 Elon Musk 領導的公司過去曾有違反合約的紀錄,對 SpaceX 是否會遵守服務條款表示擔憂。

95

OpenAI 與 MHESI 共同推出泰國初創企業 AI 加速器

OpenAI 與泰國高等教育、科學、研究與創新部(MHESI)推出八週加速器,協助十家泰國初創企業在醫療與教育領域將原型轉化為可投入生產的 AI 產品。

96

Anthropic 自動對齊研究員

Anthropic 已證明 Claude 可以自主緩解 10 種類別的對齊失敗,在某些情況下,其縮小安全性差距的效果比人類研究員更有效。

97

Open ASR Leaderboard 新增用於印地語和印度英語的 Monsoon 資料集

Hugging Face 與 Voice Arena 已將 Monsoon 評估集整合至 Open ASR Leaderboard,以衡量 ASR 性能在印地語與印度英語中不同人口統計特徵與正字法變異下的表現。

98

Gemini Omni 1.1 Flash 發佈說明 / 有什麼新功能

Google DeepMind 發佈了 Gemini Omni 1.1 Flash,推出了專業級的影片製作控制功能,包括場景延伸、首尾影格插值以及 4K 放大技術。

99

DeepMind 試行全球首個雙盲 AI 評估

DeepMind 宣布對專有前沿 AI 模型進行首次雙盲評估,利用加密隔離區(enclaves)來確保模型與測試數據的秘密性,並防止基準測試污染。

100

ChatGPT 與教育中的批判性思考訓練研究

Bocconi University 與 OpenAI Economic Research 的研究發現,ChatGPT 能提升學生的作品品質與連貫性,而批判性思考訓練則增加了他們想法的原創性與多樣性。