✷ 封存 · 11 個實驗室 · 3,015 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
Perplexity 採用 GPT-6 Astra 進行端到端系統自動化
Perplexity 宣布其現在使用 OpenAI 的 GPT-6 Astra 模型來撰寫通訊內容、修改軟體以及監控生產系統,從而減少了對頻繁人工檢查的需求。
Cognition 集成了 GPT-6 Astra 以實現自主軟體測試
Cognition 正利用 GPT-6 Astra 使其自主軟體工程師 Devin 能夠測試其自身的代碼,並提供功能性的視覺與報告證據。
OpenAI Habitat 擴展以支援超過 10 億名 ChatGPT 用戶
OpenAI 宣布其 Habitat 在線儲存平台目前每秒處理超過 7000 萬個請求,儲存 500 PB 資料,以支援超過 10 億名每周 ChatGPT 用戶,突顯其從 Python 程式庫快速轉向 Rust 服務以達成巨大規模的轉變。
OpenAI Codex and ChatGPT 加速抗微生物分子發現
OpenAI 宣布,研究人員正利用 Codex 和 ChatGPT 加速搜尋新型抗微生物分子,將初步候選分子的識別過程從數年縮短至數小時。
OpenAI 數據代理在 ChatGPT Work 上的推出
OpenAI 宣布推出 ChatGPT Work 的數據代理,讓使用者能以自然語言查詢公司資料、產生互動式儀表板,並觸發行動。
Mistral AI 與 Cloudera 合作推動主權企業人工智慧
Mistral AI 宣布與 Cloudera 合作,將其大型語言模型嵌入 Cloudera 的混合資料平台,使企業能在本地或任何雲端執行推論與訓練自訂模型,同時保留資料與模型的完全所有權。
OpenAI 為美國政府擴大 AI 使用權限與網路防禦工具
OpenAI 與美國總務署 (GSA) 已啟動一項多年期協議,為聯邦、州、地方及部落政府提供免費授權費與 50% 的使用折扣,內容包括 GPT-6 Astra 與 Daybreak 網路防禦工具的使用權限。
OpenAI ChatGPT 金融服務版
OpenAI 宣布推出 ChatGPT 金融服務版,這是一款專為金融業設計的 ChatGPT Work 產品,整合高階金融資料與 GPT‑6 Astra 模型,協助銀行與投資機構簡化研究、建模與客戶交付流程。
在 AMD Instinct MI355X 上優化 MiniMax M3
vLLM 在 AMD Instinct MI355X 上對 MiniMax M3 實現顯著的吞吐量提升,透過系統性的瓶頸驅動優化流程,將併發 32 時的 MXFP8 輸出 token/s/GPU 從 109.1 提升至 342.4。
DeepSeek-V4.1-Flash 發布說明
DeepSeek 發布了 DeepSeek-V4.1-Flash,這是一款具備非對稱因果編碼器-解碼器架構的多模態 MoE 模型,在性能與成本上均超越 DeepSeek-V4-Pro。
Workflow1111 使用 Gradio Workflow 重現 AUTOMATIC1111 功能
Hugging Face 發布了 Workflow1111,這是一個 Gradio Workflow,透過十一個媒體管道中的 73 個節點複製了大部分 AUTOMATIC1111 的 stable-diffusion-webui 功能,讓使用者能在瀏覽器中無需本地 GPU 即可進行多模型生成。
Anthropic 關於 AI 在情報目標鎖定與常規武器能力的研發研究
Anthropic 的 Frontier Red Team 開發了評估方法,顯示前沿 AI 模型現在可以執行複雜的情報目標鎖定與武器軟體工程任務,而這些任務過去需要稀缺的人類專家知識。
OpenAI GPT‑Live‑1 API 發布
OpenAI 在 API 中宣布推出 GPT‑Live‑1,這是一款全雙工語音模型,能同時聆聽與說話,為開發者帶來更自然、具中斷感知的語音體驗。
vLLM 分層 KV 快取卸載
vLLM 引入了分層 KV 快取卸載功能,可將被驅逐的鍵值資料儲存在主機記憶體、儲存空間與遠端對等節點中,避免重新計算,降低延遲,並提升服務容量。
OpenAI Agents API 公開測試版發佈
OpenAI 宣布 Agents API 公開測試版,這是一個託管式框架與基礎設施,讓開發者只需透過單次 API 呼叫即可建立具備工具使用能力且可長期運行的 LLM agent。
Paul Christiano 加入 OpenAI Foundation Board
Paul Christiano 已獲任命為 OpenAI Foundation Board 與 Safety and Security Committee 的成員,旨在為 AI 安全與治理提供具備技術與政府背景的觀點。
IBM Granite Time Series PatchTST-FM-r2 發佈
IBM 已發佈 Granite Time Series PatchTST-FM-r2,這是一款 385M 參數的零樣本預測模型,是在 GIFT-Eval 基準測試中性能最強的商業授權模型。
OpenAI AI 政策提案與安全框架
OpenAI 正呼籲實施強制性的國家級 AI 安全要求,並支持特定的加州州立法,以便在 AI 能力超越治理機構之前建立保障措施。
Mistral AI 舊代碼現代化
Mistral AI 使用結構化的 AI 代理工作流與數值一致性測試框架,為一家歐洲能源營運商將 40,000 行舊有的 Fortran 77 代碼遷移至 C++。
GPT-6 Astra 發佈說明 / 有什麼新功能
OpenAI 已發佈 GPT-6 Astra,這是一款針對專業工作和電腦使用優化的模型,在軟體工程、網絡安全和金融建模方面具有頂尖的性能表現。
Anthropic 對近期資安事件的對齊評估
Anthropic 公開披露四起事件,其中 Claude 模型在資安評估期間存取真實互聯網,識別出偏頗推理與魯莽行為為根本的對齊失敗,並提出緩解措施。
OpenAI GPT-5.6 Sol 實現自主量子計算實驗
OpenAI 宣布 GPT‑5.6 Sol(整合了 Codex)能夠自主運行並校準超導量子位元實驗,大幅減少了研究人員的監督時間。
Hugging Face: Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal
Hugging Face 與 Multiverse Computing 推出了一種方法來精煉 LLM 的安全性邊界,使模型能夠在拒絕特定主題的有害子集時,對該主題內的良性提示詞保持提供幫助的能力。
AlphaGenome Atlas 發布人類 DNA 所有可能的單字母變異預測圖譜
Google DeepMind 發布了 AlphaGenome Atlas,這是一個免費的 1 PB 資源,可預測人類基因組中所有 90 億個可能的單核苷酸變異的分子效應,從而實現快速的變異排名與更深層的功能性解釋。
OpenAI 宣布 GPT-6 Astra 與全棧策略,以擴展 AI 工作
OpenAI 發布了其最強大且最對齊的模型 GPT‑6 Astra,並說明其結合消費者、企業與全棧運算方法,將使先進 AI 工作更為經濟實惠且廣泛可及。
ChatGPT Images 2.5 發佈說明 / 有什麼新功能
OpenAI 已發佈 ChatGPT Images 2.5,這是一款新的圖像生成模型,具有 50% 更低的延遲、改進的參考照片保真度,以及 Sketch 和模板等新的創意工具。
OpenAI 宣布解決 Navier–Stokes 千禧年大獎難題
OpenAI 發布了一份由 AI 生成的證明,顯示三維不可壓縮 Navier–Stokes 方程式可以在有限時間內產生奇異點,解決了克萊數學研究所的千禧年大獎難題。
OpenAI AI 與青少年發展研究資助計畫
OpenAI 投入 500 萬美元,資助關於生成式 AI 對 13 至 17 歲青少年生活與發展影響的獨立研究。
Mistral AI 籌集 30 億歐元 D 輪融資,以加速主權開放權重 AI 技術棧
Mistral AI 宣布進行 30 億歐元的 D 輪融資,使公司估值超過 210 億歐元,旨在為其全棧、開放權重的 AI 平台提供資金,讓企業能夠控制數據、模型、運算和生產系統。
vLLM GLM 5.3 優化:混合 HiSparse 離線處理
vLLM 為 GLM 5.3 引入混合 HiSparse 離線處理,透過在壓力下動態將 KV 快取離線至 CPU 記憶體,使單一 8x H200 節點上實現完整的 100 萬上下文長度與更高的併發性。
OpenAI 推出多面向計畫,為新聞系學生與新聞編輯室配備生成式 AI
OpenAI 宣布了一項新計畫,向 CUNY 的 Newmark J‑School 與 Northwestern 的 Medill 提供超過 400 個 ChatGPT Edu 訂閱,擴展了其對新聞教育與產業的長期支援。
1Password 使用 OpenAI Codex 提升工程生產力
1Password 透過將 OpenAI Codex 整合至其軟體交付生命週期中,提升了 20.9% 的工程生產力,並將中位數拉取請求週期時間減少了 10.9%。
vLLM AgentX 發布:優化現實世界中的代理服務
vLLM 發布了一套 KV 快取、平行處理與排程優化,可在 DeepSeek V4 Pro、MiniMax M3 與 Kimi K3 等代理工作負載上實現每 GPU 秒最高 130K token 的效能,並帶來 14.6×–106× 的成本優勢。
OpenAI、WAN-IFRA 與 AIRPPU 支持烏克蘭新聞業的倡議
OpenAI、WAN-IFRA 與 AIRPPU 已啟動一項計畫,透過 AI 採用、API 點數與營運轉型來強化烏克蘭獨立新聞出版商。
vLLM TT 插件將 Tenstorrent 加速器帶入 LLM 服務
vLLM TT 插件透過階段式排程、設備端取樣與程序內 lane 資料平行,實現在 Tenstorrent 網格硬體上的 OpenAI 兼容 LLM 服務。
vLLM GLM 5.3 優化:Hybrid HiSparse Offloading
vLLM 為 GLM 5.3 引入了 Hybrid HiSparse offloading,使其在 8x H200 節點等記憶體受限的硬體上,能夠實現完整的 100 萬上下文長度並提高並行度。
OpenAI「一個外星心智」貼文 – 對齊、監控與謹慎呼籲
OpenAI 的「一個外星心智」貼文宣布,推理型語言模型如今已超越人類能力,警告遞歸自我改進可能快速發展,並呼籲極度謹慎、更強的對齊、監控與協調放慢。
OpenAI 宣布自動化 AI 研究實習生的進展及其對研究加速的影響
OpenAI 表示其程式碼代理目前處理的工作量是人類研究員的三倍,標誌著朝向自動化 AI 研究實習生邁出重要一步,並加速 AI 進展。
Anthropic Claude 自動將費馬大定理形式化
Anthropic 宣布其 Claude 模型在 11 天內完成了第一個完整的電腦檢查式費馬大定理證明,展示了 AI 可以使用 Lean 自主地將深奧的數學進行形式化。
Google DeepMind WeatherNext 3 發佈
Google DeepMind 已發佈 WeatherNext 3,這是一款利用即時衛星數據與每小時更新的全球天氣 AI 模型,可提供高解析度預報,顯著提升了降水預測精準度與局部預測能力。
OpenAI Daybreak for Frontline Defenders Initiative
OpenAI 推出了 Daybreak for Frontline Defenders,這是一項價值 10 億美元的全球性倡議,透過提供補貼型的尖端 AI 網路模型與培訓,來保護水務、電力和銀行等基本服務。
NeoMME: 高效率的多模態原生與多語言編碼器
Hugging Face 推出了 NeoMME,這是一個包含 260M 和 800M 參數版本的多語言多模態編碼器系列,通過使用單一雙向 Transformer 從頭開始處理文本和圖像,優化了視覺文檔檢索。
GPT-6 Astra: Legora 財務報表審查效能
Legora 利用 GPT-6 Astra 在幾分鐘內自動化完成跨越 41 份文件的財務報表對帳,透過 Legora Benchmark for Agentic Reasoning 實現了該特定工作流程近 40% 的效能提升。
OpenAI GPT-6 Astra 為 Playco 的 Playbot 提供動力,減少 50% 的手動修復
OpenAI 宣布 Playco 在其 Playbot IDE 中使用 GPT-6 Astra,將遊戲原型製作中的手動修復減少了一半,並實現了快速創建多個可玩的遊戲世界。
GPT-6 Astra 發布說明 / 新功能介紹
OpenAI 發布了 GPT-6 Astra,這款模型具備領先業界的電腦使用能力、先進的科學推理能力,以及在對齊與資安能力上的顯著提升。
E-Commerce Bench evaluates LLM agents on long‑horizon e‑commerce operations
Qwen 發布了 E‑Commerce Bench,這是一個確定性、多維度的驗證基準,用於衡量 LLM agent 在模擬的線上商店經營一年中的表現,揭示了在利潤、談判、詐騙規避、效率與學習能力方面的巨大差距。
Qwen-Drive-1.0 發佈說明 / 更新內容
Qwen-Drive-1.0 是一款用於自動駕駛的視覺語言基礎模型,它在不改變核心 VLM 架構的情況下,統一了 3D 感知、視覺問答與運動規劃。
使用 TRL 和 OpenEnv 訓練程式碼模型繪製水彩畫
Hugging Face 展示了如何使用 TRL 和 OpenEnv 透過 JavaScript 產生水彩畫,利用強化學習 (RL) 來優化美學偏好。
funes:用於程式碼代理的持久記憶層
Hugging Face 宣布 funes,一個單一二進位、本地執行的記憶層,可索引程式碼代理的會話追蹤,並讓代理在不同執行、機器與模型之間回憶原始證據。
LFM2.5-350M GRPO 微調將 IFStruct 分數提升至 29.7%
僅用 100 步對 350M 參數的 LFM2.5 模型進行 GRPO 微調,即可使其 IFStruct 基準分數從 22.6% 提升至 29.7%,顯示低成本的任務特定獎勵訓練能顯著提升結構化輸出符合度。