vLLM Model Runner V2 版本說明 / 新功能
vLLM 推出了 Model Runner V2(MRV2),這是一個從頭重新實作的模型執行器,透過 GPU 原生、async‑first 與模組化的架構提升吞吐量並降低延遲。
OpenAI Sora 2 安全框架
OpenAI 詳細說明了 Sora 2 的安全架構,重點在於來源訊號、基於同意的相似度管理,以及對音訊與影片的嚴格內容過濾。
領域特定嵌入微調與 NVIDIA Nemotron – 一天內完成
NVIDIA 與 Hugging Face 發布了一個單 GPU、一天內完成的管線,對 Llama‑Nemotron‑Embed‑1B‑v2 模型進行合成領域資料的微調,實現超過 10% 的檢索提升,且在真實企業資料集上最高提升 26%。
OpenAI 內部程式碼代理監控系統
OpenAI 部署了一套以 GPT‑5.4 Thinking 為動力的監控系統,用以偵測內部程式碼代理的錯位與安全違規,並識別那些常僅在複雜、工具豐富的工作流程中才會顯現的行為。
OpenAI 收購 Astral
OpenAI 正收購 Astral,將其開源 Python 工具(包括 uv、Ruff 與 ty)整合至 Codex 生態系統,使 AI 代理能參與整個軟體開發生命週期。
Qwen3.5-Max-Preview 在 LMSys Arena 的發佈
Qwen 已將 Qwen3.5-Max-Preview 部署至 LMSys Arena,供社群評估,並於兩週內完成正式發布。
Hugging Face 開源狀況:2026 年春季
Hugging Face 報告稱,2025 年開源 AI 生態系統大幅擴張,特徵是中國在模型下載量上超過美國,且機器人領域迅速崛起成為最大的資料集類別。
Google DeepMind 測量通往 AGI 的進展:認知框架
Google DeepMind 已推出認知分類法與三階段評估協議,以實證方式衡量 AI 向人工通用智慧(AGI)的進展。
Holotron-12B 高吞吐量電腦使用代理
H 公司發布了 Holotron-12B,一款基於 NVIDIA Nemotron-Nano-2 VL 的多模態電腦使用模型,採用混合 SSM‑Attention 架構,以實現代理工作負載的高推理吞吐量。
OpenAI GPT-5.4 mini 與 nano 發布說明
OpenAI 已發布 GPT-5.4 mini 與 nano,這些高效能的小型模型將 GPT-5.4 的能力帶入高容量工作負載,顯著降低延遲與成本。
OpenAI 日本青少年安全藍圖
OpenAI 日本推出了日本青少年安全藍圖,這是一個將青少年安全置於便利與隱私之上,以保護年輕使用者免受 AI 相關風險的框架。
OpenAI 研究:員工如何使用 ChatGPT 獲取薪酬洞見
OpenAI 研究顯示,美國員工每日向 ChatGPT 發送近 300 萬條訊息,尋求薪資基準與補償指導,尤其是在高技能、資訊透明度低的職位。
OpenAI Codex Security:為何系統避免使用 SAST 報告作為種子
OpenAI 的 Codex Security 會避免從靜態應用程式安全測試(SAST)報告開始,以防止分析過早收窄,並專注於驗證安全不變式在轉換鏈中是否真的成立。
BAIR 介紹 SPEX 與 ProxySPEX 用於可擴展的 LLM 互動發現
BAIR 已推出 SPEX 與 ProxySPEX,這兩種演算法結合訊號處理與編碼理論,能在大規模下辨識特徵、訓練資料與模型元件之間具影響力的互動。
P-EAGLE:vLLM 中的平行推測解碼
vLLM 引入了 P-EAGLE,一種平行推測解碼方法,能在單次前向傳播中生成所有草稿 token,於 NVIDIA B200 GPU 上相較於原始 EAGLE-3 提供最高 1.69 倍的加速。
OpenAI 設計 AI 代理以抵禦提示注入
OpenAI 正在將其對提示注入的防禦策略轉變為將其視為社交工程問題,重點在於限制成功操縱的影響,而非僅依賴輸入過濾。
OpenAI Responses API 電腦環境更新
OpenAI 為 Responses API 配備了 Shell 工具與託管容器工作區,使模型能透過命令列介面與持續的執行時上下文執行真實世界的任務。
楽天將 OpenAI Codex 整合至工程流程以提升效率
楽天已將 OpenAI Codex 整合至其工程堆疊,實現了平均復原時間 (MTTR) 減少 50%,並將原本需耗時一季的開發專案壓縮至數週完成。
vLLM 中的 NVIDIA Nemotron 3 Super 支援
vLLM 現已支援 NVIDIA Nemotron 3 Super,這是一個擁有 1200 億參數的混合 MoE 模型,針對多代理 AI 進行優化,具備 100 萬 token 的上下文窗口以及高效的推理效能。
Wayfair OpenAI 整合案例研究
Wayfair 已將 OpenAI 模型整合至其內部系統,以自動化 3000 萬項商品的產品目錄標記,並透過 AI 驅動的工具 Wilma 簡化供應商支援。
OpenAI 指令層級改進與 GPT-5 Mini-R
OpenAI 推出了一個新的強化學習資料集 IH‑Challenge,用於訓練模型優先執行可信指令而非不可信指令,從而產生了具備更佳安全可導向性與提示注入韌性的 GPT‑5 Mini‑R 模型。
ChatGPT 數學與科學互動視覺化
OpenAI 在 ChatGPT 中推出了超過 70 個核心數學與科學概念的動態視覺說明,幫助使用者即時了解變數與公式之間的關係。
vLLM Semantic Router v0.2 Athena 發行說明 / 新功能
vLLM Semantic Router v0.2 Athena 引入了全新重建的模型堆疊、實驗性的 ClawOS 協調層,以及先進的模型選擇原語,將語意路由轉變為多代理部署的策略性系統大腦。
保持 Token 流動:來自 16 個開源 RL 庫的教訓
Hugging Face 調查了 16 個開源 RL 庫,發現非同步 RL 訓練將推理與訓練分離到不同的 GPU 池、使用 rollout 緩衝區,並以非同步方式推送權重;Ray 在協調層占主導,NCCL 廣播是常見的權重同步方法。
Hugging Face 儲存桶發布
Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,基於 Xet,能有效處理如檢查點與已處理資料等中間機器學習產物。
Google DeepMind:AlphaGo 十 年的影響
Google DeepMind 回顧 AlphaGo 於 2016 年擊敗世界冠軍的勝利,如何催化了科學、數學領域以及通往通用人工智慧(AGI)之路的十年 AI 突破。
OpenAI 收購 Promptfoo
OpenAI 正在收購 Promptfoo,將其 AI 安全與評估工具整合至 OpenAI Frontier 平台,以建構企業 AI 同事。
Ulysses 序列平行化 用於 百萬標記 上下文訓練
Hugging Face 已將 Ulysses 序列平行化整合至 Accelerate、Transformers 與 TRL,使得透過在多個 GPU 上分散注意力計算,能夠訓練具備百萬標記上下文的 LLM。
LeRobot v0.5.0 版本說明 / 新功能概覽
Hugging Face 發佈了 LeRobot v0.5.0,加入了完整的 Unitree G1 人形機器人支援、新的 VLA 策略如 Pi0‑FAST 與 Wall‑X,以及顯著的資料集效能優化。
OpenAI Codex 安全研究預覽
OpenAI 推出了 Codex Security,一款使用前沿模型與自動驗證的應用安全代理,能夠識別高可信度的漏洞並提供可執行的修復方案。
Descript GPT-5 配音管線提升多語言影片本地化
Descript 推出了一條以 GPT‑5 為核心的配音管線,能同時優化語意與時長,使配音影片的匯出量提升 15%,時長符合度提升最高達 43 個百分點,從而實現可擴展的多語言影片本地化。
Balyasny Asset Management AI 研究引擎案例研究
Balyasny Asset Management 開發了一個集中式 AI 研究引擎,使用 GPT-5.4 將深度研究任務從數天縮短至數小時,並自動化複雜的金融分析。
將機器人 AI 帶入嵌入式平台:資料集錄製、VLA 微調與裝置端優化
Hugging Face 與 NXP 提供了一份在 i.MX 95 SoC 上部署 Vision‑Language‑Action(VLA)模型的技術指南,強調資料集一致性、架構分解與非同步推論,以實現即時機器人控制。
OpenAI GPT-5.4 發布:具備 1M 令牌上下文的統一推理、程式編寫與電腦使用模型
OpenAI 推出 GPT‑5.4,一款具備原生電腦使用功能、1 M 令牌上下文,且在推理、程式編寫與工具能力上有所提升的統一前沿模型,於專業與代理基準測試中提供更高的準確度與更低的令牌使用量。
GPT-5.4 Thinking 系統卡片
OpenAI 已發布 GPT-5.4 Thinking 的系統卡片,這是第一個針對高網路安全能力實施特定安全緩解措施的通用推理模型。
OpenAI 推理模型 CoT 可控性研究
OpenAI 研究發現,目前的前沿推理模型在控制其思考鏈方面掙扎,這表明 CoT 監控仍是對抗推理隱蔽的堅實安全防護措施。
OpenAI AI 教育倡議:縮小 AI 能力差距
OpenAI 正在推出一套工具與機構合作夥伴關係,以縮小「能力過剩」的差距,該差距指大學生使用 AI 的水平比高階使用者低 90% 至 99%。
Hugging Face 模組化 Diffusers 發布
Hugging Face 推出了 Modular Diffusers,一個可組合的框架,允許使用者透過混合與匹配可重複使用的區塊來構建 diffusion 流程,而不必從頭編寫完整的流程。
OpenAI 推出 Adoption 新聞頻道,助力企業 AI 實施
OpenAI 推出了 Adoption 新聞頻道,這是一個以商業為導向的部落格,旨在協助企業領導者從 AI 實驗過渡到具體的營運變革與可擴展的採用。
VfL Wolfsburg ChatGPT Enterprise 實施
VfL Wolfsburg 已實施 ChatGPT Enterprise,以在全組織擴展 AI 能力,產生 50 多個自訂 GPT,並實現六位數的年度成本節省。
OpenAI ChatGPT for Excel 測試版與金融資料整合公告
OpenAI 推出以 GPT‑5.4 為核心的 ChatGPT for Excel(測試版),並新增與主要金融資料提供商的原生整合,使 AI 輔助的試算表建模與即時取得可信的市場資料成為可能。
OpenAI:企業再造的五大 AI 價值模型
OpenAI 定義了五大策略性價值模型——員工賦能、AI 原生分發、專家能力、系統與相依性管理以及流程再造——以將組織從孤立的 AI 試點推向完整的商業模式轉型。
OpenAI「Single-minus graviton tree amplitudes are nonzero」預印本公告
OpenAI 發布了一篇預印本,顯示在半共線區域中,單負號引力子樹振幅是非零的,該結果在 AI 模型 GPT‑5.2 Pro 的大量協助下得出。
OpenAI學習成果測量套件
OpenAI推出了學習成果測量套件,這是一個旨在追蹤 AI 對學生學習的長期影響、超越單純測驗分數的框架。
Axios 本地 AI 整合
Axios 正在利用 OpenAI 工具透過自動化製作工作流程、分析公共資料,並降低新城市新聞室啟動的營運成本,以擴大高影響力的本地新聞報導。
vLLM Triton 注意力後端深度探討
vLLM 已實作一個可移植的基於 Triton 的注意力後端,透過單一源碼實作,在 NVIDIA、AMD 與 Intel GPU 上達到最先進的效能。
PRX 第 3 部分:在 24 小時內訓練文字到圖像模型
Hugging Face 與 Photoroom 展示了一個在 24 小時內使用 32 顆 H200 GPU、1500 美元預算訓練出的文字到圖像模型,結合了像素空間訓練、代幣路由與表示對齊。
Gemini 3.1 Flash‑Lite 發布:快速、低成本的高容量工作負載 AI
Google DeepMind 推出 Gemini 3.1 Flash‑Lite,一款針對高容量工作負載的快速、成本效益 AI 模型,價格為每百萬輸入 token $0.25、每百萬輸出 token $1.50。
GPT-5.3 Instant 發佈說明
OpenAI 已發布 GPT-5.3 Instant,這款模型旨在提供更快的回應速度、改進的網路搜尋情境化,以及更流暢的對話流程。
GPT-5.3 Instant 版本發布:更流暢、更精確的日常對話
OpenAI 宣佈了 GPT‑5.3 Instant,此次更新讓日常的 ChatGPT 對話更流暢、更精確,且不易出現不必要的拒絕或過度謹慎的語言。