✷ 封存 · 11 個實驗室 · 870 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
DeepInfra 與 Hugging Face 推理提供者整合
Hugging Face 已將 DeepInfra 加入為支援的推理提供者,使開發者能直接透過 Hub 和用戶端 SDK 存取超過 100 個模型(包括 DeepSeek V4 和 Kimi-K2.6)的無伺服器推理。
NVIDIA Nemotron 3 Nano Omni 發佈說明 / 新功能介紹
NVIDIA 已發佈 Nemotron 3 Nano Omni,這是一款能夠跨文字、圖像、影片和音訊進行長上下文推理的全模態模型,在文檔智能和影片理解基準測試中提供了業界領先的準確度。
# OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用
OpenAI 已發布 Privacy Filter,一個開源的 1.5B 參數 PII 偵測器,能夠在 128k 上下文窗口內標記八種類別的敏感資料。
DeepSeek-V4 發佈說明:為 AI Agents 提供高效的 1M-Token 上下文
DeepSeek-V4 引入了由混合 CSA/HCA 注意力機制驅動的 1M-token 上下文窗口,專為長時程代理工作負載和工具使用軌跡進行了優化。
在 Chrome 擴充功能中使用 Transformers.js
Hugging Face 提供了一份技術指南,說明如何在使用 Manifest V3 的 Chrome 擴充功能中整合 Transformers.js,該架構以背景託管的模型為基礎,並由 Gemma 4 E2B 提供動力。
QIMMA:以品質為先的阿拉伯語大型語言模型排行榜
Hugging Face 與合作夥伴推出了 QIMMA,這是一個全新的阿拉伯語大型語言模型排行榜,採用了嚴格的品質驗證流程,以確保基準測試能真實反映語言能力。
Hugging Face:AI 與網路安全的未來
Hugging Face 主張,開源 AI 模型與工具對於網路安全防禦至關重要,以對抗像 Mythos 這類自主漏洞發現系統所帶來的風險。
Hugging Face transformers-to-mlx Skill and Test Harness
Hugging Face 發布了一項 Skill 與一個非 Agent 式的測試工具 (non-agentic test harness),旨在簡化從 transformers 函式庫到 mlx-lm 的語言模型移植流程,同時保持高代碼品質與審核信號。
使用 Sentence Transformers 訓練與微調多模態嵌入與重新排序模型
Hugging Face 發布了一篇關於使用 Sentence Transformers 訓練與微調多模態嵌入與重新排序模型的指南,展示了針對特定任務的微調如何提升檢索任務(如視覺文件檢索)的效能。
Ecom-RLVE: 電子商務對話代理的適應性可驗證環境
Hugging Face 推出 EcomRLVE-GYM,一個使用八個可驗證的多輪環境並具備適應性難度調整的框架,用於訓練電子商務代理,以彌合對話流暢性與實際任務完成之間的差距。
VAKRA 基準測試分析:代理推理、工具使用與失效模式
Hugging Face 發布了 VAKRA 基準測試,這是一個以工具為基礎的可執行套件,用於評估 AI 代理在 8,000 多個 API 和文件來源上的組合推理能力,揭示了在工具選擇、多跳推理和策略遵循方面的普遍失敗問題。
HCompany HoloTab 發布
HCompany 已發布 HoloTab,一款由 Holo3 模型驅動的 Chrome 擴充功能,允許使用者透過自然語言描述或錄製的例行工作來自動化網頁任務。
Waypoint-1.5 發行說明
Hugging Face 與 Overworld 已發布 Waypoint-1.5,這是一個即時視訊世界模型,可讓高保真互動生成環境在消費級 GPU 上本地運行。
Safetensors 加入 PyTorch 基金會
Safetensors 已轉為由 PyTorch 基金會與 Linux 基金會托管的基金會項目,以確保供應商中立的治理與社群驅動的開發。
Gemma 4 發布:開源多模態模型,支援本機運行
Gemma 4,來自 Google DeepMind 的新開源多模態系列,已在 Hugging Face 上發布,支援圖像、音訊、影像,最高 256K 上下文,並且與 transformers、llama.cpp、MLX、Rust、WebGPU 實現日零相容。
Falcon Perception 與 Falcon OCR 發布
Hugging Face 與 TII 推出 Falcon Perception,一個 0.6B 參數的早期融合 Transformer 用於開放詞彙定位,與 Falcon OCR,一個 0.3B 參數的高吞吐量文件理解模型。
Gradio Server:將自訂前端與 Gradio 後端整合
Hugging Face 推出 gradio.Server,一個 FastAPI 擴充套件,讓開發者能使用任何自訂前端框架,同時保留 Gradio 的排隊機制、API 基礎設施與 ZeroGPU 支援。
Granite 4.0 3B Vision 版本說明 / 新功能
IBM 已發布 Granite 4.0 3B Vision,一款針對企業文件理解而優化的緊湊型多模態模型,具備高精度的表格抽取、圖表推理與鍵值對抽取功能。
OpenMed CodonRoBERTa 多物種 mRNA 語言模型發布
OpenMed 發布了一個端到端的蛋白質工程流程,包含 CodonRoBERTa-large-v2(困惑度 4.10,CAI 0.404)與一個在 55 GPU 小時內訓練完成(成本約 $165)的 25 種物種密碼子優化模型套件。
TRL v1.0 版本說明 / 新功能
Hugging Face 發布 TRL v1.0,一個實作超過 75 種方法的穩定後訓練庫,具備雙軌穩定性模型,以在快速實驗迭代與生產級可靠性之間取得平衡。
Hugging Face OpenClaw 遷移指南
Hugging Face 提供兩種方法——推理提供者與本地 llama.cpp 設定,將 OpenClaw 代理從受限的 Claude 模型遷移至開源替代方案。
EVA 端對端語音代理評估框架
EVA 是一個全新的端對端框架,能同時評估語音代理的準確度與對話體驗,揭示任務成功與使用者滿意度之間的一致權衡。
領域特定嵌入微調與 NVIDIA Nemotron – 一天內完成
NVIDIA 與 Hugging Face 發布了一個單 GPU、一天內完成的管線,對 Llama‑Nemotron‑Embed‑1B‑v2 模型進行合成領域資料的微調,實現超過 10% 的檢索提升,且在真實企業資料集上最高提升 26%。
Hugging Face 開源狀況:2026 年春季
Hugging Face 報告稱,2025 年開源 AI 生態系統大幅擴張,特徵是中國在模型下載量上超過美國,且機器人領域迅速崛起成為最大的資料集類別。
Holotron-12B 高吞吐量電腦使用代理
H 公司發布了 Holotron-12B,一款基於 NVIDIA Nemotron-Nano-2 VL 的多模態電腦使用模型,採用混合 SSM‑Attention 架構,以實現代理工作負載的高推理吞吐量。
Hugging Face 儲存桶發布
Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,基於 Xet,能有效處理如檢查點與已處理資料等中間機器學習產物。
保持 Token 流動:來自 16 個開源 RL 庫的教訓
Hugging Face 調查了 16 個開源 RL 庫,發現非同步 RL 訓練將推理與訓練分離到不同的 GPU 池、使用 rollout 緩衝區,並以非同步方式推送權重;Ray 在協調層占主導,NCCL 廣播是常見的權重同步方法。
LeRobot v0.5.0 版本說明 / 新功能概覽
Hugging Face 發佈了 LeRobot v0.5.0,加入了完整的 Unitree G1 人形機器人支援、新的 VLA 策略如 Pi0‑FAST 與 Wall‑X,以及顯著的資料集效能優化。
Ulysses 序列平行化 用於 百萬標記 上下文訓練
Hugging Face 已將 Ulysses 序列平行化整合至 Accelerate、Transformers 與 TRL,使得透過在多個 GPU 上分散注意力計算,能夠訓練具備百萬標記上下文的 LLM。
將機器人 AI 帶入嵌入式平台:資料集錄製、VLA 微調與裝置端優化
Hugging Face 與 NXP 提供了一份在 i.MX 95 SoC 上部署 Vision‑Language‑Action(VLA)模型的技術指南,強調資料集一致性、架構分解與非同步推論,以實現即時機器人控制。
Hugging Face 模組化 Diffusers 發布
Hugging Face 推出了 Modular Diffusers,一個可組合的框架,允許使用者透過混合與匹配可重複使用的區塊來構建 diffusion 流程,而不必從頭編寫完整的流程。
PRX 第 3 部分:在 24 小時內訓練文字到圖像模型
Hugging Face 與 Photoroom 展示了一個在 24 小時內使用 32 顆 H200 GPU、1500 美元預算訓練出的文字到圖像模型,結合了像素空間訓練、代幣路由與表示對齊。
Transformer 中的專家混合(MoEs)
Hugging Face 已重新設計 transformers 函式庫,使混合專家(MoEs)成為一等公民,透過全新的權重載入重構、可插拔的專家後端,以及原生的專家平行化。
使用 Unsloth 與 Hugging Face Jobs 訓練 AI 模型
Hugging Face 已將 Unsloth 與 Hugging Face Jobs 整合,實現快速且低成本的 LLM 微調,特別針對如 LiquidAI/LFM2.5-1.2B-Instruct 等小型模型進行優化。
GGML 與 llama.cpp 加入 Hugging Face
GGML,llama.cpp 的創作者,已加入 Hugging Face,提供永續資源以支援本地 AI 推論,並簡化 Transformers 套件與本地模型部署之間的整合。
IBM 與加州大學柏克萊分校使用 IT-Bench 與 MAST 診斷企業代理失敗
IBM 研究院與加州大學柏克萊分校推出 MAST(多代理系統失敗分類法)以診斷企業 IT 代理失敗的原因,發現前沿模型受到孤立的驗證錯誤影響,而開源模型則面臨連鎖的系統性崩潰。
Gradio 6 gr.HTML:一次性 Web 應用程式開發
Gradio 6 引入了增強的 gr.HTML 支援,提供自訂模板、範圍化 CSS 與 JavaScript 互動性,使得能在單一 Python 檔案中建立複雜的 Web 元件。
Hugging Face CUDA 核函數代理技能
Hugging Face 推出了一項代理技能,使得像 Claude 和 Codex 這樣的程式編寫代理能夠編寫、基準測試並整合可投入生產的 CUDA 核函數,適用於 transformers 與 diffusers 函式庫。
OpenEnv: 在真實環境中評估使用工具的代理程式
Hugging Face 與 Meta 推出了 OpenEnv,這是一個開源框架,透過針對真實系統與 Calendar Gym 等生產級環境來評估 AI 代理程式,以彌合研究與生產可靠性之間的差距。
Transformers.js v4 發行說明 / 新功能
Hugging Face 已發布 Transformers.js v4,推出全新重寫的 C++ WebGPU 執行環境,以在瀏覽器與伺服器端執行環境中實現硬體加速,並同時提供獨立的 tokenizers 函式庫。
SyGra 2.0.0 Studio 發佈
SyGra 2.0.0 引入了 Studio,這是一個用於設計和執行合成數據生成工作流的視覺化互動式環境,無需手動編輯 YAML 檔案。
Hugging Face 社群評估
Hugging Face 推出了社群評估,一個去中心化的系統,用於在 Hub 上直接報告與彙總模型基準分數,以提升透明度與可重現性。
H Company Holo2-235B-A22B 預覽版發布
H Company 已發布 Holo2-235B-A22B 預覽版,這是一款在 Screenspot-Pro 與 OSWorld G 基準測試上達到 state-of-the-art 表現的使用者介面本地化模型。
全球開源 AI 生態系統的未來:從 DeepSeek 到 AI+
Hugging Face 分析了開源如何成為中國 AI 組織的主導策略,從孤立的模型突破轉向模型、硬體與基礎設施的可擴展、整合生態系統。
文本到圖像模型的訓練設計:消融實驗的教訓
由於 429 Too Many Requests 錯誤,提供的 Hugging Face 文章關於文本到圖像模型訓練設計的來源資料無法取得。
介紹 Daggr:以程式化方式串接 AI 應用並進行視覺檢查
Hugging Face 已發布 Daggr,這是一個開源的 Python 函式庫,讓開發者能以程式化方式將 Gradio 應用、機器學習模型與自訂函式串接成工作流程,並自動產生視覺化畫布以進行除錯與狀態管理。
Hugging Face Upskill:透過代理技能將專家能力轉移至較小模型
Hugging Face 推出了 upskill,這是一個利用高能力模型(如 Claude Opus 4.5)產生經驗證的「代理技能」的工具,能提升較小或開源模型在複雜任務(例如 CUDA 核心開發)上的效能與 token 效率。
中國開源 AI 生態系統的架構選擇:從 DeepSeek R1 到硬體優先、MoE 驅動的格局
在 DeepSeek R1 開源一年後,中國的 AI 社群已從追求單一模型的最強性能,轉向構建靈活、具成本效益且感知硬體的 AI 系統。混合專家模型 (MoE) 成為預設架構,透過在每次請求時僅激活部分專家,讓大型模型能以可負擔的成本運行。多模態競賽爆發,包含文字轉圖像、影片、音訊、3D 和代理的開源發布,且每個模型都附帶完整的工具鏈。小模型 (≤30 B) 在本地部署和微調方面的普及率激增,而大型 MoE 模型則作為蒸餾的教師網路。Apache 2.0 和 MIT 授權現在佔據主導地位,消除了法律摩擦並加速了商業採用。硬體優先的思維已經出現:發布的版本附帶針對國產晶片(華為 Ascend、寒武紀 Cambricon、崑崙 Kunlun)優化的量化、推理和服務堆棧,且訓練流程也公開記錄。現在的競爭優勢在於系統設計、部署效率和開源生態系統整合,而非原始模型規模。
Alyah:阿聯酋方言基準測試(針對阿拉伯語大型語言模型)
Hugging Face 與合作夥伴推出了 Alyah,這是一個由人工精選的 1,173 個樣本的基準測試,旨在評估阿拉伯語大型語言模型在阿聯酋方言上的語言與文化能力。
GPT-OSS 代理式強化學習訓練:實務回顧
Hugging Face 與 LinkedIn 的研究人員詳細說明了使 GPT-OSS 模型能夠穩定執行代理式強化學習所需的工程修正,重點在於 MoE 路由、注意力匯流 (attention sinks) 與記憶體效能。