超越LLM:為什麼可擴展的企業AI採用依賴於代理邏輯
由於提供的來源材料因 429 Too Many Requests 錯誤而無法取得,因此不包含任何關於代理邏輯或企業AI採用的技術內容。
PyTorch 性能分析:torch.profiler 初學者指南
Hugging Face 提供了完整的指南,說明如何使用 torch.profiler 來辨識瓶頸、了解 CPU-GPU 分派鏈,並分析 torch.compile 對 kernel 執行的影響。
Reachy Mini 本地語音後端整合
Hugging Face 已為 Reachy Mini 發布了一個本地語音轉語音管線,使機器人能夠使用級聯的 VAD、STT、LLM 和 TTS 堆疊完全在本地處理對話。
TRL 中的 Delta Weight Sync 實現極低頻寬的兆級參數模型訓練
Hugging Face 宣佈在 TRL 中推出 Delta Weight Sync 功能,該功能通過 Hugging Face Buckets 僅傳輸稀疏的權重變化,將非同步 RL 訓練中的權重同步頻寬降低了 100 倍以上,從而實現了無需共享集群的解耦訓練。
Hugging Face AI Agent 術語表:定義 Harness、Scaffold 與 Agent 架構
Hugging Face 為 AI Agent 提供了一套標準化詞彙,將 Agent 定義為模型 (model)、用於執行的 harness 以及用於定義行為的 scaffolding 的結合體。
OlmoEarth v1.1 版本說明 / 新功能
Hugging Face 與 AllenAI 已發布 OlmoEarth v1.1,這是一系列地球觀測模型,可將計算成本降低最高達 3倍,同時保持與 v1 相近的性能。
Ettin Reranker 系列 v1 版本說明
Hugging Face 發布了 Ettin Reranker 系列,六款參數從 17M 到 1B 的 CrossEncoder 重新排序模型,從 mxbai-rerank-large-v2 蒸餾而成,達到最先進的檢索重新排序品質與速度。
PaddleOCR 3.5 版本說明 / 新功能
PaddleOCR 3.5 引入 Hugging Face Transformers 作為支援的推論後端,讓 OCR 與文件解析模型能更順暢地整合到基於 PyTorch 的工作流程中。
Granite 多語言嵌入 R2 發布:開放 Apache 2.0 多語言嵌入,支援 32K 上下文
IBM Granite 發布了兩款 Apache 2.0 多語言嵌入模型——granite-embedding-97m-multilingual-r2(97M)和 granite-embedding-311m-multilingual-r2(311M)——支援 32K 令牌上下文、超過 200 種語言,且在 100M 以下模型中取得最高檢索分數。
在連續批次中解鎖非同步性
Hugging Face 示範了如何在連續批次中使用 CUDA 串流與事件讓 CPU 與 GPU 工作重疊,將 8B 模型產生 8K 令牌的 LLM 推論時間縮短約 22%。
在 AWS 上基礎模型訓練與推論的構建模組
Hugging Face 在 AWS 上闡述了一個四層架構框架——包括基礎設施、資源編排、機器學習軟體堆疊與可觀測性——以支援預訓練、後訓練與測試時計算的演變擴展規則。
vLLM V1 移植:確保強化學習中的後端正確性
ServiceNow AI 透過修正 logprob 語意、執行時預設值、權重更新路徑,並實作 fp32 lm_head,使 vLLM V0 與 V1 在 RL rollout 生成上達成等價。
Hugging Face 開放 ASR 排行榜:私有資料集以對抗 Benchmaxxing
Hugging Face 已將 Appen Inc. 與 DataoceanAI 的私有評估資料集加入 Open ASR Leaderboard,以防止測試集污染,並提供更具韌性的真實世界 ASR 效能衡量。
IBM Granite 4.1 LLMs 發行說明 / 技術概覽
IBM 已發布 Granite 4.1,這是一系列密集型、僅解碼器的 LLMs(3B、8B 和 30B),透過嚴謹的資料策劃和多階段強化學習管線來實現高效能。
DeepInfra 與 Hugging Face 推理提供者整合
Hugging Face 已將 DeepInfra 加入為支援的推理提供者,使開發者能直接透過 Hub 和用戶端 SDK 存取超過 100 個模型(包括 DeepSeek V4 和 Kimi-K2.6)的無伺服器推理。
NVIDIA Nemotron 3 Nano Omni 發佈說明 / 新功能介紹
NVIDIA 已發佈 Nemotron 3 Nano Omni,這是一款能夠跨文字、圖像、影片和音訊進行長上下文推理的全模態模型,在文檔智能和影片理解基準測試中提供了業界領先的準確度。
# OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用
OpenAI 已發布 Privacy Filter,一個開源的 1.5B 參數 PII 偵測器,能夠在 128k 上下文窗口內標記八種類別的敏感資料。
DeepSeek-V4 發佈說明:為 AI Agents 提供高效的 1M-Token 上下文
DeepSeek-V4 引入了由混合 CSA/HCA 注意力機制驅動的 1M-token 上下文窗口,專為長時程代理工作負載和工具使用軌跡進行了優化。
在 Chrome 擴充功能中使用 Transformers.js
Hugging Face 提供了一份技術指南,說明如何在使用 Manifest V3 的 Chrome 擴充功能中整合 Transformers.js,該架構以背景託管的模型為基礎,並由 Gemma 4 E2B 提供動力。
QIMMA:以品質為先的阿拉伯語大型語言模型排行榜
Hugging Face 與合作夥伴推出了 QIMMA,這是一個全新的阿拉伯語大型語言模型排行榜,採用了嚴格的品質驗證流程,以確保基準測試能真實反映語言能力。
Hugging Face:AI 與網路安全的未來
Hugging Face 主張,開源 AI 模型與工具對於網路安全防禦至關重要,以對抗像 Mythos 這類自主漏洞發現系統所帶來的風險。
Ecom-RLVE: 電子商務對話代理的適應性可驗證環境
Hugging Face 推出 EcomRLVE-GYM,一個使用八個可驗證的多輪環境並具備適應性難度調整的框架,用於訓練電子商務代理,以彌合對話流暢性與實際任務完成之間的差距。
Hugging Face transformers-to-mlx Skill and Test Harness
Hugging Face 發布了一項 Skill 與一個非 Agent 式的測試工具 (non-agentic test harness),旨在簡化從 transformers 函式庫到 mlx-lm 的語言模型移植流程,同時保持高代碼品質與審核信號。
使用 Sentence Transformers 訓練與微調多模態嵌入與重新排序模型
Hugging Face 發布了一篇關於使用 Sentence Transformers 訓練與微調多模態嵌入與重新排序模型的指南,展示了針對特定任務的微調如何提升檢索任務(如視覺文件檢索)的效能。
深入了解 VAKRA:代理的推理、工具使用與失效模式
IBM Research 推出了 VAKRA,這是一個可執行基準測試,用於評估 AI 代理在 API 與文件之間的組合推理能力,揭示了儘管單獨工具調用有所進步,但在工具使用和策略遵循方面仍存在顯著差距。
HCompany HoloTab 發布
HCompany 已發布 HoloTab,一款由 Holo3 模型驅動的 Chrome 擴充功能,允許使用者透過自然語言描述或錄製的例行工作來自動化網頁任務。
Waypoint-1.5 發行說明
Hugging Face 與 Overworld 已發布 Waypoint-1.5,這是一個即時視訊世界模型,可讓高保真互動生成環境在消費級 GPU 上本地運行。
Safetensors 加入 PyTorch 基金會
Safetensors 已轉為由 PyTorch 基金會與 Linux 基金會托管的基金會項目,以確保供應商中立的治理與社群驅動的開發。
Gemma 4 發布:開源多模態模型,支援本機運行
Gemma 4,來自 Google DeepMind 的新開源多模態系列,已在 Hugging Face 上發布,支援圖像、音訊、影像,最高 256K 上下文,並且與 transformers、llama.cpp、MLX、Rust、WebGPU 實現日零相容。
Falcon Perception 與 Falcon OCR 發布
Hugging Face 與 TII 推出 Falcon Perception,一個 0.6B 參數的早期融合 Transformer 用於開放詞彙定位,與 Falcon OCR,一個 0.3B 參數的高吞吐量文件理解模型。
Gradio Server:將自訂前端與 Gradio 後端整合
Hugging Face 推出 gradio.Server,一個 FastAPI 擴充套件,讓開發者能使用任何自訂前端框架,同時保留 Gradio 的排隊機制、API 基礎設施與 ZeroGPU 支援。
Granite 4.0 3B Vision 版本說明 / 新功能
IBM 已發布 Granite 4.0 3B Vision,一款針對企業文件理解而優化的緊湊型多模態模型,具備高精度的表格抽取、圖表推理與鍵值對抽取功能。
TRL v1.0 版本說明 / 新功能
Hugging Face 發布 TRL v1.0,一個實作超過 75 種方法的穩定後訓練庫,具備雙軌穩定性模型,以在快速實驗迭代與生產級可靠性之間取得平衡。
Hugging Face OpenClaw 遷移指南
Hugging Face 提供兩種方法——推理提供者與本地 llama.cpp 設定,將 OpenClaw 代理從受限的 Claude 模型遷移至開源替代方案。
EVA 端對端語音代理評估框架
EVA 是一個全新的端對端框架,能同時評估語音代理的準確度與對話體驗,揭示任務成功與使用者滿意度之間的一致權衡。
領域特定嵌入微調與 NVIDIA Nemotron – 一天內完成
NVIDIA 與 Hugging Face 發布了一個單 GPU、一天內完成的管線,對 Llama‑Nemotron‑Embed‑1B‑v2 模型進行合成領域資料的微調,實現超過 10% 的檢索提升,且在真實企業資料集上最高提升 26%。
Hugging Face 開源狀況:2026 年春季
Hugging Face 報告稱,2025 年開源 AI 生態系統大幅擴張,特徵是中國在模型下載量上超過美國,且機器人領域迅速崛起成為最大的資料集類別。
Holotron-12B 高吞吐量電腦使用代理
H 公司發布了 Holotron-12B,一款基於 NVIDIA Nemotron-Nano-2 VL 的多模態電腦使用模型,採用混合 SSM‑Attention 架構,以實現代理工作負載的高推理吞吐量。
保持 Token 流動:來自 16 個開源 RL 庫的教訓
Hugging Face 調查了 16 個開源 RL 庫,發現非同步 RL 訓練將推理與訓練分離到不同的 GPU 池、使用 rollout 緩衝區,並以非同步方式推送權重;Ray 在協調層占主導,NCCL 廣播是常見的權重同步方法。
Hugging Face 儲存桶發布
Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,基於 Xet,能有效處理如檢查點與已處理資料等中間機器學習產物。
Ulysses 序列平行化 用於 百萬標記 上下文訓練
Hugging Face 已將 Ulysses 序列平行化整合至 Accelerate、Transformers 與 TRL,使得透過在多個 GPU 上分散注意力計算,能夠訓練具備百萬標記上下文的 LLM。
LeRobot v0.5.0 版本說明 / 新功能概覽
Hugging Face 發佈了 LeRobot v0.5.0,加入了完整的 Unitree G1 人形機器人支援、新的 VLA 策略如 Pi0‑FAST 與 Wall‑X,以及顯著的資料集效能優化。
將機器人 AI 帶入嵌入式平台:資料集錄製、VLA 微調與裝置端優化
Hugging Face 與 NXP 提供了一份在 i.MX 95 SoC 上部署 Vision‑Language‑Action(VLA)模型的技術指南,強調資料集一致性、架構分解與非同步推論,以實現即時機器人控制。
Hugging Face 模組化 Diffusers 發布
Hugging Face 推出了 Modular Diffusers,一個可組合的框架,允許使用者透過混合與匹配可重複使用的區塊來構建 diffusion 流程,而不必從頭編寫完整的流程。
PRX 第 3 部分:在 24 小時內訓練文字到圖像模型
Hugging Face 與 Photoroom 展示了一個在 24 小時內使用 32 顆 H200 GPU、1500 美元預算訓練出的文字到圖像模型,結合了像素空間訓練、代幣路由與表示對齊。
Transformer 中的專家混合(MoEs)
Hugging Face 已重新設計 transformers 函式庫,使混合專家(MoEs)成為一等公民,透過全新的權重載入重構、可插拔的專家後端,以及原生的專家平行化。
使用 Unsloth 與 Hugging Face Jobs 訓練 AI 模型
Hugging Face 已將 Unsloth 與 Hugging Face Jobs 整合,實現快速且低成本的 LLM 微調,特別針對如 LiquidAI/LFM2.5-1.2B-Instruct 等小型模型進行優化。
GGML 與 llama.cpp 加入 Hugging Face
GGML,llama.cpp 的創作者,已加入 Hugging Face,提供永續資源以支援本地 AI 推論,並簡化 Transformers 套件與本地模型部署之間的整合。
IBM 與加州大學柏克萊分校使用 IT-Bench 與 MAST 診斷企業代理失敗
IBM 研究院與加州大學柏克萊分校推出 MAST(多代理系統失敗分類法)以診斷企業 IT 代理失敗的原因,發現前沿模型受到孤立的驗證錯誤影響,而開源模型則面臨連鎖的系統性崩潰。
Gradio 6 gr.HTML:一次性 Web 應用程式開發
Gradio 6 引入了增強的 gr.HTML 支援,提供自訂模板、範圍化 CSS 與 JavaScript 互動性,使得能在單一 Python 檔案中建立複雜的 Web 元件。