51

超越LLM:為什麼可擴展的企業AI採用依賴於代理邏輯

由於提供的來源材料因 429 Too Many Requests 錯誤而無法取得,因此不包含任何關於代理邏輯或企業AI採用的技術內容。

52

PyTorch 性能分析:torch.profiler 初學者指南

Hugging Face 提供了完整的指南,說明如何使用 torch.profiler 來辨識瓶頸、了解 CPU-GPU 分派鏈,並分析 torch.compile 對 kernel 執行的影響。

53

Reachy Mini 本地語音後端整合

Hugging Face 已為 Reachy Mini 發布了一個本地語音轉語音管線,使機器人能夠使用級聯的 VAD、STT、LLM 和 TTS 堆疊完全在本地處理對話。

54

TRL 中的 Delta Weight Sync 實現極低頻寬的兆級參數模型訓練

Hugging Face 宣佈在 TRL 中推出 Delta Weight Sync 功能,該功能通過 Hugging Face Buckets 僅傳輸稀疏的權重變化,將非同步 RL 訓練中的權重同步頻寬降低了 100 倍以上,從而實現了無需共享集群的解耦訓練。

55

Hugging Face AI Agent 術語表:定義 Harness、Scaffold 與 Agent 架構

Hugging Face 為 AI Agent 提供了一套標準化詞彙,將 Agent 定義為模型 (model)、用於執行的 harness 以及用於定義行為的 scaffolding 的結合體。

56

OlmoEarth v1.1 版本說明 / 新功能

Hugging Face 與 AllenAI 已發布 OlmoEarth v1.1,這是一系列地球觀測模型,可將計算成本降低最高達 3倍,同時保持與 v1 相近的性能。

57

Ettin Reranker 系列 v1 版本說明

Hugging Face 發布了 Ettin Reranker 系列,六款參數從 17M 到 1B 的 CrossEncoder 重新排序模型,從 mxbai-rerank-large-v2 蒸餾而成,達到最先進的檢索重新排序品質與速度。

58

PaddleOCR 3.5 版本說明 / 新功能

PaddleOCR 3.5 引入 Hugging Face Transformers 作為支援的推論後端,讓 OCR 與文件解析模型能更順暢地整合到基於 PyTorch 的工作流程中。

59

Granite 多語言嵌入 R2 發布:開放 Apache 2.0 多語言嵌入,支援 32K 上下文

IBM Granite 發布了兩款 Apache 2.0 多語言嵌入模型——granite-embedding-97m-multilingual-r2(97M)和 granite-embedding-311m-multilingual-r2(311M)——支援 32K 令牌上下文、超過 200 種語言,且在 100M 以下模型中取得最高檢索分數。

60

在連續批次中解鎖非同步性

Hugging Face 示範了如何在連續批次中使用 CUDA 串流與事件讓 CPU 與 GPU 工作重疊,將 8B 模型產生 8K 令牌的 LLM 推論時間縮短約 22%。

61

在 AWS 上基礎模型訓練與推論的構建模組

Hugging Face 在 AWS 上闡述了一個四層架構框架——包括基礎設施、資源編排、機器學習軟體堆疊與可觀測性——以支援預訓練、後訓練與測試時計算的演變擴展規則。

62

vLLM V1 移植:確保強化學習中的後端正確性

ServiceNow AI 透過修正 logprob 語意、執行時預設值、權重更新路徑,並實作 fp32 lm_head,使 vLLM V0 與 V1 在 RL rollout 生成上達成等價。

63

Hugging Face 開放 ASR 排行榜:私有資料集以對抗 Benchmaxxing

Hugging Face 已將 Appen Inc. 與 DataoceanAI 的私有評估資料集加入 Open ASR Leaderboard,以防止測試集污染,並提供更具韌性的真實世界 ASR 效能衡量。

64

IBM Granite 4.1 LLMs 發行說明 / 技術概覽

IBM 已發布 Granite 4.1,這是一系列密集型、僅解碼器的 LLMs(3B、8B 和 30B),透過嚴謹的資料策劃和多階段強化學習管線來實現高效能。

65

DeepInfra 與 Hugging Face 推理提供者整合

Hugging Face 已將 DeepInfra 加入為支援的推理提供者,使開發者能直接透過 Hub 和用戶端 SDK 存取超過 100 個模型(包括 DeepSeek V4 和 Kimi-K2.6)的無伺服器推理。

66

NVIDIA Nemotron 3 Nano Omni 發佈說明 / 新功能介紹

NVIDIA 已發佈 Nemotron 3 Nano Omni,這是一款能夠跨文字、圖像、影片和音訊進行長上下文推理的全模態模型,在文檔智能和影片理解基準測試中提供了業界領先的準確度。

67

# OpenAI 隱私過濾器:構建可擴展的 PII 偵測網頁應用

OpenAI 已發布 Privacy Filter,一個開源的 1.5B 參數 PII 偵測器,能夠在 128k 上下文窗口內標記八種類別的敏感資料。

68

DeepSeek-V4 發佈說明:為 AI Agents 提供高效的 1M-Token 上下文

DeepSeek-V4 引入了由混合 CSA/HCA 注意力機制驅動的 1M-token 上下文窗口,專為長時程代理工作負載和工具使用軌跡進行了優化。

69

在 Chrome 擴充功能中使用 Transformers.js

Hugging Face 提供了一份技術指南,說明如何在使用 Manifest V3 的 Chrome 擴充功能中整合 Transformers.js,該架構以背景託管的模型為基礎,並由 Gemma 4 E2B 提供動力。

70

QIMMA:以品質為先的阿拉伯語大型語言模型排行榜

Hugging Face 與合作夥伴推出了 QIMMA,這是一個全新的阿拉伯語大型語言模型排行榜,採用了嚴格的品質驗證流程,以確保基準測試能真實反映語言能力。

71

Hugging Face:AI 與網路安全的未來

Hugging Face 主張,開源 AI 模型與工具對於網路安全防禦至關重要,以對抗像 Mythos 這類自主漏洞發現系統所帶來的風險。

72

Ecom-RLVE: 電子商務對話代理的適應性可驗證環境

Hugging Face 推出 EcomRLVE-GYM,一個使用八個可驗證的多輪環境並具備適應性難度調整的框架,用於訓練電子商務代理,以彌合對話流暢性與實際任務完成之間的差距。

73

Hugging Face transformers-to-mlx Skill and Test Harness

Hugging Face 發布了一項 Skill 與一個非 Agent 式的測試工具 (non-agentic test harness),旨在簡化從 transformers 函式庫到 mlx-lm 的語言模型移植流程,同時保持高代碼品質與審核信號。

74

使用 Sentence Transformers 訓練與微調多模態嵌入與重新排序模型

Hugging Face 發布了一篇關於使用 Sentence Transformers 訓練與微調多模態嵌入與重新排序模型的指南,展示了針對特定任務的微調如何提升檢索任務(如視覺文件檢索)的效能。

75

深入了解 VAKRA:代理的推理、工具使用與失效模式

IBM Research 推出了 VAKRA,這是一個可執行基準測試,用於評估 AI 代理在 API 與文件之間的組合推理能力,揭示了儘管單獨工具調用有所進步,但在工具使用和策略遵循方面仍存在顯著差距。

76

HCompany HoloTab 發布

HCompany 已發布 HoloTab,一款由 Holo3 模型驅動的 Chrome 擴充功能,允許使用者透過自然語言描述或錄製的例行工作來自動化網頁任務。

77

Waypoint-1.5 發行說明

Hugging Face 與 Overworld 已發布 Waypoint-1.5,這是一個即時視訊世界模型,可讓高保真互動生成環境在消費級 GPU 上本地運行。

78

Safetensors 加入 PyTorch 基金會

Safetensors 已轉為由 PyTorch 基金會與 Linux 基金會托管的基金會項目,以確保供應商中立的治理與社群驅動的開發。

79

Gemma 4 發布:開源多模態模型,支援本機運行

Gemma 4,來自 Google DeepMind 的新開源多模態系列,已在 Hugging Face 上發布,支援圖像、音訊、影像,最高 256K 上下文,並且與 transformers、llama.cpp、MLX、Rust、WebGPU 實現日零相容。

80

Falcon Perception 與 Falcon OCR 發布

Hugging Face 與 TII 推出 Falcon Perception,一個 0.6B 參數的早期融合 Transformer 用於開放詞彙定位,與 Falcon OCR,一個 0.3B 參數的高吞吐量文件理解模型。

81

Gradio Server:將自訂前端與 Gradio 後端整合

Hugging Face 推出 gradio.Server,一個 FastAPI 擴充套件,讓開發者能使用任何自訂前端框架,同時保留 Gradio 的排隊機制、API 基礎設施與 ZeroGPU 支援。

82

Granite 4.0 3B Vision 版本說明 / 新功能

IBM 已發布 Granite 4.0 3B Vision,一款針對企業文件理解而優化的緊湊型多模態模型,具備高精度的表格抽取、圖表推理與鍵值對抽取功能。

83

TRL v1.0 版本說明 / 新功能

Hugging Face 發布 TRL v1.0,一個實作超過 75 種方法的穩定後訓練庫,具備雙軌穩定性模型,以在快速實驗迭代與生產級可靠性之間取得平衡。

84

Hugging Face OpenClaw 遷移指南

Hugging Face 提供兩種方法——推理提供者與本地 llama.cpp 設定,將 OpenClaw 代理從受限的 Claude 模型遷移至開源替代方案。

85

EVA 端對端語音代理評估框架

EVA 是一個全新的端對端框架,能同時評估語音代理的準確度與對話體驗,揭示任務成功與使用者滿意度之間的一致權衡。

86

領域特定嵌入微調與 NVIDIA Nemotron – 一天內完成

NVIDIA 與 Hugging Face 發布了一個單 GPU、一天內完成的管線,對 Llama‑Nemotron‑Embed‑1B‑v2 模型進行合成領域資料的微調,實現超過 10% 的檢索提升,且在真實企業資料集上最高提升 26%。

87

Hugging Face 開源狀況:2026 年春季

Hugging Face 報告稱,2025 年開源 AI 生態系統大幅擴張,特徵是中國在模型下載量上超過美國,且機器人領域迅速崛起成為最大的資料集類別。

88

Holotron-12B 高吞吐量電腦使用代理

H 公司發布了 Holotron-12B,一款基於 NVIDIA Nemotron-Nano-2 VL 的多模態電腦使用模型,採用混合 SSM‑Attention 架構,以實現代理工作負載的高推理吞吐量。

89

保持 Token 流動:來自 16 個開源 RL 庫的教訓

Hugging Face 調查了 16 個開源 RL 庫,發現非同步 RL 訓練將推理與訓練分離到不同的 GPU 池、使用 rollout 緩衝區,並以非同步方式推送權重;Ray 在協調層占主導,NCCL 廣播是常見的權重同步方法。

90

Hugging Face 儲存桶發布

Hugging Face 推出了儲存桶,一種可變的、類似 S3 的物件儲存系統,基於 Xet,能有效處理如檢查點與已處理資料等中間機器學習產物。

91

Ulysses 序列平行化 用於 百萬標記 上下文訓練

Hugging Face 已將 Ulysses 序列平行化整合至 Accelerate、Transformers 與 TRL,使得透過在多個 GPU 上分散注意力計算,能夠訓練具備百萬標記上下文的 LLM。

92

LeRobot v0.5.0 版本說明 / 新功能概覽

Hugging Face 發佈了 LeRobot v0.5.0,加入了完整的 Unitree G1 人形機器人支援、新的 VLA 策略如 Pi0‑FAST 與 Wall‑X,以及顯著的資料集效能優化。

93

將機器人 AI 帶入嵌入式平台:資料集錄製、VLA 微調與裝置端優化

Hugging Face 與 NXP 提供了一份在 i.MX 95 SoC 上部署 Vision‑Language‑Action(VLA)模型的技術指南,強調資料集一致性、架構分解與非同步推論,以實現即時機器人控制。

94

Hugging Face 模組化 Diffusers 發布

Hugging Face 推出了 Modular Diffusers,一個可組合的框架,允許使用者透過混合與匹配可重複使用的區塊來構建 diffusion 流程,而不必從頭編寫完整的流程。

95

PRX 第 3 部分:在 24 小時內訓練文字到圖像模型

Hugging Face 與 Photoroom 展示了一個在 24 小時內使用 32 顆 H200 GPU、1500 美元預算訓練出的文字到圖像模型,結合了像素空間訓練、代幣路由與表示對齊。

96

Transformer 中的專家混合(MoEs)

Hugging Face 已重新設計 transformers 函式庫,使混合專家(MoEs)成為一等公民,透過全新的權重載入重構、可插拔的專家後端,以及原生的專家平行化。

97

使用 Unsloth 與 Hugging Face Jobs 訓練 AI 模型

Hugging Face 已將 Unsloth 與 Hugging Face Jobs 整合,實現快速且低成本的 LLM 微調,特別針對如 LiquidAI/LFM2.5-1.2B-Instruct 等小型模型進行優化。

98

GGML 與 llama.cpp 加入 Hugging Face

GGML,llama.cpp 的創作者,已加入 Hugging Face,提供永續資源以支援本地 AI 推論,並簡化 Transformers 套件與本地模型部署之間的整合。

99

IBM 與加州大學柏克萊分校使用 IT-Bench 與 MAST 診斷企業代理失敗

IBM 研究院與加州大學柏克萊分校推出 MAST(多代理系統失敗分類法)以診斷企業 IT 代理失敗的原因,發現前沿模型受到孤立的驗證錯誤影響,而開源模型則面臨連鎖的系統性崩潰。

100

Gradio 6 gr.HTML:一次性 Web 應用程式開發

Gradio 6 引入了增強的 gr.HTML 支援,提供自訂模板、範圍化 CSS 與 JavaScript 互動性,使得能在單一 Python 檔案中建立複雜的 Web 元件。