151

Hugging Face 與 VirusTotal 安全合作

Hugging Face 與 VirusTotal 合作,持續掃描 Hugging Face Hub 上超過 220 萬個公開模型與資料集倉庫,以保護機器學習社群免受惡意資產的威脅。

152

Sentence Transformers 加入 Hugging Face

Sentence Transformers 函式庫正從德國達姆施塔特工業大學的 UKP Lab 轉移至 Hugging Face,以利用更完善的基礎設施持續進行開源開發。

153

Hugging Face AI Sheets 視覺更新

Hugging Face AI Sheets 是一款開源工具,現在支援視覺功能,使用者可以從影像中提取結構化資料、根據文字生成視覺內容,並在試算表介面中編輯影像。

154

開源 OCR 模型指南 – 選擇、執行與擴展現代視覺語言 OCR

Hugging Face 宣布了一份完整的開放權重 OCR 模型指南,說明其功能、基準表現、成本效益,以及如何在本地或透過託管端點執行它們。

155

AI for Food Allergies:生物醫學研究的開放資料集收集

Hugging Face 推出 AI for Food Allergies 計畫,首次推出開放且由社群驅動的精選資料集集合,以加速 AI 驅動的過敏原預測、藥物發現與食品安全。

156

Google Cloud C4 與 Intel Xeon 6 在 GPT OSS 上的效能

Google Cloud C4 虛擬機搭載 Intel Xeon 6 處理器,較 C3 虛擬機在 GPT OSS MoE 模型推論的總擁有成本(TCO)提升最高可達 1.7 倍。

157

在 Intel CPU 上使用 OpenVINO 以 3 步驟執行 SmolVLM

Hugging Face 示範如何使用 Optimum‑Intel 與 OpenVINO 在 Intel CPU 上部署小型視覺語言模型 SmolVLM,達到比 PyTorch 高達 65 倍的吞吐量。

158

Nemotron-Personas-India:主權 AI 的合成資料

NVIDIA 已發布 Nemotron-Personas-India,這是一個以 CC BY 4.0 授權的合成資料集,包含 2100 萬印度語系人物,旨在彌補印度多語言與文化多樣環境中主權 AI 的資料缺口。

159

Arm 參加 2025 年 PyTorch 大會

Arm 參與 10 月 22-23 日的 PyTorch 大會,展示包括 ExecuTorch 與 vLLM 在內的 AI 部署工具,並蒐集開發者對於在雲端、Edge 與行動平台上擴展 AI 的回饋。

160

BigCodeArena:端到端評估程式碼生成與執行

Hugging Face 推出 BigCodeArena,一個人機互動平台,透過讓使用者即時執行與互動生成的程式碼,來評估程式碼生成模型。

161

使用 Core ML 與 dots.ocr 的最先進 OCR

Hugging Face 展示了將 3B 參數的 dots.ocr 模型轉換為在設備上使用 Core ML 與 MLX 執行的過程,實現了超越 Gemini 2.5 Pro 在 OmniDocBench 基準測試上的性能。

162

Hugging Face 推出 RTEB 用於檢索嵌入評估

Hugging Face 已推出檢索嵌入基準(RTEB)的測試版,這是一項新標準,旨在透過開放與私有資料集的混合,衡量嵌入模型的真實泛化能力與檢索準確度。

163

VibeGame:一個高階宣告式引擎,用於 AI 輔助的遊戲開發

Hugging Face 研究員 Dylan Ebert 推出 VibeGame,一個宣告式遊戲引擎,透過結合高階抽象與針對 AI 能力最佳化的網頁堆疊,實現「vibe coding」的可能。

164

在 Intel Core Ultra 上使用深度裁剪草稿模型加速 Qwen3-8B

在 Intel Core Ultra 上透過投機解碼與深度裁剪的 Qwen3‑0.6B 草稿模型加速 Qwen3-8B,達到約 1.4 倍的提速,讓本地 AI 代理透過 Hugging Face smolagents 以更快速度運行。

165

Nemotron-Personas-Japan 發布

NVIDIA 已發布 Nemotron-Personas-Japan,這是一個包含 600 萬日本人物角色的開源合成資料集,旨在支援主權 AI 與具文化意識的大型語言模型的開發。

166

Swift Transformers 1.0 版本說明 / 新功能

Hugging Face 發布了 Swift Transformers 1.0,這是一個穩定的函式庫,提供分詞器、Hub 存取與模型封裝,以簡化 Apple Silicon 開發者本地 LLM 的整合。

167

Smol2Operator 釋出:將小型 VLM 轉變為開源的代理式 GUI 程式設計師

Hugging Face 發布了 Smol2Operator,一套後訓練配方,可將 2.2 B 參數的 SmolVLM2‑2.2B‑Instruct 模型轉換為開源的代理式 GUI 程式設計師,所有程式碼、資料集與最終模型皆公開可用。

168

SyGra:低程式碼框架,用於 LLM 與 SLM 資料生成

SyGra 是由 ServiceNow AI 開發的低程式碼/無程式碼框架,旨在簡化大型與小型語言模型資料集的建立、轉換與對齊。

169

Hugging Face Gaia2 與 Meta Agents Research Environments(ARE)發布

Hugging Face 已發布 Gaia2——一個讀寫型代理基準測試,以及 Meta Agents Research Environments(ARE)框架,用於在複雜的真實世界模擬環境中評估與除錯 AI 代理。

170

Scaleway 成為 Hugging Face 推理提供者 – 功能、使用方式與計費

Scaleway 現已成為 Hugging Face Hub 的官方推理提供者,提供低延遲、歐洲託管的無伺服器存取前沿模型,並具彈性計費選項。

171

Hugging Face RiskRubric.ai 公告

Hugging Face 已宣布推出 RiskRubric.ai,一個標準化的風險評估平台,透過透明度、可靠性、安全性、隱私、安全與聲譽六大支柱來評估 AI 模型,提供可比較的風險分數與字母等級。

172

Hugging Face 整合 Public AI 作為推論提供者

Hugging Face 已將 Public AI 加入為受支援的推論提供者,讓使用者能以無伺服器方式存取來自 Swiss AI Initiative 與 AI Singapore 等機構的主權模型。

173

LeRobotDataset v3.0 版本說明 / 新功能

Hugging Face 已發布 LeRobotDataset v3.0,一種標準化的機器人學習資料集格式,能夠支援大規模資料儲存與串流,以容納數百萬個情節。

174

使用 Gradio 的可見水印

Hugging Face 已推出簡易方式,透過 Gradio 函式庫為 AI 生成的圖像、影片與文字加入可見水印,以提升合成內容的透明度。

175

Writer Palmyra-mini 系列發布

Writer 已發布 Palmyra-mini 系列,這是一組輕量級開源模型(參數量介於 1.5B 至 1.7B),包括一個基礎模型以及兩個針對邏輯與數學優化的專門推理變體。

176

使用 Together AI 微調 Hugging Face Hub 的大型語言模型

Together AI 與 Hugging Face 已整合平台,讓開發者能使用 Together AI 的基礎設施微調 Hugging Face Hub 上任何相容的 LLM。

177

Jupyter Agents:訓練 LLM 以筆記本推理

Hugging Face 推出了一條用於產生高品質合成資料與最佳化腳手架的流水線,將像 Qwen3-4B 這樣的小型 LLM 轉變為最先進的資料科學代理。

178

mmBERT:ModernBERT 走向多語言化

Hugging Face 推出 mmBERT,一個在 3 兆以上 token、涵蓋 1,800 多種語言的超大規模多語言編碼模型,於效能與推論速度上均優於 XLM-R。

179

EmbeddingGemma 300M 版本說明

Google 發布了 EmbeddingGemma,一款 308M 參數的多語言嵌入模型,在 500M 以下模型的 MTEB 基準測試中名列前茅,且針對裝置端使用進行了優化。

180

SandboxAQ SAIR 資料集發布

SandboxAQ 已發布 SAIR,這是目前最大規模的共摺疊 3D 蛋白質‑配體結構資料集,配有實驗測得的 IC50 標籤,提供超過 500 萬個 AI 生成的結構,以加速 AI 驅動的藥物發現。

181

Hugging Face ZeroGPU 前置編譯指南

Hugging Face 為 ZeroGPU Spaces 引入前置編譯(AoT),透過消除即時編譯開銷,使 Flux、Wan、LTX 等生成模型的速度提升 1.3 倍至 1.8 倍。

182

NVIDIA Nemotron 後訓練資料集 v2 與 Nemotron Nano 2 9B 發布

NVIDIA 發布了包含 600 萬樣本的多語言推理資料集以及 Nemotron Nano 2 9B 模型,該模型採用混合 Transformer-Mamba 架構,以優化推理成本與吞吐量。

183

使用 Claude 與 Hugging Face 產生圖像

Hugging Face 透過 Model Context Protocol (MCP) 伺服器,將 AI 連接至 Hugging Face Spaces,從而在 Claude 中啟用圖像生成。

184

Hugging Face 研究用 MCP:將 AI 連接至研究工具

Hugging Face 推出 Research Tracker MCP,使 AI 代理能透過模型上下文協定(Model Context Protocol)整合 arXiv、GitHub 與 Hugging Face,自動化研究發現。

185

TITLE: Hugging Face kernel-builder:建構與擴展生產級 CUDA 核心的指南

SUMMARY: Hugging Face 推出 kernel-builder 函式庫,以簡化透過 Hugging Face Hub 開發、多架構編譯與發佈生產級 CUDA 核心的流程。

186

Arm 與 ExecuTorch 0.7:將生成式 AI 擴展至數十億設備

Arm 與 ExecuTorch 0.7 beta 透過 KleidiAI 提供自動 AI 加速,利用 SDOT 指令將 Llama 3.2 等大型語言模型帶到數十億現有的 Arm 裝置上。

187

Arm Neural Super Sampling (NSS) 發布

Arm 已發布 Neural Super Sampling (NSS),這是一種 AI 驅動的升頻解決方案,旨在降低 GPU 工作負載並在行動裝置上實現高解析度渲染。

188

FilBench:評估大型語言模型在菲律賓語言的能力

Hugging Face 推出了 FilBench,一套全面的評估套件,旨在評估大型語言模型在塔加洛語、菲律賓語與宿務語的流暢度、語言能力與文化知識。

189

TextQuests:評估大型語言模型在文字冒險遊戲中的代理推理能力

Hugging Face 推出 TextQuests,一個使用 25 款經典 Infocom 互動小說遊戲的基準測試,用以評估大型語言模型代理的長上下文推理與探索能力。

190

Hugging Face AI Sheets 發布

Hugging Face 推出了 AI Sheets,一款開源的無程式碼工具,用於使用開放式 AI 模型構建、轉換與豐富資料集。

191

Accelerate ND-Parallel:高效多 GPU 訓練指南

Hugging Face 已將 ND-Parallelism 整合至 Accelerate 與 Axolotl,使用者得以結合資料、完全分片資料、張量與上下文平行化策略,優化大型模型的多 GPU 訓練。

192

NVIDIA AI-Q 藍圖:DeepResearch Bench 上排名第一的開源深度研究代理

NVIDIA 的 AI-Q 藍圖在 Hugging Face DeepResearch Bench 上的開源授權堆疊中取得第一名,結合了 Llama 3.3-70B Instruct 與 Llama-3.3-Nemotron-Super-49B-v1.5。

193

3LM:阿拉伯語大型語言模型在 STEM 與程式碼領域的基準測試

Hugging Face 與阿聯酋 TII 推出 3LM,這是首個全面的基準測試,旨在評估阿拉伯語大型語言模型在 STEM 科目與程式碼生成方面的表現。

194

使用 Gradio 在 Python 中實作 MCP 伺服器

Hugging Face 介紹了一種讓 Python 開發者快速使用 Gradio 建立 Model Context Protocol(MCP)伺服器的方法,使 LLM 能夠整合 Hugging Face Hub 上數千個 AI 模型與 Spaces。

195

Hugging Face Trackio 發布

Hugging Face 已發布 Trackio,一個免費、開源、輕量級的實驗追蹤庫,可作為 wandb 的即插即用替代方案,並原生整合 Hugging Face Spaces 與 Datasets。

196

Hugging Face CLI 更新:轉換至 hf 指令

Hugging Face 已將 huggingface-cli 改名為 hf,推出更符合人體工學的資源-動作指令結構,並新增 hf jobs 服務以在 HF 基礎設施上執行腳本。

197

Parquet 內容定義分塊以提升資料去重效率

Hugging Face 推出 Parquet 內容定義分塊(CDC),現已在 PyArrow 與 Pandas 中提供,使得在 Xet 儲存層上對 Parquet 檔案進行高效去重成為可能,顯著縮短上傳與下載時間。

198

使用 Diffusers 與 PEFT 的 Flux 快速 LoRA 推理

Hugging Face 推出針對 Flux.1-Dev 的最佳化配方,透過結合熱切換、torch.compile 與 FP8 量化,使 LoRA 推理速度提升最高可達 2.23 倍。

199

TimeScope:長影片大型多模態模型理解的新基準

Hugging Face 推出 TimeScope,一個開源基準,透過在長度從 1 分鐘到 8 小時的內容中插入影片針頭,評估視覺語言模型的時間理解能力。

200

NVIDIA NIM 與 Hugging Face 的整合

NVIDIA 已將 NVIDIA NIM 擴展至支援超過 100,000 個 Hugging Face 上的 LLM,提供單一 Docker 容器,自動化模型分析、後端選擇與效能最佳化,以快速部署。