✷ 封存 · 11 個實驗室 · 870 篇 dispatch
實驗室
不用每天手動刷十幾個官方部落格。OpenAI、Anthropic、DeepMind 等實驗室的一手發布,每篇都提煉出核心內容。
以機器學習提升客戶服務效能
Hugging Face 展示了如何使用微調的 DeBERTa-v3-base 模型以及 Transformers 與 Datasets 套件,自動過濾不滿的客戶回饋。
Hugging Face 教育倡議 2022 發佈
Hugging Face 在 2022 年 4 月宣布了一項多軌教育計畫,目標在 2023 年底前教導 500 萬人機器學習,並為學習者、教師以及大眾提供免費資源。
Hugging Face Hub 碳排放追蹤
Hugging Face 已推出工具,用於追蹤、報告與篩選基於 CO2 排放的機器學習模型,以提升 AI 的環境透明度。
Lewis Tunstall 访谈 – Hugging Face 机器学习专家
Hugging Face 宣布了一场关于机器学习工程师 Lewis Tunstall 的详细访谈,重点介绍了他在 Transformers 库的工作、新出版的《NLP with Transformers》一书,以及不断扩展的 Hugging Face 课程。
Habana Labs 與 Hugging Face 合作加速 Transformer 模型訓練
Habana Labs 與 Hugging Face 已將 Habana 的 SynapseAI 軟體套件與 Hugging Face Optimum 函式庫整合,以加速在 Habana Gaudi 處理器上進行 Transformer 模型訓練。
Hugging Face Transformers 設計哲學
Hugging Face 為 Transformers 函式庫採用了「單一模型檔案」政策,刻意拋棄 DRY(Don't Repeat Yourself)原則,以優先考慮可讀性、社群貢獻以及靜態機器學習模型的穩定性。
Decision Transformer 在 Hugging Face Transformers 中的整合
Hugging Face 已將 Decision Transformer(將強化學習視為條件序列建模問題的離線強化學習方法)整合至 transformers 程式庫與 Hugging Face Hub。
機器學習專家:訪談 Margaret Mitchell
Dr. Margaret Mitchell 討論了倫理 AI 的關鍵角色、用於提高透明度的 Model Cards 的開發,以及機器學習開發中多樣性與包容性的必要性。
Hugging Face AI Research Residency Program Announcement
Hugging Face 推出了為期 9 個月的 AI Research Residency Program,旨在幫助有志向的研究人員與 Hugging Face Science Team 合作,開發機器學習技術並發表開源研究成果。
使用自定義數據集微調 SegFormer 以進行語義分割
Hugging Face 提供了一份技術指南,介紹如何使用 Transformers 庫微調 SegFormer 模型,以進行自定義用例(如自動人行道導航)的像素級圖像分類。
使用 Hugging Face datasets 進行圖像搜尋
Hugging Face 展示了如何透過結合 `datasets` 函式庫、CLIP 嵌入與 FAISS 來構建一個圖像搜尋應用程式,以實現高效的相似度搜尋。
使用 Hugging Face Transformers 與 AWS Inferentia 加速 BERT 推論
Hugging Face 提供了一份指南,說明如何使用 AWS Inferentia 與 Neuron SDK 來加速 BERT 推論,並在 Amazon SageMaker 上實現 5-6ms 的延遲。
在 Hugging Face Transformers 中使用受限束搜索(Constrained Beam Search)引導文本生成
Hugging Face 將受限束搜索引入了 Transformers 函式庫,允許用戶在保持語言連貫性的同時,將特定的單詞或短語強制加入生成的文本中。
BERT 101:了解來自 Transformer 的雙向編碼器表示
BERT 是由 Google AI Language 開發的雙向 Transformer 模型,透過在大規模資料集上進行無監督預訓練,於 11 項以上常見 NLP 任務上達到最先進的表現。
使用 Hugging Face Transformers 微調 Vision Transformer (ViT) 以進行圖像分類
Hugging Face 提供了一份關於如何使用 `datasets` 和 `transformers` 庫微調 Vision Transformer (ViT) 模型以進行圖像分類的指南,並透過 `beans` 數據集演示了整個過程。
使用 Python 開始進行情緒分析
Hugging Face 提供了一份關於如何使用 Python 實作情緒分析的全面指南,利用了來自 Hugging Face Hub 的預訓練模型、用於微調的 Trainer API 以及無程式碼的 AutoNLP 工具。
大型檔案的自動語音辨識(ASR)— 使用 Transformers 中的 Wav2Vec2
Hugging Face 實作了一種利用 Wav2Vec2 的 Connectionist Temporal Classification(CTC)架構的步幅技術,從而在任意長度的音訊檔案以及即時推論情境下實現高品質的自動語音辨識(ASR)。
Hugging Face Hub Search API 更新
Hugging Face 為 `huggingface_hub` 函式庫引入了新的程式化搜尋功能,包括 `ModelSearchArguments` 和 `ModelFilter`,以簡化使用者在不離開 IDE 的情況下尋找模型和資料集的流程。
Stable-Baselines3 與 Hugging Face Hub 的整合
Hugging Face 已整合 Stable-Baselines3,讓使用者可以直接從 Hugging Face Hub 託管、分享與載入 PyTorch Deep Reinforcement Learning 模型。
Hugging Face Infinity CPU 效能案例研究
Hugging Face Infinity 在 Intel Ice Lake Xeon CPU 上實現了高達 800% 的吞吐量提升與毫秒級延遲,與 vanilla Transformers 相比,讓在 CPU 基礎設施上進行具成本效益的即時 Transformer 部署成為可能。
在 Hugging Face Transformers 中使用 n-grams 增強 Wav2Vec2
Hugging Face 已將 pyctcdecode 函式庫整合至 Transformers 函式庫中,使 Wav2Vec2 模型能夠透過 n-gram 語言模型進行增強,從而顯著減少拼字錯誤和字錯率 (WER)。
在 Amazon SageMaker 上使用 Hugging Face Transformers 部署 GPT-J 6B
Hugging Face 提供了一種在 Amazon SageMaker 上部署 EleutherAI 的 GPT-J 6B 模型的方法,透過使用 torch.save 將模型載入時間從超過三分鐘減少到不到八秒。
使用 AutoNLP 與 Prodigy 進行主動學習
Hugging Face 展示了如何透過結合 AutoNLP 自動化訓練框架與 Prodigy 標註工具,來建立一個用於命名實體識別 (NER) 的主動學習流水線。
Hugging Face 收購 Gradio
Hugging Face 已收購 Gradio,旨在將易於建立的機器學習演示和 GUI 整合進其生態系統,擴展機器學習對非技術用戶的可及性。
Perceiver IO: 一種適用於任何模態的可擴展、全注意力模型
Perceiver IO 是一種基於 Transformer 的架構,透過使用潛在空間將計算量與輸入大小解耦,使其能夠處理文本、圖像、音訊、影片和點雲,而不會產生二次方擴展問題。
從零開始訓練 CodeParrot
Hugging Face 推出了 CodeParrot,這是一個基於 GPT-2 的模型,在清洗後的 2000 萬個 Python 檔案數據集上從零開始訓練,旨在實現 Python 程式碼自動補全功能。
Hugging Face Snowball Fight ML-Agents 環境
Hugging Face 已發布 Snowball Fight 1vs1,這是其首個使用 Unity ML-Agents 建構並託管於 Hugging Face Spaces 的自訂深度強化學習環境。
Hugging Face Optimum for Graphcore IPU Integration
Hugging Face 已將 Optimum 函式庫與 Graphcore Intelligence Processing Units (IPUs) 整合,以加速 Transformer 模型,並從優化的 BERT 實作開始。
Hugging Face Data Measurements Tool
Hugging Face 發佈了 Data Measurements Tool,這是一個開源的 Python 函式庫與無程式碼介面,旨在幫助開發者分析、策劃與比較 ML 資料集,以實現更負責任的 AI 開發。
使用 Intel 技術加速 PyTorch 分散式微調
Hugging Face 展示了如何透過使用 Intel extension for PyTorch 與 oneCCL,將微調工作分配到 Intel Xeon Scalable CPU 伺服器叢集,從而加速 PyTorch 訓練。
為低資源自動語音辨識進行 XLS-R 微調
Hugging Face 提供了一份關於如何使用 Transformers 函式庫微調 XLS-R(一種跨語言語音表示模型)以進行低資源自動語音辨識 (ASR) 的技術指南。
在現代 CPU 上擴展類 BERT 模型推理 - 第二部分
Hugging Face 探索了在 Intel Ice Lake Xeon CPU 上類 BERT 模型的軟體層級優化,展示了記憶體配置器、並行化函式庫以及貝氏優化如何能顯著降低推理延遲。
Hugging Face 課程第二部分與社群活動發佈
Hugging Face 於 2021 年 11 月 15 日宣布發佈 Hugging Face 課程的第二部分,並隨之舉辦了一場包含技術演講與實作專案的社群活動。
大語言模型:新的摩爾定律?
Hugging Face 批評了模型規模呈指數級增長的趨勢(例如具有 530B 參數的 Megatron-Turing NLG),並主張採用如蒸餾 (distillation) 和微調 (fine-tuning) 等務實且高效的替代方案。
Hugging Face 使用 10 億對訓練數據開發的句子嵌入模型
Hugging Face 透過使用 JAX/Flax 和 TPU 基礎設施,在多達 10 億對句子上進行訓練,開發出最先進的通用型句子嵌入模型。
Hugging Face: 機器學習即程式碼的時代
Hugging Face 主張透過採用 MLOps、利用通用型 Transformer 架構,並優先考慮生產部署而非沙盒實驗,將機器學習視為一門軟體工程學科。
為遙感與衛星影像微調 CLIP
研究團隊利用 RSICD 數據集和其他衛星影像對 OpenAI 的 CLIP 模型進行了微調,以顯著提高遙感應用中的文本轉圖像檢索能力。
Hugging Face Spaces 和 Gradio 整合
Hugging Face 已將 Gradio 整合到 Spaces 中,讓使用者能夠透過 Inference API 或自訂模型檢查點,輕鬆託管和展示機器學習模型示範。
使用 Streamlit 在 Hugging Face Spaces 上託管模型與數據集
Hugging Face Spaces 與 Streamlit 整合,讓使用者能快速建立並託管機器學習模型與數據可視化的互動式演示。
Hugging Face Summer 2021 更新
Hugging Face 公佈了一系列 Hub 增強功能,包括用於 ML 示範託管的 Spaces Beta、TensorBoard 整合,以及推出 Optimum 函式庫以進行硬體加速。
Hugging Face Optimum 發佈
Hugging Face 推出了 Optimum,這是一個開源工具包,旨在針對各種硬體平台優化 Transformer 模型,以提升生產效能。
Hugging Face 與 Graphcore 合作開發 IPU 優化的 Transformers
Hugging Face 與 Graphcore 已達成合作,透過 Hardware Partner Program 與 Optimum 函式庫將 Intelligence Processing Units (IPUs) 整合至 Hugging Face 生態系統中,以加速 Transformer 模型的部署。
Hugging Face DeDLOC: 透過網路進行語言模型的協作訓練
Hugging Face 推出了 DeDLOC,這是一種分散式訓練方法,透過適應不同的網路與硬體限制,讓志願者能夠透過網路協作預訓練大型語言模型。
spaCy 與 Hugging Face Hub 的整合
Hugging Face 已將 spaCy 整合到 Hugging Face Hub,讓使用者能透過統一平台共享、探索與部署 spaCy 管線。
輕鬆在 Amazon SageMaker 上部署 Hugging Face 模型
Hugging Face 與 Amazon SageMaker 推出了全新的推論深度學習容器(DLC)與推論工具套件,以簡化 Transformer 模型部署至可投入生產的端點。
Sentence Transformers 集成於 Hugging Face Hub
Hugging Face 已將 Sentence Transformers 集成到 Hub 中,為 100 多種語言提供超過 90 個預訓練模型,並提供了用於特徵提取和句子相似度的新交互式小部件。
使用 GPT-Neo 與 Hugging Face Accelerated Inference API 進行少樣本學習 (Few-Shot Learning)
Hugging Face 探討了使用開源 GPT-Neo 模型與 Accelerated Inference API 進行少樣本學習的應用,以實現無需大量標記數據的任務泛化能力。
使用與混合 Hugging Face 模型搭配 Gradio 2.0
Gradio 2.0 讓機器學習開發者能以單行程式碼將 Hugging Face 模型載入並部署為 GUI,並支援平行與串行模型組合。
Scaling-up BERT Inference on CPU (Part 1)
Hugging Face 探討了現代 CPU 上 BERT 推理的硬體層級優化,證明了透過 NUMA 感知親和性將多個獨立模型實例綁定到特定實體核心,可以實現吞吐量的線性擴展。
Hugging Face Accelerate Library Release
Hugging Face 發布了 Accelerate,這是一個 PyTorch 函式庫,允許使用者在任何設備配置上執行原始訓練腳本,包括多 GPU 和 TPU,而無需重寫樣板代碼。