Hugging Face Judge Arena: LLMsを評価者としてベンチマーク
Hugging Faceは、人間の投票を使って他のAI生成レスポンスの採点において最も効果的な評価者として機能するLLMを決定するクラウドソーシングプラットフォームであるJudge Arenaをリリースしました。
研究者向け Hugging Face Hub データセット共有
Hugging Face Hub は、統合された探索、セキュリティ、コミュニティエンゲージメントツールを備えた、大規模な ML データセットのホスティングと共有のための包括的なプラットフォームを提供します。
Hugging Face PyCharm 統合
Hugging Face は、その Hub を PyCharm Professional に直接統合し、開発者が IDE を離れることなく機械学習モデルを検出、挿入、管理できるようにしました。
Argilla 2.4 リリースノート / 新機能
Argilla 2.4 は、Hugging Face Hub のデータセットをインポートし、人間のフィードバックを通じてファインチューニングおよび評価用データセットを構築するためのノーコード UI を導入しました。
ユニバーサル・アシスト生成: 任意のアシスタントモデルで高速デコード
Hugging Face と Intel Labs は、トークナイザーに関係なく任意の小型モデルをアシスタントとして利用できることで、LLM 推論を 1.5 倍〜2.0 倍高速化する手法、Universal Assisted Generation(UAG)を発表しました。
Digital Green Farmer.chat: LLM-as-a-Judge で RAG を強化
Digital Green は、RAG ベースの農業チャットボットである Farmer.chat に対して、LLM-as-a-judge 評価フレームワークを導入し、RAG の正確性を客観的に測定し、34 万件のクエリにわたるモデル選択を最適化しました。
Aya Expanse リリース:多言語 LLM パフォーマンスの向上
Hugging Face と Cohere For AI は、8B と 32B のオープンウェイトモデルファミリーである Aya Expanse をリリースしました。このモデルは多言語パフォーマンスにおいて新たな最先端ベンチマークを設定しています。
HUGS のローンチ:ゼロ構成、ハードウェア最適化された推論(インフェレンス)をオープンLLM向けに
Hugging Face は、NVIDIA、AMD、そして近日中に AWS Inferentia と Google TPU でも動作する、オープンソース LLM 向けのゼロ構成・ハードウェア最適化された推論サービス HUGS を発表しました。これにより、企業は OpenAI 互換 API を使用してモデルを社内でホストできるようになります。
CinePile 2.0 リリース:対抗的リファインメントでビデオ QA データセットの品質向上
CinePile 2.0 は、弱い QA ペアを視覚依存の質問に昇格させる対抗的リファインメントパイプラインを導入し、改善されたデータセットと完全なコードの両方を公開するとともに、商用およびオープンソースのビデオ‑LLM に対して大幅な性能向上を示します。
Transformers v4.46.0 における SynthID Text の統合
Google DeepMind と Hugging Face は SynthID Text を Transformers v4.46.0 に統合し、AI 生成テキストに目に見えない透かしを付与し、訓練済み分類器で検出できる手法を提供しました。
Hugging Face Inference Endpoints での Speech-to-Speech のデプロイ
Hugging Face は、計算負荷の高い Speech-to-Speech (S2S) パイプラインをカスタム Docker イメージで Inference Endpoints にデプロイし、レイテンシを低減するためのガイドを提供しています。
Outlines-core 0.1.0 リリースノート / 新機能
Hugging Face と dottxt は、インデックスコンパイル速度とポータビリティを向上させた、構造化生成用の Outlines コアアルゴリズムを Rust に移植した outlines-core 0.1.0 をリリースしました。
Diffusers との Stable Diffusion 3.5 Large 統合
Hugging Face は、標準版とタイムステップ蒸留版の 8B パラメータモデルである Stable Diffusion 3.5 Large を Diffusers ライブラリに統合しました。
Hugging Face、Protect AIと提携しモデルセキュリティ向上のためGuardianスキャナーを追加
Hugging FaceはProtect AIと提携し、HubにGuardianスキャナーを組み込み、危険なモデルシリアライズの脆弱性を自動検出して、MLコミュニティ全体のセキュリティを向上させました。
Transformers.js v3 リリースで WebGPU 加速、モデルサポートの拡充、サーバーサイド JavaScript 互換性を追加
Transformers.js v3 は WebGPU 加速、新しい量子化フォーマット、120 のモデルアーキテクチャのサポート、そして Node.js/Deno/Bun 互換性を追加し、ブラウザや JavaScript ランタイムで高速なオンデバイス推論を可能にします。
KerasでのLlama 3.2
Llama 3.2 は keras-hub を通じて Keras で完全にサポートされており、ユーザーは Hugging Face のチェックポイントをロードし、JAX、PyTorch、または TensorFlow バックエンドでモデルを実行できます。
Hugging Face Transformers 勾配蓄積修正
Hugging Face は Transformers Trainer を更新し、損失のバッチ間平均方法を修正することで、勾配蓄積がフルバッチ学習と数式上で同等になるようにしました。
Gradio 5 セキュリティレビュー
Hugging Face は Trail of Bits と共に Gradio 5 の包括的なセキュリティ監査を実施し、特定されたすべての脆弱性を修正して、機械学習アプリケーションがデフォルトで安全になるようにしました。
AMD EPYC Turin CPUはGenoaに対してLLM推論スループットを2倍提供
AMDの第5世代EPYC Turin CPUは、Genoaに比べてLLM推論スループットを約2倍にし、Hugging Faceのワークロードで低レイテンシと高スループットを実現します。
Hugging Face と Dask による AI データ処理のスケーリング
Hugging Face と Dask は、分散コンピューティングとマルチ GPU 並列推論を活用して、ローカルの小規模サンプルから数億行規模のデータまで AI ベースのデータ処理をスケールさせることを可能にします。
Gradio 5 リリースノート
Hugging Face は、Python を使用して高性能・スケーラブル・安全な機械学習ウェブアプリケーションを構築するための本番環境対応フレームワーク、Gradio 5 をリリースしました。
Hugging Face Transformers 4.45.0 動的投機的デコード
Hugging Face と Intel Labs は Transformers 4.45.0 で動的投機的デコードを導入し、モデルの信頼度に基づいてドラフトトークン数を動的に調整することで、テキスト生成を最大 2.7 倍高速化しました。
Hugging Face Hub における Parquet 重複排除の改善
Hugging Face はストレージアーキテクチャを最適化し、Parquet ファイルの重複排除を改善するために、データセット更新時のストレージオーバーヘッドを削減するコンテンツ定義行グループを提案しています。
Open FinLLM Leaderboard の開始 – 金融言語モデル向け包括的なゼロショットベンチマーク
Hugging Face は Open FinLLM Leaderboard を開始しました。このゼロショットベンチマークは、7 つのカテゴリにわたる 40 の金融特化タスクをカバーし、実際の金融アプリケーションに対する LLM の準備状況を評価します。
中国AIのグローバル展開分析
中国のAI企業は、国内市場の飽和、激しい価格競争、規制圧力により国際展開を加速しており、東南アジア、中東、そして西側の消費者市場をターゲットにしています。
BenCzechMark: チェコ語 LLM 用の包括的評価スイート
Hugging Face と学術パートナーは、チェコ語モデル向けの初の包括的評価スイートである BenCzechMark をリリースしました。9 つのカテゴリにまたがる 50 のタスクと、新しいデュエル方式のスコアリングメカニズムを備えています。
頂点カラー メッシュをテクスチャメッシュに変換する
Hugging Face は、頂点カラーの 3D メッシュを UV マッピングされたテクスチャメッシュに変換し、アプリケーションとの互換性を向上させる方法と InstantTexture ライブラリを紹介します。
Llama 3.2 リリースノート: マルチモーダルビジョンとオンデバイス小型言語モデル
Meta は Llama 3.2 をリリースし、11B と 90B のサイズでマルチモーダルビジョン機能を、オンデバイス展開に最適化された軽量な 1B と 3B のテキスト専用モデルを導入しました。
Hugging Face Daily Papers 機能ガイド
Hugging FaceのDaily Papersページは、AI研究のコミュニティキュレーションハブを提供し、著者の主張、論文提出、研究者と開発者間の直接的なやり取りを可能にするツールを備えています。
FineVideo データセットリリース
Hugging Face は、43,000 本(3,400 時間)の高品質なオープンビデオデータセットである FineVideo をリリースしました。このデータセットは、ビデオ理解と生成 AI のトレーニング向けに、豊富で構造化されたアノテーションが付与されています。
Optimum-Intel と OpenVINO GenAI を使用した Hugging Face モデルの最適化とデプロイ
Hugging Face と Intel は、Optimum-Intel と OpenVINO GenAI を活用したシンプルなワークフローを提供し、Intel ハードウェア上で Transformers モデルを最適化およびデプロイします。特にエッジやクライアント側の C++ および Python 環境を対象としています。
LLM を 1.58 ビットにファインチューニング:BitNet による極端な量子化
Hugging Face は、Llama 3 8B などの既存 LLM を動的ウォームアップ量子化戦略を用いて 1.58 ビットの三値精度にファインチューニングできることを示しました。これにより、メモリとエネルギーの要件を大幅に削減しながら、優れた性能を維持できます。
Hugging Face データセット用 SQL コンソール
Hugging Face は、DuckDB WASM によって駆動されるブラウザベースの SQL コンソールを導入しました。これにより、バックエンドの依存なしで Hub 上のデータセットを直接クエリ、フィルタ、変換できます。
HuggingChat コミュニティツールリリース
Hugging Face は HuggingChat にコミュニティツールを導入し、ユーザーが任意のパブリック Hugging Face Space をツールとして統合し、LLM がチャットインターフェース内で直接利用できるようにしました。
Accelerate 1.0.0 リリース候補のお知らせ
Accelerate 1.0.0 のリリース候補は、FP8、DeepSpeed マルチモデル、torch.compile、そして新しいデータローダー/パイプライン機能を追加し、大規模トレーニングと推論のための API を安定化させました。
シークレットスキャンにおける Hugging Face と TruffleHog のパートナーシップ
Hugging Face は Truffle Security と提携し、TruffleHog のシークレットスキャン機能を自動パイプラインに統合するとともに、ユーザーが自分のアカウントデータを積極的にスキャンできるネイティブスキャナーを提供しています。
LeRobotDataset ビデオエンコーディング形式はロボティクスデータセットのサイズを削減し、トレーニングを高速化する
Hugging Face は LeRobotDataset ビデオエンコーディング形式をリリースし、ロボティクスの視覚データを元の約 14 % に縮小しながら、ロード速度とトレーニング性能を維持しています。
Hugging Face のブログ記事が、評価が低く見過ごされがちな Hub ツール 5 つと、無料のセマンティック検索ユースケースをハイライト
Hugging Face は、評価が低く見過ごされがちな Hub ツール(ZeroGPU、マルチプロセス Docker、Gradio API、Webhooks、Nomic Atlas)を 5 つ発表し、これらを組み合わせて Reddit データ向けの無料・自動更新型セマンティック検索アプリを構築する方法を示しました。
Hugging Face トレーニング効率: Flash Attention 2 を用いたパッキング
Hugging Face は指示チューニング用サンプルの境界認識パッキングを導入し、Flash Attention 2 と併用することでトレーニングスループットが最大 2 倍に、ピークメモリが 20% 削減されます。
Google Cloud Vertex AI で Meta Llama 3.1 405B をデプロイする
Hugging Face は、Text Generation Inference(TGI)と A3 マシンシリーズを使用して、Google Cloud Vertex AI 上で Meta Llama 3.1 405B の FP8 量子化バージョンをプログラム的にデプロイするためのガイドを提供しています。
Hugging Face Infini-Attention 再現分析
Hugging Face が Infini-Attention の再現を試みた結果、ゲーティングの収束は改善できるものの、メモリ圧縮が増えると手法の性能が低下し、Ring Attention、YaRN、RoPE スケーリングよりも信頼性が低いことが判明しました。
ggml の紹介
ggml は Transformer 推論とデバイス上 LLM 実行に最適化された、軽量な C/C++ 機械学習ライブラリで、さまざまなハードウェアバックエンドをサポートします。
Hugging Face 統合ツール使用 API
Hugging Face は、Mistral、Cohere、NousResearch、Llama の各モデルでツール呼び出しを実装する際に同じコードを使用できる統合ツール使用 API を導入しました。
Falcon Mamba 7B リリースノート
Technology Innovation Institute (TII) は、最先端のトランスフォーマーモデルと同等の性能を持ち、アテンションベースのメモリスケーリング問題を排除した、初の大規模純粋 State Space Language Model (SSLM) である Falcon Mamba 7B をリリースしました。
Hugging FaceがXetHubを取得し、Hubのストレージとコラボレーションを強化
Hugging FaceはGit LFSをより効率的なストレージバックエンドに置き換えるためにXetHubを買収し、インクリメンタル更新、兆パラメータモデルのサポート、そして大規模AIデータセットでのコラボレーションを向上させました。
Hugging Face TextImage Augmentation パイプラインリリース
Hugging Face と Albumentations AI は、文書画像とテキストを同時に変更する TextImage Augmentation パイプラインをリリースしました。これにより、現実的な合成データ生成と、限られた文書データセット上でのビジョン‑言語モデルの堅牢なファインチューニングが可能になります。
Hugging Face 2024 セキュリティ機能ハイライト
Hugging Face は 2024 年のセキュリティ状況を詳述し、すべてのユーザー向けのデフォルト保護スイートと Enterprise Hub ユーザー向けの高度なガバナンス制御を導入しました。
GoogleがGemma 2 2B、ShieldGemma、Gemma Scopeをリリース
GoogleはGemma 2 2B、ShieldGemma安全分類器、そしてGemma Scopeスパースオートエンコーダーをリリースし、オープンソースLLMの機能、モデレーションツール、解釈可能性リソースを拡充しました。
Quanto 量子化で Transformer ディフュージョンパイプラインのメモリ削減
Hugging Face の量子化(Quanto)は、Transformer ディフュージョンモデルの GPU メモリを約 12 GB から約 5 GB に削減し、レイテンシと品質への影響を最小限に抑えます。
Hugging Face NVIDIA NIM API (serverless) の開始と廃止
Hugging Face は Enterprise Hub ユーザー向けに NVIDIA NIM API(サーバーレス)を開始し、OpenAI 互換 API を通じて NVIDIA DGX Cloud H100 GPU 上でオープンソース LLM の従量課金サーバーレス推論を可能にしました。