TimeScope: 長動画大規模マルチモーダルモデル理解のための新しいベンチマーク
Hugging Face は、1 分から 8 時間までのコンテンツに動画の針を挿入して、ビジョン・ランゲージモデルの時間的理解度を評価するオープンソースベンチマーク「TimeScope」を導入しました。
NVIDIA NIM と Hugging Face の統合
NVIDIA は NVIDIA NIM を拡張し、Hugging Face 上で 100,000 以上の LLM をサポートできるようにしました。単一の Docker コンテナがモデル分析、バックエンド選択、パフォーマンス最適化を自動化し、迅速なデプロイを実現します。
Arc バーチャルセルチャレンジ プライマー
Arc Virtual Cell Challenge は、参加者に 300k 件のシングルセル RNA シーケンシングプロファイルからなるデータセットを用いて、CRISPR による遺伝子サイレンシングが細胞トランスクリプトームに与える影響を予測するモデルの学習を課す課題です。
Gradio 5.38.0 MCP サーバーの改善点
Gradio バージョン 5.38.0 は、Model Context Protocol(MCP)サーバー機能に 5 つの主要な更新を導入しました。シームレスなローカルファイルサポート、リアルタイム進捗通知、OpenAPI 仕様の自動変換が含まれます。
Hugging Face FutureBench: 将来のイベント予測におけるAIエージェントの評価
Hugging FaceはFutureBenchを導入しました。このベンチマークは、AIエージェントに将来の実世界の出来事を予測させることで、推論と統合能力を評価し、データ汚染を実質的に排除します。
Ettin Suite: SoTA ペアエンコーダーとデコーダー
Hugging Faceは、同一のデータとレシピでトレーニングされたペアのエンコーダーのみモデルとデコーダーのみモデル(17M〜1Bパラメータ)を提供するEttinスイートを導入し、アーキテクチャ性能の制御された比較を可能にします。
Hugging Face Hub の Git LFS から Xet への移行
Hugging Face は、AI ワークロードに合わせてスケールするよう設計されたコンテンツアドレッシングストレージシステムである Xet に、Git LFS から 500,000 のリポジトリと 20 PB のデータを移行しました。
Kimina-Prover: 大規模形式推論モデルにおけるテスト時RL検索の適用
Hugging Face は Lean 4 用の最先端定理証明モデル Kimina-Prover-72B を発表しました。新しいテスト時強化学習 (TTRL) 検索フレームワークを用いて、miniF2F ベンチマークで 92.2% の合格率を達成しています。
Hugging Face MCPサーバーの構築
Hugging Faceは公式のModel Context Protocol(MCP)サーバーをリリースし、AIアシスタントが単一のURLでHugging Face Hubと数千のGradioベースのAIアプリケーションに動的にアクセスできるようにしました。
ScreenEnv リリース:フルスタック デスクトップエージェントのデプロイ
Hugging Face は、Docker コンテナ内に分離された Ubuntu デスクトップ環境を作成し、GUI エージェントのテストとデプロイを可能にする Python ライブラリ ScreenEnv をリリースしました。
Hugging Face 非同期ロボット推論
Hugging Face はアクション予測と実行を分離する非同期ロボット推論を導入し、ロボットのアイドル時間を削減し、タスク完了時間を最大で2倍に高速化します。
Hugging Face Gradio MCP サーバー統合
Hugging Face は Model Context Protocol(MCP)を Gradio(v5.28.0)に統合し、Hugging Face Spaces を MCP サーバーの大規模ライブラリとして機能させ、画像編集や文字起こしなどの新しい LLM 機能を提供できるようにしました。
AMD MI300 用のカスタムカーネルの作成
Hugging Face は AMD と協力して MI300X 用のオープンソース最適化カーネルを開発し、VLLM における Llama 3.1 405B の FP8 推論性能を大幅に向上させました。
Reachy Mini: AI開発向けオープンソースデスクトップロボット
Hugging Face と Pollen Robotics は、$399 から始まるオープンソースでプログラム可能なデスクトップロボット、Reachy Mini を発表しました。このロボットはヒューマンロボットインタラクションと AI 実験向けに設計されています。
Hugging Face の効率的なマルチモーダルデータパイプライン
Hugging Face は、マルチモーダルデータパイプライン向けに5段階の最適化プロセスを導入し、バランスの取れたナップサックパッキング戦略を活用して GPU のアイドル時間とパディングの無駄を最小化します。
SmolLM3 リリース: 多言語対応、長コンテキスト 3B 推論モデル
Hugging Face は、Llama-3.2-3B と Qwen2.5-3B を上回る 3B パラメータモデル SmolLM3 をリリースしました。デュアルモード推論と 128k コンテキストウィンドウを備えています。
Hugging Face 本番インフラストラクチャ アラート戦略
Hugging Face は、NAT ゲートウェイのスループット、ログアーカイブの成功率、Kubernetes API のヘルスに特化したアラートを活用し、本番環境の安定性とコスト効率を維持しています。
NeurIPS 2025 E2LM コンペティション:言語モデルの早期トレーニング評価
Hugging Face とパートナーは、LLM のトレーニング初期段階で推論や科学的知識のシグナルを検出できるベンチマークを開発するための E2LM コンペティションを発表しました。
Sentence Transformers を用いたスパース埋め込みモデルのトレーニングとファインチューニング
Hugging Face は、Sentence Transformers ライブラリを使用してスパース埋め込みモデルのトレーニングとファインチューニングを行う包括的なガイドを紹介し、ハイブリッド検索と検索パフォーマンスの向上を図ります。
NVIDIA Llama Nemotron Nano VL リリース
NVIDIA は、インテリジェント文書処理と OCR タスクにおいて高精度を実現するよう最適化された 8B ビジョン言語モデル(VLM)である Llama Nemotron Nano VL をリリースしました。
Gemma 3n リリースノート:マルチモーダルオンデバイスAI
Google の Gemma 3n がオープンソースエコシステムで利用可能になり、ネイティブなマルチモーダリティ(テキスト、画像、音声、動画)と、ローカルハードウェアでの実行を想定したメモリ効率の高いアーキテクチャを備えています。
SGLang Transformers バックエンド統合
SGLang は Hugging Face の transformers をバックエンドとしてサポートし、ネイティブな SGLang 実装がなくても任意の transformers 互換モデルで高性能推論を実現できるようになりました。
コンシューマーハードウェアでの QLoRA を用いた FLUX.1-dev のファインチューニング
Hugging Face は、QLoRA と diffusers ライブラリを使用して FLUX.1-dev モデルをファインチューニングし、単一のコンシューマー GPU でピーク VRAM 使用量を 10 GB 未満に抑える方法を示しています。
Groq と Hugging Face 推論プロバイダーの統合
Hugging Face は Groq をサポート対象の Inference Provider として追加し、ユーザーは Hub を通じて Llama 4 や QWQ-32B などのモデルに対し、高速 LPU 搭載推論を直接利用できるようになりました。
LLM パフォーマンスの最適化:長いプロンプトのブロッキングとデコード遅延の解決
Hugging Face は、長いプロンプトがリクエストキューをブロックしトークン生成を遅くする仕組みを調査し、レイテンシ削減のための解決策としてリクエスト並列プレフィルと分散プレフィルを提案しています。
Featherless AI と Hugging Face 推論プロバイダーの統合
Hugging Face は Featherless AI をサポートされる推論プロバイダーとして追加し、オープンソースのテキストおよび対話モデルの膨大なカタログへのサーバーレスアクセスを可能にしました。
Hugging Face Kernel Hub リリース
Hugging Face は Kernel Hub を導入しました。これは、事前にコンパイルされた最適化計算カーネルを Python アプリケーションに直接ロードし、ローカルでのコンパイルなしに GPU 操作を高速化するための集中リポジトリです。
NVIDIA Isaac GR00T N1.5:LeRobot SO-101 アーム向けポストトレーニング
NVIDIAはIsaac GR00T N1.5をリリースしました。これはヒューマノイドロボットの推論とスキルのためのオープン基礎モデルで、LeRobot SO-101 アームのような特定のロボットエンボディメント向けにポストトレーニングが可能です。
Hugging Face と NVIDIA が Training Cluster as a Service を開始
Hugging Face と NVIDIA は Training Cluster as a Service を導入しました。この協業は、研究機関が基礎モデルのトレーニングのために、大規模な NVIDIA GPU クラスタへの柔軟でオンデマンドなアクセスを提供することを目的としています。
Hugging Face ScreenSuite リリース
Hugging Face は GUI エージェント向けの包括的な評価スイートである ScreenSuite をリリースしました。13 のベンチマークを統合し、Vision Language Models(VLM)の認識、グラウンディング、アクション能力を評価します。
nanoVLM における KV キャッシュ実装
Hugging Face は nanoVLM リポジトリで KV キャッシングをゼロから実装し、Vision Language Model の生成速度を 38% 向上させました。
Arm CPU上でのリアルタイムAIサウンド生成
Arm と Hugging Face は、Stable Audio Open を使用したパーソナルサウンド生成ツールを実演し、音楽制作ワークフロー向けにリアルタイムでデバイス上で音声を作成できることを示しました。
Holo1 と Surfer-H: GUI 自動化のためのオープンソース Action VLM
H社は、正確なGUIローカリゼーションを実現するAction Vision Language ModelのファミリーであるHolo1と、実世界タスクで92.2%の精度を、タスクあたり$0.13のコストで達成するモジュラーWebエージェントSurfer-Hをリリースしました。
Hugging Face TRL: 効率的な GRPO トレーニングのための同居 vLLM
Hugging Face は TRL に同居 vLLM を導入し、トレーニングと推論が同じ GPU を共有できるようにしました。これにより、アイドル時間がなくなり、GRPO トレーニング中のスループットが向上します。
SmolVLA: Lerobotコミュニティデータで訓練された効率的なVision-Language-Actionモデル
Hugging Faceは、コンパクトな450MパラメータのオープンソースVision-Language-ActionモデルであるSmolVLAを紹介します。このモデルは、コミュニティ共有データを活用して、シミュレーションおよび実世界のロボティクス課題において、より大きなモデルを上回る性能を発揮します。
Hugging Face CodeAgents + Structure: 構造化生成によるエージェント信頼性の向上
Hugging Face の研究は、CodeAgents に thoughts と code を構造化された JSON 形式で生成させることで、パースエラーを排除し明示的な推論を強制することにより、能力の高いモデルのパフォーマンスが平均で 2〜7 ポイント向上することを示しています。
Liger GRPO と TRL の統合
ユーザー報告では、DeepSpeed ZeRO-3 と bf16 で Qwen2.5-0.5B-Instruct モデルを使用した際に、Liger GRPO ロスで形状不一致エラーが発生することが指摘されています。
Python における Hugging Face Tiny Agents
Hugging Face は Python 向けに Tiny Agents を導入しました。これは Model Context Protocol(MCP)で駆動される軽量エージェントフレームワークで、最小限のコードで LLM が外部ツールとやり取りできるようにします。
Dell Enterprise Hub アップデート:オンプレミス AI モデルとアプリケーション
Dell と Hugging Face は Dell Enterprise Hub を更新し、Dell AI サーバーと AI PC 向けに最適化されたモデルとすぐに展開できる AI アプリケーションの完全なスイートを提供しました。
Falcon-H1: 効率と性能のためのハイブリッドヘッド言語モデル
Hugging Face と TII UAE は、Transformer のアテンションと Mamba-2 状態空間モデルを組み合わせ、メモリ使用量を抑えつつ高速推論で高性能を実現する、0.5B から 34B の 6 つのオープンソースハイブリッドヘッドモデルファミリー「Falcon-H1」を発表しました。
Falcon-Arabic: アラビア語言語モデルの画期的進歩
Technology Innovation Institute(TII)は、7BパラメータのモデルであるFalcon-Arabicをリリースしました。このモデルは、現代標準アラビア語および地域方言にわたる一般知識、文法、推論において、より大規模なアラビア語LLMを上回ります。
nanoVLM: ビジョン言語モデルのトレーニングのためのミニマリスト PyTorch ツールキット
Hugging Face は、初心者や研究者向けに Vision Language Model(VLM)のトレーニングと理解を簡素化することを目的とした、軽量で純粋な PyTorch ツールキットである nanoVLM をリリースしました。
Hugging Face Diffusers 量子化バックエンド
Hugging Face Diffusers は、bitsandbytes、torchao、Quanto、GGUF、FP8 レイヤー単位キャスティングといった複数の量子化バックエンドを統合し、FLUX.1-dev のような大規模拡散モデルのメモリフットプリントを削減します。
Microsoft と Hugging Face が Azure AI Foundry での協力を拡大
Microsoft と Hugging Face は、10,000 以上のオープンソースモデルを Azure AI Foundry に統合するためにパートナーシップを拡大し、多様な AI モダリティの安全でエンタープライズ向けデプロイを可能にしました。
Falcon-Edge: 強力で汎用的、かつ微調整可能な1.58ビット LLM
Hugging Face と Falcon-LLM チームは、1.58 ビット(三値)言語モデルのシリーズである Falcon-Edge をリリースしました。1B と 3B のパラメータサイズで提供され、新しい事前学習パラダイムを通じて推論と微調整の両方をサポートします。
Hugging Face Transformers: エコシステム相互運用性のためのモデル定義の標準化
Hugging Face は、Transformers ライブラリをモデル定義の中心的なピボットとして位置付け、Transformers がサポートするあらゆるアーキテクチャが推論エンジンやトレーニングフレームワークを含む広範な ML エコシステムと自動的に互換性を持つようにしています。
Hugging Face と Kaggle のモデルアクセス統合
Hugging Face と Kaggle は、Kaggle ノートブックおよびモデルページ内で Hugging Face モデルの見つけやすさと使いやすさを向上させる統合をリリースしました。
Hugging Face 推論エンドポイント: 高速 Whisper 転写
Hugging Face は、Inference Endpoints 上で新しい OpenAI Whisper のデプロイオプションを導入し、精度を犠牲にすることなく転写速度を最大 8 倍向上させました。
Hugging Face ビジョン言語モデル 2025 アップデート
Hugging Face は、2024〜2025 年におけるビジョン言語モデル(VLM)の進化を包括的に概観し、any-to-any アーキテクチャ、推論モデル、そしてロボティクス向けの Vision-Language-Action(VLA)モデルの台頭といったトレンドを強調しています。
LeRobot コミュニティ データセット: ロボティクスの ImageNet を構築する
Hugging Face は、LeRobot を通じてロボティクスデータセットの多様でオープンソースなリポジトリを構築するコミュニティ主導の取り組みを推進し、ロボットポリシーの汎化課題の解決を目指しています。