✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 870 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
DeepInfra と Hugging Face Inference Providers の統合
Hugging Face は、サポートされている Inference Provider として DeepInfra を追加し、Hub とクライアント SDK を通じて、DeepSeek V4 や Kimi-K2.6 などを含む 100 種類以上のモデルへのサーバーレス アクセスを可能にしました。
NVIDIA Nemotron 3 Nano Omni リリースノート / 新機能
NVIDIAは、テキスト、画像、ビデオ、オーディオ全体での長コンテキスト推論が可能なオムニモーダルモデルであるNemotron 3 Nano Omniをリリースしました。このモデルは、ドキュメントインテリジェンスとビデオ理解のベンチマークにおいて最高レベルの精度を提供します。
OpenAI Privacy Filter: スケーラブルなPII検出ウェブアプリの構築
OpenAIは、128kコンテキストウィンドウ全体で8つのカテゴリの機密データにラベルを付けることができるオープンソースの1.5BパラメーターモデルであるPrivacy Filterをリリースしました。
DeepSeek-V4 リリースノート: AIエージェント向けの効率的な1Mトークン・コンテキスト
DeepSeek-V4は、ハイブリッドなCSA/HCAアテンション・メカニズムにより、長期間のエージェント・ワークロードとツール使用の軌跡に特化して最適化された、1Mトークンのコンテキストウィンドウを導入します。
Chrome 拡張機能での Transformers.js の使用
Hugging Face は、Manifest V3 を使用して Chrome 拡張機能に Transformers.js を統合する技術ガイドを提供し、Gemma 4 E2B を駆動するバックグラウンドホスト型モデル アーキテクチャを特徴としています。
QIMMA: 品質第一のアラビア語LLMリーダーボード
Hugging Face とパートナーは、ベンチマークが実際の言語能力を正しく反映するよう、厳格な品質検証パイプラインを実装した新しいアラビア語LLMリーダーボード「QIMMA」を導入しました。
Hugging Face: AIとサイバーセキュリティの未来
Hugging Faceは、Mythosのような自律的な脆弱性検出システムがもたらすリスクに対抗するため、オープンソースのAIモデルとツールがサイバーセキュリティ防御にとって重要であると主張しています。
Hugging Face transformers-to-mlx スキルとテストハーネス
Hugging Faceは、transformersライブラリからmlx-lmへの言語モデルの移植を合理化し、高いコード品質とレビューシグナルを維持するために、スキルと非エージェント型テストハーネスをリリースしました。
Sentence Transformers を使用したマルチモーダル エンベディングおよびリランカー モデルのトレーニングとファインチューニング
Hugging Face は、Sentence Transformers を使用したマルチモーダル エンベディングおよびリランカー モデルのトレーニングとファインチューニングに関するガイドを公開し、タスク特化型ファインチューニングが Visual Document Retrieval などの検索タスクでのパフォーマンス向上をどのように示すかを示しました。
Ecom-RLVE: Eコマース会話エージェントのための適応可能な検証可能な環境
Hugging Faceは、会話の流暢さと実際のタスク完了の間のギャップを埋めるため、8つの検証可能でマルチターンの環境と適応的難易度スケーリングを使用したEコマースエージェントのトレーニングフレームワークであるEcomRLVE-GYMを紹介します。
VAKRA ベンチマーク分析: エージェントの推論、ツール使用、および失敗モード
Hugging Faceは、8,000以上のAPIとドキュメントソースにわたる構成的推論においてAIエージェントを評価する、ツールに基づいた実行可能なスイートであるVAKRAベンチマークを発表しました。これにより、ツール選択、マルチホップ推論、およびポリシー遵守における広範な失敗が明らかになりました。
HCompany HoloTab リリース
HCompanyはHolo3モデルによって駆動されるChrome拡張機能であるHoloTabをリリースしました。これにより、ユーザーは自然言語の説明または記録されたルーチンを通じてウェブタスクを自動化できるようになります。
Sentence Transformers v5.4: マルチモーダル埋め込みとリランカー モデル
Sentence Transformers v5.4 は、テキスト、画像、オーディオ、ビデオのエンコードと比較のためのマルチモーダル埋め込みおよびリランカー モデルを導入します。
Waypoint-1.5 リリースノート
Hugging Face と Overworld は、Waypoint-1.5 をリリースしました。これは、コンシューマー GPU 上でローカルで実行可能な高忠実度のインタラクティブな生成環境を可能にするリアルタイムビデオワールドモデルです。
Safetensors が PyTorch Foundation に参加
Safetensors は、ベンダーニュートラルなガバナンスとコミュニティ主導の開発を確保するため、PyTorch Foundation および Linux Foundation の下で基盤ホスト型プロジェクトへ移行しました。
Gemma 4 リリース:オンデバイス対応のオープンソース・マルチモーダルモデル
Google DeepMind による新しいオープンソース・マルチモーダル・ファミリーである Gemma 4 が、画像、音声、ビデオのサポート、最大 256K のコンテキスト、および transformers、llama.cpp、MLX、Rust、WebGPU との Day-0 互換性を備えて Hugging Face でリリースされました。
Falcon Perception と Falcon OCR のリリース
Hugging Face と TII は、オープンボキャブラリのグラウンディング向け 0.6B パラメータの早期融合トランスフォーマーである Falcon Perception と、高スループットの文書理解を実現する 0.3B パラメータのモデルである Falcon OCR を発表しました。
Gradio Server: カスタムフロントエンドと Gradio バックエンドの統合
Hugging Face は gradio.Server を導入しました。これは FastAPI の拡張で、開発者が任意のカスタムフロントエンドフレームワークを使用できるようにしつつ、Gradio のキューイング、API インフラストラクチャ、ZeroGPU サポートを保持します。
Granite 4.0 3B Vision リリースノート / 新機能
IBMは、エンタープライズ文書理解向けに最適化されたコンパクトなマルチモーダルモデル Granite 4.0 3B Vision をリリースしました。このモデルは、高精度なテーブル抽出、チャート推論、キー・バリュー・ペア抽出を特徴としています。
OpenMed CodonRoBERTa 多種生物種 mRNA 言語モデルのリリース
OpenMed は、perplexity 4.10、CAI 0.404 の CodonRoBERTa-large-v2 を搭載したエンドツーエンドのタンパク質工学パイプラインと、55 GPU‑hour(約 $165)で学習した 25 種類のコドン最適化モデルスイートをリリースしました。
TRL v1.0 リリースノート / 新機能
Hugging Face は、75 以上の手法を実装した安定したポストトレーニングライブラリ TRL v1.0 をリリースしました。高速な実験的イテレーションと本番レベルの信頼性を両立させる二重トラックの安定性モデルを特徴としています。
Hugging Face OpenClaw 移行ガイド
Hugging Face は、Inference Providers とローカル llama.cpp 設定の 2 つの方法を提供し、制限された Claude モデルからオープンソースの代替モデルへ OpenClaw エージェントを移行します。
EVA エンドツーエンド評価フレームワーク(音声エージェント向け)
EVA は、音声エージェントを正確性と会話体験の両面で同時に評価する新しいエンドツーエンドフレームワークであり、タスク成功とユーザー満足度の間に一貫したトレードオフがあることを明らかにします。
NVIDIA Nemotronによるドメイン固有埋め込みのファインチューニング – 1日以内
NVIDIA と Hugging Face は、単一 GPU で 1 日以内に完了するパイプラインを公開し、合成ドメインデータ上で Llama‑Nemotron‑Embed‑1B‑v2 モデルをファインチューニングし、検索精度を 10% 超向上させ、実際のエンタープライズデータセットでは最大 26% の改善を実現しました。
Hugging Faceのオープンソースの現状:2026年春
Hugging Faceは2025年にオープンソースAIエコシステムが大幅に拡大したと報告しています。その特徴は、中国が米国をモデルダウンロード数で上回り、ロボティクスが最大のデータセットカテゴリとして急速に台頭したことです。
Holotron-12B 高スループットコンピュータ使用エージェント
H Companyは、NVIDIA Nemotron-Nano-2 VLをベースとしたマルチモーダルコンピュータ使用モデルHolotron-12Bをリリースしました。このモデルはハイブリッドSSM-Attentionアーキテクチャを使用し、エージェントワークロードに対して高い推論スループットを実現します。
Hugging Face Storage Buckets リリース
Hugging Face は、チェックポイントや加工済みデータなどの中間 ML アーティファクトを効率的に扱うために、Xet をバックエンドとした可変型の S3 ライクなオブジェクトストレージシステム「Storage Buckets」を導入しました。
トークンを流し続けよう:16のオープンソースRLライブラリから得た教訓
Hugging Face は 16 のオープンソース RL ライブラリを調査し、非同期 RL トレーニングは推論と学習を別々の GPU プールに分離し、ロールアウトバッファを使用し、重みを非同期にプッシュすることを示しました。オーケストレーションは Ray が支配的で、重み同期は NCCL ブロードキャストが一般的です。
LeRobot v0.5.0 リリースノート / 新機能
Hugging Face は LeRobot v0.5.0 をリリースし、Unitree G1 ヒューマノイドのフルサポート、Pi0‑FAST や Wall‑X といった新しい VLA ポリシー、そしてデータセット性能の大幅な最適化を導入しました。
Ulysses シーケンス並列化による百万トークンコンテキストのトレーニング
Hugging Face は Accelerate、Transformers、TRL に Ulysses Sequence Parallelism を統合し、注意計算を複数 GPU に分散させることで、百万トークン規模のコンテキストを持つ LLM のトレーニングを可能にしました。
ロボティクスAIを組み込みプラットフォームへ:データセット記録、VLAファインチューニング、デバイス上最適化
Hugging Face と NXP は、i.MX 95 SoC 上で Vision‑Language‑Action (VLA) モデルを展開するための技術ガイドを提供し、データセットの一貫性、アーキテクチャ分解、非同期推論を重視してリアルタイムロボット制御を実現しています。
Hugging Face Modular Diffusers リリース
Hugging Face は Modular Diffusers を導入しました。これは、再利用可能なブロックを組み合わせてディフュージョンパイプラインを構築できる、構成可能なフレームワークであり、パイプライン全体を一から書く必要がなくなります。
PRX Part 3: 24時間でテキストから画像へのモデルをトレーニング
Hugging Face と Photoroom は、32 台の H200 GPU と 1,500 ドルの予算で、ピクセル空間トレーニング、トークンルーティング、表現アラインメントを組み合わせ、24 時間でテキストから画像へのモデルを学習できることを実証しました。
トランスフォーマーにおけるエキスパートの混合 (MoEs)
Hugging Face は、weight loading のリファクタリング、プラガブルなエキスパートバックエンド、ネイティブなエキスパート並列化を通じて、Mixture of Experts (MoEs) を第一級の機能として扱えるように transformers ライブラリを再設計しました。
Unsloth と Hugging Face Jobs で AI モデルをトレーニングする
Hugging Face は Unsloth と Hugging Face Jobs を統合し、迅速かつ低コストの LLM ファインチューニングを実現しました。特に LiquidAI/LFM2.5-1.2B-Instruct のような小型モデルに最適化されています。
GGML と llama.cpp が Hugging Face に参加
GGML(llama.cpp の開発者)は、ローカル AI 推論のための持続可能なリソースを提供し、Transformers ライブラリとローカルモデル展開の統合を円滑にするために Hugging Face に参加しました。
IBM と UC Berkeley が IT-Bench と MAST を用いてエンタープライズエージェントの失敗を診断
IBM Research と UC Berkeley は、エンタープライズ IT エージェントが失敗する原因を診断するために MAST(マルチエージェントシステム失敗分類法)を導入し、最先端モデルは検証エラーが孤立しているのに対し、オープンモデルはシステム的な崩壊が連鎖的に起こることを明らかにした。
Gradio 6 gr.HTML: ワンショット Web アプリ開発
Gradio 6 はカスタムテンプレート、スコープド CSS、JavaScript インタラクティブ性をサポートする強化された gr.HTML を導入し、単一の Python ファイル内で複雑な Web コンポーネントの作成を可能にします。
Hugging Face CUDA カーネル エージェント スキル
Hugging Face は、Claude や Codex などのコーディングエージェントが、transformers と diffusers ライブラリ向けの本番環境対応 CUDA カーネルを作成、ベンチマーク、統合できるようにするエージェントスキルを導入しました。
OpenEnv: 現実世界環境におけるツール使用エージェントの評価
Hugging Face と Meta が OpenEnv を発表しました。これは AI エージェントを実際のシステムや Calendar Gym のような本番環境で評価するオープンソースフレームワークで、研究と本番の信頼性ギャップを埋めることを目的としています。
Transformers.js v4 リリースノート / 新機能
Hugging Face は Transformers.js v4 をリリースし、ブラウザとサーバーサイドランタイム向けのハードウェアアクセラレーションを実現する新しい C++ で書き直された WebGPU ランタイムと、スタンドアロンの tokenizers ライブラリを導入しました。
SyGra 2.0.0 Studio リリース
SyGra 2.0.0 は Studio を導入し、YAML ファイルを手動で編集することなく、合成データ生成ワークフローを設計・実行できるビジュアルなインタラクティブ環境を提供します。
Hugging Face Community Evals
Hugging Face は Community Evals を導入しました。これは、Hub 上でモデルベンチマークスコアを直接報告・集約する分散型システムで、透明性と再現性の向上を図ります。
H Company Holo2-235B-A22B プレビューリリース
H Companyは、Screenspot-ProとOSWorld Gベンチマークで最先端の性能を達成するUIローカリゼーションモデル、Holo2-235B-A22B Previewをリリースしました。
グローバルオープンソースAIエコシステムの未来:DeepSeekからAI+へ
Hugging Faceは、オープンソースが中国のAI組織にとって支配的な戦略となり、孤立したモデルのブレークスルーから、モデル、ハードウェア、インフラストラクチャのスケーラブルで統合されたエコシステムへとシフトした様子を分析しています。
テキストから画像へのモデルのトレーニング設計:アブレーションからの教訓
テキストから画像へのモデルのトレーニング設計に関する Hugging Face の投稿の提供されたソース資料は、429 Too Many Requests エラーのため利用できません。
Daggr の紹介:視覚的検査で AI アプリをプログラム的に連結
Hugging Face は Daggr をリリースしました。これはオープンソースの Python ライブラリで、開発者が Gradio アプリ、機械学習モデル、カスタム関数をプログラム的に連結し、デバッグや状態管理のための自動生成ビジュアルキャンバスを備えたワークフローを構築できるようにします。
Hugging Face Upskill: エキスパートの能力をエージェントスキルを通じて小型モデルへ転送
Hugging Face は `upskill` を導入しました。このツールは Claude Opus 4.5 などの高性能モデルを活用し、検証済みの「エージェントスキル」を生成して、CUDA カーネル開発といった複雑タスクにおける小型またはオープンソースモデルの性能とトークン効率を向上させます。
中国のオープンソースAIエコシステムにおけるアーキテクチャ選択:DeepSeek R1からハードウェアファースト、MoE主導の風景へ
DeepSeek R1のオープンソースリリースから1年後、中国のAIコミュニティは最大単一モデル性能の追求から、柔軟でコスト効果が高くハードウェアに配慮したAIシステムの構築へとシフトしました。Mixture‑of‑Experts(MoE)がデフォルトアーキテクチャとなり、リクエストごとにエキスパートの一部だけを活性化することで巨大モデルを手頃に運用できるようになりました。マルチモーダルレースが急速に拡大し、テキスト‑ツー‑イメージ、動画、音声、3‑D、エージェント向けのオープンリリースがそれぞれフルツールチェーンと共に提供されました。小型モデル(≤30 B)の人気が高まり、ローカルデプロイやファインチューニングが容易になり、大規模MoEモデルは教師ネットとして蒸留に利用されています。Apache 2.0 と MIT ライセンスが支配的となり、法的摩擦が除去され商用採用が加速しました。ハードウェアファーストの考え方が浸透し、リリースは国内チップ(Huawei Ascend、Cambricon、Kunlun)向けに量子化・推論・サービングスタックが調整され、トレーニングパイプラインもオープンに文書化されています。競争の鍵は、モデルサイズの大きさではなく、システム設計、デプロイ効率、オープンソースエコシステム統合に移行しています。
Alyah: アラビア語LLM向けエミラティ方言ベンチマーク
Hugging Face とパートナーは、エミラティ方言におけるアラビア語LLMの言語的・文化的能力を評価するために設計された、1,173 件のサンプルからなる手動キュレーションベンチマーク「Alyah」を導入しました。