Hugging Face 幻覚リーダーボードの開始と初期結果
Hugging Face は、複数のオープンソースデータセットを用いて LLM の事実性と忠実性のエラーをベンチマークするために Hallucinations Leaderboard を開始し、モデル選択や研究を導く透明なランキングを提供しています。
AIセキュアLLM安全リーダーボード
Hugging Face と Secure Learning Lab は、DecodingTrust フレームワークを活用した LLM Safety Leaderboard を公開し、8 つの重要な安全性指標にわたって LLM の信頼性を評価します。
Hugging Face と Google Cloud の戦略的パートナーシップ
Hugging Face と Google Cloud は、オープンモデルと Google Cloud の AI インフラストラクチャおよびハードウェアを統合することで機械学習を民主化する戦略的パートナーシップを締結しました。
オープンソース LLM を LangChain エージェントとして
Hugging Face は、オープンソース LLM、特に Mixtral-8x7B がエージェントワークフローを駆動できるようになり、一般的な推論タスクで GPT-3.5 を上回ることができることを示しました。
低リソース ASR のための Wav2Vec2‑BERT ファインチューニング
Hugging Face は、Meta の Wav2Vec2‑BERT モデルを低リソース言語向けにファインチューニングして自動音声認識(ASR)を実現する方法を示しています。Whisper‑large‑v3 と同等の性能を保ちつつ、はるかに高速でリソース効率が高い点が特徴です。
PatchTSMixer が Hugging Face Transformers に追加 – リリースとクイックスタートガイド
PatchTSMixer は IBM Research が開発した軽量な MLP‑Mixer 時系列モデルで、現在 Hugging Face Transformers にリリースされ、はるかに低いメモリと実行時間で最先端の予測を提供します。
直接嗜好最適化手法によるLLMの嗜好チューニング – DPO、IPO、KTOの実証比較
Hugging Face は 2 つの 7B チャットモデルで DPO、IPO、KTO のアラインメント手法を評価し、β ハイパーパラメータを適切に調整した場合、DPO が一貫して他を上回ることを示しました。
ONNX Runtime と Olive を使用した SD Turbo と SDXL Turbo 推論の高速化
Hugging Face と Microsoft は、ONNX Runtime と Olive を使用した最適化を導入し、PyTorch と比較して SDXL Turbo で最大 229%、SD Turbo で最大 120% のスループット向上を実現しました。
Gradio を使用して Hugging Face Spaces で ComfyUI ワークフローを実行する
Hugging Face は、複雑な ComfyUI ワークフローを Gradio アプリケーションに変換し、無料でサーバーレスの Hugging Face Spaces ZeroGPU にデプロイするためのガイドを提供しています。
TITLE: Hugging Face リーダーボードテンプレート: Vectara HHEM リーダーボードの実装
SUMMARY: Hugging Face は、開発者が動的な LLM 評価ボードを構築できるオープンソースのリーダーボードテンプレートをリリースしました。これは Vectara の新しい Hughes Hallucination Evaluation Model (HHEM) リーダーボードで実証されています。
UnslothとHugging Face TRLの統合によるLLMファインチューニングの高速化
Unslothは、QLoRAと比較して0%の精度劣化でLLMファインチューニングを最大2.7倍高速化し、メモリ使用量を最大74%削減する軽量ライブラリです。
aMUSEd: 効率的なテキストから画像への生成
Hugging Face は、Masked Image Modeling (MIM) に基づく効率的な非拡散テキストから画像へのモデルであり、Google の MUSE のオープン再現である aMUSEd をリリースしました。
Hugging Face SDXL Dreambooth LoRA 高度トレーニングガイド
Hugging Face は、SDXL Dreambooth LoRA 用の高度なトレーニングスクリプトを導入し、Pivotal Tuning と Prodigy オプティマイザを組み合わせてコンセプト捕捉と画像品質を向上させます。
推測デコードで Whisper 推論が 2× 速くなる
Hugging Face は、推測デコードが Whisper の転写レイテンシを半減させ、出力と精度を同一に保つことを実証しました。
2023年 オープンLLM年次レビュー
Hugging Faceの2023年の振り返りは、オープンソースLLMの急増、高性能な小型モデルの登場、そしてアクセスの拡大とコミュニティの参加を劇的に広げる新しいファインチューニング技術について示しています。
Mixture of Experts (MoE) の解説
Mixture of Experts (MoE) は、トランスフォーマーモデルがパラメータをスケールさせつつ、トークンごとにニューラルネットワークのエキスパートの一部だけを活性化することで、効率的な事前学習と高速な推論を維持できるようにします。
Mixtral 8x7B リリースノート
Mistral AI は Mixtral 8x7B をリリースしました。この Mixture of Experts (MoE) モデルは Llama 2 70B を上回り、ほとんどのベンチマークで GPT-3.5 と同等の性能を示しながら、Apache 2.0 の下で商業的に許容可能です。
SetFitABSA: 少数ショットのアスペクトベース感情分析
Hugging Face と Intel Labs は、プロンプト不要で少数ショットのアスペクトベース感情分析フレームワークである SetFitABSA を導入しました。このフレームワークは、データが少ないシナリオにおいて、Llama 2 や T5 などの大規模生成モデルを上回る性能を示します。
Optimum-NVIDIA リリースノート
Hugging Face は、FP8 量子化と TensorRT-LLM を使用して NVIDIA プラットフォーム上の LLM 推論を最大 28 倍に高速化する推論ライブラリ Optimum-NVIDIA をリリースしました。
Hugging Face LoRA 動的ロードで推論速度が300%向上し、レイテンシを削減
Hugging Face は、ウォームアップ時間を 25 秒から 3 秒に短縮し、LoRA 推論を最大 300 % 高速化、総応答時間を 35 秒から 13 秒に削減する動的 LoRA ローディングシステムを発表しました。
Hugging Face と AMD GPU 加速 for LLMs
Hugging Face と AMD は、Transformers ライブラリと Text Generation Inference に AMD Instinct GPU 用の即時サポートを統合し、コード変更なしで高性能な LLM 実行を可能にしました。
Hugging Face Open LLM Leaderboard DROP ベンチマーク分析
Hugging Face は、誤った正規化とストップトークンの設定によりほとんどのモデルが誤って低いスコアになることを発見した後、Open LLM Leaderboard から DROP ベンチマークを削除しました。
SDXL と Stable Diffusion の 高速 推論 と Latent Consistency LoRAs
Hugging Face は、SDXL と Stable Diffusion モデルで 4 ~ 8 ステップの 高品質 画像 生成 を 可能 に する LCM LoRAs という 手法 を 紹介 し、推論 時間 を 大幅 に 短縮 しました。
Prodigy-HF 統合リリースノート
Explosionは、注釈付きデータ上でHugging Faceトランスフォーマーモデルの直接ファインチューニングを可能にし、Hugging Face Hubへのデータセットの直接アップロードを可能にするプラグインProdigy-HFをリリースしました。
optimum-neuron を使用した AWS Inferentia2 上への Llama 2 のデプロイ
Hugging Face は、高性能なテキスト生成のために、Llama 2 モデルを AWS Inferentia2 アクセラレータ上でデプロイできるように、optimum-neuron を AWS Neuron SDK と統合しました。
LoRAを用いた災害ツイート分類におけるRoBERTa、Llama 2、およびMistralの比較
Low-Rank Adaptation (LoRA) を用いてファインチューニングした場合、小規模なRoBERTaモデルが災害ツイートの二値分類においてLlama 2およびMistral 7Bよりも優れた性能を示すことが比較研究により明らかになりました。
Hugging Face Hub ストレージリージョン
Hugging Faceは、Enterprise Hubの顧客向けにストレージリージョンを導入し、組織がモデルとデータセットの保存場所を選択できるようになり、規制遵守とデータ転送パフォーマンスの向上を実現します。
パーソナル Copilot: 自分専用のコーディングアシスタントを訓練する
Hugging Faceは、QLoRAおよびフルファインチューニング技術を使用してStarCoderを特定のコードベースでファインチューニングすることにより、パーソナライズされたコーディングアシスタントであるHugCoderを作成する方法を実証しています。
Hugging Face と Renumics Spotlight の統合によるスケーラブルなデータ検査
Hugging Face は Renumics Spotlight と統合し、1 行のコードで機械学習データセットのインタラクティブな可視化と検査を可能にし、マルチモーダルデータとモデル結果のサポートも含みます。
Stable Diffusion XL (SDXL) の推論速度とメモリ使用量の最適化
Hugging Faceは、Stable Diffusion XL (SDXL) のメモリ使用量を28GBから最小11.47GBまで削減し、推論レイテンシを72.2秒から約10.3秒まで短縮する方法を示す、いくつかの最適化手法を調査しています。
Hugging Face Inference Endpoints を使用したエンベディングモデルのデプロイ
Hugging Face は、Inference Endpoints を通じて Text Embeddings Inference (TEI) を導入し、RAG やセマンティック検索向けのオープンソースエンベディングモデルを高パフォーマンスかつコスト効率よくデプロイする方法を提供します。
PPOを用いたRLHFの実装詳細 – Hugging Face Blog 要約
Hugging Faceのブログ記事は、OpenAIの2019年のRLHFコードベースを再現して学習曲線の一致を確認し、よりアグレッシブな更新を引き起こすPyTorch Adamオプティマイザの重要な違いを含む、詳細な実装仕様を記述しています。
Gradio-Lite: ブラウザ内で完全に動作するサーバーレス Gradio
Hugging Face は、Pyodide を使用して Gradio アプリケーションをウェブブラウザで直接実行し、サーバーサイドインフラストラクチャの必要性をなくす JavaScript ライブラリである Gradio-Lite (@gradio/lite) を紹介します。
ONNX Runtime を使用した Hugging Face モデルの高速化
Hugging Face と ONNX Runtime は、130,000 を超えるモデルのパフォーマンス向上を可能にし、PyTorch と比較して whisper-tiny モデルのレイテンシーを最大 74.30% 削減します。
Hugging Face チャットテンプレート
Hugging Faceは、チャットモデルがトレーニング時と全く同じ形式で入力を受け取れるようにし、サイレントなパフォーマンス低下を防ぐためのJinjaベースのシステムとして、チャットテンプレートを導入しました。
Cloud TPU v5e上のJAXを使用したStable Diffusion XL推論の高速化
Hugging Face Diffusersは、Cloud TPU v5e上のJAXを使用してStable Diffusion XL(SDXL)の提供をサポートし、TPU v4と比較してドルあたりの性能が最大2.4倍向上します。
Hugging Face Inference API を使用した AI Comic Factory のデプロイ
Hugging Face は、Inference API を使用して AI Comic Factory のプライベート インスタンスをデプロイするガイドを提供しており、Llama-2 と SDXL 1.0 モデルを活用しています。
TRL を用いた DDPO による Stable Diffusion のファインチューニング
Hugging Face は TRL ライブラリに Denoising Diffusion Policy Optimization (DDPO) を統合し、強化学習を使用して Stable Diffusion モデルを人間の好みに合わせることを可能にしました。
Hugging Face 倫理と社会 アップデート 2023年夏
Hugging Faceは、米国、EU、英国におけるAI規制に影響を与えるための2023年夏の取り組みを詳しく説明し、公共の広報活動と技術的研究を通じてオープンソースの倫理を推進しました。
Hugging Face ガイド: コード不要で LLaMA 2 チャットボットをトレーニング
Hugging Face は、Spaces、AutoTrain、ChatUI を使用したノーコード ワークフローを提供し、エンジニアでないユーザーでも LLaMA 2 をファインチューニングし、機能的なチャット アプリケーションとしてデプロイできるようにします。
Llama 2 on Amazon SageMaker ベンチマーク
Hugging Face は、Amazon SageMaker 上の Llama 2 の 60 種類のデプロイ構成を分析し、コスト、スループット、レイテンシに対して最適なセットアップを特定しました。
Hugging Face PRO向け推論
Hugging FaceはPROユーザー向けにInferenceを導入し、キュレートされた最先端モデルへの高速APIエンドポイントと、無料Inference APIのレート制限の向上を提供します。
Rocket Money x Hugging Face: 本番環境での変動的MLモデルのスケーリング
Rocket Moneyは、Hugging FaceのInference APIを使用してレガシーなregexベースのシステムを置き換えることで、トランザクション分類システムを月間10億件以上にスケールさせました。
3D Gaussian Splatting入門
3D Gaussian Splattingは、少数の画像から学習したフォトリアリスティックな3Dシーンのリアルタイムレンダリングを可能にするラスタライズ技術です。
Hugging Face オブジェクト検出 リーダーボード
Hugging Face は、COCO スタイルのメトリクスを使用してオープンソース モデルをランク付けする Object Detection Leaderboard をリリースし、Average Precision と Average Recall の計算方法および結果に影響を与える要因を説明するブログを公開しました。
本番環境でのLLM最適化: 精度、注意、アーキテクチャ
Hugging Faceは、効率的なLLMデプロイのための主要な技術を概説し、低精度量子化、メモリ効率のためのFlash Attention、およびRoPE、ALiBi、MQA、GQAなどのアーキテクチャ最適化に焦点を当てています。
PyTorch FSDP を使用した Llama 2 70B のファインチューニング
Hugging Face は、PyTorch Fully Sharded Data Parallelism (FSDP) と Accelerate を使用して Llama 2 70B をファインチューニングし、CPU RAM のボトルネックを克服し、VRAM 使用量を最適化する方法を示しています。
Würstchenの紹介: 画像生成のための高速ディフュージョン
Würstchenは、42xの空間圧縮を達成し、トレーニングと推論のコストを大幅に削減する高速かつ効率的なテキスト・トゥ・イメージディフュージョンモデルです。
Hugging Face Transformers 量子化の概要
Hugging Face は、bitsandbytes と auto-gptq の量子化スキームをネイティブにサポートし、小型デバイスでの大規模モデルの推論と効率的なアダプター ファインチューニングを可能にします。
SafeCoder と クローズドソース コード アシスタント
Hugging Face は、オープンソースの StarCoder モデルに基づくエンタープライズグレードのコード アシスタントである SafeCoder を発表しました。これは、クローズドソースの代替品よりも透明性、カスタマイズ性、データ プライバシーを優先します。