Hugging Face が vdr-2b-multi-v1 多言語視覚ドキュメント検索モデルをリリース
Hugging Face は、ページのスクリーンショットを密ベクトルにエンコードすることで OCR なしで複雑なドキュメントの検索を可能にする、視覚ドキュメント検索用の多言語埋め込みモデル vdr-2b-multi-v1 を発表しました。
Hugging Face Open LLM リーダーボード: CO₂ 排出量とモデル パフォーマンス分析
Hugging Face は、コミュニティ ファインチューン モデルが、簡潔さの向上と指示への従順性の向上により、公式リリースよりもしばしば高いカーボン効率を示すことを明らかにしました。
Hugging Face smolagents リリース
Hugging Faceは、軽量ライブラリsmolagentsをリリースしました。これにより、LLMはJSONではなく実行可能なコードとしてアクションを記述することで複雑なタスクを実行でき、構成性と汎用性が向上します。
OpenAI 企業構造の進化
OpenAIは、デラウェア州の公益株式会社(PBC)への営利部門の移行を計画しており、資金調達を容易にし、AGIが人類全体に利益をもたらすという非営利ミッションを維持することを目的としています。
QVQ-72B-Preview リリース
Qwenは、Qwen2-VL-72Bベースのオープンウェイトマルチモーダル推論モデルであるQVQ-72B-Previewをリリースしました。MMMUベンチマークでスコア70.3を達成しています。
PyTorchにおけるGPUメモリの可視化と理解 – Hugging Face Blog サマリー
Hugging Faceのブログ記事では、torch.cuda.memoryツールを使ってPyTorchにおけるGPUメモリ使用量を可視化する方法を説明し、モデルトレーニング中のメモリコンポーネントを分解し、総メモリ要件を見積もるための公式を提供しています。
NVIDIA LogitsProcessorZoo: モジュール式 Logits Processor による言語モデル生成の制御
NVIDIA の LogitsProcessorZoo は、Hugging Face Transformers 用のモジュール式 logits processor を提供し、生成の長さの制御、フレーズの含入の強制、プロンプト内容の引用、および出力を多肢選択の回答に制限することを可能にします。
Deliberative alignment: reasoning enables safer language models
OpenAI introduces deliberative alignment, a training paradigm that teaches o-series models to reason over explicit safety specifications, improving safety and reducing both under‑ and over‑refusals compared to prior models.
Big Bench Audio リリース
Artificial Analysis は、音声言語モデルの推論能力を評価するために設計された 1,000 問の音声質問からなるデータセット Big Bench Audio をリリースし、テキストと音声の推論の間に大きなパフォーマンスギャップがあることを明らかにしました。
ModernBERT リリースノート
Hugging Face、Answer.AI、および LightOn は、BERT の速度、精度、コンテキスト長を 8,192 トークンに改善した最先端のエンコーダー専用モデルファミリである ModernBERT をリリースしました。
Bamba-9B: 推論効率の高いハイブリッド Mamba2 モデル
IBM、Princeton、CMU、UIUC による、2.2T のオープンなトークンでトレーニングされたハイブリッド Mamba2 モデルである Bamba-9B は、vLLM において Llama 3.1 8B に対して 2.5 倍のスループットと 2 倍のレイテンシ向上を達成し、transformers、vLLM、TRL、llama.cpp で即座に使用可能です。
GCPにおける第5世代 Xeonでの言語モデル性能ベンチマーク
Hugging Faceは、Google CloudのC4(第5世代 Xeon)およびN2(第3世代 Xeon)インスタンスでテキスト埋め込みと生成のベンチマークを行い、C4が埋め込みスループットで10‑24倍、生成スループットで2.3‑3.6倍高いことを確認し、それにより総所有コストにおいてそれぞれ7‑19倍および1.7‑2.9倍の優位性が得られたと報告しています。
Falcon 3 リリースノート / 新機能
Technology Innovation Institute (TII) は、高効率化と科学、数学、コーディング能力の強化を目的として設計された、100億パラメータ未満のデコーダーのみの(decoder-only)大規模言語モデルファミリーである Falcon 3 をリリースしました。
OpenAI o1 およびデベロッパー・ツールキットのアップデート 2024年12月
OpenAIは、APIにプロダクション環境向けのo1推論モデルをリリースし、DPOによるPreference Fine-Tuningを導入し、WebRTCサポートと大幅な値下げを伴うRealtime APIのアップデートを行いました。
Hugging Face Synthetic Data Generator
Hugging Faceは、自然言語プロンプトを使用してカスタムのテキスト分類およびチャットデータセットを作成できるノーコードアプリケーション「Synthetic Data Generator」を導入しました。
OpenAIタイムライン: イーロン・マスクが提案した営利目的の構造と離脱
OpenAIは、2017年にイーロン・マスクが自身の絶対的支配下で営利目的の組織へ移行しようと積極的に働きかけていたことを明らかにする詳細なタイムラインと内部の通信を公開しました。
LeMaterial v1.0: LeMat-Bulk データセットリリース
LeMaterial v1.0 はオープンソースイニシアティブとして LeMat-Bulk データセットをリリースし、Materials Project、Alexandria、OQMD の 6.7M エントリを統一フォーマットと 7 つの特性にまとめ、材料発見を加速します。
Soraはここにある – OpenAIが新しいインターフェースとサブスクリプションアクセスを備えたビデオ生成モデルSora Turboをリリース
OpenAIは、ChatGPT PlusおよびProユーザー向けのスタンドアロン製品として利用可能な、より高速なビデオ生成モデルSora Turboのリリースを発表しました。新しいインターフェース、最大1080p解像度および20秒クリップ、組み込まれた安全対策を備えています。
Hugging Face テキスト・トゥ・イメージ生成のためのオープンプリファレンスデータセット
Data is Better Together コミュニティは、モデルのアライメントのためのオープンソースプリファレンスデータの不足に対処するため、テキスト・トゥ・イメージ生成用の Apache 2.0 ライセンスのオープンプリファレンスデータセットをリリースしました。
Amazon Bedrock Marketplace の Hugging Face モデル
Hugging Face は、Amazon Bedrock Marketplace に 83 のオープンモデルを統合し、AWS のお客様が管理されたインフラストラクチャ上でオープンモデルをデプロイできるようにし、同時に Bedrock API との互換性を維持しています。
OpenAI Sora: アニメーター Lyndon Barrois のためのクリエイティブ ワークフロー インテグレーション
アニメーター Lyndon Barrois は、OpenAI Sora を使用して従来のスタジオ制作パイプラインをバイパスし、想像を高品質なビデオ コンテンツに直接変換することを可能にします。
Vallée Duhamel と Sora
OpenAIは、Soraビデオ生成モデルに対するVallée Duhamelの芸術的視点を強調していますが、製品は2026年4月26日現在利用できないと注記されています。
OpenAI Sora システムカード
OpenAIは、拡散トランスフォーマーアーキテクチャを使用して1080p解像度で最大20秒のビデオを生成できるビデオ生成モデルSoraのシステムカードをリリースしました。
ミネ・アタイルとSora
学際的アーティストのミネ・アタイルは、OpenAIのSoraを使って父権的イメージに挑戦し、文化的アイコンを再定義しています。
OpenAI プロダクトチーム AI 統合
OpenAI は、生産性と製品開発を向上させるために、製品チームのワークフローに AI を統合するウェビナーとガイダンスをリリースしました。
ChatGPT Pro リリース
OpenAIは、月額200ドルのサブスクリプションプランであるChatGPT Proを発表しました。このプランは、o1、o1-mini、GPT-4oへの無制限アクセスおよび複雑な問題解決のための高計算リソースを必要とする'o1 pro mode'を提供します。
OpenAI o1 システムカード
OpenAI は、思考の連鎖による推論モデル、その安全性評価、および準備フレームワークにおける説得と CBRN に関する中リスク、サイバーセキュリティとモデルの自律性に関する低リスクの詳細を記した o1 システムカードを公開しました。
PaliGemma 2 リリースノート
Googleは、SigLIP画像エンコーダとGemma 2テキストデコーダを組み合わせた、3つのパラメータサイズと複数の入力解像度にわたる新しいビジョン言語モデルファミリーであるPaliGemma 2をリリースしました。
LLMは自分の間違いを修正するのがどの程度得意か?KerasとTPUを用いたチャットボット・アリーナの実験
Hugging Faceは、いくつかの10B未満のLLMに対して単純なカレンダーAPIタスクのテストを行い、Gemma 2 9Bは最小限のプロンプトで一貫して間違いを修正できた一方で、小型および古いモデルは苦戦するか、多くの修正ターンを必要とすることを発見しました。
OpenAIとFutureの専門コンテンツ向け戦略的パートナーシップ
OpenAIとFutureは提携し、Futureの200以上の専門メディアブランドからのコンテンツをChatGPTに統合し、ユーザーに信頼できる専門情報を提供するとともに、出版社の配信範囲を拡大しています。
Morgan Stanley AI 統合と評価フレームワーク
Morgan Stanley は OpenAI と協力して GPT-4 と Whisper を活用したツールを導入し、信頼性とコンプライアンスに焦点を当てた厳格な評価フレームワークを通じてアドバイザーの採用率 98% を達成しました。
AraGen ベンチマークとリーダーボード: アラビア語 LLMs 向け 3C3H 評価の導入
Hugging Face は、3C3H 指標を使用して正確性、完全性、簡潔性、役立ちやすさ、正直さ、無害性を評価するアラビア語 LLMs の動的ベンチマークおよびリーダーボードである AraGen を発表しました。
Hugging Face CFM ケーススタディ: LLM インサイトを使った小規模モデルのファインチューニング
Capital Fund Management (CFM)は、Llama 3.1を使用してGLiNERやSpanMarkerなどのコンパクトモデルのファインチューニング用データのラベル付けを支援することで、金融の名前付きエンティティ認識(NER)の精度を最大6.4%向上させ、推論コストを最大80倍削減しました。
オープンソース開発者向けEU AI Actガイド
Hugging Faceのガイドは、EU AI ActがオープンソースAI開発者にどのように適用されるかを説明し、限定リスクのAIシステムおよび非システムリスクの汎用AIモデルの義務を概説し、コンプライアンスのためのツールを示しています。
QwQ-32B-Preview: 深層推論機能の探求
Qwenは、内部のチェーン・オブ・ソート思考プロセスを通じて深層推論と複雑な問題解決のために設計されたモデルであるQwQ-32B-Previewを発表しました。
Hugging Face Hub ストレージの再アーキテクチャ
Hugging Faceは、コンテンツアドレスドストア(CAS)を導入することでバイトレベルの重複除去を可能にし、巨大なAIモデルのグローバル転送速度を向上させるため、アップロードおよびダウンロードアーキテクチャを再設計しています。
SmolVLM リリースノート / 新機能
Hugging Faceは、フルオープンソースで、エッジデバイスでの低メモリフットプリントと高スループットに最適化された2BパラメータのVision Language Model(VLM)であるSmolVLMを発表しました。
あなたは最先端の位置エンコーディングを設計できたでしょう
Hugging Faceのブログ記事は、トランスフォーマーの位置エンコーディングの反復的設計を歩み、サインusoidalエンコーディングがどのように回転位置エンコーディング(RoPE)に導かれるか、そしてそれがトークン間の関係をモデル化する上でなぜ重要かを示しています。
人間とAIによるレッドチーミングの進化 – OpenAIのアプローチとo1ファミリーへの適用
OpenAIは、AIモデルの外部レッドチーミングプロセスを詳細に説明したホワイトペーパーを公開し、OpenAI o1ファミリーの公開準備にそれを適用しました。
Grab GPT-4o ビジョン ファインチューニングのための GrabMaps
Grab は、GPT-4o ビジョン ファインチューニングを実装し、GrabMaps の交通標識の位置特定と車線カウントを自動化しました。これにより、速度制限標識の位置特定が 13% 向上し、車線カウントの精度が 20% 向上しました。
Hugging Face と LLM-jp がオープン日本語 LLM リーダーボードを開始
Hugging Face と LLM-jp は、オープン日本語 LLM リーダーボードを導入しました。この透明な評価プラットフォームは、20 以上のデータセットを備え、日本語大規模言語モデルの性能をベンチマークします。
Hugging Face がストレージ効率を向上させるためにコンテンツ定義チャンク化を導入
Hugging Face は、Xet チームによるコンテンツ定義チャンク化ストレージ アプローチを発表し、変更されたチャンクのみをアップロードすることで、大規模なモデルおよびデータセット ファイルのストレージおよび転送コストを削減します。
自己スペキュラティブデコーディングによる高速テキスト生成
Hugging Faceは、LayerSkipを介した自己スペキュラティブデコーディングを導入します。これは、単一のLLMの早い層をドラフトに、後の層を検証に使用することで、生成速度を向上させ、メモリオーバーヘッドを削減する方法です。
FlagEval Debate: 新しい多言語LLM評価フレームワーク
BAAIは、LLMが多言語ディベートで競い合う動的評価プラットフォームFlagEval Debateを立ち上げ、推論、論理、敵対的能力をより正確に評価できるようにしました。
Rox収益プラットフォームとOpenAIの統合
Roxは、OpenAIのAPIを使用したAI搭載型収益管理プラットフォームを立ち上げ、AIエージェントスウォームのシステムを通じてデータ統合、営業ワークフロー、アカウント監視を自動化しました。
Hugging Face Judge Arena: LLMsを評価者としてベンチマーク
Hugging Faceは、人間の投票を使って他のAI生成レスポンスの採点において最も効果的な評価者として機能するLLMを決定するクラウドソーシングプラットフォームであるJudge Arenaをリリースしました。
OpenAIはフランスのAIエコシステムを拡大するためパリにオフィスを開設
OpenAIはフランスの組織、スタートアップ、政府との連携におけるAIの急速な導入を支援するため、パリに新しいオフィスを開設しました。
Qwen2.5-Turbo 1Mトークン コンテキスト長 リリース
Qwenは、モデルのコンテキストウィンドウを100万トークンに拡張し、推論速度を大幅に向上させながら、短いシーケンスタスクにおいて競争力のあるパフォーマンスを維持するQwen2.5-Turboをリリースしました。
エスティ ローダー カンパニーズ ChatGPT Enterprise 導入
エスティ ローダー カンパニーズは、ChatGPT Enterpriseを導入し、75年以上の消費者および臨床データを分析し、240以上のカスタム GPTを作成して、製品開発と市場対応の迅速化を実現しました。
研究者向け Hugging Face Hub データセット共有
Hugging Face Hub は、統合された探索、セキュリティ、コミュニティエンゲージメントツールを備えた、大規模な ML データセットのホスティングと共有のための包括的なプラットフォームを提供します。