1201

Hugging Face が vdr-2b-multi-v1 多言語視覚ドキュメント検索モデルをリリース

Hugging Face は、ページのスクリーンショットを密ベクトルにエンコードすることで OCR なしで複雑なドキュメントの検索を可能にする、視覚ドキュメント検索用の多言語埋め込みモデル vdr-2b-multi-v1 を発表しました。

1202

Hugging Face Open LLM リーダーボード: CO₂ 排出量とモデル パフォーマンス分析

Hugging Face は、コミュニティ ファインチューン モデルが、簡潔さの向上と指示への従順性の向上により、公式リリースよりもしばしば高いカーボン効率を示すことを明らかにしました。

1203

Hugging Face smolagents リリース

Hugging Faceは、軽量ライブラリsmolagentsをリリースしました。これにより、LLMはJSONではなく実行可能なコードとしてアクションを記述することで複雑なタスクを実行でき、構成性と汎用性が向上します。

1204

OpenAI 企業構造の進化

OpenAIは、デラウェア州の公益株式会社(PBC)への営利部門の移行を計画しており、資金調達を容易にし、AGIが人類全体に利益をもたらすという非営利ミッションを維持することを目的としています。

1205

QVQ-72B-Preview リリース

Qwenは、Qwen2-VL-72Bベースのオープンウェイトマルチモーダル推論モデルであるQVQ-72B-Previewをリリースしました。MMMUベンチマークでスコア70.3を達成しています。

1206

PyTorchにおけるGPUメモリの可視化と理解 – Hugging Face Blog サマリー

Hugging Faceのブログ記事では、torch.cuda.memoryツールを使ってPyTorchにおけるGPUメモリ使用量を可視化する方法を説明し、モデルトレーニング中のメモリコンポーネントを分解し、総メモリ要件を見積もるための公式を提供しています。

1207

NVIDIA LogitsProcessorZoo: モジュール式 Logits Processor による言語モデル生成の制御

NVIDIA の LogitsProcessorZoo は、Hugging Face Transformers 用のモジュール式 logits processor を提供し、生成の長さの制御、フレーズの含入の強制、プロンプト内容の引用、および出力を多肢選択の回答に制限することを可能にします。

1208

Deliberative alignment: reasoning enables safer language models

OpenAI introduces deliberative alignment, a training paradigm that teaches o-series models to reason over explicit safety specifications, improving safety and reducing both under‑ and over‑refusals compared to prior models.

1209

Big Bench Audio リリース

Artificial Analysis は、音声言語モデルの推論能力を評価するために設計された 1,000 問の音声質問からなるデータセット Big Bench Audio をリリースし、テキストと音声の推論の間に大きなパフォーマンスギャップがあることを明らかにしました。

1210

ModernBERT リリースノート

Hugging Face、Answer.AI、および LightOn は、BERT の速度、精度、コンテキスト長を 8,192 トークンに改善した最先端のエンコーダー専用モデルファミリである ModernBERT をリリースしました。

1211

Bamba-9B: 推論効率の高いハイブリッド Mamba2 モデル

IBM、Princeton、CMU、UIUC による、2.2T のオープンなトークンでトレーニングされたハイブリッド Mamba2 モデルである Bamba-9B は、vLLM において Llama 3.1 8B に対して 2.5 倍のスループットと 2 倍のレイテンシ向上を達成し、transformers、vLLM、TRL、llama.cpp で即座に使用可能です。

1212

GCPにおける第5世代 Xeonでの言語モデル性能ベンチマーク

Hugging Faceは、Google CloudのC4(第5世代 Xeon)およびN2(第3世代 Xeon)インスタンスでテキスト埋め込みと生成のベンチマークを行い、C4が埋め込みスループットで10‑24倍、生成スループットで2.3‑3.6倍高いことを確認し、それにより総所有コストにおいてそれぞれ7‑19倍および1.7‑2.9倍の優位性が得られたと報告しています。

1213

Falcon 3 リリースノート / 新機能

Technology Innovation Institute (TII) は、高効率化と科学、数学、コーディング能力の強化を目的として設計された、100億パラメータ未満のデコーダーのみの(decoder-only)大規模言語モデルファミリーである Falcon 3 をリリースしました。

1214

OpenAI o1 およびデベロッパー・ツールキットのアップデート 2024年12月

OpenAIは、APIにプロダクション環境向けのo1推論モデルをリリースし、DPOによるPreference Fine-Tuningを導入し、WebRTCサポートと大幅な値下げを伴うRealtime APIのアップデートを行いました。

1215

Hugging Face Synthetic Data Generator

Hugging Faceは、自然言語プロンプトを使用してカスタムのテキスト分類およびチャットデータセットを作成できるノーコードアプリケーション「Synthetic Data Generator」を導入しました。

1216

OpenAIタイムライン: イーロン・マスクが提案した営利目的の構造と離脱

OpenAIは、2017年にイーロン・マスクが自身の絶対的支配下で営利目的の組織へ移行しようと積極的に働きかけていたことを明らかにする詳細なタイムラインと内部の通信を公開しました。

1217

LeMaterial v1.0: LeMat-Bulk データセットリリース

LeMaterial v1.0 はオープンソースイニシアティブとして LeMat-Bulk データセットをリリースし、Materials Project、Alexandria、OQMD の 6.7M エントリを統一フォーマットと 7 つの特性にまとめ、材料発見を加速します。

1218

Soraはここにある – OpenAIが新しいインターフェースとサブスクリプションアクセスを備えたビデオ生成モデルSora Turboをリリース

OpenAIは、ChatGPT PlusおよびProユーザー向けのスタンドアロン製品として利用可能な、より高速なビデオ生成モデルSora Turboのリリースを発表しました。新しいインターフェース、最大1080p解像度および20秒クリップ、組み込まれた安全対策を備えています。

1219

Hugging Face テキスト・トゥ・イメージ生成のためのオープンプリファレンスデータセット

Data is Better Together コミュニティは、モデルのアライメントのためのオープンソースプリファレンスデータの不足に対処するため、テキスト・トゥ・イメージ生成用の Apache 2.0 ライセンスのオープンプリファレンスデータセットをリリースしました。

1220

Amazon Bedrock Marketplace の Hugging Face モデル

Hugging Face は、Amazon Bedrock Marketplace に 83 のオープンモデルを統合し、AWS のお客様が管理されたインフラストラクチャ上でオープンモデルをデプロイできるようにし、同時に Bedrock API との互換性を維持しています。

1221

OpenAI Sora: アニメーター Lyndon Barrois のためのクリエイティブ ワークフロー インテグレーション

アニメーター Lyndon Barrois は、OpenAI Sora を使用して従来のスタジオ制作パイプラインをバイパスし、想像を高品質なビデオ コンテンツに直接変換することを可能にします。

1222

Vallée Duhamel と Sora

OpenAIは、Soraビデオ生成モデルに対するVallée Duhamelの芸術的視点を強調していますが、製品は2026年4月26日現在利用できないと注記されています。

1223

OpenAI Sora システムカード

OpenAIは、拡散トランスフォーマーアーキテクチャを使用して1080p解像度で最大20秒のビデオを生成できるビデオ生成モデルSoraのシステムカードをリリースしました。

1224

ミネ・アタイルとSora

学際的アーティストのミネ・アタイルは、OpenAIのSoraを使って父権的イメージに挑戦し、文化的アイコンを再定義しています。

1225

OpenAI プロダクトチーム AI 統合

OpenAI は、生産性と製品開発を向上させるために、製品チームのワークフローに AI を統合するウェビナーとガイダンスをリリースしました。

1226

ChatGPT Pro リリース

OpenAIは、月額200ドルのサブスクリプションプランであるChatGPT Proを発表しました。このプランは、o1、o1-mini、GPT-4oへの無制限アクセスおよび複雑な問題解決のための高計算リソースを必要とする'o1 pro mode'を提供します。

1227

OpenAI o1 システムカード

OpenAI は、思考の連鎖による推論モデル、その安全性評価、および準備フレームワークにおける説得と CBRN に関する中リスク、サイバーセキュリティとモデルの自律性に関する低リスクの詳細を記した o1 システムカードを公開しました。

1228

PaliGemma 2 リリースノート

Googleは、SigLIP画像エンコーダとGemma 2テキストデコーダを組み合わせた、3つのパラメータサイズと複数の入力解像度にわたる新しいビジョン言語モデルファミリーであるPaliGemma 2をリリースしました。

1229

LLMは自分の間違いを修正するのがどの程度得意か?KerasとTPUを用いたチャットボット・アリーナの実験

Hugging Faceは、いくつかの10B未満のLLMに対して単純なカレンダーAPIタスクのテストを行い、Gemma 2 9Bは最小限のプロンプトで一貫して間違いを修正できた一方で、小型および古いモデルは苦戦するか、多くの修正ターンを必要とすることを発見しました。

1230

OpenAIとFutureの専門コンテンツ向け戦略的パートナーシップ

OpenAIとFutureは提携し、Futureの200以上の専門メディアブランドからのコンテンツをChatGPTに統合し、ユーザーに信頼できる専門情報を提供するとともに、出版社の配信範囲を拡大しています。

1231

Morgan Stanley AI 統合と評価フレームワーク

Morgan Stanley は OpenAI と協力して GPT-4 と Whisper を活用したツールを導入し、信頼性とコンプライアンスに焦点を当てた厳格な評価フレームワークを通じてアドバイザーの採用率 98% を達成しました。

1232

AraGen ベンチマークとリーダーボード: アラビア語 LLMs 向け 3C3H 評価の導入

Hugging Face は、3C3H 指標を使用して正確性、完全性、簡潔性、役立ちやすさ、正直さ、無害性を評価するアラビア語 LLMs の動的ベンチマークおよびリーダーボードである AraGen を発表しました。

1233

Hugging Face CFM ケーススタディ: LLM インサイトを使った小規模モデルのファインチューニング

Capital Fund Management (CFM)は、Llama 3.1を使用してGLiNERやSpanMarkerなどのコンパクトモデルのファインチューニング用データのラベル付けを支援することで、金融の名前付きエンティティ認識(NER)の精度を最大6.4%向上させ、推論コストを最大80倍削減しました。

1234

オープンソース開発者向けEU AI Actガイド

Hugging Faceのガイドは、EU AI ActがオープンソースAI開発者にどのように適用されるかを説明し、限定リスクのAIシステムおよび非システムリスクの汎用AIモデルの義務を概説し、コンプライアンスのためのツールを示しています。

1235

QwQ-32B-Preview: 深層推論機能の探求

Qwenは、内部のチェーン・オブ・ソート思考プロセスを通じて深層推論と複雑な問題解決のために設計されたモデルであるQwQ-32B-Previewを発表しました。

1236

Hugging Face Hub ストレージの再アーキテクチャ

Hugging Faceは、コンテンツアドレスドストア(CAS)を導入することでバイトレベルの重複除去を可能にし、巨大なAIモデルのグローバル転送速度を向上させるため、アップロードおよびダウンロードアーキテクチャを再設計しています。

1237

SmolVLM リリースノート / 新機能

Hugging Faceは、フルオープンソースで、エッジデバイスでの低メモリフットプリントと高スループットに最適化された2BパラメータのVision Language Model(VLM)であるSmolVLMを発表しました。

1238

あなたは最先端の位置エンコーディングを設計できたでしょう

Hugging Faceのブログ記事は、トランスフォーマーの位置エンコーディングの反復的設計を歩み、サインusoidalエンコーディングがどのように回転位置エンコーディング(RoPE)に導かれるか、そしてそれがトークン間の関係をモデル化する上でなぜ重要かを示しています。

1239

人間とAIによるレッドチーミングの進化 – OpenAIのアプローチとo1ファミリーへの適用

OpenAIは、AIモデルの外部レッドチーミングプロセスを詳細に説明したホワイトペーパーを公開し、OpenAI o1ファミリーの公開準備にそれを適用しました。

1240

Grab GPT-4o ビジョン ファインチューニングのための GrabMaps

Grab は、GPT-4o ビジョン ファインチューニングを実装し、GrabMaps の交通標識の位置特定と車線カウントを自動化しました。これにより、速度制限標識の位置特定が 13% 向上し、車線カウントの精度が 20% 向上しました。

1241

Hugging Face と LLM-jp がオープン日本語 LLM リーダーボードを開始

Hugging Face と LLM-jp は、オープン日本語 LLM リーダーボードを導入しました。この透明な評価プラットフォームは、20 以上のデータセットを備え、日本語大規模言語モデルの性能をベンチマークします。

1242

Hugging Face がストレージ効率を向上させるためにコンテンツ定義チャンク化を導入

Hugging Face は、Xet チームによるコンテンツ定義チャンク化ストレージ アプローチを発表し、変更されたチャンクのみをアップロードすることで、大規模なモデルおよびデータセット ファイルのストレージおよび転送コストを削減します。

1243

自己スペキュラティブデコーディングによる高速テキスト生成

Hugging Faceは、LayerSkipを介した自己スペキュラティブデコーディングを導入します。これは、単一のLLMの早い層をドラフトに、後の層を検証に使用することで、生成速度を向上させ、メモリオーバーヘッドを削減する方法です。

1244

FlagEval Debate: 新しい多言語LLM評価フレームワーク

BAAIは、LLMが多言語ディベートで競い合う動的評価プラットフォームFlagEval Debateを立ち上げ、推論、論理、敵対的能力をより正確に評価できるようにしました。

1245

Rox収益プラットフォームとOpenAIの統合

Roxは、OpenAIのAPIを使用したAI搭載型収益管理プラットフォームを立ち上げ、AIエージェントスウォームのシステムを通じてデータ統合、営業ワークフロー、アカウント監視を自動化しました。

1246

Hugging Face Judge Arena: LLMsを評価者としてベンチマーク

Hugging Faceは、人間の投票を使って他のAI生成レスポンスの採点において最も効果的な評価者として機能するLLMを決定するクラウドソーシングプラットフォームであるJudge Arenaをリリースしました。

1247

OpenAIはフランスのAIエコシステムを拡大するためパリにオフィスを開設

OpenAIはフランスの組織、スタートアップ、政府との連携におけるAIの急速な導入を支援するため、パリに新しいオフィスを開設しました。

1248

Qwen2.5-Turbo 1Mトークン コンテキスト長 リリース

Qwenは、モデルのコンテキストウィンドウを100万トークンに拡張し、推論速度を大幅に向上させながら、短いシーケンスタスクにおいて競争力のあるパフォーマンスを維持するQwen2.5-Turboをリリースしました。

1249

エスティ ローダー カンパニーズ ChatGPT Enterprise 導入

エスティ ローダー カンパニーズは、ChatGPT Enterpriseを導入し、75年以上の消費者および臨床データを分析し、240以上のカスタム GPTを作成して、製品開発と市場対応の迅速化を実現しました。

1250

研究者向け Hugging Face Hub データセット共有

Hugging Face Hub は、統合された探索、セキュリティ、コミュニティエンゲージメントツールを備えた、大規模な ML データセットのホスティングと共有のための包括的なプラットフォームを提供します。