✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 3,059 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
Anthropic Contextual Retrieval technique boosts RAG accuracy
Anthropicは、埋め込み(embeddings)とBM25インデックスにチャンク固有のコンテキストを付加する前処理手法であるContextual Retrievalを発表しました。これにより、top-20の検索失敗を最大67%削減し、より安価で信頼性の高いRAG(Retrieval-Augmented Generation)を実現します。
Anthropic Contextual Retrieval
Anthropicは、埋め込みの前にデータにチャンク固有のコンテキストを付加することで、RAGの検索失敗率を最大67%削減する手法、Contextual Retrievalを導入しました。
Qwen2.5 リリースノート:新しい基盤、Coder、Math モデル
Qwen は、汎用 LLM、専門の Coder と Math バリアント、そして更新された Qwen2-VL-72B を含む、オープンウェイトの密集デコーダーオンリーモデルの包括的スイートである Qwen2.5 をリリースしました。
Qwen2.5 LLMシリーズリリース
QwenはQwen2.5シリーズを発表しました – 0.5Bから72Bパラメータまでのオープンソースデコーダー専用LLMで、Qwen2の能力を2倍にし、18兆トークン規模のデータセット拡大、知識・コーディング・数学・アラインメントの大幅な向上、そして128Kトークンのコンテキストウィンドウを追加しています。
Qwen2.5-Coder リリースノート
Qwenは、5.5兆トークンで学習されたオープンソースのコーディングモデルシリーズであるQwen2.5-Coderをリリースしました。このシリーズは、コード生成、推論、数学において大規模モデルを上回ります。
Qwen2.5-Math リリースノート
Qwen は Qwen2.5-Math をリリースしました。これはバイリンガル推論と Tool-Integrated Reasoning(TIR)をサポートするオープンソースの数学 LLM シリーズで、複雑な数学ベンチマークにおいて主要なクローズドソースモデルを上回ります。
LLM を 1.58 ビットにファインチューニング:BitNet による極端な量子化
Hugging Face は、Llama 3 8B などの既存 LLM を動的ウォームアップ量子化戦略を用いて 1.58 ビットの三値精度にファインチューニングできることを示しました。これにより、メモリとエネルギーの要件を大幅に削減しながら、優れた性能を維持できます。
Bespoke-Minicheck: Grounded Factuality Checking via LLM Hallucination Reduction
Ollamaは、主張をソースドキュメントと照合してハルシネーションを検出する、Bespoke Labsの根拠に基づいた事実性検証モデルであるBespoke-Minicheckを統合しました。
Arco Educação と OpenAI がブラジルの教育向上のために提携
Arco Educação は OpenAI と提携し、GPT-4 搭載の教師アシスタントを導入して、ブラジルにおける教師の事務負担を軽減し、多様な学習ニーズを持つ学生向けにパーソナライズされた授業計画を作成します。
Mistral AI 9月2024リリース
Mistral AIは、la Plateformeの無料トライアル、全モデルファミリーの大幅な価格引き下げ、Mistral Small v24.09モデル、およびle ChatでのPixtral 12Bによる無料の視覚機能を導入しました。
Pixtral 12B リリースノート
Mistral AIは、新しい400Mパラメータのビジョンエンコーダーと12Bパラメータのデコーダーを組み合わせることで、テキスト能力を損なうことなく、高性能なマルチモーダル推論を実現するネイティブなマルチモーダルモデル、Pixtral 12Bをリリースしました。
Hugging Face データセット用 SQL コンソール
Hugging Face は、DuckDB WASM によって駆動されるブラウザベースの SQL コンソールを導入しました。これにより、バックエンドの依存なしで Hub 上のデータセットを直接クエリ、フィルタ、変換できます。
OpenAI の安全性とセキュリティ実践の更新
OpenAIは、モデルの開発と展開における重要な安全性とセキュリティ対策を統括する独立した取締役会監督委員会を設置しました。
HuggingChat コミュニティツールリリース
Hugging Face は HuggingChat にコミュニティツールを導入し、ユーザーが任意のパブリック Hugging Face Space をツールとして統合し、LLM がチャットインターフェース内で直接利用できるようにしました。
Accelerate 1.0.0 リリース候補のお知らせ
Accelerate 1.0.0 のリリース候補は、FP8、DeepSpeed マルチモデル、torch.compile、そして新しいデータローダー/パイプライン機能を追加し、大規模トレーニングと推論のための API を安定化させました。
OpenAI o1-preview リリースノート / 新機能
OpenAI は、科学、コーディング、数学の複雑な問題を長時間の思考で解決することを目的とした新しい推論モデルシリーズである o1-preview と o1-mini をリリースしました。
OpenAIがLLMで推論を学ぶ
OpenAIは、最新モデルの推論能力を、複雑な暗号解読タスクの詳細な手順を通じて示し、解決に必要な段階的な論理的進行を示しています。
OpenAI o1-mini リリースノート
OpenAIは、STEMタスク向けに最適化されたコスト効率の高い推論モデル o1-mini をリリースしました。o1-preview と比べてレイテンシとコストが大幅に低く、数学とコーディングにおいて高いパフォーマンスを維持します。
OpenAI o1 の貢献者
OpenAIは、OpenAI o1モデルを開発した内部および外部の貢献者の包括的なリストを公開し、組織内の役割と安全リーダーシップの詳細を示しています。
OpenAI o1でのコーディング
OpenAI o1は、先進的な推論機能により、ユーザーがより複雑で一貫性のあるコードを構築できるようにすることで、ソフトウェア開発を向上させます。
OpenAI o1 と量子物理学
OpenAI o1 は、科学、コーディング、数学における複雑な推論を行うために、応答する前により多くの時間を考えるよう設計された新しいシリーズの AI モデルです。
OpenAI o1 と経済学
OpenAI o1 は、科学、コーディング、数学、経済学における複雑なタスクを、応答前により多くの時間を考えることで推論できるよう設計された新しい AI モデルシリーズです。
OpenAI o1で遺伝学を解読する
OpenAI o1 は、科学、コーディング、数学における複雑な推論を目的とした新しいシリーズの AI モデルで、キャサリン・ブラウンスタインのような遺伝学者に、膨大なゲノムデータの複雑さを管理するツールを提供します。
Anthropic Circuits Updates August 2024
Anthropicの2024年8月のCircuitsアップデートは、マルチエージェントシステムの失敗、労働者の再教育プログラム、および研究用バージョンのClaudeによるリーマン予想に関する進展についての予備的な研究の知見を提供します。
Ada カスタマーサービス自動化(GPT-4)
AdaはGPT-4を使用してAIネイティブのカスタマーサービスプラットフォームを再構築し、解決率を30%から最大60%に倍増させました(トップパフォーマーでは80%以上)。
シークレットスキャンにおける Hugging Face と TruffleHog のパートナーシップ
Hugging Face は Truffle Security と提携し、TruffleHog のシークレットスキャン機能を自動パイプラインに統合するとともに、ユーザーが自分のアカウントデータを積極的にスキャンできるネイティブスキャナーを提供しています。
SalesforceがAnthropic Claude AIを統合
SalesforceはAmazon Bedrockを介してAnthropicのClaude 3.5 Sonnet、Claude 3 Opus、Claude 3 Haikuモデルをプラットフォームに統合し、企業がAI駆動のCRMアプリケーションをカスタマイズできるようにしました。
Qwen2-VL リリース:オープンソース 2B/7B ビジョン・ランゲージモデルと 72B API、最先端の画像、動画、マルチリンガル機能を搭載
Qwen は Qwen2-VL をリリースしました。この新しいビジョン・ランゲージモデルシリーズ(2B、7B オープンソース、72B API)は、画像、文書、マルチリンガル、長時間動画の理解において最先端の性能を実現し、ビジュアルエージェント機能もサポートします。
LeRobotDataset ビデオエンコーディング形式はロボティクスデータセットのサイズを削減し、トレーニングを高速化する
Hugging Face は LeRobotDataset ビデオエンコーディング形式をリリースし、ロボティクスの視覚データを元の約 14 % に縮小しながら、ロード速度とトレーニング性能を維持しています。
アリゾナ州立大学、ChatGPT Edu を統合しパーソナライズド教育を実現
アリゾナ州立大学は、181,000人の学生向けに学習のパーソナライズ、研究の推進、運営効率の向上を目的として、200以上のプロジェクトでChatGPT Edu を導入しました。
Hugging Face のブログ記事が、評価が低く見過ごされがちな Hub ツール 5 つと、無料のセマンティック検索ユースケースをハイライト
Hugging Face は、評価が低く見過ごされがちな Hub ツール(ZeroGPU、マルチプロセス Docker、Gradio API、Webhooks、Nomic Atlas)を 5 つ発表し、これらを組み合わせて Reddit データ向けの無料・自動更新型セマンティック検索アプリを構築する方法を示しました。
Hugging Face トレーニング効率: Flash Attention 2 を用いたパッキング
Hugging Face は指示チューニング用サンプルの境界認識パッキングを導入し、Flash Attention 2 と併用することでトレーニングスループットが最大 2 倍に、ピークメモリが 20% 削減されます。
OpenAI と Condé Nast のコンテンツ統合パートナーシップ
OpenAI は Condé Nast と提携し、Vogue や The New Yorker などのブランドのコンテンツを ChatGPT と SearchGPT プロトタイプに統合して、情報検索と情報源の明示を向上させます。
Upwork OpenAI 統合と AI ファースト戦略
Upwork は OpenAI 中心のエコシステムへ移行し、GPT-4o と GPT-3.5 をマーケットプレイス機能、社内詐欺検出、そして ChatGPT Enterprise を活用した企業生産性に統合しました。
OpenAI、GPT‑4oのファインチューニングを無料トークン枠付きで開始し、プラットフォームの終了を発表
OpenAIはGPT‑4oのファインチューニングを開始し、開発者が最小限のデータでモデルをカスタマイズできるようにし、9月23日まで無料のトレーニングトークンを提供すると同時に、2026年5月8日以降は新規ユーザー向けにプラットフォームを閉鎖することを発表しました。
Google Cloud Vertex AI で Meta Llama 3.1 405B をデプロイする
Hugging Face は、Text Generation Inference(TGI)と A3 マシンシリーズを使用して、Google Cloud Vertex AI 上で Meta Llama 3.1 405B の FP8 量子化バージョンをプログラム的にデプロイするためのガイドを提供しています。
OpenAIがイランの影響作戦 Storm-2035 を阻止
OpenAI は、イランの影響作戦 Storm-2035 が 2024 年米国選挙やその他の世界的イベント向けに政治コンテンツを生成するために使用した ChatGPT アカウントのクラスターを禁止しました。
Indeed のコンテキストジョブマッチング(OpenAI)
Indeed は OpenAI の GPT モデルを統合し、ジョブレコメンデーションに対してパーソナライズされた説明を提供した結果、開始されたジョブ応募が 20% 増加し、下流の成功率が 13% 向上しました。
OpenAI とメトロポリタン美術館の協働:眠れる美女たちを目覚めさせる
OpenAI はメトロポリタン美術館のコスチューム・インスティテュートと協力し、キュレーションされた歴史データセットに基づくナタリー・ポッターという歴史的人物と来館者が対話できる AI チャット体験を作成しました。
Hugging Face Infini-Attention 再現分析
Hugging Face が Infini-Attention の再現を試みた結果、ゲーティングの収束は改善できるものの、メモリ圧縮が増えると手法の性能が低下し、Ring Attention、YaRN、RoPE スケーリングよりも信頼性が低いことが判明しました。
OpenAI SWE-bench Verified リリース:人間検証ベンチマークがソフトウェアエンジニアリング評価を向上させる
OpenAI は SWE‑bench Verified をリリースしました。これは、曖昧な課題と不公平なテストを除去した、SWE‑bench ソフトウェアエンジニアリングベンチマークの人間検証済み500サンプルのサブセットで、AIモデルのコーディング能力をより信頼性の高い評価が可能です。GPT‑4o はこれらのサンプルの33.2%を解決し、元のベンチマークでのスコアの2倍以上です。
ggml の紹介
ggml は Transformer 推論とデバイス上 LLM 実行に最適化された、軽量な C/C++ 機械学習ライブラリで、さまざまなハードウェアバックエンドをサポートします。
Grok-2 ベータ版リリース
xAIは、Grok-2およびGrok-2 miniをベータ版としてリリースしました。これらはチャット、コーディング、および推論においてフロンティア級の能力を備えており、LMSYSリーダーボードにおいてClaude 3.5 SonnetやGPT-4 Turboを上回る性能を示しています。
Hugging Face 統合ツール使用 API
Hugging Face は、Mistral、Cohere、NousResearch、Llama の各モデルでツール呼び出しを実装する際に同じコードを使用できる統合ツール使用 API を導入しました。
Falcon Mamba 7B リリースノート
Technology Innovation Institute (TII) は、最先端のトランスフォーマーモデルと同等の性能を持ち、アテンションベースのメモリスケーリング問題を排除した、初の大規模純粋 State Space Language Model (SSLM) である Falcon Mamba 7B をリリースしました。
Qwen2-Audio リリースノート
Qwen2-Audioは、音声チャットと音声分析が可能な音声言語モデルで、8以上の言語と方言に対応し、複数のベンチマークで従来の最先端性能を上回ります。
Zico Kolter が OpenAI の取締役会に就任
OpenAI は、カーネギーメロン大学の教授で機械学習部門のディレクターである Zico Kolter を取締役会および安全・セキュリティ委員会に任命しました。
Hugging FaceがXetHubを取得し、Hubのストレージとコラボレーションを強化
Hugging FaceはGit LFSをより効率的なストレージバックエンドに置き換えるためにXetHubを買収し、インクリメンタル更新、兆パラメータモデルのサポート、そして大規模AIデータセットでのコラボレーションを向上させました。
GPT-4o System Card – 機能、安全性緩和策、およびリスク評価
OpenAIは、オムニモデルの機能、安全性緩和策、および全体的なリスク評価が「中」であることを詳述したGPT-4o System Cardを公開しました。
Anthropicがモデルの安全性に関するバグバウンティプログラムを拡大
Anthropicは、次世代のAI安全性緩和策に対するユニバーサルなジェイルブレイク攻撃の発見に対し、最大15,000ドルを報酬として提供する、招待制の拡大されたバグバウンティプログラムを発表しました。これは、CBRNやサイバーセキュリティなどの高リスクな領域を保護することを目的としています。