アーカイブ · ラボ 11 拠点 · ディスパッチ 3,049 件

ラボ

毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。

351

Anthropic Constitutional Classifiers: Defending against universal jailbreaks

Anthropicは、ユニバーサル・ジェイルブレイクの成功率を5%未満に抑えつつ、計算コストのわずかな増加と0.38%の無害な拒否の増加のみで実現する、新しい入出力フィルタリング・システムであるConstitutional Classifiersを発表しました。

352

OpenAI国家安全保障原則と政府パートナーシップ

OpenAIは、政府とのパートナーシップや国家安全保障・法執行における技術の使用方法に透明性を提供するために、国家安全保障原則を公表しました。

353

OpenAI の SWE‑Bench Pro コーディング評価欠陥の分析

OpenAI は監査の結果、SWE‑Bench Pro のタスクの約 30% が過度に厳しいテストや不十分に指定されたプロンプトなどの問題により壊れていることが判明したため、同ベンチマークに対する推奨を撤回しました。

354

Robostral Navigate リリースノート

Mistral AIは、単一のRGBカメラのみを使用してロボットが複雑な環境を自律的にナビゲートできるようにする8Bモデル、Robostral Navigateを導入しました。これは、未学習のR2R-CEベンチマークにおいて76.6%の成功率を達成しています。

355

OpenAI Academy K–12教育者向け AI スキルジャム

OpenAI Academy は Walton Family Foundation と提携し、1,600 人以上の K–12 教育者に対し、教育と管理に AI を統合するためのハンズオン研修を提供する AI Skills Jam を開始します。

356

Hugging Face ネイティブ速度 vLLM Transformers モデリングバックエンド

Hugging Face は、実行時に推論専用のレイヤーフュージョンを動的に適用することで、カスタム vLLM 実装のスループットに匹敵またはそれを上回るように transformers vLLM バックエンドを更新しました。

357

Introducing GPT‑Live‑1 and GPT‑Live‑1 mini: OpenAI’s New Full‑Duplex Voice Models

OpenAI は GPT‑Live‑1 と GPT‑Live‑1 mini を発表しました。これらはフルデュプレックス音声モデルで、自然で割り込み可能な会話を実現し、複雑な推論は GPT‑5.5 に委任、全世界の ChatGPT ユーザーへ順次展開されます。

358

Anthropic と AE Studio、二重用途知識制御のための GRAM を発表

Anthropic と AE Studio は、二重用途知識を取り外し可能なコンパートメントに分離する方法として、勾配ルーティング補助モジュール(GRAM)を開発しました。これにより、一般モデル性能を損なうことなく、不正利用を防止できます。

359

Hugging Face と Amazon SageMaker Studio の統合

Hugging Face は Amazon SageMaker AI とディープリンク統合を導入し、開発者がモデルの発見から SageMaker Studio でのファインチューニングまたはデプロイまでをワンクリックで行えるようにしました。

360

Foundry Managed Compute 上の Hugging Face モデル

Microsoft Foundry は、企業レベルの運用を実現するために、ワンクリックで Foundry Managed Compute 上にデプロイ可能な、毎週更新される厳選された Hugging Face オープンウェイトモデルのカタログを統合しました。

361

インテリジェンスは無料になった、では次は? エージェントのための、エージェントによる、エージェントのデータシステム

BAIR研究者は、AI推論コストがゼロに近づく中で、エージェントワークロード、エージェント状態管理、エージェント駆動のシステム合成に向けて再設計されたデータシステムのための新しいフレームワークを提案しています。

362

Hugging Face と SkyPilot のゼロエグレス AI ストレージ統合

Hugging Face と SkyPilot は統合され、Hugging Face Hub に保存されたモデルとデータセットの読み取りにゼロエグレス コストで、任意のクラウド プロバイダー上で AI ワークロードを実行できるようになりました。

363

MUFG AIネイティブ変革とOpenAI

MUFGはOpenAIと提携し、35,000人の従業員にChatGPT Enterpriseを導入し、AIを活用した顧客体験を開発することで、AIネイティブな金融グループへの転換を図っています。

364

Australian Payments Plus ChatGPT Enterprise と Codex の統合

Australian Payments Plus (AP+) は、ChatGPT Enterprise と Codex を導入し、技術調査の加速、複雑な知識作業の効率化、および製品プロトタイピング時間を週単位から1日に短縮しています。

365

LeRobot v0.6.0 リリースノート / 新機能

LeRobot v0.6.0 は、ワールドモデルポリシー、拡張された VLA モデルズー、統合された報酬モデル API、および DAgger スタイルのヒューマン・イン・ザ・ループ修正を備えた新しいデプロイ用 CLI を導入します。

366

PRX データ戦略: VLM 再キャプションと Mosaic Streaming による事前学習のスケールアップ

Photoroom は、7B パラメータモデルの最適化のために、長い VLM 生成キャプションの使用、Lance と Mosaic Data Shards のハイブリッド ストレージ戦略、および高品質な JPEG エンコーディングを強調した PRX のデータパイプラインの詳細を説明しています。

367

vLLM × HPC-Ops: 高性能 Attention と MoE バックエンド、Tencent Hunyuan から

vLLM は現在、NVIDIA Hopper H20 に最適化された HPC-Ops Attention および MoE バックエンドを含んでおり、Attention の速度向上は最大 2.95×、MoE の速度向上は 1.59× を実現し、Hy3 において TTFT を約 24%、TPOT を約 17% 削減します。

368

Hugging Face Kernels Major Updates

Hugging Faceは、Kernelsプロジェクトのメジャーアップデートを発表しました。新しいカーネルリポジトリタイプの導入、信頼できるパブリッシャーとコード署名、刷新されたCLI、より広範なフレームワークサポート、およびエージェントによるカーネル開発のための基盤が含まれます。

369

Anthropic、Claude言語モデルにグローバルワークスペース(J-space)を発見

Anthropicは、Claudeに内部的に報告可能な推論を可能にするグローバルワークスペース(J-space)が出現していることを発見し、静かな思考の監視や新たなセーフティツールの開発を可能にした。

370

Alberta Government Uses Claude Code to Scan and Fix 466M Lines of Code in Hours

アルバータ州政府は、AnthropicのClaude Code (Opus and Sonnet) を使用して、3,400のリポジトリにわたる4億6600万行のコードを20時間でスキャンし、修正パッチを自動生成し、継続的なAI駆動型セキュリティレビューを確立しました。これにより、数年かかるはずのタスクを劇的に短縮しました。

371

xAI Grok Voice アップデート: 21種類の新しいフラッグシップボイス

xAIは、Grok Voice向けに21種類の新しい多言語フラッグシップボイスをリリースし、既存の5つのボイスの改善とGrok Voice Agent Builderの導入を行いました。

372

Google DeepMindとA24の研究パートナーシップ

Google DeepMindとA24は、創造的プロセスにAIイノベーションを直接統合し、新しい映画製作ワークフローと技術を開発するための研究パートナーシップを結びました。

373

Leanstral 1.5リリース:最先端の形式的検証モデル

Mistral AIは、119 Bパラメータ、Apache‑2.0ライセンスのLeanstral 1.5をリリースしました。このモデルはminiF2Fで飽和し、PutnamBenchの672問中587問を解き、オープンソースコードに以前未知のバグを発見しました。

374

Claude Fable 5 サイバーセキュリティ保護策とジェイルブレイク・フレームワーク

Anthropicは、Claude Fable 5におけるサイバーセキュリティの悪用を防ぐために使用される安全分類器の詳細を公開し、AIジェイルブレイクの評価方法を標準化するための新しいCyber Jailbreak Severity (CJS) フレームワークを提案しました。

375

Anthropic、Claude Fable 5 および Mythos 5 のアクセスを再開

Anthropic は、米国輸出規制の解除を受け、Claude Fable 5 および Mythos 5 の稼働を再開したと発表。新規安全分類器、業界共通の jailbreak 深刻度フレームワーク、政府との連携強化を詳細に説明しました。

376

Claude Fable 5 と Claude Mythos 5 のリリース – 安全対策を備えた先進的な Mythos クラスモデルと段階的アクセス制度

Anthropic は、ソフトウェア工学、視覚処理、科学分野で記録的な性能を発揮する一般利用向け Mythos クラス 1 モデルである Claude Fable 5 と、検証済みのサイバー防衛担当者および将来の生物学研究者向けに安全対策を緩和した Claude Mythos 5 をリリースしました。

377

BAIR 2026 卒業生ショーケース

バークレー人工知能研究所(BAIR)は、2026年度の博士課程修了生クラスを発表し、ロボティクス、大規模言語モデル、AI安全、およびヘルスケアにおける研究を強調しました。

378

Hugging Face と Cerebras の Gemma 4 を使ったリアルタイム音声 AI

Hugging Face と Cerebras は、Gemma 4 31B を使用したオープンなカスケード型音声間音声パイプラインを開発し、自然で低遅延の音声 AI インタラクションを可能にしました。

379

vLLM-Omni による Qwen3-Omni-30B-A3B-Instruct サービングの最適化

vLLM-Omni は Qwen3-Omni-30B-A3B-Instruct を 3 ステージのパイプライン(Thinker、Talker、Code2Wav)を介してサービングし、ステージ分解、CUDA Graphs、非同期チャンクハンドオフ、非同期出力、ステージレプリカ、およびホットパスのクリーンアップを使用してスループットとレイテンシを向上させます。

380

xAI Voice Agent Builder ベータ版リリース

xAIは、Grok Voiceを搭載した、プロダクション環境向けの音声エージェントを作成するためのノーコードプラットフォームであるVoice Agent Builderをベータ版としてリリースしました。

381

ScarfBench: エンタープライズ Java フレームワーク移行のための AI エージェントベンチマーク

IBM Research は、Spring、Jakarta EE、および Quarkus フレームワーク間でエンタープライズ Java アプリケーションを移行する AI エージェントの能力を評価するオープンベンチマークである ScarfBench を紹介します。

382

Nano Banana 2 Lite および Gemini Omni Flash のリリース

Google DeepMind は、高速でコスト効率の高い画像生成のための Nano Banana 2 Lite と、高品質なビデオ生成および対話型編集のための Gemini Omni Flash をリリースしました。

383

なぜAIシステムにおける専門化は避けられないのか

Goldfeder et al. の 2026 年の研究に基づき、有限なリソースが集中した容量を広範な一般性よりも効果的にするため、専門化は AI のパフォーマンスにおける構造的必要性である。

384

OpenAI Signals: グローバルなChatGPT導入動向の分析

OpenAI Signalsのデータは、ChatGPTの使用が世界的に深まりかつ拡大していることを示しており、ユーザーはサインアップから6か月後に1日あたりのメッセージ量を50%増やし、実行するタスクの種類を2倍にしています。

385

Anthropic Frontier Red Team: AI能力のストレス・テスト

AnthropicのFrontier Red Teamは、将来のリスクを予測するために、サイバーセキュリティ、国家安全保障、および自律型システムに対するAIの影響に関するエビデンスに基づいた分析を行っています。

386

Hugging Face Community Evals と Every Eval Ever (EEE) の統合

Hugging Face は、Community Evals と Every Eval Ever (EEE) プロジェクトを統合し、標準化された評価結果のクロス投稿と、モデルページと詳細な技術的記録の間の直接的なリンクを可能にしました。

387

OpenAI コアダンプ疫学: 18 年前の libunwind バグを修正

OpenAI は、Rockset データインフラストラクチャにおける 2 つの異なるクラッシュ集団を特定し、解決しました。これには、サイレントなハードウェア障害と、GNU libunwind におけるまれな 18 年前のレース条件が含まれます。

388

OpenAI は計算生物学の推論のために GeneBench-Pro を発表

OpenAI は、計算生物学における AI エージェントの高レベルの科学的判断と反復分析能力を評価するために設計された研究レベルのベンチマークである GeneBench-Pro をリリースしました。

389

Inside Genebench-Pro: ゲノムAIベンチマークにおけるケーススタディ

OpenAIのGenebench-Proは、複雑なゲノミックタスクにおけるAIモデルを評価するための専門的なベンチマークを提供し、体性腫瘍学、機能ゲノミクス、および集団遺伝学にわたる十の詳細なケーススタディを特徴としています。

390

Claude Science AI Workbench リリース

Anthropic は、科学的ツールを統合し、スケーラブルなコンピューティングを管理し、検証可能な研究成果を提供する AI ワークベンチ「Claude Science」をリリースしました。

391

DiScoFormer: 分布にわたる密度とスコアのための単一トランスフォーマー

DiScoFormerは、データ点のセットから分布の密度とスコアを単一のフォワードパスで推定し、新しい分布に対して再トレーニングを必要としない新しいトランスフォーマーベースのモデルです。

392

OpenAI マッピング ヨーロッパの AI ワークフォース機会 レポート 2026

OpenAI の 2026 年レポートは、AI Jobs Transition Framework を EU に拡張し、EU 雇用の約 12% が AI とともに成長する可能性があり、14% が比較的近い将来の自動化ポテンシャルが高い、27% が再編成される可能性があり、残りの 47% が即時的な変化が少ないことを示しています。

393

vLLM Semantic Router: マイクロエージェント協調によるモデル性能の向上

vLLMは、Semantic Routerというサービングレイヤーのプリミティブを導入し、単一のモデルAPIコールをマイクロエージェントの有界な協調に変換し、複雑なベンチマークにおいてフロンティアモデルを上回る性能を達成します。

394

Ollama 0.31: マルチトークン予測によるGemma 4のパフォーマンス向上

Ollama 0.31は、Apple Silicon上のGemma 4に対してマルチトークン予測を導入し、モデルの出力を変更することなく、コーディングエージェントのベンチマークにおいてトークン生成速度を約90%向上させました。

395

HP Inc. と OpenAI の戦略的パートナーシップ

HP Inc. は、OpenAI Frontier プラットフォームを使用して OpenAI との戦略的パートナーシップを拡大し、カスタマーサポート、セキュリティ、およびソフトウェア開発全体に AI エージェントとワークフローを導入しています。

396

GPT-5.6 Sol プレビュー: 機能、セーフガード、および可用性

OpenAIは、フラッグシップ次世代モデルであるGPT-5.6 Solを、TerraおよびLunaとともにプレビューし、強化されたセーフガードと信頼できるパートナーへの限定リリースとともに、コーディング、生物学、サイバーセキュリティにおけるより強力な機能を強調しました。

397

Hugging Face Jobs: 1コマンドで vLLM サーバーをデプロイ

Hugging Face は、HF Jobs を介した 1 コマンドで、プライベートで OpenAI 互換の vLLM エンドポイントをそのインフラストラクチャ上にデプロイできるようになり、テスト、評価、バッチ生成のための従量課金(1秒単位)の代替手段を提供します。

398

Anthropic 経済指標の時間的パターンレポート – 2026年6月

Anthropicの2026年6月版経済指標レポートでは、Claudeの利用が現在、日々および週単位の労働サイクルに従っており、より高い価値の成果物を生成し、計算負荷も高い一方、より多くのタスクを自動化しているユーザーは、AIが自身の仕事に与える影響について驚くほど楽観的であることが明らかになった。

399

OpenAI Codex エージェンティック AI 導入と影響

OpenAI は、Codex を介して知識作業を短いチャットボットのやり取りから長時間帯のエージェンティックタスクへシフトしていると報告しており、8 月 2025 以降、非開発者の導入が最大 189 倍に増加しています。

400

Gemini 3.5 Flash コンピュータ使用統合

Google DeepMind は、Gemini 3.5 Flash にコンピュータ使用をネイティブツールとして統合し、エージェントがブラウザ、モバイル、デスクトップ環境で見る、推論し、行動することを可能にしました。