✷ アーカイブ · ラボ 11 拠点 · ディスパッチ 3,049 件
ラボ
毎朝十数個の公式ブログを開いて回る必要はありません。OpenAI、Anthropic、DeepMind などの一次発表を、要点を抜き出した形で。
Anthropic: AIエージェント用評価の仕組みを解明する
Anthropicは、反復的なデバッグから系統的で指標駆動の開発プロセスへと移行するための、AIエージェント用の自動評価の設計と実装の包括的なフレームワークを提供しています。
OpenAI for Healthcare リリース
OpenAIは、ChatGPT for Healthcare と OpenAI API を含む HIPAA 準拠ツールのスイート「OpenAI for Healthcare」を開始し、臨床医の管理業務負担を軽減し、ケアの一貫性を向上させます。
Netomiによるエージェンティック・システムのエンタープライズ展開 – OpenAIからの教訓
Netomiは、低レイテンシのツール利用のためのGPT‑4.1と、深いマルチステップの計画のためのGPT‑5.2を組み合わせた、プロダクショングレードのエージェンティック・プラットフォームを発表しました。3秒未満のレスポンス、98%の意図精度、およびエンタープライズ規模での組み込みガバナンスを実現しています。
AnthropicとPNNLによるAI重要インフラ防御研究
AnthropicとPacific Northwest National Laboratory (PNNL)は、Claudeが重要インフラ防御のための攻撃者エミュレーションを加速させ、攻撃の再構築時間を数週間から3時間に短縮できることを実証しました。
Qwen3-VL-Embedding と Qwen3-VL-Reranker のリリース
Qwen は、テキスト、画像、スクリーンショット、動画を横断した高精度なクロスモーダル検索を実現するマルチモーダルモデルシリーズである Qwen3-VL-Embedding と Qwen3-VL-Reranker をリリースしました。
GPT-5.1を使ったTolanのVoice-First AIの構築方法
TolanはGPT-5.1とカスタムリアルタイムコンテキスト管理システムを使用して、低遅延で声優先のAIコンパニオンを作り出し、持続的なメモリと一貫したパーソナリティを実現しています。
ChatGPT Health リリースノート
OpenAI は、個人の医療記録やウェルネスアプリデータを統合し、臨床ケアに代わるものではなく、健康情報のナビゲーションを支援する安全な専用エクスペリエンス「ChatGPT Health」を導入しました。
xAIが200億ドルのシリーズE資金調達ラウンドを実施
xAIは、大規模なAIコンピューティング・インフラストラクチャと製品展開を加速させるため、目標の150億ドルを上回る200億ドルのシリーズEラウンドを発表しました。
NVIDIA Cosmos Reason 2 リリースノート / 新機能
NVIDIAは、物理AI向けに設計されたオープンリasoningビジョン・ランゲージモデルであるCosmos Reason 2をリリースしました。このモデルはPhysical AI BenchおよびPhysical Reasoningのリーダーボードでトップに位置しています。
Falcon-H1-Arabic リリースノート
Hugging Faceは、Falcon-H1-Arabicを発表しました。この3つのハイブリッド Mamba-Transformer モデル(3B、7B、34B)は、コンテキストウィンドウを最大256Kトークンに拡張し、アラビア語NLPの新たな最先端ベンチマークを樹立します。
NVIDIA DGX Spark と Reachy Mini 統合ガイド
NVIDIAは、オープンな推論およびビジョンモデルを使用し、DGX Spark ハードウェア、Reachy Mini ロボット、および NeMo Agent Toolkit を組み合わせることで、現実世界の AI エージェントを作成するためのフレームワークを発表しました。
OpenAI Grove 第2コホート発表
OpenAIは、AI駆動型企業の構築を支援するプレアイデアの技術者向けに設計されたプログラムであるOpenAI Groveの第2コホートの応募受付を開始しました。
Qwen-Image-2512 リリースノート / 新機能
Qwen-Image-2512 は、Qwen-Image テキストから画像へのモデルに対する 12 月のアップデートであり、人間のリアリズム、自然なディテールの描写、そして複雑なテキストレイアウトの精度を大幅に向上させます。
xAI、Grok BusinessおよびGrok Enterpriseをリリース
xAIは、Grok BusinessおよびGrok Enterpriseを導入し、顧客データでトレーニングを行わない、安全で権限を認識するAIアシスタントを組織に提供します。
Google DeepMind 2025 Year-in-Review: Gemini 3, Gemma, AI Products, Science, and Safety Breakthroughs
Google DeepMindは、Gemini 3モデル、オープンソースのGemma、AI駆動型製品、生成メディア、科学的AI、量子コンピューティング、安全性フレームワーク、およびグローバルなコラボレーションにわたる2025年の画期的な成果を発表し、AIがツールからユーティリティへと移行していることを示しました。
AprielGuard: 現代LLMシステムにおける安全性と敵対的ロバスト性のためのガードレール
Hugging Face と ServiceNow AI は AprielGuard を発表しました。これは 8B パラメータのセーフガードモデルで、単独プロンプト、マルチターン会話、エージェントワークフロー全体にわたり、16 種類の安全リスクと幅広い敵対的攻撃を検出するよう設計されています。
Qwen-Image-Edit-2511 リリースノート
Qwen-Image-Edit-2511 は、キャラクターの一貫性を向上させ、コミュニティ LoRA を統合し、幾何学的推論と工業デザイン機能を強化した更新された画像編集モデルです。
Qwen3-TTS-VD-Flash と Qwen3-TTS-VC-Flash のリリース:制御可能な音声デザインと高速多言語音声クローン
Qwen は自然言語による音声デザイン用の Qwen3‑TTS‑VD‑Flash と、3 秒で多言語音声クローンを実現する Qwen3‑TTS‑VC‑Flash をリリースし、どちらも制御性と精度において主要な TTS システムを上回っています。
ChatGPT Atlas: プロンプトインジェクションに対するブラウザーエージェントのハードニング
OpenAIは、RL訓練された自動攻撃者を使用して、野外で悪用される前にChatGPT Atlasのプロンプトインジェクションの脆弱性を発見および緩和するためのプロアクティブな高速応答ループを実装しました。
OpenAI の顧客成長と企業導入
OpenAI は 100 万社以上のビジネス顧客を超え、ユーザーの 75% が以前は不可能だったタスクを完了できるようになったと報告しています。
xAI、エンタープライズAIおよびミッションシステム向けに米国国防総省に選定される
xAIは、そのフロンティアAIシステムとGrokモデルをGenAI.Milスイートに統合し、Impact Level 5において300万人の軍および文民の従業員にAI機能を提供するため、米国国防総省(DOW)に選定されました。
xAI Grok Collections API リリース
xAIは、Collections APIをリリースしました。これは、開発者がデータセットをアップロードして、正確なセマンティック、キーワード、およびハイブリッド検索を行うことで、RAGアプリケーションを構築することを可能にする、マネージド・ナレッジベース・サービスです。
Qwen-Image-Layered: 本質的な編集可能性のための階層的分解
Qwen-Image-Layered は、画像を複数の RGBA レイヤーに分解し、他のコンテンツに影響を与えることなく画像コンポーネントを個別に操作できる新しいモデルです。
Anthropic Bloom: 自動化された行動評価のためのオープンソースツール
Anthropicは、フロンティアAIモデルにおける特定の行動特性の頻度と深刻度を定量化するために、評価スイートを自動生成するオープンソースのエージェント型フレームワーク、Bloomをリリースしました。
Anthropic Frontier Compliance Framework for California SB 53
Anthropicは、カリフォルニア州のTransparency in Frontier AI Act (SB 53) の透明性と安全性に関する要件を満たすため、Frontier Compliance Framework (FCF) を公開しました。
OpenAI の思考連鎖モニタビリティ評価
OpenAI は、モデルの内部推論から行動を予測する能力である「モニタビリティ」を測定するためのフレームワークと13の評価を導入し、思考連鎖をモニタリングすることが出力だけをモニタリングするよりもはるかに効果的であることを発見しました。
OpenAI Model Spec アップデート: 18歳未満 (U18) 原則
OpenAIは、Model SpecにUnder-18 (U18) 原則を含めるよう更新し、13歳から17歳のユーザーに対してティーンセーフティと実際の世界でのサポートを優先するChatGPT向けの年齢に適した行動ガイドラインを確立しました。
OpenAI AIリテラシー リソース ティーンズと保護者向け
OpenAIは、家族向けガイドと保護者特化のヒントを含むAIリテラシー リソースのセットをリリースし、家族がChatGPTを安全かつ責任を持って利用できるよう支援します。
OpenAIと米国エネルギー省がAIコラボレーションを拡大
OpenAIと米国エネルギー省は、フロンティアAIモデルを科学研究に統合するため、覚書(MOU)に署名しました。具体的には、ジェネシスミッションおよび国立研究所のイニシアティブを支援します。
Transformers v5 トークナイゼーション更新
Hugging Face は Transformers v5 のトークナイゼーションを再設計し、トークナイザのアーキテクチャと学習済み語彙を分離しました。これにより、検査やカスタマイズ、スクラッチからのトレーニングが容易になります。
GPT-5.2-Codex リリースノート
OpenAIは、複雑なソフトウェアエンジニアリング、長期タスク、そして高度なサイバーセキュリティ研究に最適化されたエージェント型コーディングモデル、GPT-5.2-Codexをリリースしました。
OpenAI GPT-5.2-Codex システムカード付録
OpenAIは、複雑なソフトウェアエンジニアリング、プロジェクト規模のリファクタリング、サイバーセキュリティタスクに最適化されたエージェント型コーディングモデルであるGPT-5.2-Codexをリリースしました。
Anthropic Project Vend フェーズ2:AI店員が収益性を獲得したが、依然として人間による監視が必要
AnthropicのProject Vend フェーズ2では、店舗運営AIであるClaude(Claudiusに改名)をClaude Sonnet 4.xにアップグレードし、ツール、CEOエージェント、商品制作エージェントを追加。3拠点で収益性が向上したが、依然として堅牢性の課題が顕在化した。
Anthropic、ユーザーのウェルビーイングを保護するためにClaudeの新しいセーフガードを発表
Anthropicは、自殺/自傷行為への対応、追従性(sycophancy)の低減、および18歳以上の年齢制限を含む、Claude向けの新しいモデルおよびプロダクトのセーフガードの詳細を公開しました。内部評価において、高い適切性率を示しています。
Anthropicと米国エネルギー省がGenesis Missionのために提携
Anthropicは、最先端のAIをアメリカのエネルギー支配、生物学、および科学的生産性に統合するために、Genesis Missionの一環として米国エネルギー省と数年間にわたるパートナーシップを開始しました。
Mistral OCR 3 リリースノート
Mistral AI は、複雑なドキュメントおよび手書き文字において前バージョンより 74% の勝率を達成する高精度なドキュメント解析モデル Mistral OCR 3 をリリースしました。価格は 1,000 ページあたり 2 ドルです。
NVIDIA Nemotron 3 Nano のオープン評価レシピ(NeMo Evaluator)
NVIDIA は 300 億パラメータの Nemotron 3 Nano モデルを、NeMo Evaluator 上に構築された完全にオープンな評価レシピと共にリリースしました。これにより、誰でもベンチマークスコアを再現し、評価パイプライン全体を監査できるようになります。
Gemini 3 Flash リリースノート / 新機能
Google DeepMindは、開発者と消費者に低レイテンシとコスト削減を提供しながら、フロンティアレベルの推論とマルチモーダルインテリジェンスを組み合わせたモデルであるGemini 3 Flashをリリースしました。
OpenAI ニュース機関向けアカデミー ローンチ
OpenAIは、ジャーナリストにトレーニング、プレイブック、そしてAIの責任ある導入に関するガイダンスを提供し、報道およびビジネスオペレーションを強化するため、OpenAI Academy for News Organizationsを立ち上げました。
OpenAI、ChatGPT向けアプリ提出とディレクトリを導入
OpenAIはアプリディレクトリとベータ版Apps SDKを開始し、開発者がChatGPT内でチャットネイティブな体験を構築、提出、収益化できるようにしました。
エンタープライズ AI 2025 年の状況 レポート
OpenAI の 2025 年レポートは、エンタープライズ AI の導入が急速に拡大していることを明らかにしており、ChatGPT のメッセージ量は年比で 8 倍、API の推論トークン消費量は年比で 320 倍増加しています。
xAI Grok Voice Agent APIリリース
xAIは、Big Bench Audioで1位を獲得し、1分あたり$0.05のコストで利用可能な高速かつ多言語対応の音声エージェントシステムであるGrok Voice Agent APIをリリースしました。
Gemma Scope 2 リリース – Gemma 3 言語モデルを解釈するためのオープンツール
Gemma Scope 2 は、Gemma 3 モデル(270M‑27B パラメータ)向けのオープンソースの解釈可能性ツールスイートで、研究者が内部計算を追跡し、安全に関わる重要な挙動をデバッグできるようにします。
OpenAI FrontierScience ベンチマーク リリース
OpenAIは、物理、化学、生物学の分野における複雑な科学的推論および実際の研究タスクを実行するAIの能力を測定するために設計された、新しいエキスパートレベルのベンチマークであるFrontierScienceを発表しました。
OpenAI GPT-5 の生物学的研究能力
OpenAIは、GPT-5が新しい酵素メカニズムの発見を通じて、分子クローニングのプロトコルを自律的に最適化し、効率を79倍に向上させられることを実証しました。
OpenAIガイド: AI時代を先取りする
OpenAIは、Align、Activate、Amplify、Accelerate、Governの5ステッププレイブックを示し、組織がAIファースト企業へ移行し、競争優位を維持できるよう支援します。
ChatGPT Images と GPT Image 1.5 リリース
OpenAI は、最大 4 倍高速な生成速度と、精密な編集およびテキストレンダリング機能が大幅に向上した新しいフラッグシップ画像生成モデル、GPT Image 1.5 をリリースしました。
ClaudeのためのAnthropic "think" ツール
Anthropicは、Claudeの自律的なツール使用、ポリシー遵守、および複雑なタスクにおける逐次的な意思決定を向上させる、専用の推論スペースである「think" ツールを導入しました。
Hugging Face 上の CUGA: 設定可能な AI エージェントの民主化
IBM Research は、複雑な API とウェブタスクに対する AppWorld と WebArena ベンチマークで最先端のパフォーマンスを達成するオープンソースのエージェントフレームワークである CUGA (Configurable Generalist Agent) をリリースしました。
Gemini 2.5 Flash Native Audio リリース:強化されたライブ音声エージェントとリアルタイム音声翻訳
Google DeepMindは、ファンクションコーリング、指示への準拠、マルチターン会話を改善し、70以上の言語に対応したリアルタイムの音声対音声翻訳機能を追加したライブ音声モデル、Gemini 2.5 Flash Native Audioを発表しました。