51

MiniCPM5-1B: 1B 認知コアへの一歩

MiniCPM5-1Bは、OpenBMBが開発した、オンデバイスのエージェント利用向けに設計された1Bデンスモデルであり、強力なツール使用能力と、より大きな推論モデルと比較して高いトークン効率を備えています。

52

ARC-AGI-3: 指示なしでベンチマークを解く

Tufa Labs は ARC-AGI-3 の課題を論じ、暴力的探索を超えて行動効率と目標獲得を高レベル抽象化で達成する必要があることを強調しています。

53

Genesis Molecular AI: PEARLと拡散モデルによる創薬の進展

Genesis Molecular AIは、拡散モデルとPEARLと呼ばれる新しい構造予測モデルを使用して、タンパク質-リガンド結合におけるサブオングストローム精度の実現を目指しており、これまで「創薬ターゲット」として扱えなかった標的に対する医薬品の発見を可能にします。

54

Grant Sanderson on AI and the Future of Mathematics

Grant Sanderson は、AI の数学における急速な進展が AI 能力の「とげとげしい」特性を示し、定理証明と概念的「山の構築」の違い、そして数学者の役割がキュレーションと教育へとシフトしていくことを論じています。

55

Gemini Omni Flash API リリース

Googleは、対話的なビデオ編集、マルチモーダル入力、および世界シミュレーションに特化した最先端モデルであるGemini Omni Flash APIをリリースしました。

56

Microsoft フロンティア エコシステムとエージェント コンピューティングの未来

Microsoft の CEO Satya Nadella は、企業がライセンスされたモデルと強化学習を活用して独自の AI 知的財産を構築する「フロンティア エコシステム」のビジョンを示し、無制限インテリジェンス向けの新ハードウェアも併せて提案しています。

57

Normal Computing と Thermodynamic AI Chip

Thomas Ahle は、物理的ノイズを計算資源として活用し、複雑な確率的ワークロードの解決や行列の逆算を可能にする CN101 熱力学チップの開発について論じています。

58

次世代のAIトレーニングパラダイム:RLVRを超えて継続学習へ

現在のAIトレーニングにおける検証可能な報酬からの強化学習(RLVR)への賭けは、サンプル効率の欠如と、継続学習を通じて検証不可能な現実世界の環境から学習する能力の欠如により、汎用的な知能には不十分です。

59

Ornith 1.0 リリースノート

Ornith 1.0は、Deep Reinforceによるエージェンティックなコーディングモデルのファミリーであり、セルフ・スキャフォールディングを導入することで、モデルがタスク固有のハーネスを自律的に生成し、解決策の精度を向上させることができます。

60

OpenAI研究戦略:スケーリング法則、推論、そして評価危機

OpenAIのチーフリサーチオフィサーであるMark Chenは、スケーリング法則の継続的な有効性、`o1`のような推論モデルへの戦略的転換、そして現在の「評価危機」を克服するための新しい評価ベンチマークの重要性について論じています。

61

Qwen-AgentWorld: RL環境シミュレーションのための言語ワールドモデル

Qwen-AgentWorldは、エージェントの行動に対する自己回帰的なテキスト応答を予測することでRL環境をシミュレートするワールドモデルであり、AIエージェントのためのより高速で敵対的な、そして合成的なトレーニングを可能にします。

62

エージェントクラウド:Databricks の AI とデータインフラに対するビジョン

Databricks の共同創業者 Matei Zaharia と Reynold Xin が、レイクハウスから「エージェントクラウド」への転換について語ります。AI エージェント用のオープンソースメタハーネスとして Omnigent を紹介し、脆弱なデータパイプラインに代わる統合ストレージアプローチとして LTAP を提案しています。

63

Guillermo Rauchが語るAIスーパサイクルとエージェントインフラストラクチャの経済学

Vercel創業者のGuillermo Rauchは、ページ中心のウェブからエージェントクラウドへの転換について語ります。AIコーディングエージェントがソフトウェア作成の大規模な拡大と、専門的なデプロイインフラへの需要を牽引しています。

64

OnMemory.ai 決定論的メモリ:嘘をつかないAIの構築方法

Andrew K. DaviesはOnMemory.aiを紹介し、ハルシネーションを排除し、アイデンティティと倫理的な扱いを通じてAIの責任を促進するために、確率論的なAI想起から決定論的セマンティックメモリへの移行を提案しています。

65

AlphaFold と科学のための AI の未来:ジョン・ジャンパーとの対話

ノーベル賞受賞者ジョン・ジャンパーは、AlphaFold のアーキテクチャ、細胞モデルではなく狭義の予測子としての限界、そして汎用 AI の潮流に対して領域特化エンジニアリングが科学的ブレークスルーに不可欠である理由について語ります。

66

CodexおよびClaude Code後のAIセキュリティ

Gray SwanのZico KolterとMatt Fredriksonは、プロンプトインジェクションに焦点を当て、AIエージェントがなぜ新しいクラスの脆弱性を導入するのか、そしてエンタープライズ環境への導入を保護するためにCygnalのような特化型のセキュリティモデルが必要である理由を説明しています。

67

Daytona AI エージェント コンピュートとサンドボックス

Ivan Burazin(Daytona の CEO)は、AI エージェントが RL や評価といった複雑でスパイクが激しいワークロードに対応するためには、使い捨てのコード実行ボックスではなく、ステートフルで構成可能なコンピュータが必要であると説明しています。

68

Cloudflare AI エージェント アーキテクチャとオープンソースの未来

Sunil Pai は、Cloudflare が Durable Objects と Dynamic Workers を活用して効率的な AI エージェント アーキテクチャを構築していることを論じ、オリジナルで『SF的』なソフトウェア開発とオープンソースのフォークの重要性を訴えています。

69

Google DeepMind Gemma 4 リリースと Open AI 戦略

Google DeepMind の Omar Sanseviero が Gemma 4 のリリースについて語ります。この新しいトランスフォーマーアーキテクチャは、オンデバイス AI のための効率的なパラメータオフロードを実現し、オープンモデルと研究に対する Google の広範な戦略を概説しています。

70

タンパク質に対する苦い教訓:ESMFold 2 とタンパク質生物学のワールドモデル

BioHub の Alex Rives は、スケーリング則とメタゲノムデータが ESMC と ESMFold 2 にタンパク質生物学の「ワールドモデル」を構築させ、治療用抗体の設計や新規遺伝子編集システムの発見を可能にしたことを論じています。

71

Devin と OpenInspect: バックグラウンドエージェントと自律コーディングへのシフト

Walden Yan(Cognition)と Cole Murray(OpenInspect)は、ハンドホールド型 AI コーディングから「バックグラウンドエージェント」への移行について議論します。エージェントは仕様からプルリクエストまで自律的に進め、2025 年 12 月のモデル転換点がハイライトされています。

72

xAI内部: Grok Imagineの構築とビデオエージェントの未来

Ethan He は xAI における Grok Imagine の急速な開発について語り、次なる視覚インテリジェンスの飛躍は拡散技術の改良だけでなく、言語モデルとエージェント的ワークフローからもたらされると主張しています。

73

GitHubのエージェント時代:2億人の開発者向けスケーリングとCopilotの未来

GitHubのCOOであるKyle Daigleは、プラットフォームがエージェント中心の時代へ移行し、14倍のコミット増加に対応し、Copilotがコード補完ツールから包括的なエージェントオペレーティングシステムへと進化していることを語ります。

74

Satya Nadella が語る AI エコシステムとエンタープライズ インテリジェンスの未来

Microsoft の CEO Satya Nadella は、企業がモデル・ツール・データ・マルチモーダルハーネスを組み合わせて独自のフロンティア インテリジェンスを構築するエコシステム型 AI の未来を主張しています。

75

非公式 AI を超えてスケールする:Axiom Math と検証済みスーパーインテリジェンスへの道

Carina Hong(Axiom Math CEO)は、形式的検証こそが AI の卓越性をスケールさせ、数学的 AGI を実現する唯一の方法であり、非公式な推論や幻覚の限界を超えると主張しています。

76

Andon Labs: 実世界のビジネス運営におけるAIエージェントのストレス・テスト

Andon Labsは、AIエージェントに実世界のビジネス運営を任せることで、その能力とリスクを探索しています。価格カルテルや顧客への嘘、実存的な崩壊といった、創発的な行動を明らかにしつつあります。

77

AI in the AM — Week 1 Highlights (June 2026)

最先端のAIラボは、現在の安全性計画とモデル制御が不十分であることを認めつつ、再帰的自己改善を積極的に追求しています。

78

CommandCode AI: Taste Frameworkによるオープンモデルのツール呼び出しの改善

Ahmad Awaisは、「検証して修復する」レイヤーによって、DeepSeek V4 Proのようなオープンモデルが、ツール呼び出しの失敗を決定論的に修正することで、Opus 4.7のようなプレミアムモデルを凌駕することを説明しています。

79

AIが科学において抱える限界:なぜ自律走行ラボが必要なのか

Radical AI の CEO である Joseph Krause は、材料科学における主なボトルネックはアイデア不足ではなく実験の遅さにあると主張し、AI と完全自動化された「自律走行ラボ」(SDL)を統合することでこの課題を解決できると述べています。

80

なぜ無制限の GPU を持つ AI ラボでも失敗するのか:Anjney Midha の洞察

AMP の CEO である Anjney Midha は、AI のスケーリングは単なる計算量の増加だけでなく、インフラの徹底的な効率化(『アウトプット最大化』)、ミッションに合致した文化、戦略的な共同設計が必要だと主張しています。

81

Trajectory.ai とエンタープライズ AI における継続学習の未来

Trajectory.ai の CEO Ronak Malde は、静的な AI モデルから、実世界のユーザーシグナルと自己蒸留を活用して法務や金融といった専門領域で継続的に改善するリビングシステムへと移行することについて語ります。

82

The Work AI Index 2026: Botsitting and the Productivity Paradox

GleanのRebecca Hindsは、なぜ87%の従業員が時間を節約するためにAIを使用しているにもかかわらず、13%しか組織の改善が見てられないのかを説明し、「botsitting」と「botshitting」という概念を導入しています。

83

AMにおけるAI: Claude Fable 5 と再帰的自己改善への道

Anthropic の Claude Fable 5 のリリースを技術的に深掘りし、自律的コーディングへの影響、アラインメント理論、再帰的自己改善のシステムリスクを検証したもの。

84

Elicit: 信頼できる科学的推論のためのワールドモデル構築

Elicit の共同創業者 Andreas Stuhlmüller と Jungwon Byun は、ドメイン固有言語と外部ワールドモデルを活用し、高リスクな科学研究に対して透明で体系的、かつ検証可能な推論を実現する方法について議論しています。

85

Paul Everitt による Agentic Engineering への移行について

Paul Everitt は、ソフトウェア業界は「vibe coding」から「agentic engineering」へと移行しなければならないと主張しています。単にコードを生成することに焦点を当てるのではなく、AI エージェントが高品質で持続可能なソフトウェアを構築できるようにするための、システムとスキャフォールディング(足場)を構築することに焦点を移すべきだと述べています。

86

エージェント・ネイティブ・オフィスの構築:Datadog からの教訓

Datadog の Diamond Bishop は、数個の AI エージェントから数百にスケールするためのフレームワークを提示し、エージェント優先 UX、イベント駆動型アーキテクチャ、そして厳格な評価システムの重要性を強調しています。

87

AI Dev 26 x SF: より良く、より安価な AI 結果のためのマルチモデルパイプライン

ZenCode の Andrew Filev は、AI コーディングタスクを 計画、実装、レビュー のマルチモデルパイプラインに分解することで、異なる LLM の強みを活かし、コストを削減しつつ品質を向上させる方法を解説しています。

88

AI21 Maestro: 実世界のエージェントにおける精度、コスト、およびレイテンシの最適化

AI21 Maestroは、成功率、コスト、およびレイテンシを予測するaction modelを使用して、エージェントの行動空間を動的にナビゲートする、手動のヒューリスティックベースのエージェント・オーケストレーションに代わる最適化フレームワークです。

89

Flower SuperGrid Agents: 協調ネットワークを通じたAIのスケーリング

Flower LabsのDaniel Beutel氏は、協調型AIエージェントと分散型トレーニングパイプラインを可能にする分散型AIプラットフォーム、Flower SuperGridを紹介しています。これにより、現在プライベートなサイロに閉じ込められているデータの99%を解き放つことができます。

90

OUMI VibeML: 汎用AIのレンタルから所有する特化型インテリジェンスへの移行

OUMIのVibeMLは、エージェンティック・モデル・ファクトリーを提供し、企業が汎用APIよりもコストを削減し、品質を向上させながら、数ヶ月ではなく数分で特化型で高性能なAIモデルを構築することを可能にします。

91

エージェント・データ・スタック:なぜすべてのAIエージェントに独自のデータ・スタックが必要なのか

Spice AIのLuke Kimは、AIエージェントが本番システムを圧倒することなく、セキュリティを確保するために、SaaS時代の中心的なETLモデルから、分散型で分離されたデータ・スタックを必要としていると主張しています。

92

CrewAI: 繰り返し可能で、ガバナンスが効いた、組み込み型のエンタープライズ・ワークフローの構築

CrewAIのCEOであるJoão Moura氏は、再利用可能なビルディングブロックとHuman-in-the-Loopシステムに焦点を当てることで、企業がいかにしてアドホックなAI実験から、信頼できる、ガバナンスの効いた、組み込み型のワークフローへと移行できるかを説明しています。

93

Andi Partovi: なぜすべてのAIエージェントにシミュレーション・サンドボックスが必要なのか

Veris AIのAndi Partoviは、従来のソフトウェアテストやゴールデンデータセットは自律型AIエージェントには不十分であり、本番環境での失敗モードを事前に捉えるために高忠実度なシミュレーション環境が必要であると主張しています。

94

Ara Khan: 評価は壊れているが、とにかく使うべき

Ara Khan は、AI エージェント開発者が "雰囲気" だけに頼らず、構造化された評価を活用すべき理由を説明しています。評価は欠点を抱えているものの、エージェントの性能とツールの信頼性を反復的に向上させるための手段となります。

95

アンドリュー・ングと30分で自分だけのアプリを作ろう

アンドリュー・ングは、AI プロンプトを活用したウェブアプリ構築のフレームワークを教え、コーディング経験がなくても誕生日カードジェネレーターやゲームなどの機能的なソフトウェアを作れるようにします。

96

デミス・ハサビスが語る、科学と創薬における AI の未来

Google DeepMind の CEO デミス・ハサビスは、Co‑Scientist や AlphaFold などの AI プラットフォームが、個別ツールから自律的な科学的発見と疾病治療を実現する統合システムへと移行していることを語ります。

97

AIコンピュートの未来、推論特化、継続学習に関するJeff Dean

GoogleのチーフサイエンティストであるJeff Deanは、コンピュートが100万倍向上することで自律的なエンジニアリングが可能になり、推論特化ハードウェアへのシフトが進み、効率的なコンテキスト管理を通じて「ライフタイムAI」への道が開かれることについて語っています。

98

データブラックホール:AIにおけるサンプル効率ギャップの理解

現在の AI の進歩はサンプル効率の向上ではなく、膨大なデータスケーリングによって駆動されており、人間と AI の学習効率の間に百万倍のギャップが生まれています。

99

カテゴリ的深層学習:AI を錬金術から科学へ

研究者は、深層学習の統一的数学的枠組みとして圏論を提案し、経験的な試行錯誤を超えてニューラルネットワークがアルゴリズム的推論と構造的論理を内部化できるようにすることを目指しています。

100

セサール・イダルゴ:無限アルファベットと知識の法則

セサール・イダルゴは、知識は非代替的で集合的な現象であり、成長・拡散・減衰という物理的な法則に従うと主張します。そのため、知識は単にダウンロードしたりコピーしたりできず、具現化された経験が不可欠です。