AI & Frontier Tech Roundup – Local Model Advances, Agentic AI Surge, and Humanoid Robot Milestones
TL;DR
ローカルの大規模言語モデルが、これまでクラウドサービスでのみ見られていたトークン/秒単位の速度で、消費者向けGPU上で動作するようになり、Grok、Dot Reflex、Anthropicのグラフベースエージェントといった自律的な24/7作業者としてのアジェンティックAIシステムが導入されています。一方で、人型ロボットは人間のスプリント記録を上回る成果を上げており、物理的AIの全体的な加速を示しています。
ローカルなフロンティアモデルが消費者向け性能に到達
- FreeTokenにより、7530億パラメータのGLM‑5.2が1つの96GB GPU上で14.9 tok/sで動作し、35BのQwenモデルが8GB GPU上でシステムRAMからモデルの大部分をストリーミングすることで39.3 tok/sを達成しました。このアプローチは、Mixture‑of‑Expertsルーティングに依拠しており、1トークンあたり数パラメータしかアクティブにせず、巨大なチェックポイントをデスクトップハードウェアで実行可能なワークロードに変換しています @akshay_pachaar。
- Kimi‑V3(16BのスパースMoE)は1トークンあたり約3Bのパラメータのみをアクティブ化し、GPT‑4o‑miniと同等のマルチモーダルベンチマークスコアを達成しながら、4–8GB VRAMの単一GPU上で動作しています @N01ennn。
- Ornith‑1.5(35B)は約3Bのアクティブパラメータで動作し、中程度のGPUで約30 tok/s、高スペックカードでは約150 tok/sを達成しており、ローカルなコーディングやアジェンティックタスクに強い候補となっています @Oluwaphilemon1。
- DeepSeek‑V4‑Flash‑Vision‑Expはマルチモーダルエージェント機能を追加し、Opus‑4.8の性能に近づきながらも、既存のDeepSeek‑V4‑Flashチェックポイントに収まる形で実現しています @deepseek_ai。
- Qwen 3.8 27Bは、コミュニティ主導のカーネルおよび予測デコード改善により、Apple Silicon上で3倍のデコード速度を達成し、集中したエンジニアリングにより密度型モデルがローカルで実用可能になることを証明しています @0xkydo。
アジェンティックAIシステムが恒常的・自律的ワークフローへ移行
- Grok 4.6(SpaceXAI)は現在、24時間体制で動作するクラウドベースの「エージェント」として提供されており、実際のアカウントにログインし、クリックを実行し、完了した作業を返却します。ユーザーはこのボットが監視なしに受信箱のアイテムを整理し、日常的なタスクを実行できることを報告していますが、コスト制限と人間の承認の必要性について注意を促しています @RetroChainer@testingcatalog@MPxbt。
- Dot Reflex(Qwen 3‑14Bを基盤に構築)は、vanilla Qwenベースよりも32.9点の精度と39.2点のマクロF1で上回り、Dotのプラットフォーム上でリリースされ、オープンソースリポジトリも提供されます @usedotai。
- Anthropicは、現在コードの30%を生成しているグラフベースエージェントを紹介し、「アジェンティックグラフ」が主要なエンジニアリングパラダイムになったと強調しています @0xwhrrari。
- オープンソースエージェントが急増中:OpenHandsはKimiをコードエージェントに変換し、ファイルを編集し、コマンドを自律的に実行します @gippp69;CopilotKitはSlack/Teamsにエージェントを埋め込むための無料フレームワークを提供します @cyrilXBT;Grok Botの1時間コースでは、Chief‑of‑Staffマネージャーを持つ複数ボットチームの構築方法を学べます @0xMorlex@RoundtableSpace。
- FreeTokenのアーキテクチャはエージェントにも恩恵をもたらします。頻繁に使用されるエキスパートをGPUメモリにキャッシュし、必要に応じてCPUにフォールバックすることで、マルチステップのアジェンティックワークロードのレイテンシを削減しています @akshay_pachaar。
人型ロボットが人間レベルの速度と複雑なタスクを達成
- 北京に拠点を置く人型ロボットが100mを9.39秒で走破し、ウサイン・ボルトの9.58秒の世界記録を更新し、中国のロボット技術の急速な進歩を示しています @Reuters@XH_Lee23@WHRGFUN。
- 第2回世界人型ロボットゲーム(WHRG 2026)には666チームから2000台以上のロボットが参加し、現在はスプリント、高跳び、シンクロナイズドダンスなどの実行が可能になっています @business@XRoboHub@WHRGFUN。
- UnitreeのG1とDobot Atomロボットは、放送映像から学習し、外部のモーションキャプチャを用いてリアルタイムのボール追跡とスイング実行を可能にしています @TheHumanoidHub。
- Symbiosis RoboticsのDirect Perception Controlモデルにより、人型ドライバーがカートを自律的に操縦でき、階層的制御スタックを回避するエンドツーエンドの「認識→行動」パイプラインを実証しています @XRoboHub。
アジェンティックワークロードの配信に関する新研究
- Alibaba/ByteDanceの新しい論文は、LLM推論がアジェンティックアプリケーションの主なボトルネックではなくなったことを示しており、代わりにツール統合、メモリ管理、ネットワークレイテンシが支配的です。タスクに応じた配置や状態のオフロードといった最適化により、レイテンシを最大4.5倍まで削減可能であるとされています @rohanpaul_ai。
- UCバークレーの「FreeToken」論文は、LLMサービングワークロードの1年間分析を実施し、リクエストパターンが長めの入力と短めの出力へとシフトしていること、また単純なFIFO/LRUキャッシュがより複雑なポリシーを上回ることを明らかにしています @1a1a11a。
全体として、フロンティアAIの状況は3つの側面に集約されています:(1) 賢いMoEルーティングとシステムRAMストリーミングにより、巨大モデルがローカルで実行可能になっています;(2) アジェンティックAIは実験的なチャットボットから完全に自律的なクラウドワーカーへと移行しています;(3) 人型ロボットはデモからパフォーマンス重視の競争へと進化し、すでに人間のベンチマークを上回る記録を達成しています。これらのトレンドは、ソフトウェアとハードウェアのエコシステムが、クラウドからエッジに至るまで、継続的かつ高スループットのAIワークロードを支えるために迅速に適応する必要があることを示唆しています。
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch