AI と先端技術のまとめ – Grok Bot の優位性、オープンソースエージェントの急増、中国モデルの勢い
TL;DR: Grok Bot は現在、SpaceXAI の主力の永続的AIワーカーとなっており、オープンソースエージェントツールキットが急増し、Qwen や Kimi といった中国モデルが急速に採用され、性能面でも優位性を発揮している。
Grok Bot と SpaceXAI の永続的AI労働力
- Grok Bot は24時間365日稼働するAIワーカーとして、自らのコンピュータを動かし、実際の業務を実行し、7人のエージェントチームを統合して模擬火星計画を実行。54回のミッションを記録し、1回に8回の失敗率を達成。システムは明確な信頼区間を含むレポートを公開している。 @GrokMissionCtrl
- SpaceXAIは Grok Build v1.0.9 をリリース。自動モードセッション、ワークフロー予算管理、サブエージェントのレート制限に対する耐性向上を追加。Shift+Tabでエージェントを自動モードで起動可能に。永続的エージェント用のダッシュボードも搭載。 @cb_doge
- Elon Muskは、Grok 4.6が6〜12か月以内にコード作成モデルで1位になり、GrokBotが1位のエージェントツールになると予測。SpaceXAIのエンジニアの70%以上が、自己学習システムの構築にすでにGrok Botを使用している。 @DataChaz@0xRafy
- Grok 4.7は来月リリース予定。2.1Tパラメータのモデルで、トークン効率は向上するが、サービス速度はわずかに遅くなる。 @testerlabor
- ユーザーはすでにGrok Botを収益化している。コンテンツ自動化デスク、旅行計画サービス、人間の監視なしに継続的に稼働するAI駆動ヘッジファンドを構築している。 @ScottyBeamIO@RohOnChain
オープンソースマルチエージェントフレームワークの注目度上昇
- Apodex 1.1 は、非同期エージェントチーム、オープンソース研究用ワークベンチ(FrontierAgent)、ローカルデプロイ用のフルサイズおよびミニモデルを備えた先端レベルのエージェントモデルファミリーをリリース。 @Apodex_AI
- 13のオープンソースリポジトリのカレントリスト(例:Browser-Use、OpenHands、CrewAI、LangGraph、AutoGen)は、コード作成、ブラウジング、ワークフローのオーケストレーションに即座に使えるエージェントパイプラインを提供。 @RoundtableSpace
- 無料のAIエージェントオーケストレーター(Herdr、Orca、AionUi、Omnigent、Paperclip、Multica)は、ライセンス、サポートエージェント、UIの違いにより、マルチエージェント開発のための幅広い選択肢を提供。 @LomashKumar52
- OpenRouter for Agents は、Claude Code、DeepSeek、Kimi などを1つのAPIの背後に集約し、コストとトークンのベンチマークを並列で行える。 @quxiaoyin
- エージェントエンジニアリングリソース(例:GPU-perf-engineeringリポジトリ)は、CUDAカーネルから分散推論までをカバーし、高速でプロダクション品質のエージェントを構築するための支援を提供。 @techNmak
中国のオープンウェイトモデルの採用が加速
- Qwen 3.8(27B)はゲーム用GPUで動作可能で、従来のSOTAであるOpus 4.6をコードベンチマークで上回り、先端モデルが数か月で安価になることを示している。 @Hesamation
- Kimi-K3(2.8Tパラメータ)は100万トークンのコンテキストを提供し、リポジトリ規模のエンジニアリングとエージェントに適している。無料トライアルも利用可能。 @alibaba_cloud
- TencentのEVIE-Preview-4.5B は8.5GBのビジュアルドキュメント検索モデルで、ローカルで動作し、ビジュアルRAGベンチマークでより大きな競合を上回っている。 @TeksEdge
- AlibabaのQwenモデルは中国の研究論文で優位を占めており、2026年にはLLMの引用の約33%に登場。一方、アメリカのオープンモデルは成長が停滞している。 @natolambert
- 中国のオープンソースAI推進は地域的にも受け入れられており(例:シンガポールのSEA-LIONプロジェクトがQwenに移行、カザフスタンのAlemLLMはDeepSeekを基盤に構築)、主権と運用コストの低さが強調されている。 @SputnikInt
先端モデルの評価とアーキテクチャの進展
- NVIDIAの10万トークンコンテキストベンチマークでは、Grok 3 LPXがGemma-4 31Bで3,431出力トークン/秒を達成。次に公開されているエンドポイントの約4倍の速度。 @NVIDIAAIInfra
- MazeBenchスコアでは、Gemini 3.7 flashのみが非ゼロスコア(1%)を達成。Grok 4.6、GLM-5.3、Qwen 3.8は同じ指標で0%。 @patience_cave
- ArchAgent v2 は、大規模な問題を段階的なサブタスクに分割することでエージェントの検索を構造化することで、人間が設計したキャッシュプリフェッチ方式よりも3.8%のIPC向上を実現した。 @rohanpaul_ai
- Muonオプティマイザーは、値出力重みへの更新を適用することで、LLM学習における稀な尾部知識においてAdamを上回り、より等方的な特異値スペクトルを生成。 @fnruji316625
- Kimi Linear attention は、100万トークンコンテキストで6倍の高速デコードを実現し、KVキャッシュメモリを75%削減しながら、フルアテンションの品質と同等またはそれを上回る。 @HowToPrompt__
ロボット工学の進展と人型ロボットの進歩
- 中国の人型ロボットTiangongは400mを38.15秒で走破し、人間の記録(43.03秒)を上回り、その後1,500mで2分21秒の記録を樹立。脚部ロボット工学の急速な進展を示している。 @KanekoaTheGreat@WHRGFUN
- ETH Zürichの脚部ロボットは、視覚、移動、腕の振りを統合した統一された強化学習コントローラーを使用してバドミントンを学習。ノイズの多い現実世界の視覚環境でも、全身の協調性を示している。 @lukas_m_ziegler
- World Humanoid Robot Gamesでは、ロボットが直線コースでは優れた性能を発揮するが、障害物コースでは制御理論の限界とエラー処理の課題が露呈した。 @WHRGFUN@WHRGFUN
AI駆動サービスの新たなトレンド
- GoogleのASLからテキストへの変換(Pixel 11搭載)は、フロントカメラのみのパイプラインでリアルタイムでASLを英語に変換。2Dの動きマップをサーバーに送信する仕組みで、アクセシビリティの大きな進歩。 @ssamat
- Microsoft風のAIコーディング採用:NVIDIAのエンジニアは、100%のスタッフがCursor(AIコーディングアシスタント)を毎日使用していると報告。生産性の大幅な向上を挙げている。 @XFreeze
- AI駆動のコンテンツ制作:MiniMax H3とPixVerseは、AIが演出、台詞、音声を生成するエンドツーエンドの映像制作を可能にし、静止画以上のクリエイティブツールキットを拡張。 @MonetizationDon
- セキュリティ最優先のエージェント設計:新しいガイドラインでは、静的APIキーをエージェントに公開するのではなく、バウルブローカーアーキテクチャで一時的な能力を発行することを推奨。セキュリティモデルは「所有」から「権限」へとシフトしている。 @nykdotdev
関連
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch