browser-use/jev-ultrafast

Jev Ultrafastは、小さなLLMを使用して、動的に生成されたインデックス付きページコントロールリストから1つの操作(クリック、入力、選択など)と1つのUI要素を選択するオープンソースのブラウザエージェントです。1回の決定ごとに1回のネットワークラウンドトリップで、Google Flights検索などのタスクを約7秒で完了でき、サイト固有のスクリプトを必要とせず、任意のコード実行を防ぐ安全チェックも備えています。

Tencent/WeKnora

WeKnoraは、ドキュメントを検索可能で推論能力を備えたナレッジベースに変換する、オープンソースのエンタープライズ向けフレームワークです。RAG Q&A、ReActエージェント、自動生成Wiki、サンドボックス化されたカスタムスキル、セッション間メモリ、プラグイン可能なLLM/ベクトルストアバックエンドを提供し、オンプレミス環境でのデプロイ、詳細なRBAC、可観測性をサポートします。

google/artemis

AIアシスタントやテストスイートが、自然言語とマルチモーダル認識を使用して実機を操作できるようにする、AI搭載のAndroid自動化フレームワークです。

dexmal/opendm

OpenDMは、オープンワールドのロボット制御のためのVision-Language-Action (VLA) フレームワークおよびモデルコレクション (DM0.5) であり、マルチエンボディメント(多身体)学習、ファインチューニング、および高性能な推論をサポートします。

dexmal/dexbotic

身体的な知能モデルの事前学習とデプロイ向け、PyTorchベースの統合開発ツールボックス。

amagine-ai/Amagine3D

テキストによる説明、画像、および寸法から、編集可能なプリント可能なハードウェアエンクロージャおよび組み立て構造を生成するオープンソースの3D機能レイヤー。

dexmal/opendw

DW05は、将来のビデオ予測、アクション生成、状態価値推定を統合し、ロボットがアクションの結果を予測するのを助ける、具現化知能のためのマルチモーダル世界モデルです。

earthtojake/text-to-cad

CAD、CAE、CAM用のエージェントスキルのライブラリで、AIエージェントが平易な言語でのリクエストから3Dモデル、ロボット記述ファイル、製造可能なGコードを生成できるようにします。

enactic/openarm

物理AI研究、模倣学習、および安全な人間とロボットの相互作用のために設計された、オープンソースの7自由度(7DOF)ヒューマノイドアームと標準化された環境。

v-modal/vmodal_sdk_robotics

ロボティクス向けのクラッシュ耐性データアップロードSDKで、ネットワークの不安定や電源障害があってもLeRobotデータセット成果物を確実にスプールしてアップロードします。

browserbase/stagehand

Stagehand は、LLM駆動エージェントが自然言語コマンド(`act`、`observe`、`extract`)で実際のブラウザを制御できるオープンソースSDK(TS/Python/Go)です。ページコンテキストをトークン効率よくトリムし、サイトの変更に自己修復し、スキーマ検証済みデータを返します。エージェント向けに設計されており、ローカルまたはBrowserbase上で高速かつキャッシュ付きで実行可能です。

pollen-robotics/microduck

Microduckは、強化学習ポリシーを使用して歩行、転がり、環境との対話を行う小型二足ロボットの制御ソフトウェアです。

makerspet/oomwoo

Raspberry Pi と ROS2 で構築されたオープンソースの DIY ロボット掃除機。2D LiDAR を使用し、クラウドに依存せずに自律的なローカルナビゲーションを実現します。

neka-nat/freecad-mcp

AIアシスタントが3Dモデリング、Pythonスクリプト、FEM解析を実行できるFreeCADを制御するためのModel Context Protocolサーバー。

AI-FanGe/Microduck-build-tutorial

MuJoCoベースの強化学習トレーニングから、Raspberry Pi Zero 2 WでのONNXポリシーによる現実世界へのデプロイまでをカバーするコンパクトな二足歩行ロボットプロジェクト。

eonsystemspbc/fly-brain

FlyWire接続体に基づく成虫ショウジョウバエの全脳漏れあり積分・放電モデルで、神経スパイク伝播をシミュレート・分析できる。

PhyAgentOS/PhyAgentOS-core

統一されたAPIゲートウェイと証拠ベースの検証を使用して、物理タスクが正常に完了し、再帰的に改善可能であることを保証するエンボディドAI向けのエージェントフレームワーク。

anonymous-report-421/GPT-as-Policy

GPT-6 Astra をエンボディドロボティックポリシーとして使用する際の評価フレームワークおよび技術レポート。直接制御と、ベースポリシーのアクションを修正するハイブリッドアプローチを比較しています。

OpenWAM-Official/OpenWAM

世界知識と行動学習を統合するWorld-Action Models (WAMs) の開発を支援するオープンな研究スタック。世界知識と行動学習を組み合わせたロボットポリシーの事前学習および微調整に向けたモジュール式インフラを提供する。

fanhao375/microduck-replica

Microduck二足歩行ロボットのサードパーティによるハードウェア再構築。シミュレーションモデルをリバースエンジニアリングし、印刷可能なCADファイル、BOM、電子回路図を作成します。

air-embodied-brain/Zetta-Embodiment

ベースポリシーの再トレーニングなしに、コードベースの回復スキルとクリティックを進化させる効率的な閉ループハーネスで、エムベデッドAIの成功確率を向上させる。

78/xiaozhi-esp32

ESP32 マイコン向けのオープンソース AI チャットボットフレームワークで、LLM とハードウェア制御を MCP プロトコルで統合した音声対話が可能。

huggingface/lerobot

PyTorchベースの現実世界ロボティクス向けライブラリで、ハードウェア制御の標準化インターフェース、スケーラブルなデータセット形式、最先端のAIポリシーを提供します。

kevinzakka/mjbatch

mjbatch は、C++ スレッドプールを使用して CPU 上で数千もの MuJoCo 物理シミュレーションを並列で実行する Python ライブラリです。ライブな NumPy スタイルのバインディングを提供し、シミュレーション状態や各シミュレーションのモデルパラメータを変化させることができ、強化学習、MPC、システム同定、ロボットのコデザインに適しています。pip でインストール可能。例にはカートポールスイングアップ、Go1 四足歩行ロボットの制御、アームのコデザインが含まれます。

VectifyAI/PageIndex

PageIndexは、ドキュメントのレイアウトから構築された階層的ツリーインデックスを用いて、ベクトルストアによる検索を置き換えるオープンソースのRAGシステムです。LLMがこのツリーを推論して関連するセクションを特定し、ベクトルDBやチャンキングなしで説明可能で引用可能な回答を生成します。SDKはローカル(約$0.001/ページのインデックスコスト)またはPageIndex Cloudで利用可能。ベンチマークではFinanceBenchで98.7%の精度を達成し、全PDFをモデルに投入する場合と比べて最大16倍低いクエリコストを実現。

google-deepmind/mujoco

ロボット工学や機械学習の研究で広く使用されている、関節構造の高速かつ正確なシミュレーションのための高性能物理エンジン。

DenisSergeevitch/desktop-fly

FlyWire と MaleCNS の実世界の神経コネクトームデータを利用した 3D デスクトップペットのショウジョウバエ。スパイキングニューラルネットワークを通じて生物学的行動をシミュレートします。

Rhoban/microban

手頃な価格のロボット工学の学習と実験に適した、コンパクトで3Dプリント可能なオープンソース人型ロボット。

RLinf/RLinf

RLinfは、大規模な身体的・自律型AIのためのオープンソースでPyTorch互換の強化学習インフラです。多数のシミュレータと現実世界のロボットプラットフォームを統合し、幅広いアクセラレータをサポートし、PPO、GRPO、SAC、および新しいフロートランスフォーメーション手法を含むRLアルゴリズムで、巨大な視覚言語モデル、拡散モデル、MoEモデルのファインチューニング用の即時パイプラインを提供します。FUSCOなどの高度なシステム最適化と数十の例レシピを備えており、シミュレーションおよび現実世界の両方でRLエージェントのトレーニングとデプロイに統一的かつスケーラブルなバックボーンを必要とする研究者やエンジニアに適しています。

showlab/Show-Harness

Show-Harnessは、さまざまなロボットをゼロショットまたは効率的なファインチューニングで制御できる、統一された意味的インターフェースを提供する身体に依存しないハーネスです。

pollen-robotics/microduck_rl

マイクロダックという小型二足歩行ロボット向けの強化学習(RL)訓練環境。高精度なアクチュエータモデルとドメインランダム化を用いて、複雑な歩行パターンや技のシミュレーションから現実への転送を実現。

jnz/INSLIB

自律走行車やロボット用に、IMU、GNSS、その他のセンサー情報を強固なカルマンフィルタで融合するポータブルCライブラリ。

nftechie/doomfly

生物学的に再構成された果実蝇の接続図を、ViZDoomアリーナに接続して、ドーパミンゲート型記憶ルールを使用して生存のために訓練できるかどうかを検証するシミュレーション。

RoboDojo-Benchmark/RoboDojo

60の多様なタスクにわたる汎用ロボット操作ポリシーの包括的評価のための、シミュレーションと実世界を統合したベンチマーク。

datawhalechina/every-embodied

基本的なロボティクス・シミュレーションから最先端のVLAおよびワールドモデルの再現まで、構造化されたパスを提供するEmbodied AIのための包括的な学習ライブラリ。

hanyang9/UMR

学習されたポイントクラウドの対応関係を使用して、手動の関節マッピングなしで人間の動きをロボットに転送する、ヒューマノイドロボット用の統合モーションリターゲティングフレームワーク。

ShawnPana/phone-harness

Phone Harness は、LLMエージェントが macOS ミラーリング経由の実際の iPhone または ADB 経由の Android デバイスを制御できるオープンソースのブリッジです。画面をキャプチャし、可視テキストをOCRで認識し、HIDイベントを注入することで、エージェントはアプリを開き、テキストをタップし、入力し、結果を読み取ることができます。電話に何もインストールする必要はありません。

robocurve/inspect-robots

物理AIのオープンソース評価フレームワークで、どのロボットやシミュレータとも互換性のあるロボットポリシーを実行でき、監査可能なログとライブ可視化を提供します。

google-deepmind/mujoco_menagerie

MuJoCo物理エンジン用の高品質なロボットモデルのキュレートされたコレクション。リアルで忠実なシミュレーションを実現するように設計されています。

LiteReality/LiteReality-Agent

ロボット工学のシミュレーション用に、現実世界の部屋スキャンをインタラクティブで物理エンジン対応の3D環境に変換するエンドツーエンドのツールキットです。

RLinf/RPent

RPentは、再帰的な相互作用とメモリを使用して、能力を向上させ、長期間の物理的操作タスクの成功率を向上させる具身エージェントを構築するためのオープンフレームワークです。

TheRobotStudio/SO-ARM100

LeRobotライブラリとシームレスに統合できる低コストのロボットアーム(SO-100およびSO-101)のオープンソース設計で、AIロボティクスのアクセスを容易にします。

NVlabs/GR00T-WholeBodyControl

SONICと呼ばれる基礎モデルを備えた人間型全身制御フレームワーク。大規模な動きデータから学習された自然な人間らしい動きを実現し、幅広い運動を可能にする。

nvidia-isaac/video_to_data

人間のデモンストレーション動画を、シミュレーション対応アセットと、RLポリシー学習のための物理基盤ロボットトレーニングデータに変換するエンドツーエンドのパイプライン。

Robbyant/lingbot-vla-v2

LingBot-VLA 2.0は、アクション表現を統一し、MoEエキスパートを使用してクロスエンボディメント汎化を行うことで、さまざまな構成のロボットが複雑なタスクを実行できるようにするビジョン・言語・アクション(VLA)基盤モデルです。

QwenLM/Qwen-Drive-1.0

3D知覚、視覚質問応答、モーションプランニングを統合フレームワークに組み込んだ、自動運転用の視覚言語基盤モデル。

FoloToy/ai-passport

AI搭載ウェアラブルアプリケーションの構築のための安定したAPIとリファレンス実装を提供する、オープンソースのウェアラブルAIハードウェア開発基盤。

espressif/esp-claw

ESP32シリーズのIoTデバイス向けのAIエージェントフレームワーク。ユーザーがチャットを通じてデバイスの振る舞いを定義し、エッジ上で意思決定をローカルで実行できるようにします。