robertknight/rten
Rust で書かれた機械学習ランタイムで、PyTorch などの Python フレームワークで訓練された ONNX モデルを Rust および WebAssembly 環境で実行できます。
Unity-Technologies/sentis-samples
Sentis パッケージを使用して、Unity で LLM、コンピュータ ビジョン、シミュレーションなどの AI 機能を実現する方法を示す、サンプル プロジェクトとテンプレートのコレクションです。
InfiniTensor/InfiniTensor
GPU および AI アクセラレータ向けの高性能インファレンスエンジン。効率的なモデル展開と学術的な検証を可能にします。
RizwanMunawar/yolov7-object-tracking
さまざまなソースからのビデオストリーム全体で、リアルタイムの物体検出とトラッキングを行うために YOLOv7 と YOLOv8 を統合したコンピュータビジョンプロジェクト。
bentoml/BentoDiffusion
BentoML フレームワークを使用して、さまざまな Stable Diffusion ファミリーモデルをセルフホストおよびデプロイするためのサンプルプロジェクトのコレクションです。
xArm-Developer/xarm_ros
xArmシリーズのロボットアーム向けROSベースの開発・シミュレーションフレームワーク。ハードウェアインターフェース、MoveItモーションプランニング、およびGazeboシミュレーションを提供します。
lucidrains/q-transformer
Q‑Transformerは、ビデオ観測と言語指示を組み合わせたロボットタスク向けにスケーラブルなオフライン強化学習を実現するPyTorchライブラリです。ビジョン・トランスフォーマーモデル、データ収集エージェント、リプレイメモリデータセット、Q学習トレーナーを備え、`pip install q-transformer` で簡単にインストール可能です。
LongxingTan/Time-series-prediction
TFTSは、時系列予測、分類、異常検出の最先端ディープラーニングモデルを統一インターフェースで実装できるTensorFlowベースのライブラリです。
BobMcDear/attorch
カスタムディープラーニング演算を開発するために、読みやすく、カスタマイズが容易なニューラルネットワーク層のコレクションを提供する、PyTorchのnnモジュールのTritonベースのサブセット。
relari-ai/continuous-eval
continuous-eval は、LLM駆動パイプラインのモジュール化・データ駆動型評価を可能にする Python ライブラリです。検索、生成、コード、エージェント用のメトリクスカタログを提供し、個々のパイプラインモジュールにメトリクスをアタッチし、データセット上で実行可能で、リグレッションテストの強制も可能です。カスタム LLM-as-a-judge メトリクスもサポートしています。
hgneng/ekho
Ekhoは、書かれたテキストを音声に変換する中国語テキスト読み上げエンジンであり、ユーザーがカスタムボイスデータを統合できることをサポートしています。
jasonppy/VoiceCraft
数秒の参照音声のみを使用して、高品質なゼロショットテキストから音声への変換および音声編集を実現するトークン補完ニューラルコーデック言語モデル。
realsee-developer/RealSee3D
3D再構成およびセマンティックセグメンテーションのAIモデル学習用に設計された、10,000の屋内シーンを含む大規模なマルチビューRGB-Dデータセット。
Open-X-Humanoid/HEX
人型ロボットにおける異体間スキル転送と長時間操作を可能にする、全身の視覚-言語-行動フレームワーク。
stack-of-tasks/tsid
ヒューマノイドや四足歩行ロボットなどの剛体多体系ロボットの、最適化ベースの逆動力学制御のための C++ ライブラリです。
ihmcrobotics/ihmc-open-robotics-software
ヒューマノイドロボットの制御とシミュレーションのための包括的なソフトウェアスタックであり、動力学、知覚、およびリアルタイム通信のためのツールを提供します。
graspnet/graspnetAPI
GraspNet-1Billion データセット用の Python API。ロボットの把持研究のための把持ラベルと点群データをロード、処理、検証するためのツールを提供します。
google-research/language-table
オープンボキャブラリーの視覚言語運動学習のための、人間が収集したデータセット群とベンチマーク。ロボットが多種多様な自然言語の指示を実行できるようにします。
ClemensElflein/xESC
ロボット工学向けに特別設計された、FOCおよび複数の制御モードをサポートする、ブラシレスDCモーター用のオープンソース・低コスト電子速度コントローラー(ESC)。
Tobias-Fischer/rt_gene
PyTorch と ROS 2 を使用したリアルタイムの目線と瞬き推定システム。自然環境における視線方向と瞬き確率の追跡を実現。
PX4/PX4-SITL_gazebo-classic
PX4オートパイロット用のSITLおよびHITLシミュレーションを提供するGazeboプラグインを使用した、ローバー、ボート、航空機用の飛行シミュレータ。
napframework/nap
ハードウェア、センサー、およびメディアと相互作用するレスポンシブなアプリケーションを作成するための、低オーバーヘッドでリアルタイムな制御および可視化プラットフォーム。
RoboStack/ros-noetic
Condaパッケージマネージャーを使用して、Linux、macOS、Windowsで簡単にインストールおよび依存関係管理が可能な、ROS Noeticのクロスプラットフォーム配布版です。
Le0nX/ModernRoboticsCpp
『Modern Robotics: Mechanics, Planning, and Control』教科書に付随するC++ライブラリで、ロボティクスの力学、計画、制御アルゴリズムの教育用実装を提供します。
Simple-Robotics/proxsuite
ロボット工学や最適化タスクに向けた高パフォーマンスを実現する、数値的に堅牢で効率的な線形および二次計画問題用数値ソルバーのコレクション。
openrr/urdf-viz
URDFおよびXacroロボット記述ファイルを可視化し、JSON APIを介したインタラクティブな関節操作とリモート制御を可能にするRustベースのビジュアライザ。
robotology/yarp
YARPは、ロボット用の通信ライブラリおよびツールキットであり、ソフトウェアコンポーネント間の標準化されたデバイスインターフェースとメッセージングを提供します。
makeecat/Peng
Rustで書かれた最小限のマルチローター自律フレームワーク。リアルタイムの動力学シミュレーション、経路計画、制御を提供します。
Stable-Baselines-Team/stable-baselines3-contrib
Stable-Baselines3 用の貢献パッケージで、研究者や開発者のための実験的強化学習アルゴリズムとニッチなツールを提供します。
gkjohnson/urdf-loaders
UnityおよびTHREE.js向けのURDF読み込みライブラリのコレクション。開発者が3D環境でロボットモデルをインポートおよび可視化できるようにします。
UniversalRobots/Universal_Robots_ROS2_Driver
Universal Robots製機械臂用のROS2ドライバー。ハードウェア通信、MoveIt2による運動計画、およびROS2の動作を産業用協働ロボットに統合することを可能にします。
RobotWebTools/roslibjs
WebアプリケーションがROS (Robot Operating System) システムと通信し、ロボットインターフェースを構築できるようにするためのJavaScriptクライアントライブラリのコレクション。
UniversalRobots/Universal_Robots_ROS_Driver
Universal Robots CB3 および e-Series マニピュレータ用の ROS ドライバ。リアルタイム制御、キャリブレーション、および ROS-control との統合のための安定したインターフェースを提供します。
hungpham2511/toppra
ロボットの幾何学的経路に沿って、運動学的および動的な制約を守りつつ、可能な限り速く移動するための時間最適経路パラメータ化を計算するライブラリ。
Phylliade/ikpy
URDFおよびMuJoCo MJCFのインポートをサポートし、加速されたJAXバックエンドを備えた純粋なPythonによるロボットの逆運動学計算ライブラリ。
neka-nat/cupoch
ロボット工学における高速3Dデータ処理のためのGPU加速ライブラリ。高パフォーマンスな点群アルゴリズム、衝突回避、経路計画を提供。
RoboVerseOrg/RoboVerse
複数のシミュレーションフレームワークとデータセットを単一のインターフェースに統合する、スケーラブルなロボット学習のための統一プラットフォームおよびベンチマーク。
TIGER-AI-Lab/Pixel-Reasoner
Pixel Reasonerは、視覚言語モデルに視覚操作(ズームイン、フレーム選択など)を追加する研究フレームワークであり、インストラクションチューニングと好奇心駆動型強化学習により訓練される。リポジトリにはインストールガイド、SFTおよびRLのスクリプト、事前訓練済み7Bチェックポイント、データセット、画像および動画ベンチマーク用の評価パイプラインが含まれる。
jabberjabberjabber/ImageIndexer
画像のキャプションとキーワードを自動生成し、インデックス作成や検索を容易にするために画像メタデータへ直接書き込むローカルAIツール。
yuanze-lin/Olympus
コンピュータビジョン向けのユニバーサルタスクルーターで、単一の自然言語指示を、画像、動画、3Dモデルの生成に必要な専門モデルの連続呼び出しに変換します。
facebookresearch/mmf
MMFは、視覚と言語のマルチモーダル研究のためのモジュール式PyTorchベースのフレームワークであり、最先端モデルのリファレンス実装と分散トレーニング用のツールを提供します。
om-ai-lab/VLM-FO1
VLM-FO1は、汎用的な推論能力を損なうことなく、細粒度な知覚と空間認識を強化するVision-Language Model用のプラグアンドプレイ・モジュールです。
OpenEnvision/Awesome-Multimodal-Modeling
Awesome‑Multimodal‑Modeling は、マルチモーダルAIモデルを調査するコミュニティキュレート「awesome-list」です。4つの明確なファミリー(Traditional、MLLMs、Unified、Native)を定義し、アーキテクチャの違いを説明し、Hugging Face 上のオープンソースモデルコレクションへのリンクを提供します。急速に進化するマルチモーダル分野の構造的視点を必要とする研究者やエンジニア向けのリポジトリです。
OpenBMB/UltraEval-Audio
音声理解と生成の両方を34のベンチマークでサポートする、大規模音声基盤モデルの評価に向けた統一されたオープンソースフレームワーク。
Sharrnah/whispering-ui
Whispering TigerアプリケーションのネイティブWindows UI。オーディオストリームやゲーム内画像のリアルタイム文字起こしと翻訳を可能にします。
daanzu/kaldi-active-grammar
Kaldi‑Active‑Grammarは、Kaldi音声認識エンジンのPythonラッパーで、多数の小さな文法をコンパイルし、発話ごとに必要なものだけを有効化できる。主要OS向けのバイナリwheelを同梱、事前学習済み英語モデルを提供、DragonflyおよびCaster音声制御フレームワークのバックエンドを備える。pipでインストール、モデルをダウンロード、ルールを定義し、文脈に応じたコマンド制御を動的に有効化できる。
cubist38/mlx-openai-server
Apple Silicon上でMLXモデルをローカルで実行するためのOpenAI互換APIサーバー。テキスト、マルチモーダル、画像、音声モデルをサポート。
filippogiruzzi/voice_activity_detection
1D-ResNetとMFCC特徴量を使用して、音声信号を音声またはノイズとして分類する、ディープラーニングベースの音声活動検出(VAD)システム。