UniversalRobots/Universal_Robots_ROS2_Driver

Universal Robots製機械臂用のROS2ドライバー。ハードウェア通信、MoveIt2による運動計画、およびROS2の動作を産業用協働ロボットに統合することを可能にします。

RobotWebTools/roslibjs

WebアプリケーションがROS (Robot Operating System) システムと通信し、ロボットインターフェースを構築できるようにするためのJavaScriptクライアントライブラリのコレクション。

UniversalRobots/Universal_Robots_ROS_Driver

Universal Robots CB3 および e-Series マニピュレータ用の ROS ドライバ。リアルタイム制御、キャリブレーション、および ROS-control との統合のための安定したインターフェースを提供します。

hungpham2511/toppra

ロボットの幾何学的経路に沿って、運動学的および動的な制約を守りつつ、可能な限り速く移動するための時間最適経路パラメータ化を計算するライブラリ。

Phylliade/ikpy

URDFおよびMuJoCo MJCFのインポートをサポートし、加速されたJAXバックエンドを備えた純粋なPythonによるロボットの逆運動学計算ライブラリ。

neka-nat/cupoch

ロボット工学における高速3Dデータ処理のためのGPU加速ライブラリ。高パフォーマンスな点群アルゴリズム、衝突回避、経路計画を提供。

RoboVerseOrg/RoboVerse

複数のシミュレーションフレームワークとデータセットを単一のインターフェースに統合する、スケーラブルなロボット学習のための統一プラットフォームおよびベンチマーク。

TIGER-AI-Lab/Pixel-Reasoner

Pixel Reasonerは、視覚言語モデルに視覚操作(ズームイン、フレーム選択など)を追加する研究フレームワークであり、インストラクションチューニングと好奇心駆動型強化学習により訓練される。リポジトリにはインストールガイド、SFTおよびRLのスクリプト、事前訓練済み7Bチェックポイント、データセット、画像および動画ベンチマーク用の評価パイプラインが含まれる。

jabberjabberjabber/ImageIndexer

画像のキャプションとキーワードを自動生成し、インデックス作成や検索を容易にするために画像メタデータへ直接書き込むローカルAIツール。

yuanze-lin/Olympus

コンピュータビジョン向けのユニバーサルタスクルーターで、単一の自然言語指示を、画像、動画、3Dモデルの生成に必要な専門モデルの連続呼び出しに変換します。

facebookresearch/mmf

MMFは、視覚と言語のマルチモーダル研究のためのモジュール式PyTorchベースのフレームワークであり、最先端モデルのリファレンス実装と分散トレーニング用のツールを提供します。

om-ai-lab/VLM-FO1

VLM-FO1は、汎用的な推論能力を損なうことなく、細粒度な知覚と空間認識を強化するVision-Language Model用のプラグアンドプレイ・モジュールです。

OpenEnvision/Awesome-Multimodal-Modeling

Awesome‑Multimodal‑Modeling は、マルチモーダルAIモデルを調査するコミュニティキュレート「awesome-list」です。4つの明確なファミリー(Traditional、MLLMs、Unified、Native)を定義し、アーキテクチャの違いを説明し、Hugging Face 上のオープンソースモデルコレクションへのリンクを提供します。急速に進化するマルチモーダル分野の構造的視点を必要とする研究者やエンジニア向けのリポジトリです。

OpenBMB/UltraEval-Audio

音声理解と生成の両方を34のベンチマークでサポートする、大規模音声基盤モデルの評価に向けた統一されたオープンソースフレームワーク。

Sharrnah/whispering-ui

Whispering TigerアプリケーションのネイティブWindows UI。オーディオストリームやゲーム内画像のリアルタイム文字起こしと翻訳を可能にします。

daanzu/kaldi-active-grammar

Kaldi‑Active‑Grammarは、Kaldi音声認識エンジンのPythonラッパーで、多数の小さな文法をコンパイルし、発話ごとに必要なものだけを有効化できる。主要OS向けのバイナリwheelを同梱、事前学習済み英語モデルを提供、DragonflyおよびCaster音声制御フレームワークのバックエンドを備える。pipでインストール、モデルをダウンロード、ルールを定義し、文脈に応じたコマンド制御を動的に有効化できる。

cubist38/mlx-openai-server

Apple Silicon上でMLXモデルをローカルで実行するためのOpenAI互換APIサーバー。テキスト、マルチモーダル、画像、音声モデルをサポート。

filippogiruzzi/voice_activity_detection

1D-ResNetとMFCC特徴量を使用して、音声信号を音声またはノイズとして分類する、ディープラーニングベースの音声活動検出(VAD)システム。

dictation-toolbox/dragonfly

Python 用の音声認識フレームワークで、ユーザーがカスタム音声コマンドを作成し、コンピュータ操作の自動化や音声によるプログラミングを実現できます。

algolia/voice-overlay-ios

Apple のネイティブ `SFSpeechRecognizer` を使用して、権限管理と音声認識を行う、洗練された音声文字起こしオーバーレイ UI を提供する iOS ライブラリです。

judahpaul16/gpt-home

Raspberry Pi で動作する自己ホスト型 AI ホームアシスタント。LiteLLM と LangGraph を使用して LLM をホームオートメーションおよび個人の生産性ツールと統合。

sveinbjornt/hear

macOS用のコマンドラインインターフェースで、システム内蔵の音声認識機能を使用してライブマイク入力とオーディオファイルの音声認識を可能にします。

Picovoice/rhino

Rhinoは、Picovoiceが提供するデバイス上での音声から意図を抽出するエンジンです。話されたコマンドをリアルタイムで構造化された意図(intent)とスロット(slot)に変換します。マイクロコントローラからスマートフォン、ブラウザ、デスクトップまで、あらゆるデバイス上でローカルに動作し、多言語をサポートし、Python, .NET, Java, Flutter, React Native, Android, iOS, Web, Node.js, CのSDKsを提供しています。

openspeech-team/openspeech

エンドツーエンド自動音声認識(ASR)システムを構築するためのフレームワークで、20以上のASRモデルの参照実装と複数言語用のレシピを提供しています。

yeyupiaoling/MASR

複数のモデルアーキテクチャと言語に対応するストリーミングおよび非ストリーミング推論をサポートする、PyTorchベースの自動音声認識フレームワークです。

mybigday/whisper.rn

デバイス内Whisper(およびNVIDIA Parakeet)音声認識のReact Nativeバインディング。GPU/Core ML加速、音声活動検出(VAD)、リアルタイムストリーミングをサポート。

TheStageAI/TheWhisper

NVIDIA GPUおよびApple Silicon上で、低レイテンシのストリーミングとデバイス内推論に最適化された、ファインチューニングされたWhisperモデルに基づく高パフォーマンスな音声認識ソリューション。

TensorSpeech/TensorFlowASR

ext{TensorFlow ベースの自動音声認識 (ASR) フレームワーク。様々な ASR アーキテクチャを実装し、効率的なデプロイのために TFLite 変換をサポートしています。}

ardha27/AI-Waifu-Vtuber

音声認識、LLM、およびテキスト読み上げを統合し、ライブ配信や個人利用向けにインタラクティブなバーチャルキャラクターを作成するAI搭載VTuberアシスタント。

sooftware/conformer

CNNとTransformerを組み合わせ、局所的および大域的な音声依存関係を捉えることで音声認識を向上させるConformerアーキテクチャのPyTorch実装。

modal-labs/quillman

Moshi 音声対音声モデルを活用し、低遅延かつ双方向のオーディオストリーミングを提供することで、人間のようなインタラクションを実現する音声チャットアプリケーションです。

tensorflow/lingvo

シーケンス対シーケンスモデルや巨大言語モデルに特に特化した、モジュール式でスケーラブルなTensorFlowフレームワーク。

HeyWillow/willow

Willowは、音声文字変換(STT)、音声合成(TTS)、LLM処理を含む高速な言語タスクのための、セルフホスト可能な推論サーバーです。

flashlight/wav2letter

wav2letter++ は、最先端の音声からテキストへのアーキテクチャを実装するためのレシピと学習済みモデルを提供する、エンドツーエンドの自動音声認識フレームワークです。

Uberi/speech_recognition

OpenAI Whisper、Google Speech、Voskなどの複数のオンラインおよびオフラインエンジンをサポートする、音声認識のための統一インターフェースを提供するPythonライブラリ。

elevenlabs/elevenlabs-js

ElevenLabs の公式 Node.js SDK で、リアルな AI 音声合成、リアルタイム音声ストリーミング、音声駆動 AI エージェントをアプリケーションに統合できます。

wildminder/ComfyUI-VoxCPM

VoxCPM(トークナイザー不要のTTSシステム)のComfyUIカスタムノード統合。表現力豊かな音声生成、自然言語による音声設計、高度なボイスクローニングを可能にします。

codeforequity-at/botium-speech-processing

オープンソースおよびクラウドベースの音声文字起こし (STT) とテキスト読み上げ (TTS) サービスのための統合 API。チャットボットや音声アプリケーションのオーディオ処理を簡素化します。

tongjingqi/Thinking-with-Video

ビデオ生成モデルが複雑な視覚的・テキスト的推論タスクを解決する能力を評価する、新しいマルチモーダル推論パラダイムおよびベンチマーク(VideoThinkBench)。

AceDataCloud/Nexior

NexiorはMITライセンスのVueベースのアプリで、40以上のチャット、画像、音声、動画AIモデルを1つの自己ホスティング可能なUIに集約しています。1クリックVercelまたはDockerデプロイ、BYOKまたは1つのAceDataキー、組み込みのユーザー認証、支払い、紹介メカニズムを備えており、AI製品用の即戦力SaaSスタートアップとして利用可能です。

EvolvingLMMs-Lab/lmms-engine

マルチモーダルモデルのスケーラブルな事前学習と微調整を可能にする、統合的で高性能な学習エンジン。分散学習、カーネル融合、高度な最適化を統合しています。

awekrx/ChatGPT-MidJourney-prompt

簡単なテキストのヒントから、MidJourney画像用の詳細でクリエイティブなプロンプトを自動生成するPythonライブラリ。

HorizonWind2004/reconstruction-alignment

統一マルチモーダルモデルのための自己教師あり事後学習手法。モデルが自身の視覚的特徴から画像を再構成するように学習させることで、画像を生成・編集する能力を向上させます。

shiimizu/ComfyUI_smZNodes

AUTOMATIC1111のプロンプト解析と埋め込みを再現するカスタムComfyUIノード(CLIP Text Encode++ と Settings)で、Stable Diffusion WebUIとComfyUI間で同一の画像生成を可能にします。

biagiomaf/smart-comfyui-gallery

ComfyUI と AI 生産ライブラリ用に設計されたオープンソースのデジタルアセットマネージャーおよびギャラリー。生成物の整理、検索、リミックスを可能にします。

Windsander/ADI-Stable-Diffusion

ONNXRuntime を使用して、複数のプラットフォームで Python に依存しない高パフォーマンスな Stable Diffusion モデル推論を実現する C++ ライブラリおよび CLI ツール。

Licoy/GoAmzAI

個人および企業向けの、テキスト、画像、動画、音楽、PPT生成を統合管理システムに統合した、プライベートなマルチモーダルAIGCプラットフォームです。

mrhan1993/Fooocus-API

Fooocus向けに構築されたFastAPIベースのREST APIで、手動でのパラメータ調整なしに高品質な画像をプログラムで生成できます。