livekit/agents
視覚、聴覚、理解が可能なリアルタイムでマルチモーダルな音声エージェントを構築するためのフレームワークで、ジョブスケジューリングの統合と柔軟なモデル統合を備えています。
Pinvou/pinvou-agent
Pinvou Agentは、LLMを使用して作業、デザイン、コーディングのための編集可能な成果物を作成するクロスプラットフォームのデスクトップAIアシスタントです。
zcbacxc/movie-narrator
1つのプロンプトから、AI駆動の脚本、ナレーション、字幕、レンダリング済み動画を自動生成するオープンソースのツールキット。
mengxi-ream/read-frog
Read Frogは、LLMとAI TTSを活用してWebコンテンツを翻訳・解説・フラッシュカードに変換するオープンソースのブラウザ拡張機能。二か国語表示、文脈に応じた翻訳、字幕翻訳、カスタムAIアクション、20以上のAIプロバイダーに対応しています。
sbroenne/mcp-server-excel
ExcelMcpはWindows専用のサーバーおよびCLIで、LLMエージェントがCOM APIを通じて実際のMicrosoft Excelインスタンスを制御できるようにし、Power Query、ピボットテーブル、VBA、Pythonなど326の操作をリアルタイムのスプレッドシート自動化に提供します。
chengyi-ai/native-subtitle-quote-image
AIエージェントが、オリジナルの焼き込み字幕またはカスタムスクリプトベースのオーバーレイを使用して、動画フレームをプロフェッショナルな3:4ソーシャルメディア引用画像に変換するためのツール。
mattt/iMCP
iMCP は macOS アプリ(`imcp‑server` CLI を同梱)で、Model Context Protocol を実装し、カレンダー、連絡先、位置情報、マップ、メッセージ、リマインダー、天気を Claude Desktop、Claude Code、Cursor、Amp などの AI クライアント向けの JSON‑LD ツールとして公開します。ユーザーは macOS の権限ダイアログを通じてサービスを有効にし、AI クライアントを接続することで、自然言語の質問をすると AI がローカルで実際の個人データを取得して応答します。プロジェクトには、Swift SDK 統合、iMessage データベースを読み取るためのカスタム Swift パッケージ、デバッグツール(MCP Inspector、Companion)が含まれています。
open-pencil/open-pencil
ネイティブで .fig ファイルを読み取り、AI駆動のデザイン自動化とカスタムエディタ開発のためのプログラマブルツールキットを提供するオープンソースのデザインエディタ。
Forget-C/Jellyfish
脚本の分解からアセットの一貫性管理、動画生成に至るまで、ショートドラマの全パイプラインを管理するエンドツーエンドのAI制作ワークスペース。
tigerowo/infinite-canvas
画像、動画、音声生成をノードベースの無限キャンバスに統合したオープンソースのマルチモーダルAIワークベンチ。反復的なビジュアル制作を可能にします。
gastownhall/gastown
Gas Townは、複数のGitプロジェクト上でClaude、Copilot、Codex、Geminiなど、多数のAIコーディングエージェントを実行できるオープンソースのGoベースのワークスペースマネージャーであり、すべてのステップをGitバックエンドのレジャーデータに永続化します。中央のAIコーディネーター(*Mayor*)が*convoys*(作業アイテムの集まり)を作成し、ワーカーエージェント(*Polecats*)に割り当て、*Witness*、*Deacon*、*Dogs*といった監視サービスがシステムの健全性を保ちます。完了した作業はBorsスタイルのキュー(*Refinery*)でマージされ、オプションのフェデレーションレイヤー(*Wasteland*)により、異なるインストール間で作業を共有できます。Homebrew、`go install`、またはDockerでインストールでき、`gt` CLIを使って rigs、crews、convoysの作成や進捗の監視が可能です。
tandpfun/wardrobe
AIを活用したツールで、写真から個々の衣類を抽出し、デジタルワードローブを作成し、衣類のモデル化された編集風プレビューを生成します。
HRuiCcc/RuiC-card-skill
Web向けに、奥行きと視点シフトする輝きを備えたインタラクティブな3Dホログラフィックカードを、テキストプロンプトや画像から変換する自動化パイプライン。
mnemosyne-oss/mnemosyne
Mnemosyne は、ローカルファーストでSQLiteをバックエンドに持つAIエージェント向けのメモリレイヤーです。3段階のアーキテクチャ(作業メモリ、エピソードメモリ、時間的知識グラフ)により、セッション間で持続的なメモリを提供し、意味的/キーワードハイブリッド検索、高度なベクトル圧縮、Python SDK、CLI、組み込みMCPサーバーを備えています。プライバシーに重点を置き、テレメトリなし、デフォルトでローカル、クライアント側暗号化同期をオプションで提供しています。
homeassistant-ai/ha-mcp
ha‑mcp は、Claude、ChatGPT、Gemini などの大規模言語モデルアシスタントが Home Assistant インスタンスを完全に読み取り、制御、設定できる非公式の Home Assistant Model Context Protocol サーバーです。HA‑MCP カスタムコンポーネント(HACS)または Home Assistant アドオン/Docker/PyPI サーバーとしてインストールし、シークレットWebhook URLを取得してAIクライアントに接続します。87のツール(デバイス制御、自動化/スクリプト作成、ダッシュボード編集、バックアップ、ログ、セキュリティポリシーなど)を提供し、スマートホーム全体の自然言語による管理を実現します。
linyqh/NarratoAI
映画やテレビの解説動画のために、スクリプト作成、ビデオ編集、ナレーション、字幕を一つのワークフローで処理する、自動化されたAI搭載ツール。
jjyaoao/HelloAgents
HelloAgentsは、マルチエージェントAIアプリケーションを構築するためのプロダクション対応フレームワークを提供するPythonライブラリです。OpenAI互換、Anthropic、Gemini LLMをラップし、ファイルI/O、タスク委任、TODO追跡などのビルトインツールを提供。コンテキスト管理、セッション永続化、サーキットブレーカー、オプティミスティックロック、観測性、SSEストリーミング、非同期ライフサイクルなどのエンジニアリング機能も備えています。`pip install hello-agents`でインストールし、`.env`ファイルにAPI認証情報を設定して、登録済みツールセットで`ReActAgent`などのエージェントを起動できます。
OpenMOSS/MOSS-VL
リアルタイムおよびオフラインの動画理解のためのオープンウェイト11Bパラメータモデルシリーズ。中断可能なストリーミング対話をサポートするクロスアテンションアーキテクチャを特徴とします。
lipku/LiveTalking
LLM と TTS で駆動される、リアルな仮想アバターのための音声と映像を同期させるリアルタイムインタラクティブストリーミングエンジン。
jianchang512/pyvideotrans
音声認識、字幕翻訳、AI ダブリングを自動化し、音声クローンとマルチロール合成をサポートするオープンソースの動画翻訳ツール。
xushengfeng/eSearch
スクリーンショット、オフラインOCR、翻訳、および画像検索を統合し、画面上の情報を抽出して活用するためのクロスプラットフォーム・スクリーン検索ツール。
thesysdev/appless
従来のアプリを置き換える、ユーザーの要求に基づいてリアルタイムで生成されるライブストリーミングネイティブモバイルインターフェースを持つ実験的生成型UIオペレーティングシステム。
tisfeng/Easydict
Easydictは、単語の素早い検索、翻訳、OCRのためのネイティブmacOSアプリです。言語を自動検出し、ショートカット駆動の複数の入力モードを提供し、20以上のサービス(従来の辞書、クラウド翻訳、OpenAI、Gemini、Claude、OllamaなどのLLMを含む)から結果を集約します。Homebrew(`brew install --cask easydict`)または手動ダウンロードでインストールできます。オープンソース(GPL-3.0)であり、コミュニティからの貢献を歓迎しています。
wiltodelta/remove-ai-watermarks
AI生成画像や動画から可視ラベル、不可視ピクセル透かし、AI出所メタデータを除去するライブラリおよびCLIツール。
vibe-motion/skills
vibe-motion/skills は、AIエージェント(例:Claude Code)が、定規型プログレスバー、フィッシュアイ動画効果、ブランドローンチ動画、3D地球ルート、レコードプレイヤーのアニメーションなど、多様なアニメーション視覚資産を生成できるプラグインライブラリです。専用のレンダリングプロジェクトをクローンして実行することで実現します。`npx skills add vibe-motion/skills` でインストールし、スキルを選択、パラメータを入力すると、GIF/MP4/HTML形式の出力が得られます。
umlx5h/LLPlayer
LLPlayer は Windows 専用の C# メディアプレーヤーで、AI ベースの字幕生成(Whisper ASR)、リアルタイム翻訳(クラウドまたはローカル LLM で)、ビットマップ字幕用 OCR、二重字幕表示、単語照会、オンライン動画対応を備えています。言語学習者をターゲットとしており、GPL-3.0 のオープンソースです。
tsunehimatoi/psd2live
レイヤー付きPSDファイルを完全にリグgedされたLive2Dモデルに変換する自動化パイプラインとデスクトップアプリ。適応的メッシュ生成、自動デフォーマー設定、AIエージェント統合を備える。
MiaAI-Lab/Qwen3.8-Flash-Next-Single-DGX-Spark
vLLM を使用し、メモリマッピングされた PLE テーブルと予測デコードを備えた、単一の DGX Spark で Qwen3.8-Flash-Next 視覚言語モデルを配信するデプロイレシピ。
Pan-Chera/Multi-Agent-CAD
自然言語から編集可能なCAD部品とマルチパートアセンブリを生成するマルチエージェントフレームワーク。自動コード修復とシミュレーション対応のエクスポート機能を備えています。
ddcat-ai/open-ai-canvas
Open‑AI‑Canvas(影策)は、オープンソースで自己ホスティング可能なウェブワークベンチで、クリエイターがテキストの概要からストーリーボード、キャラクター/スタイルライブラリ、AI生成画像・動画・音声といった完全な映画的資産を、統合されたキャンバス、非同期タスクキュー、ローカルAIエージェントシステムを通じて生成できる。
nolangz/pixel2motion
ラスタロゴをクリーンでアニメーション化された SVG ロゴに変換するための、精密なフィッティングと HTML ベースのモーション配信に焦点を当てた AI 支援ワークフローとツールセット。
funstory-ai/BabelDOC
BabelDOC は、LLM(OpenAI互換モデル)を使用してPDF科学論文を翻訳し、二言語PDFを出力するオープンソースのPythonツールです。CLI、Python API、豊富なPDF処理オプション、用語集サポート、オフラインアセットパッケージ、ローカルまたはホストされたベータサービスでの実行が可能です。
OSideMedia/higgsfield-ai-prompt-skill
Higgsfield AI 用の包括的なプロンプト工学ライブラリで、自然言語をプロダクション対応の映画的動画および画像プロンプトに変換します。
OpenDCAI/GameFactory-3A
UE5、Unity、Godot、Blender、three.js向けの生産準備完了のアセットとエンジン固有コードを、コードエージェントを使ってゲーム要件から変換するオープンソースフレームワークです。
666ghj/BettaFish
BettaFish(微舆)は、オープンソースでPythonベースのマルチエージェントプラットフォームであり、数十のソーシャルメディアソースから公共意見を自動クロール・分析・レポートします。ユーザーはチャット形式のUIで質問を入力;3つの専門エージェント(Query、Media、Insight)がデータを収集し、LLMモデレーターのもとで議論するフォーラムエンジンが協調し、レポートエンジンがインタラクティブなHTML(またはPDF/Markdown)レポートを生成します。システムには24時間365日稼働のクローラー(MindSpider)、マルチモーダル動画/画像処理、ファインチューニング済み感情モデル、プライベートデータ統合機能を備え、Docker Compose、Flaskフロントエンド、Streamlitデモを同梱し、他のドメインにも拡張可能です。
ZSeven-W/openpencil
自然言語プロンプトからUIレイアウトを生成し、プロダクションコードとして書き出す、オープンソースのAIネイティブ・ベクターデザインツールです。
xinnan-tech/xiaozhi-esp32-server
xiaozhi-esp32 プロジェクトのためのバックエンドサーバーで、ESP32 デバイスを音声、ビジョン、スマートホーム制御機能を備えた AI アシスタントに変えることができます。
OpenBMB/ChatDev
ChatDev 2.0(DevAll)は、視覚的なWebコンソールまたは小さなPython SDKで、YAMLでエージェントとその接続を定義し、複数のLLMエージェントワークフローを設計・実行できるオープンソースでコードゼロのプラットフォームです。データ可視化、3D生成、ゲーム開発、研究など、組み込みテンプレートを活用。バックエンドはFastAPI、フロントエンドはVue 3、Docker/Makefileサポート、拡張可能なPythonツール、研究用オーケストレータ(Puppeteer、MacNet)を備えています。
HKUDS/RAG-Anything
RAG‑Anythingは、マルチモーダルな検索拡張生成システムを構築するPythonライブラリです。MinerUを使用してPDF、Officeファイル、画像、表、数式を解析し、クロスモーダル知識グラフを作成。ハイブリッドベクトル-グラフ検索で関連する情報を取得し、LLMに渡して回答を生成します。`pip install raganything`でインストールし、`RAGAnythingConfig`で設定。ドキュメントをインジェストし、自然言語でクエリを実行できます。
modelcontextprotocol/python-sdk
Model Context Protocol (LLM とツール間の通信のための標準化された API) に従い、サーバーを構築・利用するための Python SDK です。関数を LLM が利用可能なツール/リソースとして公開するためのデコレータを提供し、stdio/HTTP/SSE 転送方式をサポートし、CLI を含み、py.sdk.modelcontextprotocol.io にドキュメントがあります。
ant-research/4DAnyone
4DAnyoneは、人物の単一カメラ映像を、数十の同期的かつ視点一貫性のある動画(6〜24〜48視点)に変換する研究用ニューラルモデルで、下流の4Dガウススプラッティング再構成に使用できます。コンシューマーグラフィックスカード(最大24GB VRAM)で動作し、高速なディスティル版Turboモデル(5.6倍高速化)を提供。推論スクリプトとnerfstudio統合も用意されています。
antirez/h3.c
Apple Silicon上のMiniMax-H3向けにネイティブMetal推論エンジンを開発。高度なメモリとパフォーマンスの最適化により、ローカルでのテキストから動画・音声への生成を可能にします。
snapotter-hq/SnapOtter
プライバシーを守るため、ローカルAIを活用して画像、動画、音声、PDFの変換、圧縮、処理を行う200以上のツールを提供するセルフホスト型ファイル処理スイート。
leejet/stable-diffusion.cpp
画像および動画拡散モデルをローカルで実行するための軽量な純粋な C/C++ 実装。幅広いハードウェアバックエンドとモデルアーキテクチャをサポートします。
WEIFENG2333/VideoCaptioner
LLMを活用して音声認識、字幕最適化、翻訳を行う、動画字幕処理のワンストップツール。
OpenSenseNova/SenseNova-Skills
SenseNova‑Skillsは、画像生成、インフォグラフィック作成、Excel分析、ディープリサーチ、PowerPoint生成といったオフィス自動化機能をSenseNova LLMに追加するオープンソースのAgent‑Skillsコレクションです。OpenClawまたはhermes‑agentランタイムにスキルフォルダを配置し、SenseNova APIを設定すれば、シンプルな自然言語リクエストから洗練されたデータ駆動型レポートやデッキを生成できます。
MoonshotAI/Kimi-K3
Kimi K3は、長期的なコーディング、ディープリサーチ、および複雑なエージェント的ナレッジワーク向けに設計された、2.8Tパラメータのオープンウェイト・ネイティブマルチモーダルMoEモデルです。
modelscope/DiffSynth-Studio
コンシューマー向けGPU上で画像、動画、音声の生成モデルの高パフォーマンスな推論とトレーニングを可能にするオープンソースの拡散モデルエンジン。