MoonshotAI/Kimi-K3

Kimi K3は、長期的なコーディング、ディープリサーチ、および複雑なエージェント的ナレッジワーク向けに設計された、2.8Tパラメータのオープンウェイト・ネイティブマルチモーダルMoEモデルです。

modelscope/DiffSynth-Studio

コンシューマー向けGPU上で画像、動画、音声の生成モデルの高パフォーマンスな推論とトレーニングを可能にするオープンソースの拡散モデルエンジン。

solidSpoon/DashPlayer

英語学習者向けのAI強化ビデオプレーヤーで、ローカルAI字幕生成、文の分解、語彙ツールを提供し、没入型の言語習得を促進します。

flyteorg/flyte

Flyte 2は、MLパイプラインとAIエージェントを定義、オーケストレーション、およびサービングするためのオープンソースのPythonフレームワークです。通常のPython関数をタスクとして記述し、ワークフローに構成し、ローカルまたは将来のKubernetesネイティブ・バックエンドで実行することができます。このプロジェクトには、CLI、開発者向けのTUI、およびFastAPIによるモデルサービングの第一級のサポートが含まれています。

Jamailar/Beav

Beav(旧称 RedBox)は、セルフメディアクリエイター向けのクロスプラットフォーム対応デスクトップAIワークステーションです。WebやSNS素材の収集、ローカルナレッジベースへの保存、AIによるテキスト・画像・動画の生成、ナレーション編集、アニメーション追加、投稿スケジュール管理までを単一のUIで完結できます。Chrome/Edge用スクレイパー、日次運用レポート、再利用可能な画像テンプレート、マルチトラック動画エディタを搭載し、外部エージェントとの連携も可能です。macOS、Windows、Linuxで動作し、内蔵AIまたはOpenAI互換エンドポイントを利用可能。MIT-NC(非商用)ライセンスで公開されています。

smixs/visual-skills

プロの映画制作とドラマツルギーの原則を適用して、AIビデオおよび画像モデル用の高精度プロンプトを生成するAIエージェントスキルのツールキット。

ErickWendel/localstudio

バックエンドなしのブラウザネイティブでローカル第一のスライドエディタ。Web AIとWebGPUを活用して、AI駆動のスライド生成、翻訳、プレゼンテーションツールを提供します。

verl-project/verl-omni

マルチモーダル生成モデルのための汎用的なRLトレーニングフレームワークであり、拡散モデルおよびオムニモーダルモデルに対して高速なロールアウトと安定したポストトレーニングを提供します。

ModernRelay/omnigraph

Omnigraphは、任意のS3互換オブジェクトストレージ上に列指向のLance形式でデータを格納するRustベースのレイクハウス型グラフデータベースです。AIエージェントのフリート向けに設計されており、各エージェントは自身の分離されたブランチに書き込み、レビューとGit風のマージを経て変更を反映できます。クエリはグラフ走査、ベクトルANN、全文検索を1つのランタイムで統合し、Cedarポリシーで各変更に対して細粒度のセキュリティを強制します。CLI、Axum HTTPサーバー、TypeScript SDK、LLMホスト用の「MCP」ブリッジを提供し、エージェント記憶、企業脳知識グラフ、開発グラフ自動化、バージョン管理されたMLデータレイヤーのフルスタックソリューションです。

NVIDIA/cosmos

ロボティクスや自律システム向けに、テキスト、視覚、音声、行動シーケンスの共同処理と生成を可能にする、オムニモーダル世界モデルとツールのオープンプラットフォーム。

TrenTorch/TrenTorch

Tren⚡Torchは、教育目的のNumPyのみのディープラーニングフレームワークで、TinyTorchを再実装し、テンソルと自動微分からCNN、Transformer、量子化、ベンチマークまで20の段階的なモジュールを追加。CLIと歴史的マイルストーンスクリプトを備え、実践的な学習を可能にします。

Yuliang-Liu/MonkeyOCRv2

文書AI向けの視覚テキスト基盤モデル。多言語ビジョンエンコーダーと、文書解析・理解に特化したモデルを提供します。

apify/mcpc

mcpc は、Model Context Protocol (MCP) – AI エージェントのツール、プロンプト、タスク、支払いを扱う標準 API – への完全なアクセスを提供する軽量でクロスプラットフォームの CLI です。エージェントやスクリプトが Bash シェルから任意の MCP 操作を呼び出せます。永続セッション、OS キーチェーンに保存された OAuth 2.1、パイプ可能な JSON 出力、grep による動的ツール発見、実験的な x402 支払い統合もサポートしています。

nexmoe/VidBee

1,000以上のサイトから動画と音声をダウンロードし、ローカルで文字起こしを行い、AIを使用してコンテンツを要約・検索できるオープンソースのデスクトップアプリ。

kgoedecke/doop

Doopは、人間とAIエージェント(Claude Codeまたは組み込みDoopエージェント経由)が一緒にHTMLフレームをリアルタイムで編集できるオープンソースのリアルタイム設計キャンバスです。ライブマルチプレイヤー機能、AI駆動のデザインタスク、プライベート共有が可能で、1つのDockerコマンドまたは `bun run dev` で自己ホスティングできます。AIバックエンドはAnthropic(フリーティア)またはユーザー提供のOpenAI/ChatGPTキーと連携します。

869413421/ai-moive-studio

テキストをAI映画やショート動画に変換する、無限キャンバスとエージェント支援ワークフローを備えたフルスタックAIコンテンツ制作ワークベンチ。

Huanshere/VideoLingo

一元的な Streamlit インターフェースを通じて、音声認識、翻訳、音声生成を自動化する AI パワードの動画翻訳・ダブリングツール。

nicobailon/pi-mcp-adapter

1つの軽量ツールを通じてMCPサーバーをプロキシ化し、サーバーを遅延ロードし、必要に応じてツールを発見することで、コンテキストウィンドウを節約するPiエージェントプラグイン

taylorwilsdon/google_workspace_mcp

Google Workspace MCP Serverは、120以上のGoogle Workspace操作(Gmail、Drive、Docs、Calendarなど)をModel‑Client‑Protocol経由で公開するオープンソースのPythonサービスです。ClaudeやChatGPTなどのLLMアシスタントがWorkspaceデータを読み書きできるようにします。マルチユーザーOAuth 2.1、3段階のツール層、ステートレスなコンテナデプロイ、完全なCLIをサポートし、すべてのトラフィックをGoogleのAPIに限定。MITライセンスで自己ホスティング可能。

localai-org/kimodo.cpp

テキストプロンプトからキャラクターやロボットのモーションアニメーションを生成する、NVIDIA KimodoモデルのGGML/C++実装。

OpenBMB/MiniCPM-V

モバイル端末上で効率的にデプロイ可能な、ポケットサイズのマルチモーダルLLMシリーズ。スマートフォン上で高パフォーマンスな画像・動画・リアルタイムオムニモーダルインタラクションを実現。

BasedHardware/omi

ウェアラブルデバイスやデスクトップアプリから画面と音声データを取得し、リアルタイムの文字起こし、要約、検索可能なAIチャットを提供するオープンソースのAIメモリシステムです。

tracel-ai/burn

Burnは、単一のAPIでトレーニングと推論を統合するRustネイティブのディープラーニングフレームワークです。PyTorchに似た使いやすさ、自動微分、JITコンパイルによるカーネル融合、および柔軟なバックエンドシステム(CUDA、ROCm、Metal、Vulkan、WebGPU、CPU、no-std)を提供します。ONNXインポート、重み読み込み、ターミナルトレーニングダッシュボード、エッジおよびブラウザ環境への対応ツールを備え、モデルを一度書けばどこでも実行可能にします。

huggingface/diffusers

画像、音声、3D分子構造の生成に使用・学習可能な最先端の拡散モデルを扱うモジュール式ライブラリ。

koharu-rs/koharu

Rustで書かれたML駆動のマンガ翻訳ツール。テキスト検出、OCR、翻訳、生成インペイントを自動化し、ローカル優先のワークフローを実現。

off-grid-ai/OGAM

Android、iOS、macOS で完全にオフラインで動作する包括的な AI サイツ。テキスト、画像、ビジョン AI、音声トランスクリプションをすべてネイティブにデバイス上で実行し、完全なプライバシーを確保。

icebird1998/scientific-illustrator

Codexプラグインで、Microsoft PowerPoint、WPS Presentation、またはdraw.ioで参照画像を自動的に再描画し、編集可能な図に変換します。

modelscope/FunClip

ASRとLLMを使用して、音声テキスト、話者ID、またはAI駆動のコンテンツ分析に基づいて動画セグメントを抽出するオープンソースの自動動画クリッピングツール。

bytebase/dbhub

DBHubは、LLMベースのツールがPostgreSQL、MySQL、SQL Server、Oracle、SQLite、MariaDBを安全にクエリできるようにする、最小限でトークン効率の高いMCPサーバーです。約1.4kトークンで2つのコアツール(SQL実行とスキーマ検索)のみを提供し、オプションの追加ツール、ガードレール、組み込みのWeb UIを備えており、AIエージェントと実データベース間の軽量なブリッジとして機能します。

datascale-ai/opentalking

WebRTCを介してLLM、TTS、STT、およびビデオレンダリングを統合するオープンソースのオーケストレーションフレームワーク。

diffusionstudio/lottie

テキストプロンプトとSVGアセットからプロダクション準備完了のLottieアニメーションを生成できる、オープンソースのフレームワークです。

Tencent-Hunyuan/Hunyuan3D-WorldClaw

WorldClawは、大規模でスケーラブルなオープンワールド3D環境を生成することを目的としたエージェントベースの3D生成フレームワークです。

pollinations/pollinations

テキスト、画像、動画、音声、3D、埋め込み生成に対応する統合的でOpenAI互換のオープンソース生成AIプラットフォームを提供。

TencentARC/Pixal3D

Pixal3Dは、ピクセル対応のバックプロジェクションを使用して、1枚の画像または複数のビューから詳細なジオメトリとPBRテクスチャを生成する高精細3Dアセット生成ツールです。

ahujasid/ableton-mcp

Claude AI と Ableton Live を接続する Model Context Protocol (MCP) サーバー。プロンプト駆動の音楽制作、トラック操作、自律的楽曲アレンジを可能にします。

google-deepmind/alphagenome

DNA配列の規制コードを解読するための統合モデルとAPI。遺伝子発現、スプライシング、クロマチン特徴を予測します。

liuzhao1225/YouDub-webui

YouTube、Bilibili、またはローカルファイルからの動画に対して、音声認識、翻訳、ダブイングを自動化するオープンソースの動画ローカライズツールです。

neavo/LinguaGacha

LinguaGachaは、OpenAI、DeepSeek、Anthropic、Google、またはローカルモデル(例:Qwen2.5-7B)などの大規模言語モデルAPIを活用し、1回のクリックで字幕、電子書籍、ゲームスクリプトを数十の言語に翻訳できるクロスプラットフォームデスクトップアプリです。自動用語集抽出、バッチ翻訳、自動レビューを備えた「AGENT」ワークフローにより、フォーマットやコードスタイルを保持したまま翻訳を実行できます。

oil-oil/oil-motion

Oil Motion は、デザインプロンプトとソース画像をインタラクティブなウェブアニメーション(スクロール駆動、マウス追従、タッチ操作など)に変換するAIエージェントスキルです。キーフレーム作成、AI動画生成、フレームレベルのクリーニング、MP4またはWebPリソースへのパッケージ化を自動化し、埋め込み可能なフロントエンドコードを提供します。

SamurAIGPT/Generative-Media-Skills

スキーマ駆動型アーキテクチャにより、AIエージェントがプロフェッショナルな画像、動画、音声を生成・編集できるようにするマルチモーダルツールセットおよびMCPサーバー。

jnMetaCode/agency-orchestrator

Agency Orchestrator は、1文または小さな YAML ファイルから、複数エージェント AI ワークフローを自動的に構成・実行する npm ベースのツール(CLI + Web UI)です。276の事前構築済み中国語(および191の英語)の役割定義を搭載し、15のLLMプロバイダー(多くのキー不要)をサポート。DAGを構築して並列実行、出力を検証し、共有可能なHTMLレポートを生成。コードを書かずに「AIチーム」を活用したい個人起業家、プロダクトアナリスト、開発者に最適です。

jd-opensource/JoyAI-VL-Interaction

ユーザーのプロンプトを待たずに1秒未満でリアルタイムのビデオストリームに積極的に反応できる8B規模の視覚言語インタラクションモデルおよびシステム

diivi/aseprite-mcp

104種類の包括的なツールセットを通じて、AIアシスタントがAsepriteを完全に制御し、プロフェッショナルレベルのピクセルアートやアニメーションを作成できるようにするMCPサーバー。

jaredrhod/barehands

Webカメラベースのハンドトラッキングインターフェース。ノート、画像、3Dモデルを空間的に操作でき、AIエージェントの視覚的かつインタラクティブな「身体」として接続されるよう設計されています。

777genius/agent-teams-ai

Agent Teams AI は、AI エージェント(Claude Code、Codex、OpenCode、Cursor、SuperGrok、GitHub Copilot、Z.AI、MiniMax、Kiro など)のチームを構築および監視できる、無料のクロスプラットフォームデスクトップアプリです。エージェントはタスクを作成し、通信し、コードとターミナルコマンドを実行し、かんばんボードを見ながらコードレビューを実行できます。このアプリはトークン使用量、予算、エージェントごとのリソース統計を追跡し、組み込みターミナル、Git 対応エディタ、多言語 UI、`mcp-server` コンポーネントによるプラグインサポートを提供します。

IBM/mcp-context-forge

ContextForgeは、MCP、A2A、REST、gRPCサービスを1つの中央管理されたエンドポイントに統合するオープンソースのゲートウェイです。認証、レート制限、OpenTelemetryトレーシング、プラグインシステム、管理者UIを提供し、PyPI、Docker、Helm経由で実行可能です。

google-gemini/gemini-live-api-examples

Gemini Live APIの例のコレクション。マルチモーダル入力を備えた低遅延でリアルタイムの音声・動画AIエージェントの構築を可能にする。

X-PLUG/MobileAgent

視覚的知覚とプランニングを用いて、モバイル、デスクトップ、ウェブインターフェースにわたるタスクを自動化するマルチプラットフォームGUIエージェントおよび基盤モデルのファミリー。