zhizinan1997/jimeng-free-api-all

Jimeng AI 用の OpenAI 互換 API サービスで、複数アカウントのローテーションと管理ダッシュボードを備え、プログラムによる画像および動画生成を可能にします。

Mobile-Artificial-Intelligence/maid

Maidは、llama.cppを介してGGUF LLMをローカルで実行し、多くのリモートLLM APIに接続できるオープンソースのAndroidアプリ(React Native)です。ワンタップでのモデルダウンロード、チャット管理、調整可能な生成設定、オプションのクラウド同期、およびコンパニオンTTSアプリ(Maise)を提供します。GitHub releasesまたはGoogle Playからインストールするか、APKを自身でビルドしてください。

raysonmeng/agent-bridge

AgentBridge は、Claude Code と OpenAI Codex を接続するローカルツールで、メッセージのやり取り、タスクの分割、お互いのコードレビューを自動的に行います。Bun を基盤とするデーモンと短い CLI(`abg`/`agentbridge`)を実行し、両アシスタントを起動し、ターンの調整、クォータの引き渡し、ノイズの多い出力をフィルタリングします。手動でのコピーペーストなしに2つのLLMコーディングアシスタントが協働したい開発者を対象としています。

ZiYang-xie/WorldGen

WorldGen は、テキストプロンプトや画像から数秒で没入型 3D シーンを生成するツールで、Gaussian Splatting とメッシュ出力の両方をサポートし、VR、ゲーム、シミュレーションに利用できます。

sorker/ai-shotlive

AI ShotLive Director は、小説やストーリーの構成案をショートビデオやモーションコミックに変換する、オープンソースの React + Express (または Electron) プラットフォームです。キーフレーム駆動型のワークフロー (最初/最後のフレーム → 補完) を使用し、あらゆるテキスト、画像、ビデオ、オーディオモデル (OpenAI, Anthropic, Google, AntSK, etc.) をプラグインとして利用できます。機能には、小説から台本への変換、アセット生成 (キャラクターのルックブック、シーンのコンセプト)、グリッドベースの絵コンテエディタ、AI字幕/TTSを備えたマルチトラック・ビデオ編集、および完全なバックアップ/復元機能が含まれます。Docker, ローカル SQLite, またはデスクトップアプリとして展開可能で、CC BY-NC-SA 4.0 ライセンスの下で提供されています。

bcurts/agentchattr

agentchattr は、複数のAIコーディングエージェントと人間がリアルタイムで会話できるクロスプラットフォームのローカルチャットサーバーです。Web UIでエージェントを@でメンションすると、サーバーがMCP経由でプロンプトをエージェントのターミナルに注入し、エージェントが自動でチャットを読み、返信します。これにより、手を離した連携、マルチエージェントワークフロー、ジョブ、ルール、セッション、チャンネル、ピン留め、意思決定カード、スケジューリング、音声入力など、豊富なUI機能を実現します。

opentokenz/mcpx

MCPX は、MCP プロトコルを実装する Go ベースのローカルサーバーです。これにより、LLM エージェント(ChatGPT、Claude など)が、登録されたローカルワークスペース内で、ファイル、コマンド、プラン、アーティファクトを安全に読み書き、実行、管理できるようにします。永続的な Remote Session、きめ細かなセキュリティポリシー、SQLite に保存される監査ログ、および Skills やカスタムツールによる拡張性を提供します。

ChrisChen667788/wind-comic

1行の文章を、スクリプト、キャラクター設計、音声合成、最終MP4エクスポートまで自動化するマルチエージェントAIスタジオ。

NVIDIA-AI-Blueprints/video-search-and-summarization

自然言語を使ってライブまたは記録された動画ストリームの検索、要約、推論を行うGPUアクセラレーテッドなビジョンエージェントのリファレンスアーキテクチャ。

saddam213/AmuseAI

さまざまなオープンソースパイプラインとGPUバックエンドを使用して、画像、動画、音声、テキストの生成と編集を行うローカルマルチモーダルAIアプリケーション。

aaronyi97/image-story-video-wizard

CodexおよびWorkBuddy向けのAI動画制作ワークフローで、トピック選択からストーリー型動画の最終レンダリングまでを段階的にガイドします。

Evianis/travel-photo-abstraction

写真の形状や空間的リズムなどの視覚的証拠を最小限の抽象的なマークにマッピングすることで、疎なエディトリアル抽象画を作成するCodexスキル。

lidge-jun/ima2-gen

複数の AI プロバイダー間で画像および動画生成を統合するローカル優先のビジュアル生成スタジオで、高度な反復ツールを提供します。

scraed/LanPaint

拡散モデル向けのトレーニング不要な汎用インペインティングサンプラーで、「Think Mode」により画像、動画、音声の品質を向上させる。

Ariescar/anyCreature

テキスト記述を、マルチステージの設計と検証プロセスを経て、ゲーム用に最適化されたアニメーション付き3Dクリーチャー(GLB形式)に変換するAI駆動のパイプライン。

facebookresearch/fairchem

fairchem はMetaのオープンソースライブラリであり、化学および材料科学向けの機械学習原子間ポテンシャル(UMAモデル)を提供します。`fairchem-core` パッケージ(pipインストール可能)、ASE互換の計算機、マルチGPU推論、分子、ポリマー、無機結晶、触媒、MOFsなどに対する事前学習済みモデルを備え、高速かつ量子精度のシミュレーションを可能にします。

songlab-cal/gpn

アライメント済みおよびアライメントされていないゲノム配列を用いて、全ゲノム変異の機能的影響を予測するように設計されたゲノム言語モデルのセット。

corvo007/MioSub

Gemini と Whisper を使用して、音声認識、翻訳、ミリ秒単位のタイムライン同期を自動化するAI駆動の字幕エディタ。

anliyuan/Ultralight-Digital-Human

短い動画からパーソナライズドトレーニングを行うことで、モバイルデバイス上でリアルタイムに話す頭部を生成するための軽量なデジタル人間モデル。

NVIDIA/cudnn-frontend

NVIDIAのcuDNN Frontendは、オープンソースのヘッダーオンリーC++ APIおよびPythonバインディングであり、HopperおよびBlackwell GPU上で高性能なディープラーニングカーネル(アテンション、GEMM、融合オペレーション)の構築を簡素化します。Flash-Attention、Mixture-of-Experts GEMM融合、スパース/線形アテンションなどの完成済みJITコンパイルカーネルを同梱し、統合Graph APIおよびPyTorch互換オペレーションを通じてアクセスできます。

omnichar/OmniChar

ポータブルな .char 形式を使用し、複数の画像および動画生成モデル間で動作する、一貫した AI キャラクターを作成するためのオープンソーススタジオ。

AnubhavChaturvedi-GitHub/jarvis-ai-assistant

音声認識、LLM推論、画像生成、システム自動化を組み合わせ、ハンズフリーでコンピュータを操作できる、モジュール式の音声起動型AIデスクトップアシスタント。

GPTomics/bioSkills

bioSkills は、配列I/Oからシングルセル、バリアントコール、構造生物学、ケモインフォマティクス、ワークフロー管理まで、生物情報学解析を実行するための準備済みコードテンプレート(「スキル」)のライブラリです。Claude Code、Codex、Gemini/Antigravity、OpenCode、OpenClaw に対応する軽量スクリプトでインストール可能で、ベストプラクティスのコマンドラインフラグ、例題スクリプト、使用ガイドを提供し、AI生成生物情報学コードの正確性を向上させます。

bquenin/interpreter

OCRとローカルLLMを使用して、フローティングオーバーレイ経由でリアルタイムの英語字幕を提供する、日本のレトロゲーム用オフライン画面翻訳ツール。

safetensors/safetensors

safetensors は Rust で実装された Python ライブラリで、pickle のコード実行を回避する安全な小さな JSON ヘッダー付きバイナリフォーマットを定義しています。ゼロコピー、遅延読み込み、現代的な dtype(bfloat16、fp8 など)をサポートし、Hugging Face で大規模モデル重みを配布する際に使用されています。`pip install safetensors` でインストール可能です。

kyleskom/NBA-Machine-Learning-Sports-Betting

PythonプロジェクトでNBAの統計データとスポーツブックオッズを収集し、マッチアップ特徴量を構築、XGBoostおよびTensorFlowモデルで試合勝者とオーバー/アンダー合計を予測、期待値とケリー基準に基づくベット額を出力します。データ収集、モデルトレーニング、コマンドライン予測スクリプト、シンプルなFlaskウェブUIを含みます。

vinhhien112/img2obj

構造化された分析とレビューワークフローを通じて、必要な構築コードを生成することで、参照画像をアニメーション可能なプロシージャルThree.jsオブジェクトに変換するCodexプラグイン。

NVIDIA/cosmos-framework

言語、視覚、音声、行動を統合するPhysical AI向けのエンドツーエンドフレームワーク。Cosmos 3ファミリーを含むオムニモーダルワールドモデルの学習とサービングを可能にする。

xmarre/ComfyUI-Spectrum-MiniMax-H3

Spectrum の ComfyUI 実装で、隠れ状態を予測して高コストなトランスフォーマー評価をスキップすることで、MiniMax H3 音声・動画生成を加速する。

openxla/xprof

XProfは、現代の機械学習ワークロード向けのオープンソースでスケーラブルなプロファイラ(TensorBoardプラグイン付き)です。ステップ時間の分解、操作のタイムライン、メモリ使用量、HLOグラフを可視化でき、分散処理をサポートし、`pip install xprof`でインストール可能です。

EvolvingLMMs-Lab/LLaVA-OneVision-2

コーデック整合型ビジョンエンコーダーを用いて、画像、長時間動画、空間理解を統合し、効率的な長時間動画推論を実現する、完全にオープンな8Bマルチモーダルモデル。

facebookresearch/meshflow

MeshFlowは、MeshVAEとflow-matching Diffusion Transformerを使用して、約1秒で芸術的なメッシュを作成する効率的な3Dメッシュ生成システムです。

AlayaLab/WildWorld

AAA ARPG から提供される、明示的な状態注釈付きの大規模なアクション条件付き世界モデルデータセット。生成的なゲーム環境のトレーニング用として設計されています。

tmustier/pi-for-excel

Pi for Excel は、Microsoft Excel 内に会話型AIエージェントを埋め込むオープンソースのOfficeアドインです。任意のLLMを設定することで、スプレッドシートの読み取り、書き込み、フォーマット、分析が可能。16の組み込みスプレッドシートツール、セッション管理、ワンクリックロールバック用の自動チェックポイント、および拡張可能なサンドボックス拡張機能を提供します。

dineshsoudagar/local-llms-on-android

ONNXおよびLiteRTバックエンドを使用して、音声、画像、カメラ入力に対応する完全にオフラインでプライベートなAndroidアプリ。

jedzqer/manga-translator-android

ローカルでのバブル検出とOCRを組み合わせ、LLMによる翻訳でオリジナル画像に翻訳テキストをオーバーレイするAndroidアプリ。

OneMoreGres/ScreenTranslator

オンライン翻訳サービスを活用して、画面に表示されるテキストをスクリーンキャプチャとOCRベースで翻訳するツール。

GalTransl/GalTransl

GalTranslは、GPT-4/Claude/DeepSeekなどのLLMを活用して、日本語のガルゲスクリプトを中国語に自動抽出・翻訳・再挿入するデスクトップGUIアプリ。GPT駆動の辞書、キャッシュ、字幕対応を備えています。

Wing900/ManimCat

Manim と matplotlib を活用し、自然言語を使用して数学アニメーションと静的な視覚的図解を作成するための AI 駆動型ワークスペースです。

mll-lab-nu/VAGEN

VAGENは、明示的な視覚的状態推理を通じて内部世界モデルを強化することで、パフォーマンスを向上させる、マルチターンVLMエージェントのトレーニング用強化学習フレームワークです。

google-deepmind/tips

TIPSは、汎用的なコンピュータビジョンとマルチモーダルAI向けに設計された一連の基礎的な画像-テキストエンコーダーです。強化された空間認識能力とpatch-textアライメントを備えています。

kunchenguid/autopreso

スピーカーの声に基づいてリアルタイムで Excalidraw ホワイトボードを描画・再配置する AI エージェントを用いたハンズフリーなプレゼンテーションツール。

breezedeus/Pix2Text

画像やPDFを、レイアウト、表、テキスト、数学式を認識することでMarkdownに変換するオープンソースのPythonツールキット。

RareSense/Nova3D

Nova3Dは、実行可能なBlender Pythonスクリプトとしてアセットを生成するコードネイティブな3D生成システムであり、名前付き部品を備えた構造的で編集可能かつアニメーション可能な3Dモデルの生産を可能にします。

OrRon/EpicInfographics

AIエージェント向けのスキルであり、汎用的なテンプレートをシーンベースのデザインと数学的な正確さに置き換えることで、プロフェッショナルなスタジオ品質のインフォグラフィックとアニメーションの作成を可能にします。

jtydhr88/ComfyTV

画像、動画、音声、音楽、3DアセットのためのAI生成とプロフェッショナル編集ツールを統合した、ComfyUI用のキャンバスベースメディアワークベンチです。

gradio-app/trackio

Trackio は、無料で軽量な実験トラッキングライブラリ(wandb 互換)で、ログをローカルの SQLite に保存し、高速なノンブロッキング API、Gradio スタイルのダッシュボード、CLI/SQL クエリツール、アラート、オプションの Hugging Face Spaces での無料ホスティングまたはセルフホスティングを提供します。

nodetool-ai/nodetool

ノードベースのグラフシステムと統合されたAIエージェントを活用して、画像、動画、音声、テキストの生成を可能にするエージェント優先のクリエイティブワークスペース。