worm128/AI-YinMei

LLM、ストリーミングTTS、仮想アバターを統合したワンストップAIライブストリーミングプラットフォーム。複数のストリーミングプラットフォーム向けに、インタラクティブなAIボットを生成します。

talesofai/neta-skills

Neta Art APIのためのAIエージェント用スキルとCLIツールのコレクション。エージェントによるマルチメディア生成、キャラクター管理、インタラクティブなストーリーアドベンチャーの実行を可能にします。

facebookresearch/tuna-2

Tuna-2は、複雑なビジョンエンコーダやVAEを直接的なピクセル埋め込みに置き換えることで、画像理解と生成の両方を向上させる統合マルチモーダルモデルです。

aimclub/FEDOT

FEDOT は、進化アルゴリズムを使用して機械学習パイプライン(前処理、特徴量エンジニアリング、モデルを含む)を自動的に設計および最適化するオープンソースの Python AutoML フレームワークです。分類、回帰、クラスタリング、時系列予測をサポートし、一般的な ML ライブラリと統合され、シンプルな高レベル API と再現可能なパイプラインエクスポートを提供します。

LucasAlegre/morl-baselines

MORL‑Baselinesは、信頼性の高い多目的強化学習アルゴリズム(シングルおよびマルチポリシー、SER/ESR)のPyTorchライブラリです。MO‑Gymnasium APIに準拠し、ユーティリティ、自動W&Bログ、Open RL Benchmarkとの統合により、再現可能な実験を可能にします。

zrt-ai-lab/ViNote

YouTube、Bilibili、ローカルファイルの動画を構造化されたノート、マインドマップ、検索可能な知識資産に変換するAI駆動のツールです。

BlockRunAI/blockrun-mcp

BlockRun MCPは、AIエージェント(Claude、Codexなど)に19のリアルタイムツール(市場データ、Web検索、メディア生成、オンチェーンクエリ、Polymarketでの本物のUSDCベット)を提供するオープンソースのMCPサーバーです。エージェントは、x402マイクロペイメントプロトコルによる自己管理USDCウォレット、またはプリペイドAPIキーで1回ごとの呼び出しに課金します。サーバーは1つの`npx`コマンドでインストールでき、多数のMCP互換クライアントと連携可能。人間がループに参加する支出承認もサポートしており、自律エージェントがリアルデータにアクセスし、現実の行動を実行するための実用的な橋渡しとなります。

guochengqian/Magic123

2D と 3D の拡散プライアを組み合わせ、粗から細へのパイプラインで単一の 2D 画像から高品質な 3D オブジェクトを生成するシステム。

pykale/pykale

マルチモーダルと転移学習のための PyTorch ベースのライブラリで、持続可能かつ再利用可能な AI ワークフローを作成するための標準化されたパイプラインベース API を提供します。

rockbenben/img-prompt

5,000以上のバイリンガルタグを備えた、AI画像・動画モデル向けの視覚的で多言語対応のプロンプトビルダー。ユーザーが高品質な英語プロンプトを、プレビュー画像付きのキュレート済みタグライブラリを使って構築できるように支援します。

huggingface/finetrainers

メモリ効率の高いテキストから動画・テキストから画像生成に焦点を当てた、拡散モデルのアクセシブルなトレーニングとファインチューニングのためのライブラリです。

laminlabs/lamindb

LaminDBは、特にマルチモーダル生命科学データ向けのオープンソースでGit風のデータ管理システムです。ファイル、テーブル、配列形式をバージョン管理し、コードと環境のプロバンスを追跡、ブランチ/マージをサポート、SQLite/PostgresにACID安全なメタデータを保存します。Python/Rツール(Polars、DuckDB)、バイオオントロジー、ワークフローマネージャと統合され、研究およびバイオテック向けのトレーサブルでFAIR準拠のデータセットを実現します。

Woolverine94/biniou

8GB RAM程度の基本的なハードウェアでも、テキスト、画像、音声、動画、3D生成に対応する多様な生成AIモデルをローカルで実行できる自己ホスト型Webインターフェース。

hoanganh8389/bizcity-twin-ai

Bizcity Twin AI は、サイトを企業向けの統合的AI「脳」に変換するオープンソースのWordPressプラグインです。多数のチャネルからのメッセージを標準化し、出典付きの単一知識グラフ(KG)を構築し、管理コントロールプレーン(MCP)を通じてLLM(Claude、ChatGPT)にデータを公開します。コアサービス(ID管理、KG、推論、自動化、ログ、権限)は不変であり、開発者は軽量なプラグイン(act、channel、view)でドメイン固有の機能を追加します。プロジェクトにはCLIスケルトンツール、診断機能、ライブデモが含まれ、GPL-2.0-or-laterライセンスで公開されています。

Minidoracat/mcp-feedback-enhanced

MCP Feedback Enhanced は、長時間のAIタスク中に人間が関与するフィードバックを可能にするセキュリティ強化型MCPサーバーです。ローカル、SSH経由、WSLで動作し、セッションを追跡し、画像、Markdown、タイマー、多言語UIをサポート。元の interactive-feedback-mcp プロジェクトのフォークとして維持されています。

cyx2333hhh/talk-type

リアルタイム音声認識、ローカルWhisperフォールバック、AI駆動のテキスト修正を統合したmacOS用音声入力ツール。アプリケーション間でスムーズな二か国語入力を実現。

Blacktrupersist/hailuo-ai-pulse

Hailuo AI Pulseは、コンテンツ生成、分析、およびクリエイティブな自動化機能を提供する、Windows向けの合理化されたAIワークスペースです。

backblaze-labs/genblaze

ハッシュ検証済みの来歴マニフェストを内蔵した、生成AIビデオ、オーディオ、画像ワークフローをオーケストレーションするためのAIパイプラインSDK。

AvalancheAlbatross/midjourney-lab

Midjourney Lab は、テキスト、画像、音声、動画のマルチモーダル生成および処理をサポートするWindowsベースの機械学習プラットフォームです。

ling-kong-ran/pisper

Pisperは、LLMとの対話的分岐、並列化、自動化を可能にする、クロスプラットフォームのマルチエージェント・チャットおよびワークフロー・ツールです。オープンソースのPi Coding Agentをベースに構築されており、デスクトップ、ターミナル、モバイルクライアント、オンデマンド・プラグイン、安全なローカルのみのデータストレージ、およびオプションのLAN/P2Pリモート連携を提供します。

matterantmill/kling-ai-pulse

コンテンツ生成、分析、およびクリエイティブ・オートメーションのための、軽量な Windows 用 AI ワークスペース。

v-modal/vmodal_sdk_android

動画や画像ライブラリにマルチモーダル意味検索を追加するためのAndroid SDK。ユーザーが意味に基づいて特定の瞬間を見つけられるようにします。

GangTailorUpgrade/undress-service

クローゼットをデジタル化し、生成AIを活用して天気、TPO、スタイルに基づいたコーディネートを提案・可視化するセルフホスト型AIファッションプラットフォーム。

AutoArk/TinyEngram

LLM と Stable Diffusion に対して Engram ベースのメモリ注入を探索し、破滅的忘却なしにパラメータ効率の高い知識更新を実現するオープンリサーチプロジェクト。

AutoArk/EVA-OS

リアルタイムマルチモーダルアプリケーションおよびスマートハードウェア向けのAIOSで、AIネイティブなコーディングからオンデバイス推論までを統合された開発体験を提供します。

flatkey-ai/flatkey-cli

単一のAPIキーとクレジット残高を通じて、画像、動画、音声、テキストを生成できる、統合されたマルチモーダルAI生成のためのコマンドラインインターフェース。

hezo-ai/hezo

Hezoは、サンドボックス化されたコンテナ内でAIエージェントの組織化されたチーム(CEO、キャプテン、エンジニア、デザイナーなど)を構築・実行できるオープンソースのサーバー+Web UIです。独自のLLMプロバイダーキーを提供し、トークンとコンテナ時間の予算を設定すると、プラットフォームがシークレット保護、Git統合、さまざまなモデルランタイムを正規化する統一された「メタハーネス」を処理します。単一のバイナリでインストールし、セルフホストまたはHezo Cloudを使用し、組織図スタイルのUIでプロジェクトを管理します。

dreamers-laboratory/image-to-3d-pipeline

複数のオープンソースの再構成モデルを実行・比較し、最適な出力を得られるようにする、画像から3Dメッシュを生成するパイプラインです。

AkshitIreddy/Interactive-LLM-Powered-NPCs

既存のオープンワールドゲームのソースコードを変更することなく、NPCに動的なLLM駆動の音声会話と同期した顔アニメーションを追加するシステム。

Hchen1218/heytea-style

視覚的要素を抽出して一貫性のあるキャラクターを生成することで、写真を手描きポスターとインタラクティブなデスクトップペットに変換するクリエイティブツールキット

chflame163/ComfyUI_LayerStyle_Advance

高品質な画像キャプション生成、VLM推論、およびローカルモデルや外部APIを使用した複雑な画像合成のための高度なComfyUIノード集。

dexhunter/seedance2-skill

Seedance 2.0(ByteDanceのマルチモーダルモデル)の正しい動画生成プロンプトを作成するためのMarkdownガイドを提供するClaude互換の「スキル」です。Markdownを ~/.claude/skills にコピーするか、npx skills add でインストールします。ガイドには、制約事項、参照構文、カメラ言語、プロンプト構造、および広告、ドラマ、MV、教育用などのテンプレートが含まれており、ByteDanceの公式ドキュメントに基づいています。MITライセンス。

11273/mooc-work-answer

クロスプラットフォームのPythonツールで、中国のMOOCサービス(智慧职教、AI 优课、資源库)における学習進捗の追跡、ディスカッション投稿、AI支援型宿題のヒントを自動化します。公式APIと通信し、オプションでDeepSeekを使って参考回答(60–100%の関連性)を生成します。プリビルド実行可能ファイルまたはソースコードから実行でき、人間の行動を模倣するための安全な遅延を含んでいます。

taruma/SceneFlow

AI映画制作者がプロンプト遵守度を分析し、AI動画モデルが脚本指示をどのように可視化したかを評価するためのスクリプト・ツー・スクリーン同期ツールです。

geometric-kernels/GeometricKernels

GeometricKernelsは、非ユークリッド領域(多様体、グラフ、メッシュ)向けの熱核およびMatérnカーネルを提供するPythonライブラリです。ガウス過程モデルをこれらの空間で実行可能にし、TensorFlow (GPflow)、PyTorch (GPyTorch)、JAX (GPJax) 用のアダプターを提供します。`pip install geometric_kernels` でインストールし、必要なバックエンドを追加して使用します。リポジトリには豊富なノートブック、JMLR論文の引用、明確な貢献ワークフローが含まれています。

JuliaDiff/ReverseDiff.jl

ReverseDiff.jlは、高速でテープベースの逆モード自動微分を実装するJuliaライブラリであり、ネイティブJuliaコードの勾配、ヤコビアン、ヘッシアン、および高階微分を計算可能。テープの再利用、非割り当て型線形代数最適化、ForwardDiffとの混合モード互換性を備え、機械学習や科学計算プロジェクトにおける効率的な勾配計算に最適なバックエンドとして活用できる。

mir-group/flare

FLARE(Fast Learning of Atomistic Rare Events)は、スパースなガウス過程回帰とACE型記述子を用いたベイズ型原子間力場を構築するPythonライブラリです。不確実性を考慮した分子動力学、リアルタイムでのアクティブラーニング、LAMMPSペアスタイルの実装を提供し、材料や希少事象の高速かつ高精度なシミュレーションを可能にします。

BINE022/EEGPT

EEGPTは、二重自己教師学習法を用いて、低SNR(信号対雑音比)の課題を克服するための汎用的なEEG特徴抽出を目的とした事前学習済みTransformerモデルです。

IBM/materials

IBM/materials は、化学および材料科学向けの本格的なオープンソースの大型基礎モデルスイートです。SMILES、SELFIES、グラフ、3次元構造などの単一モーダルモデルと、マルチモーダル融合ツールをすべて、統一されたPythonラッパー(FM4M‑Kit)またはHugging FaceのWeb UIから利用可能です。リポジトリにはインストール手順、例題ノートブック、Hugging Face上でのホストモデルへのリンクが含まれています。

hankcs/HanLP

HanLPは、オープンソースの多言語NLPツールキット(Pythonコア、Java/Goクライアント)であり、トークン化、POSタグ付け、NER、構文解析、SRL、AMR、要約、感情分析、言語検出などのための本番環境対応の事前学習済みモデルを提供します。軽量なRESTfulサービス(GPU不要)と、PyTorch/TensorFlow上で動作するネイティブPythonライブラリの2つのAPIを提供します。モデルは130言語をカバーし、速度重視のマルチタスク共同モデルと、高精度なシングルタスクモデルの両方があります。インストールは `pip install hanlp`(ネイティブ)または `pip install hanlp_restful`(REST)で簡単に行えます。ライブラリは一貫したJSON出力を返し、可視化ツール、カスタム辞書サポート、詳細なドキュメントが含まれています。

Dooy/chatgpt-web-midjourney-proxy

ChatGPTとMidjourney、および数十種類の生成AIバックエンド(画像、動画、音楽、ダンス、顔交換)を統合したWeb UI。Docker、Vercel、またはビルド済みバイナリでデプロイ可能で、環境変数で設定を行います。音声入力、GPT-4-vision用の画像アップロード、リアルタイムチャット、モデルエンドポイントを切り替える「GPT-Store」をサポートしています。

Relaxed-System-Lab/Flash-Sparse-Attention

Flash‑Sparse‑Attention (FSA) は、Native Sparse Attention の最適化版を実装した Triton ベースの PyTorch モジュールです。ループの並べ替えと3つの専用カーネルへの作業分割により、メモリトラフィックを削減し、アトミック加算を排除することで、最新の NVIDIA GPU 上での長シーケンス LLM の学習および推論を 2‑3 倍高速化します。PyTorch ≥ 2.4、transformers ≥ 4.45 に対応し、Ampere/Hopper ハードウェア上で fp16/bf16 をサポートしています。

fcakyon/phd-skills

Claude Code用のゼロ依存プラグインで、研究用のガードレール、自動起動スキル、バックグラウンドエージェントを追加し、論文再現、実験デバッグ、トレーニング起動の際、AIアシスタントによる高コストなミス(誤った設定、検証されていない主張、破壊的なコマンド)を回避するのを支援します。

jmiao24/Paper2Agent

Paper2Agentは、研究論文(およびそのコード)を自動的に実行可能なMCPサーバーに変換し、論文の手法をAIが呼び出し可能なツールとして公開するマルチエージェントPythonシステムです。ユーザーは「paper2agent」スキルをコーディングアシスタント(Claude Code、Codex、Gemini CLI)にインストールし、論文のURLを「エージェント化」するように指示します。システムは専門のサブエージェントを生成し、論文の解析、隔離された環境のセットアップ、元のコードのラップ、検証テストの実行を行い、すべてを使用手順とともにZIPファイルにまとめます。生成されたサーバーはローカルで実行するかHugging Faceでホストでき、その後コーディングアシスタントに接続して対話型の科学的クエリを実行できます。

huggingface/meshgen

AIエージェントを使用して自然言語による3Dモデリング制御を可能にするBlenderアドオン。ローカルおよびリモートのLLMバックエンドをサポート。

marcellodebernardi/loss-landscapes

`loss‑landscapes` は、モデルのパラメータ空間の低次元スライス上でスカラー量(損失、勾配ノルム、曲率、期待報酬など)をサンプリングし、損失面の可視化を容易にする PyTorch ライブラリです。柔軟な `Metric` 抽象化、部分空間生成器(直線、平面など)、および標準モデルとRLエージェントの両方に対応する `ModelWrapper` を提供します。元の2019年リリースは破損しており、APIが変更される可能性があるため、現在再実装が進行中です。

20000419/fauxnix

fauxnixはnpmベースのツールで、選別されたbashコマンドのサブセットをPowerShellに翻訳し、LLMエージェントが仮想マシンを使わずにWindows上でなじみ深いLinuxスタイルのコマンドを実行できるようにします。決定論的翻訳、MCPサーバー統合、バッチ実行、広範なテストを備え、Windows環境におけるAI駆動型コードアシスタントの信頼性を向上させることを目指しています。

Aperivue/medsci-skills

MedSci Skillsは、臨床研究の全パイプライン(文献検索、研究デザイン、データクリーニング、統計分析、論文作成、コンプライアンスチェック、およびAI研究のための再現可能なモデル構築と検証)を自動化する59のAIエージェント「スキル」のオープンソースコレクションです。Claude Code、Copilot、Cursorなどのツール向けに設計されており、npx、GitHub CLI、またはClaudeプラグイン経由でインストール可能です。また、論文、図表、ガイドライン準拠の監査レポートを出力するエンドツーエンドのデモ(診断精度、メタ分析、疫学、CNNセグメンテーション、外部検証)を提供します。