alikon-art/DeterminFlow
DeterminFlow は、プロダクションレベルのAIワークフローを構築・実行・監視するためのオープンソースでAGPLライセンスのフレームワークです。複雑なパイプラインを、LLMエージェントノード、スクリプト、API呼び出し、人間の承認に分離し、バージョン管理、チェックポイントベースの回復、ノードごとのトークン会計、視覚エディタを提供します。コンテンツ生成、データ中心のAIパイプライン、企業向け自動化に適しており、デスクトップバイナリ、ソースからの実行、Dockerでのデプロイが可能です。
zeraix/zeraix
Zeraixは、ローカルLLM(GGUFモデル)をmacOSまたはWindows上で実行し、チャット、ファイルの読み取り・編集、ターミナルコマンドの実行、マルチステップの「スキル」管理を可能にするオープンソースのデスクトップアプリです。Rustベースのエージェントランタイム、メディアライブラリ、プラグインサポート、オプションのQEMUサンドボックスを備え、クラウドモデルにも接続できます。インストーラーが提供され、Apache-2.0ライセンスで、Discordコミュニティによって支えられています。
ptnghia-j/ChordMiniApp
オープンソースの音楽分析ツールで、コード自動認識、ビートトラッキング、メロディ転写を提供し、インタラクティブなビジュアライザーを備えています。
papersgpt/papersgpt-for-zotero
PapersGPTは、ローカルに数千のPDFをインデックス化し、ローカルLLMを使ってそれらと会話できるネイティブC++のZoteroプラグインです。ミリ秒スケールの検索、ドキュメント間の統合、完全なオフラインプライバシーを約束し、AutoPilotバッチ処理や他のAIエージェントの「スキル」としての統合といった機能を備えています。
oisee/vibing-steampunk
Vibing Steampunk (vsp) は、Go CLIツールとしてSAPのADT API(RFCまたはHTTPS経由)をブリッジし、AIアシスタントや開発者がSAPサーバーに何もインストールせずにABAPコードとデータの読込・書込・デバッグ・分析が可能になります。完全なデバッグ(ブレークポイント、ステップ実行、変数の確認・変更)、AMDPデバッグ、ダンプ分析、ジョブ/スプール処理、ドキュメント抽出、SAPクラスタテーブルのデコードをサポートし、記録されたADTセッションを用いたオフラインテストも可能です。
rahilp/second-brain-cloudflare
Second Brain は、Cloudflare Workers ベースの個人・チーム向けメモリサービスで、ノート、決定事項、その他の AI アシスタント向けコンテキストを保存します。ベクトル検索による意味的想起、個人+共有レイヤー、プロンプトカプセル対応を提供し、多くのツール(Claude、ChatGPT、CLI、ブラウザ拡張機能、Obsidian、Notion、iOS ショートカット)と統合します。ワンクリック Cloudflare ボタン、デスクトップアプリ、または手動 CLI でデプロイでき、ユーザー自身の Cloudflare アカウントで実行されるため、データはプライベートに保たれます。MIT ライセンス。
pymss-project/pymss-studio
pymss エンジンを使用して、モデル管理、バッチ処理、ステム編集を実行するためのデスクトップワークスペースです。
xenodium/agent-shell
Emacs Agent Shell は、Agent Client Protocol (ACP) を実装する任意のLLMコードアシスタントと対話するためのネイティブなREPL風バッファを提供するEmacsパッケージです。Claude、Codex、GeminiなどプロバイダのCLIをACPモードで起動し、認証、環境設定、画像/スクリーンショット入力まで処理することで、開発者がEmacs内からAIエージェントと直接会話できるようにします。
ogulcancelik/pi-extensions
PiというターミナルベースのコーディングアシスタントをUIフッター、セッション検索、自動権限、サブエージェント、ワークツリー処理、その他のユーティリティで拡張するnpmベースのプラグイン群です。
NVIDIA-NeMo/RL
NeMo RL は NVIDIA のオープンソースライブラリで、大規模言語モデルおよびビジョン・ランゲージモデルのスケーラブルな強化学習ファインチューニングを可能にします。GRPO、DAPO、GDPO など多数のRLアルゴリズムをサポートし、PyTorch DTensor および Megatron Core のバックエンドと連携。vLLM や Megatron 推論による高性能生成も実現。実行可能なDockerコンテナ、Rayベース分散トレーニング、豊富なYAMLレシピにより、迅速なプロトタイピングからマルチノード・マルチGPUのプロダクション運用まで対応可能です。
collabora/WhisperLive
マイクやストリームからのライブ音声入力を、OpenAIのWhisperモデルを使って最小限の遅延でテキストに変換するリアルタイム音声認識アプリケーションです。
chrxh/alien
ALIENはCUDAベースの2次元人工生命シミュレータで、粒子がニューラルネットワークで制御される柔軟体生物を形成する。リアルタイムGPU物理演算、ビジュアルエディタ、ゲノムベースの進化、シミュレーションの共有用ネットワーキング、ヘッドレス実行用コマンドラインモードを提供。CMake/Ninjaで構築され、NVIDIA GPU(またはAMDはROCm経由)で動作し、BSD-3ライセンスで公開されている。
joewongjc/type4me
Type4Meは、ローカルとクラウド音声認識を組み合わせ、LLMによるテキスト処理を提供するmacOS専用音声入力アプリです。8つの組み込みモード(生の音声入力、知能的な精査、翻訳、AI質問応答、macOS制御、プロンプト生成、タスク実行など)、カスタマイズ可能なホットキー、語彙管理、履歴ログ、自動化用URLスキームを備えています。
xiaods/k8e
K8Eは、任意のLinuxホスト上で信頼できないコードを安全に実行できるオープンソースの単一バイナリサンドボックスプラットフォームです。gVisor、Kata、Firecrackerによる隔離をサポートし、セッションごとのeBPFネットワークポリシー、500ms未満の起動時間のウォームプールポッド、`k8e-sandbox-cli`ツール経由でアクセス可能なE2B互換APIを提供します。
autonomous-ai/autonomous-computer
複数のハイエンドGPUを搭載したパーソナルAIコンピュータを構築するオープンソースハードウェア設計。オンプレミスでの推論、データプライバシー、トークン単位のコストゼロを実現。
smacke/ffsubsync
音声活動検出とFFTベースの整列を使用して、字幕をビデオまたはオーディオファイルと自動的に同期させる言語に依存しないツール。
intel/compute-runtime
Intel のオープンソース *Compute Runtime* (NEO) は、Intel 統合 GPU(HD Graphics、Xe)向けに oneAPI Level Zero および OpenCL コンピュート API を実装しています。月次リリースのドライバーを提供し、幅広い現行およびレガシー Intel GPU プラットフォームをサポートし、Linux パッケージまたは手動の .deb ファイルを通じてインストールされます。アプリケーションは標準的な Level Zero または OpenCL ICD ローダーを介してリンクされ、ランタイム自体は GmmLib および Intel Graphics Compiler を基盤としています。MIT ライセンスの下で提供され、プルリクエストによるコントリビューションが歓迎されています。
akdeb/ElatoAI
ESP32デバイスにリアルタイム音声AIモデルをデプロイするためのフレームワークで、エッジ関数を介して低レイテンシの音声対音声会話を実現します。
TypeTale/TypeTale
TypeTale (字字アニメ) は、クリエイターが小説、短編ドラマ、AI映画をエンドツーエンドで生成できるWindows専用のAIGCツールです。LLM、画像生成(Stable Diffusion、Midjourneyなど)、動画モデル(ComfyUIベース)、TTSエンジンを統合し、ビジュアルワークフローエディタ、会話型AIアシスタント、Python/ComfyUI拡張用のプラグインシステムを提供。コア機能は永久に無料で利用可能。ローカルで実行またはクラウドAIサービスに接続可能。
rzru/nightingale
ユーザーのライブラリ内の任意の楽曲からボーカルを自動分離し、歌うための同期された単語レベルの歌詞を生成するAI駆動のカラオケアプリケーション。
menglimi/astrbot_plugin_private_companion
オープンソースのAstrBotチャットボット向けのプラグインで、永続的でパーソナリティ駆動型のコンパニオンを追加します。毎日の状態、スケジュール、人間関係などのライフスタイルデータを保持し、そのコンテキストを使用して、プライベートチャットとグループチャットで反応的な返信と能動的なアクション(テキスト、画像、音声など)を生成します。コアはJSON(または任意のSQLite)ストレージで動作し、ビジュアル管理パネルを提供し、画像生成、コンテンツ作成、デバイスインタラクションなどの任意モジュールで拡張できます。
kaanozhan/Frame
Frameは、AIコーディングエージェントに永続的でgitアンカーされたコンテキストを提供するElectronベースのIDEです。ルール、モジュールマップ、ノート、タスク、マークダウンベースの仕様(spec/plan/tasks/outcome)を含む標準的な`.frame/`フォルダを作成します。エージェントは各セッションをこのコンテキストから開始し、組み込みのconductorは隔離されたgit worktree内で複数の仕様を並列実行し、重複しないフットプリントを強制し、マージ前に人間の承認を要求します。機能には、マルチターミナルグリッド、タスク/仕様パネル、GitHub統合、高速インテントインデックス検索、Claude Code、Codex CLI、Gemini CLIのサポートが含まれます。インストールは`npm install`またはプレビルドバイナリを通じて行われ、プロジェクトはApache-2.0ライセンスです。
salute-developers/GigaAM
最先端の音声認識および感情検出に最適化された、Conformerベースの音声モデルファミリー。ロシア語および70以上の他の言語を強力にサポート。
embabel/embabel-agent
Embabel Agent Frameworkは、JVM上で目標指向型、LLM拡張型エージェントを構築するためのKotlin/Javaライブラリです。強型のアクション、動的計画(GOAP/Utility AI)、Spring統合、3つの実行モード(焦点型、閉じ型、開き型)を提供します。開発者はアノテーションまたはDSLでエージェントを記述し、フレームワークが自動的にアクションを計画・再計画し、LLM呼び出しと通常のコードを混合します。プロジェクトは完全にオープンソース(Apache 2.0)、Maven公開済みで、ドキュメント、CI、Discordコミュニティによるサポートも提供されています。
BryceWG/BiBi-Keyboard
複数のクラウドおよびローカル ASR エンジンをサポートし、LLM ベースのテキスト後処理を行う AI 駆動の Android 用音声入力メソッドです。
xr843/Master-skill
Master‑skill は、検証済みの仏教大師の人格を採用できるオープンソースの AgentSkill パッケージです。LLMアシスタントは、CBETA、BDRC、SuttaCentralなどの正典テキストから直接情報を引き出し、出典を明示して回答します。ハードゲート倫理ルールと二段階の忠実度テストスイートで、架空の引用や倫理的逸脱を防止。`npx master-skill install …` でインストール後、Claude Code、Cursor、Gemini CLI、または fojin.app のWebチャットで `/master-huineng` などのスラッシュコマンドを実行可能。15の事前パッケージ化された大師、伝統間比較ツール、オフラインフォールバック、Rustベースのデスクトップマネージャを提供。
karanb192/claude-code-hooks
Claude Code用の20種類のプラグイン(フック)のマーケットプレイス。セキュリティ強化(シークレット読み取り、危険なシェルコマンド、破壊的なgit操作、設定改ざんのブロック)と自動化(自動ステージ、コードフォーマット、セッションログ、スタンドアップ生成、バンティボード、コンテキストコストリーダーボード)を実現。`/plugin marketplace add karanb192/claude-code-hooks`でインストール後、`/plugin install <hook>@claude-code-hooks`で個別に有効化。MITライセンス、完全テスト済み、OWASP LLM Top 10 2026にマッピング済み。
rengwu/chartr
chartrは、Rustベースのデスクトップアプリで、ターミナル、AI CLIエージェント、プラグインツールを永続的でレイアウトを認識する「スペース」に整理し、開発者がAIを活用した長期的なワークフローを維持・再現できるようにします。
wendy7756/AI-Video-Transcriber
AI Video Transcriberは、FastAPIベースのウェブアプリ(CLI/MCP対応)であり、YouTube、TikTok、Bilibili、ポッドキャストなどから字幕を抽出するか、Whisperを実行し、OpenAI互換のLLMを使って字幕を最適化、必要に応じて翻訳し、多言語要約を生成します。同時に元の動画を並列でダウンロードでき、Dockerまたはシンプルなインストールスクリプトで動作し、プログラム可能なエンドポイント(REST API、CLI、MCP)を提供します。
thewh1teagle/kokoro-onnx
CPU および GPU で高速な多言語テキスト音声変換を実現する、軽量な ONNX Runtime 実装の Kokoro-TTS。
franklioxygen/v2s
オンデバイスの Apple フレームワークを使用して、マイクまたは特定のアプリからの音声をリアルタイムで音声認識・翻訳し、macOS のメニューバーにライブで二か国語の字幕を表示するアプリ。
kenn-io/roborev
roborevは、ローカルでAI駆動のコードレビューを実行するGoベースのツール。Gitのpost-commitフックを追加し、人気のあるコーディングエージェント(Claude Code、Codex、Gemini、Copilotなど)と連携。結果はターミナルまたはブラウザUIで表示可能で、自動修正/改善ループで問題を修正できる。すべての処理は開発者のマシン上で実行され、分析データのエクスポートと拡張可能なフックも可能。
wanshuiyin/HERO-Anti-OverDefense
HERO‑Anti‑OverDefenseは、AIコーディングアシスタント(Claude Code、Copilot、Cursor、Gemini CLIなど)の設定ファイルに追加する、小さなコピー&ペースト可能なプロンプトブロック(ドキュメントと実世界の例付き)です。9つのルールにより、モデルが不要なハッシュを追加したり、関係のないエッジケースを守ったり、網羅的なルーブリックを構築したり、不要なスキャフォールディングを作成したりするのを止め、要求された機能を提供するようにします。
coollabsio/jean
Jeanは、複数のLLM CLIツール、gitワークツリー管理、チャットセッション、GitHub/Linear統合を単一のローカル実行UIに統合した、ネイティブデスクトップ(Tauri)AIアシスタントです。macOS、Linux (amd64/arm64)、Windowsをサポートし、Webアクセス可能なヘッドレスサーバーモードを提供します。また、PR生成、コードレビュー、リリースノート作成などの一般的な開発タスク向けの「マジックコマンド」も備えています。
Chachamaru127/claude-code-harness
Claude Code Harness は、Claudeベース(または互換性のある)AIエージェントを、計画、作業、レビュー、同期、リリースという体系的なループで運用するGoネイティブプラグインです。各ステップで強力なガードレールと人間の承認を強制し、仕様の生成、AI駆動の実装、独立した変更レビュー、検証済みリリースのパッケージ化をサポートします。Claude Code、Codex CLI、Cursor、Grokを対応しています。
QwenAudio/Fun-ASR
ノイズの多い環境、遠方音声、広範な中国語方言サポートに最適化された高精度エンドツーエンド音声認識モデルのファミリー。
alphacep/vosk-api
Voskは、Raspberry Piから大規模クラスターまで、さまざまなデバイスで20以上の言語の連続的な文字起こしを提供する、オフラインのオープンソース音声認識ツールキットです。
caipe-io/ai-platform-engineering
CAIPEは、AIエージェントとエージェント的ワークフローを構築、実行、および管理できる、オープンソースのApache‑2.0ライセンスのプラットフォームです。ランタイム、ワークフローコンポーザー、統合、アイデンティティ/認可、およびオブザーバビリティを提供し、AI対応サービスのオペレーティングシステムとなることを目指しています。
google/flax
Flax は Google DeepMind がメンテナンスしている、JAX 上で構築された柔軟で高性能なニューラルネットワークライブラリです。Python中心のAPI(Flax NNX)、一般的なレイヤー、トレーニングユーティリティ、チュートリアルを提供しており、`pip install flax` でインストール可能です。
0xarchit/github-profile-analyzer
GitHub OAuthでログインするNext.jsベースのウェブアプリ。ユーザーの公開コントリビューションデータを取得し、AIモデルを実行してスコア付きプロフィールレポート(PDFエクスポート)を生成。TypeScript、Bun、Neon PostgreSQL、Upstash Redis、Tailwind CSSで構築。
birdnet-team/BirdNET-Analyzer
6,500種以上の鳥類を対象に、音声ファイルを分析して種類を特定するディープラーニングツール。
soniqo/speech-swift
Speech Swiftは、Apple Silicon向けのオープンソースSwiftパッケージで、数十種類のデバイス内音声AIモデル(ASR、TTS、翻訳、音声エージェント、強化など)を提供。Core MLとMLXフレームワークを介して実行され、数百の言語をサポートし、複数の量子化サイズを提供。Swift Package Managerでの1行依存でプロジェクトに追加可能。ドキュメント、事前学習済みモデル、トランスクリプト、ストリーミング音声入力、UIコンポーネントの例コードをすべて含み、クラウド呼び出しは一切不要。
googleapis/python-genai
Google Gemini生成AIモデル用のPython SDK。同期/非同期クライアント、型安全なプロンプト、関数呼び出し、セーフティ設定、エンタープライズ機能を提供します。
yuruotong1/autoMate
autoMateは、AIチャットクライアントに永続的な個人用ストレージ(ノート、ファイル、リマインダー、長期記憶)と現実世界のアクションツールボックス(シェル、ブラウザ、SaaS API)を提供するローカルホストサービスです。MCP-over-HTTPブリッジ経由でクライアントと通信し、OpenClaw、Claude Desktop、Cursor、Clineなどに対応。独自のWebチャット、Chrome拡張、Dockerコンテナ、バイナリでも利用可能です。
DicioTeam/dicio-android
Android用のオープンソースでプライバシー重視の音声アシスタント。音声認識とリクエスト処理をすべてデバイス内で実行します。
intel/auto-round
AutoRoundは、大規模言語モデルおよび視覚言語モデルの超低ビット(2-4ビット)量子化のためのIntelのオープンソースPythonツールキットです。高速かつ高精度なレシピを提供し、CPU、Intel GPU、NVIDIA CUDA、Habana Gaudiをサポートし、Transformers、vLLM、SGLangと統合されています。pipでインストールし、1行のCLIまたはPython APIを使用して、量子化モデルをサポートされている任意のバックエンドにデプロイできます。
daaain/claude-code-log
Claude Code Logは、PythonのCLI/TUIツールで、Claude CodeのトランザクションJSONLファイルを検索可能なHTMLページまたはコンパクトなMarkdownに変換します。トークン使用量統計、日付フィルタリング、Git-SHAリンク、ライブ監視モードを備え、AI支援コーディングセッションのレビューと共有を容易にします。
intel/openvino-plugins-ai-audacity
OpenVINOを使用して、100%ローカルで実行されるAI対応のエフェクトとジェネレーターのセット。音楽分離、ノイズ除去、音声認識を実現。