nu-dialogue/j-moshi

重なり話や応答語(あいづち)をリアルタイムでサポートする日本語のフルデュプレックス音声対話システム。

csyangwen/dsh-memory-evolve

dsh‑memory‑evolve は、AIに永続的なクロスセッション記憶、ToDo/プロジェクトログ、Gitベースの記憶同期、マルチエージェントオーケストレーション(内部サブセッションと外部AIプロバイダー)、ファイル用の検索可能な無限キャンバス、オプションのレビューセッション、モバイル対応UIと通知を提供するDSHプラグインです。AIが長期的なパートナーとチームコーディネーターとして機能させつつ、すべての書き込みをユーザーが制御できるようにします。

narcotic-sh/senko

1時間の音声を数秒で処理できる、高速かつ高精度な話者ダイアライゼーションパイプライン。

spaceamoeba-t/tapq

TapQ は Swift で構築された macOS ランタイムで、コードエージェント(Claude Code、Codex、Cursor、OpenCode)を AirPods に接続します。エージェントのプロンプトを音声で読み上げ、二重うなずき/シェイク、ステムスワイプ、または音声(OpenAI のリアルタイム API をオプションで利用)で応答可能。解釈できない場合はスクリーン UI にフォールバック。すべてのモーション処理はデバイス内。音声は応答ウィンドウ開設時のみ OpenAI に送信。macOS 14+、Swift 6、任意のヘッドモーションを公開する AirPods 対応。Apache 2.0 ライセンス。

Companion-Inc/feynman

Feynmanは、CLIファーストのオープンソースAIリサーチエージェントです。論文、ウェブ、多数の科学データベースを検索し、ブリーフ、文献レビュー、論文ランキング、監査、再現計画、機械学習トレーニングレシピを合成します。自己完結型のネイティブバンドル(またはnpmパッケージ)として提供され、ノートブック、アーティファクトプレビュー、計算オーケストレーションのためのローカルWebワークベンチをオプションで実行できます。PiエージェントランタイムとAlphaXiv論文エンジンを基盤とし、ホスト型LLMおよびLM Studio、Ollama、LiteLLMなどを介したローカルモデルの両方をサポートしています。

yeyupiaoling/VoiceprintRecognition-Pytorch

VoiceprintRecognition-Pytorchは、PyTorchベースの話者照合ツールキットです。最新のバックボーン、プーリング層、損失関数、フロントエンドを多数備え、データ準備、トレーニング、評価用のスクリプトや、すぐに使えるWeb/WeChatデモが含まれています。

MiniMax-AI/minimax-code

MiniMax Codeは、ターミナルベースのAIコーディングアシスタントです。LLM(MiniMaxまたはOpenAI/Anthropic互換プロバイダー)とチャットし、コマンドラインから直接コードの読み取り、修正、テストを行うことができます。インタラクティブなTUI、スクリプト/CI用のヘッドレスCLI、カスタムモデルサポート、組み込み検索とツール実行、セッション管理、ACPによるエディタ統合などの機能を備えています。ワンクリックスクリプトまたはnpmでインストールし、ログイン(または独自のAPIキーを使用)して、「失敗したテストを修正して」といったプロンプトを入力するだけです。リポジトリにはCLIのソース(MITライセンス)と完全なドキュメントが含まれています。

nanbingxyz/5ire

5ireは、オープンなModel-Context-Protocol (MCP)を使用してツール(ファイルシステム、データベース、APIなど)を接続する無料のクロスプロバイダーAIチャットアシスタントです。RAG用のローカル多言語ベクトルストア、プロンプトライブラリ、ブックマーク、使用状況分析機能が含まれています。

arnegiacomo/fugleramme

Raspberry Pi向けの電子ペーパー鳥類フォトフレーム。ローカルAIを使用して音声から鳥を検出し、1800年代の切り絵風自然史イラストとして表示します。

DamRsn/NeuralNote

MuScriptor Transformerモデルを使用して、オーディオ録音をローカルで編集可能なMIDIノートに変換するDAW用オーディオ・トゥ・MIDI転写プラグイン。

schibsted/WAAS

OpenAI Whisper用のGUIおよびAPIラッパーであり、非同期文字起こしサービスとテキスト修正用の組み込みエディタを提供します。

magenta/mt3

MT3は、T5Xフレームワークを使用して録音を楽譜に変換するマルチ楽器対応の自動音楽転写モデルです。

Kulaxyz/self-learning-skills

self‑learning‑skillsは、AIコーディングエージェントがセッション中に発見した手順知識(デプロイ手順やシークレットの場所など)をキャプチャして再利用できるようにするメタスキルです。Claude Code、Cursor、および `AGENTS.md` ファイルを読み取るあらゆるツールと連携し、「ゴールデンパス」を新しいスキルファイルやメモとして永続化し、将来のセッションで自動的に読み込みます。インストールは `npx skills` によるワンライナー、Claude Codeプラグイン、または手動コピーで行えます。このプロジェクトはオープンな Agent‑Skills 標準に従っており、MITライセンスで提供されています。

espressif/esp-skainet

ESP‑Skainetは、ESP32チップ向けのEspressif製オンデバイス音声アシスタントSDKです。小型のウェイクワードエンジン(WakeNet)、最大200言語に対応したオフラインコマンド認識エンジン(MultiNet)、および完全なオーディオフロントエンド(AEC、VAD、NS)を統合しています。このスタックは、最小限のRAM/FlashでESP32‑S3(または他のESP32ボード)上で動作し、スマートホーム、ウェアラブル、ロボット向けのプライバシーに配慮した音声制御を実現します。リポジトリには、すぐにフラッシュ可能なサンプル、詳細なドキュメント、カスタムウェイクワードやコマンドのサポートが含まれています。

233stone/vocotype-cli

VocoType-CLIは、FunASRをベースにしたオープンソースのオフライン音声認識コマンドラインツールです。CPU上で動作し、中英混合の文字起こしをサポート。カスタム辞書やAIによる後処理機能を提供し、オプションで火山エンジン(Volcengine)のクラウド認識サービスも利用可能です。リポジトリにはPythonベースのインストール手順やデータセットのエクスポート機能が含まれており、非技術者向けのGUI版へのリンクも提供されています。

Dpro-at/Tel-Agent

Tel‑Agentは、SIP電話回線(および24以上のメッセージングプラットフォーム)を自前でホストするAIエージェントに接続するためのオープンソースゲートウェイです。音声認識(STT)、LLM生成、音声合成(TTS)をリアルタイムでストリーミングし、外部HTTPサービスの呼び出しや、すべての対話の記録・文字起こしが可能です。Windows/macOS/LinuxまたはDockerで動作し、AGPL‑3.0ライセンスで提供されます。

daobataotie/CAD-MCP

CAD‑MCPはWindows専用のPythonサーバーで、Model‑Context‑Protocolを通じてAutoCAD/GstarCAD/ZWCADの機能を公開します。LLMを搭載したクライアントが35の構造化JSONツールを使って、図面作成、照会、編集、レイヤー、ブロック、ファイル操作を自然言語で制御可能にし、自然言語駆動のCAD自動化を実現します。

JasonLiu0826/ackem

Ackemは、Windows専用のElectronアプリで、OpenAI互換のLLMを永続的なローカルファーストのAIコンパニオンに変えるツールです。チャット、検索可能なメモリ、感情・関係性の追跡、デスクトップペット、拡張可能なプラグインシステムを備え、すべてのデータ(APIキーを含む)をユーザーのPC内に保持します。プロジェクトは活発にメンテナンスされており、AGPL-3.0ライセンスで公開されています。エンドユーザーはNode.jsランタイムをインストールする必要はありません。

context-labs/whip

whipは、LLM駆動のコーディングエージェントを実行するためのGoベースのコマンドラインハーネスです。モデルの応答をストリーミングし、ツール(bash、ファイル編集、サブエージェント)を並列で呼び出し、OpenAI互換のあらゆるエンドポイントで動作します。このツールはOpenRouterなどのプロバイダーからモデルを自動検出し、ログインベースのCodexサブスクリプションをサポートし、組み込みのターミナルテーマを提供します。インストールは単一のスクリプトまたはgo installで行えます。

HKUDS/CatchMe

CatchMe は、ローカルでプライバシー優先のツールで、コンピュータのアクティビティ(マウス、キーボード、ウィンドウ、クリップボード、スクリーンショットなど)を継続的に記録し、階層的なアクティビティツリーに整理し、LLM 生成の要約を追加し、CLI、Web ダッシュボード、または AI エージェントスキルを通じて履歴全体をクエリできます。ベクトル埋め込みは不要です。

Autodesk/XLB

XLBは、微分可能な格子ボルツマン法(LBM)流体シミュレーションのためのPythonライブラリです。CPU、シングルGPU(Warp)、マルチGPU(Neon)、TPU(JAX)ハードウェア上で動作し、格子細分化、多数のLBMモデルや境界条件を提供します。また、JAXベースの機械学習ツールと統合されており、勾配ベースの最適化や物理情報ニューラルネットワーク(PINN)の学習が可能です。

pax-beehive/dsh-hub-cli

Node ベースの CLI で、DeepSeek Harness(ランタイム、順序付きプラグイン、設定パッチ、環境変数宣言)を、公開 DSH Plugin Hub 上の不変・バージョン管理された *Preset Release* としてキャプチャできます。他のユーザーは単一のコマンドでプリセットを取得・適用でき、正確なプラグインバージョン、ロード順序、ランタイムを固定できます。このツールは、計画、アトミックなステージングインストール、差分/アップグレード/ロールバックをサポートし、安全な計画適用ワークフローを介して AI エージェントと統合します。すべてのリリースはコンテンツアドレス指定(sha256)され、シークレットはローカルに留まり、CLI は MIT ライセンスです。

yvetteYSY/creator-agent

Creator Agentは、オープンソースでプライバシー最優先のWebプロトタイプであり、クリエイターがテキスト、Markdown、またはビデオ+字幕ファイルをアップロードし、承認してから決定論的で出典を含むチャットエージェントを公開できます。Auth0による認証、PostgreSQLによる永続的ワークスペースメタデータ、ゼロAIのローカルリトリーバエンジンを使用しており、将来のモデル統合のための「Bring-Your-Own-Agent」HTTP契約を文書化しています。

devcodex-labs/devcodex

DevCodexは、意図駆動型でプロジェクトを意識したワークフローでAIコーディングアシスタント(Copilot、Claude Codeなど)をオーケストレーションするNode.js CLIです。構造化されたプロジェクトプロファイルを構築し、必要に応じてドメイン固有のスキルをロードし、セッション間でタスク状態を永続化し、作業完了には証拠が必要です。再現可能で監査可能なAI生成コード変更を必要とする開発者やチーム向けに設計されています。

miracodeai/mira

Miraはオープンソースで自己ホスト可能なAIコードレビュー専用サービスです。OpenRouter、Ollama、AWS Bedrock、Codex CLIなど、任意のLLMと連携可能。差分、埋め込み、CVEデータ、使用ログを、あなたが管理するSQLite/Postgresに保存し、プライベートダッシュボードで結果を表示します。ノイズフィルタ付きコメント、拒否されたフィードバックからカスタムルールを学習するループ、フルリポジトリインデックス、脆弱性アラート、GitHub、GitLab、Forgejoのサポートを備えます。Docker(Railway、Fly.io、Renderのワンクリック)でデプロイ可能で、`mira.yaml`/`.mira.yaml`でリポジトリごとに設定可能です。Apache 2.0ライセンス。

Unity-Technologies/unity-agent-plugin

Claude CodeやCodexが自然言語によるUnityタスクを理解し、対応するUnityプロジェクトのコードとアセットを自動生成できるAIエージェントスキル。マーケットプレイスコマンドまたは手動でインストール可能。Unity 6以降と互換性があり、UnityのCompanion Licenseに基づいてライセンスされています。

danium/lateral-thinking

AIコーディングエージェント向けのスキルバンドルで、ランダム刺激、SCAMPER、Six Hatsなど古典的なラテラルシンキング手法に加え、内蔵された「放棄ルール」を備え、アイデアが陳腐に感じられる理由を診断し、構造的で明白でない製品方向を生成できる。

nkarasiak/qgis-mcp

QGIS MCPは、AIエージェント(Claude、Gemini、Codexなど)がModel Context Protocol(MCP)を通じてQGISを制御できるオープンソースのブリッジです。QGIS内にプラグインを提供し、外部のFastMCPサーバーで118のGIS専用ツール(レイヤー操作、編集、処理、レンダリング、レイアウトなど)を公開しています。QGISからプラグインをインストールし、LLMクライアントに小さな`uvx`ベースのサーバーを追加するだけで、AI駆動のコマンドでプロジェクトの作成、フィーチャーの編集、処理アルゴリズムの実行、マップのレンダリングが可能になります。

LucieEveille/kiwi-mem

kiwi‑mem は、LLMチャットに人間のような長期記憶を追加する自己ホスト型FastAPIゲートウェイです。事実を PostgreSQL + pgvector に保存し、時間とともに減衰する「熱量」を割り当て、毎夜の「夢」サイクルで関連する情報を統合し、古いチャットを階層的なカレンダーサマリーに圧縮します。OpenAI互換またはAnthropicネイティブAPIと連携可能で、Web管理パネルを備え、1つの Docker‑Compose コマンドで動作します。

katipally/openlive

OpenLiveは、任意のLLMまたはコーディングエージェントに、ローカルで音声認識・音声合成(オプションで音声クローン)およびカメラ/スクリーンキャプチャを追加するオープンソースのデスクトップアプリです。音声パイプライン全体をWebGPUでローカルで実行し、モデルに送信するのはトランスクリプトのみ、返信は音声で返すことで、プライベートで料金なしの音声駆動AIアシスタントを実現します。

gdstudio-org/Embeat

MLPによる音響特徴エンコーディングとTrack2Vecによる協調フィルタリングを組み合わせたハイブリッド音楽推薦システムで、高品質でジャンルに敏感な楽曲提案を実現します。