altic-dev/FluidVoice

一款適用於 macOS 的開源語音轉文字輸入應用,支援本地 AI 轉錄與系統語音控制。

index-tts/index-tts

一種零樣本文本轉語音系統,可以從單個音訊剪輯克隆聲音,並對五種語言的情感、語速和發音進行精細控制。

fastapi/fastapi

FastAPI 是一個高效率、以類型提示驅動的 Python Web 框架,適合用來建構 API。它提供自動驗證、序列化與互動式 OpenAPI 文件,開發快速且可直接投入生產環境。

bethington/ghidra-mcp

Ghidra MCP Server 是一個生產就緒的橋接器,透過 Model Context Protocol 公開 Ghidra 的完整逆向工程引擎(反編譯、P-code 模擬、即時除錯、結構建立等)。它提供 253 個讀寫工具、批次優化操作、AI 導向的文檔工作流程,並支援透過 stdio、HTTP 或 SSE 傳輸進行無頭模式 (headless)、Docker 或 GUI 部署。

OpenByteInc/QuantDinger

QuantDinger 是一個開源、自架設的 AI 增強型交易作業系統。它讓你撰寫 Python 策略、進行回測、執行紙交易模擬,並可選地在加密貨幣交易所和傳統經紀商執行真實訂單。平台整合多個 LLM 提供者進行市場研究,提供 Flask-Gunicorn API、Docker-compose 部署、可選的 Prometheus/Grafana 可觀測性,以及用於 AI 驅動自動化的安全令牌式 Agent Gateway。

Significant-Gravitas/AutoGPT

AutoGPT 是一個用於構建、部署和管理自主 AI 代理的開源平台。用戶可以用簡單的英文描述目標或以視覺化方式組裝工作流程;系統會創建一個由 LLM 驅動的代理,與 45 種以上的整合服務(如 Gmail、Slack、GitHub 等)互動,以完成撰寫報告、分類事件或生成行銷文案等任務。該項目提供付費託管服務和免費的自託管 Docker 設備,核心平台採用 Polyform Shield 授權,經典代理代碼則採用 MIT 授權。

stemdeckapp/stemdeck

一款免費的本地音軌分離工具,使用 Demucs 將歌曲拆分為獨立音軌(如人聲與鼓),提供 DAW 風格混音器,支援本地播放與匯出。

QwenAudio/qwen-audio-agent

一個即時語音執行環境,允許AI代理在同時執行複雜的背景任務時與使用者保持持續對話。

Gentleman-Programming/gentle-shell

gentle-shell™ 是一個透過 npm 分發的終端 UI,可在 Pi 開發環境中執行基於 LLM 的程式碼代理。它提供統一的工作區,顯示任務、變更與代理層級,支援輕量級的有機驅動開發(ODD),並可選地支援正式的規格驅動開發(SDD),在變更套用前提供原生的變更差異審查。可透過可選的配套套件擴充功能,使用 `pi install npm:gentle-pi@2.6.0` 安裝,並透過 `pi` 命令啟動。

risa-labs-inc/BossConsole

BossConsole (BOSS) 是一款用於 AI 代理的開源、跨平台桌面工具。它基於 Kotlin Multiplatform 和 JVM 構建,提供原生編輯器、嵌入式 Fluck 瀏覽器、可共享終端、Git/Docker/K8s 工具以及插件「Toolbox」。所有功能均以 MCP 工具 (`mcp__boss__*`) 形式公開,任何模型(Claude Code、Codex、Gemini、OpenCode 等)皆可調用,並具備細粒度的 RBAC、單一工具停用開關及簽名插件機制。熱重載功能讓代理能在運行時演進新工具。可透過 Homebrew、腳本或 OS 套件安裝;採用 Apache-2.0 授權。

MengTo/Skills

一個基於 Markdown 的 123 種「技能」庫,為 AI 編碼代理(如 Codex、Claude、Cursor 等)提供分步驟、版本化的提示詞/工作流程配方。每個技能都位於 `agent-skills/<category>/<skill>/SKILL.md`,並可能包含演示、資源和參考連結。該儲存庫讓開發者能將提示詞視為可重複使用的程式碼資產,實現可重複的 UI 設計、Web-GL、Three.js 遊戲和媒體生成工作流程。採用 MIT 授權,可作為任何 LLM 驅動開發工具的上下文載入。

kirodotdev/KiroCrew

Kiro Crew 是一個開源、在地部署的 AI 代理平台,能讓代理狀態(記憶、經驗、技能)在重啟後持續存在,支援長時間或排程任務的無人值守執行,並可透過桌面應用、Web 仪表板、CLI 或聊天整合(Slack、Discord 等)存取。可透過一行指令、Docker 或原生桌面套件安裝;Gateway 進程將所有資料本地儲存,並強制執行沙箱與審核政策。

modelscope/FunASR

適用於離線、串流與邊緣部署的工業級語音辨識工具包,提供 ASR、VAD、標點復原與說話人分離的統一流程。

zubair-trabzada/geo-seo-claude

一個 Claude Code 技能,審計網站在 AI 搜尋(GEO)中的可見性,評分引用性、品牌信號、內容品質、技術 SEO 和結構化資料,並生成 Markdown 或 PDF 客戶報告。

thewh1teagle/vibe

一款使用 Whisper 等 AI 模型在本地設備上將語音轉換為文字的私密離線音訊與影片轉錄工具。

Gentleman-Programming/engram

Engram 是一個單一二進制 Go 程式,為 AI 程式碼代理(Claude Code、Gemini CLI、VS Code Copilot、Cursor 等)提供持久、可搜尋的記憶儲存(SQLite + FTS5)。它透過 CLI、HTTP API、MCP 或終端 UI 與任何 MCP 相容代理(如 Claude Code、Gemini CLI、VS Code Copilot、Cursor 等)協作。該工具零相依,支援本地優先儲存,可選雲端複製,並提供豐富的記憶命令(`mem_save`、`mem_search`、`mem_context`、`mem_session_summary` 等),使代理能在會話與團隊間記住決策、錯誤修復與設計理由。

modelbus/one-api-pro

OneAPI Pro是一個基於Go的開源AI API閘道,具有Vue 3管理UI。它統一了對許多LLM供應商的存取,添加了令牌/角色管理、訂閱計費、使用儀表板,並支援去中心化多節點叢集。可作為靜態二進位檔案或Docker映像部署。

ggml-org/whisper.cpp

whisper.cpp 是 OpenAI Whisper 語音轉文字模型的純 C/C++ 實作。它可在 CPU 及多種加速器(Apple Silicon、NVIDIA CUDA、AMD ROCm、Intel OpenVINO 等)上離線運行,支援混合精度與量化模型,並提供簡單的 C-API 及語言綁定,方便整合至桌面、行動裝置、嵌入式及網頁平台。

echo-loop/Echo-Loop

一個由AI驅動的英語聽力與口語訓練應用,透過自動化科學學習循環(精聽、仿讀、復述)結合間隔重複,實現高效學習

ace-step/ACE-Step-1.5

ACE‑Step 1.5 是一個開源音樂生成基礎模型,結合語言模型規劃與 Diffusion‑Transformer 音頻解碼器。它可在 RTX 3090 上於 10 秒內生成 10 秒至 10 分鐘的完整歌曲,基礎模型運行僅需 <4 GB VRAM,支援從少量曲目進行 LoRA 微調。倉儲提供 Gradio 和 REST 接口、適用於所有主流操作系統的啟動腳本、多種模型尺寸(含 4 B XL 版本),並支援對歌詞、風格、節奏、樂器的精細控制。

michael-denyer/pstack-claude

pstack‑claude 是一個 MIT 許可的外掛,為 Claude Code 提供了 54 個可重複使用的「Agent Skills」(例如 TDD、CI 修復、PR 總結),並透過共享技能目錄供 Codex、Prime Agent、opencode 和 Gemini‑CLI 使用。它會在 Claude 工作階段中自動注入 poteto‑mode 指令,為 Codex 提供生成的斜線命令存根,並包含 CI 以保持技能集與上游 Cursor 版本同步。

lightpanda-io/browser

Lightpanda Browser 是一個用 Zig 編寫的輕量級無頭瀏覽器,專為 AI 代理和大規模 Web 自動化而構建。它運行完整的 V8 JavaScript 引擎,提供 CDP 和 WebDriver BiDi 介面,並包含一個「代理」模式,允許 LLM 透過純英語任務控制瀏覽器,並記錄確定性的 JavaScript 腳本。基準測試聲稱其記憶體比無頭 Chrome 低約 16 倍,頁面載入速度快約 9 倍。可透過 Homebrew、AUR、直接二進位檔案或 Docker 安裝,支援 Linux/macOS(Windows 使用 WSL2),並與主要 LLM 供應商整合。該專案採用 MIT 授權,經過積極測試(單元測試、端到端測試、Web Platform Tests),並由社群 Discord 支援。

m-bain/whisperX

透過批次推理、詞級時間戳和說話人日誌功能增強 OpenAI Whisper 的快速自動語音辨識系統。

rafal-qa/slopo

Slopo 是一個基於 Python 的 CLI 工具,它使用程式碼嵌入模型(Jina AI, Voyage AI, 或本地 Ollama)來尋找程式碼庫中語義相似的程式碼片段。它會索引原始碼檔案,計算向量嵌入,將相似的片段分組,並輸出 Markdown 或精簡的報告,供人為審查或 AI 編碼代理使用。安裝方式為 `uv tool install slopo`;配置方式為 `slopo init`。該工具針對隱藏的、非完全相同的程式碼重複,以協助重構並降低 AI token 使用量。

NVIDIA/skills

NVIDIA Agent Skills 是一個可攜帶的指令集(技能)目錄,用來教導 AI 程式代理(Claude Code、Codex、Cursor 等)如何安裝、設定與使用 NVIDIA 軟體,如 cuDF、cuOpt、DeepStream、Jetson、NeMo、DOCA 等。技能透過開源 `skills` CLI(`npx skills add nvidia/skills …`)安裝,並可針對特定代理。該倉儲鏡像產品倉儲中的技能定義,並透過自動化同步管道保持最新。

OpenMinis/OpenMinis

OpenMinis 是一個開源的行動 AI 代理(iOS + Android),讓您能在裝置上執行任何 LLM(Claude、GPT、Gemini 等)。它內建沙盒化的 Alpine Linux shell(iOS 使用 iSH,Android 使用 PRoot),使代理可安裝套件、執行指令碼並操作檔案,同時也將原生裝置服務(健康、日曆、HomeKit、藍牙、剪貼簿、媒體等)作為工具提供。使用者可建立可重複使用的「技能」(含 `SKILL.md` 的資料夾與可選指令碼),並以獨立工作區組織工作。常見用途包括營養記錄、早晨簡報、從聊天中萃取任務、與 Obsidian 同步,以及分享至事件的自動化。程式碼基底為 iOS 的 Swift/SwiftUI 與 Android 的 Kotlin/Compose,採 GPL‑v3 授權。

Gnosil/semantix

Semantix 是一個基於 Go 的 CLI 工具,為 LLM 編碼代理程式增加了跨會話記憶功能。它從已完成的會話中提取可重用的「片段」(slices),將其儲存在本地,並在後續任務中將匹配的片段作為位元組穩定的前綴注入,以提高供應商提示快取命中率並降低推理成本。它可以作為完整代理程式 (`semantix-agent`) 運行,或透過工具註冊、中介軟體或閘道作為附加到現有代理程式的核心。該專案報告在演示中實現了高快取命中率(高達 99.8%)和約 80% 的成本節省,並與 Claude Code、LangChain 以及任何相容 OpenAI 的客戶端整合。

MaxHu-xuan/chat-archive-guard

ChatArchiveGuard 是一個純 Python CLI,可在本地掃描聊天匯出檔案(文字、JSON/JSONL、SQLite)以尋找祕密/PII 模式、格式錯誤和 SQLite 完整性,報告彙總計數和覆蓋旗標,而無需修改或上傳資料。

trailofbits/skills

Trail of Bits Skills 是一個 Claude Code/Codex 插件市場,新增了數十個安全導向的「技能」(例如靜態分析、智慧合約審計、YARA 规則撰寫、變異測試)。透過單一指令 `/plugin marketplace add trailofbits/skills` 即可安裝,然後從 LLM 呼叫單一插件執行具體分析,並取得結構化結果。

cubeplexai/cubeplex

CubePlex 是一個開源、雲原生平台,讓團隊能在隔離且持久的工作區中執行托管 AI 代理。它提供多模型聊天、可重用技能、作用域記憶、工具連接器、IM 整合與內建治理,並可透過 Docker Compose 或 Helm/Kubernetes 部署。

coldteadotai/pr-lens

PR Lens 是一個 GitHub 整合工具,可將拉取請求的差異轉換為動畫架構圖與資料流圖。可透過 GitHub App、CI Action、本機 CLI 或編碼代理技能使用,並透過 `.github/pr‑lens.yml` 檔案進行設定。視覺輸出幫助審查者在深入程式碼前理解變更的範圍與影響。

k2-fsa/sherpa-onnx

一個可在多種硬體與作業系統上本地執行語音辨識、語音合成及其他音訊 AI 功能的可移植框架。

vshulcz/deja-vu

deja‑vu 是程式生成代理(Claude Code、Codex、Cursor、Copilot 等)的本地專用記憶層。它索引這些代理已寫入的對話記錄檔,建立快速可搜尋的索引,並自動將相關過往決策注入任何代理會話。功能包括事後自然語言搜尋、跨代理召回、壓縮感知持久化、狀態追蹤、過時警告、機器間同步/交接,以及自動脫敏秘密。可透過一行指令、Homebrew、Scoop、Go 或 NPM 安裝;`deja install --auto` 會將一個微型 MCP 伺服器接入偵測到的代理。使用 `deja "jwt refresh token"`、`deja wip`、`deja blame <file>`、`deja sync ssh <host>` 等命令,還可透過本地 LLM 實現可選語意嵌入。所有處理均在本地機器完成,內建隱私保護機制。

Javis603/token-monitor

Token Monitor 是一個跨平台桌面小工具,可讀取 35+ AI 程式碼助理的本機日誌和 API 金鑰餘額,顯示即時 Token 使用量、成本和配額限制,並可透過自架或 Cloudflare 中心在多台裝置間同步這些摘要。它提供會話級分解、歷史熱力圖、CSV/JSON 匯出以及高度可自訂的 UI,同時確保原始提示資料完全私密。

chidiwilliams/buzz

Buzz 是一款離線桌面應用,使用 OpenAI 的 Whisper 模型對音訊/影片(或 YouTube 連結)進行轉錄與翻譯。支援即時麥克風字幕、說話人識別、語音分離、多種硬體加速後端(CUDA、Apple-silicon、Vulkan)、匯出為字幕格式、可搜尋的檢視器、資料夾監視自動化、CLI 與外掛系統。可透過 DMG(macOS)、安裝程式(Windows)、Flatpak/Snap/AppImage(Linux)或 pip(Python)安裝。MIT 授權。

Arize-ai/phoenix

Arize Phoenix 是一個開源、自托管的 AI 可觀測性平台,可讓您追蹤、評估、實驗與除錯 LLM 應用。它支援多種框架(LangChain、OpenAI Agents、Claude 等)與提供者(OpenAI、Anthropic、Bedrock、Google GenAI 等),透過 OpenTelemetry/OpenInference 儀器化實作相容。

HAKORADev/VODER

VODER 是一個本地、離線、專業級語音處理工具包,整合了 8 種模式——語音轉文字、文字轉語音、語音轉換、音樂生成、語音增強、音效、人聲分離與說話人分離——並附帶 Project Eva DLC,支援圖像/影片/3D 生成與無限制聊天。它完全運行在您的裝置上,支援 CPU 或 GPU,使用 Whisper、Qwen3-TTS、Seed-VC 等開源模型。

resemble-ai/chatterbox

一個開源文字轉語音模型家族,支援在 GPU 與 CPU 上部署,提供低延遲語音克隆與跨多種模型尺寸的多語言語音生成。

XiaoMaColtAI/math-modeling-skill

一個開源AI代理技能,將數學建模競賽工作流程結構化為分析、編碼、論文三個階段,支援Python/MATLAB,生成出版級圖表,保障可重現性,並輸出帶內建品質檢查子代理的Word/LaTeX論文。包含DeepSeek Harness外掛與完整測試套件。

huggingface/speech-to-speech

一個低延遲、模組化的語音代理流程,協調 VAD、STT、LLM 和 TTS 組件,實現即時語音對話。

makecindy/cindy

Cindy 是一個開源、跨平台的 AI 代理客戶端(Electron 桌面 + React-Native 行動),整合多個 LLM Harness(Claude Code、Codex 等),支援本地檔案存取、瀏覽器/作業系統控制、持久記憶與可擴展的「技能」。程式碼庫包含客戶端程式碼、共享 TypeScript 套件與建構/執行應用的工具;後端服務位於其他位置。支援雲端後端使用(透過 Cindy 帳號)與完全本地代理(跳過登入)。授權條款為 Apache-2.0。

QwenAudio/CosyVoice

CosyVoice 是一個先進的基於 LLM 的文本轉語音系統,旨在實現高品質、零樣本的多語言語音合成與聲音克隆。

yuanbw2025/storyforge

StoryForge 是一個開源、基於瀏覽器的 AI 輔助敘事創作套件。它讓你能夠撰寫長篇或短篇小說,轉換為劇本或漫畫,並將世界設定轉化為可遊玩的體驗(跑團、聊天、文字冒險等)。所有資料預設儲存在本地(IndexedDB),你需自行提供 LLM API 金鑰。平台包含一個版本感知的「Harness」層,記錄每次 AI 呼叫、管理記憶檢索,並強制作者確認採用,確保章節間及衍生產品間的長期一致性。

visualbruno/3DGenStudio

3D Gen Studio 是一個開源、由 AI 驅動的桌面/網頁應用程式,可讓您端到端地建立 3D 資產。它結合了看板或節點圖形介面與 ComfyUI 工作流程及外部 3D 生成 API,提供從圖像到網格的流程、自動 UV/重拓撲、AI 自動骨骼化(SkinTokens + 可選 Kimodo 動作)、LOD/優化,以及遊戲就緒檢查——所有內容皆本地儲存在磁碟上。

breezeblue-ai/breeze-tts

Breeze TTS 2 是一個開放權重的雙語文字轉語音模型,專為即時互動而設計,具有自然語言語音設計和超低延遲串流傳輸功能。

leo-lilinxiao/codex-autoresearch

Codex‑autoresearch 是一個基於 Git 的 Codex 技能,執行自主循環:提出單一程式碼變更,提交,測量數值指標(如測試失敗數),若指標改善且通過可選保護則保留變更,否則回滾。重複此過程直至使用者指定目標達成,儲存不可變事件日誌與 HTML 報告。支援前臺或背景執行,適用於任何可度量結果,並強制執行嚴格安全(所有試驗均為真實提交,失敗時以清晰錯誤中止)。

liliu-z/stashbase

StashBase 是一個本地優先的桌面應用程式,可從你的個人檔案(PDF、文件、圖片、錄音等)建立一個可搜尋、連結的 Markdown 維基,並讓 AI 代理將其作為上下文使用。它提供語意搜尋、OCR/轉錄功能,並與 OpenQuill、Claude Code、Codex 或任何 MCP 相容的客戶端整合,同時將所有原始檔案保留在你的機器上。

OpenMOSS/MOSS-Transcribe-Diarize

一個端對端音訊理解模型,可在單次處理中聯合完成長時多說話人音訊的語音轉錄與說話人分離。