altic-dev/FluidVoice

一款适用于 macOS 的开源语音转文字输入应用,支持本地 AI 转录和系统语音控制。

index-tts/index-tts

一种零样本文本转语音系统,可以通过单个音频剪辑克隆声音,并对五种语言的情感、语速和发音进行精细控制。

fastapi/fastapi

FastAPI 是一个高性能、基于类型提示的 Python Web 框架,用于构建 API。它提供自动验证、序列化和交互式 OpenAPI 文档,开发快速且可直接投入生产。

bethington/ghidra-mcp

Ghidra MCP Server 是一个生产就绪的桥接器,通过 Model Context Protocol 公开 Ghidra 的完整逆向工程引擎(反编译、P-code 模拟、实时调试、结构创建等)。它提供 253 个读写工具、批处理优化操作、AI 导向的文档工作流程,并支持通过 stdio、HTTP 或 SSE 传输进行无头模式 (headless)、Docker 或 GUI 部署。

OpenByteInc/QuantDinger

QuantDinger 是一个开源、自托管的 AI 增强型交易操作系统。它允许你编写 Python 策略,进行回测,运行纸交易模拟,并可选地在加密货币交易所和传统券商执行真实订单。平台集成多个 LLM 提供者用于市场研究,提供 Flask-Gunicorn API、Docker-compose 部署、可选的 Prometheus/Grafana 可观测性,以及用于 AI 驱动自动化的安全令牌式 Agent Gateway。

Significant-Gravitas/AutoGPT

AutoGPT 是一个用于构建、部署和管理自主 AI 代理的开源平台。用户可以用简单的英文描述目标或以可视化方式组装工作流程;系统会创建一个由 LLM 驱动的代理,与 45 种以上的集成服务(如 Gmail、Slack、GitHub 等)交互,以完成撰写报告、分类事件或生成营销文案等任务。该项目提供付费托管服务和免费的自托管 Docker 设备,核心平台采用 Polyform Shield 授权,经典代理代码则采用 MIT 授权。

stemdeckapp/stemdeck

一款免费的本地音频分轨分离工具,使用 Demucs 将歌曲拆分为独立音轨(如人声和鼓),提供 DAW 风格混音器,支持本地播放和导出。

QwenAudio/qwen-audio-agent

一个实时语音运行时,允许AI代理在同时执行复杂的后台任务时与用户保持持续对话。

Gentleman-Programming/gentle-shell

gentle-shell™ 是一个通过 npm 分发的终端 UI,可在 Pi 开发环境中运行基于 LLM 的编码代理。它提供统一的工作区,展示任务、变更和代理层级,支持轻量级的有机驱动开发(ODD),并可选地支持正式的规范驱动开发(SDD),在变更应用前提供原生的变更差异审查。可通过可选的配套包扩展功能,使用 `pi install npm:gentle-pi@2.6.0` 安装,并通过 `pi` 命令启动。

risa-labs-inc/BossConsole

BossConsole (BOSS) 是一款用于 AI 代理的开源、跨平台桌面工具。它基于 Kotlin Multiplatform 和 JVM 构建,提供原生编辑器、嵌入式 Fluck 浏览器、可共享终端、Git/Docker/K8s 工具以及插件“Toolbox”。所有功能均以 MCP 工具 (`mcp__boss__*`) 形式公开,任何模型(Claude Code、Codex、Gemini、OpenCode 等)皆可调用,并具备细粒度的 RBAC、单工具停用开关及签名插件机制。热重载功能让代理能在运行时演进新工具。可通过 Homebrew、脚本或 OS 软件包安装;采用 Apache-2.0 授权。

MengTo/Skills

一个基于 Markdown 的 123 种“技能”库,为 AI 编码代理(如 Codex、Claude、Cursor 等)提供分步骤、版本化的提示词/工作流程配方。每个技能都位于 `agent-skills/<category>/<skill>/SKILL.md`,并可能包含演示、资源和参考链接。该仓库让开发者能将提示词视为可重复使用的代码资产,实现可重复的 UI 设计、Web-GL、Three.js 游戏和媒体生成工作流程。采用 MIT 授权,可作为任何 LLM 驱动开发工具的上下文加载。

kirodotdev/KiroCrew

Kiro Crew 是一个开源、本地部署的 AI 代理平台,可在重启后保持代理状态(记忆、经验、技能)持续存在,支持长时间运行或定时任务的无人值守执行,并可通过桌面应用、Web 仪表板、CLI 或聊天集成(Slack、Discord 等)访问。可通过一行脚本、Docker 或原生桌面包安装;Gateway 进程将所有数据本地存储,并强制执行沙箱和审批策略。

modelscope/FunASR

适用于离线、流式和边缘部署的工业级语音识别工具包,提供 ASR、VAD、标点恢复和说话人分离的统一流水线。

zubair-trabzada/geo-seo-claude

一个 Claude Code 技能,审计网站在 AI 搜索(GEO)中的可见性,评分引用性、品牌信号、内容质量、技术 SEO 和结构化数据,并生成 Markdown 或 PDF 客户端报告。

thewh1teagle/vibe

一款使用 Whisper 等 AI 模型在本地设备上将语音转换为文本的私密离线音频和视频转录工具。

Gentleman-Programming/engram

Engram 是一个单二进制 Go 程序,为 AI 编码代理(Claude Code、Gemini CLI、VS Code Copilot、Cursor 等)提供持久、可搜索的记忆存储(SQLite + FTS5)。它通过 CLI、HTTP API、MCP 或终端 UI 与任何 MCP 兼容代理(如 Claude Code、Gemini CLI、VS Code Copilot、Cursor 等)协作。该工具零依赖,支持本地优先存储,可选云复制,并提供丰富的记忆命令(`mem_save`、`mem_search`、`mem_context`、`mem_session_summary` 等),使代理能在会话和团队间记住决策、错误修复和设计理由。

modelbus/one-api-pro

OneAPI Pro是一个基于Go的开源AI API网关,具有Vue 3管理UI。它统一了对许多LLM提供商的访问,添加了令牌/角色管理、订阅计费、使用仪表板,并支持去中心化多节点集群。可作为静态二进制文件或Docker镜像部署。

ggml-org/whisper.cpp

whisper.cpp 是 OpenAI Whisper 语音转文字模型的纯 C/C++ 实现。它可在 CPU 及多种加速器(Apple Silicon、NVIDIA CUDA、AMD ROCm、Intel OpenVINO 等)上离线运行,支持混合精度与量化模型,并提供简单的 C-API 及语言绑定,方便整合至桌面、移动设备、嵌入式及网页平台。

echo-loop/Echo-Loop

一个AI驱动的英语听力与口语训练应用,通过自动化科学学习循环(精听、仿读、复述)结合间隔重复,实现高效学习

ace-step/ACE-Step-1.5

ACE‑Step 1.5 是一个开源音乐生成基础模型,结合语言模型规划与 Diffusion‑Transformer 音频解码器。它可在 RTX 3090 上于 10 秒内生成 10 秒至 10 分钟的完整歌曲,基础模型运行仅需 <4 GB VRAM,支持从少量曲目进行 LoRA 微调。仓库提供 Gradio 和 REST 接口、适用于所有主流操作系统的启动脚本、多种模型尺寸(含 4 B XL 版本),并支持对歌词、风格、节奏、乐器的精细控制。

michael-denyer/pstack-claude

pstack‑claude 是一个 MIT 许可的插件,为 Claude Code 提供了 54 个可复用的“Agent Skills”(例如 TDD、CI 修复、PR 总结),并通过共享技能目录供 Codex、Prime Agent、opencode 和 Gemini‑CLI 使用。它会在 Claude 会话中自动注入 poteto‑mode 指令,为 Codex 提供生成的斜杠命令存根,并包含 CI 以保持技能集与上游 Cursor 版本同步。

lightpanda-io/browser

Lightpanda Browser 是一个用 Zig 编写的轻量级无头浏览器,专为 AI 智能体和大规模 Web 自动化而构建。它运行完整的 V8 JavaScript 引擎,提供 CDP 和 WebDriver BiDi 接口,并包含一个“智能体”模式,允许 LLM 通过纯英语任务控制浏览器,并记录确定性的 JavaScript 脚本。基准测试声称其内存比无头 Chrome 低约 16 倍,页面加载速度快约 9 倍。可通过 Homebrew、AUR、直接二进制文件或 Docker 安装,支持 Linux/macOS(Windows 使用 WSL2),并与主要 LLM 提供商集成。该项目采用 MIT 许可证,经过积极测试(单元测试、端到端测试、Web Platform Tests),并由社区 Discord 支持。

m-bain/whisperX

通过批处理推理、词级时间戳和说话人日志功能增强 OpenAI Whisper 的快速自动语音识别系统。

rafal-qa/slopo

Slopo 是一个基于 Python 的 CLI,它使用代码嵌入模型(Jina AI, Voyage AI, 或本地 Ollama)来查找仓库中语义相似的代码片段。它会对源文件进行索引,计算向量嵌入,对相似片段进行聚类,并输出 Markdown 或紧凑型报告,供人类审查或 AI 编程助手使用。安装方式为 `uv tool install slopo`;配置通过 `slopo init` 完成。该工具针对隐藏的、非精确的代码重复,以辅助重构并减少 AI token 使用量。

NVIDIA/skills

NVIDIA Agent Skills 是一个可移植的指令集(技能)目录,用于教导 AI 编码代理(Claude Code、Codex、Cursor 等)如何安装、配置和使用 NVIDIA 软件,如 cuDF、cuOpt、DeepStream、Jetson、NeMo、DOCA 等。技能通过开源 `skills` CLI(`npx skills add nvidia/skills …`)安装,并可针对特定代理。该仓库镜像了产品仓库中的技能定义,并通过自动化同步管道保持最新。

OpenMinis/OpenMinis

OpenMinis 是一个开源移动 AI agent (iOS + Android) ,让你可以通过设备端运行任何 LLM (Claude, GPT, Gemini 等) 。它内置了一个沙盒化的 Alpine Linux shell (iSH on iOS, PRoot on Android) ,使得 agent 可以安装软件包、运行脚本并操作文件,同时还将原生设备服务 (Health, Calendar, HomeKit, Bluetooth, clipboard, media, etc.) 作为工具暴露出来。 用户可以通过创建可重用的 “skill” 文件夹 (包含 `SKILL.md` 和可选脚本) 并将工作组织在独立的 workspaces 中。 典型用例包括营养摄入记录、早晨简报、从聊天中提取任务、同步 Obsidian 并通过分享功能自动化生成日历事件。 代码库是 iOS 端的 Swift/SwiftUI,Android 端的 Kotlin/Compose,且采用 GPL-v3 许可。

Gnosil/semantix

Semantix 是一个基于 Go 的 CLI 工具,为 LLM 编码代理程序增加了跨会话记忆功能。它从已完成的会话中提取可重用的“片段”(slices),将它们存储在本地,并在后续任务中将匹配的片段作为字节稳定的前缀注入,以提高供应商提示缓存命中率并降低推理成本。它可以作为完整代理程序 (`semantix-agent`) 运行,或通过工具注册、中间件或网关作为附加到现有代理程序的核心。该项目报告在演示中实现了高缓存命中率(高达 99.8%)和约 80% 的成本节省,并与 Claude Code、LangChain 以及任何兼容 OpenAI 的客户端集成。

MaxHu-xuan/chat-archive-guard

ChatArchiveGuard 是一个纯 Python CLI,可在本地扫描聊天导出文件(文本、JSON/JSONL、SQLite)以查找秘密/PII 模式、格式错误和 SQLite 完整性,报告聚合计数和覆盖标志,而无需修改或上传数据。

trailofbits/skills

Trail of Bits Skills 是一个 Claude Code/Codex 插件市场,添加了数十个安全导向的“技能”(例如静态分析、智能合约审计、YARA 规则编写、变异测试)。通过一条 `/plugin marketplace add trailofbits/skills` 命令即可安装,然后从 LLM 中调用单个插件来执行具体分析并获得结构化结果。

cubeplexai/cubeplex

CubePlex 是一个开源、云原生平台,允许团队在隔离且持久的工作区中运行托管 AI 代理。它提供多模型聊天、可重用技能、作用域记忆、工具连接器、IM 集成和内置治理功能,可通过 Docker Compose 或 Helm/Kubernetes 部署。

coldteadotai/pr-lens

PR Lens 是一个 GitHub 集成工具,可将拉取请求的差异转换为动画架构图和数据流图。可通过 GitHub App、CI Action、本地 CLI 或编码代理技能使用,并通过 `.github/pr‑lens.yml` 文件进行配置。视觉输出帮助审查者在深入代码前理解变更的范围和影响。

k2-fsa/sherpa-onnx

一个可在多种硬件和操作系统上本地运行语音识别、语音合成及其他音频 AI 功能的可移植框架。

vshulcz/deja-vu

deja‑vu 是代码生成代理(Claude Code、Codex、Cursor、Copilot 等)的本地专用记忆层。它索引这些代理已写入的会话日志文件,构建快速可搜索的索引,并自动将相关过往决策注入任何代理会话。功能包括事后自然语言搜索、跨代理召回、压缩感知持久化、状态追踪、过时警告、机器间同步/交接,以及自动脱敏秘密。可通过一行脚本、Homebrew、Scoop、Go 或 NPM 安装;`deja install --auto` 会将一个微型 MCP 服务器接入检测到的代理。使用 `deja "jwt refresh token"`、`deja wip`、`deja blame <file>`、`deja sync ssh <host>` 等命令,还可通过本地 LLM 实现可选语义嵌入。所有处理均在本地机器完成,内置隐私保护机制。

Javis603/token-monitor

Token Monitor 是一个跨平台桌面小部件,可读取 35+ AI 编码助手的本地日志和 API 密钥余额,显示实时令牌使用量、成本和配额限制,并可通过自托管或 Cloudflare 中心在多台设备间同步这些摘要。它提供会话级分解、历史热力图、CSV/JSON 导出以及高度可定制的 UI,同时确保原始提示数据完全私密。

chidiwilliams/buzz

Buzz 是一款离线桌面应用,使用 OpenAI 的 Whisper 模型对音频/视频(或 YouTube 链接)进行转录和翻译。支持实时麦克风字幕、说话人识别、语音分离、多种硬件加速后端(CUDA、Apple-silicon、Vulkan)、导出为字幕格式、可搜索的查看器、文件夹监视自动化、CLI 和插件系统。可通过 DMG(macOS)、安装程序(Windows)、Flatpak/Snap/AppImage(Linux)或 pip(Python)安装。MIT 许可证。

Arize-ai/phoenix

Arize Phoenix 是一个开源、自托管的 AI 可观测性平台,可让您追踪、评估、实验和调试 LLM 应用。它支持多种框架(LangChain、OpenAI Agents、Claude 等)和提供商(OpenAI、Anthropic、Bedrock、Google GenAI 等),通过 OpenTelemetry/OpenInference 仪器化实现兼容。

HAKORADev/VODER

VODER 是一个本地、离线、专业级语音处理工具包,整合了 8 种模式——语音转文字、文字转语音、语音转换、音乐生成、语音增强、音效、人声分离和说话人分离——并附带 Project Eva DLC,支持图像/视频/3D 生成和无限制聊天。它完全运行在您的设备上,支持 CPU 或 GPU,使用 Whisper、Qwen3-TTS、Seed-VC 等开源模型。

resemble-ai/chatterbox

一个开源文本转语音模型家族,支持在 GPU 和 CPU 上部署,提供低延迟语音克隆和跨多种模型尺寸的多语言语音生成。

XiaoMaColtAI/math-modeling-skill

一个开源AI代理技能,将数学建模竞赛工作流程结构化为分析、编码、论文三个阶段,支持Python/MATLAB,生成出版级图表,保障可复现性,并输出带内置质量检查子代理的Word/LaTeX论文。包含DeepSeek Harness插件和完整测试套件。

huggingface/speech-to-speech

一个低延迟、模块化的语音代理流水线,协调 VAD、STT、LLM 和 TTS 组件,实现实时语音对话。

makecindy/cindy

Cindy 是一个开源、跨平台的 AI 代理客户端(Electron 桌面 + React-Native 移动),集成了多个 LLM Harness(Claude Code、Codex 等),支持本地文件访问、浏览器/操作系统控制、持久记忆和可扩展的“技能”。仓库包含客户端代码、共享 TypeScript 包和构建/运行应用的工具;后端服务位于其他位置。支持云后端使用(通过 Cindy 账户)和完全本地代理(跳过登录)。许可证为 Apache-2.0。

QwenAudio/CosyVoice

CosyVoice 是一个先进的基于 LLM 的文本转语音系统,旨在实现高质量、零样本的多语言语音合成和声音克隆。

visualbruno/3DGenStudio

3D Gen Studio 是一个开源的、AI 驱动的桌面/Web 应用,让你能够端到端地构建 3D 资产。它结合了 Kanban board 或 node-graph UI 与 ComfyUI 工作流和外部 3D 生成 API,提供图像转网格流水线、自动 UV/重拓扑、AI 自动绑定 (SkinTokens + 可选的 Kimodo 动作生成)、LOD/优化、以及游戏就绪验证——所有内容都存储在本地磁盘上。

breezeblue-ai/breeze-tts

Breeze TTS 2 是一个开放权重的双语文本转语音模型,专为实时交互而设计,具有自然语言语音设计和超低延迟流式传输功能。

leo-lilinxiao/codex-autoresearch

Codex‑autoresearch 是一个基于 Git 的 Codex 技能,运行自主循环:提出单个代码变更,提交,测量数值指标(如测试失败数),若指标改善且通过可选保护则保留变更,否则回滚。重复此过程直至用户指定目标达成,存储不可变事件日志和 HTML 报告。支持前台或后台执行,适用于任何可度量结果,并强制执行严格安全(所有试验均为真实提交,失败时以清晰错误中止)。

liliu-z/stashbase

StashBase 是一个本地优先的桌面应用,可从你的个人文件(PDF、文档、图像、录音等)构建一个可搜索、链接的 Markdown 维基,并让 AI 代理将其作为上下文使用。它提供语义搜索、OCR/转录功能,并与 OpenQuill、Claude Code、Codex 或任何 MCP 兼容客户端集成,同时将所有原始文件保留在你的机器上。

OpenMOSS/MOSS-Transcribe-Diarize

一个端到端音频理解模型,可在单次处理中联合完成长时多说话人音频的语音转录与说话人分离。

Edge0-AI/Audio8_TTS

提供 0.6B 和 0.1B 参数版本的紧凑型多语言文本转语音模型,支持零样本语音克隆,实现高效语音合成。