edison7009/EchoBird

EchoBird 是一个基于 Tauri + Rust 的跨平台桌面应用,让您通过单一 UI 安装、启动和管理多种 AI 编码助手、聊天代理和本地 LLM 运行时。其核心功能——**Model Nexus**——只需一次保存提供者凭据,即可自动重写每个工具的原生配置,实现一键切换所有地方的模型。

OpenMOSS/MOSS-TTS-Nano

一个拥有 0.1B 参数的多语言、超小型语音生成模型,专为实时 CPU 推理和高保真语音克隆设计。

liustack/modsearch

ModSearch 是一个插件,为 LLM 聊天应用(尤其是 DeepSeek Harness)添加免费的实时网页和 X(Twitter)搜索功能。它默认使用 Firecrawl 的免密钥层级(每月 1,000 个免费积分),并可回退到 Antigravity CLI、Tavily、Exa、Grok 或本地抓取器,支持自动密钥轮换和配额处理。通过单个 `npx` 命令安装,然后只需让模型搜索或抓取页面;该技能返回包含来源和不确定性标志的结构化 JSON 响应。

OpenLAIR/dr-claw

开源、模型无关的 AI 研究助手,通过 Web UI、CLI 或桌面应用管理完整的论文写作流程(调研 → 代码 → 分析 → 草稿 → 幻灯片)。支持 Claude Code、Gemini、Codex 或任何 OpenRouter 模型;内置 100+ 个“研究技能”,提供新闻流、Git 集成和一键自动研究模式。

hehehai/voxt

一款可在所有应用程序中提供实时转录、AI 翻译和语音提示驱动文本重写的 macOS 语音输入与翻译应用。

Blaizzy/mlx-audio

一个针对 Apple Silicon 的音频处理库,为文本转语音、语音转文本、语音转语音和音乐生成模型提供快速、高效的推理。

langchain-ai/langchainjs

LangChain.js 是一个用于构建使用大语言模型应用的 TypeScript 框架。它提供模块化组件(代理、模型、检索器等)、多种集成以及用于快速原型设计和生产监控的工具,并支持 Node、浏览器、边缘运行时等。

erupts/erupt

Erupt 是一个注解驱动的 Java 管理框架,可从 JPA 实体自动生成完整的 CRUD UI。它包含内置的 AI 模块(`erupt-ai` 和 `erupt-ai-claw`),支持多提供商 LLM 集成、基于角色的工具安全、聊天历史记录和自然语言控制服务器。快速启动、丰富的 UI 组件、RBAC、多数据库支持以及可选的商业扩展,使其成为在 Spring Boot 上构建 AI 增强型管理面板的开箱即用解决方案。

peteonrails/voxtype

Voxtype 是一款开源、采用 MIT 许可的 Linux 应用,提供本地、实时的语音转文本听写功能。它支持运行快速的 CPU 模型(Cohere Transcribe 运行速度比实时快 9-11 倍),并支持 GPU/Intel NPU 加速、九种可互换的转录引擎、多语言支持、会议模式转录、以及深度的桌面集成(Wayland/X11, 热键绑定, 自动暂停媒体, 波形 OSD)。除非用户选择使用远程服务器,否则所有处理过程都保留在本地机器上。

denizsafak/abogen

使用 Kokoro-82M 模型将 ePub、PDF 和文本文件转换为带有同步字幕的高质量音频的文本转语音转换工具。

AbdoKnbGit/tau

Tau 是一个基于 CLI 的编码助手,将 28 个 LLM 提供商(Claude、OpenCode、Mistral 等)统一在单一界面下。它提供原生 API 适配器、文件编辑、LSP 诊断、基于快照的撤销、浏览器自动化、通过 WhatsApp 或 Cloudflare 隧道的远程控制、子代理、GitHub 集成以及自学习规则系统。通过一条 `npx` 命令安装,登录,选择模型,下达自然语言任务即可使用。该工具采用 MIT 许可证,但需要较新的 Node、Git、Bash、GitHub CLI,以及可选的 Go 用于原生助手。

NeptuneHub/AudioMuse-AI

AudioMuse‑AI 是一个开源、自托管的应用程序,通过分析您音乐收藏的实际音频来创建基于声音的指纹。利用这些指纹,它可以聚类相似曲目、生成即时情绪导向播放列表、将整个音乐库映射到2D可视化画布,并回答自然语言查询。它支持 Navidrome、Jellyfin、LMS、Lyrion、Emby 和 Plex,可通过 Docker-Compose、Helm 图表或原生 macOS/Windows/Linux 包运行。

mkiol/dsnote

一款注重隐私的笔记应用,适用于 Linux 和 Sailfish OS,提供离线语音转文本、文本转语音和机器翻译功能。

HaujetZhao/CapsWriter-Offline

适用于 Windows 的完全离线、低延迟语音转文本输入工具,利用本地 ASR 模型实现按下即说输入和文件转录功能。

TheDeathDragon/LiveTranslate

一款适用于 Windows 的实时音频翻译工具,可捕获系统音频和麦克风输入,通过 LLM 驱动的叠加层提供实时翻译字幕。

langchain-ai/open-swe

Open SWE 是一个基于 LangChain 的框架,可运行自主的 AI 代理来规划、编写、测试、审查和交付代码变更。它与 GitHub、Slack、Linear 和 Web 仪表板集成,使用隔离的沙箱(LangSmith、Modal 等),并完全可自定义和自托管。

davebcn87/pi-autoresearch

pi-autoresearch 是一个 pi-agent 扩展,让 AI 编程助手能够针对任何可测量的目标执行自主优化循环(编辑-提交-基准测试-保留/还原),将状态持久化于 .auto/ 文件夹中,并提供实时小工具/仪表板、置信度评分、可选的检查与钩子,以及创建可供审查之 git 分支的最终化步骤。

QwenAudio/SenseVoice

一个高精度、低延迟的语音基础模型,提供多语言语音识别、情绪检测和音频事件识别。

KittenML/KittenTTS

一个轻量级、基于 ONNX 的文本转语音库,能在 CPU 上提供高质量的语音合成,且模型大小仅为 25MB。

mezmo/aura

AURA 是一个开源平台,允许您在自有基础设施中运行 AI 驱动的 SRE 代理。它提供可配置的多代理运行时,可调用工具、查询可观测性系统并执行安全操作,同时将数据和模型使用完全置于您的控制之下。

Anionex/banana-slides

Banana Slides 是一个开源的AI驱动应用,可将想法、大纲或上传的文档转化为完全可编辑的PowerPoint演示文稿。它使用LLM(Gemini、OpenAI、Claude等)进行文本生成,使用图像生成模型创建图形,支持自然语言“氛围”编辑、自定义模板、多格式导入、PPTX/PDF导出,以及可选的带旁白的视频输出。可通过Docker、一键云模板或桌面二进制文件部署,适用于任何希望快速生成高质量幻灯片的用户。

razzant/claudexor

Claudexor 是一个本地优先的 Node.js 控制平面,将多个 AI 编码服务(Codex、Claude Code、Cursor 等)统一在单一类型化接口之下。它提供只读查询、生成补丁的写入轮次、跨模型审查的最佳 N 选一竞赛、带实时配额追踪的凭证配置文件、受保护文件的确定性门控,以及 macOS 桌面应用。所有状态均存储在您的机器上,无遥测数据,系统可通过 SSH 远程运行。项目持续维护(v3.10.2),专为需要可审计、成本可控的 AI 辅助编码的开发者或代理设计。

nazdridoy/kokoro-tts

一款使用 Kokoro 模型的 CLI 文本转语音工具,可将文本、PDF 和 EPUB 转换为自然语音,支持语音混合和流式传输。

ilyhalight/voice-over-translation

一款浏览器扩展,为各种网站上的视频添加实时语音翻译和AI字幕,使用户能够以母语观看外语内容。

dyoshikawa/rulesync

Rulesync 是一个 Node.js CLI,用于集中管理 AI 助手配置。您编写统一的 `.rulesync/` 规则文件,该工具即可为数十个 AI 编码工具(Claude、Copilot、Cursor 等)生成、导入、导出或转换原生配置文件。可通过 npm、Homebrew 或单二进制脚本安装。功能包括选择性生成、广泛工具支持、弃用处理和程序化 API。MIT 许可证。

espeak-ng/espeak-ng

使用共振峰合成技术,支持超过 100 种语言,内存占用极小的紧凑型开源文本转语音合成器。

qufei1993/skills-hub

Skills Hub 是一个基于 Tauri 的桌面应用,用于集中管理 AI 编码“技能”(提示词/智能体捆绑包),并通过符号链接或副本将它们同步到许多 AI 编码工具(如 Cursor、Claude Code、Codex 等)的全局或项目级技能文件夹。它提供探索安装、打标签、批量操作、回收站、基于 Git 的自动设备同步和计划更新,所有功能均可通过多语言 UI 进行配置。

VocaHQ/vocalinux

一个注重隐私的 Linux 语音转文字应用,使用 Whisper 和 VOSK 等引擎在本地设备上将语音转换为文本。

openai/openai-python

OpenAI API 的官方 Python SDK,提供同步/异步客户端、聊天、补全、视觉、实时音频、流式传输、分页、文件上传、Webhook 验证,以及现代工作负载身份认证(K8s、Azure、GCP、X.509)的完整类型检查支持。

SamurAIGPT/llm-wiki-agent

LLM Wiki Agent 是一个本地、代理驱动的系统,可导入 PDF、DOCX、Markdown 等文件,提取实体与概念,构建不断增长的相互链接的 Markdown 维基,标记矛盾,并生成可视化知识图谱——无需服务器或数据库。

awslabs/mcp

开源 MCP(模型上下文协议)服务器,使 LLM 驱动的工具能够获取实时 AWS 文档、IaC 指导,并安全调用 AWS API。包含托管远程服务器和本地二进制文件(文档、IaC、EKS 等),均通过基于 stdio 的协议访问。

AVIDS2/memorix

Memorix 是一个 Node.js 库,为任何 AI 编码助手添加本地优先、可搜索的内存存储。它将事实、设计理由和 Git 派生的洞察持久化到 SQLite 数据库中,通过 MCP、CLI 和可选的 Web UI 暴露。通过安装单个 `memorix setup --agent <name>` 命令,数十个助手(Claude Code、Codex、Copilot CLI、Cursor、Gemini CLI 等)可以共享同一项目范围的内存,实现更顺畅的交接、更好的上下文保留和多助手编排。

rampstackco/claude-skills

一个真正的开源库,包含 103 个 Claude Skills,涵盖品牌、设计、内容、SEO、产品管理、增长和运营。Skills 是可重复使用的提示加元数据包,Claude 可以按需加载,实现端到端的 AI 驱动工作流程,用于构建、启动和优化网站。

remsky/Kokoro-FastAPI

一个为 Kokoro-82M TTS 模型提供 OpenAI 兼容 API 的 Docker 化 FastAPI 封装,支持高质量、多语言语音生成。

TeamWiseFlow/xiaobei

xiaobei(小贝)是一款面向中国自媒体运营者的AI驱动个人助理。它基于开源**openclaw**框架构建,让用户通过简单的微信聊天即可在多个平台(微信、小红书、抖音、Twitter等)创建、格式化和发布文章、图片和短视频。它还提供趋势分析、表现监控、24/7 AI客服、市场调研搜索和商业文档生成。安装是一行脚本,下载预构建的tarball;扫描二维码后机器人即可使用。系统运行在Ubuntu/macOS/Windows上,使用阿里云百炼大模型API(或替代方案),并包含自定义反检测浏览器栈(camoufox)以实现可靠自动化。可选付费“VIP俱乐部”提供高级支持和服务。

homelab-00/TranscriptionSuite

一款免费开源的转录应用,使用多种 AI 模型在本地计算机上将语音转换为文本,兼顾隐私与速度。

NoFxAiOS/nofx

NOFX 是一个开源的自托管交易终端,允许大语言模型生成加密货币永续合约交易。Go 运行时执行严格的风险限制,存储模型生成的每条推理,并支持 9 个交易所。用户可以为链上 AI 费用钱包注资,启动“Autopilot”让模型自动交易,并可以在公开排行榜上比较多个交易员。可以通过一键脚本、Docker、Railway 或手动构建进行安装。

coddingtonbear/obsidian-local-rest-api

一个 Obsidian 插件,运行本地 HTTPS REST API 和 Model-Context-Protocol 服务器,使脚本、浏览器扩展和 AI 代理能够对您的知识库执行完整的 CRUD、目标 Markdown 补丁、搜索、命令执行等操作。认证通过贝拉令牌和自签名证书实现;插件还提供 Claude 和 Cursor 的预设 MCP 配置。

matthartman/ghost-pepper

一款面向 macOS 的隐私保护型设备端语音转文字及会议转录应用,使用本地 AI 模型以确保数据不会离开设备。

crosswk/SayIt

一款适用于 Windows 的开源语音输入工具,可将语音转录并利用 AI 进行清理,将优化后的文本直接插入任意应用程序中。

aiworkskills/wechat-article-skills

一个开源的AI代理技能集合,可自动化完成撰写、审阅、格式化、配图和发布WeChat公众号文章的端到端工作流,同时在每个步骤暂停等待用户确认。

tanweai/pua

pua 是一个跨平台技能,将企业风格的“绩效改进计划”(PUA/PIP)语言和 7 点调试检查清单注入 AI 编码助手(Claude Code、OpenAI Codex、Cursor、Kiro 等)。当模型表现出懒惰模式(重试、责怪用户、被动等待)或用户手动输入 `/pua` 时自动触发。该技能强制模型穷尽解决方案、验证结果并主动行动,提供中文、英文(PIP 风格)和日文语言包。在少量 bug 上的基准测试显示修复数和验证次数增加,但速度提升有限。安装通过各工具的插件/技能系统完成(例如,Claude Code 使用 `npx skills add tanweai/pua --skill pua-en`)

owainlewis/machinist

Machinist 是一个基于 Go 的 CLI,允许您定义命名的 AI 编码命令(例如,从问题生成 PR),并使用任何兼容 LLM 的可执行文件在本地运行。它将仓库、凭证和模型配置保留在工作器上,流式输出完整日志,强制执行超时,并始终返回一个拉取请求供人工审查。非常适合可重复、可审计的 AI 辅助编码工作流。

pipeshub-ai/pipeshub-ai

PipesHub 是一个开源、可自托管的平台,可将 LLM 与企业数据(Slack、Google Drive、GitHub 等)连接。它构建权限感知的知识图谱,提供带引用的可解释答案,通过 LangChain 支持任意 LLM,拥有 50+ 连接器、多模态文档处理、无代码代理构建器,以及 Python、TypeScript、Go 的 SDK。可通过单个 Docker Compose 安装程序部署。

IAHispano/Applio

一款专注于简单与性能的高质量语音转换工具,提供灵活的语音转换平台。

dark-hxx/CLI-Manager

CLI‑Manager 是一个基于 Tauri 的桌面应用,将本地和 SSH 终端与 Claude Code、Codex 及其他 AI 编码代理统一起来。它提供实时钩子通知、实时 token/价格统计、支持差异视图的多源可搜索会话历史、使用情况分析、提供者切换、Git 工作树隔离、后台任务持久化,以及通过 Telegram/Feishu 实现的移动端聊天集成。

kizuna-ai-lab/sokuji

Sokuji 是一款跨平台桌面应用和浏览器扩展,为会议提供实时双向语音翻译。它可以利用设备上的 ASR、翻译和 TTS 模型(WASM + WebGPU)完全离线运行,也可以连接到 OpenAI、Gemini 和 Soniox 等云服务提供商。支持 99+ 种语言的识别,55+ 种语言的翻译,以及 53 种语言的 TTS,适用于 Windows/macOS/Linux 和 Chrome/Edge,并提供隐私优先的本地推理。

Moyf/moys-asr-workflow

利用AI ASR API对本地媒体进行语音识别,并提供专用编辑器以精修和导出字幕的工作流。