kyutai-labs/hibiki
Hibiki 是一个用于流式语音到语音翻译的模型,可在用户说话时实时生成自然的目标语音和文本。
woheller69/whisperIMEplus
一个使用 Whisper 引擎提供私密、离线语音识别和翻译的 Android 输入法编辑器(IME)。
deeeed/audiolab
一个适用于 React Native 和 Expo 的音频处理单体仓库,支持在 iOS、Android 和 Web 上实现本地语音识别(STT)、语音合成(TTS)和音频分析。
yaojingang/yao-open-skills
Yao Open Skills 是一个开源的可复用 AI「技能」目录——即用于决策分析、安全审计、教程创建和阅读报告可视化等任务的结构化提示+代码工作流。每个技能位于独立文件夹中,包含脚本、文档和多格式导出(Markdown、HTML、PDF 等)。该仓库提供注册表、发布规则和辅助脚本,以保持集合的整洁、版本化和公开可发现。
brummer10/guitarix
Guitarix 是一个仅限 Linux 的模块化虚拟吉他放大器,结合了经典 DSP 效果与基于 AI 的放大器模型(Neural Amp Modeler 和 RTNeural)。它可作为独立应用、VST3 或 LV2 插件运行,支持 MIDI 控制,甚至可在 Raspberry Pi 等设备上无头运行。README 提供了构建步骤、依赖项以及文档链接和基于 Docker 的容器化部署方案。
Wangnov/codex-threadripper
基于 Rust 的 CLI(也打包为 Homebrew、npm 和二进制文件),重写 Codex 的 SQLite 状态数据库和 rollout JSONL 日志,使你在更改 `model_provider` 后聊天线程仍保持可见。支持一次性同步、持续监视模式,以及 macOS、Linux 和 Windows 的可选后台服务安装。
getsentry/vitest-evals
vitest‑evals 是一个单体仓库,为 Vitest 添加 AI 友好的评估功能。它提供多种模型 SDK 的适配器、可重用的判断器(如事实性)、自定义 JSON 报告器、本地 React UI,以及可基于通过率或分数阻止 PR 合并的 GitHub Action。
linkerlin/PUAX
PUAX 是一个生产就绪的运行时,为 LLM 代理添加了一个思维模式层。它提供竞技场/门控/梦境原语、精简提示压缩、零依赖 Python SDK、混合触发检测、59 个内置(和自定义)角色、结果驱动验证、用于检测针对人类操纵的碳盾,以及可复现的多模型基准套件。该系统通过 MCP 服务器(`npx puax-mcp-server`)访问,该服务器将原生钩子注入流行的 IDE,并且可以通过一行 AMP 中间件直接嵌入 LangChain/AutoGen。MIT 许可并标记为生产就绪。
harry0703/AudioNotes
一款本地优先的音视频转录工具,可将录音转换为结构化 Markdown 笔记,并支持基于内容的 AI 驱动问答。
descriptinc/descript-audio-codec
一种将 44.1 kHz 音频压缩为 8 kbps 离散代码的高保真神经音频编码器,为语音、音乐和环境音提供约 90 倍的压缩率。
espressif/esp-sr
适用于 Espressif 芯片的语音识别框架,支持离线唤醒词检测、语音命令识别和音频预处理。
anthropics/anthropic-sdk-go
一个为 Anthropic 的 Claude API 提供轻量、符合 Go 习惯的封装的 Go SDK,使 Go 开发者能够直接从应用程序调用 Claude 模型(例如 Claude Opus 4.6)。通过 `go get` 安装,使用 API 密钥创建客户端,并调用 `Messages.New` 方法发送提示并接收响应。
wevm/incur
incur 是一个 TypeScript 库,可让你构建易于 LLM 代理发现和使用的命令行工具。它提供基于 Zod 的类型化命令定义、高效的 TOON 输出、内置 MCP 和技能文件生成,并能将 HTTP API 包装或暴露为 CLI 命令。
NVIDIA/NeMo-text-processing
一个用于文本归一化与反向文本归一化,用于为语音处理系统准备文本。
tony1223/better-agent-terminal
Better Agent Terminal (BAT) 是一个跨平台桌面应用(Windows/macOS/Linux),使用 Tauri 2 和 React 构建。它允许您管理多个项目工作区,每个工作区包含分屏终端、文件浏览器、Git 查看器、代码片段管理器以及嵌入式 AI 编码助手(Claude Code 或 OpenAI Codex)。AI 在应用内运行,提供流式输出、权限模式、会话恢复/分叉和详细的使用统计。可选集成 `cx` CLI,实现轻量级语义代码导航。可通过 Homebrew、AppImage 或一行脚本安装;也可使用 Rust 和 Node 从源码构建。适合希望在一个窗口中安全高效地运行命令并与 LLM 交互的开发者。
Optima-CityU/LLM4AD_Next
LLM4AD Next 是一个 Python 工具包,可将自然语言问题描述一键转换为完整、可运行的进化算法搜索项目。交互式 LLM 顾问生成代码骨架、配置和评估器,内置的进化方法(如 IslandGA、Diverse Island GA、EoH 等)自动演化生成的算法。还提供进化块建议、长期记忆支持、Docker 镜像和在线演示。
specula-org/Specula
Specula 是一个开源工具,利用 LLM 编码代理(Claude Code、Codex 等)自动为并发或分布式代码生成 TLA⁺ 规范,进行模型检查,并将发现的缺陷还原为源码级补丁。支持自动、CI 集成和交互模式,需要 Python 3.10+、Java 21+ 和高性能 LLM,采用 Apache 2.0 许可证发布。
shanggqm/codexU
codexU 是一个原生 macOS 菜单栏(和 Windows Tauri)应用,它读取本地 OpenAI Codex(以及可选的 Claude Code)数据,以显示配额百分比、令牌使用趋势、项目/技能排名、本地计算的 AI 领导力评分以及估算的 API 成本(“羊毛进度”)。所有处理都在用户机器上完成;不会上传任何使用数据。
clawdotnet/openclaw.net
OpenClaw.NET 是一个 .NET 原生 AI 代理运行时和网关。它提供兼容 NativeAOT 的可执行文件、基于 Web 的聊天/管理 UI、OpenAI 兼容 API、80 多个内置工具适配器、多渠道支持(Slack、Telegram 等),以及与云和本地 LLM 提供者(OpenAI、Claude、Gemini、DeepSeek、Ollama、嵌入式 Gemma-4)的顶级集成。可选的治理功能可让你审计并批准高风险工具操作。该项目面向希望构建一个自托管、可观测的 AI 代理平台、可在 Windows、macOS 或 Linux 上运行的开发者。
marswaveai/TypeNo
一款面向 macOS 的隐私优先本地语音转文本工具,可将语音直接转录并粘贴到任何活动应用程序中。
py-why/dowhy
DoWhy 是一个用于端到端因果推断的 Python 库。它允许你定义因果图,自动识别因果效应,使用多种统计方法进行估计,并运行反证测试以检查稳健性。该库还支持用于根本原因分析、反事实和干预采样的图形因果模型。通过 `pip install dowhy` 安装,并遵循四步工作流程(模型 → 识别 → 估计 → 反证)即可使用。
InternScience/InternAgent
InternAgent‑1.5 是一个用于长周期科学发现的开源自主代理框架。它能够生成假设、设计并运行(模拟)实验、通过 MLEvolve 核心优化算法,并利用深度研究管道回答研究问题。系统包含持久化记忆模块、用于算法发现和论文复现的任务套件,以及用于发现或问答模式的统一启动脚本。
Piebald-AI/claude-code-lsps
一个 LSP 服务器定义的市场,让 Claude Code(Anthropic 的 AI 编程助手)为数十种语言提供 IDE 类功能——跳转到定义、悬停、查找引用等。安装 Claude Code ≥ 2.1.50,运行 `npx tweakcc --apply` 打补丁,通过 `/plugin marketplace add Piebald‑AI/claude‑code‑lsps` 添加市场,然后按说明安装底层语言服务器二进制文件(rust-analyzer、pyright、clangd 等)。仓库包含验证脚本,以保持市场 JSON 与 `.lsp.json` 配置同步。
xybrid-ai/xybrid
Xybrid 是一个开源、跨平台 SDK,可在设备(移动、桌面、Unity)上本地运行 LLM、语音识别和文本转语音模型。它提供 Flutter、Swift、Kotlin、Unity、Rust 和 Python 的原生绑定,支持多种流行开源模型,并允许将它们组合成多模型流水线——无需依赖云服务。
lakesoul-io/LakeSoul
LakeSoul 是一个具有 Rust 原生元数据和 I/O 核心的开源湖仓一体框架,提供 ACID 事务、增量 upsert、自动压缩、细粒度 RBAC,并支持 Spark、Flink、Presto、Ray、Daft 和基于 Python 的工具。它允许您通过 Vortex 格式存储常规行和多模态/向量数据,并提供实时 CDC 摄取、快照查询以及与 AI/ML 流水线的无缝集成。
bytechefhq/bytechef
ByteChef 是一个开源平台,将 AI 代理编排与可视化工作流自动化相结合。它提供内置代理循环、250+ 预制连接器、多提供商 LLM 支持、内存/RAG 后端、护栏机制,以及可 Docker 化的自托管运行时。免费核心(Apache 2.0)涵盖编辑器、代理、连接器和多语言代码;企业功能增加 API 暴露工作流、Git 原生发布、SSO 和 AI 网关控制。通过 Docker Compose 快速启动,几分钟内即可在本地运行实例。
missuo/koe
一款轻量级的 macOS 语音输入工具,利用 ASR 和 LLM 纠错功能,将清理后的语音文本直接粘贴到任意应用程序中。
nimroddolev/chime_tts
通过在本地将通知铃声和 TTS 音频合并为单个无缝文件进行播放,从而消除音频延迟的 Home Assistant 集成。
tronghieuit/v-tts
一款轻量级越南语文本转语音系统,具有多说话人合成和零样本语音克隆功能,可在 CPU 上高效运行。
derek-larson14/obsidian-claude-sidebar
Claude Sidebar 是一个 Obsidian 插件,它直接在侧边栏中嵌入一个运行 Claude Code(或其他 AI 代理 CLI)的终端。它支持自动启动代理、多标签页、上下文菜单快捷方式、YOLO 模式,并且可以在你电脑上的任何文件夹中工作。通过 Obsidian 的社区插件(或手动)安装,它使用 xterm.js 和一个小型 Python PTY 后端,可在 macOS、Linux 和 Windows 上运行。
caiovicentino/polymarket-mcp-server
Polymarket MCP Server 是一个基于 Python 的 MCP 服务器,让 Claude(或任何 LLM)能够自主发现、分析、交易并监控 Polymarket 预测市场仓位。它提供 45 种涵盖市场发现、分析、交易、投资组合管理及实时监控的工具,并由可配置的安全限制与全节点验证机制保护。项目包含网页仪表板、真实 API 测试、MIT 授权,以及针对演示(只读)与实盘交易设置的详细文档。
kardolus/chatgpt-cli
ChatGPT CLI 是一款跨平台的命令行客户端,支持多家 LLM 提供商。它提供流式查询、基于线程的聊天记录、提示文件注入、多媒体 I/O,以及一个实验性的代理模式 (ReAct / Plan-Execute),可在预算与策略限制下运行 shell/文件/网络搜索工具。它还支持模型上下文协议 (MCP) 以进行自定义工具调用。通过 Homebrew 或预构建二进制文件安装,在 `~/.chatgpt-cli/config.yaml` 中配置 API 密钥,并使用 `chatgpt "your question"` 或 `chatgpt --interactive` 开始聊天。
jamsch/expo-speech-recognition
一个为 React Native 和 Expo 提供跨平台语音转文本功能统一 API 的库,支持 iOS、Android 和 Web。
claraverse-space/ClaraVerse
ClaraVerse 是一个专注于 AI Agent 团队、分层记忆与宽松授权的私有 AI 工作空间,提供聊天、多 Agent 协作、终端 Agent、工作流自动化以及 150+ 项整合。
samuel-vitorino/sopro
一个轻量级的 120M 参数文本转语音模型家族,可在笔记本电脑 CPU 或浏览器中实现高质量的零样本语音克隆和流式音频合成。
Natooz/MidiTok
MidiTok 是一个 Python 包,可将 MIDI 和 abc 音乐文件转换为机器学习模型(如 Transformer)的 token 序列,从而实现音乐生成、转录及其他 MIR 任务。
OHF-Voice/speech-to-phrase
一个快速、在本地运行的语音转文字系统,专为 Home Assistant 设计,只识别特定已知的短语和设备名称,而不是通用语音。
shivammehta25/Matcha-TTS
Matcha-TTS 是一种快速、非自回归的文字转语音架构,使用条件流匹配来实现高质量且高效率的语音合成。
hhblaze/DBreeze
DBreeze 是一个纯 C# 编写的、适用于 .NET 的嵌入式数据库,支持 ACID 事务、无模式表、全文搜索,以及对 AI 至关重要的 HNSW 相似性搜索集成向量存储,可实现对 LLM 嵌入的快速最近邻查询。
Makememo/MemoAI
一款基于 AI 的工具,可从本地文件或 YouTube 链接中转录音频和视频,提供翻译和字幕功能。
sudoprivacy/sudocode
Sudo Code 是一个开源、基于 Rust 的 CLI 代码助手,可在终端中直接运行 LLM(Anthropic、OpenAI、xAI、Gemini 等)。它具备模型无关性、文件驱动特性,专为需要完全可见性和控制权的重度开发者设计。单个 `scode` 二进制文件可交互使用,也可作为管道兼容的一次性工具,支持为编辑器/网页 UI 提供 ACP API,并支持多种部署模式(本地、远程 Nexus VFS 或托管代理)。通过简单安装脚本即可部署,项目采用 MIT 许可证,致力于隐私优先、无遥测、无供应商锁定。
10000ge10000/luci-app-openclaw
LuCI 插件,使 OpenWrt 路由器可托管 OpenClaw AI 网关,提供 Web UI 用于安装 Node.js、管理 LLM 模型,并启用 WeChat 等通道。
liyedanpdx/reddit-ai-trends
Reddit AI Trend Reports 是一个基于 Docker、由 MongoDB 支持的系统,它从专注于 AI 的 subreddit 获取帖子,可选地通过图像字幕、YouTube 字幕摘要和网页抓取进行增强,然后使用 Groq 或 OpenRouter LLM 生成每日双语(英语/中文)趋势报告。
mrthinger/wow-voiceover
一个由CLI和游戏内插件组成的工具集,使用ElevenLabs TTS为《魔兽世界》NPC对话生成并播放AI语音。
MahmoudAshraf97/ctc-forced-aligner
一个使用 Hugging Face CTC 模型实现高效音频与文本强制对齐的 Python 包,支持超过 1,100 种语言。
Deodat-Lawson/LaunchStack
LaunchStack 是一个 TypeScript 优先、基于端口的引擎,用于 AI 原生应用,提供文档摄取、OCR、RAG、LLM 聊天和后台任务基础设施。一个 Next.js 参考应用展示了如何将引擎连接到 PostgreSQL + pgvector, S3, Inngest 和 Google Gemini (或任何 OpenAI 兼容端点)。软件包目前尚未发布但已准备好发布;该仓库可以本地运行或通过 Docker 运行。
lofcz/LLMTornado
LLM Tornado 是一个 .NET SDK,统一访问 30 多个 LLM 供应商和向量数据库,添加代理编排原语、多模态 I/O 和企业功能(防护、OpenTelemetry)。支持云 API 和本地运行时(Ollama、vLLM),提供强类型工具调用,并与 Microsoft.Extensions.AI 集成。通过 NuGet 以 MIT 许可证分发,积极维护,并被多个公开项目使用。
echogarden-project/echogarden
一个为 Node.js 提供的综合性语音处理工具集,无需 Python 或 Docker 即可实现离线和云端的文本转语音、语音转文本以及音频对齐功能。