asklokesh/loki-mode
Loki Mode 是一个开源 CLI/SDK,可将产品规格转化为完全构建、测试和验证的代码库。它运行一个自主的 LLM 驱动工作流(Reason-Act-Reflect-Verify),包含八个质量门检查,并生成可由任何人重新验证的加密绑定“证据收据”。可通过 bun/npm/Homebrew/Docker 安装,使用 `loki quickstart` 创建新应用,或使用 `loki modernize heal` 评估和改进现有仓库。该工具需要 Anthropic API 密钥(或兼容模型),专注于可审计、生产级代码生成。
kaixxx/noScribe
一款免费、开源的用于本地音频转录和说话人识别的应用程序,专为研究人员和记者设计,以确保数据隐私。
knowsuchagency/mcp2cli
mcp2cli 是一个运行时 CLI 生成器,可将 MCP 服务器、OpenAPI 规范或 GraphQL 端点即时转换为即用型命令行工具。它支持 OAuth、安全密钥标志、内置配置、使用感知排序和机器可读 JSON 输出,使 LLM 代理和开发者能够以极低的 token 开销调用 API。
ken107/read-aloud
一款适用于 Chrome 和 Firefox 的浏览器扩展程序,利用文本转语音技术将网页文本转换为音频,从而提高可访问性并方便多任务处理。
plasma-umass/scalene
Scalene 是一款快速的行级 Python 分析器,可测量 CPU、GPU (NVIDIA) 和内存使用情况,实现 Python 与原生代码的分离,可视化缝合后的堆栈,并能直接从 UI 向 LLM(OpenAI、Azure、Bedrock、Ollama 等)请求优化建议。
ZaxbyHub/opencode-swarm
OpenCode Swarm 是一个 OpenCode 插件,可将单个 AI 编码提示转化为带门禁、可生产部署的工作流。它强制执行审查、测试、安全扫描和文档化,支持 13 种语言,提供可恢复会话、PR 监控和多种安全/速度模式。通过 `bunx opencode‑swarm install` 安装;通过 `~/.config/opencode/opencode‑swarm.json` 配置;使用 `/swarm agents`、`/swarm status`、`/swarm auto‑proceed` 等斜杠命令控制流程。
librosa/librosa
用于音频和音乐信号处理的 Python 库,为构建音乐信息检索系统提供基础工具。
SamadhiFire/xinqingnian-maoxuan-skill
一个适用于 Claude/Codex 的技能,通过四步“毛式”分析法指导 LLM 分析卡住的项目、团队冲突或人生决策,输出简洁文本摘要和可选的单文件 HTML 报告。
TaoLiveAIGC/TaoMate
TaoMate 是一个研究级、实时音视频数字人生成系统。该仓库提供推理代码、多GPU启动器和四GPU交互式浏览器演示。它整合了 22B LTX-2.3 变压器、Gemma-3 文本编码器和可选的 Gemma-4 对话模型,需要高内存 NVIDIA GPU 和来自 Hugging Face 的独立模型检查点。
diodiogod/TTS-Audio-Suite
TTS Audio Suite 是一个 ComfyUI 扩展,整合了 19 个文本转语音、语音转换和音频编辑引擎(例如 F5‑TTS、DramaBox、Higgs Audio、Qwen3‑TTS、RVC)。它提供字幕感知生成、分段标签、可视化波形分析、静音语音时间对齐,以及内置的 RVC 模型训练功能,所有功能均通过运行时隔离实现不同引擎依赖项的独立管理。
pytorch/audio
一个基于 PyTorch 的音频库,提供用于机器学习的音频数据处理工具,具备 GPU 加速和专用音频变换功能。
estebanstifli/LocalText2Voice
一款用于创建长篇有声读物和播客的桌面应用,使用本地或云端 AI 文本转语音引擎,具备内置的质量验证和音频混音功能。
sdatkinson/NeuralAmpModelerPlugin
一个将 Neural Amp Modeler 引擎集成到 DAW 中的 VST3/AudioUnit 插件,实现 AI 驱动的吉他放大器建模。
genomoncology/biomcp
BioMCP 是一个统一的 CLI/MCP 服务器,让用户和 AI 代理能通过简单的指令语法查询约 30 个生物医学数据库(如 PubMed、ClinVar、ClinicalTrials.gov、OncoKB 等),并可在实体间转换、执行本地研究分析及进行基因集富集分析。可通过脚本、uv/pip、Homebrew、Docker 或源代码安装,提供丰富来源信息的 JSON 或终端输出,并可直接与 Claude Code、Codex 和 Claude Desktop 集成。
vllm-project/vime
Vime 是一个用于大语言模型的开源 RL 后训练框架。它将 slime/Megatron 分布式训练栈与 vLLM 推理(通过 vllm-router)相结合,以提供高吞吐量 rollouts 和灵活的数据生成流水线。支持的模型包括 Qwen, DeepSeek V3, 和 LLaMA 3。用户可以通过配置 Megatron, vLLM, 和 router 参数来运行 agentic RL, coding-agent RL, 或自定义 RL 算法。该仓库提供了快速入门文档、快速示例,以及为开发者提供的清晰的代码阅读路径。
tile-ai/tilelang-ascend
TileLang‑Ascend 是一个基于 TVM 构建的 Python 风格 DSL,用于在华为 Ascend NPU 上编写高性能 AI 核函数。它提供了一个可发出 Ascend 专用代码的编译器,支持自动向量化、内存规划和同步,并以可使用 pip 安装的 wheel 形式发布,包含许多现成的示例(GEMM、Flash‑Attention 等)。
matrixorigin/memoria
Memoria 是基于 MatrixOne 数据库构建的 AI 代理记忆的 Git 风格版本控制层。它为每一次记忆变更提供快照、分支、合并和回滚功能,支持混合向量/全文搜索、自动矛盾检测,并采用隐私优先的部署模式(云或自托管)。代理通过 MCP 命令或 REST API 与之交互,使记忆可安全修改、可审计且可在会话间复用。
SUC-DriverOld/MSST-WebUI
一个基于网页的 Music-Source-Separation-Training 界面,允许用户使用各种 AI 模型从音乐轨道中分离人声和乐器。
bolna-ai/bolna
Bol na 是一个开源框架,可协调语音转文字、LLM 和文字转语音服务,构建可发起和接收电话通话的语音优先助手。它提供核心服务器、电话 Webhook(Twilio/Plivo)、Redis 和 ngrok 的 Docker-Compose 容器,并提供 Python SDK(`Assistant`)用于构建流式管道。该平台与提供商无关(支持 Deepgram、Azure、OpenAI、ElevenLabs、AWS Polly 等),并可扩展至新的电话或音频服务。
royshil/obs-localvocal
一个使用 OpenAI 的 Whisper 提供实时、本地语音转文本转录和翻译的 OBS 插件,确保隐私且无云端成本。
DeadWaveWave/opencove
OpenCove 是一款跨平台的 Electron 应用,提供一个无限的 2D 画布,让您可以在上面放置运行 AI 编码代理(如 Claude Code、Codex)的终端、笔记、任务和图片。布局、终端输出和代理状态会在重启后保留,您还可以为画布创建快照以便日后重复使用。它的目标是让 AI 助手的工作流程空间化,而不是隐藏在标签页或冗长的聊天记录中。
elevenlabs/elevenlabs-python
ElevenLabs 的官方 Python SDK,可让开发者将逼真的 AI 文本转语音、语音克隆和实时对话式 AI 代理集成到其应用程序中。
prathoshap/vagdhenu
一种生产级的大型梵文吟诵文本转语音系统,能够生成传统的旋律吟诵,而非平淡的朗读语音。
spotify/pedalboard
一个高性能的 Python 库,用于读取、写入和应用专业级音频效果及第三方 VST3/Audio Unit 插件到音频文件和实时流中。
LearnPrompt/humanize-ppt
Humanize PPT 是一个开源 Python 编排工具,可将 Markdown 转换为观众状态转移(AST)幻灯片计划,决定每页媒体内容,将渲染任务交给下游 HTML 或 PPTX 技能,运行自动演示检查以标记“好看但无法讲解”的幻灯片,并生成轻量级演讲者外壳。它可通过简单技能安装与 AI 代理(Claude‑Code、Codex、Hermes)集成,支持下游渲染器如 `guizang-ppt-skill`、`frontend-slides`、`ppt‑master` 和媒体生成器(`baoyu-image-gen`、Remotion)。MIT 许可证。
flybirdxx/ComfyUI-Qwen-TTS
基于 Qwen3-TTS 模型的 ComfyUI 自定义节点,支持高质量语音合成、零样本语音克隆与自然语言驱动的语音设计。
mbailey/voicemode
一个为 Claude Code 和其他 MCP 兼容代理设计的语音接口,支持使用云服务或本地语音服务,实现自然、免提的对话。
Dicklesworthstone/coding_agent_session_search
一个基于 Rust 的终端 UI 和 CLI,将数十个 AI 编码助手的对话日志聚合、归一化并索引到本地 SQLite 归档中。提供 60 毫秒以下的词法搜索和可选的设备内 MiniLM 语义搜索,配备稳定的 JSON 机器人模式 API,用于自动化和诊断。
KoljaB/RealtimeSTT
一个 Python 语音转文本库,提供快速、实时的转录功能,并集成语音活动检测和唤醒词支持。
di-sukharev/opencommit
OpenCommit 是一个 Node.js CLI,利用 LLM(OpenAI、Anthropic、Ollama 等)从暂存变更中自动生成符合规范、带表情符号的 Git 提交消息。支持全局与项目级配置、多提供商、本地模型服务器、Git 钩子和 GitHub Action,实现提交消息的自动优化。
richardr1126/openreader
一个开源、自托管的文本转语音文档阅读器,支持 EPUB、PDF、TXT、MD 和 DOCX 文件的同步朗读播放。
OpenMOSS/MOSS-Audio
MOSS-Audio 是一个开源音频理解模型,统一了语音、环境声音和音乐分析,并具备强大的时间感知与推理能力。
kigner/audio.cpp-webui
基于 ggml 的高性能 C++ 音频推理框架,可在多种硬件后端上实现 TTS、ASR 和语音克隆模型的快速、便携的本地执行。
riba2534/happyclaw
HappyClaw 是一个自托管平台,可将 Anthropic Claude Code 代理作为长期运行的多用户服务运行。它封装了 Claude Agent SDK(TypeScript)和 Claude Code CLI,提供基于 Web 和 8 个即时通讯渠道的接口,支持隔离工作区(主机或 Docker)、完整的 Claude Code 功能(文件访问、Shell、浏览器、插件)、调度、使用量追踪,以及企业级 RBAC 和备份。
hkjarral/AVA-AI-Voice-Agent-for-Asterisk
一个为 Asterisk 和 FreePBX 设计的开源 AI 语音代理,提供 STT、LLM 和 TTS 提供商的模块化流水线,可创建生产就绪的语音机器人。
magenta/magenta-realtime
专为 Apple Silicon 上的音频流媒体优化的实时音乐生成开源权重模型及推理引擎。
Eddycrack864/UVR5-UI
一个基于 `python-audio-separator`(UVR5 的 Python 版本)的用户友好图形界面,支持使用多种 AI 模型从音频和视频文件中分离人声与乐器。
f-is-h/Usage4Claude
Usage4Claude 是一款原生的 macOS 菜单栏应用,可实时监控 Anthropic Claude (以及可选的 OpenAI Codex) 的订阅配额。它支持所有 Claude 产品、多账号管理、自适应刷新、彩色用量环形图、通知功能,并将凭据安全地存储在 macOS Keychain 中。可以通过预构建的 DMG 文件安装,或使用 Swift/SwiftUI 从源码构建。
andimarafioti/faster-qwen3-tts
使用 CUDA 图捕获技术的高性能推理引擎,实现 Qwen3-TTS 的实时、低延迟语音克隆与语音生成。
FireRedTeam/FireRedASR2S
一个工业级全能型 ASR 系统,结合了语音识别、语音活动检测、语种识别和标点预测,并对中文方言提供专门支持。
JordyZomer/lemmalog
Lemmalog 是一个基于 Rust 的 Datalog 引擎,可将 LLM 提取的三元组转化为可验证、可增量更新的记忆存储。支持置信度加权事实、时间有效性、实体标准化、证明树生成以及混合 BM25 加实体检索层。通过 CLI、REPL 或 JSON-RPC MCP 服务器集成,驱动 Claude Code/Kimi 代理,在 MemEval 风格基准测试中表现优异,同时使用的令牌远少于全上下文基线。
sdatkinson/NeuralAmpModelerCore
一个核心 C++ DSP 库,提供运行音频插件中神经放大器模型所需的神经网络逻辑。
langchain-ai/social-media-agent
一个由 LLM 驱动的智能体,可抓取 URL、起草 Twitter/LinkedIn 帖子,经人工审核后通过 Arcade 或原生 OAuth 发布。基于 LangGraph 构建,支持 Slack、Supabase、GitHub 和 YouTube 集成,并可通过提示词文件配置。
speechbrain/speechbrain
用于对话式 AI 的开源 PyTorch 工具包,提供语音和文本处理(包括语音识别和合成)的方案和工具。
Kieirra/murmure
Murmure 是一个开源桌面应用,使用 NVIDIA 的 Parakeet TDT 0.6B v3 模型实现离线、以隐私为先的语音转文字。它在 Windows、macOS 和 Linux 上本地运行,支持 25 种欧洲语言,并提供无遥测的简单语音输入界面。
stemrollerapp/stemroller
StemRoller 是一个免费应用程序,使用 Demucs 算法从通过整合的 YouTube 搜索找到的歌曲中分离人声与伴奏 stem。
azuwis/pianotrans
字节跳动钢琴转录系统的GUI和打包工具,可将钢琴音频和视频录音转换为包含踏板数据的MIDI文件。
oboard/claude-code-rev
Claude Code 的社区重建版本,恢复了原始 CLI 并允许通过 GitHub 托管的推理端点(GitHub Models 和 Copilot)运行 Claude 家族模型。使用 Bun 安装,通过 `/provider` 或命令行标志选择提供商/模型,并使用恢复的工具使用循环。部分私有模块被沙盒替代,因此行为可能与专有原始版本不同。