nateshmbhat/pyttsx3

一个利用本地系统引擎在离线状态下生成语音输出的 Python 库,无需互联网连接即可实现文本转语音转换。

readbeyond/aeneas

用于强制对齐的 Python/C 库和工具集,可自动将音频朗读与对应文本片段同步。

ashbuilds/payload-ai

一个为 Payload CMS 添加 AI 驱动的文本、图像和语音生成功能的插件,支持多个模型提供商,并提供细粒度配置和访问控制。

SponsioLabs/Sponsio

Sponsio 是一个开源库,为基于 LLM 的代理程序提供确定性、微秒级的防护机制。它让您能编写基于形式化方法的合约(YAML 规则集),并在每次工具调用时强制执行,无需调用任何模型即可阻止、警告或允许操作。该库与 Python 或 TypeScript 中的 LangChain、Claude、OpenAI、CrewAI 及其他代理框架集成,随附 22 个现成的合约套件,并提供用于审计与查看的托管控制台。基准测试显示,错误行为减少超过 95%,每次调用延迟低于 0.2 毫秒,使其成为生产环境 AI 代理快速且可靠的安全层。

av/harbor

Harbor 是一个 CLI 驱动的 Docker-Compose 编排器,让你通过一个 `harbor up` 命令即可启动一个完整的本地 LLM 技术栈——包括模型后端 (Ollama, llama.cpp, vLLM, MLX, etc.), 聊天前端 (Open WebUI, LibreChat, AnythingLLM, ...), 网页搜索, 语音, 图像生成, 和基于 Boost 的智能体工作流。

marcusquinn/aidevops

aidevops 是一个 MIT 许可的 AI-DevOps 框架,提供 CLI 和 OpenCode 插件,用于在代码、基础设施、产品、营销等领域协调 AI 代理。它将工作分解为 14 个主要代理和数千个子代理,使用脉冲监督者路由任务、管理 token 预算、保护密钥安全并维护 Git 清洁。通过 npm 或 Homebrew 安装后,运行 `aidevops init`、`aidevops pulse` 或特定领域的斜杠命令,即可自动化构建、部署、报告和业务流程,同时保持可审计性。

norse/norse

Norse 是一个基于 PyTorch 的库,添加了脉冲神经网络原语(LIF、LSNN 等),用于构建、训练与评估事件驱动模型。它提供 pip/conda/Docker 安装方式、即用的示例任务(MNIST、CIFAR‑10、cart‑pole),并可与 PyTorch‑Lightning 集成以支持可扩展的训练。

MigoXLab/dingo

Dingo 是一个开源的 Python 库(以及 SaaS 产品),用于评估 AI 数据、模型输出和 RAG 系统。支持基于规则、基于 LLM 和基于代理的检查,可从文件、数据库、S3 或 Hugging Face 流式读取数据,并提供 JSON 报告及可选的可视化仪表板。通过 `pip install dingo-python`(含可选扩展)安装,通过 CLI(`dingo eval …`)或 Python SDK 运行,并可通过自定义规则、LLM 提示或代理进行扩展。

nikdanilov/whisper-obsidian-plugin

一个使用 Whisper 将音频录音或上传的文件转换为文本的 Obsidian 插件,并可选择使用 LLM 进行语法和格式的后处理。

iver56/audiomentations

一个用于音频数据增强的 Python 库,提供多种转换方式,使音频深度学习模型在实际应用中更加鲁棒。

datachain-ai/datachain

DataChain 是一个 Python 库,它将 S3/GCS/Azure(或本地)中的文件转换为存储在轻量级 SQLite 数据库中的版本化、类型化数据集。它无需移动原始文件,即可对数百万条记录进行快速、亚秒级的过滤、连接、聚合和向量相似度搜索。流水线以普通 Python 函数编写;引擎处理并行执行、检查点和增量更新。可选功能包括为人类/LLM 自动生成的 Markdown 知识库,以及使 Claude、Cursor、Codex、Copilot 或 Pi 等工具能够识别数据层的技能。托管的“Studio”服务增加了共享数据集注册表、分布式计算和用于大型媒体的 UI。使用 `pip install datachain` 安装,并可选择执行 `datachain skill install --target claude`。

AgentEra/Agently

Agently 是一个用于构建可靠 AI 服务的 Python 框架。它提供结构化的请求/响应契约、部分结果的即时流式传输、可观察的操作(工具调用)、版本化技能以及信号驱动的工作流引擎 (TriggerFlow)。该库抽象了模型提供商,支持模型池,并包含用于 Python、shell、网页浏览、SQLite 等的内置操作。专为需要可调试性、重启安全工作流和严格输出验证的生产级助手、内部副驾驶和 AI 支持的 API 而设计。

tolimarchuk/goalbuddy

GoalBuddy 是一个基于 npm 的 CLI,它在你的仓库内创建一个基于文件的「看板」,用于协调使用 Codex 和 Claude Code 等 LLM 代理的长期编码任务。它允许你定义目标,将其分解为安全、可验证的片段,将这些片段分派给选定的代理,捕获 YAML 格式的收据,并通过测试、演示等 Oracle 验证工作。看板在工具间持久存在,支持代理间的无缝交接、审计追踪和并行子目标,且运行时开销极小。

psyray/oasis

OASIS 是一个 Python CLI 工具,使用本地托管的 LLM(通过 Ollama 或任何 OpenAI 兼容服务器)扫描源代码中的安全漏洞。它先运行快速扫描模型,再运行深度分析模型,对发现结果进行确定性验证,缓存结果,并输出标准 JSON 以及 HTML/PDF/Markdown 报告。一个密码保护的 Web 仪表板允许用户探索发现结果,并请求助手进行重新调查。支持多模型运行、抑制注册表、与基线的差异比较,以及 CI 退出码门控。

skyzh/vector-db-from-scratch

一个基于 Rust 的分步课程,涵盖 Arrow 表、DataFusion 集成以及多种 ANN 索引(IVFFlat、NSW、HNSW、IVF-PQ),支持 SQL 并附带基准测试工具。

gemelo-ai/vocos

一种使用频谱系数和逆傅里叶变换,从声学特征中合成高质量音频波形的快速神经声码器。

linto-ai/whisper-timestamped

openai-whisper 的扩展,为多语言自动语音识别提供精确的单词级时间戳和置信度分数。

paul-buerkner/brms

brms 是一个 R 包,提供了一个高级、lme4 风格的接口,用于使用 Stan 拟合贝叶斯广义(非线性)多层模型。它支持多种响应分布、灵活的先验,以及一系列拟合后的诊断和可视化工具,使用户无需直接编写 Stan 代码即可执行复杂的贝叶斯回归。

OpenVoiceOS/ovos-installer

Open Voice OS 的精简安装程序,使用户能够在 Raspberry Pi、Linux 或 Mac 硬件上部署注重隐私的开源语音助手。

yibie/skills-manager

Skills Manager 是一款原生 macOS 应用(及配套终端 UI),可集中发现、安装、测试和组织数十种基于 LLM 的开发者工具(如 Claude Code、Cursor、Gemini CLI、OpenHands 等)的编码代理“技能”(提示扩展)。它将原始技能包存储在本地 Library 中,分组为可复用的 Collections,并通过符号链接挂载到代理中,提供冲突检测、翻译和离线优先操作。

CUNY-CL/wikipron

一个从 Wiktionary 中挖掘多语言发音数据以创建音素到音标(G2P)数据集的命令行工具和 Python API。

uxlfoundation/oneDNN

oneDNN(oneAPI Deep Neural Network Library)是一个开源、跨平台的性能库,为深度学习操作符提供高度优化的 CPU 和 GPU 内核。它实现了 oneAPI 规范,支持 Intel、AMD、Arm 以及实验性的 Power/IBM z/RISC‑V 硬件,并被 PyTorch、TensorFlow、ONNX Runtime、llama.cpp 等主要框架使用。

tensorflow/quantum

TensorFlow Quantum 是一个 Python 库,将 Cirq 量子电路与 TensorFlow/Keras 集成,提供高性能混合量子-经典机器学习模型、自动微分以及通过 qsim 实现的可扩展模拟。

lucasjinreal/Kokoros

通过 CLI、Rust crate 和 OpenAI 兼容 API 服务器提供快速文本转语音合成的 Kokoro TTS 模型高性能 Rust 实现。

fishaudio/audio-preprocess

一组用于人声分离、音量匹配和转录等任务的音频处理脚本,用于准备AI训练的数据集。

Ammaar-Alam/minebench

MineBench 是一个基于网页的基准测试工具,通过让 LLM 对如“一座中世纪城堡”等提示输出体素坐标,来评估其三维空间推理能力。它可视化生成结果,支持人类进行头对头对比,并使用 Bradley-Terry 系统对模型进行排名。平台包含用于成对投票的 Arena、用于自定义构建的 Sandbox、社区提示的 Gallery,以及 GLB、STL、.vox、.schem 等格式的导出功能。支持主流 LLM 提供商,可通过 Node.js、pnpm 和 Docker 在本地运行。

justrach/kuri

一个为 AI agent 设计的轻量级浏览器自动化工具,以单个 Zig 二进制文件实现,无需 Node.js 依赖。

0xranx/golembot

GolemBot 是一个 Node.js 运行时,为现有的编码代理(Cursor, Claude Code, OpenCode, Codex)提供聊天机器人“身体”。通过单个 `golembot gateway` 命令,您可以在 Slack、Telegram、Discord、Feishu、DingTalk、WeCom、WeChat 或自定义 HTTP API 上公开该代理,并通过微小的 YAML 配置切换 LLM 提供者(OpenRouter、MiniMax、DeepSeek 等)。它集成了 ClawHub 市场(13k+ 社区技能),使代理能够即时获得新能力。功能包括内置仪表板、cron 调度器、舰队管理以及最小化的 JavaScript SDK(`createAssistant`)。通过 `npm i -g golembot` 安装,运行 `golembot onboard` 进行配置,然后运行 `golembot gateway` 上线。采用 MIT 许可证。

Cranot/roam-code

roam‑code 是一个本地静态分析 CLI(及可选 MCP 服务器),可构建仓库的符号图,使 AI 编码代理无需任何远程 API 调用即可查询定义、调用者、测试影响和风险(爆炸半径)。它提供预飞行检查、健康摘要、验证门禁和 Claude 特定钩子,全部开源且保护隐私。

mrpulor-gh/nuphus-mcp

该仓库是一个关于 AI 桌面和浏览器自动化的真正软件项目,提供一个基于 Rust 的 MCP 服务器,通过标准输入输出的 JSON-RPC 与 AI 代理通信,使 AI 代理能够控制本地计算机,支持本地 OCR 和可选的视觉模型集成。

NaomiProject/Naomi

Naomi 是一个开源、始终在线的语音助手平台(Python,Linux/Raspberry Pi),可让你控制家庭设备、查询信息,并通过简单的 Python 模块添加自定义“技能”。

xianyu110/clawbot

Clawdbot 是一个开源、本地运行的 AI 助手,可通过可配置的 API 代理端点连接 Claude、GPT、Gemini 等 LLM。它提供 Web 和终端 UI、Telegram/Discord/WhatsApp 机器人,并将所有数据存储在主机上。README 包含安装说明(Node 22+、npm 或脚本)、模型和渠道设置的引导向导、多模型代理的详细 JSON 配置、常见陷阱(Node 版本、环境变量误用、缺失字段)、以及用于管理网关、日志和诊断的完整 CLI 命令集。

Spr-Aachen/Easy-Voice-Toolkit

Easy Voice Toolkit 将开源语音模型(Whisper、GPT-SoVITS)整合到 GUI/Colab 工作流程中,用于清理音频、转录、构建语音转换数据集、训练自定义语音模型,以及生成转换后的语音。它提供即开即用的 Windows 便携式包和 Colab 笔记本,并附有开发者友好的安装指南。该项目仅供学术使用,并计划未来集成 LLM 聊天机器人和 Linux 支持。

google/jax-cfd

JAX‑CFD 是一个基于 JAX 的研究级可微分 CFD 库。它提供有限体积法和伪谱法求解器、可选的 ML 增强模型以及数据工具,使用户户可以使用基于梯度的实验进行湍流模拟。该套件可通过 pip 安装,附带 Colab 演示,但目前已停止维护,建议使用更新的替代方案。

Kabanosk/whisper-website

一个使用 OpenAI 的 Whisper 在本地将音频转录为文本或多种格式字幕的自托管 Web 应用程序。

teticio/audio-diffusion

通过将扩散模型应用于梅尔频谱图,实现音乐和音频循环合成的框架,支持潜在扩散和条件生成。

Xueyang-Song/paper-pilot

Paper Pilot 是一个桌面(Electron + React)研究助手,可爬取 8+ 个学术数据库,下载 PDF,使用 SQLite + FTS5 + 向量搜索进行索引,并允许你向本地或托管的 LLM 提出基于证据的答案。所有数据均保留在你的机器上;该应用提供可审计的引用追踪和可复现的文献综述工作流。

Deep-ai-inc/ch.at

ch.at 是一个单二进制文件的 Go 服务器,让您可以通过 HTTP、SSH、DNS 或 API 与 LLM(默认为 GPT-4o)进行对话,无需 JavaScript,无需账户,且所有状态均保留在 RAM 中。它专注于隐私,易于自行托管,并包含一个用于通过相同轻量级协议发布消息的公共看板。

EasyJailbreak/EasyJailbreak

EasyJailbreak 是一个开源的 Python 框架,将 LLM jailbreak 攻击模块化。它提供现成的配方(如 ReNeLLM、GPTFuzz、AutoDAN 等),并允许用户插入自定义的选择器、变异器、约束和评估器,以生成、运行和评分针对目标语言模型的对抗性提示。可通过 `pip install easyjailbreak` 或从源码安装,然后使用高级 API(如 `PAIR` 配方)或构建自己的攻击流水线。项目包含文档、论文、数据集和可下载的实验结果。

ankane/torch.rb

Torch.rb 是一个封装了 PyTorch C++ 库(LibTorch)的 Ruby gem,为 Ruby 开发者提供了功能完整的深度学习 API。它支持张量、自动微分、神经网络模块、优化器以及 GPU(CUDA/MPS)加速,同时以 Ruby 风格的方法命名模仿 PyTorch 的 Python API。安装需要匹配的 LibTorch 构建版本,之后你就可以直接在 Ruby 中编写和运行模型(例如 CNN、GAN)。

FlashLabs-AI-Corp/FlashLabs-Chroma

一个支持直接音频理解与个性化语音克隆的实时端到端多模态语音对话模型。

Firepal/stammer

一个Python实用工具,使用另一个音频或视频源中最频谱相似的帧来重建一个音频源。

jacbz/Lofi

一种利用 VAE 模型将音乐轨道表示并生成为特征向量的机器学习支持的 lo-fi 音乐生成器。

jjazzboss/JJazzLab

JJazzLab 是一个开源应用程序,可根据和弦符号和选定的音乐风格生成包含鼓、贝斯、吉他和钢琴的真实、动态伴奏轨道。

ronibandini/reggaetonBeGone

一款基于 Raspberry Pi 3 的边缘AI设备,可在本地运行 Edge Impulse 音频分类模型以检测雷盖顿。当置信度超过 95% 时,触发蓝牙流程禁用配置好的音箱。包含 OLED 反馈、启动按钮、日志记录以及完整的软硬件说明。

kristianvast/hermes-claude-auth

hermes‑claude‑auth 是一个 Python 运行时补丁,可在 Anthropic 于 2026‑04‑04 引入 OAuth 验证后,让 hermes‑agent 继续使用 Claude Code 订阅。它安装一个 .pth 沙盒,对代理的请求构建器进行猴子补丁,添加必要的计费头,修复提示布局,并实现对订阅窗口速率限制的自动等待。安装程序支持 Linux/macOS 和 Windows,提供卸载脚本,并通过 git 钩子 + cron 恢复机制,确保在 hermes 更新后仍能存活。

JeremyCCHsu/Python-Wrapper-for-World-Vocoder

一个用于 WORLD Vocoder 的 Python 包装器,通过将音频分解为音高、频谱包络和非周期性,实现高质量的语音分析与重新合成。

usnistgov/dioptra

Dioptra 是 NIST 的开源 Docker 基础平台,用于测试 AI 模型是否符合可信性标准(公平性、安全性、可解释性等)。它提供 REST API、Web UI 和 Python 客户端,支持使用 YAML 定义实验,兼容 PyTorch/TensorFlow 插件,并为开发者、审计者、研究人员和红队提供可复现、可追溯的运行记录。