hoophq/hoop

hoop 是一个开源侧车,位于 AI 代理与其数据源之间,提供运行时数据掩码、护栏、可选的基于模型的风险分析以及人工审查升级功能,所有配置均可通过单一 YAML 文件定义,并可通过轻量级控制平面 UI 实现规模化管理。

PatterAI/Patter

一个为 AI Agent 提供完整语音栈的开源 SDK,将 LLM、STT、TTS 和电话运营商集成到单个 API 中。

neuphonic/neutts

一系列开源的端侧文本转语音模型,可在移动和嵌入式设备上本地实现自然语音和即时语音克隆。

sipeter/CloneTTS

一个离线的 Android TTS 引擎,可通过短音频样本实现本地语音克隆,用于私密、设备端的文本转语音合成。

goodroot/hyprwhspr

一款原生 Linux 语音转文本工具,利用本地或云端 AI 模型,提供快速、私密且系统级的语音输入功能。

FalkorDB/GraphRAG-SDK

GraphRAG‑SDK 是一个 Python SDK,从您的文档构建 FalkorDB 中的知识图谱,然后通过遍历该图谱回答问题。它添加了出处边、多跳检索和可选拒答功能,显著减少 LLM 幻觉,并附带基准测试显示其优于标准向量 RAG。通过 pip 安装,运行 FalkorDB 容器,摄入文本(或 PDF/markdown),调用 `finalize()`,再使用 `completion()` 查询。该库支持模式、增量更新、自定义提供者,采用 Apache‑2.0 许可。

takahirom/arbigent

Arbigent(Arbiter-Agent)是一个用于移动、网页和电视应用的开源AI代理测试框架。它允许QA工程师使用自然语言目标在可视化UI中创建测试场景,同时开发者可从YAML文件或CLI中以编程方式运行相同场景。功能包括任务分解、跨平台支持、模型选择灵活性、基于图像的断言、可重用场景库、Maestro/YAML集成,以及通过Model Context Protocol(MCP)实现的可扩展性。安装方式为macOS二进制文件或通过Homebrew安装的CLI(可选固定版本包装脚本)。该工具免费、社区驱动,适用于希望使用LLM驱动的高保真UI测试的团队,但需接受较慢速度和AI成本的权衡。

paulilaaso/lue

一个基于终端的电子书和文档阅读器,可将文本转语音播放与单词高亮和自动滚动同步。

volcengine/SearchCLI

SearchCLI 是 Volcengine AI Search 服务的命令行客户端。它允许您管理数据集、创建搜索应用,并从终端执行搜索、推荐和对话式检索。该工具还支持基于 LLM 的相关性判断,并提供“Viking skills”——可安装的命令包,外部 AI 代理可调用,实现自动化数据接入、配置和质量验证工作流。

neuron-core/neuron-ai

Neuron AI 是一个可通过 Composer 安装的 PHP 框架,用于构建功能齐全的代理应用程序。它提供了一个 Agent 基类(具备记忆、工具包和多供应商 LLM 支持)、用于检索增强生成的 RAG 类、用于自定义管道的低级 Workflow 引擎、结构化输出类型、用于远程工具的 MCP 连接器,以及通过 Inspector 进行的可选可观测性。该库针对 PHP 8.1+,支持 20 多个 LLM 后端,并包含 CLI 生成器、文档和基于 Docker 的测试设置。

WSTxda/SwitchAI

SwitchAI 是一个 Android 应用,通过 Material 3 UI、主屏幕小部件和快速设置瓷砖,让您从数十个 AI 数字助手应用(如 ChatGPT、Claude、Gemini、Alexa 等)中选择、启动并设置默认值。

intel/AI-Playground

Intel AI Playground 是一套开源桌面套件,将本地 LLM 聊天、图像/视频生成、代码辅助、音频转录和工具调用整合到单一 UI 中。它可在 Intel Core Ultra CPU、Intel Arc GPU 或 NVIDIA RTX 显卡上运行,并可选择性地回退到云端 API(ChatGPT、Claude、Gemini、Grok)。测试版安装程序会设置 Llama.cpp、OpenVINO 和 ComfyUI 等后端;模型会通过内置的 Model Manager 按需下载。目标用户为高级用户(prosumer)和注重隐私、想要离线且多合一生成式 AI 工作站的用户。

LCAV/pyroomacoustics

一个用于模拟房间声学和实现音频阵列处理算法的 Python 包,用于生成合成音频数据并测试信号处理技术。

NVIDIA/nvidia-kaggle

基于 Python 的代理技能,让 LLM 代理能够与 Kaggle 交互:获取竞赛信息、总结顶级解法、搜索讨论、下载并复现笔记本、提交解决方案、上传数据集——全部通过自然语言命令完成。

OHF-Voice/linux-voice-assistant

Linux-Voice-Assistant 是一个开源工具,可将 Linux 设备转变为 Home Assistant 的语音卫星。它在本地处理唤醒词检测,并将您的语音流式传输至 Home Assistant 的 Assist,让您构建具备计时器、广播和对话支持的自定义智能音箱。

devnen/Chatterbox-TTS-Server

为 Resemble AI 的 Chatterbox TTS 系列提供的自托管服务器,具备 Web UI 和兼容 OpenAI 的 API,支持语音克隆、多语言支持及有声书生成。

vocoder712/OpenUtauMobile

一款支持 DiffSinger、UTAU 和 Vogen 音源库的移动设备开源歌唱合成编辑器。

agentrq/agentrq

AgentRQ 是一个开源平台,让人类和 LLM 智能体(Claude、Codex、Antigravity 等)共享一个实时任务工作区。它提供 Web UI 和原生桌面应用,以及一个基于 Go 的后端,暴露一个模型上下文协议(MCP),智能体可以调用它来创建/更新任务、触发事件、读写笔记等。功能包括看板、计划/重复任务、拖放事件驱动工作流、设备端自动标题生成、语音转文本和广泛的键盘快捷键。扩展可以添加自定义页面或操作。仓库包括 Docker/自托管说明、单行桌面安装程序,以及通过 `.mcp.json` 集成 Claude 和通过 ACP 网关桥接其他智能体的指南。

ricky0123/vad

一个 JavaScript 库,用于语音活动检测,允许开发者在包含用户语音的音频片段上运行回调。

gendigitalinc/sage

Sage 是一款为 AI 编码助手(Claude Code、Cursor、VS Code、OpenClaw、OpenCode)设计的安全插件。它拦截工具调用——shell 命令、URL 获取、文件写入、包安装——并运行多重威胁检查(云 URL 声誉、300 多个本地 YAML 启发式规则、提示注入 ML 模型、供应链分析、Windows AMSI)。若请求看似不安全,Sage 会阻止它并记录决策。安装通过各自助手的市场或 npm 完成,项目采用 Apache 2.0 开源许可。

jeffhajewski/latticedb

LatticeDB 是一个嵌入式、单文件属性图数据库,同时支持 HNSW 向量相似性和 BM25 全文搜索。它提供统一的 Cypher 查询语言、ACID 事务、持久化变更流,并支持 Python、TypeScript、Go 和 Java 的绑定。基准测试显示,节点查找低于 1 微秒,100 万向量的 10-NN 搜索低于 1 毫秒,全文查询在微秒级,且无需服务器。适用于本地知识图谱、代理记忆和 RAG 流水线,但不适合多写者或分布式工作负载。

vibevoice-community/VibeVoice

一个从文本生成富有表现力、长时、多说话人对话音频的框架,可生成长达 90 分钟的播客。

orneryd/NornicDB

NornicDB 是一个开源 Go 数据库,将兼容 Neo4j 的图遍历、向量搜索(HNSW,GPU 加速)和基于 MVCC 的历史读取合并到一个引擎中。它提供 Bolt/Cypher、REST、GraphQL 和兼容 Qdrant 的 gRPC API,支持硬件加速(Metal、CUDA、Vulkan),并包含衰减/保留策略和自动关系生成等 AI 功能。专为代理记忆、Graph-RAG 和重审计的知识存储设计,声称比 Neo4j 具有显著更低的延迟,并提供 Docker 镜像以便快速部署。

dongbeixiaohuo/writing-agent

Writing-Agent 是一个兼容 Windows、由 Claude Code 驱动的工具,将文章创作转化为多阶段、可复现的流水线,支持证据追踪、事实核查和 AI 语气去除。可通过 CLI、插件或预览桌面应用使用,支持低成本 Anthropic 兼容模型如 deepseek-v4-flash。

nyrahealth/CrisperWhisper

一款高精度语音转文字系统,支持用户在包含填充词的原文直录与干净的意图文本之间自由选择,具备精确的词级时间戳。

CheshireCC/faster-whisper-GUI

一个用于 faster-whisper 和 whisperX 的图形用户界面,可将音频和视频文件转录为多种字幕格式。

OHF-Voice/wyoming-faster-whisper

一个用于 faster-whisper 的 Wyoming 协议服务器,为 Home Assistant 实体提供具备动态名称偏差功能的本地语音转文字服务。

OpenMOSS/MOSS-TTSD

一款可将脚本转化为长达60分钟连续音频的长篇多说话人对话生成模型,支持富有表现力的多角色对话。

kbwo/ccmanager

CCManager 是一个终端 UI,让开发者可以在一个或多个 Git worktree 中运行、监控和组织多个 AI 编码助手会话(Claude、Gemini、Codex 等)。它可以创建和删除 worktree、复制忽略文件和 Claude 对话数据、在重启后保留会话状态、提供视觉状态指示器、可配置的键盘快捷键、自动化钩子、devcontainer 支持以及多项目模式。使用 `npm i -g ccmanager` 安装,并通过 `ccmanager` 启动。

samvallad33/vestige

Vestige 是一个开源、本地运行的 LLM 编码代理记忆层。它记录决策为“记忆”,合并重复项,标记矛盾,并能从错误回溯到导致问题的早期决策(回填)。所有数据均保留在开发者机器上(SQLite),可选通过付费 Pro 版本实现加密同步。安装仅需一条 npm 命令;工具以 25MB 的 Rust 二进制文件形式提供,仅需一次性下载嵌入器和重排序器,之后即可离线运行。基准测试显示,Vestige 使代理比普通向量搜索 RAG 更可靠地收敛到正确修复。采用 AGPL-3.0 许可证。

codeaholicguy/ai-devkit

AI DevKit 是一个本地 npm 基础的控制平面,统一了配置、监控、跨代理消息传递、可搜索的 SQLite 内存,以及可组合的工程“技能”(需求、设计、测试、评审等),适用于 Claude Code、Gemini CLI、Codex CLI、Cursor 和 GitHub Copilot 等多种 AI 编码助手。它让团队能够从单一控制台管理多个代理,将项目规范存储在可搜索的仓库中,并在不修改底层 LLM 的情况下强制执行资深工程师的工作流程。

netease-youdao/EmotiVoice

支持英语和中文的情感合成与语音克隆的多语音、提示控制型文本转语音引擎。

lc2panda/alphastream

Alphastream 是一个 AI 驱动的金融分析 Web 应用。它使用 DeepSeek/任何 OpenAI 兼容 LLM 与 LangGraph,运行 14 个专业智能体(技术、基本面、情感、风险等)以及 4 个投资者人格智能体。实时市场数据来自双适配器(AKShare 与 BaoStock),覆盖中国、美国、香港、加密货币和宏观数据源。Next.js + React 前端采用暗色玻璃拟态 UI,包含聊天、仪表板和图表卡片;Flask 后端通过 SSE 流式传输智能体进度。所有服务可通过一条 Docker-Compose 命令启动。

dapr/dapr-agents

Dapr Agents 是一个基于 Dapr 运行时构建的 Python SDK,可帮助开发者创建可扩展、容错的 AI 代理。它提供持久工作流、基于 Actor 的执行、内置数据源绑定、多代理通信和自动工具发现,所有功能均支持 Kubernetes 原生部署和强安全机制。

oumi-ai/oumi

Oumi 是一个开源的 Python 平台,通过统一的 CLI 和针对多种文本及视觉语言模型的现成 YAML 配方库,覆盖了基础模型从数据准备、训练 (SFT, LoRA, QLoRA, GRPO)、评估到部署的整个生命周期。

SynaLinks/synalinks

Synalinks 是一个开源 Python 框架,允许你使用 Keras 风格的声明式 API 组合、训练和部署神经符号语言模型应用(RAG、代理、递归管道)。它提供沙箱代理、嵌入式图/SQL 知识库、上下文内强化学习优化提示,以及通过 LiteLLM 实现的轻松模型切换。该库支持 FastAPI/FastMCP 部署、MLflow 可观测性与超参数搜索,面向 AI 开发者、研究人员、数据科学家和学习者。

christian-byrne/audio-separation-nodes-comfyui

一組用于通过 Hybrid Demucs 将音频拆分为不同声部(stems)的 ComfyUI 节点,并可执行音频编辑任务,如速度匹配与裁剪。

vibeinging/dsh-desktop

DSH Desktop 是一个社区维护的桌面发行版,打包了官方 DeepSeek Harness AI 运行时、内置插件市场、更优的侧边栏工作台(文件树、编辑器、Git、终端)、任务板,以及可选的移动/远程访问功能。它在 Electron 主机中运行 DSH Web UI,使用单一配置文件管理所有数据,并出厂预装 16 个已验证插件。macOS Apple Silicon 和 Windows x64 的安装程序已提供;其他平台可从源码构建。

Blaizzy/mlx-audio-swift

基于 Apple Silicon 上的 MLX 的模块化 Swift SDK,可轻松将 TTS、STT、VAD 和音频编解码器集成到 macOS 和 iOS 应用中。

ghuntley/how-to-build-a-coding-agent

一个基于 Go 的工作坊,逐步构建一个由 Claude 驱动的编码助手,逐步添加文件读取、目录列出、shell 执行、文件编辑和代码搜索等工具。

akshayaggarwal99/jarvis-ai-assistant

一款开源语音转录工具,可在系统任何位置将语音转换为文本,支持本地转录和 LLM 后处理,兼顾隐私与速度。

Notely-Voice/NotelyVoice

一款私密、跨平台的 AI 语音转录与笔记应用,使用 OpenAI Whisper 提供离线语音转文字功能。

torchgeo/torchgeo

TorchGeo 是一个 PyTorch 库,让处理卫星和航空图像变得简单。它提供现成的地理空间数据集、用于补丁提取的智能采样器、多光谱预训练模型,并与 PyTorch Lightning 紧密集成,让研究人员只需几行代码即可训练和评估遥感模型。

5uck1ess/tts-bench

一个用于本地文本转语音模型的基准测试套件,可在各种硬件设备上评估速度、客观质量分数和人类偏好排名。

Accio-org/CommerceAgentBench

Commerce Agent Bench 是一个开源基准测试,用于在 107 个真实的、有状态的商业任务 (CLI, browser, API, file) 上评估 LLM-based agent。它提供 Docker-隔离的 mock services, 一个可复现的 OpenClaw harness, 多供应商路由, 以及一个公开的排行榜。该仓库包含安装说明, 示例运行, 以及一个可复现性契约, 但其本身并不提供任何 agent。

soaring-xiongkulu/easyaiot

EasyAIoT是一个开源云边端平台,统一了AI视频分析、IoT设备管理和企业集成。它运行在小型边缘盒子上(约1GB RAM),通过内置RTC模块支持专业IP摄像头和消费级P2P摄像头(Tapo、Tuya、Ring等),提供原生YOLO/SAM推理、联邦边缘调度和用于现场验收的一键安装程序(PANEL)。可安装在Linux、Windows、macOS和ARM上,提供Web、移动和SCADA风格的仪表板,用于实时监控和警报。

elevenlabs/ui

一个基于 shadcn/ui 的 React 组件库,提供波形、球体等预构建 UI 元素,用于构建音频和 AI 代理应用。

TracecatHQ/tracecat

Tracecat 是一个开源的 AI 原生安全自动化平台。它允许团队构建具有工具访问权限的自定义 LLM 智能体,管理事件案件,并编排确定性工作流(通过 Temporal)。功能包括沙箱代码执行、100 多个安全工具集成、用于将提示词转换为操作的 Model-Code-Prompt (MCP) 服务器,以及可自托管的技术栈(Docker、Fargate、Kubernetes)。核心采用 AGPL-3.0 许可证;企业版增加了多租户、RBAC 和人工介入审批。