hoophq/hoop
hoop 是一个开源侧车,位于 AI 代理与其数据源之间,提供运行时数据掩码、护栏、可选的基于模型的风险分析以及人工审查升级功能,所有配置均可通过单一 YAML 文件定义,并可通过轻量级控制平面 UI 实现规模化管理。
PatterAI/Patter
一个为 AI Agent 提供完整语音栈的开源 SDK,将 LLM、STT、TTS 和电话运营商集成到单个 API 中。
neuphonic/neutts
一系列开源的端侧文本转语音模型,可在移动和嵌入式设备上本地实现自然语音和即时语音克隆。
sipeter/CloneTTS
一个离线的 Android TTS 引擎,可通过短音频样本实现本地语音克隆,用于私密、设备端的文本转语音合成。
goodroot/hyprwhspr
一款原生 Linux 语音转文本工具,利用本地或云端 AI 模型,提供快速、私密且系统级的语音输入功能。
FalkorDB/GraphRAG-SDK
GraphRAG‑SDK 是一个 Python SDK,从您的文档构建 FalkorDB 中的知识图谱,然后通过遍历该图谱回答问题。它添加了出处边、多跳检索和可选拒答功能,显著减少 LLM 幻觉,并附带基准测试显示其优于标准向量 RAG。通过 pip 安装,运行 FalkorDB 容器,摄入文本(或 PDF/markdown),调用 `finalize()`,再使用 `completion()` 查询。该库支持模式、增量更新、自定义提供者,采用 Apache‑2.0 许可。
takahirom/arbigent
Arbigent(Arbiter-Agent)是一个用于移动、网页和电视应用的开源AI代理测试框架。它允许QA工程师使用自然语言目标在可视化UI中创建测试场景,同时开发者可从YAML文件或CLI中以编程方式运行相同场景。功能包括任务分解、跨平台支持、模型选择灵活性、基于图像的断言、可重用场景库、Maestro/YAML集成,以及通过Model Context Protocol(MCP)实现的可扩展性。安装方式为macOS二进制文件或通过Homebrew安装的CLI(可选固定版本包装脚本)。该工具免费、社区驱动,适用于希望使用LLM驱动的高保真UI测试的团队,但需接受较慢速度和AI成本的权衡。
paulilaaso/lue
一个基于终端的电子书和文档阅读器,可将文本转语音播放与单词高亮和自动滚动同步。
volcengine/SearchCLI
SearchCLI 是 Volcengine AI Search 服务的命令行客户端。它允许您管理数据集、创建搜索应用,并从终端执行搜索、推荐和对话式检索。该工具还支持基于 LLM 的相关性判断,并提供“Viking skills”——可安装的命令包,外部 AI 代理可调用,实现自动化数据接入、配置和质量验证工作流。
neuron-core/neuron-ai
Neuron AI 是一个可通过 Composer 安装的 PHP 框架,用于构建功能齐全的代理应用程序。它提供了一个 Agent 基类(具备记忆、工具包和多供应商 LLM 支持)、用于检索增强生成的 RAG 类、用于自定义管道的低级 Workflow 引擎、结构化输出类型、用于远程工具的 MCP 连接器,以及通过 Inspector 进行的可选可观测性。该库针对 PHP 8.1+,支持 20 多个 LLM 后端,并包含 CLI 生成器、文档和基于 Docker 的测试设置。
WSTxda/SwitchAI
SwitchAI 是一个 Android 应用,通过 Material 3 UI、主屏幕小部件和快速设置瓷砖,让您从数十个 AI 数字助手应用(如 ChatGPT、Claude、Gemini、Alexa 等)中选择、启动并设置默认值。
intel/AI-Playground
Intel AI Playground 是一套开源桌面套件,将本地 LLM 聊天、图像/视频生成、代码辅助、音频转录和工具调用整合到单一 UI 中。它可在 Intel Core Ultra CPU、Intel Arc GPU 或 NVIDIA RTX 显卡上运行,并可选择性地回退到云端 API(ChatGPT、Claude、Gemini、Grok)。测试版安装程序会设置 Llama.cpp、OpenVINO 和 ComfyUI 等后端;模型会通过内置的 Model Manager 按需下载。目标用户为高级用户(prosumer)和注重隐私、想要离线且多合一生成式 AI 工作站的用户。
LCAV/pyroomacoustics
一个用于模拟房间声学和实现音频阵列处理算法的 Python 包,用于生成合成音频数据并测试信号处理技术。
NVIDIA/nvidia-kaggle
基于 Python 的代理技能,让 LLM 代理能够与 Kaggle 交互:获取竞赛信息、总结顶级解法、搜索讨论、下载并复现笔记本、提交解决方案、上传数据集——全部通过自然语言命令完成。
OHF-Voice/linux-voice-assistant
Linux-Voice-Assistant 是一个开源工具,可将 Linux 设备转变为 Home Assistant 的语音卫星。它在本地处理唤醒词检测,并将您的语音流式传输至 Home Assistant 的 Assist,让您构建具备计时器、广播和对话支持的自定义智能音箱。
devnen/Chatterbox-TTS-Server
为 Resemble AI 的 Chatterbox TTS 系列提供的自托管服务器,具备 Web UI 和兼容 OpenAI 的 API,支持语音克隆、多语言支持及有声书生成。
vocoder712/OpenUtauMobile
一款支持 DiffSinger、UTAU 和 Vogen 音源库的移动设备开源歌唱合成编辑器。
agentrq/agentrq
AgentRQ 是一个开源平台,让人类和 LLM 智能体(Claude、Codex、Antigravity 等)共享一个实时任务工作区。它提供 Web UI 和原生桌面应用,以及一个基于 Go 的后端,暴露一个模型上下文协议(MCP),智能体可以调用它来创建/更新任务、触发事件、读写笔记等。功能包括看板、计划/重复任务、拖放事件驱动工作流、设备端自动标题生成、语音转文本和广泛的键盘快捷键。扩展可以添加自定义页面或操作。仓库包括 Docker/自托管说明、单行桌面安装程序,以及通过 `.mcp.json` 集成 Claude 和通过 ACP 网关桥接其他智能体的指南。
ricky0123/vad
一个 JavaScript 库,用于语音活动检测,允许开发者在包含用户语音的音频片段上运行回调。
gendigitalinc/sage
Sage 是一款为 AI 编码助手(Claude Code、Cursor、VS Code、OpenClaw、OpenCode)设计的安全插件。它拦截工具调用——shell 命令、URL 获取、文件写入、包安装——并运行多重威胁检查(云 URL 声誉、300 多个本地 YAML 启发式规则、提示注入 ML 模型、供应链分析、Windows AMSI)。若请求看似不安全,Sage 会阻止它并记录决策。安装通过各自助手的市场或 npm 完成,项目采用 Apache 2.0 开源许可。
jeffhajewski/latticedb
LatticeDB 是一个嵌入式、单文件属性图数据库,同时支持 HNSW 向量相似性和 BM25 全文搜索。它提供统一的 Cypher 查询语言、ACID 事务、持久化变更流,并支持 Python、TypeScript、Go 和 Java 的绑定。基准测试显示,节点查找低于 1 微秒,100 万向量的 10-NN 搜索低于 1 毫秒,全文查询在微秒级,且无需服务器。适用于本地知识图谱、代理记忆和 RAG 流水线,但不适合多写者或分布式工作负载。
vibevoice-community/VibeVoice
一个从文本生成富有表现力、长时、多说话人对话音频的框架,可生成长达 90 分钟的播客。
orneryd/NornicDB
NornicDB 是一个开源 Go 数据库,将兼容 Neo4j 的图遍历、向量搜索(HNSW,GPU 加速)和基于 MVCC 的历史读取合并到一个引擎中。它提供 Bolt/Cypher、REST、GraphQL 和兼容 Qdrant 的 gRPC API,支持硬件加速(Metal、CUDA、Vulkan),并包含衰减/保留策略和自动关系生成等 AI 功能。专为代理记忆、Graph-RAG 和重审计的知识存储设计,声称比 Neo4j 具有显著更低的延迟,并提供 Docker 镜像以便快速部署。
dongbeixiaohuo/writing-agent
Writing-Agent 是一个兼容 Windows、由 Claude Code 驱动的工具,将文章创作转化为多阶段、可复现的流水线,支持证据追踪、事实核查和 AI 语气去除。可通过 CLI、插件或预览桌面应用使用,支持低成本 Anthropic 兼容模型如 deepseek-v4-flash。
nyrahealth/CrisperWhisper
一款高精度语音转文字系统,支持用户在包含填充词的原文直录与干净的意图文本之间自由选择,具备精确的词级时间戳。
CheshireCC/faster-whisper-GUI
一个用于 faster-whisper 和 whisperX 的图形用户界面,可将音频和视频文件转录为多种字幕格式。
OHF-Voice/wyoming-faster-whisper
一个用于 faster-whisper 的 Wyoming 协议服务器,为 Home Assistant 实体提供具备动态名称偏差功能的本地语音转文字服务。
OpenMOSS/MOSS-TTSD
一款可将脚本转化为长达60分钟连续音频的长篇多说话人对话生成模型,支持富有表现力的多角色对话。
kbwo/ccmanager
CCManager 是一个终端 UI,让开发者可以在一个或多个 Git worktree 中运行、监控和组织多个 AI 编码助手会话(Claude、Gemini、Codex 等)。它可以创建和删除 worktree、复制忽略文件和 Claude 对话数据、在重启后保留会话状态、提供视觉状态指示器、可配置的键盘快捷键、自动化钩子、devcontainer 支持以及多项目模式。使用 `npm i -g ccmanager` 安装,并通过 `ccmanager` 启动。
samvallad33/vestige
Vestige 是一个开源、本地运行的 LLM 编码代理记忆层。它记录决策为“记忆”,合并重复项,标记矛盾,并能从错误回溯到导致问题的早期决策(回填)。所有数据均保留在开发者机器上(SQLite),可选通过付费 Pro 版本实现加密同步。安装仅需一条 npm 命令;工具以 25MB 的 Rust 二进制文件形式提供,仅需一次性下载嵌入器和重排序器,之后即可离线运行。基准测试显示,Vestige 使代理比普通向量搜索 RAG 更可靠地收敛到正确修复。采用 AGPL-3.0 许可证。
codeaholicguy/ai-devkit
AI DevKit 是一个本地 npm 基础的控制平面,统一了配置、监控、跨代理消息传递、可搜索的 SQLite 内存,以及可组合的工程“技能”(需求、设计、测试、评审等),适用于 Claude Code、Gemini CLI、Codex CLI、Cursor 和 GitHub Copilot 等多种 AI 编码助手。它让团队能够从单一控制台管理多个代理,将项目规范存储在可搜索的仓库中,并在不修改底层 LLM 的情况下强制执行资深工程师的工作流程。
netease-youdao/EmotiVoice
支持英语和中文的情感合成与语音克隆的多语音、提示控制型文本转语音引擎。
lc2panda/alphastream
Alphastream 是一个 AI 驱动的金融分析 Web 应用。它使用 DeepSeek/任何 OpenAI 兼容 LLM 与 LangGraph,运行 14 个专业智能体(技术、基本面、情感、风险等)以及 4 个投资者人格智能体。实时市场数据来自双适配器(AKShare 与 BaoStock),覆盖中国、美国、香港、加密货币和宏观数据源。Next.js + React 前端采用暗色玻璃拟态 UI,包含聊天、仪表板和图表卡片;Flask 后端通过 SSE 流式传输智能体进度。所有服务可通过一条 Docker-Compose 命令启动。
dapr/dapr-agents
Dapr Agents 是一个基于 Dapr 运行时构建的 Python SDK,可帮助开发者创建可扩展、容错的 AI 代理。它提供持久工作流、基于 Actor 的执行、内置数据源绑定、多代理通信和自动工具发现,所有功能均支持 Kubernetes 原生部署和强安全机制。
oumi-ai/oumi
Oumi 是一个开源的 Python 平台,通过统一的 CLI 和针对多种文本及视觉语言模型的现成 YAML 配方库,覆盖了基础模型从数据准备、训练 (SFT, LoRA, QLoRA, GRPO)、评估到部署的整个生命周期。
SynaLinks/synalinks
Synalinks 是一个开源 Python 框架,允许你使用 Keras 风格的声明式 API 组合、训练和部署神经符号语言模型应用(RAG、代理、递归管道)。它提供沙箱代理、嵌入式图/SQL 知识库、上下文内强化学习优化提示,以及通过 LiteLLM 实现的轻松模型切换。该库支持 FastAPI/FastMCP 部署、MLflow 可观测性与超参数搜索,面向 AI 开发者、研究人员、数据科学家和学习者。
christian-byrne/audio-separation-nodes-comfyui
一組用于通过 Hybrid Demucs 将音频拆分为不同声部(stems)的 ComfyUI 节点,并可执行音频编辑任务,如速度匹配与裁剪。
vibeinging/dsh-desktop
DSH Desktop 是一个社区维护的桌面发行版,打包了官方 DeepSeek Harness AI 运行时、内置插件市场、更优的侧边栏工作台(文件树、编辑器、Git、终端)、任务板,以及可选的移动/远程访问功能。它在 Electron 主机中运行 DSH Web UI,使用单一配置文件管理所有数据,并出厂预装 16 个已验证插件。macOS Apple Silicon 和 Windows x64 的安装程序已提供;其他平台可从源码构建。
Blaizzy/mlx-audio-swift
基于 Apple Silicon 上的 MLX 的模块化 Swift SDK,可轻松将 TTS、STT、VAD 和音频编解码器集成到 macOS 和 iOS 应用中。
ghuntley/how-to-build-a-coding-agent
一个基于 Go 的工作坊,逐步构建一个由 Claude 驱动的编码助手,逐步添加文件读取、目录列出、shell 执行、文件编辑和代码搜索等工具。
akshayaggarwal99/jarvis-ai-assistant
一款开源语音转录工具,可在系统任何位置将语音转换为文本,支持本地转录和 LLM 后处理,兼顾隐私与速度。
Notely-Voice/NotelyVoice
一款私密、跨平台的 AI 语音转录与笔记应用,使用 OpenAI Whisper 提供离线语音转文字功能。
torchgeo/torchgeo
TorchGeo 是一个 PyTorch 库,让处理卫星和航空图像变得简单。它提供现成的地理空间数据集、用于补丁提取的智能采样器、多光谱预训练模型,并与 PyTorch Lightning 紧密集成,让研究人员只需几行代码即可训练和评估遥感模型。
5uck1ess/tts-bench
一个用于本地文本转语音模型的基准测试套件,可在各种硬件设备上评估速度、客观质量分数和人类偏好排名。
Accio-org/CommerceAgentBench
Commerce Agent Bench 是一个开源基准测试,用于在 107 个真实的、有状态的商业任务 (CLI, browser, API, file) 上评估 LLM-based agent。它提供 Docker-隔离的 mock services, 一个可复现的 OpenClaw harness, 多供应商路由, 以及一个公开的排行榜。该仓库包含安装说明, 示例运行, 以及一个可复现性契约, 但其本身并不提供任何 agent。
soaring-xiongkulu/easyaiot
EasyAIoT是一个开源云边端平台,统一了AI视频分析、IoT设备管理和企业集成。它运行在小型边缘盒子上(约1GB RAM),通过内置RTC模块支持专业IP摄像头和消费级P2P摄像头(Tapo、Tuya、Ring等),提供原生YOLO/SAM推理、联邦边缘调度和用于现场验收的一键安装程序(PANEL)。可安装在Linux、Windows、macOS和ARM上,提供Web、移动和SCADA风格的仪表板,用于实时监控和警报。
elevenlabs/ui
一个基于 shadcn/ui 的 React 组件库,提供波形、球体等预构建 UI 元素,用于构建音频和 AI 代理应用。
TracecatHQ/tracecat
Tracecat 是一个开源的 AI 原生安全自动化平台。它允许团队构建具有工具访问权限的自定义 LLM 智能体,管理事件案件,并编排确定性工作流(通过 Temporal)。功能包括沙箱代码执行、100 多个安全工具集成、用于将提示词转换为操作的 Model-Code-Prompt (MCP) 服务器,以及可自托管的技术栈(Docker、Fargate、Kubernetes)。核心采用 AGPL-3.0 许可证;企业版增加了多租户、RBAC 和人工介入审批。