microsoft/TypeAgent

TypeAgent 是微软开源的一个示例项目,展示了如何使用大语言模型、结构化提示和一种新颖的“结构化 RAG”记忆系统,构建一个单一的个人 AI 助手。它包含一个 Electron 外壳、一个将自然语言请求路由到类型化代理的调度器、一个将对话事实存储为逻辑实体的记忆层,以及一个减少 LLM 调用的缓存。该仓库提供了许多示例代理(日历、邮件、浏览器等)和一个用于添加自定义代理的 SDK。这是一个早期阶段的示例代码,仅在 Azure OpenAI 上以英文测试过,未经进一步验证前不适用于生产环境。

erdogant/bnlearn

bnlearn 是一个用于学习、参数化和查询贝叶斯网络的 Python 库。它支持结构发现(多种评分和搜索方法)、CPT 估计、因果推断(do-计算)、合成数据生成和可视化,所有功能均封装在简洁的 API 中。

bugbakery/transcribee

一款开源的音视频转录工具,利用 AI 生成自动草稿,并支持协作式手动编辑。

joaopauloschuler/neural-api

一个原生 Pascal 深度学习库(CAI Neural API),可在 CPU(AVX)或 OpenCL GPU 上运行现代 LLM、音频生成、图像超分辨率和经典视觉模型,编译为单个二进制文件,无需 Python 或 CUDA。

FonaTech/Clouds-Coder

Clouds Coder 是一个 Python 运行时,将 CLI 执行与基于浏览器的 IDE 分离,增加 AI 代理编排功能,并提供仅限局域网的协作工作区,支持版本化文件、冲突解决和管理员批准的工具策略。

jim60105/docker-whisperX

一组为 WhisperX 优化的 Docker 镜像,提供预打包的 ASR 模型,支持单词级时间戳,实现快速高效的语音转文字转录。

TalAter/annyang

一个轻量级的 JavaScript 库,使用语音识别技术使用户能够通过语音命令控制网站。

lenML/Speech-AI-Forge

一个统一的框架和 API 服务器,为包括 ChatTTS、CosyVoice 和 Whisper 在内的多种 TTS 和 ASR 模型提供集中式接口。

open-mmlab/FoleyCrafter

FoleyCrafter 是一个视频转音频生成框架,能够基于无声视频的视觉内容生成真实、同步的音效。

brailcom/speechd

一种设备无关的语音合成接口,提供统一 API 以访问多个文本转语音引擎。

walkingddd/CPA-Helper

CPA‑Helper 是一个自托管的 Web 仪表板(Go 后端 + Vue 前端),用于管理 CLIProxyAPI/CPA 账户。它提供多用户分析、用户级 API 密钥处理、余额限制、模型价格目录以及 Codex 认证文件的健康检查,所有数据均本地存储在 SQLite 中。

CopilotC-Nvim/CopilotChat.nvim

一个将 GitHub Copilot Chat(及其他 LLM)直接嵌入编辑器的 Neovim 插件,提供聊天、工具调用、自定义提示和用于自动化的 Lua API。

nishuzumi/gemini-teacher

基于 Google Gemini 的 AI 驱动英语口语助手,提供实时发音反馈和语法修正。

chenpipi0807/ComfyUI-Index-TTS

一个实现高保真语音克隆与文本转语音的 ComfyUI 扩展,支持多语言、情感控制及多角色小说文本解析。

dbccccccc/ttsfm

一个使用 openai.fm 后端将文本转换为自然语音的 OpenAI 兼容文本转语音 (TTS) API 服务和 Python SDK。

hgneng/ekho

Ekho 是一个中文文本转语音引擎,可将书面文本转换为口语音频,并支持自定义语音数据整合。

bosun-ai/swiftide

Swiftide 是一个用于构建 LLM 应用的 Rust 框架,包含三个核心组件:用于半自主智能体的代理框架 (agent harness)、用于工作流编排的类型化任务图 (任务图 (typed task graphs)),以及用于索引与检索的流式 RAG 管线 (streaming RAG pipelines)。

facebookresearch/HolisticTraceAnalysis

Holistic Trace Analysis (HTA) 是一个 Python 库,可读取分布式训练任务生成的 PyTorch Profiler(Kineto)追踪文件,并生成数据框和可视化图表,展示 GPU 在计算、通信、内存或空闲状态上花费的时间。它提供内核级分解、空闲时间原因分析、通信-计算重叠、频繁内核模式、启动时间统计、增强的内存带宽/队列长度计数器,以及追踪对比工具。通过 `pip install HolisticTraceAnalysis`(Linux/macOS,Python ≥ 3.10)安装,并在笔记本中使用 `TraceAnalysis` 类获取各分析结果的 pandas DataFrames。提供文档、示例和实验性 CUPTI 计数器 API。

tsurumeso/vocal-remover

通过将人声与背景音乐分离,使用深度学习从歌曲中提取伴奏音轨的工具。

ML-KULeuven/deepproblog

DeepProbLog是一个Python库,通过引入神经谓词(其概率由PyTorch模型输出的事实)将ProbLog的概率逻辑编程与深度学习相结合。它支持精确推理和可选的近似推理,包含研究论文中的示例实验,可通过`pip install deepproblog`安装。

rossoctl/rossoctl

Rossoctl 是一个开源、Kubernetes 原生平台,通过 RossoCortex 数据平面拦截 AI 代理,强制执行身份、授权、弹性与可观测性。它提供可复用服务(技能、工具、记忆、知识库、沙箱)和管理工具,使跨框架的可信、生产级代理部署成为可能。

nnstreamer/nnstreamer

NNStreamer 提供 GStreamer 插件,让开发人员能够将神经网络推理直接嵌入媒体流水线中,支持跨 Linux、Android、Tizen 和 macOS 的多种 AI 框架和硬件加速器。

halo-dev/upage

UPage 是一个开源、基于 Docker 的平台,利用大语言模型将自然语言描述转化为完全响应式的网页。它提供可视化编辑器、多页面生成和干净的 HTML/CSS/JS 导出功能,支持任何兼容的 LLM API。

backmeupplz/voicy

一个使用工作队列架构和 GPU 加速转录的 Telegram 机器人,可自动将音频消息转换为文本。

tequilahub/tequila

Tequila 是一个用于构建和优化变分量子算法的 Python 框架。它提供电路、哈密顿量和期望值的抽象对象,支持自动微分,并与多种量子模拟器(Qulacs、Qiskit、Cirq 等)和量子化学包(Psi4、PySCF、Madness)无缝集成。用户编写高层代码,调用 `tq.minimize`,即可在模拟器或真实硬件上运行。

aliyun/alibabacloud-bailian-speech-demo

阿里云百炼开发者示例集。可使用Qwen-Audio及其他模型实现语音识别、合成和实时语音对话。

jcvasquezc/DisVoice

一个用于从语音中提取声学和语言特征以检测语音障碍和识别情绪的 Python 框架。

wenet-e2e/wekws

专为低功耗物联网设备设计的、可投入生产的端到端小型唤醒词检测工具包。

Azure-Samples/cognitive-services-speech-sdk

一组跨平台代码示例,展示如何使用 Microsoft Cognitive Services Speech SDK 实现语音识别、合成和翻译。

BindsNET/bindsnet

BindsNET 是一个基于 PyTorch 的库,用于在 CPU 或 GPU 上构建和模拟脉冲神经网络。它提供神经元模型、生物启发的学习规则(例如 STDP),以及将 SNN 转换为 ML 或 RL 代理的工具。可通过 pip、Poetry 或 Docker 安装,并运行从 MNIST 无监督学习到 Atari 游戏的示例。

lean-dojo/LeanCopilot

Lean Copilot 是一个将大语言模型作为证明自动化战术集成到 Lean 4 中的库。它提供 `suggest_tactics`、`search_proof` 和 `select_premises` 等命令,包含预构建的 BYT5 模型,并可通过简单的 HTTP API 接入任何外部模型。通过标准 Lake 包管理器安装,可在任何 Lean 项目中立即使用。

inworld-ai/tts

一个基于 SpeechLM 的文本转语音系统的训练和建模框架,支持在单 GPU 或多 GPU 集群上进行预训练、SFT 和 RLHF 对齐。

openyak/openyak

OpenYak 是一个开源桌面 GUI (Electron + React),让您能与 Codex 或 Claude Code 代理进行对话,同时将所有对话记录、文件和项目数据保留在本地 (Rust + SQLite)。它通过 stdio 集成官方运行环境,显示参考文件 (Markdown, HTML, PDF, DOCX, 代码),并提供一个由 Playwright 驱动的共享浏览器,让用户与代理皆可控制同一个页面。请使用 Node 26、Rust 1.90 以及您自己的 Codex/Claude CLI 二进制文件执行;应用程序目前为 v2 alpha 版本,采用 Apache-2.0 授权。

machinewrapped/llm-subtrans

LLM‑Subtrans 是一个基于 Python 的桌面和 CLI 工具,使用 LLM API(Gemini、OpenAI、Anthropic 等)翻译字幕文件(SRT/ASS/VTT)。支持可插拔字幕格式、可选音频转录、项目文件续传及多种高级 CLI 选项。可通过预构建的 Windows/macOS 安装包或虚拟环境安装程序从源码安装;通过简单 GUI 或命令行运行,只需提供 API 密钥即可使用。

neiltron/apple-health-mcp

一个本地 Node.js 服务器,让 AI 助手客户端(通过 MCP)能够使用内存中的 DuckDB 数据库,对个人的 Apple Health CSV 导出文件执行 SQL 查询。它提供结构发现、即时查询与健康摘要报告,同时确保数据保留在用户电脑上。

ksenxx/kiss_ai

KISS Sorcar 是一个开源、本地优先的 AI 代理框架,运行守护进程(`kiss‑web`),并通过 VS Code、Web/移动和 Python 接口发出自然语言任务。支持您配置的任意 LLM(OpenAI、Anthropic、Gemini、本地端点等),可在单个工作流中混合多个模型,并提供 43 个内置第三方代理,用于消息、邮件、智能家居和生产力服务。自定义 Python「扩展代理」允许您为每个任务定义提示、工具、预算和安全钩子。所有提示均保留在您的机器上;系统处理 git worktree 隔离、语音唤醒词、定时自动化和工具调用,是一款注重隐私、可扩展的个人 AI 助手。

linuxrebel/DocuBrowser

DocuBrowse 是一款离线、AI增强的文档搜索工具。它可索引多种文件类型,支持关键词、语义和混合搜索(使用本地Ollama嵌入),提供文档内“深度链接”,并能使用本地模型生成AI摘要。所有操作均在本地运行,保障隐私,且已打包为Linux、Windows和macOS版本。

kstonekuan/tambourine-voice

一个开源的通用语音转文字接口,利用 AI 将语音转录并格式化为干净文本,直接输入到任何活动应用程序中。

Lamatic/AgentKit

AgentKit 是一个开源 SDK,提供 70 个现成的“套件”(完整应用、流水线或模板),用于构建、测试和部署 AI 代理。套件由一个简单的配置文件定义,可在可视化流程工作室中编辑,并以无服务器运行的 Next.js 应用形式交付。该集合涵盖支持分诊、代码审查、RAG 聊天、招聘助手、法律/医疗机器人等众多业务导向的代理,是一个开箱即用的平台,可快速构建可靠、企业级的 AI 代理。

istupakov/onnx-asr

一个用于自动语音识别 (ASR) 的轻量级 Python 包,使用 ONNX 模型,无需 PyTorch 或 Transformers 即可在边缘和服务器硬件上实现快速部署。

cyberofficial/Synthalingua

一款用于将直播、麦克风音频和视频文件实时转录并翻译成英语及其他语言的自托管 AI 工具。

AudarAI/Audar-ASR-V1

一套以阿拉伯语为首要目标的生成式语音识别模型家族,可为方言阿拉伯语和代码切换语音提供业界领先的转录性能。

janvarev/Irene-Voice-Assistant

一款默认离线运行的俄语语音助手,支持可扩展的插件和基于 LLM 的自然语言命令处理。

cmusphinx/pocketsphinx

PocketSphinx 是一个开源、离线的语音转文本引擎(C 库,带 Python 绑定),可在低资源设备上高效运行。它提供命令行工具和 API,用于识别或对齐音频,并将结果输出为 JSON 格式。

ManimCommunity/manim-voiceover

一个将 AI 配音和录音工具直接集成到 Python 中的 Manim 插件,利用 OpenAI Whisper 实现逐词动画同步。

Migushthe2nd/MsEdgeTTS

一个简单的 Azure Speech Service 模块,利用 Microsoft Edge Read Aloud API 为服务端运行时提供文本转语音合成。

PowerBeef/Vocello

一个适用于 macOS 和 iOS 的本地优先语音工作室,利用 MLX 和 Swift 生成高质量语音,支持语音克隆和自定义语音设计,无需依赖云端服务。

nateshmbhat/pyttsx3

一个利用本地系统引擎在离线状态下生成语音输出的 Python 库,无需互联网连接即可实现文本转语音转换。