sooftware/conformer

Conformer 架构的 PyTorch 实现,通过结合 CNN 和 Transformer 来捕捉局部和全局音频依赖关系,从而提高语音识别性能。

modal-labs/quillman

一个由 Moshi 语音对语音模型驱动的语音聊天应用,提供低延迟、双向音频流,实现类人交互。

flashlight/wav2letter

wav2letter++ 是一个端到端自动语音识别框架,它提供实现最先进语音转文本架构的方案(recipes)和预训练模型。

Uberi/speech_recognition

一个为语音识别提供统一接口的 Python 库,支持 OpenAI Whisper、Google Speech 和 Vosk 等多种在线和离线引擎。

elevenlabs/elevenlabs-js

ElevenLabs 官方 Node.js SDK,使开发者能够将逼真的 AI 语音合成、实时音频流和语音驱动的 AI 代理集成到其应用中。

wildminder/ComfyUI-VoxCPM

VoxCPM 的 ComfyUI 自定义节点集成。VoxCPM 是一个无需分词器(tokenizer-free)的 TTS 系统,能够实现富有表现力的语音生成、自然语言语音设计以及高级语音克隆。

codeforequity-at/botium-speech-processing

一个用于开源与云端语音转文字 (STT) 和文字转语音 (TTS) 服务的统一 API,简化了聊天机器人和语音应用的音频处理流程。

hengruiyun/AI-Stock-Master

AI Stock Master 是一个 Windows/macOS 桌面应用程序,将定量股票分析算法(RTSI、TMA、MSCI)与本地运行的 LLM(Mini Ollama)结合,为中国、香港和美国股票生成自然语言市场报告和交易信号。它是一个研究导向的工具,而非商业交易平台。

24kchengYe/MemoMind

MemoMind 是一个本地托管、GPU 加速的记忆系统,专为 AI 编码代理设计。它将聊天、文档和日常生活事件中提取的事实存储在 PostgreSQL + pgvector 中,构建知识图谱,并提供快速的 4 方向混合检索(语义、BM25、图谱、时间)。代理可以保留新信息、回忆相关记忆,并对整个存储库进行反思。所有数据均保留在用户机器上,兼容任何 OpenAI 兼容 LLM,并包含一个用于浏览和导出记忆的 Web 仪表板。

adobe-research/dynasaur

DynaSaur 是一个 AI agent 框架,通过编写和重用 Python 代码作为动作来解决任务,并在预定义工具不足时进行动态调整。

Paritok-official/paritok-4b-v1

Paritok 是一个开源代理,位于代码代理(Claude Code、Cursor、Codex、OpenHands 等)与 LLM API 之间。它通过(1)过滤无关工具模式,(2)使用 4B 模型压缩文件读取/工具输出/历史记录,(3)总结旧轮次,来减少输入 token 使用量。网关是一个 Python 包(`paritok[proxy]`),可通过 Ollama 或 vLLM 本地运行,或通过托管 GPU 服务运行。报告的节省效果为首次轮次约 25%,长时间会话超过 60%,显著降低使用成本。项目采用 Apache-2.0 许可证,包含仪表板和 VS Code 扩展。

Picovoice/speech-to-text-benchmark

一个极简框架,用于在各种数据集上基准测试语音转文字引擎,以比较准确度、延迟和计算效率。

mrwadams/attackgen

AttackGen 是一个基于 Streamlit 的开源 Web 应用程序,通过 LiteLLM 使用 LLM,结合 MITRE ATT&CK、MITRE ATLAS 和 AI 内部威胁模型,生成完整的网络事件响应桌面推演场景、检测与响应报告以及 ATT&CK Navigator 层。它支持多种 LLM 提供商,提供聊天助手用于优化,可本地运行或作为 Docker 容器部署,并包含可选的 FastMCP 服务器以实现代理集成。

nullpointexception-i/agent-sphere

AgentSphere 是一个基于 Java-Spring/React 的平台,支持 LLM 驱动的 ReAct 循环、多代理子运行、通过 Chrome 扩展实现的真实浏览器自动化、模型路由、持久化多级内存、人机协同澄清、OIDC SSO 以及可嵌入的聊天组件。

csdcorp/speech_to_text

一个 Flutter 插件,让应用能够通过原生设备语音识别功能在 Android、iOS 和 web 上执行短语音指令与短语。

Picovoice/leopard

Leopard 是一款设备端语音转文字引擎,可在多个平台上提供私密、准确且计算效率高的转录服务。

Picovoice/cheetah

一款在设备上运行的流式语音转文字引擎,提供跨平台的私密实时音频转录。

innovatorved/whisper.api

一个由 whisper.cpp 提供驱动、高性能的语音转文字 API,且与 Deepgram 兼容,方便进行集成。

deepgram/deepgram-python-sdk

Deepgram 官方 Python SDK,提供自动语音识别、文本转语音和语言理解 API 的便捷集成。

CortexReach/memory-lancedb-pro

memory-lancedb-pro 是一个生产级 OpenClaw 插件,为 AI 代理提供持久、可搜索的记忆。它自动捕获对话片段,使用 LLM 进行分类,存储在 LanceDB 向量+BM25 索引中,并自动将最相关的记忆注入提示。功能包括混合检索、交叉编码器重排序、基于 Weibull 的遗忘、按代理/用户/项目的作用域隔离,以及对任何 OpenAI 兼容嵌入提供者的支持。可通过一键脚本或 OpenClaw CLI 安装,用简短 JSON 块配置,并通过内置 CLI 管理存储。

ankane/neighbor

Neighbor 是一个 Rails gem,为 ActiveRecord 模型添加基于向量的最近邻搜索功能。支持 PostgreSQL(pgvector 或 cube)、MariaDB、MySQL(HeatWave)、SQLite、Redis 和 S3,提供多种距离度量、多种向量类型,以及精确和近似索引。可直接在 Rails 应用中构建语义搜索、推荐或混合检索功能。

nii-yamagishilab/project-NN-Pytorch-scripts

一个聚焦于神经声码器和语音欺骗防御(伪造音频检测)的 PyTorch 脚本与工具集合。

elyra-ai/elyra

Elyra 是一组 JupyterLab 扩展的集合,提供 AI 专用功能,如可视化管道编辑器、笔记本/Python/R 脚本的批处理作业执行、可复用代码片段、基于 LLM 的代码辅助、通过 Jupyter Enterprise Gateway 实现的混合运行时支持以及 Git 集成。可通过 pip 或 conda(或通过 Docker)安装,让数据科学团队无需离开笔记本环境即可构建、运行和版本控制 AI 管道。

QJHWC/PaperForge

PaperForge Research OS v3 是一款基于 Python 的工具,整合了 AI 辅助论文写作、实验编排、产出物追踪及可验证的出版流程。它将每个主张与证据的链接存储在 SQLite“科学记忆库”中,强制执行三种执行配置文件(仅写作、研究、完整),并支持本地、Docker、SSH、Slurm、Kubernetes 及云端计算后端。通过 CLI (`paperforge …`) 与本地网页 UI,用户可执行工作流程、批准提案、使用内置模板(generic、CVPR、IEEE、Elsevier)编译 LaTeX,并在进行密钥扫描后发布确定性的源代码包。专为可重现的学术研究设计,以非商业授权开源。

steipete/sag

一个命令行 TTS 工具,使用 ElevenLabs 或 60db 提供高质量 AI 语音合成,带来 macOS 风格的 'say' 体验。

opendilab/LightRFT

LightRFT 是一个开源、分布式强化学习框架,用于微调大型语言和多模态生成模型。它统一了训练后端(DeepSpeed, FSDP)与 Rollout 引擎(SGLang, vLLM),支持多种 RL 算法(GRPO, REINFORCE++, DAPO 等),并可跨文本、图像、视频和音频模态运行。该库提供即插即用的示例(例如使用 Qwen2.5 进行 GSM8K)、详尽的文档和 Docker 镜像,非常适合开发 RL 基于对齐管道的研究人员和工程师。

SaynaAI/sayna

一个基于 Rust 的高性能服务器,为跨多个提供商的实时语音识别(STT)和文本转语音(TTS)服务提供统一 API。

optimatika/ojAlgo

ojAlgo 是一个用于高性能线性代数、数值优化(LP/QP/MIP)以及轻量级数据科学工具(神经网络、聚类)的纯 Java 库。零外部依赖、采用 MIT 授权,适用于基于 Java 的 AI/ML 工作负载。

kitlangton/Hex

专为 Apple Silicon Mac 设计的语音转文本工具,可在本地设备上实时转录语音,并将结果粘贴到任何活动应用程序中。

bootphon/phonemizer

一个使用多种后端将多种语言的文本转换为音素转写的 Python 库和命令行工具。

nv-legate/cupynumeric

cuPyNumeric 是一个在 Legate 运行时实现 NumPy API 的 NVIDIA 库,使 NumPy 代码能够在 GPU 和分布式集群上运行。它提供即插即用的兼容性,支持 Linux Python 3.11-3.14,并可通过 Conda 或 PyPI 安装。该项目现已停止维护(最终版本为 v26.06.01),但在 Apache-2.0 许可下仍可供历史使用。

duckbugio/flock

Flock 是一个基于 Docker 的服务,通过聊天(Telegram、VK 或纯文本适配器)控制一个由 Claude-Code 驱动的开发团队。从一条消息开始,它即可规划、编写、测试、审查并提交 PR,支持可选的自检、目标评估、定时任务和 CI 监控循环。每个聊天会话拥有独立的隔离工作区和分支,系统与 GitHub/GitLab/Gitea 通过 PAT 集成。填写一个小型 `.env` 文件后,通过 `docker compose up -d` 一行命令即可部署;核心逻辑位于 `core/agents/`,适配器为轻量级封装。

Gremble-io/Detto

一款为 Apple Silicon 设计的本地优先 macOS 应用,为会议、语音备忘录和系统级语音输入提供私密、本地化的语音转录功能,输出结构化 Markdown 文件。

allgpt-co/QuickVoice

QuickVoice 是一个开源、可自托管的平台,用于构建语音 AI 智能体(入站/出站通话),并对从营销网站、控制台、API 到电话连接、RAG、计费和隐私功能在内的整个技术栈拥有完全控制权。

aws-samples/amazon-bedrock-client-for-mac

一款原生 macOS Swift 应用,可直接连接 Amazon Bedrock,让用户与文本、图像及其他基础模型聊天,支持文件附件、本地工具/技能运行和自动化提示调度,所有数据均本地存储于 Mac 上。

Palm1r/QodeAssist

QodeAssist 是一个 GPL-v3 许可的 Qt Creator 插件,为 C++/QML 提供了 AI 驱动的代码补全、聊天和行内重构功能。它支持本地 (Ollama, llama.cpp, LM Studio) 和云端 LLM 提供商 (Claude, OpenAI, Gemini, Mistral, Qwen, DeepSeek 等),并通过 Model Context Protocol (MCP) 暴露其项目感知型工具,供其他编辑器使用。该项目已归档,不再维护。

jayminwest/mulch

Mulch 是一个由 CLI 驱动、基于 Git 的知识库,允许 AI 代理将结构化学习(惯例、失败、决策等)记录在各领域的 JSONL 文件中,并在后续检索上下文优化的摘录用于提示注入。它支持自定义记录类型、基于证据的范围划分、健康检查和清理,使团队能够积累并共享跨代理会话的专业知识。

izwi-ai/izwi

一个本地优先的语音 AI 平台,提供桌面应用、CLI 和服务器,无需云 API 即可实现语音转文本、文本转语音和聊天工作流。

6drf21e/ChatTTS_colab

ChatTTS 的精简版部署封装器,提供 WebUI 和一键式 Colab 设置,用于进阶的文本转语音生成。

KlaatAI/klaatcode

Klaat Code 是一款基于终端的 AI 编码助手,可与托管的 Klaatu-o1 路由器对接。该路由器会自动为每个请求选择最便宜的模型层级,并仅在需要时升级,从而大幅降低成本。客户端会将您的项目索引为语义调用图,免费执行工具调用(文件编辑、Shell 命令、网页搜索),并透过智能压缩和验证来管理上下文。功能包括丰富的 UI、斜线命令、Git 集成、子代理委派、广泛的安全/权限检查,以及可重现的基准测试,显示每个已解决任务的成本为 $0.027,中位数时间为 23 秒。

crabwise-ai/crabwalk

Crabwalk 是一个实时 Web UI,能够可视化 OpenClaw AI 代理人在 WhatsApp、Telegram、Discord 和 Slack 上的活动。它通过 WebSocket 从 OpenClaw gateway 流式传输事件,展示实时的会话节点图,允许检查工具调用,并支持 Docker、CLI 或源码安装部署。

shibing624/agentica

Agentica 是一个开源、Apache-2.0 许可的框架,可让你在本地运行多个 LLM 驱动的代理。它提供统一的 CLI、Web UI 和桌面应用,共享相同的对话历史和配置。功能包括异步优先工具执行、多模型与多模态支持、持久记忆与上下文压缩、基于 Markdown 的自进化技能系统、安全防护机制,以及内置协作功能(对等消息、任务/子代理、委托流程)。Python 和 TypeScript SDK 可让你在代码中嵌入代理,Docker/uv-tool 安装器让设置变得简单。

jitsi/jiwer

一个用于通过 Word Error Rate (WER) 和 Character Error Rate (CER) 等指标评估自动语音识别系统的高速 Python 包。

shiwenwen/hope-agent

Hope Agent 是一个开源、基于 Rust 的桌面 AI 助手,可作为原生应用、带 Web UI 的无头服务器或 IDE 集成后端运行。它提供目标驱动的任务自动化、持久记忆、设计空间生成,以及完整的计算机控制(文件、Shell、浏览器),并具有强大的安全性(本地优先数据、工具审批、Docker 沙箱)。可通过包管理器或 Docker 安装于 macOS、Windows 和 Linux,内置数十个 LLM 提供商模板、多平台 IM 集成,以及插件技能系统。

resemble-ai/Perth

一个用于在音频文件中使用神经网络方法嵌入和检测不可察觉水印的 Python 库,以确保对操作的鲁棒性。

qqqqqf-q/Arkloop

Arkloop 是一个开源、本地优先的 AI 代理平台。它集成了 Go 后端、SQLite 存储和基于 Electron 的桌面应用(带有 React 网页 UI),支持多模型路由、工具调用、持久或语义记忆,以及与 Telegram、Discord、QQ、Feishu 和 WeChat 的集成。可通过 GitHub 发布版、Homebrew 或 AUR 安装,完全在用户机器上运行,无需任何云基础设施。

jasonppy/VoiceCraft

一种仅需几秒参考音频即可实现高质量零样本文本转语音和语音编辑的 token infilling 神经编码语言模型。

LnYo-Cly/ai4j

ai4j 是一个以Java为首要目标的SDK(JDK 8+),统一了对多个LLM提供商的访问,并增加了代理功能(工具调用、多代理协调、A2A、RAG)。它包含核心库、代理运行时、代码助手CLI/TUI/IDE桥接器、Spring Boot启动器和插件系统。通过Maven/Gradle安装,配置提供商(如OpenAI),即可在几行代码中调用聊天/补全API,或在本地运行内置代码代理。