ScottZt/jin-ce-zhi-suan

一个基于 Python 的定量交易平台,采用受唐代官僚制度启发的“三省六部”架构,提供回测、多策略管理、风险优先执行及 AI 驱动的自然语言股票筛选功能。通过 FastAPI + HTML 仪表盘运行,支持多种数据源,个人/学术使用免费(商业使用需授权)。

yaojingang/yao-open-skills

Yao Open Skills 是一个开源的可复用 AI「技能」目录——即用于决策分析、安全审计、教程创建和阅读报告可视化等任务的结构化提示+代码工作流。每个技能位于独立文件夹中,包含脚本、文档和多格式导出(Markdown、HTML、PDF 等)。该仓库提供注册表、发布规则和辅助脚本,以保持集合的整洁、版本化和公开可发现。

AddictedCS/soundfingerprinting

一个用于音频和视频指纹识别的 C# 框架,通过声学和视频哈希实现媒体内容的快速识别。

OlympiaAI/raix

Raix 是一个 Ruby 库,为任何 Ruby 类添加 LLM 聊天、工具(函数)分发和提示链功能。它通过 RubyLLM/OpenRouter 包装多个提供者,管理对话记录,提供全局/类/实例钩子,支持 JSON 模式、缓存和提示缓存,并提供用于声明函数和多步骤提示的 DSL。

flyteorg/flytekit

Flytekit Python 是 Flyte 的官方 SDK,让您使用 `@task` 和 `@workflow` 装饰器在纯 Python 中编写、测试和部署 AI/ML 工作流。通过 `pip install flytekit` 安装,遵循快速入门指南,并通过插件扩展或根据提供的文档贡献。

amsehili/auditok

一个轻量级的 Python 库,通过能量阈值或 WebRTC VAD 将音频流分割为事件。

vb000/LookOnceToHear

一种智能可穿戴系统,用户只需注视目标说话者几秒钟,即可在嘈杂环境中分离并听到该说话者的语音。

composio-community/open-chatgpt-atlas

Open ChatGPT Atlas 是一个开源的 Chrome/Edge 扩展程序(以及可选的 Electron 应用),可让 AI 通过 Gemini 2.5 Computer‑Use 控制浏览器,并通过 Composio 调用 500 多个第三方服务。使用 Node 构建 `dist` 文件夹,添加您的 Google 和可选的 Composio API 密钥,然后通过侧边栏聊天输入自然语言命令,如“点击此按钮”或“创建 GitHub 问题”。它提供视觉反馈、安全确认,且完全在客户端运行。

InternLM/InternBootcamp

InternAgentHarness(InternBootcamp)是一个开源框架,用于创建、运行和评估多轮、工具增强型 LLM 代理。它允许研究人员定义合成任务,暴露经过验证的外部工具,管理多轮交互,计算奖励,并记录完整轨迹,用于数据生成或强化学习训练。

pmarreck/yt-transcriber

一个使用 Whisper 将 YouTube 视频或本地媒体文件转录为文本的 CLI 工具,支持可选的 AI 摘要和翻译功能。

audeering/opensmile-python

一个用于 openSMILE 的 Python 接口,可实现机器学习研究中标准化音频特征的提取。

runesleo/claude-code-workflow

QuietHarness 是一个微型、开源的 AI 编码代理(Claude Code、Codex、Cursor)安全层。它提供共享配置模板、预览安装脚本、自动备份和风险门控操作,确保代理在未确认前不会覆盖文件、跳过测试或执行不可逆操作。可按项目或全局安装,完全离线运行,采用 MIT 许可证。

CaptainYifei/fake-news-detector

一个基于 Streamlit 的网页应用,使用 LLM(如 Qwen2.5)和 BGE‑M3 嵌入从新闻中提取主张,通过 DuckDuckGo/SearXNG 检索网络证据,并通过三节点流水线进行验证。支持中文、英文、日文、韩文,多种模型提供商,用户账户,历史记录,以及 PDF 报告。

Jittor/jittor

Jittor 是一个高性能深度学习框架,通过 JIT 编译整个计算图,并使用元操作符生成针对特定模型优化的 CUDA/C++ 内核。它提供类似 PyTorch 的 Python API,支持 CPU 和 GPU 后端(CUDA、ROCm、Hygon),并包含视觉、渲染、几何学习和强化学习领域的模型库。

yxlllc/DDSP-SVC

一个高效的歌唱音色转换项目,相比传统 SVC 模型,显著降低了硬件需求并大幅缩短训练时间,实现高质量 AI 语音变换。

strob/gentle

基于 Kaldi 构建的强大强制对齐器,可将语音音频与文本转录进行对齐,提供精确的词级时间戳。

appleboy/CodeGPT

CodeGPT 是一个基于 Go 的 CLI,使用 LLM API(OpenAI、Azure、Gemini、Anthropic、Ollama、Groq、OpenRouter)自动为 Conventional-Commit 生成提交消息和简短的代码审查摘要。支持安装 Git `prepare-commit-msg` 钩子、自定义提示、语言翻译、流式输出和灵活配置(API 密钥、提供方、代理、差异上下文等)。可通过 Homebrew、Chocolatey、脚本、二进制文件或 `go install` 安装。

VOICEVOX/voicevox_core

为 VOICEVOX 提供核心语音合成引擎,以 C 和 Python 库的形式,便于在各种应用中轻松集成。

DataBassGit/AgentForge

AgentForge 是一个低代码 Python 框架,用于构建、测试和迭代 AI 驱动的自主代理。它使用声明式 YAML 文件(Cogs)来组合代理、附加可选记忆,并协调多代理工作流,同时支持 OpenAI、Gemini、Claude 以及通过 Ollama/LMStudio 的本地模型。

fishaudio/fish-diffusion

支持多说话人训练和高效硬件利用的基于扩散模型的文本转语音(TTS)、歌声合成(SVS)和歌声转换(SVC)训练框架。

wavlab-speech/versa

一个综合性工具包,提供90多种指标的统一接口,用于评估语音和音频的质量、可懂度和技术属性。

BakeLens/crust

Crust 是一个开源、本地运行的代理,位于 AI 编码助手与 LLM 提供商之间。它检查每一次工具调用(文件读取、shell 命令、网络请求等),并阻止可能暴露密钥或损害主机的操作。该网关可作为 HTTP 代理、MCP/ACP stdio 包装器或 Docker 容器运行,内置 42 个安全规则、51 个 DLP 模式,并支持自定义策略插件。它完全在用户机器上运行,日志加密存储于操作系统密钥环中,并通过 Swift 包支持 iOS 集成。

Stability-AI/stable-codec

一种高质量、低比特率的语音编码器,可将音频压缩为离散标记,专为文本转语音等下游任务优化。

Deep-unlearning/smol-audio

一系列实用的笔记本,用于在Hugging Face生态系统中对ASR和音频字幕等任务的音频AI模型进行微调和优化。

Kocoro-lab/Kocoro

Kocoro 是一个开源的 macOS AI 代理守护进程(`shan`),允许语言模型代理读写文件、控制应用、运行 shell 命令、自动化浏览器,并与 Slack/Telegram 集成。提供 CLI/TUI、HTTP API、MCP 流式传输和实时语音前脑。可通过 npm、脚本或 Go 构建安装;配置 Shannon Cloud 或自托管网关以获取 LLM 补全。守护进程处理权限、代理内存、调度和可扩展工具,而独立的闭源 GUI(Kocoro Desktop)提供精致界面。采用 MIT 许可证。

milady-ai/milady

Milady 是一个以隐私为先的个人AI助手,可在本地运行(或通过自托管或云后端)。它提供带3D头像的桌面应用、多平台聊天连接器、渐进式动作流式传输,以及内置的BNB智能链交易功能。可通过macOS/Windows/Linux的签名安装程序安装,或使用CLI(`milody setup`)。系统具备能源感知、插件可扩展性,并可通过API令牌安全地暴露为远程后端。

absadiki/pywhispercpp

支持多种硬件加速后端的 Python 绑定,提供高性能语音转文字转录功能。

microsoft/cognitive-services-speech-sdk-js

一个用于整合 Microsoft Cognitive Services 语音功能 JavaScript SDK,可在浏览器和 Node.js 中实现语音转文字和语音转语音功能。

ASLP-lab/MeanVC

MeanVC 是一个轻量级的零样本语音转换系统,它使用 mean flows 和扩散 Transformer 来实现实时的、单步的音色转移。

Prorise-cool/Claude-Code-Multi-Agent

Claude Code Multi‑Agent 是一个开源框架,为 Anthropic 的 Claude Code 项目赋予项目感知能力和专家代理功能。它使用 Python Hook 系统和本地运行的 Ollama 模型,自动检测代码库类型,分析用户意图,加载 300 多个领域专用的“技能”(后端、前端、测试、安全等),并强制执行自动文档(DEVELOPMENT.md、KNOWLEDGE.md、CHANGELOG.md)。克隆仓库,安装 Ollama、模型和 uv 后,将项目放入仓库,Claude Code 即可立即了解其上下文,建议合适工具,并可通过 `/backend‑specialist` 或 `/kiro/spec` 等斜杠命令驱动。 关键点: - 零配置启动;所有配置均位于 `.claude/settings.json` 和 `prompts.json`。 - Hooks 在会话启动、用户提示、工具使用等时刻运行,处理项目检测、意图分析和文档更新。 - Skills 由 `SKILL.md` 文件定义,可自动发现。 - 完全本地运行(无外部 API),与 Git 集成,MIT 许可。 适合希望获得可复现、本地部署 AI 编码助手的开发者或小团队。

vercel/next-evals-oss

Next.js Evals 是一个由 Vercel 维护的框架,用于在真实世界的 Next.js 任务上自动测试 AI 代码代理。它从 `vercel/next.js` 仓库同步评估固定装置,在 Vercel 沙箱中运行代理,检查隐藏断言,记录通过/失败、令牌使用量和成本,并导出 JSON 排行榜,为公开的 Next.js 评估网站提供支持。

PierrunoYT/Kokoro-TTS-Local

一个本地实现的 Kokoro-82M 文本转语音模型,配备网页界面、54 个多语言语音和完整的离线支持。

MisoLabsAI/MisoTTS

用于对话式英语语音生成和声音克隆的高质量文本转对话 RVQ Transformer 模型。

OpenBMB/UltraEval-Audio

一个用于评估大型音频基础模型(large audio foundation models)的统一开源框架,支持跨 34 个基准测试(benchmarks)的语音理解与生成。

daanzu/kaldi-active-grammar

Kaldi‑Active‑Grammar 是 Kaldi 语音识别引擎的 Python 包装器,可编译多个小型语法,并在每个语音输入中仅激活所需部分。支持所有主流操作系统二进制 wheel,包含预训练英语模型,并为 Dragonfly 和 Caster 语音控制框架提供后端。通过 pip 安装,下载模型,定义规则,即可动态启用上下文感知的命令控制。

filippogiruzzi/voice_activity_detection

一种基于深度学习的语音活动检测(VAD)系统,使用 1D-ResNet 和 MFCC 特征将音频信号分类为语音或噪声。

dictation-toolbox/dragonfly

一个允许用户创建自定义语音命令以自动化计算机操作和通过语音编程的 Python 语音识别框架。

algolia/voice-overlay-ios

一个提供精致的语音转文字覆盖层 UI 的 iOS 库,使用 Apple 的原生 `SFSpeechRecognizer` 处理权限和语音识别。

sveinbjornt/hear

macOS 的命令行接口,可使用系统内置语音识别功能对实时麦克风输入和音频文件进行转录。

Picovoice/rhino

Rhino 是 Picovoice 的本地设备语音转意图引擎,可实时将语音命令转换为结构化的意图和槽位。它可在从微控制器到手机、浏览器和桌面设备的各类设备上本地运行,支持多种语言,并提供 Python、.NET、Java、Flutter、React Native、Android、iOS、Web、Node.js 和 C 的 SDK。

openspeech-team/openspeech

一个用于构建端到端自动语音识别系统的框架,提供 20 多种 ASR 模型的参考实现以及多种语言的配方。

yeyupiaoling/MASR

一个基于 PyTorch 的自动语音识别框架,支持多种模型架构和语言的流式与非流式推理。

mybigday/whisper.rn

设备端 Whisper(及 NVIDIA Parakeet)语音转文本的 React Native 绑定,支持 GPU/Core ML 加速、语音活动检测(VAD)和实时流式传输。

TheStageAI/TheWhisper

基于微调的 Whisper 模型,专为 NVIDIA GPU 和 Apple Silicon 上的低延迟流式传输和设备内推理优化的高性能语音转文本解决方案。

TensorSpeech/TensorFlowASR

一个基于 TensorFlow 的自动语音识别 (ASR) 框架,实现了多种 ASR 架构,并支持 TFLite 转换以进行高效部署。

sooftware/conformer

Conformer 架构的 PyTorch 实现,通过结合 CNN 和 Transformer 来捕捉局部和全局音频依赖关系,从而提高语音识别性能。

modal-labs/quillman

一个由 Moshi 语音对语音模型驱动的语音聊天应用,提供低延迟、双向音频流,实现类人交互。

flashlight/wav2letter

wav2letter++ 是一个端到端自动语音识别框架,它提供实现最先进语音转文本架构的方案(recipes)和预训练模型。