karanb192/itr-wala

itr‑wala 是一个开源 CLI,用于在本地准备印度个人税务申报表。 它仅使用 LLM 来读取 PDF,而所有法定计算均由经过彻底测试的 Python 引擎完成。 该工具验证输入,比较新旧税制,并输出一个可直接输入的申报包;您仍需在政府门户上手动提交和支付。

mrthinger/wow-voiceover

一个由CLI和游戏内插件组成的工具集,使用ElevenLabs TTS为《魔兽世界》NPC对话生成并播放AI语音。

NSHipster/sosumi.ai

sosumi.ai 是一个基于 Node 的服务,可将 Apple 开发者文档(包括 Swift 文档、HIG 和 WWDC 转录)转换为干净的 Markdown 格式,使 AI 模型和自动化工具易于使用。提供简单的 URL 重写、HTTP/MCP API、CLI、Chrome 扩展,并可在 Cloudflare Workers 或任何 Hono 兼容运行时环境中自托管。

McCloudS/subgen

一个自托管的 AI 字幕生成工具,可与 Bazarr、Plex、Jellyfin 和 Emby 集成,为个人媒体库生成字幕。

nethical6/conversation-steganography

Conversation Stenography 是一个开源 Go CLI 工具,使用 AES-SIV 加密秘密消息,将密文编码为本地运行的 LLM(如 Llama 3.2 或 GPT-2)的 token 选择,并输出看起来自然的覆盖文本。用户将该文本复制到任何聊天应用中;接收方运行相同工具以解码并解密隐藏消息。系统完全离线运行,使用共享密钥短语(PBKDF2 派生密钥),并通过消息链保证完整性。包含设置向导、模拟模式和多个 CLI 命令,但属于概念验证,易受现有隐写检测方法攻击。

mikeoliphant/neural-amp-modeler-lv2

一个使用 NeuralAudio 引擎播放神经网络机器学习放大器模型的 LV2 插件。

kadirnar/whisper-plus

一个全面的音视频处理工具包,扩展了 OpenAI 的 Whisper,支持转录、说话人分离、摘要以及基于 RAG 的视频聊天。

vercel-labs/coding-agent-template

一个由 Vercel 托管的模板,允许经过身份验证的用户创建 AI 驱动的编码任务(Claude、Codex、Copilot、Cursor、Gemini、opencode)。它会启动一个 Vercel Sandbox,运行所选代理,将更改提交到 AI 生成的分支,并显示实时日志。使用 Next.js 15、Tailwind、Neon Postgres 和 Vercel AI Gateway 构建;支持多用户 OAuth、用户级 API 密钥,以及可选的沙箱保持运行功能,用于迭代式工作。

yym68686/uni-api

uni‑api 是一个仅通过配置运行的服务器,提供单一 OpenAI 兼容 API,同时将请求路由到多个 LLM 提供商(OpenAI、Anthropic、Gemini、Vertex、Azure、AWS 等)。支持加权和轮询负载均衡、自动重试、每模型超时、速率限制、工具调用透传、内容审核以及细粒度请求覆盖——所有配置均通过 `api.yaml` 文件或 `CONFIG_URL` 定义。可作为 Docker 容器部署(提供一键 Fugue 按钮)

stenolabs/stenoai

一款以隐私为先的 AI 记事本,在本地设备上录制、转录和摘要机密会议,确保数据永不离开本地环境。

braindecode/braindecode

Braindecode 是一个 Python 工具箱,将深度学习模型应用于原始大脑信号数据(EEG/ECoG/MEG)。它提供了数据集加载器、预处理、几种现成的神经网络架构以及可视化工具,全部构建于 PyTorch 和 MNE-Python 之上。可通过 `pip install braindecode` 安装,主要目标用户为处理神经生理数据的神经科学家与机器学习研究人员。

SciML/NeuralPDE.jl

NeuralPDE.jl 是一个 Julia 库,使用物理信息神经网络求解 ODE、SDE、RODE 和 PDE。它能从符号方程自动生成损失函数,支持使用 Flux/Lux 进行 GPU 训练,并可与 NeuralOperators 集成以构建高级神经算子模型。

dimastatz/whisper-flow

一个基于 OpenAI Whisper 的实时转写服务,通过流式处理而非批量处理,提供低延迟的语音转文字功能。

BUTSpeechFIT/DiariZen

一个利用自监督学习和结构化剪枝技术,在音频录制中准确识别“谁在何时说话”的话者日志工具包。

bigsk1/voice-chat-ai

一个语音驱动的 AI 界面,支持多种 LLM 和 TTS 服务提供商,实现实时对话和本地语音克隆。

LambdaTest/agent-skills

一个 Node.js 库,为 AI 编码助手(Claude Code、Copilot 等)提供插件式“技能”,用于生成 Selenium、Playwright、Cypress 等测试自动化代码,并在 TestMu AI 云平台上运行。

Quantatirsk/qwen3-asr

Qwen3‑ASR 是一个自托管语音转文本服务器,封装了 Qwen3‑ASR 模型(0.6 B 与 1.7 B)。它自动选择 GPU‑vLLM 后端或 CPU‑Rust 后端,提供 OpenAI 与阿里云兼容的 HTTP/WebSocket API,支持说话人分离、基于 VAD 的分段、批量推理,并可通过 Docker、自定义 GPU 镜像或离线 tarball 部署。MIT 许可证。

IBM/LNN

LNN 是一个 Python 库,用于神经符号人工智能,将逻辑公式表示为加权神经网络,即使在知识不一致或不完整的情况下,也能实现可解释、可微分的推理与学习。

huisezhiyin/sdd-riper

SDD‑RIPER Light 是一个轻量、原生于仓库的框架,为基于 LLM 的编码代理添加控制平面。它定义了一个清晰的循环——重述目标、创建最小规格、等待人类审批、执行、用证据验证,并将结果同步回项目,使代理能安全、可审计、可恢复地修改代码。四个模块化“技能”(light、strict、codemap、new‑chat‑ready)覆盖日常任务、高风险工作、陌生代码库和交接场景。

leiting-eric/DailyBrief

DailyBrief 是一个自托管的 Node/TypeScript 应用,聚合 26 个免费新闻源、21 个标的的市场数据及 AI 生成摘要,生成双语(中文/英文)单页 HTML 报告。支持六种可互换的 LLM 后端,提供三种部署方式(GitHub Actions + Pages、本地一键安装、AI 代理安装),仅需承担 LLM API 调用成本(使用 DeepSeek 时约 1 美元/月)。

timoncool/ACE-Step-Studio

一个使用 ACE-Step 1.5 XL 模型在本地生成包含人声、歌词和音乐视频的完整歌曲的 AI 音乐制作工作室。

huanchong-99/SoloDawn

SoloDawn 是一个开源 Web 应用,可实现全栈软件开发自动化。它通过一个由 LLM 驱动的主代理,按需生成子代理来编排多个 AI 命令行工具(Claude Code, Codex 等)。任务在并行的 Git 分支中执行,每个分支都会通过三层质量检查。当生成的代码满足 90 分的评分标准时,会自动合并,从而根据简单的自然语言描述交付生产就绪的产品。

strands-labs/ai-functions

Strands AI Functions 是一个 Python 库,可将外观普通的函数转换为基于 LLM 的代理。使用 `@ai_function` 装饰器,你编写一个带有文档字符串提示的普通函数;该库构建提示、调用模型(Bedrock、OpenAI、Claude 等)、解析类型化结果,并可自动重提示,直到用户定义的后置条件通过。函数可返回真实的 Python 对象(如 pandas DataFrames),支持异步运行,可在 *AI 线程* 中保持状态,并可通过协调器在本地或通过 WebSocket 进行团队编排。功能包括自修正循环、经济意识模型选择、内存支持的优化,以及用于管理分布式代理的 CLI/TUI。通过 `pip install strands-ai-functions` 安装(可选扩展支持 Claude、Kiro、Codex)

FrigadeHQ/yap

一款轻量级、在设备上运行的 macOS 语音输入工具,利用 Apple 原生语音 API 将转录文本私密地粘贴到任何活跃应用中。

fluxions-ai/vui

Vui 是一个开源的实时语音助手技术栈,它将语音转文本、本地 LLM 和流式 TTS 模型 (Vui Nano, 300 M 参数) 粘合在一起。它提供了一个具有轮次切换、barge-in、OpenAI Realtime-API 兼容性、单次语音笔记 HTTP 端点、可插拔 ASR (faster-whisper 或 Moonshine) 和 LLM 后端 (Ollama, vLLM, OpenAI-compatible), 工具路由、语音克隆和可选的 Claude 风格的任务委派。可以通过一行命令脚本或 Docker-compose 安装;支持 Linux + NVIDIA GPU, macOS + MLX, 机器学习引擎 (MLX) 模式, 移动端通过 Cloudflare Tunnel 或 Tailscale 访问。

MoonInTheRiver/DiffSinger

一个基于扩散模型的框架,用于从歌词、MIDI 和音高数据生成高质量的歌声合成与文本转语音生成。

GetBindu/Bindu

Bindu 是一个开源框架,可将任何基于 LLM 的代理转变为安全、身份验证、支付功能齐全的互联网服务。它提供内置 mTLS、DID 签名、通过 Hydra 的 OAuth2、USDC(x402)支付强制、技能广告、推送通知以及多语言 SDK(Python、TypeScript、Kotlin)。通过一次 `bindufy()` 调用,即可获得 JSON-RPC 端点、可选的公共隧道和部署助手,轻松构建代理群组、付费 API 或受监管的 B2B 代理集成。

watzon/pindrop

一款利用设备内转写引擎实现私密、离线语音转文本的 Mac 原生 AI 语音输入应用。

sp-uhh/sgmse

一个基于 PyTorch 的扩散式生成模型实现,用于语音增强和去混响,从音频信号中去除噪声和混响。

prophesier/diff-svc

一个使用扩散模型将输入歌声转换为目标音色的歌声转换工具,并提供基础音高修正支持。

VRCWizard/TTS-Voice-Wizard

一款为 VRChat 及其他环境设计的无障碍工具,能够将语音转文字和文字转语音,提供实时翻译和头像集成功能。

aa0101181514/tw-legal-rag

tw-legal-rag 是一个开源 Python CLI,连接到托管的语义搜索服务,该服务包含 2200 万+ 份台湾判例、法规和行政裁决。它支持自然语言搜索、获取精确案件编号、将结果(包括摘要、判例历史和引用白名单)打包为 JSON 文件,并对 LLM 生成的答案执行确定性引用核查。该工具本身不调用 LLM,无需 API 密钥,作为法律 AI 应用的检索增强生成(RAG)前端使用。

tgies/klattsch

一个原始的并行共振峰语音合成器,可在浏览器、Node.js 和 CLI 中重现 1970 年代和 80 年代计算机语音的复古音色。

MaKTaiL/gemini-srt-translator

Gemini SRT Translator 是一个使用 Google Gemini 模型翻译或转录字幕文件(`.srt`/`.ass`)的 Python 包。它通过命令行工具(`gst`)或 Python API 使用,可借助 FFmpeg 从视频中提取字幕/音频,支持安全恢复的批处理、模型调优、企业版 Vertex AI 认证,并可作为技能安装到 AI 编码代理中。

Stability-AI/stable-audio-metrics

音乐和音频生成模型的评估指标集合,提供对长时立体声音频计算弗雷chet距离、KL散度和CLAP分数的工具。

HexmosTech/git-lrc

git-lrc 是一款基于 Go 的工具,可安装全局 Git hook,在每次提交时执行 AI 驱动的代码审查。它将差异文件发送至可配置的 LLM(默认 Gemini),返回行内注释、风险评分及幻灯片摘要,并将审查状态记录在提交信息中。每月 30k LOC 以内免费;付费方案起价为每 100k LOC 32 美元。

ankur-anand/unisondb

UnisonDB 是一个开源、原生日志的实时数据库,专为边缘AI设计。它将数据存储在 B+ 树(BoltDB 或 LMDB)中,同时通过写前日志(WAL)以 gRPC 或对象存储(S3/MinIO)方式实时复制。系统提供基于 Raft 的高可用写入、亚毫秒级变更通知和多模型支持(KV、宽列、大对象),使数千个边缘节点无需独立流媒体基础设施即可保持同步。

ratwithacompiler/OBS-captions-plugin

一款利用 Google Cloud Speech Recognition API 为 Twitch 直播和 VOD 提供实时字幕的 OBS 插件。

AaronZ345/GTSinger

一个大规模、多语言的歌唱语料库,包含专业录音和真实音乐乐谱,旨在提升 AI 歌唱语音合成与技术控制能力。

decocms/studio

deco Studio 是一个开源的、以 TypeScript 为先的平台,允许组织运行私有 AI 智能体。它提供了一个统一的模型上下文协议 (MCP) 控制平面,用于路由模型调用、管理与内部工具的安全连接、处理 SSO/RBAC、审计日志和成本分摊。智能体封装了上下文、工具和策略;连接存储了用于 GitHub、Slack 或数据库等服务的加密凭据;模型层是可互换的(OpenRouter, Anthropic, OpenAI 等)。该系统可以在本地、Docker 或通过 Kubernetes 上的 Helm 运行,并包含通过 OpenTelemetry 实现的完整可观测性。

statewright/statewright

Statewright 是一个基于 Rust 的开源框架,将 LLM 代理封装在确定性状态机中,强制执行各状态的工具策略、模型路由和审批门,使代码生成代理更可靠。它提供 CLI/TUI、主机插件(Claude Code、Codex、Cursor 等)以及可自托管的 Docker 堆栈。

johnmarktaylor91/torchlens

TorchLens 是一个 Python 库,用于捕获、可视化和干预任何 PyTorch 模型(并预览支持其他框架)的完整计算图。它记录每个激活和梯度,提供丰富的操作级元数据,允许您查询或过滤张量,绘制 PDF 图,计算感受场/投影场,并在前向传递中实时干预或重放图以进行“如果……会怎样”实验。该工具已在超过 11,600 个架构上验证,约 89% 通过算法验证,确保捕获的激活不仅合理,而且可证明正确。

JeffreyCA/spleeter-web

一个网络应用程序,使用 Spleeter 和 Demucs 等 AI 模型,从歌曲中分离或移除人声、贝斯和鼓声。

plmbr/notebook-intelligence

Notebook Intelligence (NBI) 是一个开源 JupyterLab 扩展,增加了 AI 聊天、内联代码生成、自动补全和自主笔记本编辑智能体。它可与 Copilot、OpenAI 兼容 API、本地 Ollama 模型或 Anthropic Claude(通过 Claude Code)配合使用。功能包括 Claude 专用工具、基于 MCP 的工具调用、多语言感知以及 AI 编辑文件的实时重载。

dectalk/dectalk

一个为现代平台保留并编译经典 DECtalk 语音合成引擎原始源代码的文本转语音系统。

Aivis-Project/AivisSpeech

一款使用 AivisSpeech Engine 与基于 ONNX 的模型来生成情感丰富的合成语音的日语文本转语音软件。

sandrohanea/whisper.net

通过 whisper.cpp 提供 OpenAI Whisper 的 Dotnet 绑定,使 .NET 应用程序能够实现高性能语音转文本转录和翻译。

URUWorks/TeroSubtitler

一款开源、跨平台的字幕编辑器,集成了AI语音识别、翻译和配音工具,专为专业字幕制作而设计。