cubist38/mlx-openai-server
一个用于在 Apple Silicon 上本地运行 MLX 模型的 OpenAI 兼容 API 服务器,支持文本、多模态、图像和音频模型。
filippogiruzzi/voice_activity_detection
一种基于深度学习的语音活动检测(VAD)系统,使用 1D-ResNet 和 MFCC 特征将音频信号分类为语音或噪声。
dictation-toolbox/dragonfly
一个允许用户创建自定义语音命令以自动化计算机操作和通过语音编程的 Python 语音识别框架。
algolia/voice-overlay-ios
一个提供精致的语音转文字覆盖层 UI 的 iOS 库,使用 Apple 的原生 `SFSpeechRecognizer` 处理权限和语音识别。
judahpaul16/gpt-home
一个基于 Raspberry Pi 的自托管 AI 家庭助手,使用 LiteLLM 和 LangGraph 将 LLM 与家庭自动化和个人生产力工具集成。
sveinbjornt/hear
macOS 的命令行接口,可使用系统内置语音识别功能对实时麦克风输入和音频文件进行转录。
Picovoice/rhino
Rhino 是 Picovoice 的本地设备语音转意图引擎,可实时将语音命令转换为结构化的意图和槽位。它可在从微控制器到手机、浏览器和桌面设备的各类设备上本地运行,支持多种语言,并提供 Python、.NET、Java、Flutter、React Native、Android、iOS、Web、Node.js 和 C 的 SDK。
openspeech-team/openspeech
一个用于构建端到端自动语音识别系统的框架,提供 20 多种 ASR 模型的参考实现以及多种语言的配方。
yeyupiaoling/MASR
一个基于 PyTorch 的自动语音识别框架,支持多种模型架构和语言的流式与非流式推理。
mybigday/whisper.rn
设备端 Whisper(及 NVIDIA Parakeet)语音转文本的 React Native 绑定,支持 GPU/Core ML 加速、语音活动检测(VAD)和实时流式传输。
TheStageAI/TheWhisper
基于微调的 Whisper 模型,专为 NVIDIA GPU 和 Apple Silicon 上的低延迟流式传输和设备内推理优化的高性能语音转文本解决方案。
TensorSpeech/TensorFlowASR
一个基于 TensorFlow 的自动语音识别 (ASR) 框架,实现了多种 ASR 架构,并支持 TFLite 转换以进行高效部署。
ardha27/AI-Waifu-Vtuber
一款集成了语音识别、LLM 和文本转语音技术的 AI 驱动 VTuber 助手,用于创建用于直播和个人使用的交互式虚拟角色。
sooftware/conformer
Conformer 架构的 PyTorch 实现,通过结合 CNN 和 Transformer 来捕捉局部和全局音频依赖关系,从而提高语音识别性能。
modal-labs/quillman
一个由 Moshi 语音对语音模型驱动的语音聊天应用,提供低延迟、双向音频流,实现类人交互。
tensorflow/lingvo
一个专为构建和扩展序列到序列模型及巨型语言模型而设计的模块化 TensorFlow 框架。
HeyWillow/willow
Willow 是一个可自托管的推理服务器,用于快速执行包括语音转文本、文本转语音和 LLM 处理在内的语言任务。
flashlight/wav2letter
wav2letter++ 是一个端到端自动语音识别框架,它提供实现最先进语音转文本架构的方案(recipes)和预训练模型。
Uberi/speech_recognition
一个为语音识别提供统一接口的 Python 库,支持 OpenAI Whisper、Google Speech 和 Vosk 等多种在线和离线引擎。
elevenlabs/elevenlabs-js
ElevenLabs 官方 Node.js SDK,使开发者能够将逼真的 AI 语音合成、实时音频流和语音驱动的 AI 代理集成到其应用中。
wildminder/ComfyUI-VoxCPM
VoxCPM 的 ComfyUI 自定义节点集成。VoxCPM 是一个无需分词器(tokenizer-free)的 TTS 系统,能够实现富有表现力的语音生成、自然语言语音设计以及高级语音克隆。
codeforequity-at/botium-speech-processing
一个用于开源与云端语音转文字 (STT) 和文字转语音 (TTS) 服务的统一 API,简化了聊天机器人和语音应用的音频处理流程。
tongjingqi/Thinking-with-Video
一种全新的多模态推理范式和基准测试 (VideoThinkBench),用于评估视频生成模型解决复杂视觉和文本推理任务的能力。
AceDataCloud/Nexior
Nexior 是一个 MIT 许可的 Vue 基础应用,将 40 多个聊天、图像、音频和视频 AI 模型整合到一个可自托管的统一界面中。支持一键 Vercel 或 Docker 部署,BYOK 或单个 AceData 密钥,内置用户账户、支付和推荐机制,是 AI 产品即用型 SaaS 的理想起点。
EvolvingLMMs-Lab/lmms-engine
一个统一、高性能的多模态模型训练引擎,集成了分布式训练、内核融合和高级优化器,支持可扩展的预训练和微调。
awekrx/ChatGPT-MidJourney-prompt
一个利用 LLM 根据简单的文本提示为 MidJourney 图像自动生成详细且具创意提示词的 Python 库。
HorizonWind2004/reconstruction-alignment
一种用于统一多模态模型的自我监督式后训练方法,通过训练模型从其自身的视觉特征中重建图像,从而提升图像生成与图像编辑能力。
shiimizu/ComfyUI_smZNodes
自定义 ComfyUI 节点(CLIP Text Encode++ 和 Settings),复现 AUTOMATIC1111 的提示词解析和嵌入逻辑,实现 stable-diffusion-webui 与 ComfyUI 之间的图像生成完全一致。
biagiomaf/smart-comfyui-gallery
专为 ComfyUI 和 AI 生产库设计的开源数字资产管理和画廊工具,用于组织、搜索和重混生成内容。
Windsander/ADI-Stable-Diffusion
一个使用 ONNXRuntime 在多个平台上实现高性能、无 Python 依赖的 Stable Diffusion 模型推理的 C++ 库和 CLI 工具。
Licoy/GoAmzAI
一个为个人与企业设计的私有化、多模态 AIGC 平台,将文本、图像、视频、音乐和 PPT 生成功能整合进一个统一的管理系统。
mrhan1993/Fooocus-API
为 Fooocus 构建的基于 FastAPI 的 REST API,允许开发者无需手动调整参数即可通过编程方式生成高质量图像。
Acly/comfyui-tooling-nodes
一套 ComfyUI 自定义节点和 API 扩展,可将 ComfyUI 作为外部工具的后端使用,具有优化的图像传输、区域提示词(regional prompting)和模型检查功能。
melMass/comfy_mtb
ComfyUI 的自定义节点集合,通过额外的实用工具扩展图像生成工作流。
a616567126/GPT-WEB-JAVA
一个基于Java的Web平台,将GPT、Midjourney和Stable Diffusion整合为具备用户管理和支付系统的商业AI服务。
vual/ChatGPT-Next-Web-Pro
ChatGPT‑Next‑Web‑Pro 是一个开源的、自托管的 OpenAI 风格 LLM Web UI,它增加了多模态(图像、音频、视频)生成、文件解析、S3 存储,以及可选的包含用户账号、订阅计划和管理面板的后端。可以通过单个 Docker run(无后端)或 Docker-Compose 堆栈(有后端)进行部署。
basetenlabs/truss
用于将 AI/ML 模型打包并部署到生产环境的 CLI 工具,自动化容器化、GPU 配置和依赖管理。
xxxily/hello-ai
一个由 AI 驱动的导航中心,利用自主代理从 GitHub 发现、评估并组织高质量的开源 AI 项目,形成一个自动更新的目录。
lobehub/sd-webui-lobe-theme
一款为 Stable Diffusion WebUI 设计的现代、高度可定制的界面框架,可提升 AI 图像生成的工作流与视觉体验。
mikekeith52/scalecast
一个为机器学习和深度学习模型提供统一接口的时间序列预测库,简化了模型选择、验证和流水线创建的过程。
EternalEvan/Astra
Astra 是一个交互式世界模型,它使用自回归扩散 Transformer 来生成逼真的、以动作为条件的长期视频预测。
Ma-Zhuang/OmniNWM
OmniNWM是一个研究代码库,构建用于自动驾驶仿真的全景多模态世界模型。它从车辆轨迹联合生成RGB、语义、深度和3D占用图,使用归一化Plücker射线图实现精确控制,并提供基于占用的密集奖励以支持闭环策略评估。该仓库包含安装步骤(含对`transformers`的手动补丁)、nuScenes数据准备说明、预训练检查点下载链接,以及用于推理、分布外测试和分阶段训练的脚本。
forloopcodes/contextplus
一个通过 RAG、AST 解析和谱聚类技术,将大规模代码库转换为可搜索的层级功能图,从而提供高精度 AI 编码上下文的 MCP 服务器。
opensumi/core
一个用于快速构建 AI 原生 IDE 的框架,支持云、桌面和基于 Web 的开发环境。
Pimzino/spec-workflow-mcp
通过强制执行需求、设计和任务的顺序工作流,并配备实时监控仪表板,为 AI 智能体实现结构化、规范驱动的开发。这是一个 MCP 服务器。
VibiumDev/vibium
一个为 AI 编码代理提供验证能力的层,可通过 CLI、MCP 或客户端库实现网页任务的浏览器自动化与验证。
KlaatAI/klaatcode
Klaat Code 是一款基于终端的 AI 编码助手,可与托管的 Klaatu-o1 路由器对接。该路由器会自动为每个请求选择最便宜的模型层级,并仅在需要时升级,从而大幅降低成本。客户端会将您的项目索引为语义调用图,免费执行工具调用(文件编辑、Shell 命令、网页搜索),并透过智能压缩和验证来管理上下文。功能包括丰富的 UI、斜线命令、Git 集成、子代理委派、广泛的安全/权限检查,以及可重现的基准测试,显示每个已解决任务的成本为 $0.027,中位数时间为 23 秒。
hengruiyun/AI-Stock-Master
AI Stock Master 是一个 Windows/macOS 桌面应用程序,将定量股票分析算法(RTSI、TMA、MSCI)与本地运行的 LLM(Mini Ollama)结合,为中国、香港和美国股票生成自然语言市场报告和交易信号。它是一个研究导向的工具,而非商业交易平台。