notepower2k1/CapCap

一款用于视频在地化处理的 Windows 应用程序,利用 Faster-Whisper 等 AI 模型与各种 TTS 引擎来实现自动化的逐字稿制作、翻译与配音。

dabit3/react-native-ai

一个用于构建跨平台移动AI应用的全栈框架,内置对实时LLM流式传输和图像生成的支持。

Kazama-Suichiku/Houdini-Agent

基于 Meshy AI 的自主 AI 助手,可自动化节点网络创建、VEX/Python 编码和 3D 资产生成,专为 SideFX Houdini 设计。

oracle/mcp

Model Context Protocol (MCP) 服务器的参考实现,让基于 LLM 的工具能与 Oracle Cloud 服务交互。提供多语言(Python, Node.js, Java)服务器、stdio 或 HTTP 传输方式,并支持容器化以及适用于 Cline、Cursor 和 mcphost 的客户端配置片段。

OpenMOSS/MOVA

MOVA 是一个开源模型,可从文本提示(可选参考图像)生成同步的视频+音频。它采用双塔视频音频架构,提供 360p/720p 检查点、推理脚本、LoRA 微调流水线、评估代码,以及与 SGLang、ComfyUI 和托管 API 的集成。

MaxBittker/rs-sdk

RS‑SDK 是一个开源、基于 TypeScript 的启动套件,用于模拟 RuneScape 风格 MMO 以进行机器人研究。它集成了服务器模拟器、网页客户端、网关和类型安全 SDK,使你能够编写异步脚本(或 LLM 生成代码)来控制机器人,实验目标导向合成、多智能体竞争和市场经济学。演示服务器开箱即用;你也可以通过可调 tickrate 在本地托管。MIT 许可证,并由 Discord 社区支持。

xandergos/terrain-diffusion-mc

一个 Minecraft Fabric 模组,使用扩散模型生成高度多样且逼真的地形和景观。

OpenVGLab/OmniLottie

OmniLottie 是一个多模态 AI 生成器,使用预训练的视觉‑语言模型,从文字、图像或视频输入生成复杂的向量 Lottie 动画。

HELPMEEADICE/TE-Speed-MiniMaxH3-OSS

一个 ComfyUI 自定义节点,通过 DiT 块的残差缓存机制,将 MiniMax H3 模型推理速度提升高达 45%。

Ariescar/anyCreature

一个 AI 驱动的管道,通过多阶段设计和验证流程,将文本描述转换为游戏就绪的动画 3D 生物(GLB 格式)。

bquenin/interpreter

一款用于日本复古游戏的离线屏幕翻译器,利用 OCR 和本地 LLM 通过浮动覆盖层提供实时英文字幕。

merveenoyan/smol-vision

一系列用于缩小、优化和定制前沿视觉与多模态 AI 模型的配方,以提升效率和性能。

pwilkin/trellis.cpp

使用 GGML 的独立 C++ 实现,无需在运行时使用 Python,即可从图像生成带纹理的 3D 模型。

microsoft/unilm

微软提供的一套全面的基础模型和架构集合,专注于在文本、视觉、语音和多模态任务上实现大规模自监督预训练。

oxbshw/watch-skill

一个将视频、音频和屏幕活动转化为带时间戳证据的感知与验证引擎,具备确定性验证系统和专用代理工作区。

tegnike/aituber-kit

一个支持多种 LLM、TTS 引擎和 2D/3D 头像的全功能工具包,用于创建可交互的 AI 角色(AITuber)

1038lab/ComfyUI-QwenVL

一个 ComfyUI 扩展,集成 Qwen-VL 视觉语言模型用于图像和视频理解,具备双 HF 和 GGUF 后端及 GPU 优化推理功能。

bkingfilm/lapian-notes

一款本地优先的电影分析工具,可提取帧和字幕,生成 AI 支持的叙事结构树、剧情泳道和情绪曲线。

NVIDIA-BioNeMo/bionemo-agent-toolkit

一个为 AI 代理提供专业化生命科学技能的工具包,使其能够利用 NVIDIA 的模型和库执行蛋白质折叠、分子对接和基因组分析等任务。

fangwei123456/spikingjelly

SpikingJelly 是一个基于 PyTorch 的开源库,用于构建、训练和部署脉冲神经网络。它提供神经元模块、ANN 到 SNN 的转换、多后端加速(torch、CuPy、Triton)、大规模训练工具、类脑数据集加载器、性能分析工具,以及类脑硬件的导出接口。需要 Python ≥ 3.11 和 PyTorch ≥ 2.6,采用 Open-Intelligence Open Source License 发布。

facebookresearch/VLM3

VLM³ 是一个框架,仅通过文本输出和数据缩放,即可使标准视觉语言模型执行深度估计和相机位姿估计等 3D 视觉任务。

sakalond/StableGen

一个将 TRELLIS.2 与 ComfyUI 集成的 Blender 插件,可从文本或图像生成 3D 网格,并为现有模型应用 AI 驱动的贴图。

katanaml/sparrow

一个面向企业文档智能的 API-first 平台,利用 Vision LLMs 和代理工作流将发票、收据和对账单转换为结构化的 JSON。

BIT-DataLab/Edit-Banana

一个使用 SAM 3 和多模态大语言模型将图表和流程图的静态图像转换为可编辑 DrawIO XML 文件的工具。

ZJU4HealthCare/HealthGPT

一个统一医疗文本、2D 图像和 3D 体积的医疗多模态大语言模型家族,实现高级医疗理解与生成。

microsoft/Biodiversity

一套开源 AI 工具,用于生物多样性监测,提供相机陷阱影像、生物声学、航空视角和声纳的动物检测模型。

NX-AI/xlstm

xLSTM 是一种新颖的循环神经网络架构,通过引入指数门控和矩阵记忆,扩展了 LSTM,使其能够支持大规模语言模型(例如,一个 70 亿参数的模型)。该仓库提供 PyTorch 代码、通过 `mlstm_kernels` 包提供的自定义 CUDA/Triton 内核、单文件 70 亿参数实现、配置工具以及 Hugging Face 上的预训练权重。安装通过 conda + pip 完成,该库可在 NVIDIA GPU(使用快速 Triton 内核)上运行,并为 AMD 或 Apple Silicon 提供回退方案。

catlog22/maestro-flow

Maestro‑Flow 是一个 TypeScript/Node.js 框架,可将自然语言意图转化为由多个 LLM 智能体(Claude、Gemini、Codex 等)执行的全栈开发流水线。其 Ralph 引擎将意图分类为 40 多种命令链,在“决策”检查点动态判断是否继续、回滚或插入修复循环,并将发现的模式自动存储在 SQLite 知识图谱中,后续运行中自动注入。支持四种协调模式(Delegate、Team、Wave、Swarm),通过 Odyssey 命令实现长时间自主循环,并具备精确的字面量/语义代码搜索能力。安装方式为 `npm i -g maestro-flow`,并提供丰富的 CLI 和 Web 仪表板文档。

VILA-Lab/FigMirror

FigMirror 是一个代理式工具,可自动将用户数据以指定参考科学图的风格生成 Matplotlib 代码。

OFA-Sys/Chinese-CLIP

一个针对跨模态检索与零样本图像分类训练的中文版 CLIP 模型,使用了 2 亿对图像-文本对。

anysearch-ai/anysearch-mcp-server

AnySearch MCP Server 是一个实时、MCP 兼容的后端,提供通用网络搜索、垂直领域搜索、并行批量搜索和 URL 内容提取功能。它可通过简单的 JSON 配置与 OpenCode、Claude Code、Cursor、VS Code、Windsurf、Cline 等主流 AI 助手 IDE 集成,支持可选的 API 密钥认证以提升速率限制,也支持匿名使用。README 详细说明了注册流程、密钥管理、客户端特定配置片段,以及四个工具端点(`search`、`get_sub_domains`、`batch_search`、`extract`)的使用方法。

jtydhr88/ComfyTV

一个基于画布的媒体工作台,将 AI 生成与专业级编辑工具集成,适用于图像、视频、音频、音乐和 3D 资产。

valentinfrlch/ha-llmvision

LLM Vision 是一个 Home Assistant 集成,使用多模态大语言模型(OpenAI, Anthropic, Gemini, Ollama 等)来分析图像、视频片段、实时摄像头画面和 Frigate 事件。它会返回自然语言描述、记住已识别的人/宠物/物体,并将每次分析结果存储在时间轴中,可以在仪表板上显示或通过 Assist 进行查询。可以通过 HACS 安装,配置 LLM 提供者,并可选择添加提供的 Blueprint 以获得 AI 摘要的摄像头摄像头通知。

NoizAI/HelixWorld

HelixWorld 是一个实时交互式视听世界模型,它生成可导航的环境,其中声音和视觉会根据用户移动同步更新。

tryonlabs/opentryon

一个用于时尚科技的开源 AI 工具包,为虚拟试穿、图像/视频生成和多模态理解提供统一的接口。

CronusL-1141/AI-company

AI Team OS 是一个开源平台,可将类Claude的LLM转变为持续运行的“CEO”。它持续运行,协调专业代理、任务墙、研究管道和双层记忆系统。FastAPI + React仪表板实时展示工作流、决策轨迹和所有备忘录的统一搜索。适合希望实现AI优先、自主运行工作流的技术创始人或研究团队。

om-ai-lab/VLM-R1

VLM-R1 是一个使用 GRPO 训练 R1 风格大型视觉语言模型的框架,旨在提升在视觉定位、数学与目标检测等任务中的推理与泛化能力。

StanfordMIMI/Merlin

Merlin是一个用于计算机断层扫描的3D视觉语言基础模型和数据集,将CT扫描与电子健康记录和放射学报告相结合,用于医学分析。

OpenBMB/MiniCPM-V-Apps

一系列适用于iOS、Android和HarmonyOS的设备端演示应用,允许MiniCPM-V系列多模态和文本模型通过llama.cpp完全本地运行。

Intent-Lab/VisionClaw

一款利用 Gemini Live 实时感知视觉与听觉,并通过 OpenClaw 集成执行操作的实时 AI 助手。

TinyLLaVA/TinyLLaVA_Factory

一个模块化的代码库,用于构建和训练小规模大型多模态模型,支持多种 LLM、视觉塔和连接器。

Anionex/agent-vision-toolkit

一个通过任务感知视觉工具和无缝代理集成,为仅支持文本的 LLM 代理赋予图像问答和 GUI 自动化能力的工具包。

fruitbars/simple-one-api

simple‑one‑api 是一个开源的 Go 网关,它通过 OpenAI 兼容的端点统一了多个 LLM 提供商,并增加了容量感知的密钥调度、四层速率限制、内置的 React 聊天 UI、可视化配置控制台以及 Wails 桌面客户端。它可以作为单个二进制文件、Docker 容器或桌面应用运行,并将配置存储在 SQLite 中。

nikkigallery/Whimbox

一个利用 LLM 和图像识别技术,通过屏幕截图和输入模拟来自动化《Infinity Nikki》游戏中的日常任务、导航和活动的 AI 代理。

MooreThreads/torch_musa

torch_musa 是一个 PyTorch 扩展,为 Moore Threads GPU 添加了 **MUSA** 后端。它镜像了标准 PyTorch API,因此您只需将 `cuda` 替换为 `musa`。该包包含构建 C/C++ 扩展的工具、通过 **mccl** 后端进行分布式训练的功能,以及用于快速设置的 Docker 镜像。它还提供 torchvision、torchaudio 以及一系列其他热门 PyTorch 库的 MUSA 兼容构建版本。可通过预构建的 wheel 安装,或在安装 MUSA SDK 后从源码构建。该项目采用 BSD 许可证。

crisng95/flowboard

一个仅限本地的无限画布工作区,采用基于图的方法,通过 Google Flow 将一致的角色和产品组合成图像和视频。

kyutai-labs/unmute

通过将文本 LLM 包装在低延迟语音转文本和文本转语音模型中,使文本型 LLM 能够实现听和说的系统。

Episkey-G/GrokSearch-rs

GrokSearch‑rs 是一个基于 Rust 的 MCP 服务器,为 LLM 代理添加实时、带引用的网络搜索工具。它可以通过 stdio 在本地运行,也可以作为多租户 HTTP 服务暴露。服务器查询可配置的提供商链(Tavily、Exa、TinyFish、Firecrawl),并包含针对 GitHub、StackExchange、arXiv 和 Wikipedia 的无密钥专用提取器。功能包括响应预算、缓存、对 Grok 的 OAuth 支持以及健康检查 `doctor` 工具。通过 npm(预构建二进制文件)或 Docker 安装,使用环境变量或全局 TOML 文件配置,并通过 MCP 协议与 Claude 风格助手集成。