MoonshotAI/Kimi-K3

Kimi K3 是一个拥有 2.8T 参数的开源权重原生多模态 MoE 模型,专为长周期编码、深度研究和复杂的智能体知识工作而设计。

modelscope/DiffSynth-Studio

一个开源的扩散模型引擎,可在消费级 GPU 上实现图像、视频和音频生成模型的高性能推理与训练。

solidSpoon/DashPlayer

一款专为英语学习者打造的 AI 增强视频播放器,提供本地 AI 字幕生成、句子拆解和词汇工具,以促进沉浸式语言习得。

flyteorg/flyte

Flyte 2 是一个用于定义、编排和提供机器学习流水线及 AI agent 服务的开源 Python 框架。它允许您将普通的 Python 函数作为任务编写,将其组合成工作流,并在本地或未来的 Kubernetes-native 后端上运行。该项目包含 CLI、面向开发者的 TUI,以及对 FastAPI 模型服务化的原生支持。

Jamailar/Beav

Beav(前身为 RedBox)是一款专为自媒体创作者设计的跨平台桌面 AI 工作站。它让您能够收集网页与社交媒体素材、存储至本地知识库、利用 AI 生成文字、图片与视频、编辑配音剪辑、添加动画并排程发布,所有功能皆整合于单一界面。该应用程序随附 Chrome/Edge 网页抓取工具、每日运营报告、可重复使用的图片模板、多轨视频编辑器,并可选择整合外部 Agent。它运行于 macOS、Windows 与 Linux,可使用内置 AI 服务或任何兼容 OpenAI 的端点,并以 MIT-NC(非商业)授权发布。

smixs/visual-skills

一套AI代理技能工具包,应用专业电影制作和戏剧学原理,为AI视频和图像模型生成高精度提示。

ErickWendel/localstudio

一个浏览器原生的、本地优先的幻灯片编辑器,利用 Web AI 和 WebGPU 提供无需后端的 AI 驱动幻灯片生成、翻译和演示工具。

verl-project/verl-omni

一个通用的多模态生成模型强化学习训练框架,提供快速采样和稳定的扩散模型与多模态模型后训练能力。

ModernRelay/omnigraph

Omnigraph 是一个基于 Rust 的湖仓式图数据库,将数据以列式 Lance 格式存储在任何 S3 兼容对象存储中。专为 AI 代理舰队设计:每个代理可写入其隔离分支,然后提交变更以供审查和 Git 风格合并。查询在单个运行时中融合图遍历、向量 ANN 和全文搜索,Cedar 策略对每次变更强制执行细粒度安全。项目提供 CLI、Axum HTTP 服务器、TypeScript SDK 和 LLM 主机用的“MCP”桥接器,是代理记忆、企业脑知识图谱、开发图自动化和版本化 ML 数据层的全栈解决方案。

NVIDIA/cosmos

一个开放平台,提供全模态世界模型和工具,用于构建物理AI,支持机器人和自主系统对文本、视觉、音频和动作序列的联合处理与生成。

TrenTorch/TrenTorch

Tren⚡Torch 是一个教育性质的、仅依赖 NumPy 的深度学习框架,重写了 TinyTorch 并添加了 20 个渐进式模块——从张量和自动微分到 CNN、Transformer、量化和基准测试——还包含 CLI 和历史里程碑脚本,支持动手学习。

Yuliang-Liu/MonkeyOCRv2

面向 Document AI 的视觉-文本基础模型,提供多语言视觉编码器以及专用于文档解析与理解的模型。

apify/mcpc

mcpc 是一个轻量级、跨平台的 CLI,提供对 Model Context Protocol (MCP) 的完整访问——AI 代理的工具、提示、任务和支付的标准 API。它允许代理和脚本从 Bash shell 调用任何 MCP 操作,支持持久会话、存储在操作系统密钥链中的 OAuth 2.1、适合管道的 JSON 输出、通过 grep 的动态工具发现,以及实验性的 x402 支付集成。

nexmoe/VidBee

一款开源桌面应用,可从 1000 多个站点下载视频和音频,在本地进行转录,并使用 AI 对内容进行摘要和搜索。

kgoedecke/doop

Doop 是一个开源的实时设计画布,人类和 AI 代理(通过 Claude Code 或内置 Doop 代理)可共同编辑 HTML 帧。它提供实时多人功能、AI 驱动的设计任务、私有共享,并可通过单个 Docker 命令或 `bun run dev` 自托管。AI 后端支持 Anthropic(免费层)或用户提供的 OpenAI/ChatGPT 密钥。

869413421/ai-moive-studio

一个全栈式 AI 内容创作工作台,通过无限画布和代理辅助工作流,将文本转化为 AI 电影和短视频。

Huanshere/VideoLingo

一个通过统一的 Streamlit 界面实现语音转录、翻译和语音生成自动化的 AI 驱动视频翻译与配音工具。

nicobailon/pi-mcp-adapter

一个 Pi 代理插件,通过一个轻量工具代理 MCP 服务器,懒加载服务器并按需发现工具,以节省上下文窗口

taylorwilsdon/google_workspace_mcp

Google Workspace MCP Server 是一个开源 Python 服务,通过 Model‑Client‑Protocol 暴露 120 多个 Google Workspace 操作(Gmail、Drive、Docs、Calendar 等),使 Claude 或 ChatGPT 等 LLM 助手能够读写 Workspace 数据。支持多用户 OAuth 2.1、三种工具层级、无状态容器部署和完整 CLI,同时将所有流量限制在 Google 的 API 范围内,并提供 MIT 许可证、可自行托管的代码。

localai-org/kimodo.cpp

一个基于 GGML/C++ 的 NVIDIA Kimodo 模型实现,可从文本提示生成角色和机器人动作动画。

OpenBMB/MiniCPM-V

一系列专为高效设备端部署设计的口袋大小多模态 LLM,可在手机上实现高性能图像、视频和实时全模态交互。

BasedHardware/omi

一个开源的 AI 记忆系统,通过可穿戴设备和桌面应用捕获屏幕和音频数据,提供实时转录、摘要和可搜索的 AI 聊天功能。

tracel-ai/burn

Burn 是一个原生 Rust 的深度学习框架,通过单一 API 统一训练与推理。它提供类似 PyTorch 的易用性、自动微分、JIT 编译的内核融合,以及灵活的后端系统(CUDA、ROCm、Metal、Vulkan、WebGPU、CPU 和 no-std)。借助 ONNX 导入、权重加载、终端训练仪表板,以及对嵌入式和浏览器环境的支持,Burn 让您编写一次模型,即可在任何地方运行。

huggingface/diffusers

一个用于生成图像、音频和 3D 分子结构的模块化库,支持使用和训练最先进的扩散模型。

koharu-rs/koharu

使用 Rust 编写的 ML 驱动的漫画翻译工具,自动化文本检测、OCR、翻译和生成式修复,实现本地优先的工作流。

off-grid-ai/OGAM

一个为 Android、iOS 和 Mac 设计的全面离线 AI 套件,提供文本、图像和视觉 AI 以及语音转录功能,所有功能均在设备本地原生运行,确保完全隐私。

icebird1998/scientific-illustrator

一个 Codex 插件,可自动将参考图像重绘为 Microsoft PowerPoint、WPS Presentation 或 draw.io 中的可编辑图表。

modelscope/FunClip

一个开源自动化视频剪辑工具,使用 ASR 和 LLM 根据语音文本、说话人身份或 AI 驱动的内容分析来提取视频片段。

bytebase/dbhub

DBHub 是一个极简且 Token 高效的 MCP 服务器,让基于 LLM 的工具能安全地查询 PostgreSQL、MySQL、SQL Server、Oracle、SQLite 和 MariaDB。它仅提供两个核心工具(SQL 执行与结构搜索),占用约 1.4k Token,并包含可选的额外工具、防护机制与内置网页 UI,是 AI 代理与真实数据库之间的轻量级桥梁。

datascale-ai/opentalking

一个开源的编排框架,通过 WebRTC 集成 LLM、TTS、STT 和视频渲染,实现实时数字人对话。

diffusionstudio/lottie

一个开源框架,使代码代理能够从文本提示和 SVG 资产生成生产就绪的 Lottie 动画。

Tencent-Hunyuan/Hunyuan3D-WorldClaw

WorldClaw 是一个代理式3D生成框架,旨在创建大规模、开放世界的3D环境。

pollinations/pollinations

一个开源生成式 AI 平台,提供统一的 OpenAI 兼容 API,支持文本、图像、视频、音频、3D 和嵌入生成。

TencentARC/Pixal3D

Pixal3D 是一个高保真 3D 资产生成器,通过像素对齐的反投影技术,从单张图像或多视角图像生成精细的几何结构和 PBR 纹理。

ahujasid/ableton-mcp

一个将 Claude AI 与 Ableton Live 连接的 Model Context Protocol (MCP) 服务器,支持提示驱动的音乐制作、轨道操作和自主歌曲编排。

google-deepmind/alphagenome

用于解码 DNA 序列调控代码的统一模型和 API,可预测基因表达、剪接和染色质特征。

liuzhao1225/YouDub-webui

一个开源视频本地化工具,可自动完成 YouTube、Bilibili 或本地文件视频的转录、翻译和配音。

neavo/LinguaGacha

LinguaGacha 是一个跨平台桌面应用,利用 OpenAI、DeepSeek、Anthropic、Google 或本地模型(如 Qwen2.5-7B)等大语言模型 API,仅需一键即可将字幕、电子书和游戏脚本翻译成数十种语言。它提供“AGENT”工作流,支持自动术语表提取、批量翻译和自动审查,同时保留格式和代码风格。

oil-oil/oil-motion

Oil Motion 是一个 AI 代理技能,可将设计提示和源图像转换为交互式网页动画(滚动驱动、鼠标跟随、触摸等)。它自动完成关键帧创建、AI 视频生成、帧级清理,并打包为 MP4 或 WebP 资产,最终提供可直接嵌入的前端代码。

SamurAIGPT/Generative-Media-Skills

一个多模态工具集和 MCP 服务器,通过模式驱动的架构使 AI 智能体能够生成和编辑专业级的图像、视频和音频。

jnMetaCode/agency-orchestrator

Agency Orchestrator 是一个基于 npm 的工具(CLI + Web UI),可从一句话或极小的 YAML 文件自动组合并运行多代理 AI 工作流。它提供 276 个预构建中文角色(191 个英文角色),支持 15 个 LLM 提供商(许多无需密钥),构建 DAG 实现并行执行,验证输出,并生成可共享的 HTML 报告。适合希望零代码拥有“AI 团队”的个人创业者、产品分析师和开发者。

jd-opensource/JoyAI-VL-Interaction

一个8B规模的视觉语言交互模型与系统,可在不到一秒内无需等待用户提示,主动响应实时视频流

diivi/aseprite-mcp

一个 MCP 服务器,通过 104 个全面的工具集,让 AI 助手能够完全控制 Aseprite,从而创作出专业级的像素艺术和动画。

jaredrhod/barehands

一个基于网络摄像头的双手追踪界面,让您能够以空间方式操作笔记、图像和 3D 模型,旨在作为视觉与交互的“身体”接入 AI 代理。

777genius/agent-teams-ai

Agent Teams AI 是一款免费的跨平台桌面应用,可让您构建和监控 AI 代理团队(Claude Code、Codex、OpenCode、Cursor、SuperGrok、GitHub Copilot、Z.AI、MiniMax、Kiro 等)。代理可以创建任务、通信、运行代码和终端命令,并在您观看看板时执行代码审查。该应用会跟踪令牌使用量、预算和每个代理的资源统计信息,并提供内置终端、支持 Git 的编辑器、多语言 UI,以及通过 `mcp-server` 组件的插件支持。

IBM/mcp-context-forge

ContextForge 是一个开源网关,将 MCP、A2A、REST 和 gRPC 服务联邦化为一个集中治理的单一端点,支持认证、速率限制、OpenTelemetry 跟踪、插件系统和管理 UI,可通过 PyPI、Docker 或 Helm 运行。

google-gemini/gemini-live-api-examples

Gemini Live API 的示例集合,使开发者能够利用多模态输入构建低延迟、实时的语音和视频 AI 代理。

X-PLUG/MobileAgent

一个利用视觉感知和规划实现移动端、桌面端及 Web 界面任务自动化的多平台 GUI 智能体及基础模型系列。