google-gemini/gemini-live-api-examples
Gemini Live API 的示例集合,使开发者能够利用多模态输入构建低延迟、实时的语音和视频 AI 代理。
X-PLUG/MobileAgent
一个利用视觉感知和规划实现移动端、桌面端及 Web 界面任务自动化的多平台 GUI 智能体及基础模型系列。
YouMind-OpenLab/awesome-seedance-2-prompts
一个经精选、采用 CC-BY-4.0 许可的社区提交提示集合,共 6,405 个,专为字节跳动的 Seedance 2.0 多模态视频生成模型设计,包含精选示例、可搜索的网页画廊和贡献指南。
niedev/RTranslator
一款基于 Whisper 和 NLLB 等设备端 AI 模型的 Android 离线实时翻译应用,实现无需互联网的私密对话。
HUANGCHIHHUNGLeo/claude-real-video
一个本地视频处理管道,为LLM提取有意义的关键帧和字幕,用智能的场景变化检测替代固定间隔采样。
op7418/guizang-yingzao-skill
一项 AI 驱动的设计技能,将建筑与文化照片转化为艺术指导的编辑海报,并整合中文字体排版与空间感知。
fengshao1227/ccg-workflow
CCG-Workflow 是一个 Node.js CLI,使 Claude Code 成为多个代码生成模型(Codex、Gemini 等)的中心协调器。它注入 JavaScript 钩子以保持上下文,创建持久任务文件夹,运行内置策略(如 full-collaborate),应用安全/质量门,并可部署到 Baota 面板。通过 `npx ccg-workflow`(完整模式)安装,或作为 Claude 插件仅获取可重用技能。
xberg-io/xberg
Xberg 是一个开源、基于 Rust 的文档智能引擎,可从 107 种格式中提取干净、结构化的文本(包括 OCR、表格、代码结构,以及可选的 LLM 驱动增强)。它提供 15 种语言的绑定、CLI、Docker 镜像、REST API 和 AI 编码助手用的 MCP 服务器。
GMGNAI/gmgn-skills
GMGN Skills 通过 CLI 命令为 AI Agent 提供实时的多链链上数据和 Meme 代币交易能力,无需抓取即可实现自动化的研究、分析和执行。
ooboqoo/interview-coder-cn
一款由 AI 驱动的截图助手,能实时分析屏幕上的问题并提供答案,同时对屏幕共享软件保持隐形。
taoufik123-collab/claude-watch
一个使 Claude 能够通过提取关键帧和字幕来观看 URL 或本地文件视频的技能,实现多模态分析。
zilliztech/memsearch
memsearch 是一个 Python 库和 CLI,记录 AI 编码助手的对话为 Markdown,构建混合(BM25 + 密集)Milvus 索引,并通过插件支持 Claude Code、Codex、DeepSeek Harness、OpenClaw 和 OpenCode 等平台的跨平台召回。支持本地 ONNX 嵌入、可选的 Zilliz Cloud 后端、后台项目/用户笔记,以及自动技能蒸馏。
argosopentech/argos-translate
Argos Translate 是一个用于离线神经机器翻译的开源 Python 库。它下载封装为 ".argosmodel" 文件的预训练 OpenNMT 模型,支持通过中间语言进行枢轴翻译,并通过 CTranslate2 提供 GPU 加速,可以通过 Python API、CLI 或独立的桌面 GUI 使用。该项目还为 LibreTranslate Web/API 服务提供支持。
nyldn/claude-octopus
Claude Octopus 是一个为 Claude Code 设计的插件,添加了多 LLM 编排层。它在你运行 `/octo:*` 命令前保持休眠状态,随后可调用最多 12 个外部提供者(如 Codex、Copilot、Ollama 等)执行共识门控审查、对抗性评议或完整的“规格到软件”流水线。它自带数十个角色、斜杠命令和方法感知工作流,与持久化记忆工具集成,支持在 Claude Code、Codex CLI、Cursor IDE(通过 MCP 服务器)、OpenCode 中使用。
open-multi-agent/open-multi-agent
Open Multi‑Agent (OMA) 是一个 TypeScript 框架,用于在 Node.js 应用中编排动态的 LLM 代理团队。它在运行时从高层次目标构建任务 DAG,执行计划(支持人工审批),记录完整追踪以供检查或重放,并支持任意 LLM 提供商、工具门控、预算控制和 OpenTelemetry 集成。
Ch921-cell/Remember-R1
Remember-R1 是一个旨在防止多模态模型在长上下文推理过程中遗忘视觉信息的强化学习框架。
llm-as-a-verifier/llm-as-a-verifier
llm-as-a-verifier 是一个 Python 框架,将 LLM 转化为 AI 代理输出的细粒度、概率性验证器。它对候选轨迹进行评分,通过高效的概率性枢轴锦标赛(PPT)选择 best-of-N,逐步追踪进展,并支持多模态(图像)输入。该库在多个代理基准测试中达到最先进水平,包含可复现的评估脚本、缓存优化的 token 使用量追踪器,以及用于无缝集成的 Claude Code 插件(TurboAgent)。
jingyaogong/minimind-v
一个极简的视觉语言模型 (VLM) 实现,允许用户在单张消费级 GPU 上仅用 2 小时即可训练一个 65M 参数的多模态模型。
50kg/image-to-slice
一款 AI 驱动的 UI 分解工具,通过智能切片资产和背景修复,将扁平的 UI 图像转换为可编辑的 Figma 图层和 HTML/CSS 代码。
halcyon-video/halcyon-video
专为 Jellyfin、Plex 和 Emby 等媒体库设计的可步行 3D 视频商店界面,将数字目录转变为沉浸式物理浏览体验。
Blizaine/Maestro
一个本地 AI 创作工作室和视频编辑器,使用 LLM 驱动的工作流来自动化音乐视频和短片的制作。
hero8152/Infinite-Canvas
一个视觉化、无限画布的工作空间,整合了多种 AI API 和本地 ComfyUI 工作流,用于协作式生成式 AI 内容创作。
JohnKinyanjui/sprite-maker
一个本地优先的 AI 工作台,用于创建、动画化和导出 2D 游戏艺术,具备身份保持的 AI 动画和基于 Rust 的确定性绑定引擎。
shootthesound/Fizgig
一个允许用户在消费级 GPU 上微调和修复 AI 图像与视频模型的 LoRA 训练与优化工作室。
Adam-CAD/CADAM
一个开源的文字转 CAD 网页应用,使用 AI 将自然语言和图像转换为 OpenSCAD 的参数化 3D 模型。
tover0314-w/opentypeless
一款开源的 AI 语音输入工具,适用于 macOS、Windows 和 Linux,提供应用感知的语音输入、语音问答和文本重写功能。
MCPJam/inspector
MCPJam Inspector 是一个开源测试与评估平台,用于实现 Model‑Chat‑Protocol (MCP) 的服务器,该协议被 ChatGPT、Claude、Cursor、Copilot 等基于聊天的 AI 产品所使用。它提供 Web Playground、OAuth 调试器、服务器调试工具、可重用的“技能”、共享工作区、评估测试用例运行器、CLI、SDK 以及 CI/CD 集成,可在 16 种客户端配置和 170+ LLM 模型中捕捉回归问题。
csyqlz/VOZEB-PRO
一个将多模态代理、视觉画布和短剧制作流水线整合为单一商业就绪 SaaS 应用的全栈式 AI 内容创作平台。
AgnesAI-Labs/AgnesAI-Models
一个统一的 OpenAI 兼容 API 网关,为文本、图像和视频生成提供高性能多模态基础模型的访问。
penecho/penecho
PenEcho 是一个通过 Model-Canvas-Protocol (MCP) 与 LLM 代理集成的视觉画布应用。它允许您绘制、注释、嵌入小部件,并让 AI 代理读取和编辑画布,从而在对话与视觉工作之间建立紧密的反馈循环。可作为桌面应用或 npm 包使用,支持本地和云托管模型,提供版本化项目、共享功能和内置助手。
oomol-lab/pdf-craft
一个 Python 库,使用 OCR 和基于大语言模型的翻译将扫描的 PDF 转换为可编辑的 Markdown 或 EPUB 文件。
digitalsamba/claude-code-video-toolkit
一个与 Claude Code 集成的 AI 原生视频制作工作区,可自动化脚本编写、资产生成和渲染流程,以低成本制作专业级解释型视频。
NomaDamas/CozyClay
一个基于浏览器的预可视化工作室,用于场景布局和角色摆姿,以创建AI视频生成所需的高控制参考资产。
modstart-lib/aigcpanel
集唇形同步、语音克隆和音视频工具于一体,用于 AI 数字人创作的一站式桌面应用程序。
sokrypton/ColabFold
一款通过 Google Colab 和本地安装使蛋白质折叠预测易于访问的工具,集成了 AlphaFold2 和 AlphaFold3 等多种模型及公共 MSA 服务器。
Blaizzy/mlx-vlm
MLX‑VLM 是一个 Python 库,可通过 Apple Silicon 上的 MLX 运行时实现视觉-语言(及多模态)模型的推理、微调和部署。它提供 CLI、FastAPI 服务器、Gradio 聊天 UI,以及推测解码(DFlash、Gemma‑4 MTP、EAGLE‑3)等高级加速技术。该包支持数十种预封装模型、低比特量化、思考预算控制,以及便于开发的代理技能包。
NVIDIA-NeMo/Nemotron
专为代理型 AI 设计的开源、高效率多模态模型家族及训练配方,提供从数据整理到部署的完整生命周期工具支持。
jordanrendric/claude-video-vision
一个通过本地或云后端提取帧并转录音频,使 Claude Code 实现视频理解的插件。
Tencent-Hunyuan/HY-World-2.0
一个从文本、图像或视频生成和重建可编辑 3D 资产(网格和 Gaussian Splattings)的多模态世界模型框架,适用于游戏引擎。
rome-os/rome
Rome 是一个开源的「代理操作系统」,允许人类与 AI 代理在持久、自托管的环境中协作。它引入了 **Rome Apps**——通过 git 跟踪的包,包含动作、代理、技能、UI 和数据,使能力超越单次对话而持续存在。您可通过 Docker/Electron 本地运行或使用预览版 Rome Cloud,使用提供的 SDK 构建应用,并通过应用商店共享。该平台聚焦于可组合、可重用的软件,而非仅模型提示,定位在持久代理服务与个人软件平台之间。
ahujasid/camera-to-blender
一个使用 AI 将现实世界的物体照片转换为 3D 模型,并自动导入 Blender 的工具。
WecoAI/aideml
AIDE ML 是一个开源 Python 库,它实现了一个由 LLM 引导的树搜索智能体,用于自动编写、调试和优化机器学习流水线。用户通过自然语言描述数据集、目标和评估指标;智能体迭代地生成代码、评估它并剪枝搜索树,直到指标达到最大化。该包包含 CLI、Streamlit UI、HTML 可视化,并支持任何 OpenAI 兼容的 LLM(包括本地 Ollama 模型)。
mizorewww/course2md
使用语音识别将 YouTube、Bilibili 和本地视频转换为带插图的 Markdown 或 HTML 笔记的工具。
GenielabsOpenSource/spine-animation-ai
一个为 Spine 2D 设计的 AI 驱动工具集,可自动完成角色绑定、资产定位和从原始图像生成动画。
alibaba/lumenx
一个 AI 原生的动画漫画与视频创作平台,通过集成的脚本分析、资产生成和合成流程,将脚本转化为成品视频。
anymouschina/TapCanvas
一个原生 Agent 无限画布,将脚本、资产和故事板整合为可追溯的工作流,用于 AI 电影和多模态内容生产。
raojiacui/prompt-lens
一款 AI 视频分析工具,可逆向分析现有视频以提取提示和脚本,帮助创作者复现并迭代成功的 AI 视频风格。
laravel/mcp
Laravel MCP 是一个 Laravel 包,提供即用型 Model Context Protocol (MCP) 服务器,使 AI 客户端能够通过标准协议与 Laravel 应用的数据和逻辑进行交互。