latent-spaces/brag

一个 Claude Code 技能,利用 Hyperframes 自动将软件项目转换为带有音乐和动态效果的短版可分享发布视频。

TauricResearch/TradingAgents

TradingAgents 是一个基于 LangGraph 的开源框架,通过协调多个 LLM 驱动的代理(基本面、情绪、新闻、技术、研究员、交易员、风险、投资组合)来模拟完整的交易公司。它支持数十种 LLM 提供商,获取时点市场数据(SEC EDGAR、FRED、Yahoo Finance、社交情绪),提供带检查点的图执行,记录决策以实现持续学习,并提供回测 CLI 以评估跨股票代码和日期的性能。专为研究设计,非投资建议。

wide-trace/open-higgsfield

一个开源且可自托管的创作平台,通过统一的提示界面和用户提供的 API 密钥,支持使用 32 种不同的 AI 模型生成图像和视频。

ApodexAI/FrontierAgent

FrontierAgent 是一个开源、基于终端的运行时,可运行自主 ReAct 代理或并行代理团队工作流。它提供沙箱化文件系统、实时 TUI 任务板、异步用户干预,以及用于研究级长周期任务的内置基准测试框架。使用 `uv` 安装,指向任意 OpenAI 兼容模型端点(包括免费的 Apodex-1.1 服务),运行 `--mode react` 以启动单代理,或 `--mode agent_team` 以启动协调的并行代理。该项目采用 Apache-2.0 许可证。

spinabot/brigade

Brigade 是一个自托管、多智能体AI助手框架。它允许您在本地运行一个由智能体组成的团队,共享持久且可追溯记忆(Tideline),按组织架构图进行组织,并可通过终端UI、WhatsApp、Slack、Discord、iMessage等渠道访问。所有API密钥和数据均保留在您的机器上;您可以接入任意LLM(Claude、OpenAI、Gemini、本地Ollama等),并通过Composio连接1,000多个第三方应用。功能包括技能系统、子智能体分发、cron调度、文档/媒体处理、可选Convex存储和MCP记忆服务器。通过一行脚本或npm安装,完成上手流程,启动始终在线的网关,即可开始聊天。

nexu-io/open-design

一个开源、本地优先的设计平台,使编码代理能够基于品牌的設計系统生成和渲染网页原型、演示文稿和动态图形。

yi1108/printfilm

一个开源的 AI 工作室,通过模板驱动的流水线,自动化完成故事板、图像/视频生成和语音合成,支持短视频和连载漫画的创作。

Comfy-Org/ComfyUI

一个模块化、基于节点的 AI 引擎,专为视觉专业人士设计,可精确控制参数,用于生成图像、视频、音频和 3D 模型的复杂工作流。

docling-project/docling

Docling 是一个开源 Python 库,可解析大量文档类型(PDF、Word、幻灯片、电子表格、电子书、音频、视频、邮件、图像及多种 XML 模式),并利用 AI 驱动的布局分析、OCR、视觉-语言模型理解及语音转文本功能对其进行增强。它输出统一的 `DoclingDocument`,可导出为 Markdown、HTML、JSON、DocLang、DocTags 等格式,并可通过 MCP 或 REST API 直接集成到 LangChain、LlamaIndex、Crew AI、Haystack 或自定义代理中。该工具可在本地运行以保护隐私敏感数据,也支持 CLI 和服务模式,非常适合构建 RAG 管道、企业知识库、金融或法律文档处理以及多模态 AI 代理。

higgsfield-ai/higgsfield

higgsfield 是一个开源 GPU 节点管理器和训练框架,专为超大规模 LLM 设计。它处理节点分配、ZeRO-3/FSDP 分片、任务队列和基于 GitHub Actions 的部署,让您仅用一个简单的 Python 装饰器即可在集群中训练 LLaMA-70B 等模型。

milind-soni/OpenMausBot

OpenMausBot 是一款桌面聊天应用,可让您将多个 AI 代理(Claude、Codex、Grok 或任何兼容 CLI)作为联系人进行管理。每个机器人通过小型适配器服务器在本地运行,可控制云或本地计算机,并可通过 Composio 与第三方应用连接。UI 提供模型切换、高风险操作的审批对话框、通过 ElevenLabs 的语音输出,以及基于 Markdown 的团队导入系统。它在 macOS、Windows 和 Ubuntu 上运行,除非启用外部服务,否则所有数据均本地存储。

ruvnet/ruflo

Ruflo 是一个开源框架,在 Claude Code/Codex 周围添加了完整的代理执行层。它提供 100 多个专用代理、蜂群协调、持久向量记忆、自我学习循环、零信任联邦、插件市场和多模型聊天的 Web UI。可通过 `npx ruflo init`(全栈)或作为 Claude Code 插件(轻量)安装。

krillinai/OpenCreator

OpenCreator 是一个开源、本地运行的 AI 工作区,结合了基于 Codex 的对话式代理与用于多模态内容创作(视频翻译、下载、缩略图和图像生成)的可视化仪表板。提供版本化工作流、本地数据存储以及基于相同 Web UI 的桌面客户端。支持多种 LLM、Whisper、GPT-Image 及其他语音/翻译服务。专为希望在不依赖仅限云端平台的情况下实现 AI 辅助媒体制作的创作者和小团队设计。

ahujasid/mcp-for-blender

基于 MCP 的集成,将 LLM 连接到 Blender,实现提示驱动的 3D 建模、场景操作和资产集成。

Anil-matcha/Open-Generative-AI

一个无限制的开源 AI 工作室,可使用 400 多个模型生成图像、视频和音频,没有内容过滤器或订阅费用。

gzxx-2025/aid-studio

一个自行托管的 AI 制作平台,将编剧、分镜、图像/视频生成和配音整合到单一工作流程中,用于创作 AI 电影、剧集和漫画。

microsoft/playwright-mcp

Playwright MCP 是一个 Node.js 服务器,可让基于 LLM 的代理通过 Model Context Protocol 控制 Playwright 浏览器。它返回结构化的可访问性快照(JSON)而非屏幕截图,实现节省 token、确定性的 Web 自动化,并保持浏览器状态。

ZJU-REAL/Easel

Easel 是一款开源的 AI 驱动内容工作台,专为社交媒体创作者设计。它结合了 OpenClaw LLM 代理、账号专属配置文件以及超过 113 种可执行“技能”,能协助发现趋势、规划主题、生成文字、图像、音频与视频,并直接发布至七大中国平台,同时将绩效数据回馈至配置文件以持续优化。

lixiaoxiao9888-create/manju-laoli-skill

一套为 AI 代理设计的工业级 AIGC 创作规则库,通过“资产优先”流程将剧本转换为一致且符合模型要求的视频提示词。

basketikun/infinite-canvas

一个将无限画布、多模态AI生成和代理式画布操作整合到单一工作区的开源AI图像创作工作台。

nilbuild/page-mascot

一个 React 组件和 AI 驱动的工具集,用于使用精灵表向网站添加交互式、光标追踪的吉祥物。

OpenSenseNova/SenseNova-U1

OpenSenseNova 的 SenseNova‑U1 系列是基于 NEO‑unify 架构构建的开源、原生统一多模态模型(文本 + 图像)。支持高质量 4K 图像生成、密集文本信息图创建、图像编辑、VQA 以及交错文本-图像教程生成。仓库提供训练代码、预训练 8 B 参数检查点(含社区量化 GGUF 文件)、示例推理脚本和部署指南,均在 Apache 2.0 许可证下提供。

Devin-AXIS/deepseek-design

DeepSeek Harness 的原生视觉设计系统,使 AI 能够生成并手动精修可编辑的网站、演示文稿和视频。

chatfire-AI/huobao-drama

一个由 AI 驱动的自动化制作平台,可从剧本生成、角色设计到最终视频合成,高效简化短剧创作流程。

HBAI-Ltd/Toonflow-app

一个AI驱动的工作台,可自动化从剧本创作、分镜制作到最终视频生成的全流程,专为短剧制作而设计。

zenstory-ai/drama-skills

一个由十一项智能体技能组成的 AI 驱动短剧制作流程,可将创意或小说转化为剧本、分镜和视频提示,重点在于视觉一致性

alesha-pro/tools

一套本地 AI 工具集合,包含针对 MiniMax H3 视频-音频生成优化的多 GPU 工作流程,以及专为 AI 代理设计的动画技能。

v-modal/vmodal_sdk_flutter

一个用于在视频和图像库之间实现跨模态语义搜索的 Flutter SDK,使用户能够通过语义、语音或图像查找特定时刻。

omnigent-ai/omnigent

Omnigent 是一个开源的元框架,将 Claude Code、Codex、Cursor 等多种 LLM 编码代理统一在单一 CLI 和 Web UI 下,支持跨设备和云沙箱运行、组合与治理,并具备内置协作和策略功能。

darkzOGx/youtube-automation-agent

一个开源的 AI agent 系统,实现了 YouTube 频道全生命周期的自动化,从趋势研究、脚本编写到视频制作、发布以及基于分析数据的优化。

ningzimu/codex-ppt-skill

一种AI代理技能,可将文章、报告和论文转换为基于图像的PowerPoint演示文稿,通过规划提纲、生成样式化的幻灯片图像并将其组装为.pptx文件。

EverettFish/holo-card-studio

一个Codex技能,可将文本或图像转换为带有视差效果的交互式3D全息卡片,同时提供Three.js网页查看器和可编辑的Blender项目。

xuanyustudio/LocalMiniDrama

一个开源、本地优先的AI短剧生成器,通过整合多种AI API,实现从剧本生成到最终视频合成的全流程自动化。

alchaincyf/huashu-design

一个面向 AI 代理的设计自动化技能,可将文本提示转化为专业级的交互式原型、动态图形和可编辑的演示文稿。

waooAI/waoowaoo

一个用于图像和视频的 AI 创意工作区,结合了头脑风暴助手和用于整理及优化 AI 生成资产的视觉画布。

Merserk/dlss5-visual-enhancer

一款适用于 NVIDIA RTX GPU 的 Windows 应用程序,使用 DLSS 5 和 RTX Video 技术来对图像、视频和直播进行超分辨率、增强和帧插值。

Open-LLM-VTuber/Open-LLM-VTuber

一个开源、语音交互的 AI 伴侣,具备 Live2D 头像与视觉感知,能够完全离线运行,提供私密的实时对话。

Swayingleaves/novanova-studio

一个将图像和视频生成集成到无限画布中的 AI Agent 驱动的视觉创作工作台,以保持创作上下文。

yejy53/Editable-Design

Editable Visual Design 是一个开源工具包,让 LLM(通过 Codex “Skills”)能将自然语言设计需求转化为完全可编辑的图形,包括具有独立文字、图像和布局层的 HTML 页面或 PowerPoint 文件。它包含三个技能:用于研究图表的 `paper-fig`、用于海报/信息图表的 `editable-design`,以及用于将 HTML 转换为 PPTX 的 `html-to-pptx`。该系统记录 LLM 的设计步骤(Agent Design Replay)并提供可视化编辑器,实现可于本地编辑的快速 AI 生成草稿。

ningzimu/image-to-editable-ppt-skill

一种多代理 AI 技术,通过重建文字、形状、资产,将图片、PDF 和基于图片的幻灯片转化为可编辑的 PowerPoint 演示文稿。

QwenLM/Qwen-MM-Plugins

Qwen 模型的多模态插件集合,使 AI 代理能够原生处理图像、视频、音频和 3D 文件,并控制 Blender 和 FreeCAD 等软件。

techjarves/Portable-Local-Studio

一个零配置、离线的AI工作室,将Stable Diffusion、LLM、Whisper和Kokoro TTS集成到一个硬件加速的桌面界面中。

bytedance/UI-TARS-desktop

一个多模态 AI 智能体技术栈,通过视觉识别和精确的 GUI 交互,实现对桌面应用程序和网络浏览器的自然语言控制。

buxuku/SmartSub

SmartSub(妙幕)是一款开源、跨平台的桌面应用程序,可下载视频,运行本地或云端语音转文字,通过多种服务翻译字幕,编辑/校对,合成语音(包括零样本语音克隆),最终将字幕硬烧录或复用到视频中。它可在离线状态下运行,支持可选GPU加速,且可完全免费使用。

xpzouying/xiaohongshu-mcp

一个自托管的 MCP 服务器,让 AI 助手能够登录小红书、发布内容(图片或视频)、搜索动态、点赞/收藏、评论,并获取用户或帖子详情。支持二进制文件、Docker 镜像或源码构建,可与 Claude Code、Cursor、VS Code、Open Code、Cline 等集成。

PurpleDoubleD/locally-uncensored

一个全面的本地 AI 工作室,将聊天、图像和视频生成以及编码代理整合到一个易于安装的桌面应用程序中。

lightningpixel/modly

一个本地开源桌面应用程序,利用在用户 GPU 上运行的 AI 模型,将照片转换为 3D 网格。

Tencent/WeMM-Embedding

WeMM‑Embedding 是腾讯开源的多模态嵌入套件(2B/4B/9B 参数),可将文本、图像、视频和视觉文档转换为单一 L2 归一化向量。支持通过“马特里什卡”截断实现多种输出维度,提供 🤗 Transformers 和 Sentence‑Transformers 的即用推理脚本,并包含 vLLM 和 SGLang 的服务封装。基准测试(MMEB‑v2/v3)显示其在图像、视频、文档、文本和代理任务中均达到最先进水平。模型托管于 Hugging Face,采用 Apache 2.0 许可证发布。