ruvnet/ruflo

Ruflo 是一个开源框架,在 Claude Code/Codex 周围添加了完整的代理执行层。它提供 100 多个专用代理、蜂群协调、持久向量记忆、自我学习循环、零信任联邦、插件市场和多模型聊天的 Web UI。可通过 `npx ruflo init`(全栈)或作为 Claude Code 插件(轻量)安装。

nexu-io/open-design

一个开源、本地优先的设计平台,使编码代理能够基于品牌的設計系统生成和渲染网页原型、演示文稿和动态图形。

ApodexAI/FrontierAgent

FrontierAgent 是一个开源、基于终端的运行时,可运行自主 ReAct 代理或并行代理团队工作流。它提供沙箱化文件系统、实时 TUI 任务板、异步用户干预,以及用于研究级长周期任务的内置基准测试框架。使用 `uv` 安装,指向任意 OpenAI 兼容模型端点(包括免费的 Apodex-1.1 服务),运行 `--mode react` 以启动单代理,或 `--mode agent_team` 以启动协调的并行代理。该项目采用 Apache-2.0 许可证。

EverettFish/holo-card-studio

一个Codex技能,可将文本或图像转换为带有视差效果的交互式3D全息卡片,同时提供Three.js网页查看器和可编辑的Blender项目。

Comfy-Org/ComfyUI

一个模块化、基于节点的 AI 引擎,专为视觉专业人士设计,可精确控制参数,用于生成图像、视频、音频和 3D 模型的复杂工作流。

Anil-matcha/Open-Generative-AI

一个无限制的开源 AI 工作室,可使用 400 多个模型生成图像、视频和音频,没有内容过滤器或订阅费用。

dramaclaw/dramaclaw

一个源码可用的 AI 剧集制作管线,通过基于节点的画布和结构化制作管线的双模式工作流,将剧本转化为成片。

ahujasid/camera-to-blender

一个使用 AI 将现实世界的物体照片转换为 3D 模型,并自动导入 Blender 的工具。

yejy53/Editable-Design

一个由编码代理驱动的框架,利用 HTML 和语义层而非扁平化图像来将提示词转换为可编辑、结构化的视觉设计。

OpenDCAI/GameFactory-3A

一个开源框架,利用代码代理将游戏需求转化为多个游戏引擎的生产就绪资产和引擎就绪代码。

OpenSenseNova/SenseNova-U1

SenseNova‑U 是一个开源的 8 B 参数统一多模态模型家族(U1 和 U1.5),原生支持文本到图像生成、图像编辑、VQA 和交错生成。基于 NEO‑unify 架构,它移除了独立的视觉编码器/VAE,提供高质量的 4K 生成能力、强大的信息图渲染效果,以及高效的推理性能(包括 LoRA 和社区提供的 8 位 GGUF 量化版本)。该仓库包含训练代码、推理脚本、基准测试和部署指南,所有内容均采用 Apache 2.0 许可证。

Tencent/WeMM-Embedding

...

Merserk/dlss5-visual-enhancer

一个 Windows 应用程序,通过本地 Gradio 界面将 NVIDIA DLSS 5 神经渲染和帧生成技术应用于图像和视频。

basketikun/infinite-canvas

一个开源的、基于节点的工作台,用于AI图像创作,将生成、编辑和提示词库集成在无限画布上。

HBAI-Ltd/Toonflow-app

一个AI驱动的工作台,可自动化从剧本创作、分镜制作到最终视频生成的全流程,专为短剧制作而设计。

snapotter-hq/SnapOtter

一个自托管的文件处理套件,提供超过 200 个工具,用于图像、视频、音频、PDF 和文档处理,支持本地 AI 功能,如 OCR 和语音转录。

moeru-ai/airi

一个开源框架,用于创建能够聊天、玩游戏并在多个平台上互动的交互式 AI 虚拟角色和 VTuber。

halcyon-video/halcyon-video

一个适用于 Jellyfin 和 Plex 的 3D 沉浸式视频商店界面,将您的媒体库变成一家可步行的 1990 年代租赁店。

NoizAI/HelixWorld

HelixWorld 1.0 是一个即将推出的实时模型,能够在用户移动虚拟摄像机时,同步生成视频与空间音频。该模型基于第一人称视角视频/音频与游戏引擎捕获的数据进行训练,以因果关系预测下一帧与声场,随后将整个流程蒸馏以达到交互速度。代码、模型权重与技术报告预计将于近期发布;该项目将采用 Apache-2.0 许可证。

pipecat-ai/pipecat

一个开源的 Python 框架,用于构建支持多代理编排和低延迟传输的实时语音与多模态 AI 代理。

Pinvou/pinvou-agent

Pinvou Agent 是一款跨平台桌面 AI 助手,利用 LLM 为工作、设计和编码创建可编辑的交付物。

ningzimu/codex-ppt-skill

一种 AI 代理技能,通过自动化大纲规划和视觉风格生成,将文章、报告和论文等转换为专业的图像型 PowerPoint 演示文稿。

Devin-AXIS/deepseek-design

DeepSeek Harness 的原生视觉设计系统,使 AI 能够生成并手动精修可编辑的网站、演示文稿和视频。

oil-oil/oil-motion

一种基于 Agent 的动画技术,可将 AI 生成的连续运动转化为响应滚动、鼠标移动和触摸的交互式网络元素。

zenstory-ai/drama-skills

一个基于AI的短剧创作工作流,通过一组模块化Agent技能,将创意或小说转化为剧本、分镜脚本和制作提示。

chatfire-AI/huobao-drama

一个由 AI 驱动的自动化制作平台,可从剧本生成、角色设计到最终视频合成,高效简化短剧创作流程。

techjarves/Uncensored-Local-Studio

一个零配置、离线的AI工作室,将Stable Diffusion、LLM、Whisper和Kokoro TTS集成到一个私有的桌面界面中,并支持硬件加速。

OpenSenseNova/SenseNova-Skills

SenseNova‑Skills 是一个开源的 Agent Skills 集合,为 SenseNova 大语言模型添加办公自动化功能(图像生成、信息图制作、Excel 分析、深度研究和 PowerPoint 生成)。将技能文件夹放入 OpenClaw 或 hermes‑agent 运行时,配置 SenseNova API 后,代理即可将简单的自然语言请求转化为专业的数据驱动报告与演示文稿。

darkzOGx/youtube-automation-agent

一个开源的 AI agent 系统,实现了 YouTube 频道全生命周期的自动化,从趋势研究、脚本编写到视频制作、发布以及基于分析数据的优化。

buxuku/SmartSub

SmartSub(妙幕)是一款开源、跨平台的桌面应用程序,可下载视频,运行本地或云端语音转文字,通过多种服务翻译字幕,编辑/校对,合成语音(包括零样本语音克隆),最终将字幕硬烧录或复用到视频中。它可在离线状态下运行,支持可选GPU加速,且可完全免费使用。

alchaincyf/huashu-design

一个面向 AI 代理的设计自动化技能,可将文本提示转化为专业级的交互式原型、动态图形和可编辑的演示文稿。

wide-trace/open-higgsfield

一个开源且可自托管的创作平台,通过统一的提示界面和用户提供的 API 密钥,支持使用 32 种不同的 AI 模型生成图像和视频。

PurpleDoubleD/locally-uncensored

适用于Windows和Linux的即插即用本地AI工作室,将无审查聊天、图像和视频生成以及代码代理整合到一个无需云端的桌面应用程序中。

ljquan/opentu

Opentu 是一个基于画布的 AI 应用平台,将多模型生成和工具管理整合到一个工作区中,实现持续的 AI 任务执行。

HKUDS/RAG-Anything

一个集成了多模态RAG功能的全栈框架,可无缝处理包含交错文本、图像、表格和数学公式的文档。

google-deepmind/alphagenome

用于解码 DNA 序列调控代码的统一模型和 API,可预测基因表达、剪接和染色质特征。

mengxi-ream/read-frog

Read Frog 是一个开源的浏览器扩展,为任何网页添加 AI 驱动的翻译、解释、文字转语音、字幕翻译、抽认卡创建以及自定义 AI 动作。它兼容 Chrome、Edge 与 Firefox,支持 20+ 家 LLM 提供商,批量请求以降低成本,并内置间隔重复系统用于词汇学习。

SegFault42/HeliosGen

一个免费且开源的可视化工作流构建器,可在无限节点画布上串联 AI 图像和视频生成模型。

llm-as-a-verifier/llm-as-a-verifier

llm-as-a-verifier 是一个 Python 框架,将 LLM 转化为 AI 代理输出的细粒度、概率性验证器。它对候选轨迹进行评分,通过高效的概率性枢轴锦标赛(PPT)选择 best-of-N,逐步追踪进展,并支持多模态(图像)输入。该库在多个代理基准测试中达到最先进水平,包含可复现的评估脚本、缓存优化的 token 使用量追踪器,以及用于无缝集成的 Claude Code 插件(TurboAgent)。

Blizaine/Maestro

一键式 AI 视频、图像和音频工作室,具备导演模式,利用 LLM 自动规划并生成音乐视频和短片。

flatkey-ai/flatkey-cli

用于统一多模态 AI 生成的命令行界面,允许媒体团队和 AI Agent 通过单个 API 密钥和积分余额生成图像、视频、音频和文本。

ant-research/4DAnyone

4DAnyone 是一个研究级神经模型,可将单摄像头人物视频转换为数十个同步、视角一致的视频(6-24-48 视角),用于下游 4D 高斯点云重建。可在消费级 GPU(≤24 GB VRAM)上运行,提供快速蒸馏版 Turbo 模型(5.6 倍加速),并提供即用型推理脚本和 nerfstudio 集成。

jtydhr88/ComfyTV

一个基于画布的媒体工作台,将 AI 生成与专业级编辑工具集成,适用于图像、视频、音频、音乐和 3D 资产。

livekit/agents

一个用于构建实时、多模态语音代理的框架,这些代理能够看见、听见并理解,具备集成的任务调度和灵活的模型集成能力。

ningzimu/image-to-editable-ppt-skill

一种多代理 AI 技术,通过重建文字、形状、资产,将图片、PDF 和基于图片的幻灯片转化为可编辑的 PowerPoint 演示文稿。

mnemosyne-oss/mnemosyne

Mnemosyne 是一个面向 AI agent 的、基于 SQLite 的本地优先记忆层。它通过三层架构(工作记忆、情境记忆、时序知识图谱)为助手提供跨会话的持久记忆,并结合了混合语义/关键词搜索、重度向量压缩、Python SDK、CLI 和内置 MCP server。它专注于隐私:无遥测,默认本地存储,并提供可选的客户端加密同步。

wiltodelta/remove-ai-watermarks

一个库和CLI工具,用于从AI生成的图像和视频中移除可见标签、不可见像素水印和AI来源元数据。

NomaDamas/CozyClay

一个基于浏览器的 3D 布景工作室,专为场景布光和 AI 生成动作序列化设计,支持通过 Model Context Protocol 实现直接 AI 控制。