Hugging Face Spaces agents.md 实现自动化 3D 多媒体流水线

Hugging Face Spaces agents.md 实现自动化 3D 多媒体流水线

TL;DR

一个编程智能体(coding agent)通过串联两个现有的 Space——一个用于图像生成,一个用于单图 3D 重建——自动构建了一个静态 Hugging Face Space,以 3D Gaussian splats 的形式展示巴黎古迹,展示了 agents.md 如何将任何 Space 转化为多媒体流水线中可组合的构建模块。

构建模块经济学迈向多媒体领域

Mitchell Hashimoto 所描述的“构建模块经济”(building-block economy)认为,现代软件开发倾向于使用可以由智能体组装的小型、文档齐全的组件,而不是单体式代码库。虽然这一理念已应用于代码库,但同样的原理现在也适用于多媒体 AI。使用最先进的图像、视频、TTS 或 3D 模型最困难的部分传统上在于集成:SDK、权重文件、GPU 要求和输入输出格式。通过将每个模型暴露为可调用的组件,智能体可以像处理 npm 包一样将它们粘合在一起。

agents.md 让每个 Hugging Face Space 都成为可调用的模块

Hugging Face Hub 上的每个 Gradio Space 都提供了一个纯文本 agents.md 文件,描述了如何通过编程方式调用该 Space。一个典型的 agents.md 包含:

API schema:   GET  ../gradio_api/info
Call endpoint: POST.../gradio_api/call/v2/{endpoint} {"param_name": value,...}
Poll result:  GET  ../gradio_api/call/{endpoint}/{event_id}
File inputs:  POST.../gradio_api/upload -F "files=@file.ext"
Auth:         Bearer $HF_TOKEN

不需要任何客户端库或硬编码的 SDK——智能体可以读取这些指令,设置 HF_TOKEN,并端到端地驱动该 Space。当一个 Space 的输出成为另一个 Space 的输入时,真正的力量就会显现,从而实现诸如 提示词 → 图像 → 3D splat 之类的流水线。

实际案例:巴黎古迹 → Gaussian splats

作者指示一个编程智能体使用两个 Space 创建一个巴黎古迹画廊:

  1. 图像生成ideogram-ai/ideogram4 Space 生成了每个古迹清晰的深色背景图像(例如:万神殿、歌剧院、凯旋门、圣心堂以及埃菲尔铁塔的缩微模型)。
  2. 3D 重建VAST-AI/TripoSplat Space 将每张单图转换为 3D Gaussian splat (.ply)。

智能体还执行了额外的粘合工作:

  • 检测到 TripoSplat 的输出是 Y 轴向下(Y-down)的,并自动将其翻转为正向。
  • 为每个古迹自动构图以获得最佳视角。
  • .ply 文件压缩为 .ksplat(体积缩小约 3 倍)以实现快速加载。
  • 生成了一个具有滚动切换和拖拽旋转交互的 Three.js 查看器。
  • 将整个查看器部署为一个静态 Space (mishig/monuments-de-paris)。

人类的输入仅限于高层级的偏好,例如“缩小一点”或“把方尖碑换成更适合 splatting 的形状”。智能体还会对视觉反馈做出反应(例如,一个宽大的玻璃金字塔 splatting 效果不佳),并进行相应迭代,展示了一个“外包研发”的循环。

仅凭一个提示词即可复用流水线

由于流水线完全由两个 agents.md 文件描述,创建一个新画廊只需要一个新的文本提示词。作者要求同一个智能体生成埃及和日本的画廊,结果如下:

  • 埃及古迹 – 大金字塔、狮身人面像、阿布辛贝神庙、图坦卡蒙面具、卡纳克神庙、门农巨像。
  • 日本古迹 – 东京塔、姬路城、金阁寺、大阪城、镰仓大佛、严岛神社鸟居。

每个画廊都是使用相同的两个 Space、相同的压缩和查看器逻辑构建的,仅仅改变了文本描述。这表明,创建一个新多媒体应用的边际成本正趋近于描述它的成本。

为什么这很重要

  • 可组合模型 – 来自不同机构的最先进图像和 3D 重建模型可以进行串联而无需编写集成代码,将 Hub 的开源权重目录变成了一个可调用的多媒体原语库。
  • 对智能体友好的文档agents.md 提供了一个机器可读的契约,使 Space 对智能体而言是即时可达的,并鼓励其复用而非手动设置模型。
  • 消除集成障碍 – 以前需要专门工程投入的任务(例如,“将提示词转化为旋转的 3D 古迹”)现在只是智能体驱动流水线中的一个步骤。

亲自尝试

要复制此工作流,只需将任何编程智能体(例如 Claude Code)指向这两个 Space 的 agents.md 文件并提供一个 HF_TOKEN

# Image generation Space
curl https://huggingface.co/spaces/ideogram-ai/ideogram4/agents.md

# Single-image to 3-D Gaussian splat Space
curl https://huggingface.co/spaces/VAST-AI/TripoSplat/agents.md

将 URL 输入智能体,描述所需的画廊,让智能体编排图像创建、3D 重建、压缩、查看器生成和部署。完整的可复现流水线和支持脚本可在 monuments-de-paris Space 仓库中找到。

结论

agents.md 将每个 Hugging Face Space 变成了一个文档齐全、可调用的组件,使智能体能够以极少的人类指导来组合复杂的多媒体应用。巴黎 3D 画廊展示了一个简单的提示词如何驱动完整的流水线——从图像合成到 3D 渲染和 Web 部署——预示着 AI 驱动的媒体创作正向构建模块经济转型。

Sources