Hugging Face Spaces agents.md 实现自动化 3D 多媒体流水线
Hugging Face Spaces agents.md 实现自动化 3D 多媒体流水线
TL;DR
一个编程智能体(coding agent)通过串联两个现有的 Space——一个用于图像生成,一个用于单图 3D 重建——自动构建了一个静态 Hugging Face Space,以 3D Gaussian splats 的形式展示巴黎古迹,展示了 agents.md 如何将任何 Space 转化为多媒体流水线中可组合的构建模块。
构建模块经济学迈向多媒体领域
Mitchell Hashimoto 所描述的“构建模块经济”(building-block economy)认为,现代软件开发倾向于使用可以由智能体组装的小型、文档齐全的组件,而不是单体式代码库。虽然这一理念已应用于代码库,但同样的原理现在也适用于多媒体 AI。使用最先进的图像、视频、TTS 或 3D 模型最困难的部分传统上在于集成:SDK、权重文件、GPU 要求和输入输出格式。通过将每个模型暴露为可调用的组件,智能体可以像处理 npm 包一样将它们粘合在一起。
agents.md 让每个 Hugging Face Space 都成为可调用的模块
Hugging Face Hub 上的每个 Gradio Space 都提供了一个纯文本 agents.md 文件,描述了如何通过编程方式调用该 Space。一个典型的 agents.md 包含:
API schema: GET ../gradio_api/info
Call endpoint: POST.../gradio_api/call/v2/{endpoint} {"param_name": value,...}
Poll result: GET ../gradio_api/call/{endpoint}/{event_id}
File inputs: POST.../gradio_api/upload -F "files=@file.ext"
Auth: Bearer $HF_TOKEN
不需要任何客户端库或硬编码的 SDK——智能体可以读取这些指令,设置 HF_TOKEN,并端到端地驱动该 Space。当一个 Space 的输出成为另一个 Space 的输入时,真正的力量就会显现,从而实现诸如 提示词 → 图像 → 3D splat 之类的流水线。
实际案例:巴黎古迹 → Gaussian splats
作者指示一个编程智能体使用两个 Space 创建一个巴黎古迹画廊:
- 图像生成 –
ideogram-ai/ideogram4Space 生成了每个古迹清晰的深色背景图像(例如:万神殿、歌剧院、凯旋门、圣心堂以及埃菲尔铁塔的缩微模型)。 - 3D 重建 –
VAST-AI/TripoSplatSpace 将每张单图转换为 3D Gaussian splat (.ply)。
智能体还执行了额外的粘合工作:
- 检测到 TripoSplat 的输出是 Y 轴向下(Y-down)的,并自动将其翻转为正向。
- 为每个古迹自动构图以获得最佳视角。
- 将
.ply文件压缩为.ksplat(体积缩小约 3 倍)以实现快速加载。 - 生成了一个具有滚动切换和拖拽旋转交互的 Three.js 查看器。
- 将整个查看器部署为一个静态 Space (
mishig/monuments-de-paris)。
人类的输入仅限于高层级的偏好,例如“缩小一点”或“把方尖碑换成更适合 splatting 的形状”。智能体还会对视觉反馈做出反应(例如,一个宽大的玻璃金字塔 splatting 效果不佳),并进行相应迭代,展示了一个“外包研发”的循环。
仅凭一个提示词即可复用流水线
由于流水线完全由两个 agents.md 文件描述,创建一个新画廊只需要一个新的文本提示词。作者要求同一个智能体生成埃及和日本的画廊,结果如下:
- 埃及古迹 – 大金字塔、狮身人面像、阿布辛贝神庙、图坦卡蒙面具、卡纳克神庙、门农巨像。
- 日本古迹 – 东京塔、姬路城、金阁寺、大阪城、镰仓大佛、严岛神社鸟居。
每个画廊都是使用相同的两个 Space、相同的压缩和查看器逻辑构建的,仅仅改变了文本描述。这表明,创建一个新多媒体应用的边际成本正趋近于描述它的成本。
为什么这很重要
- 可组合模型 – 来自不同机构的最先进图像和 3D 重建模型可以进行串联而无需编写集成代码,将 Hub 的开源权重目录变成了一个可调用的多媒体原语库。
- 对智能体友好的文档 –
agents.md提供了一个机器可读的契约,使 Space 对智能体而言是即时可达的,并鼓励其复用而非手动设置模型。 - 消除集成障碍 – 以前需要专门工程投入的任务(例如,“将提示词转化为旋转的 3D 古迹”)现在只是智能体驱动流水线中的一个步骤。
亲自尝试
要复制此工作流,只需将任何编程智能体(例如 Claude Code)指向这两个 Space 的 agents.md 文件并提供一个 HF_TOKEN:
# Image generation Space
curl https://huggingface.co/spaces/ideogram-ai/ideogram4/agents.md
# Single-image to 3-D Gaussian splat Space
curl https://huggingface.co/spaces/VAST-AI/TripoSplat/agents.md
将 URL 输入智能体,描述所需的画廊,让智能体编排图像创建、3D 重建、压缩、查看器生成和部署。完整的可复现流水线和支持脚本可在 monuments-de-paris Space 仓库中找到。
结论
agents.md 将每个 Hugging Face Space 变成了一个文档齐全、可调用的组件,使智能体能够以极少的人类指导来组合复杂的多媒体应用。巴黎 3D 画廊展示了一个简单的提示词如何驱动完整的流水线——从图像合成到 3D 渲染和 Web 部署——预示着 AI 驱动的媒体创作正向构建模块经济转型。