ldraw-nova:用于生成式乐高模型构建的智能体 AI

ldraw-nova 是一个开源框架,旨在使 AI 智能体能够设计出可构建的实体乐高模型。与其要求大语言模型(LLM)直接计算 3D 坐标(这是模型通常难以胜任的任务),ldraw-nova 提供了一套工具,允许智能体编写 Python 生成器脚本,进而生成 LDraw 汇编语言的源代码。

“生成器”架构

ldraw-nova 的运行原理是:LLM 在编写能够生成数学逻辑的代码方面,远比直接生成原始数学坐标更胜任。该系统实现了一个多阶段流水线,从提示词(prompt)到实体模型:

  1. 规划:智能体分析提示词并创建一个 plan.json 文件,详细说明所需的零件、子模型和整体美学风格。
  2. 生成:智能体根据计划编写 generator.py 脚本。该脚本充当编译器的角色,将高层计划转换为低层的 LDraw 语言。
  3. 执行:执行 Python 脚本以生成 .mpd 或 .ldr 文件(LDraw 源代码),然后将其渲染为 3D CAD 模型。
  4. 迭代优化:智能体渲染当前模型的图像,检查是否存在间隙或碰撞,并调整生成器脚本,直到模型完成。

核心工具与功能

为了实现精确构建,ldraw-nova 为智能体提供了一套全面的信息源和技术工具:

智能体指导

智能体配备了专门的文档来处理不同的构建风格,包括:

  • 载具和飞船工作流:针对空气动力学和结构完整性的具体指南。
  • 机械组(Technic)与机械结构:构建功能性机械结构的说明。
  • 模块化组织:通过子模型管理大型复杂模型的工作流。
  • 视觉设计:改善形状、颜色和细节的指南。

技术工具

  • 语义搜索:系统使用 jev-rerank(由 TypeSafe 的 Jev System One 提供支持)来帮助智能体查找合适的乐高零件和示例模型。如果无法使用 TypeSafe API 密钥,系统将回退到全文搜索(FTS)。
  • 验证:用于碰撞和间隙检测的工具,确保零件放置正确且在物理上可构建。
  • 渲染:无头渲染(Headless rendering)允许智能体“查看”其进度并进行视觉检查。

部署与技术要求

该系统作为容器化 Web 应用程序部署。安装需要克隆两个同级仓库——ldraw-nova 和 ldraw-nova-docker——并保持相同的版本标签(例如 v0.6.0)。

  • 基础设施:需要 Git 和 Docker。
  • 访问:该应用程序提供用于 Meta Quest 3 VR 交互的 HTTPS 端口(8443)和用于标准浏览器访问的普通 HTTP 端口(8765)。
  • 输出格式:最终输出包括 LDraw 源代码、可在 Blender 中编辑的 glTF 文件(.glb)以及完整的智能体思维过程/聊天记录。

当前局限性与未来工作

作为首个版本,作者指出了几个需要改进的领域:

  • 模型效率:生成过程目前缓慢且昂贵,对于复杂结果,需要 GPT-6 Astra 或 Claude Opus 5.5 等高端模型。
  • 领域差距:人仔(人类/动物)和复杂飞船的生成效果仍然不理想。
  • VR 性能:Meta Quest 3 的集成目前存在性能和模型处理方面的问题。
  • 低端模型支持:需要调整工具和文档,以允许较小的模型(例如 Claude Haiku)生成可行的模型。

社区观点

围绕该项目的讨论突显了智能体 CAD 设计的更广泛潜力。一位用户指出,在使用类似的 FreeCAD 和 Claude 工作流制作 3D 打印外壳和铣削铝制适配器方面取得了成功,并指出 AI 面临的主要挑战仍然是理解零件的物理装配顺序。

其他贡献者建议扩展该项目,包括用于机器人技术的物理建模,或者创建能够从照片中编目现有实体乐高收藏的工具,以限制 AI 的零件选择。

Sources

相关

  • Dispatch
  • 项目
  • Dispatch
  • 项目
  • Dispatch