ldraw-nova:用于生成式乐高模型构建的智能体 AI
ldraw-nova 是一个开源框架,旨在使 AI 智能体能够设计出可构建的实体乐高模型。与其要求大语言模型(LLM)直接计算 3D 坐标(这是模型通常难以胜任的任务),ldraw-nova 提供了一套工具,允许智能体编写 Python 生成器脚本,进而生成 LDraw 汇编语言的源代码。
“生成器”架构
ldraw-nova 的运行原理是:LLM 在编写能够生成数学逻辑的代码方面,远比直接生成原始数学坐标更胜任。该系统实现了一个多阶段流水线,从提示词(prompt)到实体模型:
- 规划:智能体分析提示词并创建一个
plan.json文件,详细说明所需的零件、子模型和整体美学风格。 - 生成:智能体根据计划编写
generator.py脚本。该脚本充当编译器的角色,将高层计划转换为低层的 LDraw 语言。 - 执行:执行 Python 脚本以生成
.mpd或.ldr文件(LDraw 源代码),然后将其渲染为 3D CAD 模型。 - 迭代优化:智能体渲染当前模型的图像,检查是否存在间隙或碰撞,并调整生成器脚本,直到模型完成。
核心工具与功能
为了实现精确构建,ldraw-nova 为智能体提供了一套全面的信息源和技术工具:
智能体指导
智能体配备了专门的文档来处理不同的构建风格,包括:
- 载具和飞船工作流:针对空气动力学和结构完整性的具体指南。
- 机械组(Technic)与机械结构:构建功能性机械结构的说明。
- 模块化组织:通过子模型管理大型复杂模型的工作流。
- 视觉设计:改善形状、颜色和细节的指南。
技术工具
- 语义搜索:系统使用
jev-rerank(由 TypeSafe 的 Jev System One 提供支持)来帮助智能体查找合适的乐高零件和示例模型。如果无法使用 TypeSafe API 密钥,系统将回退到全文搜索(FTS)。 - 验证:用于碰撞和间隙检测的工具,确保零件放置正确且在物理上可构建。
- 渲染:无头渲染(Headless rendering)允许智能体“查看”其进度并进行视觉检查。
部署与技术要求
该系统作为容器化 Web 应用程序部署。安装需要克隆两个同级仓库——ldraw-nova 和 ldraw-nova-docker——并保持相同的版本标签(例如 v0.6.0)。
- 基础设施:需要 Git 和 Docker。
- 访问:该应用程序提供用于 Meta Quest 3 VR 交互的 HTTPS 端口(8443)和用于标准浏览器访问的普通 HTTP 端口(8765)。
- 输出格式:最终输出包括 LDraw 源代码、可在 Blender 中编辑的 glTF 文件(
.glb)以及完整的智能体思维过程/聊天记录。
当前局限性与未来工作
作为首个版本,作者指出了几个需要改进的领域:
- 模型效率:生成过程目前缓慢且昂贵,对于复杂结果,需要 GPT-6 Astra 或 Claude Opus 5.5 等高端模型。
- 领域差距:人仔(人类/动物)和复杂飞船的生成效果仍然不理想。
- VR 性能:Meta Quest 3 的集成目前存在性能和模型处理方面的问题。
- 低端模型支持:需要调整工具和文档,以允许较小的模型(例如 Claude Haiku)生成可行的模型。
社区观点
围绕该项目的讨论突显了智能体 CAD 设计的更广泛潜力。一位用户指出,在使用类似的 FreeCAD 和 Claude 工作流制作 3D 打印外壳和铣削铝制适配器方面取得了成功,并指出 AI 面临的主要挑战仍然是理解零件的物理装配顺序。
其他贡献者建议扩展该项目,包括用于机器人技术的物理建模,或者创建能够从照片中编目现有实体乐高收藏的工具,以限制 AI 的零件选择。
Sources
相关
- Dispatch
- 项目
- Dispatch
- 项目
- Dispatch