Antigravity 2.0와 AI 기반 파라메트릭 디자인의 현주소

대규모 언어 모델(LLMs)과 컴퓨터 보조 설계(CAD)의 교차점은 자연어 의도와 정밀한 기하학적 실행 사이의 간극을 메우려는 이들에게 오랫동안 개척지로 여겨져 왔습니다. 스크립트 기반 3D 모델러인 OpenSCAD를 사용한 건축물 재구성 작업에 초점을 맞춘 최근의 벤치마크에서, Antigravity 2.0은 특히 판테온(Pantheon)을 재구성하는 능력에서 리더보드 최상위를 차지했습니다.

벤치마크 결과가 자율 에이전트의 능력 향상을 시사하고 있음에도 불구하고, 개발자 커뮤니티의 반응은 인상적인 "one-shot" 시연과 생산 단계의 엔지니어링이 직면한 가혹한 현실 사이의 복잡한 긴장감을 드러내고 있습니다.

판테온 벤치마크: 건축적 충실도의 테스트

벤치마크의 핵심은 LLM이 판테온을 재현하기 위한 OpenSCAD 코드를 생성하도록 도전하는 것이었습니다. 보고서에 따르면, Antigravity 2.0은 단순히 외형뿐만 아니라, 오큘러스(oculus)를 통해 보이는 특징적인 내부 천장 패턴—반복되는 사각형 코퍼(coffers)—까지 구현함으로써 차별화되었습니다.

이러한 수준의 디테일은 에이전트가 복잡한 공간적 요구 사항을 파라메트릭 코드로 합성할 수 있는 능력을 보여준다는 점에서 매우 중요합니다. 그러나 이러한 성공은 벤치마크 자체의 본질에 대한 논쟁을 불러일으켰습니다. 일부 관찰자들은 판테온이 역사상 가장 많이 기록된 건물 중 하나이기 때문에, 모델이 제공된 참조 이미지로부터의 진정한 시각적 추론보다는 학습 데이터나 외부 검색에 의존했을 가능성이 있다고 주장합니다.

"내부 돔 패턴은 두 사진 모두에서 보이지 않습니다. 따라서 모델은 사진과 이름을 보고, 검색이나 학습 데이터를 통해 내부에 패턴이 있어야 한다는 것을 알게 된 것입니다."

실용적 유용성 vs. 벤치마크 성능

이러한 주목받는 건축물 테스트를 넘어, 사용자들은 이 모델들이 실제 기능적 시나리오에서 어떻게 작동하는지에 대해 매우 다양한 결과를 보고하고 있습니다. 어떤 이들에게는 유용성이 이미 혁신적입니다. 한 사용자는 사진과 디지털 캘리퍼스 측정값을 제공하여 Claude를 사용해 교체용 자전거 케이블 라우팅 그로밋(grommet)을 설계했는데, 첫 번째 시도에서 거의 완벽한 TPU 프린트 결과물을 얻었다고 전했습니다.

다른 사용자들은 LLM을 Model Context Protocol (MCP) 서버와 결합하는 힘을 강조합니다. 예를 들어, Claude를 사용하여 PSU 스펙 시트를 처리하고 정밀한 나사 구멍과 장착 그릴이 있는 출력 가능한 인클로저(enclosure)를 반복적으로 구축하는 것은 "생성형 예술"에서 "기능적 엔지니어링"으로의 전환을 의미합니다.

하지만 이러한 성공은 상당한 장애물로 인해 상쇄됩니다:

  • 공차와 제약 조건: 사용자들은 LLM이 여전히 정밀 공차(예: snap-fits)와 특정 모드(예: vase mode)에서 물리적으로 출력이 불가능한 기능을 설계하는 문제로 어려움을 겪고 있다고 지적합니다.
  • **Iteration Loops: 3D 모델을 "디버깅"하는 것은 어렵다는 것이 공통된 불만 사항입니다. LLM이 결과물인 메쉬(mesh)를 실시간으로 높은 충실도로 "볼" 수 없기 때문에, 부품을 정교화하는 반복 과정이 시행착오의 좌절스러운 루프가 될 수 있습니다.
  • "Jagged" 성능 프로필: 일부 개발자들은 모델의 성능이 매우 불일치하다는 점을 관찰했습니다. 즉, 한 종류의 3D 객체는 탁월하게 수행하는 반면, 다른 종류는 처참하게 실패하는 양상을 보합니다.

"Vibe Coding" 논란

벤치마크에서의 승리에도 불구하고, 주어진 도구 자체의 전달 방식에 대해서는 명백한한 불만족이 존재합니다. Antigravity 2.0은 기반 모델은 강력하지만, 소비자 경험 측면에서 비판을 받고 있습니다. 깨진 TUI (Terminal User Interfaces), 공격적인 사용량 제한, 그리고 배포 버그로 인해 일부에서는 "vibe coding"—즉, 엄격한 소프트웨어 엔지니어링보다는 일반적인 능력의 느낌에 의존하여 개발을 진행하는 방식을—의 지속 가능성에 의문을 제기하고 있습니다.

"Google과 같은 거물조차 이렇게 실수를 한다면, 많은 것을 시사합니다... antiGravity2.0 업데이트에서 우리가 목격한 완전한 난장판은 'vibe coding'이 실제로 신뢰할 수 있는지에 대한 의문을 제기합니다."

AI in CAD의 미래

이 논의는 근본적인 질문을을 던집니다: 우리는 결국 창의적 글쓰기부터 기계적 엔지니어링까지 모든 것을 아 способность-할 수 있는 단일한 "god-model"을 갖게 될 것인가, 아니면 전문화된 CAD 중심의 LLM이 등장할 것인가?

범용용 모델이 진보하고 있지만, 커뮤니티는 AI가 전문적인 CAD 워크플로우를 진해할 혁신을 일으키기(and potentially threaten established giants like Autodesk)를 위해, 상징적인 건물을 재현하는 것을 넘어 기하학에 대한 더 강력한 "unit tests" 시스템으로 나아가야 한다고 제안합니다. 즉, 프로파일이 특정 경사도를 초과하지 않거나 교차점이 null인지 확인하는 방식입니다.

현재로서는, 성공적인 벤치마크 점수보다 더 중요한 것은 신뢰할 수 있는 엔지니어링 도구로의 전환입니다. 이는 단순히 리더보드 상위권에 오르는 것 이상의 것을 요구합니다. 정밀도, 신뢰성, 그리고 원활한 사용자 경험을에 대한 근본적인 전환이 필요합니다합니다.

Sources