FLUX 3 and FLUX-mimic: 물리적 AI를 위한 비디오-액션 모델 통합

FLUX 3 and FLUX-mimic: 물리적 AI를 위한 비디오-액션 모델 통합

FLUX-mimic은 비디오 생성을 활용하여 물리적 로봇을 구동한다

FLUX-mimic은 Black Forest Labs(BFL)가 mimic robotics와 협력하여 개발한 차세대 비디오-액션 모델이다. FLUX 3 멀티모달 기초 모델을 백본으로 활용하여 시각적 지능을 물리적 행동으로 변환함으로써, 로봇이 Audi의 실제 생산 환경과 같은 곳에서 복잡한 조작 작업을 수행할 수 있게 한다.

FLUX-mimic의 핵심 논리는 현실적인 비디오를 생성할 수 있는 모델은 접촉, 움직임, 무게, 인과 관계의 내부 표현인 "월드 모델"을 inherently 학습해야 한다는 것이다. 이 학습된 표현에서 행동을 디코딩함으로써, FLUX-mimic은 콘텐츠 생성 도구를 물리적 AI 시스템으로 변환한다.

FLUX 3 멀티모달 백본

FLUX 3은 이미지, 비디오, 오디오 전반에 걸쳐 공동으로 훈련되는 단일 모델이다. BFL에 따르면, 비디오 예측은 훈련에서 가장 computationally demanding한 부분으로, 총 컴퓨팅 비용의 95% 이상을 차지한다. 이러한 강도는 현실적인 비디오 생성이 물리적 세계가 어떻게 행동하는지를 정확하게 시뮬레이션하도록 모델을 요구하기 때문에 필요하다.

액션 예측 통합

BFL은 FLUX 3 커리큘럼에 액션 예측을 추가해도 생성 능력을 영구적으로 저하시키지 않는다는 것을 발견했다. 대규모 훈련 중에 텍스트-비디오 및 이미지-비디오에 대한 인간 평가가 처음에는 최대 10% 떨어졌지만, 3,500 단계 후에 모델은 완전한 품질을 회복했다. 이는 비디오 생성과 액션 예측이 용량을 경쟁하지 않고 단일 백본을 공유할 수 있음을 나타낸다.

표현 학습을 위한 Self-Flow

로봇 공학에 월드 모델을 사용하기 위해 BFL은 Self-Flow라는 프레임워크를 활용했다. 표준 생성 모델은 종종 다운스트림 작업에서의 유용성을 제한하는 "얽힌" 표현을 생성하지만, Self-Flow는 생성과 표현 학습을 통합한다. 이로 인해 상호 개선이 이루어지며: 모든 모달리티에서 생성 품질이 증가하고, 시뮬레이션에서 로봇 제어 작업의 성공률이 향상된다.

월드 모델에서 공장 배포까지

FLUX-mimic은 FLUX 3 백본을 범용 조작 작업에 적용한다. FLUX 백본의 비디오 예측 경로에서 추출된 중간 특징을 훈련한 경량 액션 디코더를 사용한다.

Audi에서의 실제 응용

Audi 생산 및 물류 운영에 배포된 FLUX-mimic은 기존 자동화로는 이전에 불가능했던 작업을 처리할 수 있음을 입증했는데, 다음을 포함한다:

  • 구조화된 트레이에 부품 키팅하기
  • 밀착된 픽스처에 전자 제어 유닛 삽입하기
  • 구성 요소 조립하기
  • 실리콘 및 케이블과 같은 부드럽고 유연한 재료 다루기

샘플 효율성과 견고성

세계의 물리 법칙이 이미 FLUX 3 표현에 내재되어 있기 때문에, 모델은 새로운 작업마다 세계가 어떻게 작동하는지를 가르칠 필요가 없다. 이로 인해 효율성이 크게 향상된다:

  • 데이터 요구량 감소: Self-Flow 실험에서, 액션 예측은 Self-Flow가 없는 모델에 비해 훈련 단계의 절반만으로 목표 성공률에 도달했다.
  • 샘플 효율성 증가: mimic-video 연구에 따르면, 비디오-액션 모델은 vision-language-action(VLA) 모델에 비해 최대 10배의 샘플 효율성을 달성한다.
  • 자율적 복구: 모델은 시연 세트에서 특정 실패 사례를 명시적으로 보여주지 않아도 내부 월드 모델에 의존하여 실패(예: 놓친 grasp 수정)에서 복구할 수 있다.

성능 및 지연 제약

공장 바닥에서 실행 가능하도록 하려면, 모델은 인간 시각 반응과 비슷한 반응 시간으로 작동해야 한다.

하드웨어 최적화

잘 구조화된 월드 모델을 사용함으로써 BFL은 더 작은 백본을 사용하여 높은 성능을 달성할 수 있으며,これにより 지연이 감소한다. FLUX-mimic 백본은 단일 NVIDIA RTX 5090 GPU에서 입력을 월드 표현으로 변환하는 데 80ms 미만이 소요된다.

시스템 전체 지연

mimic의 배포 스택을 통해—여기에는 액션 디코더 최적화 및 센서와 액추에이터 간 프로세스 간 지연 감소가 포함된다—총 시스템 반응 시간은 101ms이다.

커뮤니티 통찰

산업 관찰자 및 개발자들은 이 접근 방식의 함의를 지적했는데, 구체적으로 생성형 비디오 모델에서 월드 모델을 도출할 수 있는 능력을 언급했다.

"잘 훈련된 멀티모달 비디오 생성 모델은 내부에 월드 표현 모델을 훈련시킨다. 그들은 이 월드 모델을 추출하여 로봇에 배포하는 일부 작업을 수행했다... 비디오 모델 훈련, 비디오 생성 판매, 규모 확장, 규모를 활용하여 로봇 관련 것들을 훈련: 이익."

다른 관찰자들은 모델의 자율적 오류 해결 능력을 강조했는데, 구성 요소를 재좌석하기 위해 여러 번 시도할 수 있는 로봇의 능력은 로봇 해결 능력에서의 중요한 발전이라고 지적했다.

Sources