FLUX 3 릴리스: 시각 인텔리전스를 위한 다중모달 흐름 모델
FLUX 3 릴리스: 시각 인텔리전스를 위한 다중모달 흐름 모델
FLUX 3은 고립된 모달리티 학습을 넘어서는 다중모달 기반 모델입니다. 이미지, 비디오, 오디오를 함께 학습함으로써 모델은 물리적 현실에 대한 통합된 표현을 개발합니다—공간 구조, 시간적 역학, 그리고 음향 인과 관계를 포착하여 다양한 미디어 유형에 걸쳐 보다 정확한 예측 및 생성이 가능하도록 합니다.
통합 다중모달 아키텍처
FLUX 3은 Self-Flow 접근법을 기반으로 구축되었으며, 이는 단일 아키텍처 내에서 다중모달 생성과 이해를 정렬합니다. 기존의 흐름 매칭(FM)과 달리 Self-Flow는 모델이 이러한 모달리티를 보다 효율적으로 정렬하도록 합니다. Black Forest Labs에 따르면, 이 아키텍처는 모델이 "소리는 충격과 일치해야 하고, 움직임은 질량을 따라야 하며, [그리고] 미래는 과거로부터 이어져야 한다"는 것을 이해하도록 합니다.
주요 기능
비디오 및 오디오 생성
FLUX 3은 최대 20초 길이의 네이티브 오디오가 포함된 고다양성 비디오를 생성할 수 있습니다. 주요 기능은 다음과 같습니다:
- Text-to-Video: 순수 텍스트 프롬프트로부터 클립을 생성합니다.
- Image-to-Video: 시작 프레임을 애니메이션화하거나 이미지를 시각적 레퍼런스로 사용합니다.
- Video-to-Video: 소스 비디오의 중심 요소(예: 캐릭터)를 새로운 컨텍스트로 옮깁니다.
- Generative Continuation: 기존 비디오 및 오디오 시퀀스를 확장합니다.
- Keyframe-to-Video: 정의된 순간들 사이에 제어된 전환을 생성합니다.
- Multilingual Dialogue: 여러 언어로 된 음성 대화를 생성합니다.
- Agentic Chaining: 개별 클립을 연결하여 더 길고 다중 샷 시퀀스를 만듭니다.
이미지 합성 및 편집
FLUX 3 Image는 복잡한 프롬프트 처리와 다양한 스타일 및 해상도에서 다중 언어로 고정밀 텍스트 렌더링을 향상시켜 이전 FLUX 버전보다 개선되었습니다.
행동 예측 및 물리 AI
모델의 세계 이해는 두 가지 방법을 통해 행동 예측에 적용됩니다: FLUX 3 백본에 행동 예측을 원시적으로 통합하는 방법과 사전 학습된 비디오 백본을 특수 행동 모델의 기반으로 사용하는 방법입니다. mimic robotics와의 파트너십을 통해 FLUX-mimic이 탄생했으며, 이는 생산 환경에서 정교한 조작에 특화된 비디오-행동 모델로 현재 Audi에서 테스트 중입니다.
성능 평가
예비 평가에 따르면 FLUX 3 Video는 직접 비교에서 여러 경쟁 모델보다 선호됩니다. 선호도 비율은 다음과 같습니다:
| 모델 | 선호도 |
|---|---|
| Luma Ray 3.2 | 93% |
| Runway Gen-4.5 | 77% |
| Grok Imagine Video | 69% |
| Kling v3 Pro | 60% |
| Happy Horse v1 | 59% |
| Happy Horse 1.1 | 57% |
| Seedance 2.0 | 52% |
| Gemini Omni Flash | 52% |
출시 계획 및 접근
Black Forest Labs는 초기 접근 단계에서 다음 기능들을 출시할 예정입니다:
- FLUX 3 Video: API와 프라이빗 가중치 접근을 통한 비디오 및 오디오 생성/편집.
- FLUX 3 Action: 연구 및 상업 파트너(예: mimic robotics)를 통한 행동 예측.
- FLUX 3 Image: API와 프라이빗 가중치 접근을 통한 이미지 합성 및 편집.
- FLUX 3 Dev: 콘텐츠 제작 및 행동 예측을 위한 다중모달 백본에 대한 오픈 가중치 접근.
커뮤니티 관점
공식 발표가 세계 모델 기능을 강조하는 반면, Hacker News에서의 커뮤니티 반응은 엇갈렸습니다. 일부 사용자는 다가오는 오픈 가중치 "Dev" 버전에 대해 기대감을 표했으며, 다른 이들은 발표에서 사용된 용어에 회의적이었습니다.
"오픈 가중치 버전이 최신 최고 성능(SOTA)이 되길 바랍니다. ... 정말 Flux 3도 비교 가능한 업데이트된 오픈 가중치 모델을 갖길 바랍니다."
비평가들은 초기 쇼케이스에서 인간 예시가 부족하다고 지적하고, "World Model"이라는 용어 사용에 의문을 제기하며, 발표 문구가 "LLM 슬롭 라이터"처럼 느껴진다고 주장했습니다.
"사람 예시가 거의 없었습니다. - World Model이라는 용어의 경솔한 사용. - 20초 비디오를 주장하지만 실제로는 점프컷만 보여줍니다."
다른 사용자들은 이 모델이 유럽 AI 개발에 큰 도약이 될 가능성을 언급했으며, 한 사용자는 "유럽에서 나온 최초의 AI가 큰 기대를 줍니다"라고 말했습니다.
Sources
- HNFlux 3