Flux 3 Image: AI 생성 예술을 위한 정밀한 픽셀 단위 제어
TL;DR
Flux 3 Image는 아티스트와 개발자에게 단일 프롬프트와 바운딩 박스 좌표 세트를 통해 생성된 이미지의 모든 요소를 픽셀 단위로 완벽하게 제어할 수 있는 기능을 제공하며, 고해상도 4K 출력과 정밀하고 비파괴적인 편집을 지원합니다.
Flux 3 Image란 무엇인가?
Flux 3 Image는 Black Forest Labs의 멀티모달 Flux 3 제품군(비디오, 오디오, 액션)의 이미지 생성 및 편집 구성 요소입니다. 이 모델은 0에서 1000까지의 그리드로 정의된 캔버스를 이해하며, 사용자가 지정한 바운딩 박스 내의 각 요소를 렌더링할 수 있습니다. 워크플로우는 다음과 같습니다:
- 종횡비 선택 (예: 2:3, 4K).
- 바운딩 박스 정의:
[y_min, x_min, y_max, x_max]와 각 요소에 대한 짧은 텍스트 설명을 사용합니다. - 전체 캡션 작성: 요소들을 하나로 묶어주는 전체 캡션을 작성합니다.
- 레이아웃 프롬프트 전송: API 또는 웹 Playground로 전송하면 Flux 3가 모든 박스를 준수하여 전체 장면을 렌더링합니다.
- 사후 편집: 개별 박스를 다시 설명하거나, 이동하거나, 교체하여 편집합니다. 나머지 요소는 변경되지 않습니다.
이 모델은 네이티브 4K(최대 16.8 MP)로 실행되며, 호스팅된 Playground, BFL API 또는 자체 호스팅 상용 가중치 라이선스를 통해 사용할 수 있습니다.
바운딩 박스 UI가 중요한 이유
“그들이 강조하는 것 중 하나는 이미지 내에서 원하는 위치에 특정 요소를 배치할 수 있는 UX입니다.” – @vunderba (HN 댓글)
기존의 확산 모델 도구들은 단일 텍스트 프롬프트에 의존하므로, 세밀한 구성을 위해서는 시행착오가 필요했습니다. Flux 3 Image의 선언적 레이아웃은 세 가지 문제점을 해결합니다:
- 결정론적 배치 – 돔, 군중, 텍스트가 나타나야 할 정확한 위치를 모델에 지시합니다.
- 반복적 편집 – 전체 캔버스를 다시 생성할 필요 없이 단일 박스만 변경(예: 잠수복 색상 변경)할 수 있습니다.
- 복잡한 장면의 간편한 구현 – 편집용 스프레드, UI 목업, 다중 캐릭터 일러스트레이션을 간결한 JSON 테이블로 구축할 수 있습니다.
이 접근 방식은 Ideogram V4의 JSON 레이아웃과 유사하지만, Flux 3 Image는 UI를 Playground에 직접 통합하여 마찰을 줄였습니다.
핵심 기능
| 기능 | 설명 |
|---|---|
| 픽셀 단위의 완벽한 구성 | 각 요소는 고정된 바운딩 박스 안에 존재하며, 하나를 편집할 때 다른 부분은 절대 변하지 않습니다. |
| 고해상도 출력 | 네이티브 4K 렌더링(5456 × 3072 px)으로 질감, 얼굴, 미세한 디테일을 보존합니다. |
| 정밀한 편집 | 이미지의 나머지 부분을 그대로 유지하면서 박스를 다시 설명하거나, 교체하거나, 색상을 변경할 수 있습니다. |
| 상용 가중치 라이선스 | 기업은 대규모 생성을 위해 모델을 자체 호스팅할 수 있습니다. |
| OpenRouter 할인 | OpenRouter 엔드포인트에서 50% 프로모션 할인을 받을 수 있습니다(참조: @minimaxir). |
| 멀티모달 호환성 | 더 넓은 Flux 3 제품군(비디오, 오디오, 액션)의 일부입니다. |
예시 워크플로우: "Le Festival du Soleil"
공식 데모는 6개의 박스를 사용하여 장면을 구성합니다:
[
{"id":"Fr_Text_1","bbox":[10,200,170,800],"desc":"\"LE FESTIVAL DU SOLEIL\" written in a thin, elegant, serif typeface in a light cream color"},
{"id":"town_1","bbox":[280,700,420,1000],"desc":"faint lights and small buildings of a coastal town at the foot of the hills"},
{"id":"dome_1","bbox":[250,150,650,850],"desc":"a massive, smooth parabolic dome of pale concrete"},
{"id":"swimmers_1","bbox":[580,200,720,800],"desc":"dozens of small, silhouetted figures scattered in the dark water, wading"},
{"id":"crowd_1","bbox":[740,0,1000,1000],"desc":"a large crowd of people seated on the beach in casual, light‑colored summer attire"}
]
전체 캡션은 다음과 같습니다:
*"A glowing concrete dome rises from a twilight bay, a crowd on the beach before it."
Flux 3 Image는 각 요소를 박스가 지시하는 정확한 위치에 배치하여, 선명한 텍스트, 건축물, 실루엣이 포함된 일관된 야간 축제 일러스트를 생성합니다.
렌더링된 이미지 편집
픽셀 단위의 완벽한 색상 변경 예시
원본: 흰색 보드 위에 검은색 잠수복을 입은 서퍼. 편집: 바다 파도와 하늘은 그대로 둔 채 잠수복과 보드를 밝은 빨간색으로 변경.
{
"id":"surfer_wetsuit",
"bbox":[…],
"desc":"A bright red neoprene wetsuit, same fit and highlights"
},
{
"id":"surfboard",
"bbox":[…],
"desc":"A bright red surfboard, same shape and reflection"
}
해당 두 박스만 모델로 전송되며, 나머지 캔버스(파도, 하늘)는 이전과 정확히 동일하게 유지됩니다.
커뮤니티 피드백 (HN 댓글)
- UX 칭찬 – @arnaudsm은 채팅 기반 도구들이 종종 투박하게 느껴지는 것과 달리 “놀랍고 매우 조종하기 쉬운” 인터페이스를 강조했습니다.
- 오픈 가중치 요구 – 여러 사용자(@vergessenmir, @Grimblewald 등)는 Black Forest Labs가 이전 Flux 버전에서 그랬던 것처럼 모델 가중치가 공개되기를 기대하고 있습니다.
- 사용 사례의 다양성 – @soundworlds는 스크린샷의 UI 요소를 성공적으로 교체했다고 보고했으며, @armcat은 게임용 스프라이트 시트 생성에 대해 질문했습니다.
- 한계점 – @pks016과 @Zufriedenheit는 가끔 발생하는 오류(예: 편집 후 텍스트 왜곡)와 작은 텍스트 영역을 더 잘 처리해야 할 필요성을 언급했습니다.
시작하기
- Playground – Precise Editing Playground를 방문하세요: https://flux-tools.bfl.ai/precise-editing.
- API – BFL API를 사용하거나(문서: https://docs.bfl.ai/flux_3/flux3_image_overview), 할인된 OpenRouter 엔드포인트를 사용하세요.
- 상용 라이선스 – 자체 호스팅 배포를 위해 영업팀에 문의하세요: https://bfl.ai/contact?interest=flux-license.
자주 묻는 질문
FLUX 3 Image란 무엇인가요?
레이아웃 인식 프롬프트를 지원하는 Flux 3 멀티모달 제품군의 이미지 생성 및 편집 브랜치입니다.
바운딩 박스는 어떻게 작동하나요?
0-1000 그리드에 사각형을 그리고 짧은 설명을 제공하면, 모델이 설명과 일치하는 콘텐츠로 박스를 채웁니다.
모든 박스를 수동으로 작성해야 하나요?
아니요. LLM이 한 줄의 프롬프트에서 전체 요소 테이블을 생성할 수 있으며, 그 후 원하는 대로 박스를 조정할 수 있습니다.
기존 이미지를 편집할 수 있나요?
네. 개별 박스를 다시 설명하거나, 이동하거나, 교체할 수 있습니다. 건드리지 않은 박스는 변경되지 않습니다.
결론
Flux 3 Image는 자유 형식의 확산 모델과 결정론적 그래픽 디자인 사이의 간극을 메워줍니다. 사용자가 모든 픽셀 그룹의 정확한 위치와 의미를 선언할 수 있게 함으로써, 신뢰할 수 있는 구성, 빠른 반복, 고해상도 출력을 가능하게 합니다. 이는 많은 창작자들이 기존의 텍스트-이미지 변환 도구에서 아쉬워했던 기능들입니다.
Sources
관련
- Dispatch
- 프로젝트
- Dispatch
- 프로젝트
- Dispatch