Bonsai Image 4B: 로컬 디바이스에 고품질 이미지 생성 기술을 가져오다

최첨단 생성형 AI를 로컬에서 실행하려는 꿈은 오랫동안 메모리라는 근본적인 하드웨어 제약에 가로막혀 왔습니다. 클라우드 API는 엄청난 성능을 제공하지만, 지연 시간, 반복적인 비용, 그리고 창의적인 작업의 반복적인 특성을 저해하는 개인정보 보호 문제를 야기합니다. 이를 해결하기 위해 PrismML은 고사양 노트북부터 스마트폰에 이르기까지 로컬 하드웨어에 특화되어 설계된 소형 이미지 생성 모델 제품군인 Bonsai Image 4B를 출시했습니다.

극한의 양자화 기술을 활용함으로써, Bonsai Image 4B는 이전에는 이 정도 파라미터 규모의 모델을 호스팅할 수 없었던 디바이스, 특히 iPhone에서 고품질 확산(diffusion) 추론을 실행할 수 있게 합니다.

Bonsai Image 4B의 엔지니어링 기술

Bonsai Image 4B는 FLUX.2 Klein 4B 아키텍처를 기반으로 구축되었습니다. 모델을 처음부터 다시 설계하는 대신, PrismML은 트랜스포머 가중치(transformer weights)가 어떻게 표현되는지에 집중했습니다. 확산 트랜스포머는 디노이징(denoising) 단계마다 반복적으로 호출되는 파이프라인에서 가장 계산 집약적인 부분입니다. 이 가중치들을 압축함으로써, 팀은 메모리 압박과 대역폭 요구 사항을 크게 줄였습니다.

Bonsai Image 4B는 두 가지 주요 변형으로 제공됩니다:

  • 1-bit Bonsai Image 4B: 이 버전은 FP16 그룹별 스케일링 인자를 사용하는 이진 {−1, +1} 트랜스포머 가중치를 사용하여, 가중치당 1.125 유효 비트를 생성합니다. 이 변형은 최대 압축 및 최소 배포 규모에 최적화되어 있습니다.
  • Ternary Bonsai Image 4B: 이 버전은 FP16 그룹별 스케일링 인자를 사용하는 {−1, 0, +1} 트랜스포머 가중치를 사용하여, 가중치당 1.71 유효 비트를 제공합니다. 0 상태의 추가는 더 큰 표현 유연성을 제공하며, 이는 더 높은 시각적 품질과 더 나은 프롬프트 충실도로 이어집니다.

메모리 점유율 비교

안정성을 유지하기 위해 정밀도에 민감한 투영 레이어(projection layers)의 소량(약 5%)은 FP16으로 유지됩니다. 그럼에도 불구하고, 전체 정밀도의 FLUX.2 Klein 4B와 비교하면 크기 감소 폭이 매우 큽니다:

Model Diffusion Transformer Reduction vs FP16
FLUX.2 Klein 4B 7.75 GB 1.0x
1-bit Bonsai Image 4B 0.93 GB 8.3x
Ternary Bonsai Image 4B 1.21 GB 6.4x

Apple Silicon에서 배포할 경우, 압축된 텍스트 인코더와 FP16 VAE를 포함한 총 페이로드(payload)는 1-bit 모델의 경우 3.42 GB, ternary 모델의 경우 3.88 GB이며, 이는 전체 정밀도 버전의 15.97 GB와 대조됩니다. 활성 런타임(512x512 이미지 생성) 시, 평균 활성 메모리 사용량은 1-bit 모델의 경우 1.5 GB, ternary 모델의 경우 1.96 GB로 떨어지며, 이는 기존 모델이 요구하는 11.74 GB에서 대폭 감소한 수치입니다.

성능 및 벤치마크

압축은 모델이 유용성을 유지할 때만 가치가 있습니다. PrismML은 GenEval(객체 구성), HPSv3(인간 선호도/미학), 그리고 DPG-Bench(의미론적 충실도)를 사용하여 모델을 모델을 평가했습니다.

Ternary Bonsai Image 4B는 품질 지향적 선택지로, 트랜스포머 점유율을 6.4배 줄이면서 FLUX.2 Klein 4B의 정확도를 95% 유지합니다. 1-bit 변형은 8.3배의 감소를 달성하면서 정확도의 88%를 유지합니다.

실제적인 관점에서, iPhone 17 Pro Max는 512x512 이미지를 9.4초 만에 생성할 수 있으며, Mac M4 Pro는 약 6초 만에 생성할 수 있습니다. 이는 기본 full-precision MFLUX 파이프라인보다 최대 5.6배 더 빠릅니다.

로컬 추론으로의 전환

PrismML은 이미지 생성은 품질의 문제만큼이나 배포의 문제라고 주장합니다. 사용자가 프롬프트를 끊임없이 수정하고 실패한 결과물을 버리는 AI 아트의 반복적인 특성상, 클라우드 기반의 왕복 과정은 비효율적이고 비용이 많이 듭니다.

로컬 추론은 생성을 더 저렴하고, 빠르고, 개인정보를 보호하며 이 경험을 변화시킵니다. 이는 AI를 원격 서비스에서 통합된 제품 기능으로 이동시킵니다. 이러한 변화는 로컬 AI를 값비싼 기업용 구독 서비스를 피하고 하드웨어에 대한 제어권을 되찾기 위한 방법으로 보는 커뮤니티 구성원들에 의해 뒷받침됩니다.

커뮤니티의 관점 및 비판

기술적 성취는 인상적이지만, 출시와 함께 개발자와 사용자들 사이에서 활발한 토론이 일겨났습니다:

Sources