dangeng/visual_anagrams

Code for the paper "Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion Models"

What it solves

이 프로젝트는 "시각적 아나그램(visual anagrams)"을 생성합니다. 즉, 정상적으로 볼 때는 한 가지 모습으로 보이지만, 조작(회전, 색상 반전, 퍼즐 재배열 또는 픽셀 치환)을 거치면 다른 정체성이나 외형으로 변하는 이미지입니다.

How it works

이 시스템은 착시 현상에서 흔히 발생하는 아티팩트를 피하기 위해 잠재 확산 모델(latent diffusion model) 대신 픽셀 기반 확산 모델(DeepFloyd IF)을を使用합니다. 다양한 "뷰(view)"(변환)에 걸쳐 여러 프롬프트를 동시에 충족하는 이미지를 생성합니다. 예를 들어, 원래 상태에서는 눈 덮인 산 마을처럼 보이고, 90도 회전하면 말처럼 보이는 이미지를 생성할 수 있습니다.

Who it’s for

생성형 AI와 착시 현상에 관심이 있으며, 복잡한 다중 뷰 시각적 퍼즐을 제작하고자 하는 예술가, 연구자 및 크리에이터입니다.

Highlights

  • Multi-View Support: 회전, 뒤집기, 퍼즐 재배열, 내부 원형 회전, 색상 반전 및 왜곡을 포함한 다양한 변환을 지원합니다.
  • High Resolution: 다단계 업스케일링 프로세스를 사용하여 최대 1024x1024 해상도의 이미지를 생성할 수 있습니다.
  • Customizable: 기본 클래스를 상속받거나 픽셀 치환 배열을 사용하여 사용자 정의 뷰를 정의할 수 있습니다.
  • Animation Tools: 원본 이미지와 변환된 상태 사이의 전환을 애니메이션으로 만드는 스크립트가 포함되어 있습니다.