dangeng/visual_anagrams

Code for the paper "Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion Models"

What it solves

该项目创建“视觉字母换位字”(visual anagrams)——即在正常观看时呈现一种形象,,但在经过操作(如旋转、颜色反转、拼图式重新排列或像素置换)后,会转变为不同的身份或外观。

How it works

该系统使用基于像素的扩散模型(DeepFloyd IF)而非潜在扩散模型(latent diffusion model)来避免在错觉图中通常会发生的伪影(artifacts)。它能同时在不同的“视角”(变换)下满足多个提示词(prompts)。例如,它可以创建一个看起来在原始状态下是雪山村庄,而在旋转 90 度后看起来像马的图像。

Who it’s for

对生成式 AI 和错觉图感兴趣,并希望制作复杂、多视角视觉谜题的艺术家、研究人员和创作者。

Highlights

  • Multi-View Support: 支持多种变换,包括旋转、翻转、拼图式排列、内圈旋转、颜色反转和倾斜。
  • High Resolution: 能够使用多阶段放大过程生成高达 1024x1024 的图像。
  • Customizable: 允许用户通过继承基类或使用像素置换数组来定义自己的自定义视角。
  • Animation Tools: 包含一个用于动画化原始图像与其变换状态之间转换过程的脚本。