dangeng/visual_anagrams

Code for the paper "Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion Models"

What it solves

このプロジェクトは「ビジュアル・アナグラム」を作成します。これは、通常に見るとあるものに見えるが、操作(回転、色の反転、ジグソーパズル的な再配置、またはピクセルの置換)を加えると、別のアイデンティティや外観に変化する画像です。

How it works

このシステムは、錯覚画像において通常発生するアーティファクトを避けるため、潜在拡散モデル(latent diffusion model)ではなく、ピクセルベースの拡散モデル(DeepFloyd IF)を使用しています。異なる「ビュー」(変換)にわたって、複数のプロンプトを同時に満たす画像を生成します。例えば、元の状態では雪山の村のように見え、90度回転させると馬のように見える画像を生成できます。

Who it’s for

生成AIと錯覚画像に関心があり、複雑で多視角な視覚的パズルを制作したいアーティスト、研究者、クリエイターです。

Highlights

  • Multi-View Support: 回転、反転、ジグソー、内円回転、色の反転、歪みなど、幅広い変換をサポートしています。
  • High Resolution: 多段階アップスケーリングプロセスを使用して、最大 1024x1024 の画像を生成できます。
  • Customizable: ベースクラスを継承したり、ピクセル置換配列を使用したりすることで、ユーザー独自のカスタムビューを定義できます。
  • Animation Tools: 元の画像と変換後の状態の間の遷移をアニメーション化するスクリプトが含まれています。