dangeng/visual_anagrams
Code for the paper "Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion Models"
What it solves
このプロジェクトは「ビジュアル・アナグラム」を作成します。これは、通常に見るとあるものに見えるが、操作(回転、色の反転、ジグソーパズル的な再配置、またはピクセルの置換)を加えると、別のアイデンティティや外観に変化する画像です。
How it works
このシステムは、錯覚画像において通常発生するアーティファクトを避けるため、潜在拡散モデル(latent diffusion model)ではなく、ピクセルベースの拡散モデル(DeepFloyd IF)を使用しています。異なる「ビュー」(変換)にわたって、複数のプロンプトを同時に満たす画像を生成します。例えば、元の状態では雪山の村のように見え、90度回転させると馬のように見える画像を生成できます。
Who it’s for
生成AIと錯覚画像に関心があり、複雑で多視角な視覚的パズルを制作したいアーティスト、研究者、クリエイターです。
Highlights
- Multi-View Support: 回転、反転、ジグソー、内円回転、色の反転、歪みなど、幅広い変換をサポートしています。
- High Resolution: 多段階アップスケーリングプロセスを使用して、最大 1024x1024 の画像を生成できます。
- Customizable: ベースクラスを継承したり、ピクセル置換配列を使用したりすることで、ユーザー独自のカスタムビューを定義できます。
- Animation Tools: 元の画像と変換後の状態の間の遷移をアニメーション化するスクリプトが含まれています。