dangeng/visual_anagrams
Code for the paper "Visual Anagrams: Generating Multi-View Optical Illusions with Diffusion Models"
What it solves
這項專案旨在創建「視覺字母換位字」(visual anagrams)——即在正常觀看時呈現一種形象,但在經過操作(如旋轉、顏色反轉、拼圖式重新排列或像素置換)後,會轉變為不同的身份或外觀的圖像。
How it works
該系統使用基於像素的擴散模型(DeepFloyd IF)而非潛在擴散模型(latent diffusion model),以避免在錯覺圖中常見的偽影(artifacts)。它能同時在不同的「視角」(變換)中滿足多個提示詞(prompts)。例如,它可以創建一張在原始狀態下看起來像雪山村莊,而在旋轉 90 度後看起來像馬的圖像。
Who it’s for
對生成式 AI 和錯覺圖感興趣,並希望製作複雜、多視角視覺謎題的藝術家、研究人員和創作者。
Highlights
- Multi-View Support: 支持多種變換,包括旋轉、翻轉、拼圖式排列、內圈旋轉、顏色反轉和傾斜。
- High Resolution: 使用多階段放大程序,能夠生成高達 1024x1024 的圖像。
- Customizable: 允許用戶通過繼承基類或使用像素置換數組來定義自己的自定義視角。
- Animation Tools: 包含一個用於動畫化原始圖像與其變換狀態之間轉換過程的腳本。"},