Anti-AI 字體:為何混淆手段無效且有害

Anti-AI 字體對現代 AI 而言根本無效

Anti-AI 字體——例如 Decoy、Shield 和 Ghost 字體——試圖透過混淆或擾亂文字來防止 AI 爬蟲。這些努力在很大程度上是徒勞的,因為如果人類可以視覺化地解析資訊,多模態 AI 模型最終也能被訓練來做到同樣的事。

每一種新的混淆技術實際上都成為了 AI 公司的基準測試,挑戰他們開發繞過障礙的解決方案。一旦某種方法被廣泛使用,AI 公司破解它的優先級就會提高,使該技術變得過時。此外,AI 系統已經展示了辨識難以辨認的人類手寫字的能力,這表明視覺擾亂對於前沿模型來說是一個很低的門檻。

混淆手段會造成嚴重的無障礙障礙

實施擾亂字體會為螢幕閱讀器和其他無障礙工具帶來即時問題。當文字在視覺上被混淆時,這些工具解析的底層數據通常也是混亂的,從而切斷了視覺障礙用戶的存取權限。

雖然有些專案,例如 ShieldFont,試圖透過使用 aria-hidden="true" 並要求進行高運算量的 JavaScript 謎題來為螢幕閱讀器揭示真實文字,但這引入了新的風險:

  • 中央化驗證: 解決選擇性授予身障人士元數據存取權的問題,可能會導致透過中央化身份驗證系統來過濾內容。
  • 用戶摩擦: 要求用戶解謎或等待處理會為創作者試圖保護的人群帶來退化的體驗。

「封閉式」網路的風險

參與混淆手段的「貓捉老鼠」遊戲,存在將開放式網路轉變為碎片化、運算成本高昂的環境之風險。如果廣泛的混淆手段成為常態,可能的結果是實施複雜的版權保護系統、付費牆和門檻機制來阻擋內容存取。

這種轉變會使網路偏離其自由且開放獲取資訊的初衷,並可能使那些希望審查網路的人受益,而非那些尋求保護知識產權的人。

反對觀點與替代視角

儘管對於這些字體的徒勞性已有普遍共識,但一些開發者和法律專業人士認為混淆手段仍具價值:

增加爬蟲成本

有些論點認為,雖然混淆不是加密,但它提高了爬蟲的「稅收」。透過迫使 AI 公司啟動無頭瀏覽器(例如 Chrome)來對截圖進行 OCR,或花費 LLM 額度來逆向工程一個頁面,爬蟲的成本對於某些參與者來說可能會變得極其昂貴。

法律與專業用途

在法律情境中,分發帶有機器可讀圖例的混淆版文件,可能會提供一層緩解措施。有一種提議的方法涉及使用即時渲染並向某些前沿 LLM 回報錯誤或虛假的 Unicode 映射,以避開偵測。

「貓捉老鼠」產業

這與網絡安全和反作弊產業進行了類比,在這些產業中,永遠找不到永久的解決方案,但會出現一個具競爭力的、以服務為基礎的產業來管理攻擊者與防禦者之間的持續鬥爭。

"如果一種有效的混淆方法以某種方式獲得了廣泛使用,那麼破解它的優先級將會變得更高,最終使其變得毫無用處。"

最終,對於內容創作者而言,基準情境是:任何公開可用的資訊都將不可避免地成為任何擁有網路存取權限的系統所能獲取的資訊,這使得技術性混淆成為一種暫時且通常適得其反的措施。

Sources

相關