TheNumbers.com 停機事件:AI 爬蟲與開放網路的脆弱性
TheNumbers.com 停機事件:AI 爬蟲與開放網路的脆弱性
最近 TheNumbers.com 的不穩定與部分數據移除,為開放網路的脆弱性提供了一個關鍵的案例研究。該網站面臨的困境說明了一個更廣泛的系統性問題:隨著 AI agents 和惡意行為者為了經濟利益而利用免費的公開數據資源,這些資源正變得難以持續維護,通常導致維護者必須獨自承擔基礎設施成本。
AI 爬蟲與基礎設施成本
AI 爬蟲正在為小規模網站維護者造成難以持續的財務負擔。與傳統的搜尋引擎爬蟲不同,某些 AI agents 會翻遍搜尋端點的每一個可能面向進行分頁,以下載原始 HTML,這導致網路入站與出站成本大幅增加。
一位貢獻者分享了經營一個追蹤美國政府 COVID-19 補助網站的類似經驗。儘管該網站提供了一個 10 GB 的免費非壓縮數據集供直接下載,但 AI 爬蟲卻忽略了這種高效路徑,轉而下載了數 TB 的原始 HTML。這導致每月的網路帳單高達約 1,000 美元,迫使該網站在總共僅獲得 2,000 美元捐款的情況下被迫關閉。
AI 與預測市場的交集
除了單純的基礎設施成本外,TheNumbers.com 的案例還暗示了涉及財務激勵的更深層安全風險。有推測認為,該網站的停機以及隨後帶著減少的數據回歸,可能是為了應對惡意用戶試圖在數據正式發布前獲取特權存取權的行為。
在預測市場的背景下,提前獲取 TheNumbers 的數據具有顯著的競爭優勢。正如一位觀察者所言:
如果你每週都能比其他人更早看到 The Numbers 的數據,你將比所有其他交易者都擁有顯著優勢——在發布前稍微提前得知答案,將使你能夠進行交易套利(front-run)。
這為駭客攻擊和「提煉攻擊」(distillation attacks)創造了一個高激勵環境,其目標不僅僅是爬取公開數據,而是為了在投注市場中獲得時間優勢而滲透系統。
技術緩解策略
為了對抗 AI 機器人和惡意爬蟲的襲擊,社群提出了幾種技術策略:
流量管理與機器人阻擋
- CDN 實作: 利用具備機器人識別能力的 CDN 或像 Cloudflare 這樣的服務,作為阻擋機器人流量的權宜之計。
- Robots.txt 配置: 為已知的 AI 爬蟲實作特定的禁止(disallow)規則。常見目標包括
GPTBot(OpenAI)、ClaudeBot(Anthropic) 和Google-Extended(Google AI 訓練)。 - 靜態網站生成: 使用靜態網站生成器重寫網站的公開面向部分,以減少伺服器負載和成本。
經濟與安全強化
- 工作量證明 (PoW): 實作 PoW 挑戰,增加爬蟲端在計算上的成本。
- AI 驅動審計: 使用 AI 工具審計現有代碼中的安全漏洞,並強化伺服器以抵禦漏洞攻擊。
- 數據分發: 提供壓縮後的存檔(例如.zip 或.tar.gz)作為數據形式,以阻礙低效的 HTML 爬取,儘管有人認為維護者對於免費資源沒有這種義務。
開放網路的未來
AI 實驗室與獨立數據提供者之間的衝突正導致資訊發布方式的轉變。創作者中有一種日益增長的觀感,認為「免費網路」已不再可行,因為獨特內容被 AI 公司爬取並變現,卻沒有將流量或收入回饋給來源。
這一趨勢預示著可能會向通用付費牆和授權協議轉移。如果 AI 公司繼續透過使原始來源變得難以持續運作來破壞開放網路,他們最終可能會被迫策劃自己的知識來源,就像 Amazon 管理實體商店或 Netflix 製作自己的內容一樣。