Smart TVs 與 AI 爬蟲經濟:消費性裝置如何成為住宅代理伺服器
消費性裝置正被用作 AI 爬蟲的住宅代理伺服器
智慧電視與行動應用程式正被重新利用為全球「AI 爬蟲經濟」中的節點,其中消費性硬體充當住宅代理伺服器,以協助數據收集公司規避機器人偵測。透過將爬蟲流量路由至合法的家用 IP 地址,公司可以規避網站用來封鎖已知數據中心 IP 範圍的安全措施。
Bright Data SDK 的技術實作
研究指出,某些裝置與應用程式整合了特定的 SDK(與 Bright Data,前身為 Luminati Networks 有關)以促進這種代理行為。其技術機制運作如下:
WebSocket 通訊與 C&C
在獲取配置後,該 SDK 會開啟一個持久的 WebSocket 連線至 wss://proxyjs.brdtnet.com:443。此連線將裝置連結至指令與控制 (C&C) 伺服器,隨後該伺服器可指示裝置代表第三方下載公開的網路數據。
透過介面釘選 (Interface Pinning) 規避 VPN
在 iOS 上,該 SDK 採用一種技術來確保流量不會被使用者配置的 VPN 攔截或封鎖。SDK 配置中包含一個旗標 "use_netifs": true,這會強制 NWConnection 使用特定的網路介面——通常是 en0 (WiFi) 或 pdp_ip0 (行動網路)—而非系統的預設路由。這使得代理流量可以規避大多數 VPN 使用的 tun0 介面,確保爬蟲流量能以裝置實際的住宅 IP 地址到達目標網站。
基礎設施的諷刺性
儘管努力將爬蟲流量隱藏在住宅 IP 後面,代理基礎設施本身卻經常依賴與目標相同的雲端供應商。主機名稱 proxyjs.brdtnet.com 解析至 AWS Global Accelerator IP,這意味著爬蟲的控制平面與被爬取的網站通常都託管在 AWS 上。
安全與法律影響
將消費性裝置轉變為代理節點會為終端使用者帶來顯著風險,因為裝置的 IP 地址被用於使用者並未發起的流量。
歸因風險
由於裝置充當了外部行為者的閘道器,爬蟲進行的任何非法活動都會歸因於該家用 IP 地址。正如社群成員所指出的,這情況類似於運行 Tor 出口節點,使用者可能會因為第三方利用其電視作為代理而進行的活動(例如販運非法內容)而接受調查。
資源消耗與隱私
雖然公司將此描述為「使用免費資源」來「下載公開網路數據」,但其主要目標是規避數據提供者中那些明確封鎖了這些公司的「非預期屬性」。這會導致非預期的頻寬使用,並可能導致裝置被各種網路服務標記為機器人。
偵測與緩解措施
尋求保護家用網路免於成為爬蟲經濟中無意參與的節點的使用者,可以採用以下幾種策略:
- 網路層級封鎖: 使用防火牆或基於 DNS 的封鎖器(例如 AdGuard)可以減輕流量。部分使用者報告,智慧電視的大量請求已被全網路廣告封鎖器攔截。
- 實體隔離智慧功能 (Air-Gapping Smart Features): 最有效的防禦是完全避免將「智慧」裝置連接至網路,僅透過 HDMI 將其作為顯示裝置使用。
- 應用程式審核: 研究顯示,許多 iOS 應用程式可能包含 Bright Data SDK。工具如 AppGoblin 已被用於識別出約 60 個使用
brdsdk.framework的 iOS 應用程式。
社群觀點
這些做法的發現引發了關於住宅代理的倫理問題以及網路路由未來的辯論。
"產品的目的是讓你協助 Bright Data 規避『公開』數據提供者的非預期屬性,代表那些恰好有現金的人... 這絕對是令人不齒的。"
一些觀察者指出,這種趨勢可能會導致「封建網路架構 (feudal internetwork)」的出現,其中信任只能透過逐跳金鑰 (hop-by-hop keys) 與嚴格的身分驗證來維持,因為關於 IP 地址所有權與路由的基本假設正被積極地規避。