arxhr007/Aliens_eye

Hunt down 840+ social media accounts using AI

Aliens Eye – AI‑OSINT 使用者名掃描器

是什麼 – 一個 Python 命令列工具,用於檢查指定使用者名稱是否存在於 840 個以上的社群媒體、論壇及其他公開平台。它結合輕量級邏輯回歸模型與一組手動設計的啟發式規則(HTTP 狀態、DOM 訊息、OpenGraph 標籤等),判斷帳號為 已找到可能未找到。掃描器支援非同步執行,可恢復中斷的任務,並可透過輕量級 MCP 伺服器向 LLM 代理提供結果。

為何重要 – 傳統的 OSINT 使用者名查詢依賴簡單的 HTTP 狀態檢查,會漏掉回傳通用頁面或使用 JavaScript 的網站。透過結合機器學習與 30 個工程化訊號,Aliens Eye 提高了準確率與召回率,並能將看似屬於同一人的帳號進行聚類(如頭像雜湊、簡介相似性、共享連結等)。

核心功能

  • 廣泛覆蓋 – 支援 840+ 個網站,每個網站由 sites.d/ 中的 JSON URL 模板定義。
  • 混合檢測 – 啟發式評分 + 內建邏輯回歸模型(執行時無重型依賴)。
  • 資料提取 – 透過 OpenGraph/JSON-LD 或網站特定 CSS 提取顯示名、簡介與頭像。
  • 跨站關聯 – 可選 --correlate 將可能屬於同一人的帳號分組。
  • 遞迴擴展 – 跟隨簡介中發現的使用者名稱(--recurse-depth)。
  • 域名可用性檢查 – 檢查 <username>.com.io 等域名是否已註冊。
  • 監控模式 – 定期重新掃描並支援 Webhook 通知。
  • 可恢復掃描 – 支援檢查點檔案(--resume)。
  • 豐富的終端 UI – 使用 rich 實現即時進度表;可選互動式 TUI 瀏覽器。
  • MCP 伺服器aliens_eye serve 可讓 LLM 代理查詢掃描器。
  • 支援代理/Tor、網站過濾、NSFW 排除,以及對 JavaScript 輕載頁面的 Playwright 備用方案。
  • 匯出格式 – 支援 JSON、CSV、HTML、Markdown、PDF,以及圖形檔案(GEXF、Mermaid、Maltego CSV)。

典型工作流程

# 快速檢查單一帳號
aliens_eye alice

# 帶關聯與域名檢查的全功能掃描
aliens_eye alice --correlate --domains --format all --output results

# 作為服務運行,供 LLM 驅動的工作流程使用
aliens_eye serve   # 然後從代理呼叫 MCP 端點

安裝pip install aliens-eye(支援 Playwright、訓練、PDF、TUI 或 MCP 的可選依賴)。也提供 Docker 鏡像。

檢測機制

  1. 從 HTTP 回應建構 30 維特徵向量(狀態桶、回應時間、重導向、DOM 線索、結構化資料標籤等)。
  2. 啟發式引擎對向量評分。
  3. 內建邏輯回歸模型投票;兩個分數融合為機率,映射到 已找到 / 可能 / 未找到
  4. 若模型檔案遺失,則僅使用啟發式規則。

重新訓練 – 使用者可收集標註資料集(aliens_eye train collect),擬合新模型(aliens_eye train fit),並透過 --model 提供。

使用場景

  • 開源情報調查(跨平台追蹤帳號)。
  • 品牌監控 – 檢測冒名頂替或域名搶注的帳號。
  • 安全評估 – 枚舉員工的公開足跡。
  • 透過 MCP 伺服器向 LLM 代理提供最新 OSINT 資料。

限制與注意事項

  • 準確性取決於網站模板與 ML 模型品質;誤報/漏報可透過 selfcheck 命令報告。
  • 快速掃描大量網站可能觸發速率限制或反爬蟲機制;工具包含可設定延遲,但無法保證完全符合各網站的使用條款。
  • 法律與倫理責任由使用者承擔;倉儲包含免責聲明,強調工具僅限合法研究用途。
  • ML 模型為簡單邏輯回歸,非深度學習檢測器,若未啟用 Playwright,對高度動態內容的網站可能表現不佳。

貢獻方式 – 將新網站定義新增至 src/aliens_eye/data/sites.json 或將 JSON 檔案放入 sites.d/。改進基準資料集、提交模型優化或新增匯出插件。測試使用 pytest;程式碼風格由 ruff 檢查。


以上所有資訊均直接來自倉儲的 README,未添加任何外部假設。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案