arxhr007/Aliens_eye
Hunt down 840+ social media accounts using AI
Aliens Eye – AI‑OSINT ユーザー名スキャナー
何であるか – 840以上のソーシャルメディア、フォーラム、その他の公開プラットフォームで指定されたユーザー名が存在するかを確認するPythonコマンドラインツール。軽量なロジスティック回帰モデルと手作業で設計されたヒューリスティック(HTTPステータス、DOMの手がかり、OpenGraphタグなど)を組み合わせて、プロファイルが「見つかった」「おそらく」「見つからなかった」のいずれかを判断する。スキャナーは非同期で実行可能で、中断されたジョブの再開も可能。また、小さなMCPサーバーを介してLLMエージェントに結果を提供できる。
なぜ重要か – 伝統的なOSINTユーザー名検索は単純なHTTPステータスチェックに依存しており、汎用ページを返すサイトやJavaScriptを使用するサイトを見逃す。30のエンジニアリングされた信号とMLを組み合わせることで、精度と再現率を向上させ、同一人物と思われるアカウントをクラスタリングできる(アバターのハッシュ、バイオの類似性、共有リンクなど)。
主な機能
- 広範なカバレッジ – 840以上のサイト。各サイトは
sites.d/内のJSON URLテンプレートで定義される。 - ハイブリッド検出 – ヒューリスティックスコアリング + 搭載済みのロジスティック回帰モデル(実行時の重い依存関係なし)。
- プロファイル抽出 – OpenGraph/JSON-LDまたはサイト固有のCSSを用いて表示名、バイオ、アバターを取得。
- クロスサイト相関 – オプションの
--correlateで、おそらく同一人物のプロファイルをグループ化。 - 再帰的拡張 – バイオに見つかったユーザー名をたどる(
--recurse-depth)。 - ドメイン利用可能チェック –
<username>.com,.ioなどのドメインが登録されているか確認。 - ウォッチモード – 定期的な再スキャンとWebhook通知。
- 再開可能スキャン – チェックポイントファイル(
--resume)。 - 豊富なターミナルUI – rich を使用したライブ進捗表。オプションでインタラクティブなTUIブラウザも利用可能。
- MCPサーバー –
aliens_eye serveでLLMエージェントがスキャナーに問い合わせ可能。 - プロキシ/Tor対応、サイトフィルタリング、NSFW除外、JavaScript重視ページ用のPlaywrightフォールバック。
- エクスポート形式 – JSON、CSV、HTML、Markdown、PDFに加え、グラフファイル(GEXF、Mermaid、Maltego CSV)もサポート。
通常のワークフロー
# 単一ハンドルの迅速チェック
aliens_eye alice
# 相関とドメインチェックを含むフル機能スキャン
aliens_eye alice --correlate --domains --format all --output results
# LLM駆動ワークフロー用のサービスとして実行
aliens_eye serve # その後、エージェントからMCPエンドポイントを呼び出す
インストール – pip install aliens-eye(Playwright、トレーニング、PDF、TUI、MCP用のエクストラ付き)。Dockerイメージも提供されている。
検出の仕組み
- HTTPレスポンスから30次元の特徴ベクトルを構築(ステータスバケット、タイミング、リダイレクト、DOMの手がかり、構造化データタグなど)。
- ヒューリスティックエンジンがベクトルにスコアを付与。
- 搭載済みのロジスティック回帰モデルが投票。2つのスコアをブレンドして「見つかった/おそらく/見つからなかった」にマッピングされる確率を算出。
- モデルファイルが存在しない場合、ヒューリスティックのみにフォールバック。
再トレーニング – ユーザーはラベル付きデータセットを収集(aliens_eye train collect)、新しいモデルを適合(aliens_eye train fit)、--model で指定可能。
利用例
- オープンソースインテリジェンス調査(ハンドルを複数プラットフォームで追跡)。
- ブランド監視 – なりすましやドメイン乗っ取りのユーザー名を検出。
- セキュリティ評価 – 従業員の公開された足跡を列挙。
- MCPサーバー経由でLLMエージェントに最新のOSINTデータを供給。
制限事項 / 注意点
- 正確性はサイトテンプレートとMLモデルの品質に依存。誤検出/見逃しは
selfcheckコマンドで報告可能。 - 多数のサイトを高速でスキャンすると、レート制限やスクラップ防止対策に引っかかる可能性あり。設定可能な遅延は含まれているが、各サイトの利用規約に完全に準拠する保証はない。
- 法的・倫理的責任はユーザーにあり。リポジトリには「本ツールは正当な研究目的のみに使用すること」という免責条項が含まれている。
- MLモデルは単純なロジスティック回帰であり、ディープラーニング検出器ではない。Playwrightが有効でない場合、非常に動的なコンテンツを持つサイトでは性能が低下する可能性がある。
貢献方法 – src/aliens_eye/data/sites.json に新しいサイト定義を追加、または sites.d/ にJSONファイルを配置。グランドトゥルースセットの改善、モデルの最適化、エクスポートプラグインの追加。テストは pytest で実行。コードスタイルは ruff でチェック。
上記のすべての情報はリポジトリのREADMEから直接取得。外部の仮定は一切追加していない。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト