arxhr007/Aliens_eye
Hunt down 840+ social media accounts using AI
Aliens Eye – AI‑OSINT 用户名扫描器
是什么 – 一个 Python 命令行工具,用于检查给定用户名是否存在于 840 多个社交媒体、论坛及其他公开平台。它结合了轻量级逻辑回归模型与一组手工设计的启发式规则(HTTP 状态、DOM 信息、OpenGraph 标签等),判断某个账号是 已找到、可能 还是 未找到。扫描器支持异步运行,可恢复中断的任务,并可通过一个轻量级 MCP 服务器向 LLM 代理提供结果。
为何重要 – 传统的 OSINT 用户名查询依赖于简单的 HTTP 状态检查,会漏掉返回通用页面或使用 JavaScript 的网站。通过将机器学习与 30 个工程化信号结合,Aliens Eye 提高了准确率与召回率,并能将看似属于同一人的账号进行聚类(如头像哈希、简介相似性、共享链接等)。
核心功能
- 广泛覆盖 – 支持 840+ 个站点,每个站点由
sites.d/中的 JSON URL 模板定义。 - 混合检测 – 启发式评分 + 内置逻辑回归模型(运行时无重型依赖)。
- 资料提取 – 通过 OpenGraph/JSON-LD 或站点特定 CSS 提取显示名、简介和头像。
- 跨站关联 – 可选
--correlate将可能属于同一人的账号分组。 - 递归扩展 – 跟随简介中发现的用户名(
--recurse-depth)。 - 域名可用性检查 – 检查
<username>.com、.io等域名是否已注册。 - 监控模式 – 定期重新扫描并支持 Webhook 通知。
- 可恢复扫描 – 支持检查点文件(
--resume)。 - 丰富的终端 UI – 使用 rich 实现实时进度表;可选交互式 TUI 浏览器。
- MCP 服务器 –
aliens_eye serve可让 LLM 代理查询扫描器。 - 支持代理/Tor、站点过滤、NSFW 排除,以及对 JavaScript 重载页面的 Playwright 备用方案。
- 导出格式 – 支持 JSON、CSV、HTML、Markdown、PDF,以及图文件(GEXF、Mermaid、Maltego CSV)。
典型工作流
# 快速检查单个账号
aliens_eye alice
# 带关联与域名检查的全功能扫描
aliens_eye alice --correlate --domains --format all --output results
# 作为服务运行,供 LLM 驱动的工作流使用
aliens_eye serve # 然后从代理调用 MCP 端点
安装 – pip install aliens-eye(支持 Playwright、训练、PDF、TUI 或 MCP 的可选依赖)。也提供 Docker 镜像。
检测机制
- 从 HTTP 响应构建 30 维特征向量(状态桶、响应时间、重定向、DOM 线索、结构化数据标签等)。
- 启发式引擎对向量评分。
- 内置逻辑回归模型投票;两个分数融合为概率,映射到 已找到 / 可能 / 未找到。
- 若模型文件缺失,则仅使用启发式规则。
重新训练 – 用户可收集标注数据集(aliens_eye train collect),拟合新模型(aliens_eye train fit),并通过 --model 提供。
使用场景
- 开源情报调查(跨平台追踪账号)。
- 品牌监控 – 检测冒名顶替或域名抢注的账号。
- 安全评估 – 枚举员工的公开足迹。
- 通过 MCP 服务器向 LLM 代理提供最新 OSINT 数据。
限制与注意事项
- 准确性取决于站点模板和 ML 模型质量;误报/漏报可通过
selfcheck命令报告。 - 快速扫描大量站点可能触发速率限制或反爬虫机制;工具包含可配置延迟,但无法保证完全符合各站点的使用条款。
- 法律与伦理责任由用户承担;仓库包含免责声明,强调工具仅限合法研究用途。
- ML 模型为简单逻辑回归,非深度学习检测器,若未启用 Playwright,对高度动态内容的网站可能表现不佳。
贡献方式 – 将新站点定义添加至 src/aliens_eye/data/sites.json 或将 JSON 文件放入 sites.d/。改进基准数据集、提交模型优化或添加导出插件。测试使用 pytest;代码风格由 ruff 检查。
以上所有信息均直接来自仓库的 README,未添加任何外部假设。
相关
- 项目
- 项目
- 项目
- 项目
- 项目