Anakin-Inc/anakin
Open-source web scraping API. Turn any website into clean markdown or structured JSON. Anti-detect browser, proxy auto-selection, self-hosted. One command: make up
解决的问题
AnakinScraper 是一个专为 AI 应用设计的开源网页爬取 API。它解决了将复杂、现代的网页转换为干净、LLM 就绪的 Markdown 或结构化 JSON 数据的问题,同时绕过反机器人保护机制,并降低使用付费爬取服务的成本。
工作原理
该系统使用「处理器链」来最大化效率并最小化成本。它首先尝试使用最快的方法(HTTP fetch)爬取页面,若失败则回退到更强大的反检测浏览器(Camoufox/Firefox),最后在本地方法失败时调用可选的外部 API 处理器。
关键技术组件包括:
- 反检测浏览器:使用 Camoufox 提供真实的浏览器指纹,避免被检测到。
- 代理自动选择:采用 Thompson Sampling(一种机器学习技术)实时为特定域名自动选择最成功的代理。
- AI 提取:与 Google Gemini 集成,将原始页面内容转换为结构化 JSON。
- 转换:自动移除模板代码,生成适用于 RAG 流水线的干净 Markdown。
适用人群
专为开发 AI 代理、RAG(检索增强生成)流水线和需要高质量、干净网页数据但无需管理复杂爬取基础设施的数据提取工具的开发者打造。
主要亮点
- 成本高效的回退机制:仅对本地处理器无法解决的极少数网站调用付费 API。
- 零配置启动:可作为单个 Go 二进制文件运行,无需数据库,立即可用。
- 机器学习驱动的代理:通过 Thompson Sampling 实时学习每个域名的最佳代理。
- LLM 就绪输出:通过 Gemini AI 直接转换为 Markdown 和结构化 JSON。
- 完整管理 UI:包含基于 React 的仪表板,用于跟踪任务、监控代理评分和管理域名配置。
相关
- 项目
- 项目
- 项目
- 项目
- 项目