vakra-dev/reader

Open source web infrastructure for AI. Scrape, crawl, and automate the web, clean markdown, browser sessions, ready for your agents.

해결하는 문제

Reader는 AI 에이전트의 웹 접근을 단순화하도록 설계된 프로덕션 급 웹 스크래핑 엔진입니다. 브라우저 인스턴스 관리, Cloudflare와 같은 안티봇 보호 우회, HTML을 LLM이 사용하기 적합한 형식으로 정리하는 복잡성을 없애줍니다.

작동 방식

Playwright 위에 구축된 Reader는 세 가지 주요 프리미티브를 제공합니다: URL을 깨끗한 Markdown으로 스크래핑, 페이지 탐색을 위한 사이트 크롤링, 은밀한 브라우저 세션 시작. 브라우저 풀링, TLS 지문, navigator 스푸핑, 표준 및 프리미엄 계층 프록시 회전 등 탐지 회피에 필요한 "어려운 작업"을 내부에서 처리합니다.

대상 사용자

AI 에이전트 또는 LLM 기반 애플리케이션을 개발하는 개발자로, 봇 탐지와 복잡한 브라우저 인프라 관리 없이 신뢰성 높고 대량의 웹 데이터 추출이 필요한 경우에 적합합니다.

주요 특징

  • 안티봇 스텔스: 내장 TLS 지문, WebRTC 마스킹, navigator 스푸핑을 통해 탐지를 우회합니다.
  • LLM‑Ready 출력: 주요 콘텐츠를 자동 추출하고 페이지를 깨끗한 Markdown 또는 HTML로 변환, 네비바, 푸터, 팝업을 제거합니다.
  • 유연한 제어: 간단한 스크래핑을 위한 고수준 API와, 전체 Playwright/Puppeteer 제어를 위한 CDP WebSocket을 반환하는 저수준 browser() 메서드를 제공합니다.
  • 인프라 관리: 자동 재활용, 상태 모니터링, 동시 처리 기능을 갖춘 브라우저 풀을 포함합니다.
  • 하이브리드 배포: 클라우드 API로 사용하거나 자체 호스팅 엔진으로 배포할 수 있습니다.