QIN2DIM/hcaptcha-challenger

🥂 Gracefully face hCaptcha challenge with multimodal large language model.

해결하는 문제

제3자 악성캡차 서비스나 Tampermonkey 스크립트에 의존하지 않고, 전문적인 AI 모델과 다중모달 대규모 언어 모델(MLLM)을 결합하여 hCaptcha 챌린지를 자동으로 해결할 수 있는 방법을 제공합니다.

작동 방식

프로젝트는 작업에 따라 다양한 유형의 캡차 챌린지를 처리할 수 있는 플러그인 가능한 리소스 시스템을 사용합니다:

  • 이미지 레이블링 (이진/포인트): 분류에 ResNet ONNX, 탐지에 YOLOv8 ONNX 사용.
  • 영역 선택 (경계 상자): YOLOv8 ONNX 세그멘테이션 사용.
  • 다중 선택: ViT ONNX 제로샷 모션 사용.
  • 드래그 앤 드롭: 공간적 사고 체인(Spatial Chain-of-Thought) 접근법 사용.
  • 고급 작업: 자가학습 챌린지에는 CLIP-ViT 통합, 에이전트 워크플로우에는 AIOps 다중모달 LLM 활용.

대상 사용자

로컬 또는 AI 기반 모델을 사용하여 프로그래밍적으로 hCaptcha 챌린지를 우회해야 하는 개발자 및 자동화 엔지니어.

주요 특징

  • 제3자 종속 없음: 유료 악성캡차 서비스에 의존하지 않고 독립적으로 작동.
  • 다중모달 접근법: 전통적인 컴퓨터 비전 모델(YOLO, ResNet, ViT)과 현대적인 MLLM을 결합.
  • 에이전트 워크플로우: AI 기반 에이전트 접근법을 통해 복잡한 챌린지 해결 지원.
  • 통합 파이프라인: Roboflow를 통한 데이터 수집 및 어노테이션, Colab를 통한 모델 훈련/검증 워크플로우 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트