QIN2DIM/hcaptcha-challenger

🥂 Gracefully face hCaptcha challenge with multimodal large language model.

解決的問題

不依賴第三方反驗證服務或Tampermonkey腳本,透過結合專用AI模型與多模態大語言模型(MLLM),提供自動解決hCaptcha挑戰的方法。

工作原理

本專案使用可插入的資源系統,根據任務類型處理不同類型的驗證碼挑戰:

  • 影像標記(二元/點): 使用ResNet ONNX進行分類,YOLOv8 ONNX進行檢測。
  • 區域選擇(邊界框): 使用YOLOv8 ONNX進行分割。
  • 多選題: 使用ViT ONNX零樣本推理。
  • 拖曳與放置: 採用空間思維鏈(Spatial Chain-of-Thought)方法。
  • 進階任務: 整合CLIP-ViT用於自監督挑戰,AIOps多模態LLM用於代理式工作流程。

適用對象

需要透過本地或AI驅動模型程式化繞過hCaptcha挑戰的開發者與自動化工程師。

核心亮點

  • 無第三方依賴: 獨立運作,不依賴付費反驗證服務。
  • 多模態方法: 結合傳統電腦視覺模型(YOLO、ResNet、ViT)與現代MLLM。
  • 代理式工作流程: 透過AI驅動的代理式方法支援複雜挑戰的解決。
  • 整合式流程: 包含透過Roboflow進行資料收集與標註,以及透過Colab進行模型訓練與驗證的工作流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案