QIN2DIM/hcaptcha-challenger

🥂 Gracefully face hCaptcha challenge with multimodal large language model.

何を解決するか

第三者のアンチキャプチャサービスやTampermonkeyスクリプトに依存せずに、専門的なAIモデルとマルチモーダル大規模言語モデル(MLLM)を組み合わせることで、hCaptchaチャレンジを自動で解決する方法を提供します。

動作方法

このプロジェクトは、タスクに応じて異なる種類のキャプチャチャレンジを処理できるプラグイン可能なリソースシステムを使用しています:

  • 画像ラベル付け(バイナリ/ポイント): 分類にResNet ONNX、検出にYOLOv8 ONNXを使用。
  • 領域選択(バウンディングボックス): YOLOv8 ONNXによるセグメンテーションを使用。
  • 複数選択: ViT ONNXによるゼロショットモーションを使用。
  • ドラッグアンドドロップ: 空間的チェーンオブサウンド(Spatial Chain-of-Thought)アプローチを採用。
  • 高度なタスク: 自己教師付きチャレンジにはCLIP-ViTを統合し、エージェントワークフローにはAIOpsマルチモーダルLLMを活用。

対象ユーザー

ローカルまたはAI駆動のモデルを使用して、プログラム的にhCaptchaチャレンジを回避する必要がある開発者や自動化エンジニア。

特徴

  • 第三者依存なし: 有料のアンチキャプチャサービスに依存せず、独立して動作します。
  • マルチモーダルアプローチ: 伝統的なコンピュータビジョンモデル(YOLO、ResNet、ViT)と現代的なMLLMを組み合わせます。
  • エージェントワークフロー: AI駆動のエージェントアプローチにより、複雑なチャレンジ解決をサポートします。
  • 統合パイプライン: Roboflowを介したデータ収集・アノテーション、Colabを介したモデルトレーニング・検証のワークフローを含みます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト