EvoMap/AutoResearch

AI/ML research agents from idea to paper-ready evidence. An EvoMap open-source project.

何を解決するか

AutoResearchは、アイデアの生成からエビデンスの収集に至るまでのプロセス全体を、現実世界のシグナルと厳格な相互検証に基づかせることで、AI/ML研究におけるハルシネーション(幻覚)や根拠のない主張を排除するように設計されています。独立したレビューと実証的なエビデンスを必要とする、状態を保持し追跡可能なワークフローを強制することで、AIエージェントが詳細を捏造したり、否定的な結果を過剰に解釈したりするという一般的な問題を防止します。

仕組み

このシステムは、主に2つのフェーズに分かれた状態保持型のエージェントワークフローとして動作します:

  1. アイデアの生成: 公開チャネル(論文、コミュニティのトレンド)から研究シグナルを収集し、それらをドメインの制約に関するローカルな知識ベースと交差させ、少なくとも3つの異なるLLMを使用して、候補となるアイデアを独立して開発および相互レビューします。
  2. アイデアの実行: Claude Code CLIとコーディネーターを使用して、アイデアを回復可能なパイプラインを通じて進めます:計画、実現可能性のためのパイロットテスト、フル実験へのスケールアップ、結果の分析、そして最後に、結論に異議を唱えるための「critic」モデルによる独立したブラインドレビュー。

コード、ログ、criticレポートを含むすべての進捗状況はディスクに保存されるため、研究者はいつでもプロセスを検査したり、引き継いだりすることができます。

対象者

論文に耐えうるエビデンスを維持しながら、新しい研究方向の発見と実験の実行を自動化したいAIおよび機械学習の研究者向けに構築されています。

ハイライト

  • クロスドメインの発見: 外部の研究シグナルとローカルなドメイン知識を組み合わせて、新しい問題を見つけ出します。
  • 独立したマルチモデルレビュー: アイデアの自己承認を防ぐために、複数の異なるモデルのアイデンティティを必要とします。
  • 状態保持型 & 回復可能: すべての計画、コード、およびログをディスクに保存するため、長時間実行される実験を中断後に再開できます。
  • パイロット優先アプローチ: フル計算リソースにスケールアップする前に、低コストで実現可能性を検証します。
  • 否定的な結果のサポート: 成功体験を強いるのではなく、失敗した仮説のエビデンスを保持します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト