WILLOSCAR/research-units-pipeline-skills

Research pipelines as semantic execution units: each skill declares inputs/outputs, acceptance criteria, and guardrails. Evidence-first methodology prevents hollow writing through structured intermediate artifacts.

何を解決するか

Research Harness は、AIエージェントによる研究を検査可能で、再開可能で、誠実なものにするためのインフラを提供します。AIエージェントが最終成果物(例:PDF)を生成するものの、その結論に至る過程における証拠、意思決定、中間ステップの痕跡が一切残らないという一般的な問題を防ぎます。これにより、成果物の検証や作業の再開が困難になるのを回避します。

動作方法

このシステムは、研究目標を「実行(Run)」に変換し、ピン留めされたパイプライン契約によって管理します。タスクを回復可能な「ユニット」と「スキル」に分割することで、すべての遷移が証拠とアーティファクトによって裏付けられるようにします。

主なメカニズムは以下の通りです:

  • ピン留めされた契約:パイプラインとスキルの実装をスナップショット化し、実行中に静かに変化するのを防ぎます。
  • 証拠に基づく完了:成功は単なるステータスフラグではなく、一致するアーティファクトハッシュ、マニフェスト、完了イベントを必要とします。
  • 制限付き診断:契約が失敗した場合、システムは全体のプロセスを再書き込みするのではなく、特定の修正対象を特定します。
  • 人間のチェックポイント:ユーザーが特定のアーティファクト(例:アウトラインやプロトコル)を承認できるようにし、その下位アーティファクトが変更された場合は承認権限を失います。

対象ユーザー

文献レビュー、研究の統合、技術レポートの作成などにAIエージェントを活用する研究者や開発者で、検証可能な監査ログと、障害からの回復能力が必要な方々。

特徴

  • 多様なワークフロー・テンプレート:研究要約、論文レビュー、証拠の統合、arXiv調査、チュートリアル作成など、事前に構築されたワークフローを提供。
  • Harness Lock:カーネルとスキルバンドルのハッシュ化により、実行の整合性を保証。
  • 厳格な残留物チェック:AI生成のテンプレート残留物(例:"this run")が最終成果物に含まれるのを防ぐための特定のゲートを含む。
  • ファイル優先アプローチ:すべての目標、意思決定、証拠を構造化されたワークスペースに整理し、完全な透明性を実現。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch