xorq-labs/xorq

Git-native executable catalog for agentic data work.

何を解決するか

Xorqは、AIコーディングエージェントによるデータ分析中に蓄積された「技術的負債」に対処します。エージェントが一時的なPythonスクリプト、断片化されたJSONファイル、古くなったrequirementsを生成すると、その結果として得られる作業はしばしば再現不可能であり、人間や他のエージェントが検証または本番環境に展開するのが困難になります。Xorqは一時的なメモや脆弱なスクリプトの代わりに、実行可能でコンテンツアドレス可能なデータパイプラインのカタログを提供します。

動作方法

Xorqはデータフレーム式を耐久的で再現可能なアーティファクトに変換します。Ibisで駆動される宣言的式システムを使用し、DuckDB、Snowflake、pandasなどの複数のバックエンドにコンパイル可能です。

  1. 定義: ユーザーまたはエージェントが遅延評価データフレーム式を定義します。
  2. ビルド: 式がハッシュ化されたディレクトリにビルドされ、マニフェスト(計算の仕様)、ピンされたPython環境(uv経由)、およびウェHEELが含まれます。
  3. カタログ化: これらのビルドはカタログに追加され、Gitリポジトリです。これにより、ハッシュまたは人間が読みやすいエイリアスでエントリを検出可能になり、Git履歴で追跡でき、他のエージェントや人間が再利用できます。

対象ユーザー

  • AIエージェント: Claude Codeなどのコーディングエージェントで、データ作業の実行可能メモリを保存・取得する手段が必要な場合。
  • データエンジニア: 一時的なエージェント生成パイプラインをポータブルでバージョン管理可能なアーティファクトに変換したい人。
  • アナリスト: 異なるコンピューティングエンジン上で実行可能な再現可能なデータ変換が必要なユーザー。

特徴

  • Gitネイティブストレージ: カタログはGitリポジトリなので、発見やバージョン管理に中央サーバーは不要です。

  • コンテンツアドレス可能なパイプライン: すべてのパイプラインは、そのコンテンツに基づいた再現可能なIDを持ちます。

  • マルチエンジン対応: 同じ式は、埋め込みエンジン(DataFusion、DuckDB、SQLite)またはデータウェアハウス(Snowflake、Databricks、Trino)で実行可能です。

  • エージェント統合: Claude Code用のプラグインを備えており、カタログの自動作成と探索を可能にします。

  • Arrowネイティブ: 式間の高速なデータ交換にApache Arrowを使用しています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト