xorq-labs/xorq

Git-native executable catalog for agentic data work.

解決的問題

Xorq 解決了 AI 編碼代理在資料分析過程中累積的「技術債」。當代理產生一次性 Python 指令碼、碎片化的 JSON 檔案與過時的 requirements 時,其結果往往難以重現,且人類或其他代理難以驗證或投入生產。Xorq 以可執行、內容位址化的資料流程目錄,取代了暫時性的筆記與脆弱的指令碼。

工作原理

Xorq 將資料框表達式轉化為持久、可重現的產物。它使用由 Ibis 驅動的宣告式表達式系統,可編譯至多種後端(如 DuckDB、Snowflake 或 pandas)。

  1. 定義:使用者或代理定義一個延遲計算的資料框表達式。
  2. 建構:表達式被建構為一個雜湊目錄,包含一個清單(計算規格)、固定版本的 Python 環境(透過 uv 實現)與一個 wheel 套件。
  3. 目錄化:這些建構產物被加入目錄中,該目錄是一個 Git 倉庫。這使得條目可透過雜湊或人類可讀別名發現,透過 Git 歷史追蹤,並可供其他代理或人類重用。

適用對象

  • AI 代理:需要一種方式來儲存與檢索其資料工作的可執行記憶,以避免從零開始(如 Claude Code)。
  • 資料工程師:希望將臨時生成的代理流程轉化為可攜帶、可版本化的產物。
  • 分析師:需要可在不同計算引擎上執行的可重現資料轉換的使用者。

特色亮點

  • Git 原生儲存:目錄是一個 Git 倉庫,因此無需中心化服務即可實現發現或版本控制。

  • 內容位址化流程:每個流程都有基於其內容的可重現身分。

  • 多引擎支援:同一表達式可在嵌入式引擎(DataFusion、DuckDB、SQLite)或資料倉儲(Snowflake、Databricks、Trino)上執行。

  • 代理整合:包含 Claude Code 的外掛程式,可自動建立與探索目錄。

  • Arrow 原生:使用 Apache Arrow 實現表達式之間的高效能資料交換。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案