xorq-labs/xorq

Git-native executable catalog for agentic data work.

解决的问题

Xorq 解决了 AI 编码代理在数据分析过程中积累的“技术债”。当代理生成一次性 Python 脚本、碎片化的 JSON 文件和过时的 requirements 时,其结果往往难以复现,且人类或其他代理难以验证或投入生产。Xorq 用可执行、内容地址化的数据管道目录,取代了临时的笔记和脆弱的脚本。

工作原理

Xorq 将数据框表达式转化为持久、可复现的产物。它使用由 Ibis 驱动的声明式表达式系统,可编译为多种后端(如 DuckDB、Snowflake 或 pandas)。

  1. 定义:用户或代理定义一个延迟计算的数据框表达式。
  2. 构建:表达式被构建为一个哈希目录,包含一个清单(计算规范)、固定版本的 Python 环境(通过 uv 实现)和一个 wheel 包。
  3. 目录化:这些构建产物被添加到一个目录中,该目录是一个 Git 仓库。这使得条目可通过哈希或人类可读别名发现,通过 Git 历史追踪,并可供其他代理或人类重用。

适用人群

  • AI 代理:需要一种方式来存储和检索其数据工作的可执行记忆,以避免从零开始(如 Claude Code)。
  • 数据工程师:希望将临时生成的代理管道转化为可移植、可版本化的产物。
  • 分析师:需要可在不同计算引擎上运行的可复现数据转换的用户。

特色亮点

  • Git 原生存储:目录是一个 Git 仓库,因此无需中心化服务即可实现发现或版本控制。

  • 内容地址化管道:每个管道都有基于其内容的可复现身份。

  • 多引擎支持:同一表达式可在嵌入式引擎(DataFusion、DuckDB、SQLite)或数据仓库(Snowflake、Databricks、Trino)上运行。

  • 代理集成:包含 Claude Code 的插件,可自动创建和探索目录。

  • Arrow 原生:使用 Apache Arrow 实现表达式之间的高性能数据交换。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目