xorq-labs/xorq
Git-native executable catalog for agentic data work.
解决的问题
Xorq 解决了 AI 编码代理在数据分析过程中积累的“技术债”。当代理生成一次性 Python 脚本、碎片化的 JSON 文件和过时的 requirements 时,其结果往往难以复现,且人类或其他代理难以验证或投入生产。Xorq 用可执行、内容地址化的数据管道目录,取代了临时的笔记和脆弱的脚本。
工作原理
Xorq 将数据框表达式转化为持久、可复现的产物。它使用由 Ibis 驱动的声明式表达式系统,可编译为多种后端(如 DuckDB、Snowflake 或 pandas)。
- 定义:用户或代理定义一个延迟计算的数据框表达式。
- 构建:表达式被构建为一个哈希目录,包含一个清单(计算规范)、固定版本的 Python 环境(通过
uv实现)和一个 wheel 包。 - 目录化:这些构建产物被添加到一个目录中,该目录是一个 Git 仓库。这使得条目可通过哈希或人类可读别名发现,通过 Git 历史追踪,并可供其他代理或人类重用。
适用人群
- AI 代理:需要一种方式来存储和检索其数据工作的可执行记忆,以避免从零开始(如 Claude Code)。
- 数据工程师:希望将临时生成的代理管道转化为可移植、可版本化的产物。
- 分析师:需要可在不同计算引擎上运行的可复现数据转换的用户。
特色亮点
Git 原生存储:目录是一个 Git 仓库,因此无需中心化服务即可实现发现或版本控制。
内容地址化管道:每个管道都有基于其内容的可复现身份。
多引擎支持:同一表达式可在嵌入式引擎(DataFusion、DuckDB、SQLite)或数据仓库(Snowflake、Databricks、Trino)上运行。
代理集成:包含 Claude Code 的插件,可自动创建和探索目录。
Arrow 原生:使用 Apache Arrow 实现表达式之间的高性能数据交换。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目