xorq-labs/xorq

Executable memory system for tabular data that works in your harness.

它解决了什么

Xorq 解决了 AI 编码代理在执行表格数据工作时产生的“技术债”。它不会留下杂乱的一次性 Python 脚本、脆弱的 JSON 状态文件和过时的需求文件,而是将短暂的代理工作转换为持久、可组合且可执行的制品。它防止血统信息的丢失,消除在不同机器上手动重现结果的需求,并用可发现的可执行管道目录取代静态的 markdown 笔记。

它如何工作

Xorq 使用基于 Ibis 的声明式表达式系统,可编译到多种后端(如 DuckDB、Snowflake 或 pandas)。这些表达式被打包成“entries”——包含表达式清单、固定的 Python 环境(通过 uv)以及必要源码的 zip 构建产物。这些 entries 存储在 git 原生目录中,允许代理和人类使用标准文件操作和 git 命令发现、版本化和复用管道。数据在这些表达式之间使用 Arrow RecordBatches 进行高性能 IPC 交换。

适用人群

它面向开发者和 AI 代理(特别是与 Claude Code 等工具集成),适用于执行复杂数据分析、构建机器学习管道以及为表格数据创建语义层的场景。

亮点

  • 多引擎执行:在嵌入式引擎(SQLite、pandas)、数据仓库(Snowflake、Databricks)和湖仓(PyIceberg)上运行相同的表达式。
  • Git 原生目录:使用 git 仓库存储构建产物,使系统的“记忆”具备可版本化和可移植性。
  • 可重现环境:每个 entry 都随附其固定的 requirements.txt 和 wheel,确保每次运行方式相同。
  • 代理优化:包含 Claude Code 插件,允许代理初始化目录、探索 entries,并通过斜杠命令组合新管道。
  • Scikit-learn 集成:可以将 scikit-learn Pipeline 对象转换为延迟执行的 Xorq 表达式。