pzqpzq/LSF_MDia

[ICML 2026] Let LLMs invent and evolve languages for efficient reasoning.

📚 机器方言学(MDia)

是什么 – MDia 是一个研究级 Python 库,可将大型语言模型(LLM)的中间推理步骤视为 机器间通信协议。与传递冗长的人类可读思维链不同,说话者模型 会输出一个紧凑的 语言象征框架(LSF)卡——一种“方言”,定义了符号、语法、可重用操作符、有效性规则和经验性概况。听者模型 随后解析并执行该方言。MDia 提供了创建、演化、分析、选择、路由和验证这些方言卡的完整生命周期,并保证严格的可复现性。


🎯 核心理念

概念 含义
方言卡(LSF) 持久化规范 D = (V, G, O, R, ρ) – 符号、语法、操作符、规则和数据驱动的概况。
说话者 → 听者 一个模型生成方言卡,另一个模型消费它。
效用是关系性的 方言的价值取决于说话者、听者、任务、路由策略和令牌预算。
确定性流水线 八个 CLI 阶段(collect → create → evolve → profile → select → run → validate-rules → report),在任何保留评估之前冻结证据。
构建即可复现 不可变的数据分区、内容衍生 ID、完整的令牌计数,以及一个无需任何外部 API 密钥即可运行的玩具离线示例。

⚙️ 主要特性(如 README 所述)

  • 兼容黑盒 LLM – 与任何基于 API 的模型兼容;无需访问隐藏状态。
  • 可重用的方言卡 – 版本化、哈希标识、可归档,便于后续重用。
  • 路由策略singleaggregatecomposeabstain/raw-fallback 计划,尊重预算、风险和听者开放性。
  • 基于规则的验证 – 100 条机器社会语言学规则的银行,每条规则均有证据等级(完整、强、未评估)。
  • 跨异构模型的分析 – 捕获准确性、令牌成本、失败模式、公开性、教学优势等。
  • CLI 优先设计mdia 命令包含每个流水线阶段的子命令;--help 显示详细选项。
  • 离线确定性演示examples/toy/ 提供固定用例,可在无任何 API 密钥的情况下本地运行整个生命周期。
  • 详尽的文档 – 架构、流水线、规则验证、扩展指南,以及论文到代码的映射。
  • CI 与质量门禁 – 跨 Python 3.10–3.12 的测试、静态分析(ruff, mypy)、格式化和密钥扫描。

🚀 典型用例

场景 MDia 如何帮助
模型间通信研究 创建可重用的 LSF,进行演化,并测量不同模型家族如何从彼此的方言中获益。
高效推理 用紧凑的方言卡替代冗长的 CoT 跟踪,保留下游听者所需状态,生成令牌减少约 70%(论文报告)。
课程式教学 使用较弱的说话者生成“教学方言”,其他模型可高效率采用。
预算约束下的鲁棒路由 部署 singlecompose 路由计划,在尊重令牌预算的同时避免听者已知抗拒的方言。
可审计的可复现性 在测试评估前冻结方言选择和路由决策,确保不从保留数据中泄露。

📦 安装(来自 README)

# 克隆仓库
git clone https://github.com/pzqpzq/LSF_MDia.git
cd LSF_MDia

# 创建虚拟环境(需 Python 3.10+)
python -m venv .venv
source .venv/bin/activate

# 以可编辑模式安装包(拉取所有依赖)
pip install -e .

玩具演示无需外部 API 密钥;真实运行需按 docs/extending.md 所述添加兼容的模型提供者适配器。


🏃‍♀️ 快速入门示例(来自 README)

# 运行确定性玩具流水线
mdia pipeline --config configs/toy_mdia.yaml

该命令创建一个版本化运行目录(runs/<run_id>/),包含:

  • 原始追踪数据,
  • 生成的方言卡,
  • 演化和路由器验证概况,
  • 冻结的方言库,
  • 路由计划、预测、令牌计数和完整的可复现性报告。 使用相同种子重新运行将完全复现相同结果。

📉 局限与范围(如所述或隐含)

  • 仅限研究级 – 专为受控实验设计,非生产级服务堆栈。
  • 基准特定的固定用例 – 离线演示使用小规模可再分发数据集;复现论文数字需精确模型版本和私有基准数据。
  • 依赖黑盒 – MDia 假设底层 LLM 可通过标准 API 查询;不支持暴露内部状态的模型。
  • 规则库保守 – 100 条规则中仅 19 条有强实证支持;其余标记为弱证据。
  • 路由决策必须冻结 – 框架强制验证与测试分区严格分离,可能对快速原型设计感到受限。

📄 许可证

项目采用 MIT 许可证(见 LICENSE)。


📚 引用(来自 README)

若在出版物中使用 MDia,请引用配套的 ICML 2026 海报和 arXiv 预印本:

@inproceedings{mdia2026,
  title = {Machine Dialectology: from verbose reasoning traces to a measurable ecology of machine dialects},
  author = {…},
  booktitle = {Proceedings of the 2026 International Conference on Machine Learning (ICML)},
  year = {2026},
  url = {https://arxiv.org/abs/2606.29354},
  note = {Poster 61557}
}

(确切作者列表可从 arXiv 条目获取。)


🔗 接下来

  • 阅读架构指南docs/architecture.md)以了解如何实现新模型提供者。
  • 探索规则系统docs/rules.md)若想添加或修改社会语言学约束。
  • 尝试玩具流水线 并检查生成的 report.md,查看溯源链接如何记录。
  • 检查遗留工作区legacy/)以获取 CLSR 框架的早期版本,如需历史背景。

MDia 是一个真正的开源研究平台,用于研究异构 LLM 代理之间的可重用符号协议。以上所有信息均直接取自仓库的 README。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目