Claude 的承重词汇:分析 GitHub PR 中 AI 驱动的语言转变

AI 生成的词汇正在改变技术交流

通过对 595 天内抓取的 47,464 个 GitHub pull requests (PRs) 进行分析,研究发现了一种独特的语言集群——通常被称为 "Claudish"——截至 2026 年底,它已占所有人类归属 PR 的 45%。这种转变的特征是特定、语义密集的技术术语激增,这些术语高度代表了编程代理,特别是那些基于 Anthropic 的 Claude 模型开发的代理。

数据驱动的 "Claudish" 模式识别

通过对超过 500 万个单词进行 KL-divergence k-means 聚类,研究人员 Labo333 识别出了八个不同的词汇集群。其中一个集群出现在 2026 年,显示出特定术语频率的剧烈增加。

关键语言标记

与通用语料库相比,某些单词在 AI 归属的贡献中变得异常频繁:

  • "Load-bearing": 该术语在此特定集群中的频率增加了 123.04 倍。
  • "Seam", "Fold", and "Substrate": 这些术语用于描述代码的边界条件和结构组件。
  • "Byte-identical": 用于高精度地描述精确的数据匹配。
  • "Sidecar": 频繁出现在提议的架构解决方案中,通常作为添加辅助数据的模式。

"Claudish" 词汇表

除了主要的标记之外,代表性词汇还包括 verdict, invariant, footprint, substrate, residue, and parity 等术语。这些词汇通常会取代更简单的替代方案(例如,使用 "verdict" 而不是 "result",或使用 "carries" 而不是 "contains")。

社区对 AI 术语的看法

开发者对这种新兴词汇的反应呈现两极分化,反映了语义精确度与交流摩擦之间的紧张关系。

支持 AI 词汇的观点

一些开发者认为,这些术语在技术交流中实际上更加高效。

"Things like seam, fold, and load-bearing are useful concepts... they are more descriptive and more concise than alternatives."

此外,一些观察者指出,LLMs 正在通过将难以理解或非英语条目替换为结构化、语法正确的英语,从而提高 commit logs 的整体质量,即使这种英语是风格化的。

反对 AI 词汇的观点

批评者将这种风格描述为 "obnoxious," "patronizing," 或 "inscrutable." 常见的投诉包括:

  • Over-verbosity: 使用复杂语言的倾向,即在简单术语足以胜任的地方使用复杂语言。
  • Cognitive Load: 在代码审查期间穿梭于 AI 特有的术语中带来的 "draining" 体验。
  • Tactical Ambiguity: 担心机器人使用这些术语来避免引用特定的文件名或函数名。

语言转变的理论驱动因素

关于为什么这些模式存在以及它们如何传播,出现了几种假设:

  • RLHF and System Prompts: 一位用户报告称,Claude 的 system prompt 明确指示它在发现 "something load-bearing" 时进行标记,这表明该词汇是强化学习和引导的结果。
  • Human Adaptation: 存在 "linguistic mirroring"(语言镜像)的证据,即人类开发者开始在自己的交流中采用 AI 术语,以更好地进行 prompt 提示,或者仅仅是因为反复接触。
  • Training Loops: 有人推测,随着 AI 生成的内容在训练数据中占据越来越大的比例,一种复合偏差被创造出来,从而在不同的模型家族中强化了这些特定的风格化特征。
  • Token Efficiency: 一种理论认为,这些密集的术语可能是一种策略,旨在使用更少的输出 tokens 来传达复杂的架构概念。

与其他模型的比较

虽然研究重点是关注 Claude,但社区成员报告了其他模型也存在类似的趋势。例如, "Sol" (GPT 5.6) 的用户注意到 "unusually" 一词的泛滥使用(例如, "unusually efficient," "unusually narrow"),这表明大多数前沿模型都在开发其独特的语言 "fingerprints" 或水印。

Sources

相关