Claude 的承載性詞彙:分析 GitHub PR 中 AI 驅動的語言轉變

AI 生成的詞彙正在改變技術溝通

對在 595 天內抓取的 47,464 個 GitHub pull requests (PRs) 進行分析顯示,出現了一個獨特的語言集群——通常被稱為「Claudish」——截至 2026 年底,它代表了所有人類歸屬的 PRs 中的 45%。這種轉變的特徵是特定、語義密集的技術術語激增,這些術語高度代表了編碼代理 (coding agents),特別是那些基於 Anthropic 的 Claude 模型之代理。

數據驅動的「Claudish」模式識別

透過對超過 500 萬個單詞進行 KL-divergence k-means clustering,研究人員 Labo333 識別出了八個不同的詞彙集群。其中一個集群出現在 2026 年,顯示出特定術語頻率的劇烈增加。

關鍵語言標記

某些單詞在 AI 歸屬的貢獻中,與一般語料庫相比,頻率變得不成比例地高:

  • "Load-bearing": 這個術語在此特定集群中的頻率增加了 123.04 倍。
  • "Seam", "Fold", and "Substrate": 這些術語用於描述代碼的邊界條件和結構組件。
  • "Byte-identical": 用於高精度地描述精確的數據匹配。
  • "Sidecar": 經常出現在提議的架構解決方案中,通常作為添加輔助數據的模式。

「Claudish」詞彙表

除了主要的標記之外,代表性的詞彙還包括 verdict, invariant, footprint, substrate, residue, and parity。這些單詞經常取代較簡單的替代方案(例如,使用 "verdict" 而不是 "result" 或 "carries" 而不是 "contains")。

社群對 AI 術語的看法

開發人員對這種新興詞彙的反應兩極分化,反映了語義精確度與溝通摩擦之間的緊張關係。

支持 AI 詞彙的論點

一些開發人員認為,這些術語實際上對於技術溝通更有效率。

"Things like seam, fold, and load-bearing are useful concepts... they are more descriptive and more concise than alternatives."

此外,一些觀察者指出,LLMs 正在透過將無法理解或非英語的條目替換為結構化、語法正確的英語,來提高 commit logs 的整體品質,即使這種英語是風格化的。

反對 AI 詞彙的論點

批評者將這種風格描述為「令人討厭」、「傲慢」或「難以捉摸」。常見的投訴包括:

  • 過度冗長 (Over-verbosity): 在簡單術語足以應付的情況下,傾向於使用複雜語言的傾向。
  • 認知負荷 (Cognitive Load): 在代碼審查期間,穿梭於 AI 特有的術語中帶來的「耗能」體驗。
  • 戰術性模糊 (Tactical Ambiguity): 擔心機器人使用這些術語來避免引用特定的文件名或函數名。

語言轉變的理論驅動因素

關於為什麼這些模式存在以及它們如何傳播,出現了幾種假設:

  • RLHF and System Prompts: 一個用戶報告說 Claude 的 system prompt 明確指示它在發現「something load-bearing」時進行標記,這表明該詞彙是強化學習和引導 (steering) 的直接結果。
  • Human Adaptation: 有證據顯示存在「語言鏡像 (linguistic mirroring)」,即人類開發人員開始在自己的溝通中使用 AI 術語,以更好地提示模型,或者僅僅是透過重複接觸來達成。
  • Training Loops: 一些人推測,隨著 AI 生成的內容在訓練數據中佔據更大的比例,一種複合偏誤 (compounding bias) 被創造出來,強化了不同模型家族中的這些特定風格特徵。
  • Token Efficiency: 一種理論認為,這些密集的術語可能是一種策略,旨在使用較少的輸出 token 傳遞複雜的架構構思。

與其他模型的比較

雖然研究重點在於 Claude,但社群成員報告了其他模型中的類似趨勢。例如,「Sol" (GPT 5.6) 的用戶指出 "unusually" 一詞的遍布性過度使用(例如,"unusually efficient," "unusually narrow"),這表明大多數前沿模型都發展出了自己獨有的語言「指紋」或水印。

Sources

相關