Claude 的承載性詞彙:分析 GitHub PR 中 AI 驅動的語言轉變
AI 生成的詞彙正在改變技術溝通
對在 595 天內抓取的 47,464 個 GitHub pull requests (PRs) 進行分析顯示,出現了一個獨特的語言集群——通常被稱為「Claudish」——截至 2026 年底,它代表了所有人類歸屬的 PRs 中的 45%。這種轉變的特徵是特定、語義密集的技術術語激增,這些術語高度代表了編碼代理 (coding agents),特別是那些基於 Anthropic 的 Claude 模型之代理。
數據驅動的「Claudish」模式識別
透過對超過 500 萬個單詞進行 KL-divergence k-means clustering,研究人員 Labo333 識別出了八個不同的詞彙集群。其中一個集群出現在 2026 年,顯示出特定術語頻率的劇烈增加。
關鍵語言標記
某些單詞在 AI 歸屬的貢獻中,與一般語料庫相比,頻率變得不成比例地高:
- "Load-bearing": 這個術語在此特定集群中的頻率增加了 123.04 倍。
- "Seam", "Fold", and "Substrate": 這些術語用於描述代碼的邊界條件和結構組件。
- "Byte-identical": 用於高精度地描述精確的數據匹配。
- "Sidecar": 經常出現在提議的架構解決方案中,通常作為添加輔助數據的模式。
「Claudish」詞彙表
除了主要的標記之外,代表性的詞彙還包括 verdict, invariant, footprint, substrate, residue, and parity。這些單詞經常取代較簡單的替代方案(例如,使用 "verdict" 而不是 "result" 或 "carries" 而不是 "contains")。
社群對 AI 術語的看法
開發人員對這種新興詞彙的反應兩極分化,反映了語義精確度與溝通摩擦之間的緊張關係。
支持 AI 詞彙的論點
一些開發人員認為,這些術語實際上對於技術溝通更有效率。
"Things like seam, fold, and load-bearing are useful concepts... they are more descriptive and more concise than alternatives."
此外,一些觀察者指出,LLMs 正在透過將無法理解或非英語的條目替換為結構化、語法正確的英語,來提高 commit logs 的整體品質,即使這種英語是風格化的。
反對 AI 詞彙的論點
批評者將這種風格描述為「令人討厭」、「傲慢」或「難以捉摸」。常見的投訴包括:
- 過度冗長 (Over-verbosity): 在簡單術語足以應付的情況下,傾向於使用複雜語言的傾向。
- 認知負荷 (Cognitive Load): 在代碼審查期間,穿梭於 AI 特有的術語中帶來的「耗能」體驗。
- 戰術性模糊 (Tactical Ambiguity): 擔心機器人使用這些術語來避免引用特定的文件名或函數名。
語言轉變的理論驅動因素
關於為什麼這些模式存在以及它們如何傳播,出現了幾種假設:
- RLHF and System Prompts: 一個用戶報告說 Claude 的 system prompt 明確指示它在發現「something load-bearing」時進行標記,這表明該詞彙是強化學習和引導 (steering) 的直接結果。
- Human Adaptation: 有證據顯示存在「語言鏡像 (linguistic mirroring)」,即人類開發人員開始在自己的溝通中使用 AI 術語,以更好地提示模型,或者僅僅是透過重複接觸來達成。
- Training Loops: 一些人推測,隨著 AI 生成的內容在訓練數據中佔據更大的比例,一種複合偏誤 (compounding bias) 被創造出來,強化了不同模型家族中的這些特定風格特徵。
- Token Efficiency: 一種理論認為,這些密集的術語可能是一種策略,旨在使用較少的輸出 token 傳遞複雜的架構構思。
與其他模型的比較
雖然研究重點在於 Claude,但社群成員報告了其他模型中的類似趨勢。例如,「Sol" (GPT 5.6) 的用戶指出 "unusually" 一詞的遍布性過度使用(例如,"unusually efficient," "unusually narrow"),這表明大多數前沿模型都發展出了自己獨有的語言「指紋」或水印。
Sources
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch