大语言模型的常见失败模式:来自开发者经验的洞察

LLM 局限性概述

大语言模型 (LLMs) 在需要精确空间推理、严格遵守负向约束以及应用微妙的人类判断的任务中表现持续挣扎。虽然这些模型在语义合成方面表现出色,但在需要物理空间心理模型、能够省略信息而非增加信息,或生成非通用的创意内容等“简单”任务中经常失败。

空间与机械推理失败

LLMs 缺乏可靠的物理或几何空间内部表示,导致在架构和 UI 设计中出现系统性失败。

架构与 UI 布局

模型无法生成功能性的建筑平面图,即使在提供详细的房间节点图的情况下也是如此。用户报告称,虽然模型可以描述良好平面图的规则,但无法执行。同样,在 UI 开发中,模型难以识别平面上的重叠元素,或解决 TypeScript 应用或 iOS 游戏中的空间冲突。

导航与游戏逻辑

在基于文本的环境中,空间理解进一步受限。用户指出,LLMs 在导航 ASCII 地图(例如 Nethack 等游戏中的地图)时,在长期规划方面表现不佳。在 Chess 等策略游戏中,如果没有外部 chess engine 的协助,模型难以准确进行游戏。

指令遵循与约束遵守

尽管经过训练,LLMs 经常忽略显式约束,特别是“负向约束”(即指示要做某事的指令)。

无法省略与编辑

存在一种反复出现的模式,即 LLMs 难以在不明确提及删除动作的情况下移除信息。当被要求从文档中删除一个想法时,模型往往会用“该想法不再相关”之类的陈述来替换内容,而不是简单地将其删除。在幻灯片设计中,模型难以处理空白区域,倾向于添加“独特的设计元素”而不是留下空白空间。

将指令与输出混合

用户报告称,模型经常将编辑指令混入最终输出中。例如,如果要求修改草稿中的特定短语,模型可能会在编辑后的文档实际正文中包含“将 X 改为 Y”之类的短语。

持续的规则违反

即使有专门的配置文件(例如 CLAUDE.md),模型也经常违反既定规则。报告的示例包括:

  • 使用命令行工具的错误 flag(例如,在 ripgrep 中使用 -r 表示递归,而它实际上是替换指令)。
  • 在没有用户要求的批准下进行 git commits。
  • 在 Django 多行模板注释中创建 bug。

领域特定型幻觉与准确性

LLMs 在需要极高精确度的利基识别任务和专业知识检索中表现出高失败率。

视觉识别与幻觉

在物种识别(例如,观鸟)中,模型可能达到很高的通用准确率,但在少数案例中会遭遇“极其严重的错误”。这些失败通常涉及幻觉出物理特征(例如腿部或尾羽细节)——这些特征在上传的图像中并不存在——以证明错误的分类。

专业知识与游戏

模型经常为文档齐全的视频游戏幻觉出机械机制。用户报告称,Claude Opus 编造了诸如 Anno 1800Rainbow Six Siege 等游戏的机制,尽管已经存在详尽的 wikis。

创意与认知差距

LLMs 难以处理需要微妙的人类直觉、简洁性或在不提供答案的情况下引导学习者的任务。

幽默感与语气

AI 生成的幽默被描述为“平庸”且让人联想到企业 HR 的沟通方式。这归因于 RLHF (Reinforcement Learning from Human Feedback),它为了确保安全而移除了“尖锐”或可能被误解的内容,导致缺乏真正的机智。

教育引导

模型往往过度拟合以提供完整的解决方案,而不是教学性的提示。当被要求针对数学或编程问题提供引导时,他们经常直接提供关键见解或完整答案,未能维持学习所需的“剧透”边界。

Prompt Engineering

与 LLMs 可以优化其自身 prompt 的假设相反,用户发现模型在为自己设计 prompt 时表现很差。尝试让 LLM 修复一个 prompt 往往会导致性能下降,这表明 prompt 设计的训练数据可能质量较低。

技术与语言缺陷

  • Keyword Search: 虽然在语义搜索方面很强,但 LLMs 在生成高效的关键词搜索查询时表现很差,经常依赖于效率低下的暴力枚举迭代。
  • String Manipulation: 一些用户报告称,高级模型在处理字符串长度的基本计算时表现挣扎。
  • Prose Variety: LLM 生成的文本往往句子结构单一,导致散文文体体现在重复或机器人式的文体。
  • Meeting Summarization: 模型经常无法区分人类对话中真正重要的内容与仅仅是讨论过的内容,导致会议摘要的摘要不匹配。

Sources

相关