llm.txt 的兴起:机器可读的网页内容能否修复人类体验?
llm.txt 文件的出现——专门为大语言模型(LLMs)设计的纯文本或 Markdown 文件——正在创造一个并行且精简的网页版本。这种转变表明,AI 革命可能会在无意中通过绕过主导现代互联网的营销密集型布局和复杂的 JavaScript,为人类提供更干净、信息密度更高的浏览体验。
机器可读内容对人类的吸引力
像 llm.txt 这样的机器可读文件旨在直接且不含那些经常阻碍人类导航的“营销密集型”元素。对于那些更喜欢 Gopher 或 Gemini 等早期网络协议的简洁性的用户来说,这些文件提供了一种访问网站核心价值的方法,而无需受到现代网页设计的干扰。
由于这些文件通常以 Markdown 或纯文本形式编写,它们提供了极高的信噪比,允许用户快速找到信息。然而,一个主要的摩擦点仍然是浏览器体验;像 Google Chrome 这样的标准浏览器无法原生渲染 Markdown,通常会让用户只能查看原始文本文件。
对无障碍访问的潜在好处
除了普遍的用户偏好外,向机器可读摘要的转变可能会显著改善网页的无障碍访问。通过用页面功能的简短、详细的文本描述取代冗长、非线性的 HTML 树状结构,网页可以变得对盲人用户和依赖辅助技术的人士更加易于导航。
“劣质化”与上下文中毒的风险
虽然 llm.txt 目前提供了一个干净的替代方案,但技术观察者之间存在一个强烈的共识,即这种格式容易受到与传统网页相同的退化过程。这个过程通常被称为“enshittification”(劣质化),遵循一个循环,即一个有用的工具逐渐被广告、虚假信息和算法操纵的叠加压力所破坏。
批评者认为,机器可读的网页不会保持纯净太久。潜在风险包括:
- 上下文中毒: 引入旨在操纵 LLMs 执行特定操作或花钱的“上下文中毒提示词”。
- 垃圾邮件集成: 垃圾邮件发送者不可避免地会迁移到任何新的、高可见度的文本格式。
- 商业化: 一旦该格式达到用户规模的关键点,就会逐渐加入广告和阴谋论。
采用与标准化问题
尽管兴趣日益增长,但 llm.txt 的采用尚未实现普及或标准化。用户注意到许多网站仍未实现这些文件,而且关于该标准是否在主要 AI 提供商的参与下开发的疑问也存在。一些用户建议,该标准应该被放置在 .well-known 目录中,以符合现有的网站元数据网络标准。
"我们把网页为人类使用的体验搞得太烂了,以至于我们不得不为机器构建一个干净的网页,而现在人类又不得不通过机器来重新体验一个干净的网页。"
这种情绪凸显了一种根本性的讽刺:正是那些为优化 AI 的网页而创建的工具,可能成为人类重新获得以文本为中心、实用的互联网体验的唯一途径。