AI 代理中的信任提示与远程代码执行之间的紧张关系

漏洞:一键远程代码执行

据报道,在 Claude Code 的信任提示机制中发现了一个安全缺陷,可通过一键远程代码执行触发。该漏洞本质上允许攻击者在用户的机器上执行任意代码,只要用户对特定文件夹授予了信任。通过操纵其余环境,攻击者可以绕过本应保护用户的同一信任提示。

信任提示悖论

此问题的核心是“信任提示”——一种旨在防止 AI 代理访问敏感数据或执行危险指令的安全措施。然而,该漏洞凸显了逻辑上的缺陷:如果用户点击“确定”以信任某个文件夹,实际上就是把王国的钥匙交给了代理(以及可能影响代理输出的任何恶意行为者)。

社区争论:用户错误 vs 系统性失误

对该漏洞的反应分为两派:一派认为系统是 AI 提供商安全架构的失败,另一派认为是用户错误。

用户责任论点

有人认为信任提示已经足够警示。如果用户信任了包含恶意内容的文件夹,或在信任被误置的环境中,失败并非工具本身,而是用户的判断。

系统会询问您是否信任 Claude 正在运行的文件夹。如果这种信任被误置,这并不是 Anthropic 的错。

开发者问责论点

另一些人认为,这些工具的用户并非安全专家,AI 提供商应实现防护措施,即使用户犯错也能防止灾难性后果。人们认为,将全部责任转嫁给用户是公司常用的规避对不安全默认设置负责的手段。

结论

随着 AI 代理从简单的聊天界面转变为本地开发环境中的活跃参与者,“信任提示”正变得不足以作为安全模型。行业必须转向更细粒度的权限、沙箱化,并拥有更强大的安全框架,而不是仅依赖用户对目录的二元信任或不信任选择。

Sources