webmachinelearning/webmcp

🤖 WebMCP

解决的问题

WebMCP 解决了 AI 代理在与现代网页应用交互时面临的困难。传统上,代理依赖于脆弱的技术,如 DOM 抓取或模拟鼠标点击,这些方法不可靠,且常常绕过应用的内部状态和身份验证。WebMCP 允许网页开发者将特定网站功能作为结构化的「工具」暴露出来,供代理直接调用,从而在保持用户知情的前提下,实现更可靠的网页操作。

工作原理

WebMCP 引入了一个客户端 API(document.modelContext),允许开发者将 JavaScript 函数或 HTML <form> 元素注册为工具。每个工具都包含自然语言描述和结构化输入模式。当 AI 代理(无论是内置在浏览器中,还是托管在 iframe 中)需要执行某个操作时,它会发现这些已注册的工具,并使用正确的参数调用它们。浏览器负责中介调用,执行客户端逻辑,并将结果返回给代理,代理随后更新 UI 或通知用户。

适用人群

适用于希望在不构建独立后端集成的情况下,使自己的应用“支持代理”的网页开发者,以及需要一种稳定、由开发者定义的方式来与网页内容交互的 AI 代理开发者。

主要亮点

  • 客户端执行:复用现有的 JavaScript 逻辑,无需单独的后端服务器即可保持用户身份验证和会话状态。
  • 人在回路中:专为协作式工作流设计,用户在代理执行任务时仍能保持对页面的可见性和控制权。
  • 混合方法:同时支持通过 JavaScript 的命令式注册和通过 HTML 表单的声明式注册。
  • 安全委派:使用 Permissions Policy(allow="tools")控制哪些 iframe 或源可以访问已注册的工具。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目