Google DeepMind AI 驱动的指针

Google DeepMind 正在开发一款由 Gemini 驱动的 AI 指针,将传统的鼠标光标转变为具备上下文感知的工具。该系统允许用户通过简单的指向和语音指令,在任何应用中与 AI 交互,免去手动将数据移动到单独的 AI 窗口或编写详细文本提示的需求。

核心交互原则

Google DeepMind 确立了四条指导原则,将提供上下文的负担从用户转移到计算机,从而实现更自然的人机协作。

保持流程

AI 功能被设计为跨所有应用运行,以防止出现“AI 绕路”。AI 驱动的指针让用户能够在当前工作流中完成任务,例如:

  • 请求对 PDF 的要点摘要,以粘贴到电子邮件中。
  • 将统计表格悬停时转换为饼图。
  • 将高亮食谱中的配料加倍。

展示与说明

为消除对精确、详细提示的需求,AI 驱动的指针会捕获光标周围的视觉和语义上下文。这样系统能够自动识别用户所指的具体单词、段落、代码块或图像区域,而无需明确描述。

拥抱 “这” 与 “那” 的力量

该系统通过将指向手势与语音相结合,支持使用自然的简写——例如“修复这段”或“把那儿移动到这里”。依赖共享的视觉上下文,AI 能够解析模糊代词,而无需在基于文本的提示中进行冗长解释。

将像素转化为可操作实体

AI 不仅仅跟踪坐标,还能理解指针下对象的身份。这将静态像素转化为结构化、可交互的实体,包括:

  • 将手写笔记的照片转换为交互式待办事项列表。
  • 将旅行视频中暂停的画面转化为所示餐厅的直接预订链接。

产品集成与可用性

Google 正在将这些 AI 指针原则集成到多个现有和即将推出的产品中:

  • Chrome:用户现在可以使用指针在 Chrome 中向 Gemini 询问网页的特定部分,例如比较所选产品或在房间中可视化家具。
  • Googlebook:名为“Magic Pointer”的功能将推送到 Googlebook 笔记本体验中,以提供直观的 Gemini 集成。
  • Google AI Studio:提供实验性演示,供用户测试 AI 指针在图像编辑和地图上寻找地点等任务中的表现。
  • Google Labs:未来概念将继续通过 Google Labs 的 Disco 进行测试。

Sources