跳到正文
原文
Google DeepMind·· 2026-03-29精选AI 评分60

Google DeepMind 重新构想由 Gemini 驱动的 AI 鼠标指针

Reimagining the mouse pointer for the AI era

AI 导读

Google DeepMind 正探索由 Gemini 驱动的 AI 鼠标指针,让系统理解用户所指内容及其重要性,从而在现有工具中直接协作。他们提出保持流程、看图说明、用简短指代配合语音,以及把像素变成可操作实体四项原则。

推荐理由

文中提出四条交互原则,说明指针如何在当前工具里理解所指内容,把详细提示和跨窗口搬运换成指向与口语。

正文 · AI 翻译

2026年5月12日 研究

Adrien Baranes 和 Rob Marchant

我们正在开发更流畅、更直观的与 AI 协作方式

鼠标指针一直是电脑屏幕上的常伴之物,贯穿每一个网站、文档和工作流程。尽管技术已经改变,指针在半个多世纪里几乎没有演变。

我们一直在探索由 AI 驱动的新能力,帮助指针不仅理解它所指向的内容,还理解这对用户为何重要。

我们的目标是解决一个常见的困扰:由于典型的 AI 工具存在于自己的窗口中,用户需要把自己的世界拖进去。我们想要的恰恰相反:直观的 AI 在用户使用的所有工具中与他们相遇,而不打断他们的流程。例如,想象指向一张建筑物的图片,并请求“显示路线”。当 AI 系统已经理解上下文时,无需更多操作。

今天,我们概述了指导我们对未来用户界面思考的基本原则,并分享由 Gemini 驱动的 AI 指针的实验演示。例如,你可以访问 Google AI Studio,仅通过指向和说话来编辑图片或在地图上查找地点。

这段视频展示了我们 AI 指针的实验环境。全程片段均已缩短。

我们的交互原则

我们制定了四项原则,它们共同将传达上下文和意图的繁重工作从用户转移到计算机,用更简单、更直观的交互取代冗长的文本提示。以下是我们的方法和原则的图示。

保持流程

AI 能力应在所有应用中发挥作用,而不是迫使用户在它们之间走“AI 弯路”。我们的原型 AI 指针在用户工作的任何地方都可用。例如,他们可以指向一份 PDF 并请求要点摘要以直接粘贴到电子邮件中,悬停在统计表格上并请求饼图版本,或高亮一份食谱并要求将所有食材加倍。

展示与讲述

当前的 AI 模型要求精确的指令。为了获得良好的回应,用户必须撰写详细的提示。AI 指针将通过顺畅捕获指针周围的视觉和语义上下文来简化这一过程,让计算机“看见”并理解对用户重要的内容。在我们的实验系统中,只需指向,AI 就确切知道用户需要帮助的是哪个词、段落、图像的哪一部分或代码块。

拥抱“This”和“That”的力量

在日常彼此互动中,人类很少用冗长、详细的段落说话。我们可能会说“修好这个”“把那个移到这里”,或“这是什么意思?”——同时依靠肢体动作和我们共享的上下文来填补理解上的空白。一个理解上下文、指向和语音这一组合的 AI 系统,将允许用户用自然的简略说法提出复杂请求,无需繁琐的提示。

将像素转化为可操作的实体

几十年来,计算机只追踪我们指向哪里。AI 现在也能理解用户指向的是什么。这将像素转化为结构化实体,例如地点、日期和物体,用户可以立即与之交互。一张潦草笔记的照片变成交互式待办清单;旅行视频中的暂停画面变成那家看起来很酷的餐厅的预订链接。

构建能够适应人类行为的技术——而不是强迫用户去适应它——将开启一个与 AI 协作真正直观、流畅且无缝的未来。

我们很高兴这些以人为本的理念正被融入我们每天使用的产品中。

将这项工作应用于我们的产品

我们正在整合这些原则,以重新构想 Chrome 以及我们全新的 Googlebook 笔记本电脑体验中的指向交互。从今天起,你不必再编写复杂的提示,而是可以用指针向 Gemini in Chrome 询问你关心的网页部分。例如,你可以选中页面上的几件产品并要求进行比较,或者指向你想在客厅中可视化一张新沙发的位置。同样,我们很快将在 Googlebook 中推出 Magic Pointer,让用户能够在指尖调用 Gemini,获得更直观的体验。由于还有许多其他潜在的出色应用,我们将继续在各个平台上测试未来概念,包括 Google Labs’ Disco。

在 Google AI Studio 中试用支持 AI 的指针

来源:Google DeepMind · deepmind.google