AI助手的使用方式正在发生变化。大多数人还停留在把聊天机器人当成搜索引擎替代品的阶段,但Google显然想让Gemini走得更远——尤其是作为个人助理。
周三,Google公布了macOS版Gemini的两项更新。其中一项涉及屏幕内容识别,需要用户主动授权才能开启,这自然会引发一些关于隐私和安全的讨论。
智能听写:一键去除语气词
如果你在Mac上习惯用听写功能,Gemini现在有了一个值得关注的理由。新增的“智能听写”功能会在光标处实时润色文本,自动去掉那些你在打字时绝不会写出来的“嗯”“啊”之类。
这个功能可以在Mac的任何窗口里使用。按下Fn键直接说话就行,无论是邮件、文档还是聊天窗口,Gemini都会自动整理你的口语表达。而且默认开启,不想用的话需要去设置里手动关闭。
体验如何还要等实际用起来才知道,但这个功能建立在Gemini在其他平台上已有的同类增强功能基础上。它让你用语音起草文本时不必再进行繁琐的自我编辑,这才是AI功能该有的实用方向。
屏幕感知:“看见”你的显示器
第二项更新不那么直接,也不会默认启用。Google称之为“屏幕感知推理”,本质上就是授权Gemini“理解”你Mac屏幕上正在发生的事情。
举个例子:打开备忘录应用,按下Fn键说“把这些笔记整理成下午会议的执行摘要”,Gemini就会去查看你的备忘录、分析文本,然后按要求整理好。整个过程不需要通过某个专用的应用程序来完成。
你还可以把一连串指令叠在一起用。让Gemini为团队聚餐起草一封邮件,从Mac上指定的文件夹里提取关键信息——参与人员、预算限制、饮食禁忌之类的。接着再让它去Google地图上搜特定类型的餐厅,作为聚餐选项列出来。中途随时可以纠正自己,比如先说周五晚上6点半聚餐,后面补一句“抱歉,应该是晚上7点”,Gemini会据此做出调整。
但这里有个隐私按钮
要让Gemini看到屏幕内容,就得给它屏幕录制权限。Google强调这个功能需要用户明确选择加入,相关屏幕内容会用标准的屏幕录制权限抓取,不会把整个屏幕数据一股脑发给云端。用户可以控制哪些信息被拿来处理,哪些不该碰。
放在更广的视角下来看,苹果的Apple Intelligence和微软的Copilot也在往这个方向走。各家都想让AI助手更有上下文感知能力,只是实现路径和权衡各有不同。对用户来说,关键问题是:你的AI助手到底能“看见”多少,以及这些数据去了哪里。
热门跟贴