打开网易新闻 查看精彩图片

8 月 5 日,字节跳动发布了 SeedRealtime。其实就是AI 不只等你把一句话说完,也能在镜头和麦克风持续开启时,一边看画面、一边听你说话,再挑合适的时机回应。

Seed 官方页面称,这项能力已经在豆包 App 全量上线。

这听起来像一次普通的模型更新,但它改变的是使用习惯。以前问 AI,像把问题递到窗口里,等它回一张纸条;现在更像把它请到身边,让它看着、听着,随时接话。

官方演示画面:模型结合镜头里的资料与对话内容做概括
打开网易新闻 查看精彩图片
官方演示画面:模型结合镜头里的资料与对话内容做概括

它能帮上的忙,确实比“打字问答”多一些

看菜谱时,镜头对着食材,顺手问一句调料能不能替换;和孩子一起读绘本,卡在一个字上,让它看着书页解释;开线上会议时,拿它帮忙跟住屏幕和对话。这些场景并不稀奇,难的是以前的 AI 往往要你停下来:拍照、上传、输入,再等答案。

SeedRealtime 想做的是把这些步骤接起来。官方介绍里提到,它会同时处理声音、画面和时间顺序,也会试着判断该不该接话、什么时候先别出声。听起来很像人与人说话时那种不抢话的分寸。

实际好不好用,仍要看手机、网络、环境噪声和具体任务。发布页里的演示与内部评测可以说明方向,不能替代每个人手里的体验。但有一点很清楚:AI 正在从“回答一个问题”,往“陪着完成一件事”走。

麻烦也从这里开始

以前让 AI 写一段文案,交出去的是几行字。现在如果要它实时看、听,交出去的可能是一间客厅、一场会议、孩子正在读的书,或者旁边顺带被收进镜头的人。

很多人对这类功能的态度大概会很分裂。需要临时协助时,它省事得很;可一旦镜头和麦克风长时间开着,心里又难免会多一道坎:它到底看到了什么,听到了什么?

这个问题不能只用“信不信大厂”来回答。不同功能的权限、提示和数据处理规则可能不同,具体仍要以豆包 App 的隐私政策、功能弹窗和授权页面为准。用户能做的也很朴素:不用时关掉相机和麦克风权限;镜头里有其他人、工作资料、孩子信息或私人聊天时,先想一下是否真的需要 AI 参与。

官方演示画面:模型在亲子阅读场景中结合画面与语音回答问题
打开网易新闻 查看精彩图片
官方演示画面:模型在亲子阅读场景中结合画面与语音回答问题

别急着把它当成“更像人”的朋友

全双工的意思,是双方可以同时说话、也可以打断对方。这个能力做得顺,会让工具少一点机械感;可它没有因此变成一个懂得承担后果的人。

它会听错,也会把画面理解偏。豆包首页现在仍有“AI 生成可能有误,注意核实”的提示,这句小字反而很重要。涉及医疗建议、支付操作、合同内容、孩子安全这些事情,实时回应再自然,也不能替人做最后判断。

我更愿意把它当作一个反应变快的助手。它可以帮人找、听、记、解释,但别因为它会及时接话,就把该由自己确认的事也一并交出去。

AI 往前走得很快,用户的习惯也要跟着变。以后打开摄像头,可能不只是为了拍给朋友看,还会多一个正在理解画面的人机系统。方便是真的,边界也得自己先画出来。