问一个产品团队,为什么他们的AI功能感觉慢,得到的往往是一耸肩,外加一句技术解释:模型要跑八秒,推理很贵,大家的模型都慢。
这句耸肩里藏着一个假设:400毫秒这条线属于绿屏终端和整笔交易的时代,生成式AI已经把它作废了。事实恰恰相反——它改写了这条线的工作内容,而新工作完全落在请求的设计者这一侧。
Walter Doherty和Ahrvind Thadani当年测量的,是机器让人等待时,人的注意力会发生什么,并且给这件事标了价。生成式AI改变的,是被测量对象的形状:它把一个事件拆成两个——确认和答案——而这条线跟着确认走。
从吞吐量到监督成本
赌注也变了,这才是值得争论的部分。1982年,一次慢响应损失的是吞吐量;在一个AI产品里,它损失的是监督。
每个AI功能都默认有人正足够专注地盯着,好在模型出错时抓住它。而注意力,恰恰是Doherty阈值所保护的东西。确认的预算就是监督的预算。超支了,产品所依赖的那个人类审核环节,就会悄无声息地不再发生。
1982年那篇论文《The Economic Value of Rapid Response Time》把每小时交易数和系统响应时间画在一起,形状不是一条直线。在约400毫秒以下,生产率的爬升比省下的时间所能解释的更快,因为变化发生在操作者身上,而不是机器上。
人们不再围绕停顿来分批处理自己的思考。他们保持一条思路,而不是每次回来都重建上下文。这首先是一个经济学论证,其次才是设计论证——这也是为什么这个数字在一屋子高管面前依然管用。系统响应时间下降时,操作者自己的思考时间也跟着下降。
这条线从来不是在说电脑能想多快,而是在说一个人愿意把一个念头握住多久。
毫秒值百万
速度很重要,而且它一直在被重新测量。Deloitte Digital在2020年的《Milliseconds Make Millions》中发现,0.1秒的速度提升让37个品牌的零售转化率提高了8.4%。
它运行的预算和对话一样:一项跨十种语言的研究发现,对话中轮次之间的间隔中位数约为100毫秒。这条线此前也被改写过多回。Jakob Nielsen把同样的物理规律用三个限制重述给网页:十分之一秒感觉是即时的,一秒保持思维流动,十秒是注意力的边缘。这些数字自那以后一直支配着界面工作。
1982年,请求和响应是一个事件,一只钟覆盖全部。生成式交互是两个事件穿着一件戏服:轮次,问的是系统有没有听到你;工作,问的是答案好不好。
Josh Clark和Veronika Kindred在《Say Hello to Sentient Design》中把结果称为智能界面:一个在当下组合出响应、而不是端上预制菜的系统。
Artificial Analysis报告的是首个答案token的时间,以秒计,而对推理模型来说,这个数字包含模型开口之前所做的全部思考。团队读到这个数字,断定交互是秒级的,并据此设计。他们把对模型的测量当成了对界面的测量。
界面有自己的预算,不依赖推理,在一部糟糕的手机上也能在50毫秒内回显输入。模型可以花八秒返回答案,但按下发送键之后的最初那段时间不行。
在企业软件里,这个错误会被放大,因为用工具的人面前有一条队列。微软2025年的遥测显示,Microsoft 365用户平均每个工作日收到117封邮件和153条Teams消息,每两分钟被打断一次。
把AI辅助放到这样一份清单上,一秒的确认延迟就是每天四分钟无人应答的点击,分布在270个此人本就正被拉向别处的时刻。消费级聊天里,一次慢轮次换来一个好奇的用户;工作软件把它乘以队列。
流式输出不是确认
流式输出是每个团队都会伸手去抓的模式,它也确实配得上名声。文字以你阅读的速度抵达,让一个长答案感觉像对话而不是排队。但它解决的是错误的问题。
Luke Wroblewski早在2013年的《Mobile Design Details: Avoid The Spinner》里就在反对首个token之前的空档。人们真正感受到的失败发生在那之前:按下去什么都没产生,输入被清空却没有任何东西补位,推理模型花十五秒决定怎么开头时,线程空坐在那里。
Google的标准比Doherty更紧,而且直接对准发送键:Interaction to Next Paint把真实访问第75百分位上200毫秒或更少视为良好。无论模型接下来做什么,你的提示框已经被这条线管着了。
修复它需要的是一周的前端工作,外加一个完成定义,而不是更便宜的推理。
热门跟贴