假设有一天,临近下班,你收到了一份AI生成的工作日报:

“使用手机38分钟,离开工位24分钟,疑似闲置19分钟,工作专注度72分。”

你看了一眼,觉得有点冤。

那38分钟,是在跟客户确认一笔反复修改的订单。离开工位,是去仓库核对样品。至于那19分钟,你确实没怎么动,一直在想明天的方案该怎么改。

但报告上没有这些,只有数字。

这当然是一个设想。不过,它提出的问题很实际:当我们打算用AI判断一个人有没有认真上班,到底准备让它依据什么作出判断?

手机拿得最多的人,可能正在谈订单

从技术上说,让AI在画面中寻找目标,已经有成熟的开发工具。比如,Google公开的目标检测工具可以处理图片和视频,输出识别对象的类别、位置以及相应评分。具体能识别哪些对象,取决于使用的模型。

姿态分析也不是新鲜事。通过定位肩膀、手肘、手腕等身体关键点,系统可以进一步分析人的姿势和动作。

这些能力组合起来,可以用来设计一些具体功能:某个区域有没有人,某段时间里是否出现了指定动作,再把需要关注的片段筛选出来。

问题是,筛出片段之后,应该给它起什么名字?

“检测到手机”,是一回事。

“员工在玩手机”,是另一回事。

“员工工作不认真”,又往前走了一大步。

拿销售岗位举例。假设一个人整个下午都在手机上回复客户,另一个人始终坐在电脑前,却把一份早就做完的表格来回翻了几十遍。如果规则只计算拿手机的时长,前者可能更容易被标出来。

换成采购岗位,浏览购物页面可能是在比价;换成内容运营岗位,看短视频可能是在检查自己发布的素材。

这些情境不难理解。困难在于,一套统一的规则要怎样把它们区分开。

同一个动作,放在不同岗位、不同任务里,含义就可能完全不同。检测结果可以从画面中产生,工作背景却未必在画面里。

所以,看到“使用手机38分钟”这样的数字,合理的下一步应该是核实这段时间在做什么,而不是直接把它写成“摸鱼38分钟”。

分数越精确,就越客观吗?

如果一个人直接说“我觉得你今天不够认真”,你大概会追问依据。

但换成一张图表,配上时间轴、百分比和红黄绿标签,同样的判断就很容易显得有根有据。

其实,仍然应该问一句:这个分数算的是什么?

以目标检测为例,公开工具输出的是目标类别、相应评分和位置框。由此可以看出,一个用于支持“这是手机”的识别评分,不能直接拿来表示“这个人正在摸鱼”的把握有多大。 两者回答的不是同一个问题。

再设想一套打分方法:每离开座位一分钟扣一分,每使用手机一分钟扣两分,持续操作电脑则加分。

计算过程可以完全正确,最后的评价却未必合理。

一个上午完成任务的人,和一个拖到晚上仍没做完的人,谁更值得肯定?一个主动离开工位帮助同事解决故障的人,又该不该因为“离席时间过长”被扣分?

如果这些情况解释不清楚,那么小数点后再多保留两位,也不会让评价更公平。

当然,不是所有岗位都只看最终结果。值守、服务接待等工作,对在岗时间可能有明确要求。但即使如此,也需要区分正常交接、临时调度、规定休息和未经安排离岗。

打开网易新闻 查看精彩图片

数字可以很准确,数字所代表的意思仍然需要核实。

大模型能看懂视频,能不能顺便看懂工作?

有人可能会觉得,过去的算法只会识别人和手机,现在的大模型能描述视频、回答问题,应该不会再这么死板。

这确实是技术上的进步。Google的视频理解文档已经展示了视频总结、事件描述以及结合音视频内容回答问题等用法。与只检测某一类物体相比,这类模型能够处理更丰富的上下文。

比如,在一个假设场景中,员工先拿起手机,再对着设备拍照,随后把照片展示给同事。如果只看中间一张截图,很容易漏掉事情的前后经过。查看完整过程,至少能够获得更多判断线索。

但有些信息,无论把视频多看几遍,都不一定能补出来。

一个人打开购物页面,是在买自己的东西,还是采购公司的配件?一个人盯着文档很久,是没有理解,还是发现了一处关键问题?

只要这些不同情境在画面里呈现得一样,单靠画面就没有足够依据把它们分开。

这时,系统可能需要任务单、工作安排、业务记录等其他信息。讨论也就随之改变了:为了判断一个人有没有摸鱼,究竟需要收集多少信息?这些信息由谁查看,又会被拿来做什么?

有必要先把边界讲清楚,再决定接入哪些数据。

否则,一次原本用来核实在岗情况的分析,很容易被赋予越来越大的解释权:从人在不在,延伸到忙不忙,再延伸到态度好不好、是不是值得信任。

越往后,越不能只靠一段视频作结论。

当“看起来很忙”开始影响评分

我们还可以把这个设想继续往下推。

假如员工知道,离开座位会影响评分,那么他可能会减少走动,即使有些事情当面沟通更快。

假如长时间没有操作电脑就容易被标记,他可能会在思考时顺手移动鼠标,或者时不时敲几下键盘。

假如使用手机需要解释,那他或许宁愿花更多时间,把原本方便在手机上完成的工作转到电脑上。

这些行为并不必然发生,但它们是设计考核规则时应当考虑的后果:员工可能开始花时间适应评分,而不只是完成工作。

管理者原本希望提高效率,最后却可能得到一个更安静、动作更统一、人人都显得很忙的办公室。

至于事情有没有做得更好,还得另外检查。

关于监控与工作表现的关系,也有研究值得参考。一项发表于《Personnel Psychology》的元分析汇总了94个独立样本、涉及23461人,没有发现电子绩效监控提高员工工作表现的总体证据,同时发现监控与更高的员工压力相关。研究涵盖的是多种电子监控方式,不能直接据此断定某款AI摄像头有效或无效,但它提醒我们:监控投入与工作改善之间,不能直接画等号。

对企业来说,更值得追问的是,当前究竟哪里出了问题。

是关键岗位真的经常无人值守,还是任务安排不清?是员工没有按要求完成工作,还是需求一天改了三次?是有人长期把任务推给别人,还是认真解决问题的人一直没有得到合理评价?

这些问题需要的证据和处理方式,并不相同。

报告可以交给AI,解释机会应该留给人

AI并非不能用于工作管理。把它放在一个范围明确的任务里,价值反而更容易看清楚。

例如,对一个事先明确要求持续值守的岗位,系统发现异常后提醒负责人核实;对一段需要回查的录像,帮助缩小查找范围。此时,系统提供的是线索,人再结合现场安排确认发生了什么。

到了扣分、处罚和绩效评价,就应该更加谨慎。

被标记的人至少应当知道:系统截取了哪段记录,采用了什么规则,是否遗漏了前后过程,以及出现错误后由谁更正。

不能一边说AI只是辅助工具,一边在出现争议时,又用“系统就是这么算的”结束讨论。

回到文章开头那份虚构的日报。

“使用手机38分钟”,也许应该补上一句:“完成客户订单确认。”

“离开工位24分钟”,也许对应的是:“协助仓库核对样品。”

“疑似闲置19分钟”,也许暂时找不到一个可以量化的成果。但没有立刻产生成果,也不能自动证明那19分钟毫无意义。

如果将来真的要让AI为一天的工作写总结,希望报告里有一个位置,能容纳这些解释。

毕竟,认真工作的人已经要想办法把事情做好了,不应该还得额外练习,怎样让自己在镜头里显得足够忙。