假设有一天,临近下班,你收到了一份AI生成的工作日报:
“使用手机38分钟,离开工位24分钟,疑似闲置19分钟,工作专注度72分。”
你看了一眼,觉得有点冤。
那38分钟,是在跟客户确认一笔反复修改的订单。离开工位,是去仓库核对样品。至于那19分钟,你确实没怎么动,一直在想明天的方案该怎么改。
但报告上没有这些,只有数字。
这当然是一个设想。不过,它提出的问题很实际:当我们打算用AI判断一个人有没有认真上班,到底准备让它依据什么作出判断?
手机拿得最多的人,可能正在谈订单
从技术上说,让AI在画面中寻找目标,已经有成熟的开发工具。比如,Google公开的目标检测工具可以处理图片和视频,输出识别对象的类别、位置以及相应评分。具体能识别哪些对象,取决于使用的模型。
姿态分析也不是新鲜事。通过定位肩膀、手肘、手腕等身体关键点,系统可以进一步分析人的姿势和动作。
这些能力组合起来,可以用来设计一些具体功能:某个区域有没有人,某段时间里是否出现了指定动作,再把需要关注的片段筛选出来。
问题是,筛出片段之后,应该给它起什么名字?
“检测到手机”,是一回事。
“员工在玩手机”,是另一回事。
“员工工作不认真”,又往前走了一大步。
拿销售岗位举例。假设一个人整个下午都在手机上回复客户,另一个人始终坐在电脑前,却把一份早就做完的表格来回翻了几十遍。如果规则只计算拿手机的时长,前者可能更容易被标出来。
换成采购岗位,浏览购物页面可能是在比价;换成内容运营岗位,看短视频可能是在检查自己发布的素材。
这些情境不难理解。困难在于,一套统一的规则要怎样把它们区分开。
同一个动作,放在不同岗位、不同任务里,含义就可能完全不同。检测结果可以从画面中产生,工作背景却未必在画面里。
所以,看到“使用手机38分钟”这样的数字,合理的下一步应该是核实这段时间在做什么,而不是直接把它写成“摸鱼38分钟”。
分数越精确,就越客观吗?
如果一个人直接说“我觉得你今天不够认真”,你大概会追问依据。
但换成一张图表,配上时间轴、百分比和红黄绿标签,同样的判断就很容易显得有根有据。
其实,仍然应该问一句:这个分数算的是什么?
以目标检测为例,公开工具输出的是目标类别、相应评分和位置框。由此可以看出,一个用于支持“这是手机”的识别评分,不能直接拿来表示“这个人正在摸鱼”的把握有多大。 两者回答的不是同一个问题。
再设想一套打分方法:每离开座位一分钟扣一分,每使用手机一分钟扣两分,持续操作电脑则加分。
计算过程可以完全正确,最后的评价却未必合理。
一个上午完成任务的人,和一个拖到晚上仍没做完的人,谁更值得肯定?一个主动离开工位帮助同事解决故障的人,又该不该因为“离席时间过长”被扣分?
如果这些情况解释不清楚,那么小数点后再多保留两位,也不会让评价更公平。
当然,不是所有岗位都只看最终结果。值守、服务接待等工作,对在岗时间可能有明确要求。但即使如此,也需要区分正常交接、临时调度、规定休息和未经安排离岗。
数字可以很准确,数字所代表的意思仍然需要核实。
大模型能看懂视频,能不能顺便看懂工作?
有人可能会觉得,过去的算法只会识别人和手机,现在的大模型能描述视频、回答问题,应该不会再这么死板。
这确实是技术上的进步。Google的视频理解文档已经展示了视频总结、事件描述以及结合音视频内容回答问题等用法。与只检测某一类物体相比,这类模型能够处理更丰富的上下文。
比如,在一个假设场景中,员工先拿起手机,再对着设备拍照,随后把照片展示给同事。如果只看中间一张截图,很容易漏掉事情的前后经过。查看完整过程,至少能够获得更多判断线索。
但有些信息,无论把视频多看几遍,都不一定能补出来。
一个人打开购物页面,是在买自己的东西,还是采购公司的配件?一个人盯着文档很久,是没有理解,还是发现了一处关键问题?
只要这些不同情境在画面里呈现得一样,单靠画面就没有足够依据把它们分开。
这时,系统可能需要任务单、工作安排、业务记录等其他信息。讨论也就随之改变了:为了判断一个人有没有摸鱼,究竟需要收集多少信息?这些信息由谁查看,又会被拿来做什么?
有必要先把边界讲清楚,再决定接入哪些数据。
否则,一次原本用来核实在岗情况的分析,很容易被赋予越来越大的解释权:从人在不在,延伸到忙不忙,再延伸到态度好不好、是不是值得信任。
越往后,越不能只靠一段视频作结论。
当“看起来很忙”开始影响评分
我们还可以把这个设想继续往下推。
假如员工知道,离开座位会影响评分,那么他可能会减少走动,即使有些事情当面沟通更快。
假如长时间没有操作电脑就容易被标记,他可能会在思考时顺手移动鼠标,或者时不时敲几下键盘。
假如使用手机需要解释,那他或许宁愿花更多时间,把原本方便在手机上完成的工作转到电脑上。
这些行为并不必然发生,但它们是设计考核规则时应当考虑的后果:员工可能开始花时间适应评分,而不只是完成工作。
管理者原本希望提高效率,最后却可能得到一个更安静、动作更统一、人人都显得很忙的办公室。
至于事情有没有做得更好,还得另外检查。
关于监控与工作表现的关系,也有研究值得参考。一项发表于《Personnel Psychology》的元分析汇总了94个独立样本、涉及23461人,没有发现电子绩效监控提高员工工作表现的总体证据,同时发现监控与更高的员工压力相关。研究涵盖的是多种电子监控方式,不能直接据此断定某款AI摄像头有效或无效,但它提醒我们:监控投入与工作改善之间,不能直接画等号。
对企业来说,更值得追问的是,当前究竟哪里出了问题。
是关键岗位真的经常无人值守,还是任务安排不清?是员工没有按要求完成工作,还是需求一天改了三次?是有人长期把任务推给别人,还是认真解决问题的人一直没有得到合理评价?
这些问题需要的证据和处理方式,并不相同。
报告可以交给AI,解释机会应该留给人
AI并非不能用于工作管理。把它放在一个范围明确的任务里,价值反而更容易看清楚。
例如,对一个事先明确要求持续值守的岗位,系统发现异常后提醒负责人核实;对一段需要回查的录像,帮助缩小查找范围。此时,系统提供的是线索,人再结合现场安排确认发生了什么。
到了扣分、处罚和绩效评价,就应该更加谨慎。
被标记的人至少应当知道:系统截取了哪段记录,采用了什么规则,是否遗漏了前后过程,以及出现错误后由谁更正。
不能一边说AI只是辅助工具,一边在出现争议时,又用“系统就是这么算的”结束讨论。
回到文章开头那份虚构的日报。
“使用手机38分钟”,也许应该补上一句:“完成客户订单确认。”
“离开工位24分钟”,也许对应的是:“协助仓库核对样品。”
“疑似闲置19分钟”,也许暂时找不到一个可以量化的成果。但没有立刻产生成果,也不能自动证明那19分钟毫无意义。
如果将来真的要让AI为一天的工作写总结,希望报告里有一个位置,能容纳这些解释。
毕竟,认真工作的人已经要想办法把事情做好了,不应该还得额外练习,怎样让自己在镜头里显得足够忙。
热门跟贴