和一个"人"视频聊了半天,挂断后才发现对方根本不是人。Tavus 发布的 Griffin,把这件事的发生概率拉到了 48%。

这家公司称 Griffin 是首个通过视频图灵测试的 Human Interaction Model。在它之前,同类系统的通过率低于 3%。从 3% 到 48%,中间隔的不是一点优化,是一次量级跳变。

打开网易新闻 查看精彩图片

它到底能做什么

有作者拿到早期访问权限后体验了这个视频到视频模型。它的能力清单不长,但每一条都指向"像人":边看边听,能打断对方,也会被打断,还会对房间里发生的事做出反应。

这几件事拆开看都不新鲜,合在一起才是难点。打断与被打断意味着它得判断什么时候该停、什么时候该抢;对房间内事件的反应意味着它接收的不只是对话音频,还有画面里的环境信息。

3.83 分和 3.92 分

在 NVIDIA Video Full-Duplex Benchmark 上,Griffin 的生成得分是 3.83/5,真人的得分是 3.92。两者之间只差 0.09。

这个差距放在评测里不算小,但放在"人机对话"的语境里,已经足够让近一半的对话者放弃分辨。