Tavus 发布了 Griffin,称这是首个通过视频图灵测试的模型,归入 Human Interaction Model(人类交互模型,HIM)这一类目。

测试结果里最扎眼的是那个数字:与 Griffin 实时对话的受访者中,48% 认为它是真人。作为对照,此前同类系统的通过率低于 3%。

打开网易新闻 查看精彩图片

从3%到48%

视频图灵测试的难点在于,对话不只是文字往返,还叠加了实时画面与交互节奏。受访者要在这种条件下判断对面是不是人,误判率越高,说明系统越接近真人表现。

3% 到 48% 的跨度,是这次发布里被反复引用的核心数据。

基准排名与同行反应

除了受访者判断,Tavus 还给出了另一项成绩:Griffin 在 NVIDIA 的全双工 AI 视频基准上排名第一。

fal 转发了这次发布,并向 Tavus 团队表示祝贺。