人工智能技术再现突破。芬兰阿尔托大学的跨国团队开发出能够如实模拟人类阅读机制的AI模型,突破过去AI仅能模仿的局限,未来有望应用于智能眼镜排版,以及自动简化晦涩的法律文件。
这项研究由阿尔托大学(Aalto University)主导,联合香港科技大学、香港城市大学以及新加坡国立大学团队共同完成,10日发表于权威期刊《自然·人类行为》(Nature Human Behaviour)。
研究团队表示,新模型除了可以模拟人类阅读时如何分配注意力,还能够真正理解文本内容,切实解析读者接收信息的逻辑。
(来源:论文)
以往模拟人类阅读的AI模型,大多依靠输入大量文本与眼球运动数据进行训练。阿尔托大学教授安蒂·欧拉斯维塔(Antti Oulasvirta)称,旧模型只是在模仿人类行为,并没有真正掌握文本内容,得出的结论也无法跨语言通用,“这是我们首次利用人工智能去理解人类如何阅读,而不只是单纯模仿”。
关于运行原理,研究团队解释,该模型以“资源合理性”为核心:读者在阅读过程中会不断决定视线下一步看向何处,力求在有限时间内把理解程度最大化。视线控制的决策覆盖单词、句子到完整文本的多个层级。
香港城市大学教授赵盛东表示,这套模拟技术“为大脑运作提供了全新视角”。研究发现,阅读过程中的注意力分配,会受到文本语言,以及读者自身记忆力、眼球移动速度、清晰视野范围等个人特质的显著影响。举例来说,记忆力好、阅读速度快的人,可以快速在段落之间跳转;记忆力较差的读者,则常常需要反复回看重读。
为此,研究人员把读者的各项特征转化为可调节参数输入模型。欧拉斯维塔介绍,团队让模型接触数百万篇文本,让AI自主学习如何优化眼球运动,以此实现真正读懂内容。
模型会把阅读过的内容转化为“记忆表征”(memory representation),也就是精简压缩后的文本信息。这份记忆并不完整,但会随着模型扫过的字词不断累积;遇到关键语句时,视线会自动聚焦来获取信息。
研究团队还通过提问测试模型的理解能力,并将模型的注意力决策和真实人类的眼球轨迹做比对,证实该模型确实成功复现了读者的真实行为。
放眼未来,这项新技术将为阅读体验带来新的可能。欧拉斯维塔举例,未来几乎不用耗费太多人力,就可以把晦涩复杂的法律文件,转换成适配不同读者理解水平的通俗版本。
该研究还提到,增强现实(AR)应用也将迎来变革。借助眼球轨迹分析,开发者可以更贴合用户需求调整智能眼镜视野内的文字排版与展示节奏,让文字恰好在读者需要的时候,适时呈现在眼前。
点击图片可联系我们了解报告详情
马女士 Ms. Ceres
TEL:(+86)137-7604-9049
Email:CeresMa@cinno.com.cn
CINNO 公众号矩阵
热门跟贴