IT时代网8月25日消息,卡迪夫大学与墨尔本大学的一项新研究发现,生成式人工智能目前还无法像人类教师一样可靠地评判学生的书面作业。
研究人员使用某大模型的两个版本,对 50 篇生物科学专业本科生论文进行评分,要求模型按照 7 项标准批改,并采用 4 种不同的提示方式,随后将大模型与人工评分的平均分和分数波动情况进行对比。结果显示,模型给出的分数波动很大,无法准确预测人工评分;两者在只看论文总分时结果相对接近,但具体到每项评分标准和每一篇论文,差距就相当明显。
除一种情况外,AI 模型给出的平均分普遍高于人工评分,平均分方面最大差距达到 16.1 分,单篇论文最大差距达到 40 分。研究还发现,AI 往往会压低高分论文成绩,又抬高低分作业成绩,使分数系统性地向中间集中。
研究人员指出,至少现阶段,即使经过大量训练,AI 仍无法可靠地对主观性较强的书面作业给出与人类相当的分数,并不适合取代教师为学生预测成绩。同时,未经学生明确同意便把作业提交给 AI 工具,本身还涉及伦理问题。不过随着大模型发展,未来模仿人类判断的能力可能会提高。
打开网易新闻 查看精彩图片
注:本文综合自IT之家等,文中包含AI辅助创作的内容。
热门跟贴