大湾区经济网9月18日讯 AI安全公司Anthropic近日发布了一套全新的AI发展评估指标体系,旨在为行业提供一个客观、可量化的标准,衡量AI模型在能力、安全性和社会影响等维度的发展速度。
这套名为“AI Progress Metrics”的指标体系涵盖四大维度:能力基准、安全评估、环境影响和社会经济效应。Anthropic表示,当前AI行业缺乏统一的发展衡量标准,不同公司各自为政,导致外界难以准确评估AI技术的真实进展。
在能力基准方面,该指标体系涵盖了推理、数学、编程、语言理解、视觉感知等多个子维度,并引入了“能力加速度”的概念——不仅衡量模型当前的性能水平,还量化性能提升的速度。Anthropic的数据显示,过去18个月主流AI模型的综合能力提升幅度约为35%,但部分子领域(如复杂推理)的进步速度明显放缓。
安全评估维度是该指标体系的亮点。Anthropic提出了“安全-能力比”的概念,即在衡量模型能力的同时,量化其安全风险水平。数据显示,最新一代模型的安全-能力比相比两年前改善了约60%,但随着模型能力的持续提升,新的安全风险也在不断涌现。
Anthropic CEO达里奥·阿莫迪表示,发布这套指标的目的是推动全行业建立共识。“AI的发展速度不应该由各公司自行宣传,而应该由客观、可复现的指标来衡量。”他呼吁OpenAI、Google、Meta等主要AI公司共同参与到标准制定中来。
业内观察人士指出,缺乏统一的评估标准不仅导致企业间难以横向比较,也使得投资者在判断AI系统真实能力时面临巨大盲区。Anthropic此番率先提出框架性指标,某种程度上是在争夺行业话语权。后续能否获得主要竞争对手的响应和监管机构的认可,将决定这套体系能否真正发挥行业基准的作用。
目前,已有多家研究机构对该指标体系表示支持。斯坦福大学人工智能研究所表示,这套指标为AI发展的量化评估提供了有价值的框架,但建议进一步扩大评估样本量和测试场景的覆盖面。
文/王鹏飞,封面图/资料图
来源:大湾区经济网
热门跟贴