报告:《斯坦福:2026年人工智能指数报告》
解读:三个皮匠报告

报告说,AI能力的发展速度,已经超过了我们管理它的准备程度。

斯坦福大学以人为本人工智能研究院(HAI)发布了第九版《人工智能指数报告》。

425页。14个核心要点。覆盖研发、性能、经济、教育、政策、舆论——几乎把AI的每一根毛细血管都剖开给你看。

报告基调是一句克制但分量极重的话:“AI能力的发展速度,已经超过了我们用来衡量、治理和理解它的体系。”

翻译成人话:AI在狂奔,人类在瘸行。

我从425页里捞出5个最扎心的真相,说给你听。

01 中美AI差距,已经“小到可以忽略”

01 中美AI差距,已经“小到可以忽略”

2023年初,美国顶尖模型在Arena排行榜上领先中国205分

到2026年3月,美国顶尖模型(Claude Opus 4.6,1,503分)领先中国顶尖模型(Dola-Seed-2.0 Preview,1,464分)39分——2.7%

2.7%什么概念?在同一个排行榜上,Anthropic、xAI、谷歌、OpenAI四家美国公司自己的模型差距都不止这个数。

2025年2月,DeepSeek-R1曾短暂追平美国顶尖模型。

两国在顶尖AI模型上的差距,已基本消失。

不是“追上”,是“打平”。从科研环境到投资体量完全不同的两条路径,在Arena排行榜上交汇了。

但别急着下结论。美国在顶级模型数量和高价值专利上依然占优——2025年,美国发布59个标志性模型,中国35个。美国私人AI投资2859亿美元,中国124亿美元——23倍的差距。如果单看私人投资,会严重低估中国的总投入,因为政府引导基金等资金来源未被计入。

前沿差距在缩小,但产业纵深差距依然巨大。

02 模型越强,我们知道的越少

02 模型越强,我们知道的越少

报告第1章有一个令人不安的趋势图。

2014年到2020年,标志性模型的参数量、训练数据集规模、训练时长都在公开披露。2022年开始,一条虚线在多个图表上戛然而止——OpenAI、Anthropic、谷歌不再披露这些关键数据了。

你能看到的只有模型名字和性能分数。训练代码、参数量、数据集规模、训练时长——“不详”。

标志性模型中,93个来自产业界,只有2个来自学术界。91.2%的前沿模型由企业主导开发。

更让人不安的是透明度指数的变化。基础模型透明度指数(FMTI)平均分,2023年是37,2024年涨到58,2025年跌回40。训练数据、算力、部署后影响等环节的披露存在巨大缺口。

能力在涨,透明在降。 一个越来越依赖少数私营公司的领域,外部研究者能看到的内部信息却越来越少。

03 AI事故一年飙升到362起,RAI却在“瘸行”

03 AI事故一年飙升到362起,RAI却在“瘸行”

2025年,有据可查的AI事故达到362起——2024年是233起,2022年之前每年不到100起。

事故类型五花八门:Grok因安全过滤器放宽生成反犹内容;AI深度伪造冒充演员诈骗粉丝;AI克隆网站盗刷信用卡——AI正在以前所未有的速度制造“麻烦”。

但报告更尖锐的洞察是:几乎所有领先前沿模型开发者都会公布MMLU、SWE-bench等能力基准的结果,但在RAI基准上的报告仍“稀疏且不完整”。

能力有排行榜,安全没有。

更麻烦的是,研究发现负责任AI的各个维度之间存在“内耗”——提升安全性可能损害准确性,增强隐私可能削弱公平性。没有任何干预方法能同时提升所有维度。

04 AI让职场人“更快”了,但没有“更强”

04 AI让职场人“更快”了,但没有“更强”

报告第2章罗列了AI在各领域的性能飙升:SWE-bench Verified一年内从人类基准的60%跃升至接近100%。Gemini Deep Think在IMO拿到金牌(35分,2024年是银牌28分)。Humanity‘s Last Exam一年内从不足10%准确率跃升至38.3%。

但第4章经济篇有一个更值得琢磨的数据:82.8%的职场人认为AI加快了信息搜集和处理速度,64.4%认可其减少重复劳动。

——听起来全是好事?

往下翻:19.8%的受访者感受到“AI依赖度加深,深度分析能力变弱”。16.5%觉得“同事/同行更卷了”。11.4%认为“领导预期变高”。

报告的原话是:“AI让职场人变得更快,但没有更强。”

AI在提升“效率”,但在某种程度上削弱了“能力”。效率不等于能力。

05 专家和普通人,活在两个平行世界

05 专家和普通人,活在两个平行世界

报告第9章的对比堪称“认知断层教科书”。

在AI对人们工作方式的影响上:73%的专家认为积极,23%的公众这么认为——整整差50个百分点。

经济影响:69%的专家积极,21%的公众——差48个百分点。

医疗健康:84%的专家积极,44%的公众——差40个百分点。

专家在欢呼,公众在焦虑。

更深的差距在未来预期上:64%的美国公众认为AI将在未来20年导致工作岗位减少,只有5%认为会增加。而AI专家中,39%预计减少,19%预计增加。

哪里出了问题? 也许是专家看到的是“能力曲线”——每六个月翻一番,最终改变一切。公众看到的是“生活经验”——AI写周报、生成假视频、让同事更卷——然后说:这不比人聪明,只是比人快。

两个群体都在说实话,只是看到了同一件事的不同侧面。

写在最后

写在最后

这份425页报告的核心矛盾,不是开源vs闭源、中美差距、就业冲击——虽然这些都很重要。真正的主线是:

AI的发展速度,正在超过我们管理它的能力。

技术性能在飙升——但RAI基准报告不完整,透明度在下降。

算力在指数级增长——但硬件供应链高度依赖台积电一家,全球AI基础设施的物理安全比很多人想象得更脆弱。

AI在加速科学发现——但专业领域模型在真实研究任务中的得分依然远低于人类专家。

普通人在日常工作生活中用AI——但学校AI政策只有6%的教师认为“清晰明确”。

开发AI的人相信自己能做好事,普通人担心AI会抢走一切。这两种叙事之间的裂缝,正在变宽。

这份报告的价值,不是告诉你AI有多强或多危险,而是用425页数据和图表,让这个裂缝被看到。至于怎么填——那是接下来所有人的事。

报告节选

报告节选

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片