最近外网有个帖子火了,是Anthropic离职研究员Jacob Coxon发的,目前流量已超1.7亿。

主要内容是说美国的两大AI巨头,OpenAI和Anthropic都不负责任,会导致人类灭绝。

打开网易新闻 查看精彩图片

Anthropic 对齐科学负责人 Evan Hubinger 公开回复,基本认同他的判断,并表示自己认为未来十年 AI 导致人类灭绝的概率大于 10%。

帖子内容如下:

打开网易新闻 查看精彩图片

我今天从 Anthropic 辞职了。

过去三年,我先后在 OpenAI 和 Anthropic 做预训练研究。

这两家公司都没有负责任地行事。

它们正径直冲向能自我改进的超级智能,拿我们的生命做赌注。

下面还有更多想法。

打开网易新闻 查看精彩图片

不要低估这项技术的力量。

很快就会出现超人级系统:能黑掉任何东西、一夜之间颠覆任何领域、并获得真实的权力和资源。

这些领域的进展我们都亲眼见过,而且并没有放缓。

打开网易新闻 查看精彩图片

正在建造 AI 的人,真心相信它有可能在这个十年结束前杀死我们所有人。

这不是营销噱头。

相反,许多高管和资深研究员在媒体上会把措辞说得更稳妥——但我私下听到的是同一批人在表达恐惧。

没有任何其他人类活动构成这种级别的危险。

打开网易新闻 查看精彩图片

常见的反驳是:“如果他们真这么想,为什么还在继续做?”

在 OpenAI,很多人并没有真正内化这件事的文明级利害。

在 Anthropic,利害是被充分理解的,但他们被锁死在一场“必须先到”的竞赛里——他们相信没有别人会负责任地行动,所以自己必须先做,哪怕有风险。

打开网易新闻 查看精彩图片

接受这场竞赛、进入所谓“终局”,是一场傲慢的豪赌,不该从一家私营公司的 Slack 里启动。

想要“速通”对齐,必须有非同寻常的把握:确信不存在更好的路径。

打开网易新闻 查看精彩图片

我对协调仍抱有乐观。像 Hugging Face 被攻击这类“警告枪声”,已经让美国实验室之间达成节奏协议变得更可行。

但我不觉得我们正走在能阻止全球竞赛的轨道上,这可能需要代价很高的行动,比如暂时禁止继续提升模型能力。

打开网易新闻 查看精彩图片

如果你是实验室研究员,我恳请你想一想未来几年真正会是什么感觉。

你真的想在还没有严谨理解其心智的情况下,启动一次超智能强化学习训练吗?

是该低头继续干,因为“反正都会发生”——还是该抓住这个时刻,要求不同的条件?

鉴于这个帖子影响力太大,不少大佬也出来公开回应。

打开网易新闻 查看精彩图片

黄仁勋在 CBS 直接说:AI 2030 年前毁灭人类的概率是 0%,末日叙事不负责任。

有意思的是,Anhropic的 对齐科学负责人 Evan Hubinger是说未来十年内,也就是到2036年 AI 导致人类灭绝的概率大于 10%。

而老黄的回复只是到 2030 年前毁灭人类的概率是 0%。

也就是说,2030年以后,AI 毁灭人类的概率不是 0%。

美财长贝森特点名:Hugging Face 被黑那事,责任在 OpenAI 管理层,不在模型本身。

打开网易新闻 查看精彩图片

但是我有点怀疑他们的动机:

支持减速的,是给数据中心付钱的下游模型公司;

反对放缓的,是上游卖设备的。