文 | AIX财经,作者 | 陈丹,编辑 | 魏佳 马斯克想让Grok在今年年底前拍完一部《奥德赛》。 这听起来像典型的马斯克式Flag:用AI挑战诺兰、好莱坞和2.5亿美元制作预算。但真正值得关注的,并不是Grok能不能在五个月里生成几千个镜头,而是它是否已经拥有把一项复杂任务从头做到尾的能力。 Grok 4.6发布后,这个问题有了更具体的答案。在最新一轮模型竞争中,它已经挤进美国大模型的第一梯队:能力接近OpenAI和Anthropic的旗舰模型,编程成绩甚至在部分榜单领先,API价格却明显更低。与此同时,它在长链条Agent任务上的短板依然存在——会理解问题、会搭框架、会快速启动,却还不够稳定地收尾。 这恰好也是眼下大模型竞争的缩影。当能力差距缩小、Token越来越便宜,真正决定商业价值的,已经不只是“模型有多聪明”,还要看一次任务能否稳定完成,以及完成一次到底要花多少钱。 01. Grok 4.6上了牌桌,但还拍不了《奥德赛》 诺兰的《奥德赛》从立项起就被马斯克骂了好几轮。骂选角、骂改编
打开网易新闻 查看精彩图片
热门跟贴