最近有一条关于 Codex 降智的言论传播挺广的: 部分 Codex 用户遇到的表现变差,是因为 OpenAI 的软性风控。账号如果被识别为中转用途,就会被降智。
还有朋友给出了两道测试题,要求用 GPT-6 Astra 的 medium 档来做:生成鹈鹕骑自行车的 SVG 动画,再解一道糖果题。
按这个说法,鹈鹕画不好,或者糖果题没答出 21,就算中招。
说实话,拿这两道题直接判断,我后面想了下,多少是有点草率了。
我让 Claude 把糖果题算了一遍。这里有个会改变答案的条件: 能不能按手感挑形状?
上面的 X 帖子给出了完整题面,明确提到不同形状靠手感可以分辨。
袋子里有三种口味、两种形状的糖果,数量如下:
形状
苹果味
桃子味
西瓜味
圆形
7
9
8
五角星形
7
6
4
题目要求提前决定取多少颗,保证手里能凑出一对不同形状的苹果味和桃子味糖果。圆形苹果配五角星桃子、圆形桃子配五角星苹果,都算成功。
我也用本地 Codex 测了这道原题,GPT-6 Astra 的 medium 和 high 档在这几次测试里都答出了 21,取法都是 9 颗圆形加 12 颗五角星形。下面是 high(高)档的一次执行结果:
可要是规则改成不能挑形状,只能随机取,且取出后不放回,答案就变成了 29。
最不走运的时候,你可能先拿到全部 24 颗圆形糖果,再拿到 4 颗五角星形西瓜味糖果。手里已经有 28 颗,仍然凑不出目标组合。
要一直配不成,圆形苹果与五角星桃子只能留一类,最多拿 7 颗;圆形桃子与五角星苹果也只能留一类,最多拿 9 颗。再加上全部 12 颗西瓜味糖果,上限就是 28 颗,第 29 颗才能保证成功。
所以,21 和 29 对应两套取糖规则。按这份题面允许辨认、挑选形状的通常理解,答案应是 21。模型若直接按随机抓取算出 29,确实漏用了条件,不能替它说成完全答对。
但从漏条件、答错题,推到账号被 OpenAI 特意限制,中间还缺证据。只看最后那个数字,也看不出模型究竟在哪一步出了问题。
画一个骑自行车的鹈鹕
X 上已经有人贴出了自己的鹈鹕。
吐槽说 Astra 连鹈鹕骑车都画不好了,并特别提到自己用的是 Ultra。
可以看到,鹈鹕的身体、腿和车架之间的关系也画得别扭。
Astra Ultra 鹈鹕测试反馈:画面中的骑行姿态别扭,另一张结果图出现模型容量不足提示
还有一条反馈挺有意思。有朋友说自己在 Codex 重置后明显感觉效果变差,但拿鹈鹕来测,却能正常完成。
我也在本地跑了一遍原帖的动画题。Astra medium 一次生成的 HTML 能正常打开,车轮和双腿会动;high 档的三次静态 SVG 也都能渲染。
本地 Astra medium 按 X 原提示词生成的鹈鹕骑车动画 GIF
所以说,鹈鹕画得好,也不能替日常写代码的表现作保证。
比较时还得把任务说清楚。直接输出静态 SVG、写一个网页动画、调用图像生成工具,做的是不同的事。SVG 是用代码描述图形的格式;这次流传的提示词要求用 SVG 做动画,不能拿图像生成工具画的一张图来替代。
官方确实提过临时降级
OpenAI 文档里确实提到了 temporary downgrade,也就是临时降级这个说法。
它提到,多次登录失败、来自未知地点的访问等可疑活动,可能触发临时降级。整页讨论的是模型访问或部分能力暂时受限,还包括模型选项可见但无法选择、用量达到限制,以及账号变更等情况。
这份说明没有给出具体的降级实现,也没有说会专门识别中转账号,在继续显示 Astra 的情况下偷偷降低它的推理能力。
不过,有一点确实很明显,就是每次重制额度之后就很容易降智。我之前也发文字消息吐槽过: 如果你经常觉得 Codex 蠢到离谱,不...
热门跟贴