先别急着往下翻。

盯着这张图看三秒,满屏黑白噪点,像老电视机没信号时的雪花

大多数人第一反应是:这什么都没有啊。

但旧金山创业者 Eric Lu(做字体产品 Mixfont)把这张图做成了一段六秒视频,播放起来,字母会从噪点里自己"长"出来。

他把这段视频甩给了当时最前沿的两个智能体,Claude FableGPT 5.6 Sol Ultra,然后发了条推文:

"I created a font called Ghost Font that only humans can read. Tested it in Fable and GPT 5.6 Sol Ultra and neither was able to decipher it correctly."

“我做了一种叫 Ghost Font 的字体,只有人类才能读懂。我在 Fable 和 GPT 5.6 Sol Ultra 上测试过,两者都没能正确破译。”

这条推文很快被转到 Hacker News,顶上热榜第一页。

评论区吵成了两派:一派说这是天才实验,把AI的视觉盲区扒了个精光;

另一派冷笑一声, 等等,真有这么神?

打开网易新闻 查看精彩图片

Eric Lu 的原帖:一段黑白噪点视频,静止时几乎看不出任何字母

两个顶流模型,栽进了同一个陷阱

先说说这两个顶流模型到底是怎么"翻车"的。

在 Mixfont 官网的对照实验里,GPT-Sol 5.6 Ultra拿到视频后,闷头干了4分7秒,最后一本正经地报告:"It says: WRITTEN IN GHOST FONT",还贴心地把 188 帧噪声取了平均值,生成了一张清晰可辨的 revealed.png。

看起来很厉害对吧?

问题是,这份"答案"跟视频里真正藏着的那句话,压根对不上

Claude Fable Max(带最大推理强度)也没能幸免。

它花了近3分钟,跑了好几轮 shell 命令,用 ffmpeg 的 tmix 滤镜把全部帧叠在一起求平均,最后信心满满地宣布:隐藏消息是 "HELLO WORLD"。

同样,也不对。

打开网易新闻 查看精彩图片

两个顶尖模型都"读"出了结果,但那只是作者故意埋下的诱饵文案。视频里靠运动才成立的真消息,两个模型统统错过了

这就是 Ghost Font 最狡猾的地方,诱饵(decoy)。

作者早就料到,会有 AI 尝试把视频帧做平均、做统计分析。

于是他在噪声里额外埋了一层更容易被"平均"出来的假文案。

模型一旦读到这层诱饵,往往就满意地交卷了,压根不会意识到自己错过了真正靠运动才能读出来的那句话。

这种"AI 很努力,但努力错了方向"的画面,恰恰是整件事最好笑也最细思极恐的部分:模型算得挺认真,只是算错了方向,还一脸笃定地交了卷。

为什么人眼能看见,机器却看不见

这套把戏的原理,说穿了并不神秘,甚至可以说是个"返祖"的老套路。

Mixfont 官网首页放着一个能上手玩的 playground:输入一段话(上限36字符),页面立刻生成同款噪点动画,还能调速度、反色、下载视频。

默认文案是HELLO HUMAN

打开网易新闻 查看精彩图片

Ghost Font 官网 playground:一段点阵噪点在浏览器本地生成,作者称数据不上传服务器

秘密在时间里,不在空间里。

字母不会被"画"在某一帧上;

起作用的是字母区域的点和背景的点,各自遵循不同的运动规律。

人的视觉系统对这件事特别敏感,大脑会用"共同命运"这类格式塔原则,把运动方式一致的点自动归成一组,从而在几秒钟内"脑补"出字母轮廓。

这和玩过的 Magic Eye(魔术眼)立体画、随机点立体图,其实是同一个感知家族的把戏,科学上更准的叫法是随机点动景图(random-dot kinematogram)

而多数多模态模型处理视频时,走的是一条更"偷懒"的路:抽几帧,当成静态图片分析

单独拎出任何一帧,字母边界压根不存在,模型看到的自然只有均匀噪声。

它要么老实报告"只有噪点",要么把帧做平均读出诱饵,要么,这个更耐人寻味,在长时间"思考"后,干脆幻觉出一段根本不存在的句子

官网就记录过 ChatGPT 5.5 Pro 面对单帧分析了很久,最后给出的答案压根就是编的。

模型"很努力",不等于"读对了"。 这句话值得抄下来。

反转来得比想象中快

如果故事到这里结束,那就是一个"AI被人类完虐"的爽文。

但互联网的乐趣就在于,总有人不服气

推特用户 @ElQuesoSabisimo 贴出了自己的实验:桌面版对话模式下的 Claude Opus 4.8,没有作者的任何提示,只用了6分钟

Claude 自己的解读是这样的:

"Decoded it. The video is a random-dot kinematogram , every single frame is just noise, but the motion between frames spells out text. After compensating for global jitter and accumulating the motion energy, the message resolves cleanly across three lines: 'ONLY A HUMAN CAN READ THIS'"

“已解码。这段视频是随机点动景图,每一帧都只是噪声,但帧间运动拼出了文字。在补偿全局抖动并累积运动能量后,信息在三行上清晰显现:“ONLY A HUMAN CAN READ THIS”

Claude 自己还补了一句挺幽默的收尾: 讽刺的是,我并非人类,只是靠提取一致的运动信号把它读了出来,用的并非人类视觉那种感知方式 。

打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片
打开网易新闻 查看精彩图片

Claude Opus 4.8 桌面对话版,六分钟破解出真正的运动消息:"ONLY A HUMAN CAN READ THIS"

这条反转很关键:它能读对,前提是模型被允许写代码、跑分析脚本,光"看一眼图"办不到。

区别就在这,官方演示里失败的两个模型,走的是默认的抽帧视觉路径;

一旦切换到"理解这是运动掩膜,然后自己写脚本补偿抖动、累积运动能量"的 agent 模式,防线立刻就松动了。

连"字体"这个名字都有人来纠偏

推特上很快有技术型账号跳出来,给这场狂欢泼了盆冷水。 用户 @scaling01(自称 Lisan al Gaib)转发原帖并撂下一句评论:

"it's not a font. you need optical flow to read it, so of course LLMs (and humans) can't see it on static images"

“这压根算不上字体。得靠光流才能读懂它,所以大模型(和人类)当然在静态图上看不到。”

打开网易新闻 查看精彩图片

技术社区的第一反应:先把"字体"这个营销词拆穿,光流(optical flow)才是关键词

这句话戳中了要害。

Ghost Font 严格来说压根算不上传统意义上能安装的 TTF/OTF 字体文件,作者自己在官网正文里也承认了这点,它是一种用运动、视频、噪声和诱饵拼出来的图形通信实验。

更打脸的是,就连"人类能轻松读懂"这个前提,在 Hacker News 的评论区里也被撕开了口子。

有人说自己花了很久才意识到"Written In Ghost Text"只是诱饵,真消息读起来跟 Magic Eye 一样费劲,在手机上看甚至看出了头痛

隔壁楼层的另一位用户却说反过来,他一眼就能看清真消息,诱饵才是那个几乎看不见的东西。

有人靠调亮度、摘眼镜、把浏览器窗口缩放到30%才切换出另一层文字;

还有人干脆把手机横过来再竖过来,就能在两种读法之间来回切换。

打开网易新闻 查看精彩图片

HN 高赞评论区:有人只看得见诱饵,有人只看得见真文,屏幕分辨率和缩放比例都会左右答案

放在一起看,"人人都能秒读"的说法站不住脚,真正发生的,是"连人类自己都读不整齐"这件事。

十三年前,同一场战争打过一次

如果你觉得这个点子似曾相识,那是因为它确实有前传。

2013年,设计师 Sang Mun 发布过一款叫ZXX的字体,名字取自图书馆语言代码里表示"无语言内容"的编号。

它用迷彩纹理、噪点、打叉、装饰性假字母,专门用来干扰当年的 OCR 识别,被 WIRED 等媒体称为"防监控字体"。

那套办法在2013年确实管用。

但 Mixfont 官网做了个残酷的复现实验:把 ZXX 的样例图原样丢给现在的 ChatGPT,模型一个提示词、十几秒钟,就把主要单词全部读出来了,连细节都没放过。

2013年被称为"防监控"的 ZXX 字体,如今丢给 ChatGPT 秒读,静态对抗已经过时

静态字形对抗,在今天的视觉大模型面前,已经彻底失效了。

这也是 Ghost Font 为什么非要把战场从"空间"挪到"时间",不再靠涂鸦式的视觉噪声唬人,改用运动本身当密码,再加一层诱饵,专门对付那些会写分析脚本的智能体。

这条技术史的轨迹其实很清晰:对抗手段跟着识别器的能力一路上移,从字符分类器,到深度OCR,再到今天会写代码的视觉agent。

没有永远的防线,只有升级中的猫鼠游戏

把这件事往大了说,它撞上了一个更老的命题:CAPTCHA 的宿命

从最早的扭曲字母,到选交通灯、点红绿灯,人机验证的历史就是一部"机器越来越强、人类越来越累"的疲劳史。

HN 上已经有人把 Ghost Font 摆进同一条军备竞赛曲线里:任何公开的"人能解、机难解"方案,只要有经济价值,就会被针对性攻破,光流、帧差、相位相关,这些工具在自动驾驶和视频编码领域已经用了几十年,公开算法遇上公开工具,攻破窗口往往以周计,很少能撑到以年计。

作者本人其实心里门儿清。

他在官网上留了一句挺诚实的话:真想隐藏信息,还是得用加密

Ghost Font 从来算不上密码学方案,它更像一次感知边界的探针,用来测一测,当未来出现更懂"运动"的视频原生模型时,今天的失败会不会变成明天的及格线。

这场实验最后在中文互联网上,被压缩成了一句更轻松的调侃。 有博主转发时配文:

"有人发明了一种只有人类才能看懂的字体:Ghost Font!目前 Claude 和 Codex 等 AI 是没办法读懂的。有一天 AI 统治人类的时候也许能用得上"

这句玩笑话底下藏着一种挺真实的情绪,工具越强,人就越想给自己留一扇后门

哪怕理性上所有人都清楚,一个公开、可复现、还挂着 Download 按钮的视觉戏法,保鲜期注定短暂。

Claude Opus 用6分钟破解就是明证。

今天读不懂,不代表明天也读不懂。

今天被骗过去的,只是那条"抽帧当图看"的默认路径;

换成"允许写代码去理解运动"的agent能力线,防线立刻就松动了。

Ghost Font 真正戳破的,是"防线"这个词本身的保质期,AI的视觉短板,从来撑不了太久。