在今天的Unicode字符集里,藏着一群身份成谜的“幽灵汉字”(日文称“幽霊文字”)。它们不是网络生造字,也不是罕见的古籍异体字,而是1978年日本JIS X 0208标准制定时意外产生的编码错误。 当年标准制定者从大量资料中收集汉字,依靠人工抄录与整理,难免出现字形辨认失误、出处记录混乱甚至来源彻底遗失的情况。这些“查无实据”的汉字被编入标准后,又随着字符集兼容进入Unicode,从此成为现代数字文本中的永久住客。 许多幽灵字符没有可考读音,也找不到真实文献用例,却在电脑和手机里安静地存在了四十多年。Unicode的收录原则本是“为所有真实文字提供数字身份”,而幽灵字符的存在,恰恰打破了这种理想叙事:它们既是技术史上的意外产物,也是标准系统“不完美”的活证据。 研究者至今仍在回溯档案,试图为这些汉字找到真正来源,而一些字符恐怕永远只能保持“幽灵”身份。这段编码史提醒我们:所谓标准,有时不过是人类错误被制度化后的漫长回声。

打开网易新闻 查看精彩图片