1978年,日本一份重要的编码标准中出现了一些来源不明的“幽灵文字”(幽霊文字)。经过1997年的一次调查,人们发现这些字符大多是由于在整理和抄录过程中的无心之失(例如将纸张的接缝误认为笔画)而被创造出来的。尽管大部分“幽灵”的来源都已查明,但这些错误的字符最终还是被纳入了国际通用的 Unicode 标准,从而成为了全球计算机系统中一个永久存在的、潜伏在字符表角落里的数字遗产。
幽灵的诞生
1978年,日本经济产业省制定了后来的 JIS X 0208 编码标准。但在标准发布后,人们注意到其中一些新增的字符非常奇怪:
- 没有明确的来源
- 无人知晓其含义或读音
- 无人确定它们从何而来
这些字符就是后来被称为 “幽灵文字” 的存在。
长期以来,这些幽灵文字一直是一个未解之谜,几乎被人们遗忘。
艰难的追溯调查
1997年,一项旨在揭开这些字符来源的调查正式启动。尽管按照规定,JIS 标准中的每个字符都应有出处记录,但这些记录往往非常模糊,通常只列出其来源的文件名称。
这项追溯工作极为困难。例如,幽灵文字的一个常见来源是《国土行政区画总览》,这是一份日本地名的综合清单。你可能以为它是一本几百页的地图册,但实际上最新版是一套七卷本的巨著,每卷约九百页。想象一下,在没有任何页码提示的情况下,从近万页的资料中寻找一个字符的来源是多么困难。
错误如何发生:一个实例
尽管困难重重,调查最终还是成功揭示了大多数幽灵文字的起源。通过采访当年参与标准制定的编目员,调查人员确认,一些字符是在编目过程中的失误中被无意创造出来的。
以 “妛” 字为例:
- 目标: 工作人员试图收录一个由“山”和“女”上下组合而成的地名用字 (𡚴)。
- 问题: 当时无法将这个字作为一个整体打印出来。
- 操作: 他们将打印出的“山”和“女”剪下,粘贴到一张纸上,然后进行复印。
- 错误: 在读取复印件时,两张小纸片拼接处的接缝 被误认为是一个横向的笔画,从而错误地创造出了“妛”这个新字。
永恒的数字遗产
最终,在所有核心的幽灵文字(如 妛、挧、暃、椦、槞、蟐、袮、閠、駲、墸、壥、彁)中,只有一个字符既没有明确的来源,也没有任何历史先例:彁。最可能的解释是,它是在阅读手写文献时,将 “彊” 字误读而产生的,但具体是哪一次误读已无从考证。
1978年的一系列小错误无中生有地创造了一些字符。这些错误在被发现之前,就已足够长的时间被固化下来。现在,这些幽灵潜在地成为地球上每一台计算机的一部分,潜伏在字符表的黑暗角落里。
随着 JIS 标准被广泛采用,所有这些幽灵文字最终都进入了 Unicode 编码,与我们永远共存。