当AI机器人开始大规模读取网页内容时,一个令人尴尬的事实浮出水面:全球访问量最高的网站中,近九成存在HTML代码违规。
法国开发者Théo Ducreux主导的独立项目ValidateHTML,对Tranco榜单上排名前5000的网站进行了系统检查。结果显示,仅53%的网站首页具备良好的人类可读性,而高达87.2%的站点在首页存在HTML规范违反问题。
“有效HTML是例外,而非规则”
Ducreux在公布这一发现时直言不讳:“有效HTML是例外,而非规则。”这一判断基于严格的验证流程:项目使用html-validate.org工具逐一检测5000个网站的首页,且只检查首页——不包括结账页面或CMS生成的文章,后者在Ducreux看来“几乎肯定更糟”。
如果按照W3C(万维网联盟)和WHATWG(Web超文本应用技术工作组)制定的标准严格执行,结果更为惊人:仅2.6%的网站可被认定为完全合规。即便采用宽松标准,也只有12.8%的网站提供“完全有效的HTML”。
与此同时,超过33%的网站存在可访问性问题。随着《欧洲无障碍法案》及全球类似法规的推进,不合规网站正面临被拒的风险,这可能带来罚款等实际后果。
网页标准为何重要?
W3C自1996年起、WHATWG(成员包括苹果、谷歌、Mozilla和微软)自2004年起建立的标准,核心目标是确保开发者“以人为本”——让有访问障碍的用户也能顺畅消费内容,同时防止不合理或隐蔽的代码与设计。
有人或许认为,在AI读取网页的时代,网页标准已不再重要。但这种观点忽略了两点关键事实。
其一,标准是确保网站在所有浏览器中正常显示的基础。其二,也是更关键的一点:AI机器人恰恰偏好人类可读的内容。当AI成为信息消费的主要入口,网页代码的规范性反而比以往任何时候都更影响内容的可及性。
Ducreux本人也将其validatehtml.com域名提交至同一验证工具,结果同样暴露了若干错误——这或许是对整个行业现状的某种隐喻:即便是审视标准的人,也难免在细节上失守。
在AI代理开始替人类浏览网页的当下,代码的“差不多就行”心态正在付出隐性代价。现代浏览器确实能自动修复大量编码错误,但这恰恰掩盖了问题的严重性——当AI无法像浏览器那样宽容时,那些“够用就好”的网站,可能正在失去被AI理解和推荐的机会。
热门跟贴