我写了一个爬虫,监控十个与我工作相邻的网站。它从七月初一直运行至今,输出全部进入一个向量库,而目前没有任何程序读取它——这也是这个故事最后没有律师出场的唯一原因。

本周,我按照自己网站上安全信息源采用的标准,对这十个源做了一次审核:许可证必须书面允许商业复用。我的网站卖东西,所以“有歧义”一律算“不行”。结果:两个通过,八个没通过。失败的模式并不是我预想的那样。

问题其实是两个,不是同一个。Simon Willison 的 robots.txt 几乎是你能见到的最友好的声明:对 ChatGPT-User 显式放行,对 * 只屏蔽 /admin/ 和 /search/。没有 GPTBot 封锁,没有 Google-Extended 封锁。我的爬虫完全受欢迎。但同一个页面的页脚只有版权符号和年份列表:没有许可证,没有条款页,没有任何允许我在卖咨询服务的页面上转载一行内容的书面授权。

Troy Hunt 的页脚则不同。他的 robots.txt 也没有屏蔽什么重要路径,但页脚明确写道:作品采用知识共享 CC BY 4.0 国际许可证,可自由分享,但需署名。这是一份真正的许可证:它说明了我可以做什么、需要回报什么。按我自定的准入规则,Troy Hunt 通过,Simon Willison 不通过。这件事与他们对爬虫是否友好毫无关系。

robots.txt 回答的是“你的机器人能抓取这个页面吗?”;许可证回答的是“你能转载机器人抓取到的内容吗?”。一个网站可以对第一个问题说“可以”,却在第二个问题上保持沉默。沉默不是同意,而是同意的缺席;在我的规则里,沉默就是“不行”。

反过来的情况也存在。Julia Evans 的 robots.txt 里用大号 ASCII 艺术字写着“NO LLM”。机器人协议可以禁止爬虫,但禁止抓取并不等于自动给出版权许可;反向亦然:允许抓取也不等于允许复用。