“没人承认机器已经失控。年复一年,人们侍奉它的效率越来越高,对它的理解却越来越少。”——E. M. 福斯特《机器停转》
文丨王子伊
编辑丨黄俊杰 程曼祺
2023 年底,知名密码学家布鲁斯·施奈尔(Bruce Schneier)撰文警告:大互联网公司已经收集了海量隐私数据,但没人力去理解每一个用户,只能打标签;大模型将让大公司第一次知道上亿用户具体在想什么。
当时最先进的模型还是 GPT-4,又贵又慢,他的警告只是推演。不到三年,同等性能的大模型成本只有 GPT-4 的几百分之一,还学会了调用工具、读电脑上的数据、接入用户的互联网服务。风险成形了。
本周,智谱再次为 ZCode 编程工具上传用户软件项目数据道歉,承诺已删除数据,并补偿 Token。两个月前,xAI 的编程工具 Grok Build 干过类似的事,马斯克也道歉、删数据。
编程工具影响的主要是开发者。ZCode 用户约 200 万,一位接近智谱的人士称,这次事件只涉及其中 5% 的用户。但普通人跟大模型的对话也可能被公司读取,有时被人看。
腾讯、阿里、字节正在打 AI 办公助理大战,争夺上亿用户。而消费级 AI 个人助理(personal agent)有望覆盖更多人,吸纳更海量的信息。Meta 偏向消费的个人助理 Muse 已在美国 App Store 免费榜首停了一周多。几个月内,这也会成为国内科技大公司对未来的 “新洞察”。
AI 助理有效工作的前提是拿到足够的数据,更懂用户。但能看懂用户的,将不只是大模型。
发现编程软件上传数据,纯粹靠运气
“我不是网传的神秘黑客、逆向大佬。” 林峰(化名)对《晚点 LatePost》说,“我发现漏洞,纯属因为电脑硬盘小。”
9 月 18 日早上,林峰照例清理那台 256GB 硬盘的 MacBook Air。他发现 .zcode 目录占了 700 多 MB,而 ZCode 两周前才装上。他觉得 “不太对劲”。
林峰做了 10 年后端开发,在一家小型科技公司任职,习惯从异常里追问题。2013 年至今,他写了 375 篇技术博客。
他发现的问题有三点:
上传的范围远超用户的预期。
他在 .zcode 目录里发现一个 300 多 MB 的加密文件包。文件打不开,但清单显示,里面约有 4.2 万个文件,超过 8 成是项目的历史修改记录。他进一步分析,ZCode 打包时优先处理保存项目历史的 .git 目录,再上传到云端。
这些历史记录里,可能留着临时开发环境的密钥、没跟客户签过保密协议的数据,不能对外。而 ZCode 当时的隐私政策只写明收集用户 “在对话中” 提交的文本、文件和代码,没说会打包上传硬盘上的其他文件。
在您使用 ZCode 产品的过程中,我们将收集您在对话中向我们提交的文本、文件(包括但不限于您上传、指定的文本、图片、音频、视频、配置参数和 shell 命令等形式的文件)和代码为您提供内容生成和 AI 辅助操作服务。
上传没有明确提示。
在林峰用的那版 ZCode,用户一登录,上传就默认开启。全程没有弹窗、勾选等确认环节,界面上也没有明显的关闭入口。
按行业惯例,除了用户主动提交或授权给模型的内容,Agent 产品会收集一部分使用记录和崩溃数据,比如用户点了哪些功能、出了什么报错、系统响应多慢,用来改产品、排故障。
规范的产品会给这类数据脱敏,并提供关闭选项,VS Code、Claude Code 都有。
数据被送到了第三方服务器上。
林峰还原出的流程是:ZCode 先向智谱服务器取得上传凭证和加密公钥,在用户电脑上压缩、加密,再把文件传到阿里云对象存储,最后由云端向智谱后台返回结果。
前一天傍晚,林峰还在向一位律师朋友推荐 ZCode,建议对方把它纳入团队工作流。不到半天,他撤回了推荐。
一位接近智谱的人士称,ZCode 是智谱内部孵化的项目,团队十几人,立项时直接参照 Claude Code 做 AI 编程产品。另一位接近智谱的人士称,此次事故是无心之失,“真想拿数据训练,不会做得这么粗糙,轻易就被发现。”
事发后,智谱一边修产品,一边修复信任:
9 月 18 日,林峰的博客引发大批开发者讨论。智谱承认问题出在 ZCode 的代码库索引功能:生成索引页面时会触发仓库数据上传。这个功能上线初期默认开启,现已修复;
9 月 21 日,ZCode 宣布开源。有开发者发现开源版和官网版不一致。两天后,开源版更新,和官网同步;
9 月 28 日,ZCode 软件通知称,涉事的云端存储桶和其中数据已彻底删除,今后开源版与官方版同步发布。作为补偿,智谱向付费用户赠送重置卡,向全体用户发放 Token。
ZCode 的漏洞在那天被发现,是因为一位程序员恰好没用另一台 2TB 硬盘的电脑,他愿意刨根问底,又常年写技术博客、有开发者关注。缺任何一样,漏洞都可能存在更久。
Grok Build 的问题也是一名安全研究者做测试才发现的。他发现 Grok Build 代理和模型交互的数据只有约 192KB,另一条存储通道却上传了约 5.48GB 的项目文件。项目里的密码和密钥文件没有脱敏,直接上传;关掉 “改进模型” 等隐私设置后,上传照旧。
就算公司没有恶意,事故也会发生
除了产品主动上传用户数据,过去三年,用户交给 AI 的数据还出过几类大规模泄露:
系统故障泄密
2023 年 3 月,ChatGPT 的缓存组件出故障,部分用户看到了别人的聊天标题,新对话的第一条消息也可能发错;部分订阅确认邮件发错了收件人,泄露了其他用户的姓名和信用卡末 4 位。这些信息可以用来做针对性钓鱼和其他社会工程攻击。
2024 年 9 月,AI 伴侣服务 Muah.AI 数据泄露,约 190 万个邮箱地址和用户提交的图像生成提示词流出。一些提示词涉及露骨的性内容,甚至有对未成年人的性化描述。
设计失误,诱导用户过度分享
2025 年 7 月底,有人发现 ChatGPT 的 “分享” 链接被 Google 索引。用户点分享时勾选了 “可被发现”,多数人不知道这意味着全网可搜,大量只想转给朋友的私密内容因此公开,其中一些含有账户和密码。OpenAI 一天内关闭了这个选项,并请搜索引擎撤下约 5 万条链接;但至今仍能找到数万条存档。
几周后,Forbes 核实 Grok 有同样的问题,而且连勾选框都没有:点 “分享” 即公开。超过 37 万条对话被 Google、Bing 索引,内容包括病情咨询、一名用户的姓名和密码、制毒和炸弹说明。xAI 没有回应。
提示注入攻击
2025 年 5 月,安全公司 Invariant Labs 演示:一个接了 GitHub 工具的代理,读到公开 issue 里藏着的一段指令,就把用户私有仓库里的姓名、薪资、出行计划写进了一个公开页面。
2025 年 7 月,一名外部贡献者向亚马逊官方的 Amazon Q 编程助手扩展提交了一段指令,要求代理充当 “系统清理器”,删除用户的本地文件和云资源。亚马逊没有察觉,把它发布给了约 100 万安装用户。指令因为一个语法错误没有执行。
Django 联合创始人、率先定义 “提示注入攻击”(prompt injection)的西蒙·威利森(Simon Willison) 总结了 “致命三要素”:一个 AI 代理只要同时能读私密数据、能接触不可信的外部内容、能对外通信,它就能被藏在内容里的指令诱导泄露数据,和用哪家模型无关。
厂商通常训练一个分类器拦截可疑输入,但拦不住全部。威利森认为,模型识别不出所有攻击,要安全就得砍掉三要素之一。OpenAI 去年底发布 Atlas 浏览器时也说,提示注入仍是 “前沿的、未解决的安全问题”。
不对等的用户协议——“你只能祈祷公司有良心”
《个人信息保护法》规定,处理个人信息若以同意为依据,同意必须在充分知情的前提下,由用户自愿、明确作出。
现实中,多数用户不会点开冗长的用户协议和隐私政策,就点了确认。比如正在读这篇文章的你,注册微信账号时,大概率没意识到自己同意了 “账号的所有权归腾讯所有,用户完成申请注册手续后,仅获得微信账号的使用权”。
我们读了 7 款 AI 产品的用户协议和隐私条款,试图拆解责任和权利的边界:
1. 你的账号、你的数据,可能都不属于你。
像微信等互联网服务一样,你的账号属于服务方,你注册、花钱买到的是使用权。即使内容的知识产权属于你,平台往往也有权处理这些数据。
在企业工作区里,账号身份、权限、内容可见范围和数据管理权,通常由企业管理员或客户组织控制。
2. 你说的话并不都被用于大模型训练,但公司保留了使用它的权力。
一个常见误解是:用户输入的每句话都会直接变成训练大模型的原料,从而泄露。
多位大模型公司的研究员告诉《晚点 LatePost》,普通用户日常产生的数据——对话、代码修改、任务记录——对训练基础模型价值有限。这些数据零散、没有高质量标注,提升不了模型能力。
过半产品默认不用你的数据训练,其余的要手动关闭。模型公司更尊重企业和 API 用户的数据,默认不训练。
规则也可能改变。Anthropic 2025 年 8 月宣布,个人版对话和 Claude Code 会话默认用于训练,保留期从 30 天延长到 5 年。
3. “数据不用于训练”,也会被人看见。
不用于训练,通常只排除了基础模型的预训练和微调,不排除为运行服务、安全扫描、内容审核、故障排查、日志审计、合规留存、管理员治理或依法披露而做的处理。哪些数据算在这些范围里,主要由公司裁量。
不久前,Anthropic 发布安全报告,披露了一批异常用户。它的安全团队用两周观察一个开发团队在 20 多个约会应用里,用 4700 个 AI 虚拟人与数万用户互动。报告记录了开发者给 Claude 的具体要求,也记录了约会软件用户在对话里说出的病情和痛苦。
Claude 的用户协议允许审查人员以安全为名查看这些信息。各家的用户协议都有类似声明,有的范围不止安全审查。
4. Agent 会把数据给更多服务商,范围取决于它拿到了什么权限、调用了什么第三方、执行了什么动作。
连接器、MCP、插件、第三方模型和自动执行,意味着数据可能流向模型供应商、云服务商、插件提供方、被连接的 SaaS 和组织管理员。
WorkBuddy 国际版协议称,第三方大模型、插件或 API 可能自行保留或训练数据,腾讯无法控制,也未必提供退出权。2026 年 9 月,Anthropic 在安全报告中提到,部分用户通过第三方应用或中转服务访问 Claude,部分请求里带着姓名、联系方式和企业内部信息。
5. 用户误删、Agent 误操作,合同责任通常由用户承担;厂商赔偿极低,或大范围免责。
几乎所有产品的协议都用 “输出仅供参考”“用户须人工复核”“自行备份”“AI 会出错”“第三方服务风险自担” 把出错的责任转给用户。
千问办公称,用户 “未及时制止”Agent 的操作,也可能视为许可。服务协议 14.3 还称,“若适用法律不允许排除或限制某些责任,则我们的责任将在法律允许的最大范围内予以限制。”
WorkBuddy 国际版协议明确提示 Agent 可能删除数据、修改系统或发起交易,要求用户承担后果。OpenAI 称,用户自行承担使用 Codex 输出的风险;公司若仍有责任,赔偿上限取以下两者中较高者:事发前 12 个月用户为该服务支付的费用,或 100 美元。
“看上去你给模型厂商的是有限的权限,但实际上它拿的是无限的权限。” 林峰说。
这些条款给了大模型公司极大的权利,让用户承担出问题后的责任;对公司的约束,很大程度上靠公司自我约束。
2026 年 9 月,OpenAI 宣布内部模型解开了一道 “千禧年大奖难题”。
纽约大学数学家特里斯坦·巴克马斯特(Tristan Buckmaster)和 2024 年加入 Anthropic 的研究员莱文特·阿尔珀格(Levent Alpoge)随即指责 OpenAI。两人此前用 Codex 等工具合作推导,研究草稿、未公开的证明方法和半成品代码都存在 OpenAI 的云端。他们质疑:自己的未公开研究是否通过 Codex 进了模型训练。
OpenAI 随后称,内部调查已排除发布成果前两个月的 Codex 输入对解题系统的影响,包括通过训练;但没有提供独立审计记录。
“你只能祈祷公司有良心。” 一位国内大模型公司的研究员对《晚点 LatePost》说,他和身边同事都用 Codex 和 Claude Code。在 ZCode 事件之前,他已经意识到所有闭源的 harness 都可能发生数据泄露。但为了效率,他不得不用。
AI 助理可能打破系统安全的 “血脑屏障”
1938 年,加拿大人约书亚·哈尔德曼(Joshua Haldeman)发表文章《美洲不需要价格体系》。他设想美国和加拿大合并,废除关税、宪法、货币、银行、教会, “将科学应用于社会秩序”,就能摆脱贫穷、失业和恐惧。
哈尔德曼这一派自称 “技术统治运动” (Technocracy movement),他们主张以技术专家取代政治家,以能源核算取代货币和市场,在北美建立统一的技术管理体系,相信科学组织生产和分配能解决一切问题。
在他们的设想里,人不需要名字,只需要编号,一名成员把自己改名为 “1x1809x56”。哈尔德曼去世 46 年后,他的外孙埃隆·马斯克给自己的孩子之一取名 X Æ A-Xii。
技术统治运动在加拿大发行的宣传手册,该组织在二战期间被加拿大政府取缔,哈尔德曼也因此被捕。
二战后的富足生活让 “技术统治运动” 失去了市场,但他们的一些核心设想,比如持续记录每个人做了什么,据此决定给他什么——这在过去几十年,由商业公司做到了。
1960 年代,美国航空开始计算机管理订票和出行记录,并在多年后用这些数据给航班定价、划分舱位。这是数据分析的雏形。同期,《芝麻街》制作团队每 7.5 秒记录一次孩子的目光,删改抓不住注意力的片段。
到互联网时代,这套方法已经成熟。平台后台,用户也是一组编号。公司记下你搜过什么、买过什么、看什么不看什么,有时还相互交换数据。十几年前,这套算法就在用机器学习,人只在数据异常时介入。
平台挖不透收集到的数据,因为之前的模型不够强,需要人才能读懂一段文字。于是他们根据数据给人打上关键词和标签,比如 “25-34 岁、对理财感兴趣”。
精准的广告更有效撮合用户和他们感兴趣的商品,这很正当。但中国移动互联网用户的人均单日使用时长已接近 8 小时——每天醒着的时间,近乎一半被推荐算法定在了 6 寸屏幕里。这套算法,也在帮 “快招” 加盟品牌、茅台镇 “投资酒” 筛出容易上钩的人。
大模型正在重读用户数据,让这一切更有效率。2025 年至今,Meta、OpenAI 先后将用户与 AI 聊天的记录用分析用户、投放更精准的广告。2026 年二季度,Meta 称,大模型分析用户活动使其二季度广告转化率提高了 15.7%。扎克伯格解释,“为了判断一条广告是否与用户相关,我们扩大了所能考虑的上下文。”
个人助理则将为公司带来更多数据。
去年 3 月,上亿用户的加密通讯软件 Signal 总裁梅雷迪思·惠特克(Meredith Whittaker)在 SXSW 大会上描述了未来的 AI 个人助理,自动帮你订票、写日程,再发消息给朋友,“我们就不用管了,把大脑装进罐子里就好了,对吧?”
风险在于,这样的助理,模型只能放在云端,用户的数据都得交过去。惠特克认为这将打破现代操作系统保护隐私的 “血脑屏障”——今天的手机系统隔离各应用,就是为了不让一个应用轻易读取其他应用的数据。
Meta 的 Muse 就是这样一个产品。它在云端的虚拟机上,通过连接器和浏览器模拟操作完成各种任务,有些相当复杂:订演唱会门票、联系多个搬家公司比价、打电话预约牙医(电话功能目前只小范围开放)。
Muse 只在北美可用,已经霸榜一周多,下载量超过 ChatGPT 同期刚推出时。可以预见,中美主要科技公司都会跟进第二个像 ChatGPT 一样增长速度的 AI 产品。
美国主要模型公司每一个都上线了类似的云端虚拟机产品,只是之前大多偏向办公助理。Meta 给虚拟机加了隔离层,防止外来指令拿到虚拟机内的敏感信息。但这只防外人:提供服务的公司,还是会因此更了解自己的用户。
9 月,林峰给自己开发的 Agent 加了一项 “隐私替换”:身份证号、电话号码等敏感信息先在本地换成 “X”,模型处理完,再换回真实信息。他觉得这个 “X”,就是开发者的良心。“企业家、开发者应该有基本的社会责任感。不能因为普通人没有分辨和控制能力,就去诱导他们获利。”
“个人对抗不了这种大趋势。” 林峰觉得,普通人能做的,就是隔开工作和个人数据,给资料划分隐私等级,少给 AI 权限:“打死都不能交出去的,尽量别让 AI 碰。”
2023 年底施奈尔写下那篇文章时,大公司用模型读懂上亿人还只是推演。不到三年,它已经进了大公司的产品说明书,带着前所未有的数据量。
· 还原 ZCode 静默上传全量 Git 历史(2026)
https://blog.ferstar.org/posts/zcode-silent-workspace-snapshot-upload/
· The Internet Enabled Mass Surveillance. AI Will Enable Mass Spying(2023),by Bruce Schneier,安全专家论 AI 如何把 “记录一切” 升级为 “理解一切”
https://www.schneier.com/essays/archives/2023/12/the-internet-enabled-mass-surveillance-ai-will-enable-mass-spying.html
· The Data Delusion(2023),by Jill Lepore,哈佛历史学家在《纽约客》回顾人类如何一步步相信 “数据能解决一切”
https://www.newyorker.com/magazine/2023/04/03/the-data-delusion
· America Needs No Part Of the Price System(1938),by Joshua Haldeman,马斯克祖父大萧条时期的技术统治运动宣言
https://archive.org/stream/technocracydiges00unse_37/technocracydiges00unse_37_djvu.txt
· Automation and Repression(2026),by Daron Acemoglu, A. Arda Gitmez, Mehdi Shadmehr,诺奖经济学家关于自动化与社会关系的推演
https://www.nber.org/papers/w35336
题图来源:The Social Dilemma
热门跟贴