当你调用一个模型API时,你其实是在和一份无形的合同打交道——你付了钱,对方承诺会运行你指定的模型。但直到现在,你根本没有任何手段去核实,GPU里奔腾的字节流,到底是不是你花钱买的那款大模型。这份信任的代价有多高?一篇2026年3月来自Offchain Labs的论文交出了一个关键答案:把推理验证的证明生成时间,从每次查询的15分钟左右,直接压到了毫秒级别。而对Arbitrum工作原理有所了解的人,会立刻从这个方案的路径里嗅到熟悉的气息。

信任缺口不是危言耸听。按Token计费的商业模式,天生就内置了一把作弊的尺子。运行一个700亿参数的大模型,成本远高于跑一个70亿参数的版本,而量化推理又比全精度推理便宜得多。如果某个服务商能在峰时将一部分请求偷偷路由到更小或更便宜的模型上,却依然按首屏标出的价格计费,省下的成本在规模化之后会是一笔惊人的数字。斯坦福大学的研究者已经证实,GPT-3.5和GPT-4在2023年3月到6月之间,即便是在同样的评测任务上,行为也出现了可测量的漂移。后续的一系列工作更是把在LLM API中检测模型偷梁换柱这件事,提炼成了一个正式的问题。这并非对哪个具体提供商的指控,而是直指一个根本性的结构缺陷:当下的API合约,没给你留下任何用于弄清楚的机制。

打开网易新闻 查看精彩图片

对个人开发者而言,这或许只是恼人的杂音。但对于受监管的行业、对于需要审计的模型治理团队、对于正在成型的代理之间自动结算的机器经济层来说,这个缺口足以撕裂整个体系的承重墙。自动驾驶、医疗审批、金融风控,任何一处由未经核实的大模型做出的决策,都可能因为模型版本、精度或结构的悄然替换,累积出无法追溯的风险。没有可验证的推理,就没有可靠的责任归属,而此刻成千上万个自主代理正在协议层互相发现、协商和交易,它们比人类更需要一套轻量、高速、不可抵赖的证明系统。

密码学其实早已备好了工具箱。同一族被零知识卷叠所用到的证明方案,理论上可以证明一个服务器正确执行了某个计算,而客户端完全无需重跑一遍——只需在响应中附上一个证明,客户端用原始计算量的零头就能完成验证。把这套工具搬到AI推理上,似乎是水到渠成的事。可惜数学上的完美,撞上了工程数字的冰冷现实。最前沿的方案,比如zkLLM,给一个130亿参数的LLM生成一份推理证明,需要大约15分钟。对于更小的Llama-2-70亿参数模型,公开报告的数据是每次查询388秒的证明时间,183KB的证明文件,以及2.36秒的验证耗时。在原型研究里,这些数字完全正当,但在一个期望亚秒响应的线上API面前,15分钟就意味着一场灾难。推理本身的速度极快,用户已经习惯了即时反馈,任何额外延迟都会立刻变成系统瓶颈。

Offchain Labs论文选择了一条不同的路。它不再试图去加密证明神经网络内部的每一次乘法和加法,而是换了一个更“偷懒”却巧妙得多的赌法:服务器提前对两样东西做出承诺——一样是模型权重的指纹,在训练结束后只发布一次;另一样是模型在回答某个具体查询时产生的内部中间值的指纹。然后,客户端在靠近输出的随机位置挑一个点,只检查那一个点的计算结果是否与承诺的指纹吻合。这就像审计师不去翻阅整年的每一张发票,而是在报表上抽样一笔交易,只要抽查能通过,就认定整体可信。通过这样的“抽查”逻辑,整个证明生成的负担被削掉了绝大部分,于是毫秒级验证才真正有了落地的可能。

这种思路与Arbitrum的乐观汇总设计异曲同工。在Arbitrum的框架里,交易默认有效,由挑战者周期性地提交故障证明来揪出作恶者。Offchain Labs的方案则把赌注押在了概率上:只要抽查的随机性由客户端掌握,且抽查位置无法被服务端预判,那么一次成功的作弊要想始终躲过抽查,其难度会随着抽查点多到让经济上变得无利可图。换句话说,它并没有追求无限接近100%的理论安全,而是把安全锚定在统计学和经济学的现实里,以毫秒级的轻量成本挡住绝大多数的欺骗企图。

毫秒,是一个值得拆解的时空坐标系。当证明生成从15分钟——也就是900秒——被压缩到毫秒量级,这接近三个数量级的飞跃并不是单纯的性能调优,而是一次可行性边界的重绘。在此之前,任何将密码学验证嵌入实时对话AI链路的构想,都只能停留在PPT里。而现在,智能体之间的交易协议完全可以把这种抽查证明作为结算凭据,让一个代理调用另一个代理的推理服务后,在瞬间完成可信查验,而不必等待一场电影结束。对需要外部审计的合规场景,留存的指纹和抽查记录也第一次提供了可追溯的、无需暴露原始数据的验证链条。

但这并不意味着所有的信任困境都一劳永逸了。抽查模型天然地将一部分安全交给了随机性,理论上一个极度聪明、且愿意承受小概率失败风险的攻击者,仍有可能在特定查询中完成替换而不被查到。只不过在代理经济的大样本交易流中,任何成规模作弊的期望收益都会被反复的抽查迅速摊薄。更值得警惕的反倒是“承诺指纹”本身的发布机制——假如模型权重指纹只在训练后发布一次,那么后续任何细颗粒的微调、持续的模型更新,都需要一套额外的证书管理流程来同步更新指纹,否则旧的指纹反而会变成掩护灰盒操作的幕布。

放眼整个代理经济的生长图景,推理验证的轻量化,补齐的恰恰是机器与机器之间自动结算的最后一环。当一个采购代理决定花费预算去调用某个推理服务来完成合同审查,或者当一个DeFi策略代理依赖外部模型做市场预测时,它需要的不仅是准确的结果,还需要一块不可伪造的收据。Offchain Labs的这项工作,向行业展示了一张可能的设计图:把证明成本降到和API请求本身一个数量级,让可信变成可在秒级内交割的标准品。沿着这个方向走下去,未来的代理市场或许会多出一个新指标——不仅比较每百万Token的价格,还要比较每毫秒验证的可信度。

从更广的视角看,轻量验证成了AI基础设施里一块突然