产品实验里想测一下“调用高级大模型”对任务完成率的影响,直接用普通最小二乘回归(OLS)行不行?答案是:很可能得出一个有偏的结论。
麻烦出在混杂——比如系统本身就更倾向把复杂任务丢给高级模型,高级模型处理的样本天然难度大,完成率反而被拉低。OLS没办法把这些因素剥离干净,你会低估高级模型的真实贡献。
打开网易新闻 查看精彩图片
这篇教程给出的解法是:工具变量。一个随手可得的工具就是速率限制回退。当API调用触发限流,系统自动降级到基础模型,这个过程跟任务难度基本无关,却直接影响了模型分配。用这种准随机的外生变量,就能拆解出路由决策的净效应。
实操上用的是两阶段最小二乘法(2SLS):第一阶段用限流回退作为工具变量,预测实际调用的是高级还是基础模型;第二阶段拿预测值去拟合任务完成率,得到的就是不受混杂干扰的因果估计。教程在Python里完整跑通了这套流程,对比之下,OLS的偏差非常直观。
一句话:当你没法随机分配,就找个靠谱的工具变量,让数据自己把真相抖出来。
热门跟贴