单一视角采集正在悄悄污染机器学习数据集

一份技术分析指出,只从单一位置收集训练数据,会把地理偏差无声地注入机器学习模型。这种偏差不会报错,也不会在训练日志里出现,却会直接影响模型在真实市场中的表现。

打开网易新闻 查看精彩图片

文章给出的核心证据来自价格预测任务:使用原有方式训练时,非美国市场的预测误差落在20%到30%区间。

换用地理定向代理后,误差大幅收窄

研究团队尝试重新在目标市场内采集数据,借助地理定向代理获取更贴近当地环境的样本。结果显示,非美国价格预测误差被压缩到接近美国市场的水平。

关键之处在于:整个过程中没有改动任何模型结构或训练算法。变化的只是数据来自哪里、覆盖了哪些地理条件。

数据采集位置本身就是特征

这意味着,训练数据的采集地点并不是中性背景信息。它决定了模型见过哪些价格波动、哪些供需关系、哪些区域性因素。

当训练集过度依赖单一市场视角,模型学到的规律就带有地域局限。即便算法再先进,也无法弥补输入数据在地理覆盖上的缺失。