“开源模型”这个词,含义已经和过去不一样了。有些发布只给你一个.safetensors权重文件外加一段说明文字,有的则把数据配方、训练代码、日志和检查点全部交出来。但两者都被通称“开源”——这两者之间的差距,几乎等于“能用模型”和“能复现模型”之间的鸿沟。
韩国ETNews本周报道了VIDRAFT的一系列模型发布,恰好把这种光谱展示得清清楚楚:三个模型,刻意用三种不同的开放程度发布。其中只有一个是真正的开源。
先把三个模型的底牌摊开。Aether-7B-5Attn公布了完整的训练配方、代码、超参数、日志和检查点——这符合开源定义。另外两个模型只给了权重。三者的权重许可都是Apache-2.0,但这仅仅是许可声明,不等于可复现。把许可和可复现混为一谈,正是“开源”被过度营销的最常见方式。每次评估一个发布,都值得检查这一点。
注意,AETHER-7B-7Attn-base和Aether-7B-5Attn是不同检查点。我们在字节层面做了比对,而不是轻信模型卡片:两者文件大小完全相同(都是13,179,635,998字节),safetensors头部一致,张量名称、形状和偏移都一样——但SHA-256不同,而且每一个采样出的张量块都不相同。它们属于同一架构家族,但训练状态不同。如果你要做基准测试,这两个模型不能互换。
第三个是11Attn模型,还在训练中。步骤174,000是一个中途快照,不是成品模型。它作为研究产物发布,模型卡片也写明了这一点。
这三个模型共享的唯一架构思路,由那款真正开源的成员记录公开:并不是所有层都必须运行相同的注意力机制。让每一层都跑同一个混合器,只是从参考实现继承下来的惯例,并不是经过验证的最优解。很自然的实验方向,就是把几种机制放进同一个网络。但朴素的做法证明不了什么,因为Transformer层不能互相替换——浅层和深层做的工作不同。如果简单堆叠不同机制,测出的任何差异都是混淆的:你分不清是“这个机制好”还是“这个深度恰好在干这些活”。这就是深度偏差,足以让结果失去解读意义。
这里用到的修正方法是拉丁方:一个网格,每行每列每个符号恰好出现一次,这样每一种机制都会在每一个深度位置恰好出现一次。这个架构,首先是一个实验控制,然后才是其他任何东西。你只能在真正开源的模型里看到这样的设计图,并且对照代码去验证它。
热门跟贴