一个分类模型的训练和实验,云端GPU账单是540雷亚尔,折合104.08美元。这是Julia-1公布的成本数字,也是它被拿出来讨论的原因之一。
发布方称,Julia-1是他们的第一个分类模型,"几乎能在任何设备上运行"。这个定位本身就带着反差:在通用大模型越做越大的当下,一个强调轻量、强调随处可跑的分类模型,反而成了值得看一眼的东西。
分类模型为什么又回来了
有人把这件事放进了智能体(agent)的语境里看。当模型能力逐渐趋同,真正的空间转移到了智能体框架(harness)的搭建上。在这个阶段,花时间做实验、把"系统一模型"和"系统二模型"组合起来,被证明是有价值的。
所谓系统一模型,指的正是优秀的分类器。它的价值在于:很多问题并不需要动用通用前沿模型,一个足够好的分类器就能解决。混合系统在特定领域问题上的表现历来更好,这个结论即便在通用前沿模型已经很强的今天,依然成立。
这也是Julia-1被拿来测试的另一个背景——它用到了在@dair_ai构建的情绪数据集。发布方提到,看到这个数据集被用来测试新模型,是件很酷的事。
从图方法到深度学习,一条老路的新走法
有人回忆,自己整个博士阶段都在从零构建高效的分类器,从基于图的方法一路做到深度学习。如今看到分类模型重新成为趋势,感受是"怀旧"。
这种怀旧背后是一条被忽略的路径:分类器不是过时的技术,而是在智能体时代被重新需要的基础件。发布方也把Julia-1称为"开源所能实现的一个很好的例子",并明确表示这还是一个进行中的工作。
对于今天在搭智能体框架的人,给出的建议很直接:搭好框架,写好评测,自己跑实验。理由是可以从中获得大量洞察,进而利用这些进展。
发布方最后抛出一个问题:我们会不会看到一种新型的前沿实验室,专门聚焦于这类模型?这个问题没有答案,但它指向的方向是清楚的——当大模型的能力开始聚集,边缘处的机会可能恰恰在那些小而专的模型上。
热门跟贴