打开网易新闻 查看精彩图片

8月6日,据字节跳动内部人士处消息,今年国内竞争对手开源模型的快速发展给字节跳动带来更大的压力。在近日的内部会议中,字节跳动创始人张一鸣表示,做模型要坚持长期主义、延迟满足感,而不是用别人的输出,换一时的榜单排名

今年以来,国内AI大模型竞争已经极为激烈,几乎每隔几天就有新模型发布,每当有一个强大的开源新模型发布,字节跳动内部关于蒸馏的争论就会升温。据了解,张一鸣很少在Seed团队的会议上发言,但此次明确表态,字节跳动“应该愿意为长期目标牺牲一部分短期收益”

据了解,字节跳动内部对开源模型严禁蒸馏,甚至通过API检测等方式在内部加强相关限制,张一鸣认为,蒸馏会干扰真正意义上的长期技术突破。

国产大模型激战仍在延续,来自各家模型厂商新品“卷”上天际,就在当天早些时候,DeepSeek发布公告:计划近期整体上调DeepSeek API服务的定价,预计涨幅较大,请合理安排您的使用。具体方案以正式通知为准。

7月31日,DeepSeek宣布,DeepSeek-V4-Flash正式版API上线公测。这也是外界期待已久的DeepSeek正式版官宣上线,据了解,DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行后训练。

据业内人士分析称,此次官宣涨价也意味着DeepSeek即将上线V4-Pro正式版,将对整体算力调用产生影响。

何为“蒸馏”

“蒸馏”本是人工智能领域的一项基础技术。2015年,被誉为“深度学习之父”的杰弗里·辛顿等人明确提出这一技术命名,其核心逻辑是:让算力充沛的大模型做“师傅”,轻量级的小模型做“徒弟”,后者通过观察前者的输入输出,学习其解决问题的思路和方法,最终实现能力复刻。这种技术路径的价值在于,它能让一个体积更小、运行更高效的模型,在大幅降低算力需求的同时,获得接近尖端大模型的性能表现。

正因如此,“蒸馏”迅速成为全球人工智能界公认的常规操作。谷歌、开放人工智能公司(OpenAI)、亚马逊等美国科技巨头,不仅广泛使用这一技术,甚至将其作为标准化服务对外提供。换言之,“蒸馏”本质上是一种中性的技术方法,是人工智能技术迭代与创新演进的重要方式之一,是降低技术门槛、推动人工智能普惠发展的重要路径。

■综合自澎湃新闻、《求是》

■编辑:越玥、张阿嫱