AI企业Liquid AI近日宣布,为其小型模型LFM2.5系列推出应用了高速化技术“DSpark”的版本。官方表示,DSpark应用版模型在保持原有性能的同时,实现了2倍以上的推理速度提升。
此次发布涉及三款模型的DSpark草稿版本:LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B。这些版本通过增加一条投机解码路径,以极小的内存开销换取大幅度的解码加速,且不改变输出质量。
DSpark如何实现加速?
DSpark属于“投机解码”类加速技术。AI模型生成文本或代码时,本质是不断重复“预测下一个token”的过程。DSpark的做法是:在主模型之外,额外准备一个轻量级的“草稿模型”。草稿模型先快速生成一批候选token,再由主模型对这些候选进行采纳或拒绝。通过这种分工,整体生成速度得到提升。
与一些以牺牲精度换取速度的方案不同,DSpark的卖点在于:加速的同时,精度可以完全保持。它不是“变快但变笨”,而是“变快且不变笨”。
实测数据:从H100到MacBook Pro
Liquid AI公布了在两种硬件上的加速效果。在NVIDIA H100上,LFM2.5-2.6B应用DSpark后,推理速度达到原来的2.67倍。在搭载M4 Max芯片的MacBook Pro上,LFM2.5-2.6B提速2.27倍,LFM2.5-1.2B-Instruct提速2.54倍,LFM2.5-8B-A1B也实现了1.18倍的提升。
三款草稿模型的参数量也已公开:LFM2.5-1.2B-Instruct对应的草稿模型为2.957亿参数,LFM2.5-2.6B和LFM2.5-8B-A1B对应的草稿模型均为3.277亿参数。
面向端侧设备的小型模型
LFM2.5系列本身是为智能手机、笔记本电脑等算力受限设备设计的小型AI模型。该系列提供多种参数规模,并包含针对日语优化的版本。此次DSpark的加入,进一步提升了这类模型在端侧设备上的实用性。
Liquid AI的Piotr Mazurek在社交平台上表示:“投机解码将是把Fable级智能压缩到手机里运行的关键部分,这次成果是第一步。”他对后续的性能提升表达了期待。
目前,三款DSpark应用版模型已通过Hugging Face平台开放下载,开发者可以自行获取并测试。
热门跟贴