大模型推理速度一直是落地应用的瓶颈。近日,LFM2.5系列迎来新成员——DSpark草稿模型,通过投机解码技术,在GPU和边缘设备上实现了最高3.2倍的推理加速,同时保持输出质量不降级。
投机解码:小模型打前站
打开网易新闻 查看精彩图片
这套方案的核心思路并不复杂:先用一个轻量级的草稿模型快速生成候选token序列,再由主模型进行验证。由于草稿模型足够小、足够快,大部分简单token可以一次性通过验证,只有少数需要主模型重新计算,从而大幅减少推理时间。
实测数据与集成路径
官方公布的基准测试显示,在GPU和边缘设备上,LFM2.5-DSpark的推理速度提升最高可达3.2倍,且输出质量与原始模型保持一致。对于资源受限的边缘场景来说,这一提升意味着更流畅的本地推理体验。
集成方面,LFM2.5-DSpark已支持llama.cpp和SGLang两个主流推理框架,开发者可以直接接入使用,无需额外改造现有部署流程。
对于正在优化推理成本的团队,这或许是一个值得关注的方案。
热门跟贴