6000个标记压缩到1500个,推理延迟降低38%,吞吐量提升16%——Shopify工程团队最新公开的Gisting技术,正在改变大语言模型(LLM)系统提示词的处理方式。这不是简单的文本摘要,而是一套让模型"记住"提示词精髓的学习型标记方案。
4:1压缩背后的核心机制
传统做法中,LLM每次推理都要处理完整的系统提示词,这些提示词动辄数千个标记,占据大量计算资源。Shopify的做法是训练一小批"摘要标记"——经过优化的嵌入向量,让模型表现得如同处理过原始提示词。
具体实现上,团队通过最小化教师logits(完整提示词)与学生logits(摘要标记)之间的KL散度,让压缩后的标记逼近原始提示词的行为。两阶段训练确保压缩表示保留了模型的核心行为模式,而非简单的文本概括。
生产环境实测数据:延迟降38%,吞吐量升16%
在Shopify的Sidekick GraphQL智能体上,Gisting完成了真实生产部署。数据显示:中位数TTFT(首令牌时间)从438ms降至354ms,端到端延迟从6.8s降至4.2s,QPS从20.2提升至23.4。这些数字直接转化为GPU分配的缩减——实打实的基础设施成本节省。
在350 RPM(每分钟请求数)的负载下,这些优化依然稳定。团队强调,Gisting与现有的前缀缓存机制互补,两者结合使用效果更佳。
零侵入集成:不改权重,不动服务架构
这项技术最吸引人的地方在于部署方式。训练完成后,摘要嵌入被直接写入模型的嵌入矩阵,新的摘要标记注册为分词器中的特殊标记。推理时模型像往常一样加载运行——无需自定义注意力掩码、额外编码器或特殊服务路径。
对现有基础设施完全透明,意味着团队可以在不修改模型权重的情况下获得性能提升。这种设计思路降低了采用门槛,也让优化方案更容易推广到其他场景。
与简单摘要的本质区别
Gisting的核心优势在于,模型处理的不是原始提示词的传统摘要,而是一种精心设计的学术表征,旨在让LLM的行为尽可能接近其看到原始提示词时的表现。简单摘要会丢失关键指令信息,而学习型标记保留了行为模式。
从技术原理看,短摘要标记序列减少了预填充和解码阶段的KV张量处理,这是性能提升的直接来源。Shopify将Gisting与前缀缓存结合使用,两种优化相辅相成,进一步降低了推理开销。
对LLM推理优化的启示
在LLM应用成本居高不下的当下,Gisting提供了一条不同于模型压缩或量化优化的路径——从提示词侧入手,用更少的标记传递同样的指令意图。对于高频调用LLM的智能体应用,这种优化思路值得关注。
Shopify公开的技术细节显示,团队在训练阶段就考虑了生产环境的约束条件,确保压缩后的标记在推理时不会引入额外开销。这种从实际部署反推技术设计的做法,或许正是Gisting能快速落地的原因。
热门跟贴