IT时代网9月1日消息,腾讯混元团队推出Hy4 preview轻量版,将模型权重从接近1.5TB压缩至约214GB。Hy4 preview是腾讯8月28日发布并开源的新一代MoE混合专家大语言模型,总参数量7700亿、激活参数490亿,上下文长度达100万Token。

此次压缩依靠两项核心技术:其一是Sherry稀疏三值量化算法,将路由专家层权重压缩至平均1.25比特;其二是MIX-STQ1_0混合精度策略,依校准数据逐层决定量化位宽,敏感层保留较高精度,不敏感层采用更激进压缩。两者结合下,模型长文理解几乎与原始BF16模型持平,多轮长上下文检索基本同水平,数学能力仅小幅回落。

在异构设备联合推理上,腾讯混元与prima.cpp合作验证新方案:在一台单张4090笔记本与一台四卡A4000服务器(合计80GB显存、64GB内存、分属两个局域网)上,通过异构调度拆分分配MoE层,使214GB轻量版达到1.02 token/s推理速度,较笔记本单机offload快约6倍。轻量版已上线开源社区,支持llama.cpp、vLLM、SGLang等主流推理框架。

注:本文综合自IT之家等,文中包含AI辅助创作的内容。
打开网易新闻 查看精彩图片
注:本文综合自IT之家等,文中包含AI辅助创作的内容。