IT之家 8 月 16 日消息,小红书于 8 月 14 日正式发布 dots3-note preview 开源大模型。令人意外的是,华为官方在发布当天便完成了昇腾平台对该模型的全量适配,并基于 vLLM Ascend 开源推理引擎提供了完整的部署与推理能力。
作为 dots3 系列的首个版本,dots3-note preview 采用 280B 总参数量、16B 激活参数量的架构,同时具备文本、视觉、语音三大模态的感知理解能力。据官方介绍,该模型在推理、Agent 以及多模态感知任务上表现突出,多项能力比肩国内外更大尺寸的优秀模型。
华为方面表示,得益于提前布局,dots3-note preview 发布当天昇腾便完成了 0 Day 推理部署适配与性能优化,在保留模型全模态理解能力的前提下,实现了稳定运行和生成效率提升。目前,Atlas 800 A3 与 Atlas 900 A3 SuperPoD 超节点均已支持该模型。
在技术适配层面,基于 vLLM Ascend 推理框架,团队打通了视觉编码器、音频特征提取与 LLM 主干推理的全链路,完整支持图文、音文、视频等多模态输入场景的稳定推理。
针对通信瓶颈,FlashComm 优化通过数学等价变换将 AllReduce 拆解为 ReduceScatter 与 AllGather 两个阶段,把列向独立算子前移至两阶段通信之间执行,彻底消除多卡间的重复计算,有效降低推理时延。
FUSED_MC2 通算融合方案则启用 MoE 层 dispatch_ffn_combine 融合算子,将原本多段独立 Kernel 合并为单一大算子,通过减少 Kernel Launch 次数、通信与计算深度流水以及中间张量不落盘等手段,显著提升 MoE 推理吞吐。
针对增量推理阶段 TPOT(单 Token 生成耗时)这一核心瓶颈,vLLM Ascend 原生适配了 dots3-note preview 的 MTP 投机解码能力。通过单次前向并行生成多 Token 候选并校验复用,大幅减少解码前向次数,有效降低 TPOT,更好满足高并发在线业务的低时延诉求。
相关部署指导与模型资源如下:
型号部署指导:https://docs.vllm.ai/projects/ascend/en/latest/tutorials/models/Dots3-Note.html
模型权重下载:https://huggingface.co/dots-studio/dots3-note-prev
小红书技术博客:https://studio.dots.ai/dots/dots3-zh.html
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。
热门跟贴