据快科技报道,4月24日,普林斯顿大学博士生Yifan Zhang在X平台公开了DeepSeek V4的完整技术规格。

DeepSeek V4将分为两个版本,完整版参数量达1.6万亿,V4 Lite参数量为2850亿。在注意力机制方面,V4采用了DSA2,融合了DeepSeek V3/R1中的DSA机制,以及今年初DeepSeek论文中提出的NSA两种稀疏注意力机制。MoE混合专家技术采用融合方案,使用Mega内核,每层384个专家,每次激活6个专家。残差连接采用此前论文中提出的Hyper-Connections,DeepGemm更新中也有提及。

在后端训练及优化方面,优化器为Muon,RL强化学习使用GRPO及KL散度修正,预训练的32K上下文最终扩展到了1M上下文。不过爆料显示V4依然是纯文本大模型,而非此前暗示的多模态模型。

需要指出的是,Yifan Zhang并非DeepSeek公司研发人员,其爆料内容真实性尚待确认,相关技术细节很多在网上已有蛛丝马迹。DeepSeek R1发布至今已超过15个月,距离V3.2最终版也过去5个月,V4面临的压力不小。