SenseNova U1.5技术报告发布,官方给出的定位是:从能力共存,走向真正的能力交互。这是一个开源的8B-MoT原生统一模型,官方称其不止于"能看也能画"。

共享注意力,是这次的关键词

打开网易新闻 查看精彩图片

U1.5采用原生MoT架构,理解和生成通过共享注意力连接。

配套的是空间联合重建方案。它用Pixel Shuffle加3×3空间卷积,支撑原生4K生成,同时提升空间连贯性。

训练层面,美学、OCR、信息图、编辑这几个方向的专家模型,通过多专家在线策略蒸馏合并成一个统一模型。路径是:先专精,再统一。

两组数字,说明交互真的发生了

报告里给出了两组对比数据:

  • 推理到生成:WISE指标从0.70提升到0.81,靠的是CoT
  • 生成到理解:RealUnify-GEU从47.5提升到56.3,对比对象是U1-SFT

第一组说明,让模型在生成前先"想一步",画面质量会变好。第二组则是生成能力的增强反过来抬高了理解能力的分数。官方将这一变化对应到"能力交互"与"能力共存"的区别上。

视觉推理方面,U1.5在VBVR-Pro-Bench上拿到68.2%,官方给出的对比是Nano-Banana-Pro的56.4%和GPT-Image-2的50.7%。

开源的不只是权重,还有配方

这次放出的内容包括完整的训练配方:SFT、RL以及多专家在线策略蒸馏。技术报告发布在Hugging Face Papers,模型和代码分别托管在Hugging Face集合页与GitHub的OpenSenseNova仓库下,另有SenseNova Studio和Token Plan两个入口。

8B的体量、原生4K生成、共享注意力的理解生成交互,加上完整训练配方,这几件事叠在一起,是这次发布的主要内容。