打开网易新闻 查看精彩图片

公司情报专家《财经涂鸦》获悉,8月3日,商汤宣布面向全球用户开源轻量级统一多模态模型的预览版本SenseNova U1.5-Lite-Preview该版本是基于U1的一次系统性迭代,不仅在同一架构中贯通视觉理解、推理、生成与编辑,还以仅8B-MoT轻量的大小,将能力推进到4K、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。

今年4月,商汤发布SenseNova U1,首次完整展示了基于NEO-Unify架构的原生统一多模态路线。

7月16日,SenseNova U1信息图增强版V3(SenseNova-U1-8B-MoT-Infographic-V3,以下简称Infographic-V3)发布,首次加入信息图编辑能力。

7月18日,2026WAIC期间,商汤科技再发布面向长程任务的交付级原生多模态智能体基座——日日新SenseNova U1 Pro,推动行业正式告别传统的“单点式内容生成(Generation)”,全面迈向能够闭环完成复杂、长程任务的“系统级内容交付(Delivery)”新时代。

此次开源的U1.5-Lite-Preview较U1在多个方向带来显著提升,包括原生支持4K图像生成;更精细的局部纹理、细节与真实世界质感;更准确的中英文文字生成与复杂版式组织,以及更稳定的图像编辑和视觉指令遵循

例如,U1.5-Lite-Preview重点优化了对长篇自然语言、结构化创作指令的理解能力。简单需求用户说几句话就能快速生成;复杂的任务,则可以给出完整详细的创作要求,让模型按明确的视觉结构来执行。

“在我们看来,超长的提示词并不是生成好图的必要条件,它的价值是给复杂创作提供了更高的控制上限”商汤表示。

一个重要观察是,U1.5-Lite-Preview的强prompt following能力,并非主要来自对结构化模板的记忆或适配。即使在没有高度依赖专门Prompt Enhance格式化数据训练的情况下,模型依然能够较稳定地执行长篇、多约束、层次化的视觉指令。

商汤认为,这正体现了原生统一多模态路线的优势:模型学到的不是某种Prompt格式本身,而是从语言描述到视觉结构的原生映射能力

编辑能力进化方面,U1.5-Lite-Preview让图像编辑不再是外挂功能,而是统一模型在理解视觉状态、执行用户约束并重构目标画面上的原生能力。这使图像创作从一次性的“重新采样”,转向可持续迭代的视觉操作过程。

目前,U1.5-Lite-Preview已覆盖多类主流创作工作流:包括参考图风格与设计再创作、,多参考图组合编辑、单参考图条件创作、信息图局部编辑、文字编辑、交互式精准编辑等。

如果说U1成功验证了“统一架构是否可行”,证明了从像素和语言出发、端到端构建原生统一多模态模型是一条可行的路线,那么U1.5将进一步验证“能力能否持续扩展”,证明统一架构不仅能够同时承载理解和生成,也能够继续扩展到更高分辨率、更复杂的信息表达和更真实的视觉世界。

“我们相信,未来的多模态模型不应只是连接不同模态的系统,而应该是一个从一开始就能够跨越语言、视觉与行动进行学习、思考和创造的统一智能体。”商汤表示。

据悉,面向专业用户的交付级创作模型 U1 Pro亦正紧密邀测,将在近期对公众开放服务。