商汤科技今日正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版相比,正式版的核心变化在于,将能力重心从“展示多模态潜力”转向“稳定进入真实视觉创作流程”。

模型围绕真实视觉任务重新设计了训练数据、任务定义与后训练流程,重点强化了视觉质量、复杂指令遵循、文字与布局控制、原生4K输出、图像编辑和精细视觉控制等能力。目前模型已面向全球开源,开发者与创作者可直接部署体验。

打开网易新闻 查看精彩图片

解决创作中的“崩溃瞬间”

官方在发布中列举了创作者常见的痛点:“精心写了25分钟的详细Prompt,模型却只能解析1k字符”;“只想改掉图里的一只杯子,AI却把背景和主角的脸一起换了”。这些问题的根源在于模型能否精准执行用户的完整意图,而非单纯比拼画面美感。

SenseNova U1.5 Lite 针对这些瓶颈给出了具体方案:

  • 3-4k字符超长复杂指令遵循:打破多数开源模型在指令超过1k字符时易崩溃、遗漏细节的瓶颈,可同时处理主体、数量、空间关系、文字、布局、风格等多重约束。
  • 更高质量的视觉生成:改善整体构图、色彩、材质、光影、真实感和局部细节,减少“局部正确但整体完成度不足”的情况。
  • 更可靠的原生图像编辑:增强主体身份、空间结构、版式关系和非编辑区域的保持,支持局部修改、元素替换、文字精修和多参考图编辑。
  • 更好的文字与复杂布局:加强中英文文字、海报、信息图、品牌视觉及多文本排版能力。
  • 更精细的视觉控制:支持 Bounding Box、Visual Marker 以及单图、多图参考等方式,对指定区域和对象进行更准确的编辑。
  • 原生4K高分辨率输出:在高分辨率生成中兼顾整体构图与极精细的肌理、微小文字与光影折射。

真实场景实测:从海报到图像编辑

官方同步展示了多个实战场景,验证模型在真实交付中的表现。

在复杂视觉表达方面,模型可完成高美学完成度的创意海报与封面生成,精准控制文字与留白节奏,并处理文字与物体的空间遮挡关系;在高密度信息图生成中,能保证中英文、数据等细节准确无误,实现复杂信息可视化图表的一次性交付;在建筑结构、人像肌理、艺术画作笔触等场景中,展现出细腻质感。

在原生图像编辑方面,模型支持布局与风格可控编辑。例如,将手绘草图渲染为复古暖色调漫画时,能精准遵循超长复杂指令,保留线稿分镜与人物轮廓,并自然补充上色与材质;跨主题迁移时,能深度理解原海报版式框架,切换主题后仍保持视觉结构完整。

多参考图融合生成同样表现突出:可提取多图核心特征(主体、风格、光影)在全新空间中自然重组;多张美食图可融合为一张完整海报,自动匹配背景、餐盘质感与环境光;信息图参考元素替换时,能保留原海报所有元素,同时替换指定对象并重新排列板块。

SenseNova U1.5 Lite 的发布,意味着 AI 视觉生成正从“能生成好看的图”向“稳定完成真实视觉交付”跨越。对于依赖 AI 辅助创作的团队而言,超长指令遵循与原生4K输出能力的落地,或将显著减少反复调试 Prompt 与后期修复的时间成本。

模型已开放下载与在线体验,开发者可通过 GitHub、Hugging Face、魔搭社区及 SenseNova Studio 平台获取。