来源:市场资讯

(来源:网易智能)

8月3日消息,商汤科技近日开源轻量级统一多模态模型预览版本SenseNova U1.5-Lite-Preview。该模型基于此前SenseNova U1使用的NEO-Unify架构进一步迭代,在单一模型中贯通视觉理解、推理、生成与编辑,并以8B-MoT规模原生支持4K图像生成。

据介绍,SenseNova U1.5-Lite-Preview重点提升了图像生成和编辑能力,包括更精细的局部纹理与真实质感、更准确的中英文文字生成与复杂版式组织,以及更稳定的图像编辑和视觉指令遵循能力。

在视觉控制方面,U1.5-Lite-Preview强化了对长篇自然语言和结构化创作指令的理解能力,可处理主体、布局、风格、文字等多重约束。商汤还同步提供实验性的Prompt Enhance Skill,可将用户较为简短的创作需求整理成更完整的视觉创作方案,再交由模型执行。

在图像生成方面,该模型训练进一步扩展至4K分辨率。商汤表示,U1.5-Lite-Preview重新设计了生成头,以减弱视觉Token网格对最终图像的影响,并改善高分辨率场景下的局部细节、纹理衔接和整体一致性。

编辑能力方面,U1.5-Lite-Preview采用encoder-free视觉建模方式,在统一模型中完成视觉理解、目标定位、约束推理与像素生成。其支持参考图风格迁移、多参考图组合编辑、单参考图条件创作、信息图局部编辑、文字编辑以及区域标记、坐标定位等交互式精准编辑。

商汤表示,相比U1,U1.5-Lite-Preview针对编辑范围外内容变化、主体身份漂移、局部修改影响整体画面等问题进行了优化,通过重新组织编辑数据与训练任务,强化模型对原图内容、空间结构以及非编辑区域的保持能力。

评测数据显示,SenseNova U1.5-Lite-Preview在Qwen-Image-Bench上的成绩由47.14提升至55.20(with Prompt Enhance),ImgEdit-Bench由3.90提升至4.37,GEdit-Bench-en由7.47提升至8.17,GEdit-Bench-zh由7.42提升至8.05。

目前,SenseNova U1.5-Lite-Preview已通过GitHub、Hugging Face和魔搭社区面向全球用户开源。此外,商汤面向专业用户的交付级创作模型U1 Pro正在邀测,并计划近期对公众开放服务。(定西)