今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。
U1.5-Lite-Preview 并非简单的模型规模升级,而是基于 U1 的一次系统性迭代。它仅以 8B-MoT 的轻量大小,将能力推进到 4K 分辨率、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。

相比 U1 的显著提升
- 原生支持 4K 图像生成
- 更精细的局部纹理、细节与真实世界质感
- 更准确的中英文文字生成与复杂版式组织
- 更稳定的图像编辑和视觉指令遵循
长上下文视觉控制
U1.5-Lite-Preview 在生成能力上做了系统性打磨。不仅追求 4K 高像素,更关注模型能否理解超长的自然语言和结构化视觉指令,从而实现精准的视觉控制。
更高的视觉控制上限
在海报、信息图、品牌视觉等复杂创作任务中,一张图往往需要同时满足多类要求。U1.5-Lite-Preview 重点优化了对长篇自然语言、结构化创作指令的理解能力。简单需求用几句大白话就能快速生成;复杂任务则可以给出完整详细的创作要求,让模型按明确的视觉结构来执行。
下面这张"背包产品解析"信息图使用了 1675 词的超长 prompt,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束。

U1.5-Lite-Preview 的强 prompt following 能力并非主要来自对结构化模板的记忆。即使在未使用专门 Prompt Enhance 格式化数据训练的情况下,模型依然能够稳定执行长篇、多约束、层次化的视觉指令。
为降低编写门槛,还配套了实验性的 Prompt Enhance Skill:能把简短想法自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案。
原生 4K 生成
4K 不只是像素更多,更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷,都能呈现真实的材质质感与光影层次。
模型生成了横跨 2018 至 2026 年的 WAIC 发展历程长卷:

WAIC 发展历程(分辨率 4K,长宽比 10:3,prompt 总长 3880 words)。即便放大观看,大量文字、图标等设计细节依然清晰稳定。
除了超大画幅,在常规图像的真实感与细节表现上也有明显提升:

海岸游客中心建筑概念图

浪漫生活主题拼贴海报

阳光下的面部特写

复古手帐页

主题创意海报,人物摄影与夸张字体融合设计

渔民坐在船上整理渔网

迷你厨师团队正在装饰一只蓝莓奶油

夏日冷萃咖啡时尚广告海报

女生站在路边,身后车辆穿梭而过
文字生成与版式升级
强化了中英文文字生成及复杂版式组织能力,从杂志内页、旅行攻略,到复杂信息图,都能在保持视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。

杂志内页

信息图

武康路 Citywalk 攻略
编辑能力进化
图像编辑要求模型能看懂画面内容、理解用户的真实意图,精准判断出"哪里要改、怎么改,以及哪些部分绝对不能动"。
依托原生统一多模态架构,U1.5-Lite-Preview 在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时采用了 encoder-free 视觉建模方式,减少了固定视觉编码器带来的信息压缩与表征瓶颈。
图像创作从一次性的"重新采样",转向可持续迭代的视觉操作过程:模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素,从"一次抽卡、不行重来"变成"反复修改、改到满意"。
参考图风格与设计再创作
可理解参考图中的配色、构图、材质、字体和视觉语言,将其迁移至新的内容主题;也可以在保留原始信息的基础上,对海报和信息图进行整体美化与设计升级。
输入图片:

输出图片:

案例:青花瓷风格古建筑屋顶图鉴
多参考图组合编辑
可从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。
输入图片:


输出图片:

案例:水煮鱼菜单与炸鸡融合
单参考图条件创作
输入图片:

输出图片:

案例:人物照片简历排版
信息图局部编辑
输入图片:

输出图片:

案例:替换标题文字
文字编辑
可对真实场景中的文字进行编辑,并保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。
输入图片:

输出图片:

案例:添加手绘注释
交互式精准编辑
支持区域标记、坐标定位、marker 标记等方式让模型更准确地理解编辑位置与范围。
输入图片:

输出图片:

案例:红框指定区域修改
从验证架构可行,到真实场景好用
U1.5-Lite-Preview 针对性解决了真实创作痛点,在不盲目扩大模型规模的前提下,对生成与编辑全链路进行系统性优化:
- 重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练进一步扩展至 4K 分辨率
- 重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力
U1.5-Lite-Preview 在多项主流生成/编辑质量评测基准上显著超越 U1:
- Qwen-Image-Bench:从 47.14 提升到 55.20(with Prompt Enhance)
- ImgEdit-Bench:从 3.90 提升到 4.37
- GEdit-Bench-en:从 7.47 提升到 8.17
- GEdit-Bench-zh:从 7.42 提升到 8.05


开源与下载
SenseNova U1.5-Lite-Preview 现面向全球用户开源:
- GitHub:github.com/OpenSenseNova/SenseNova-U1
- Hugging Face:huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
- 魔搭社区:modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,将在近期对公众开放服务。