10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑

5小时前 AI开源项目 37 0

今年 4 月,商汤科技发布了 SenseNova U1,首次完整展示了基于 NEO-Unify 架构的原生统一多模态路线。如今商汤持续强化模型的图像生成与编辑能力,正式开源轻量级统一多模态模型的预览版本 SenseNova U1.5-Lite-Preview。

U1.5-Lite-Preview 并非简单的模型规模升级,而是基于 U1 的一次系统性迭代。它仅以 8B-MoT 的轻量大小,将能力推进到 4K 分辨率、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。

图片 1

相比 U1 的显著提升

  • 原生支持 4K 图像生成
  • 更精细的局部纹理、细节与真实世界质感
  • 更准确的中英文文字生成与复杂版式组织
  • 更稳定的图像编辑和视觉指令遵循

长上下文视觉控制

U1.5-Lite-Preview 在生成能力上做了系统性打磨。不仅追求 4K 高像素,更关注模型能否理解超长的自然语言和结构化视觉指令,从而实现精准的视觉控制。

更高的视觉控制上限

在海报、信息图、品牌视觉等复杂创作任务中,一张图往往需要同时满足多类要求。U1.5-Lite-Preview 重点优化了对长篇自然语言、结构化创作指令的理解能力。简单需求用几句大白话就能快速生成;复杂任务则可以给出完整详细的创作要求,让模型按明确的视觉结构来执行。

下面这张"背包产品解析"信息图使用了 1675 词的超长 prompt,包含复古博物学标本图鉴风格、五章结构、中英双语对照、拉丁文标注等复杂约束。

图片 2

U1.5-Lite-Preview 的强 prompt following 能力并非主要来自对结构化模板的记忆。即使在未使用专门 Prompt Enhance 格式化数据训练的情况下,模型依然能够稳定执行长篇、多约束、层次化的视觉指令。

为降低编写门槛,还配套了实验性的 Prompt Enhance Skill:能把简短想法自动整理成包含主体、布局、风格、文字和各项约束的完整创作方案。

原生 4K 生成

4K 不只是像素更多,更是对细节、材质、光影和整体一致性的更高要求。无论是自然风光、商业摄影、产品海报、超宽幅长卷,都能呈现真实的材质质感与光影层次。

模型生成了横跨 2018 至 2026 年的 WAIC 发展历程长卷:

图片 3

WAIC 发展历程(分辨率 4K,长宽比 10:3,prompt 总长 3880 words)。即便放大观看,大量文字、图标等设计细节依然清晰稳定。

除了超大画幅,在常规图像的真实感与细节表现上也有明显提升:

图片 4

海岸游客中心建筑概念图

图片 5

浪漫生活主题拼贴海报

图片 6

阳光下的面部特写

图片 7

复古手帐页

图片 8

主题创意海报,人物摄影与夸张字体融合设计

图片 9

渔民坐在船上整理渔网

图片 10

迷你厨师团队正在装饰一只蓝莓奶油

图片 11

夏日冷萃咖啡时尚广告海报

图片 12

女生站在路边,身后车辆穿梭而过

文字生成与版式升级

强化了中英文文字生成及复杂版式组织能力,从杂志内页、旅行攻略,到复杂信息图,都能在保持视觉风格的同时,组织更清晰的版式结构与更准确的文字呈现。

图片 13

杂志内页

图片 14

信息图

图片 15

武康路 Citywalk 攻略

编辑能力进化

图像编辑要求模型能看懂画面内容、理解用户的真实意图,精准判断出"哪里要改、怎么改,以及哪些部分绝对不能动"。

依托原生统一多模态架构,U1.5-Lite-Preview 在同一个模型中协同完成视觉理解、目标定位、约束推理与像素生成的全流程。同时采用了 encoder-free 视觉建模方式,减少了固定视觉编码器带来的信息压缩与表征瓶颈。

图像创作从一次性的"重新采样",转向可持续迭代的视觉操作过程:模型可以在当前生成结果的基础上持续修改文案、调整版式、补充元素,从"一次抽卡、不行重来"变成"反复修改、改到满意"。

参考图风格与设计再创作

可理解参考图中的配色、构图、材质、字体和视觉语言,将其迁移至新的内容主题;也可以在保留原始信息的基础上,对海报和信息图进行整体美化与设计升级。

输入图片:

图片 16

输出图片:

图片 17

案例:青花瓷风格古建筑屋顶图鉴

多参考图组合编辑

可从多张参考图中分别提取人物、产品、场景和风格,完成跨图绑定、内容融合与场景重构。

输入图片:

图片 18
图片 19

输出图片:

图片 20

案例:水煮鱼菜单与炸鸡融合

单参考图条件创作

输入图片:

图片 21

输出图片:

图片 22

案例:人物照片简历排版

信息图局部编辑

输入图片:

图片 23

输出图片:

图片 24

案例:替换标题文字

文字编辑

可对真实场景中的文字进行编辑,并保持原有字体、材质、透视、排版与遮挡关系,使文字自然融入原图。

输入图片:

图片 25

输出图片:

图片 26

案例:添加手绘注释

交互式精准编辑

支持区域标记、坐标定位、marker 标记等方式让模型更准确地理解编辑位置与范围。

输入图片:

图片 27

输出图片:

图片 28

案例:红框指定区域修改

从验证架构可行,到真实场景好用

U1.5-Lite-Preview 针对性解决了真实创作痛点,在不盲目扩大模型规模的前提下,对生成与编辑全链路进行系统性优化:

  • 重新设计了生成头,减弱视觉 Token 网格对最终图像的影响,并将训练进一步扩展至 4K 分辨率
  • 重新组织了编辑数据与训练任务,强化模型对原图内容、主体身份、空间结构和非编辑区域的保持能力

U1.5-Lite-Preview 在多项主流生成/编辑质量评测基准上显著超越 U1:

  • Qwen-Image-Bench:从 47.14 提升到 55.20(with Prompt Enhance)
  • ImgEdit-Bench:从 3.90 提升到 4.37
  • GEdit-Bench-en:从 7.47 提升到 8.17
  • GEdit-Bench-zh:从 7.42 提升到 8.05

图片 29

图片 30

开源与下载

SenseNova U1.5-Lite-Preview 现面向全球用户开源:

  • GitHub:github.com/OpenSenseNova/SenseNova-U1
  • Hugging Face:huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
  • 魔搭社区:modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview

面向专业用户的交付级创作模型 U1 Pro 正在紧密邀测,将在近期对公众开放服务。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
#SenseNova #商汤开源 #多模态模型 #图像生成 #AI图像编辑 
收藏 1
Cherry Studio V2 进阶玩法:Agent 自主执行、MCP 集成与 Skill 生态
Humanizer-zh:专治中文写作 AI 味的开源 Skill,14.6k Star
推荐阅读
  • Taste-Skill:54.2K 星的开源 AI 前端审美规则库,根治模板化 UI
  • Star OfficeCLI:零依赖 AI 全包 Word Excel PowerPoint
  • Claude Code 隐藏彩蛋:18 种稀有度电子宠物
  • OpenFang:OpenClaw升级版,如何重新定义 Agent 框架的生产级标准
  • 说人话 Skill 详解:如何去除 AI 生成内容的翻译腔和工程师腔
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
11411 11月前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10319 9月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
8841 7月前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
8462 7月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
7855 11月前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
7612 9月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
7581 6月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
7562 10月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7049 6月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
6860 3月前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 scroll-world 与 img2threejs:两个炫酷的 GitHub 开源项目,让 AI 帮你做网页和 3D 模型
2 Humanizer-zh:专治中文写作 AI 味的开源 Skill,14.6k Star
3 SenseNova U1.5-Lite-Preview 开源:8B 轻量级统一多模态模型,支持 4K 图像生成与编辑
4 Cloudflare 开源企业级 Agent 工作平台 Cloudflare OS
5 human-writing:卡兹克开源活人感写作 Skill,从材料到推进消除 AI 味
6 AI复刻王虹手写PPT:从GPT Image到HTML完整方案,附开源Skill
7 wigolo:开源免费的 Agent 联网搜索工具,零成本替代 Tavily/Exa
8 GitHub 7月热门开源项目盘点:Hallmark、Orca、Strix 等 17 个值得关注的项目
9 Hallmark:2.1万Star的AI编程Skill,57道检测关卡告别AI味前端页面设计
10 DataEase:开源BI数据可视化工具,拖拽制图+Apache Doris加速查询,支持多数据源
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联