SenseNova U1.5 Lite正式版发布:支持超长指令,解锁原生4K真实视觉创作流
今天,商汤科技正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版(U1.5 Lite Preview)呈现的原生统一多模态模型能力相比,正式版更关注的是,这些能力能否更准确、更稳定地进入真实视觉创作流程。
模型重点围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、图像编辑和精细视觉控制等,提供更高可控性、更高清、更高性价比的能力工具,推动 AI 视觉生成真正跨越到“稳定完成真实视觉交付”的新阶段。
目前模型已面向全球开源,开发者与创作者可直接部署体验。
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15
魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
SenseNova Studio在线体验:https://unify.light-ai.top/
更完整的视觉创作能力,告别AI创作瓶颈
“精心写了 25 分钟的详细 Prompt,模型却只能解析 1k 字符,不得不花半小时删减细节”;“只想改掉图里的一只杯子,AI 却把背景和主角的脸一起换了”。
这些几乎是每个创作者都遇到过的“崩溃瞬间”。过往几年,行业往往把重点放在卷“画面美感”和“写实感”上;但在实际生产流程中,真正的核心问题是:模型能否精准执行你的完整意图?
SenseNova U1.5 Lite 解决了这一难题:
- 3-4k 字符超长复杂指令遵循:打破大多数开源模型在指令超过 1k 字符时易崩溃、遗漏细节的瓶颈。SenseNova U1.5 Lite 原生支持 3-4k 上下文长度,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束,提升复杂视觉任务的执行稳定性。
- 更高质量的视觉生成:改善整体构图、色彩、材质、光影、真实感和局部细节,减少“局部正确但整体完成度不足”的情况。
- 更可靠的原生图像编辑:增强主体身份、空间结构、版式关系和非编辑区域的保持,同时提升局部修改、元素替换、文字精修和多参考图编辑能力。
- 更好的文字与复杂布局:加强中英文文字、海报、信息图、品牌视觉及多文本排版能力,从“生成内容”进一步走向“组织完整视觉表达”。
- 更精细的视觉控制:支持 Bounding Box、Visual Marker 以及单图、多图参考等方式,对指定区域和对象进行更准确的编辑。
- 原生4K高分辨率输出:在高分辨率生成中兼顾整体构图与极精细的肌理、微小文字与光影折射。
实战演练:真实场景深度还原
我们挑选了最能考验“硬实力”的创作场景,带你看 SenseNova U1.5 Lite 如何搞定真实交付。
场景一:复杂视觉表达
1、创意海报与封面生成:
展现出极佳的美学完成度与高对比度质感。具备高精度的复杂布局能力,可精准掌控文字与留白节奏;在处理文字与物体的空间遮挡时,能够维持光影的自然连贯,充分展现了原生多模态对三维空间叠加关系的深刻理解。
2、高密度信息图生成:
保证中英文、数据等丰富细节的准确无误;通过多层级结构化空间映射,完美串联各类标签和信息,实现了复杂信息可视化图表的高质量一次性交付。
瑞士旅行攻略手绘地图 | 滑板信息图 | 馄饨制作指南 |
3、高清细节与艺术质感:
在建筑结构、人像肌理、艺术画作笔触等复杂场景中,展现出媲美摄影与大师画作的细腻质感。
超现实书本船只效果图 | 工人群像工笔水彩 | 海岸船只水彩画 | 哥特式教堂建筑 |
爵士乐演奏插画 | 沙滩人像特写 | 公路视角摄影 | 城市摄影海报 |
场景二:原生图像编辑
1、布局与风格可控编辑
- 草图/线稿转复古暖色漫画:精准遵循超长复杂指令,保留线稿分镜与人物轮廓,上色与材质补充自然细腻。
线稿图 | 编辑后 |
- 跨主题迁移且保持排版:深度理解原海报的版式框架,切换主题后仍能保持完美的视觉结构。
prompt:沿用参考图的复古印刷风格,生成一张天文台公众开放日主题海报。
参考图 | 编辑后 |
2、多参考图融合生成
- 融合核心元素与场景重组:如“橘猫骑摩托坐在咖啡馆内”,提取多图核心特征(主体、风格、光影),在全新空间中自然重组,光影与比例浑然天成。
参考图 | 参考图 | 参考图 |
编辑后
- 美食海报重组:多张美食图融合为一张完整海报,自动匹配一致的背景、餐盘质感与环境光,并完美植入排版文案。
参考图 | 参考图 | 参考图 | 参考图 | 参考图 |
编辑后
- 信息图参考元素替换:保留原海报中的所有元素,同时替换图中的乐队成员,并将下方板块重新排列,添加曲目和新的划线元素。
prompt:Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.
参考图 | 参考图 | 参考图 |
编辑后
3、信息图编辑
- 变换风格主体保持不变:
prompt:将整张海报改为蓝银色高科技工业风,保持所有文字内容、机器人主体和信息布局不变。
- 局部属性修改:
prompt:将植物周围Cd、Pb、Zn、Cu、As五个圆形标签改为砖红色,文字保持米白。
4、文字编辑
- 黑板菜单局部文字替换:
prompt:将黑板菜单上“Summer Drinks”标题下方第一行、位于白色三角形符号右侧的黄色手写体文字“快乐柠檬水”替换为红色手写体文字“草莓啵啵奶茶”,保持原有粉笔质感和笔触风格,严格保留黑板上其余所有文字(包括价格5.00)、插图(柠檬、咖啡杯、冰棍)、木框结构及背景绿植环境不变。
- 多处精准文字重写:
在左上英文地点标题,将 "ORIENTAL PEARL TOWER" 替换为 "SHANGHAI LANDMARK"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
在左上英文地点副标题,将 "SHANGHAI, CHINA" 替换为 "CITY OF HARMONY"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
在右上中文地点标题,将 "东方明珠" 替换为 "城市之光"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
在左侧城市宣言第一句,将 "A SYMBOL OF SHANGHAI." 替换为 "A BEACON OF VISION."。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
在右侧城市宣言第一句,将 "DESIGNED FOR HARMONY." 替换为 "BUILT FOR TOMORROW."。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
在建筑底部中文大标语,将 "时代的瞭望 · 城市的明珠" 替换为 "城市的节奏 · 未来的地标"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
在底部英文宣言,将 "A LANDMARK OF VISION. A BEACON OF SHANGHAI." 替换为 "A LANDMARK OF TOMORROW. A BEACON OF THE CITY."。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。
5、指定区域与局部精细编辑
prompt:将红框中的“WHY IT MATTERS”模块完整翻译为中文,保留原有图标、层级和排版;红框仅作定位,输出中不要保留红框。
prompt:Follow the marks and overall hints on the image to creatively transform this scene, making it moody, sophisticated midnight lounge vibe; remove the annotations when done.
8B 参数架构突破:不只是“更多”能力,还是“更稳定”和“更高性价比”
作为8B参数的轻量化模型,SenseNova U1.5 Lite在指令遵循与图像编辑保持度上超越了同量级模型,并在文字渲染与复杂布局上达到了媲美超大规模商业模型的交付水平。
面对不同视觉任务,业界通常采用显式 Router(路由)或多专家协同机制将渲染、美学、编辑分发给不同模型。但这大幅增加了系统开销与推理时延。
SenseNova U1.5 Lite 基于NEO-unify统一架构,打破了这一传统定式:
- 解耦训练与交付(MOPD 蒸馏):训练阶段针对文字、美学、编辑独立训练专家模型(Expert);交付阶段,通过多专家在线策略蒸馏技术(MOPD),将多专家能力无损融合至单体 8B 模型中。
- 理解与生成双向反哺:视觉语义理解与空间建模形成的认知直接反哺生成,使其自然消化多层级指令,同时在多模态理解榜单上保持强劲表现。
- 极致性价比:8B 参数量支持单卡流畅运行,无须 Router 频繁切换,单次 Pass 即可兼顾语义理解与像素生成,极大降低调用成本与推理延迟。
在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 与 Qwen-Image-Bench 上的生成延迟与平均性能对比。
此外,正式版强化了任务导向的强化学习(RL)后训练,聚焦优化三大关键维度:
- 指令遵循(Instruction Compliance):轻松解析超长 Prompt,精准执行严苛的多重复杂限制。
- 视觉偏好(Visual Preference):全面优化构图、材质与光影,提升画面质感与视觉完成度。
- 编辑保持(Editing Preservation):实现像素级局部修改,完美保留非目标区域的内容与结构。
这种复杂指令跟随与精细编辑能力,使得 SenseNova U1.5 Lite 可以无缝支持多轮迭代修改而不跑偏。这真正打破了单次生成的局限,让轻量级模型参与长流程的持续创作与二次改造成为可能。
让开源创作从“能看”走向“能用”
多模态是AI迈向物理世界与真实生产力的必经之路。商汤 SenseNova U1.5 Lite 开源的初衷,正是希望为全球开发者与创作者提供一个轻量、统一、极具性价比且高可控的生产力工具。
欢迎前往 GitHub / Hugging Face 部署体验,与我们共同繁荣开源生态!
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15
魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
SenseNova Studio在线体验:https://unify.light-ai.top/
本文由方向对了资讯网发布,不代表方向对了资讯网立场,转载联系作者并注明出处:https://www.zhenyes.com/industry/8575.html





