SenseNova U1.5 Lite是商汤科技正式开源的轻量级、原生统一多模态大模型,基于商汤自研的NEO-Unify架构,仅有8B-MoT参数规模。该模型在同一架构中贯通了视觉理解、推理、图像生成与图像编辑四大核心能力,原生支持4K分辨率图像输出,支持3-4k上下文长度。其前身SenseNova U1于2026年4月发布并开源,U1.5 Lite在此基础上进行了系统性迭代,从验证”统一架构是否可行”推进到验证”能力能否持续扩展”。模型权重已同步上线GitHub、Hugging Face及魔搭社区,面向全球开发者免费开放。

SenseNova U1.5 Lite特点
- 极致轻量化:仅8B-MoT参数规模,在单张消费级显卡上即可实现4K图像的实时生成。据2026年8月4日对Preview版本的公开分析,相较于需要多模型协同的传统方案,其推理速度提升约2.3倍,内存占用降低约58%,中小团队可低成本部署。
- 原生统一架构:摒弃传统”视觉编码器+语言模型+适配层”的拼接式设计,将语言、视觉语义和像素生成融合在同一套表征空间中,图像和语言不再由两套系统”接力”处理,而是在同一个模型中自然融合,减少信息损耗。
- 原生4K直出:不是通过后期超分放大,而是在模型训练阶段就扩展到4K分辨率,在超大画幅场景下兼顾整体构图与极精细的肌理、微小文字和光影折射。
- 复杂指令精准遵循:原生支持3-4k上下文长度,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束,支持长篇、多约束、层次化和结构化的视觉指令。
- 可持续迭代编辑:生成后不再是一次性输出,而是可以继续通过自然语言指令逐步调整文案、版式和画面元素,支持参考图、多图组合、局部文字编辑以及红框、坐标和marker精准编辑。
- 性能越级:在指令遵循与图像编辑保持度上超越同量级模型,文字渲染与复杂布局能力达到媲美超大规模商业模型(如Qwen-Image 2.0 Pro、Seedream 4.5等)的交付水平。
SenseNova U1.5 Lite技术原理
SenseNova U1.5 Lite的技术架构建立在以下核心路径之上:
NEO-Unify统一架构:这是整个模型的技术基石。传统多模态模型通常采用”拼接”方式,将视觉编码器(VE)和语言骨干通过适配器串联,信息在不同模块之间来回传递,既费时又造成信息损耗。NEO-Unify架构彻底去除了独立的视觉编码器和变分自编码器(VAE),重新构建统一的表征空间,让模型在同一套”思考方式”中直接处理图像和文字,图像和语言在同一个”大脑”中自然融合。这种设计使模型在相对精简的规模下,就能高效实现更强的多模态理解与生成能力。
Encoder-Free视觉建模:在图像编辑任务中,模型引入encoder-free视觉建模方式,减少信息压缩损失,使编辑过程更可控,确保非编辑区域不受意外改动。模型将视觉理解、目标定位、约束推理与像素生成整合为单一流程,支持”哪里不对改哪里”的可持续迭代创作。
生成头结构重设计:商汤通过重新设计生成头结构,有效解决了网格伪影问题,并将训练扩展至4K分辨率,使模型在高分辨率生成中兼顾整体构图与极精细的细节表现。
长上下文视觉控制:模型重点优化了对长篇自然语言和结构化创作指令的理解能力。关键突破在于,这种强指令遵循能力并非来自对特定提示词模板的记忆训练,而是模型自主建立了语言描述与视觉结构之间的原生映射关系。即使未使用专门格式化数据训练,仍能稳定执行多层次视觉指令。
系统化后训练优化:U1.5 Lite正式版围绕真实视觉任务重新完善了训练数据、任务设计与后训练流程,在图像编辑任务中优化了数据组织与训练策略,强化了对原图内容、主体身份、空间结构的保留能力。
SenseNova U1.5 Lite项目地址
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15
魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
SenseNova U1.5 Lite功能
- 高质量视觉生成:支持原生4K分辨率图像直出,改善整体构图、色彩、材质、光影、真实感和局部细节,覆盖自然风光、商业摄影、产品海报、超宽幅长卷等多种场景。
- 中英文文字渲染与复杂版式:准确处理中英文混合文本,支持多字体组合、艺术字渲染及文字与背景融合,在信息图、海报、杂志排版、品牌视觉等高信息密度内容中实现文字与视觉元素的精准对齐。
- 原生图像编辑:支持多种粒度的编辑方式——局部元素替换、画面文字修改、指定区域增删,编辑时保留原有字体、材质、光照和透视关系,非编辑区域不受影响。
- 多图参考创作:可同时读取多张参考图,从不同图片中分别提取人物、场景与字体风格,融合生成新的作品。
- 超长Prompt理解:支持数千词的超长提示词,可同时处理主体、数量、空间关系、文字、布局、风格等多重约束,在复杂信息图任务中保持内容和版式的稳定性。
- Prompt Enhance Skill:配套实验性工具,可将用户简短描述自动转化为包含主体、布局、风格等要素的完整创作方案,降低复杂视觉指令的编写门槛。
- 视觉理解与推理:作为统一多模态模型,不仅支持生成和编辑,还具备图像理解、视觉推理等能力,形成理解-生成-编辑的完整闭环。
SenseNova U1.5 Lite应用场景
- 商业设计与品牌视觉:生成商业海报、产品包装、品牌VI素材、电商主图和详情页,支持4K高分辨率输出,满足印刷和大幅面展示需求。
- 信息图与知识可视化:自动生成高信息密度的信息图、流程图、知识图谱、时间线长卷等,适合教育、科普、报告、数据可视化等场景。
- 出版与印刷:杂志内页、书籍封面、宣传册等需要复杂版式和精准文字排版的场景,模型可自动适配字体风格、段落间距,实现文字与视觉元素的精准对齐。
- 社交媒体内容:快速生成适配各平台的视觉素材,支持从简短描述到成品的快速转化,降低内容创作门槛。
- 创意迭代与改稿:设计师可在已生成的基础上通过自然语言指令持续调整,无需从零重新生成,大幅缩短”生成—反馈—修改”的迭代周期。
- 多语言内容生产:中英双语甚至多语言混排的文字渲染能力,适合跨境电商、国际化品牌等多语言视觉内容需求。
- 轻量化本地部署:8B参数规模使中小团队和个人开发者可在消费级显卡上部署,适合对数据隐私有要求的本地化创作场景,无需依赖云端API。
SenseNova U1.5 Lite同类产品对比
表格
| 对比维度 | SenseNova U1.5 Lite(商汤科技) | Qwen-Image-2.0(阿里通义千问) |
|---|---|---|
| 研发主体 | 商汤科技日日新团队 | 阿里巴巴通义千问团队 |
| 产品定位 | 轻量级开源原生统一多模态生图模型,主打低门槛 4K 视觉生成与编辑 | 7B 级开源图像基础模型,生成编辑一体化,主打专业排版与文本渲染 |
| 核心架构 | NEO-Unify 原生统一架构,语言 + 视觉语义 + 像素联合建模,无独立 VAE 与视觉编码器 | MMDiT 多模态扩散 Transformer,搭配 Qwen3-VL 条件编码器与双编码机制 |
| 参数规模 | 8B MoT | 7B(生成、编辑能力统一在单模型内) |
| 原生分辨率 | 4K 级原生输出 | 2K 级原生输出 |
| 核心特色 | 单模型贯通理解 + 生成 + 编辑全链路;复杂版式与中英文文字生成精准;3-4K 超长指令遵循稳定;单消费级显卡即可部署 | 中英文文本渲染能力领跑开源基准;支持 1K Token 长指令;多项生图与编辑基准测试成绩领先;生态工具链完善 |
| 代表能力 | 文生 4K 高清图、局部精准编辑、多参考图控制生成、海报信息图排版、多模态语义理解 | 文生图创作、精准图文重编、长文本海报生成、专业信息图排版、多风格创意输出 |
| 适用场景 | 本地私有化部署、商业海报设计、电商素材批量生产、端侧多模态应用、低成本视觉内容生产 | 开源二次开发、商业设计物料生产、长文案视觉化、企业批量素材生成、本地化设计工具集成 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



