SenseNova U1.5-Lite-Preview是商汤科技正式面向社区开源发布的轻量级统一多模态模型预览版本。它并非简单的模型规模升级,而是基于今年4月发布的SenseNova U1进行的一次系统性迭代,在同一架构中贯通视觉理解、推理、生成与编辑,仅以8B-MoT的轻量级规模,将能力推进到4K分辨率、更精细的真实质感、更复杂的视觉控制和可持续迭代编辑。
在多项主流生成/编辑质量评测基准上,U1.5-Lite-Preview显著超越前代U1,并以轻量级体量实现了可比肩商用闭源模型的图像生成能力与编辑效果。

SenseNova U1.5-Lite-Preview核心特点
1. 极致轻量,性能越级
- 模型规格仅为8B-MoT(基于稠密骨干网络),属于轻量级参数规模
- 却能在图像生成与编辑质量上对标甚至超越部分大型商业闭源模型
- 推理响应速度快,适合本地部署与边缘端运行
2. 原生4K图像生成
- 无需超分辨率后处理,原生支持4K分辨率图像输出
- 从生成源头保证高分辨率下的细节完整性和画面一致性

3. 精细真实质感
- 局部纹理、光影细节与真实世界质感表现显著提升
- 生成图像在材质表现、光照反射、景深层次等方面更趋近真实摄影效果
4. 精准文字生成与复杂版式
- 中英文文字生成准确度大幅提升,减少乱码、扭曲等常见问题
- 支持复杂版式组织,可在图像中精准控制多段落、多字体、多区域的文字排版
5. 稳定编辑与指令遵循
- 图像编辑过程更加稳定,减少非预期区域变动
- 对视觉指令的遵循能力更强,用户描述什么就编辑什么
6. 可持续迭代编辑
- 支持多轮连续编辑,用户可在同一图像上反复下达编辑指令
- 每次编辑不会破坏前序编辑成果,保持全局一致性

SenseNova U1.5-Lite-Preview技术原理
1. NEO-Unify原生统一架构
U1.5-Lite-Preview继承并强化了商汤自研的NEO-Unify架构,其核心设计理念为:
- 摒弃拼接式设计:传统多模态模型通过适配器组合视觉编码器(VE)、语言理解模块与生成模块,信息在不同组件间多次转换,存在损耗大、协同效率不足的问题
- 去除视觉编码器与变分自编码器(VAE):不再依赖独立的视觉编码与解码组件
- 重构统一表征空间:将语言与视觉信息作为统一的复合体直接建模,信息在每一层计算中深度交融
- 从模态集成到原生统一的范式跨越:理解与生成能力同步增强,在保留语义丰富度的同时维持像素级视觉保真度
2. MoT(Mixture of Transformers)骨干网络
- 采用8B参数稠密骨干,所有参数在每次推理时全部激活
- MoT架构在统一Transformer中同时处理文本Token与视觉Token,无需在不同模块间切换
- 相比混合专家(MoE)架构,稠密骨干在推理行为上更加稳定可控,适合精细生成任务
3. 单模型贯通四大能力
在单一模型架构中联合建模:
表格
| 能力维度 | 说明 |
|---|---|
| 视觉理解 | 深度理解图像内容、空间关系与物理布局 |
| 视觉推理 | 基于图像信息进行逻辑推断与因果分析 |
| 图像生成 | 从文本描述原生生成高分辨率图像(最高4K) |
| 图像编辑 | 基于自然语言指令对已有图像进行精准修改 |
四种能力共享同一套权重与表征空间,无需多模型串联调用,单次单模型即可完成连续的图文创作输出。
4. 系统性能力迭代策略
相比U1,U1.5-Lite-Preview的进化并非依赖参数规模扩大,而是通过:
- 训练数据质量与多样性提升
- 生成-编辑联合训练强化
- 4K高分辨率原生训练流程优化
- 文字渲染与版式控制的专项强化
- 迭代编辑场景下的一致性约束训练
SenseNova U1.5-Lite-Preview项目地址
GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
SenseNova U1.5-Lite-Preview核心功能
1. 高分辨率图像生成
- 支持从1024×1024到4K(3840×2160) 的多分辨率原生生成
- 生成质量在主流评测基准上达到商业级水准
2. 复杂信息图生成
- 可生成包含精确数据、图表、图标、多段文字的完整信息图
- 文字准确、排版合理、视觉层级清晰,达到商用级表现
3. 精准图像编辑
- 支持局部修改、风格迁移、元素替换、背景更换等操作
- 编辑区域精准可控,非目标区域保持稳定
4. 多轮迭代编辑
- 用户可对同一张图像连续下达多轮编辑指令
- 模型在每轮编辑中保持全局一致性,支持渐进式精修
5. 中英文文字渲染
- 在生成图像中精准嵌入中文或英文文字
- 支持多字体、多字号、多色彩的复杂文字排版
6. 连续图文创作
- 单次调用即可输出包含文字说明与配图的连续创作内容
- 适用于科普图解、产品介绍、教程文档等场景
7. 视觉指令遵循
- 对自然语言描述的视觉控制指令(如”把背景换成日落””将人物服饰改为汉服”)具有高遵循度
SenseNova U1.5-Lite-Preview应用场景
1. 商业设计与营销物料
- 电商产品图、广告海报、社交媒体视觉素材的快速生成与迭代修改
- 4K输出满足印刷级品质需求
2. 信息图与数据可视化
- 科研论文配图、行业报告图表、科普可视化内容生成
- 复杂版式与精准文字渲染能力确保信息传达准确
3. 自媒体与内容创作
- 公众号配图、视频封面、PPT美化、短视频素材
- 多轮迭代编辑降低设计门槛,非专业用户也可产出高质量视觉内容
4. 教育与培训材料
- 教材插图、知识图解、考试题目配图的批量生成
- 中英文文字精准嵌入,满足多语言教育场景
5. 本地化私有部署
- 8B参数量支持在消费级GPU或工作站上本地运行
- 适合对数据隐私有要求的企业内部设计流程
6. 具身智能与机器人视觉(远期)
- 基于统一多模态理解与生成能力,未来可为机器人提供视觉感知与场景理解的”具身大脑”
SenseNova U1.5-Lite-Preview与U1的对比
表格
| 维度 | SenseNova U1 | U1.5-Lite-Preview |
|---|---|---|
| 最高生成分辨率 | 标准分辨率 | 原生4K |
| 局部纹理与质感 | 良好 | 显著提升 |
| 中英文文字准确度 | 可用 | 更准确,复杂版式可控 |
| 图像编辑稳定性 | 基础水平 | 更稳定 |
| 视觉指令遵循 | 基础水平 | 显著增强 |
| 迭代编辑 | 有限支持 | 可持续多轮迭代 |
| 评测基准表现 | 同量级领先 | 显著超越U1 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



