商汤8B多模态模型原生出图4K

商汤今日正式开源 SenseNova U1.5 Lite,以 8B-MoT 规模统一完成视觉理解、4K 图像生成与原生编辑。相比单纯追求出图分辨率,它在文字排版、非编辑区域保持和多重指令遵循上的进步更值得关注。
商汤把 8B 统一多模态模型推到了 4K
商汤科技今天(2026 年 8 月 21 日)正式开源轻量级统一多模态模型 SenseNova U1.5 Lite,模型以 8B-MoT 规模同时覆盖视觉理解、推理、图像生成与图像编辑,并原生支持 4K 级图像输出。
SenseNova U1.5 Lite 是商汤 SenseNova U1 系列的最新轻量级开源版本,也是 8 月初 U1.5-Lite-Preview 预览版后的正式落地版本。模型权重和相关资料已经上线 GitHub 与 Hugging Face,官方提供的模型标识为 SenseNova-U1.5-8B-MoT。
这次更新最显眼的标签是“8B”和“原生 4K”,但真正决定它是否好用的并不是像素数量,而是模型能否在高分辨率画布上同时管住主体、数量、空间关系、文字、布局、材质和风格。过去不少生成模型可以先出一张看起来不错的图,再通过超分辨率放大到 4K;问题是放大只能补纹理,不能修正错误的文字、错位的布局和失控的主体关系。SenseNova U1.5 Lite 试图把这些问题前移到生成阶段解决。

“原生统一”不是把几个模型串起来
原生统一多模态模型是指在同一套模型架构和表征空间内完成文本与视觉信息的理解、推理、生成和编辑,而不是分别调用视觉编码器、语言模型、扩散模型和编辑模型完成流水线拼接。
SenseNova U1.5 Lite 延续了商汤在 SenseNova U1 中采用的 NEO-Unify 路线。按照商汤公开的信息,这一路线强调从文本和视觉信号出发进行统一建模,让模型在生成像素之前就理解画面中的对象、关系和用户约束。对于普通文生图任务,这种差异未必一眼可见;对于“保留人物身份,只替换衣服,并把右下角日期改成 2026 年 8 月 21 日,其余排版不动”这类任务,统一建模的价值会明显得多。
图像编辑保持度是衡量模型在执行修改时能否保留原图主体身份、空间结构、版式关系和非编辑区域的能力。传统生成式编辑常见的问题是“改一处、重画整张”:用户只要求换掉杯子的颜色,人物的脸、背景文字和光线却一起漂移。商汤称 U1.5 Lite 重新组织了编辑数据和训练任务,重点强化原图内容及非编辑区域的保持能力,让编辑更接近 Photoshop 中的定向修改,而不是基于原图重新抽卡。
这也是 SenseNova U1.5 Lite 相比普通 8B 视觉语言模型更特别的地方。大多数轻量级多模态模型主要负责看图、识别和回答问题,本身并不生成图像;SenseNova U1.5 Lite 则把看图、推理、出图和改图放进同一个模型体系,产品边界更接近完整的视觉创作模型。
4K 不是简单把宽高参数调大
原生 4K 图像生成是指模型在训练和生成阶段直接面向 4K 级高分辨率视觉结构建模,而不是只生成低分辨率底图后再交给独立超分模型放大。需要注意的是,“4K”通常代表约 3840 像素宽度的分辨率等级,不同画幅对应的具体宽高可能不同,官方目前没有将其限定为单一的 3840×2160 输出比例。
高分辨率生成的困难会随着画布扩大而放大。模型不仅要补出更多像素,还要保证人物五官、产品边缘、织物纹理、玻璃折射、阴影方向和小字号文字在整张图里相互一致。低分辨率下不明显的视觉 Token 网格、纹理断裂和局部重复,到了 4K 画布上往往会直接变成可见瑕疵。
商汤为此重新设计了生成头,并将训练扩展到 4K 分辨率。生成头是把模型内部视觉表征还原为最终图像的关键模块;它可以类比为相机成像链路的最后一段,前面理解得再准确,如果这里出现网格干扰或细节还原不足,最后导出的高分辨率图仍然会显得塑料、松散或带有拼接感。
官方称新版本改善了构图、色彩、材质、光影、真实感和局部细节,目标是减少“局部看着都对,整张图却不像成品”的情况。这个方向比单纯提高分辨率更务实,因为商业海报、电商主图和信息图最终看的是整体交付质量,而不是文件属性里是否写着 4K。
3—4K 上下文用来承载复杂视觉需求
视觉上下文长度是模型在一次任务中能够接收并联合处理的文本、图像及相关视觉条件的容量。商汤表示 SenseNova U1.5 Lite 原生支持 3—4K 上下文长度,可同时处理主体、数量、空间关系、文字、布局和风格等多重约束。
这里的 3—4K 上下文与 4K 图像分辨率是两个概念,前者描述输入条件和序列容量,后者描述输出图像的像素等级。官方现阶段并未在公开简报中进一步拆分不同输入形态对应的精确 Token 上限,因此不宜把 3—4K 直接等同于固定数量的纯文本 Token。
指令遵循是模型把自然语言中的主体、位置、数量、文字和禁止项准确落实到画面中的能力。对于“制作一张横向发布会海报,左侧是产品,右侧包含三组参数,中英文标题各一行,背景不要出现人物”这样的任务,真正困难的不是画出一个产品,而是让所有约束同时成立。
SenseNova U1.5 Lite 强调对长篇自然语言和结构化创作需求的处理能力。用户可以只给一句简短想法,也可以输入接近设计需求文档的完整说明;长提示词在这里不是生成好图的必要条件,而是提高复杂任务控制上限的手段。这种能力如果稳定,会比堆叠大量提示词模板更适合真实工作流。
文字和布局,决定它能不能进生产环境
文字渲染是图像生成模型在画面中准确生成指定字符、词句及排版关系的能力。商汤称 U1.5 Lite 加强了中英文文字、海报、品牌视觉、信息图和多文本排版,相关表现达到可与超大规模商业模型比较的交付水平。
文字一直是生成图像最容易暴露模型短板的部分。单个英文单词已经不算特别困难,但多行中文标题、日期、数字参数、品牌名称和脚注同时出现时,模型仍容易漏字、重复、变形或打乱阅读顺序。更现实的问题是,文字正确并不等于版式正确:标题层级、留白、对齐方式和图文视觉重心同样决定结果能否直接使用。
SenseNova U1.5 Lite 的产品定位因此不只是“生成内容”,而是“组织完整视觉表达”。如果模型能够在 4K 画布上稳定生成小字号中文、对齐多个文本框,并在后续编辑中只改指定文字,它会更适合营销海报、活动物料、商品详情页、教育图解和数据型信息图,而不只是社交媒体配图。
不过,官方目前公开材料主要给出了能力描述,没有同步披露足够完整的第三方盲测、逐项基准分数和失败率。所谓“媲美超大规模商业模型”现阶段仍属于官方结论,开发者在决定生产部署前,最好用自己的中文字体、品牌模板、多轮编辑和人物一致性数据集进行复测。
Bounding Box 和 Visual Marker 提供更细控制
Bounding Box 是用矩形坐标框指定图像目标或编辑区域的控制方式。它适合表达“把左上角这个商品移到右侧”或“只修改坐标范围内的标题”,比单纯使用自然语言描述位置更精确。
Visual Marker 是直接在参考图上通过点、圈选、标记或区域提示指定目标对象的交互方式。它降低了用户描述复杂位置关系的成本,例如在多人合照中圈出第二个人,再要求更换其外套颜色,可以避免模型误改其他人物。
SenseNova U1.5 Lite 同时支持 Bounding Box、Visual Marker、单图参考和多图参考。多参考图场景尤其值得关注:用户可以分别提供人物、服装、产品和设计风格,让模型抽取不同图像中的条件并组合到新画面中。这类工作流对身份一致性、遮挡关系和光影融合要求很高,也是统一多模态模型比简单文生图更能体现价值的地方。
| 控制方式 | 输入形式 | 更适合的任务 | 主要价值 | |---|---|---|---| | 自然语言指令 | 描述主体、布局、文字和风格 | 从零生成海报、插画、信息图 | 使用门槛低,可容纳复杂创意要求 | | Bounding Box | 矩形坐标或区域框 | 局部替换、对象移动、版面约束 | 明确告诉模型“改哪里” | | Visual Marker | 点选、圈选或视觉标记 | 多目标图像中的精准编辑 | 减少对象指代歧义 | | 单图参考 | 一张人物、产品或风格图 | 风格迁移、条件创作 | 保留参考图的核心视觉特征 | | 多图参考 | 多张独立参考图 | 人物、商品、服装和场景组合 | 支持更复杂的素材级创作流程 |
从 U1 到 U1.5,重点已经从“会生成”转向“能交付”
SenseNova U1.5 Lite 的升级主线不是继续堆参数,而是在 8B-MoT 规模内提高生成、编辑和视觉控制的完成度。8B-MoT 是官方对该模型规模和结构的命名,但模型总参数量并不能直接等同于单次推理的激活参数量、显存占用或生成速度,实际部署成本仍取决于精度、分辨率、运行框架和推理策略。
商汤在 2026 年 4 月发布并开源 SenseNova U1,首次完整展示 NEO-Unify 原生统一多模态路线;7 月 16 日推出信息图增强版本,补充信息图编辑能力;8 月 3 日开放 U1.5-Lite-Preview;今天则进一步发布并开源 SenseNova U1.5 Lite。短短四个月内连续迭代,说明商汤正在把视觉生成从能力展示推进到稳定编辑和成品交付。
| 版本 | 发布时间 | 模型定位 | 关键进展 | |---|---:|---|---| | SenseNova U1 | 2026 年 4 月 | 原生统一多模态基础版本 | 在一个体系中贯通视觉理解、推理与生成 | | U1 信息图增强版 V3 | 2026 年 7 月 16 日 | 信息图专项增强 | 加入信息图编辑能力,强化文字与版式场景 | | U1.5-Lite-Preview | 2026 年 8 月 3 日 | U1.5 预览版本 | 8B-MoT、4K 生成、复杂指令和精准编辑 | | SenseNova U1.5 Lite | 2026 年 8 月 21 日 | 正式开源轻量版本 | 强化生成质量、编辑保持、文字布局和视觉控制 |
8B 不代表一张消费级显卡就能轻松跑 4K
8B 参数让 SenseNova U1.5 Lite 具备私有化部署和社区适配的想象空间,但原生 4K 生成仍然是一项高计算量任务。模型权重大小只是显存需求的一部分,高分辨率视觉 Token、中间激活、注意力计算和图像解码都会占用额外资源,生成一张 4K 图像与运行一个 8B 纯文本模型并不是同一个负载等级。
开发者真正需要关注的是官方后续给出的显存需求、支持精度、量化方案、推理速度、并发能力和运行框架兼容性。对于企业部署,还要检查模型许可证、可商用范围、训练数据合规要求,以及生成内容的安全过滤和水印策略。开源权重降低的是模型可获得门槛,并不会自动解决工程化和合规问题。
SenseNova U1.5 Lite 现阶段更适合作为视觉生产工作流的模型底座,而不是被简单理解成一个“本地 4K 出图工具”。团队可以围绕它搭建品牌模板生成、商品图编辑、海报文字替换、信息图制作和多轮视觉代理;但要达到设计师可直接交付的稳定性,仍需加入质量检测、文字校验、区域比较和人工审核。
这次更新的价值,在“少返工”而不是“多几个像素”
SenseNova U1.5 Lite 最值得关注的能力是把高分辨率生成、文字布局和局部编辑放进同一套 8B 级模型中。4K 是传播效果最强的卖点,但对开发者和设计工作流来说,非编辑区域保持、复杂指令执行和多参考图组合更可能直接减少返工次数。
商汤选择开源也让这款模型有机会进入更广泛的行业场景。相比只能通过在线产品使用的商业图像模型,开放权重意味着开发者可以围绕私有素材、中文品牌规范和垂直行业数据进行评估与适配;相比只负责看图问答的开源视觉语言模型,它又提供了从理解到生成、再到修改的完整闭环。
SenseNova U1.5 Lite 仍需要更多独立评测来证明其“同量级领先”和“媲美超大商业模型”的说法。尤其是在 4K 实际生成耗时、显存占用、中文长文本准确率、多轮编辑身份漂移率,以及连续修改后的画质衰减方面,官方展示图不足以代替规模化测试。
但从产品方向看,商汤这次走对了重点。图像模型的下一阶段竞争不会只比谁第一次出图更惊艳,而会比谁更听指令、谁能准确改图、谁能保住不该动的部分,以及谁能把一张“AI 味样片”推进到可交付成品。SenseNova U1.5 Lite 用 8B 规模切入这个问题,比单纯再造一个更大的文生图模型更有实际意义。
参考来源
- IT之家:商汤开源 8B 参数多模态模型 SenseNova U1.5 Lite——包含 2026 年 8 月 21 日发布信息、4K 输出、编辑与复杂布局能力概述。
- GitHub:OpenSenseNova / SenseNova-U1——SenseNova U1 系列官方代码仓库,可查看项目说明和后续部署资料。
- Hugging Face:SenseNova U1.5 模型合集——官方模型权重、模型卡及相关版本入口。



