把 4K 生图门槛打下来!商汤开源 SenseNova U1.5 Lite

如今模型能力大幅跃升,用户的要求也随之水涨船高。文字渲染、复杂版式、多图参考、局部编辑、原生4K——这些过去需要多个工具协作才能完成的任务,现在正被压缩进同一套模型之中。 但「能力出现」和「能力可用」之间,依然横亘着不小的距离。一张商业海报可能同时包含人物、产品、商标文字、指定数量、前后空间关系、品牌色号以及若干禁改项,任何一个要素被模型遗漏,整张图就要推倒重来。而每一次推倒重来,都意味着新的token消耗。 8月3日,商汤开源 SenseNova U1.5 Lite Preview,初步展示了原生统一多模态模型在图像生成与编辑上的能力边界。今天,正式版 SenseNova U1.5 Lite继续向前迈出一步,目标是让这些能力真正融入视觉创作与交付流程。 通过精调训练数据、重调后训练流程、优化任务设计,最终打磨出的 SenseNova U1.5 Lite,是一款轻量级、原生统一多模态开源模型。它的目标也非常具体,就是解决用户最真实的诉求,做到更稳、更准、更好。 开源生图从来不缺尝试者。难的是在保持模型开放、轻量和可部署的同时,把画质、文字、布局与编辑放进同一个模型,而且每一项都不能成为明显短板。 在完整横向评测中,SenseNova U1.5 Lite 在所有维度都位于开源生图模型的领先位置,并且展现了比较均衡的系统能力,在复杂指令、视觉质量和创意生成等维度都表现出较强竞争力。 对于需要批量生成海报、电商图和营销素材的团队,这样带来的意义就很直接。同样的时间和预算,可以支持更多次尝试,也能把生成能力放进更高频的工作流。 一张竖版2:3复古城市旅行海报,香港维多利亚港,前景是木质红帆船,深红棕色帆面张开,海面有波纹和倒影;中景是现代香港天际线,密集高层建筑,右侧有一栋高耸圆角玻璃摩天楼,左中有带斜向交叉结构的尖顶高楼,建筑背后有灰绿色山体轮廓;远景天空为米白色,右上角有淡橙色柔和小太阳,天空中有几只飞鸟剪影。左上角是巨大的黑色窄长衬线英文标题“HONG KONG”,分两行排列,非常醒目;标题下方有红棕色小号英文副标题“HONG KONG”和几行小字说明。右上角有竖排中文“香港”,红棕色细长宋体,下方有小英文和红色印章式装饰。整体为复古高端旅行海报风格,摄影底图与平面排版结合,低饱和暖色调,米色纸张质感,轻微胶片颗粒,柔和雾气和空气透视,构图左重右轻,留白充足,画面安静怀旧,像高端城市旅游杂志封面。不要出现水印、二维码、品牌标志、乱码文字,不要现代游艇或快艇,不要高饱和蓝天或强烈夕阳,文字清晰准确。 真正困难的,是画布变大之后,模型还能不能稳住整张图的全局结构。标题、正文、图标和人物之间的关系不能散,局部的文字边缘、材质纹理和光影过渡也不能糊成一片。 前卫高定时装摄影。一位模特身着半透明纸质高定服装,由褶皱、折叠插片、层叠纸板构成。构图上方密集、下方留白,地面有一处红色折纸点缀。配色为绿玉色阴影、阳光黄透光纸边、中国红插片、纯白表面。关键词是摄影,前卫高定时尚大片,纸艺工程,风动感,实验冷静气质。 当这种保持能力逐渐稳定,图片模型才能从一次性生成器变成可反复沟通的创作工具。用户不再需要每次都推倒重来,可以在同一张作品上继续修改。 可能它需要保留第一张图里的人物身份,借用第二张图的色彩和材质,再沿用第三张图的版式关系。参考图之间不能互相污染,风格迁移也不能吞掉主体。 帮我为学校咖啡厅活动设计一张可爱的动漫海报,我想让绿发女孩当我们的厨师,酷男孩(图3)当服务员,黑发女孩(图4)当接待员。让那位严肃的男士(图1)当美食评论家,甜美金发女孩当开心的顾客。请添加一些简单的英文标题,比如“Sweet Cafe”,让它看起来像真正的活动传单。 可以看到最后的成图信息清晰,符合要求。时间 / 地点 / 菜单三个部分以小卡片的形式独立列出,还设计了 So yummy、Come & Enjoy 等符合人物形象的小对白,用气泡呈现增加了活泼感。 当你的灵感来自于他人的作品,这个时候就可以让模型参考之后进行再创作。就像我觉得下面这张图很好看,我想自己模仿这张图设计一张其他主题的海报。所以我就 更新图1中的主客厅插图,使其与图2中的蓝绿色沙发和几何配色方案相匹配。将现有的白色和橙色沙发替换为蓝绿色L型转角沙发,并更新地毯、扶手椅和墙面装饰,使其采用包含蓝绿色、芥末黄、陶土红、米色和深蓝色的几何图案。添加图3中那只戴着蓝绿色项圈的浅棕色卷毛贵宾犬,让它坐在房间中央扶手椅之间的几何图案地毯上。更新家具布局示意图和配色方案部分,以体现这一新的蓝绿色和几何配色主题。 在同一个模型架构之下,视觉理解、图像生成与图像编辑被共同训练。模型首先理解原始图像和用户指令,识别其中的主体、文字与空间关系,再完成像素级的最终生成。整个过程中,用户无需在理解模型、生成模型和编辑工具之间反复切换。 模型在视觉理解任务中习得了结构、位置、文字排布与信息层级,这些认知成果可以顺滑地迁移到生成和编辑任务中。面对一条较长的自然语言指令,模型需要解析的已经不是孤立的关键词,而是这些要求之间的内在关系:谁在左边,谁不能被遮挡,哪段文字属于哪个区域,修改时又有哪些内容必须被保留。这正是 U1.5 Lite 能够处理层级化视觉需求,却不需要依赖固定 JSON 模板的原因之一。 OCR 关心文字是否准确可读,美学关心构图、色彩和整体质感,编辑则还要兼顾主体身份与结构保持。如果简单地把所有训练目标混在一起,往往会出现一项能力变强、另一项反而被削弱的窘境。 商汤训练了 OCR、美学和编辑等多个 Expert:OCR Expert 强化中英文文字识别与排版质量,美学 Expert 改善构图、色彩、材质、光影和真实感,编辑 Expert 则负责确保主体身份、空间结构以及非编辑区域的一致保持。随后,通过 MOPD 将这些 Expert 的能力重新蒸馏回 U1.5 Lite 中。 在此基础上,正式版又引入了更精细的任务导向 RL。它优化的三个目标,都能与前面的测试维度一一对应:Instruction Compliance 关注复杂指令是否被执行完整,Visual Preference 关注构图、真实感和整体完成度,Editing Preservation 关注指定区域是否改对、其他区域能否保持不变。 能力仍在增长,行业却已经开始算账。投入多少,成本几何,回报又在哪。参数规模能快速制造话题,但真实视觉任务里的稳定性,靠的是数据、评测和一次次后训练,慢慢磨出来。 长指令会不会漏、文字能不能写对、4K下结构能否保持、局部编辑会不会破坏整张图,这些看似微小的问题恰恰决定了模型能不能真正进入海报、信息图、电商素材和品牌视觉的日常生产。 从 U1 到 U1.5 Preview,再到正式版,SenseNova 没有简单叠加一份更长的能力清单。它在尝试回答一个更实际的问题:一个轻量级、统一、开源的多模态模型,能不能更完整地承担真实视觉创作任务? 把视野再拉开一点,视觉创作只是多模态进入现实世界的一站。一个模型需要先理解画面中的对象、文字和空间关系,才能进一步生成、编辑,最终与更复杂的真实环境发生连接。

本页 /product/rmy160516082340323287/

查看更多内容 更多最新文章 相关栏目

数据频道

数据频道:本文聚合数据相关资讯化学安全、生活防护写得很仔细,像可执行的说明书。和备考的人一起看时,讨论会自然落到证据而不是站队。争议话题措辞谨慎,不站队煽情,更像在认真备课。标签过滤能躲开暂时太难的,先专注自己能消化的层级。成熟的产品气质比花哨运营更让人心甘情愿留下。真实路径走下来,优点大多能稳定复现。

关键词:数据,(女人同房太激烈会得白血病吗),(玩具测试员by笔趣阁TXT免费下载百度云)