跳转到内容
主站 新闻 控制台

开源国产 8B 模型,性能比肩闭源 Image 2!

· 量子位
国内AI

SenseNova U1.5 Lite

金磊 发自 凹非寺

时隔仅仅三周,国产生图模型又进化了。

上回书说到,这个生图模型支持4K直出、开源,且模型规模只有8B。

这一次,它的正式版本来了!如果用三个词来概括,那就是——

更完整、更准确、更稳定。

例如,我们一次性将九张不同的食物照片交给它:

并简单附上一句 Prompt:

请将这九款美食拼成一张精美的食谱分享卡片。

原本拍摄角度、比例和背景各不相同的九张图片,一下子被整齐地设计到了一张图中;AI 不仅精准识别出了每道菜品,还为它们进行了适当的美化处理,让图片整体更加赏心悦目。

再来看一个图片编辑的例子。

我们在原图的基础上,通过**“框选+标注”**的方式,标出想要修改的局部细节:

AI 接到任务并完成修改后,效果如下:

可以明显看到,几个目标区域都按照要求发生了变化,但床、床头柜、玻璃杯、右侧柜体,以及整个卧室原有的空间关系,都基本得到了保留。

这个 AI,便是商汤科技此次正式开源的SenseNova U1.5 Lite,其亮点如下:

  • 3,000—4,000字符超长复杂指令遵循:能一次理解更长、更复杂的要求,同时处理主体、数量、位置、文字、布局和风格等多种约束,不容易遗漏细节。
  • 更高质量的视觉生成:构图、色彩、材质、光影和细节更加自然,整体完成度更高。
  • 更可靠的原生图像编辑:修改指定内容时更加精准,同时更好地保持人物、结构、版式及其他区域不变。
  • 更出色的文字与复杂布局处理:中英文文字、海报、信息图和多文本排版更加准确,也更擅长组织复杂画面。
  • 更精细的视觉控制:支持框选、标记和多图参考等方式,更准确地指定“改哪里、改什么”。
  • Native 4K 高分辨率输出:直接生成4K高清图,同时保留构图、纹理、小字和光影等细节。

而且,SenseNova U1.5 Lite 依旧保持了8B的模型规模,在复杂排版与精准编辑等核心场景上,也能比肩闭源的 GPT-Image-2:

如果说三周前的 SenseNova U1.5 Lite Preview 版本,是在验证一个统一模型能够将视觉能力扩展到什么程度,那么到了今天的正式版本,商汤科技则是在进一步验证:这些能力能否分别得到强化,再重新统一到一个轻量级模型中,并稳定进入真实创作流程。

效果怎么更强了?看细节

接下来,我们继续用效果来说话。

第一个任务,先来一个考验信息组织能力的实测,主题是从可可豆到巧克力。

需要在一张竖版信息图中,同时呈现 Harvesting、Fermentation、Roasting、Grinding、Tempering 到 Finished Chocolate 六个阶段。

每个阶段既要有文字解释,也要有对应的可可果、发酵箱、烘焙设备、研磨装置、巧克力浆等视觉元素;同时,六层内容还要沿着版式一路向下展开。

从最终效果来看,SenseNova U1.5 Lite 已经能够组织一整套视觉表达,包括长文本、多层级结构、插画、数字顺序和版式关系。

这种能力应用到更日常的内容生产中,就变成了类似制作社交媒体封面这样的任务。

比如下面这张图:

这类图片看上去虽然元素不算多,但难点在于要做到“封面感”。

标题要立得住,主体要足够抓眼;三只狗的造型、服饰和表情既要各有区分,又不能彼此冲突。同时,整张图还要保持统一的时尚调性,而不是简单地将几个可爱元素拼在一起。

从最终结果来看,正式版在这类应用型视觉任务上,已经开始更接近一张可以直接使用的封面作品。

接下来,我们再来看一下 SenseNova U1.5 Lite 的局部编辑能力。

Prompt 是这样的:

仿照参考图的折纸拼贴视觉,生成一张社区共享厨房运营模式信息图。

乍一眼看过去,两张图片整体的结构和风格几乎没有变化,因为我们的要求就是“仿照参考图”。

仔细观察细节可以发现,原本属于教育项目的元素被替换成了厨师帽、砧板、菜谱等厨房相关视觉;左侧的信息也随之变成 Membership Fees、Commercial Rental、Cooking Classes、Market Sales 和 Event Hosting。

在这类任务中,模型需要先分辨出一张图中哪些元素属于主题内容,哪些属于更底层的设计逻辑。然后保留后者,再让新内容沿着原有的视觉语言生长出来。

不过,如果参考图从一张变成多张,任务难度就会更大。

例如,我们输入下面这三张参考图片:

然后附上这样的 Prompt:

Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.

这次 Prompt 的要求更加细致:第三张参考图只允许用于参考内容和信息层级,原来的白色卡片背景不能一并搬过来;新歌单需要直接融入海报原有的黑色做旧背景。

SenseNova U1.5 Lite 给出的结果如下:

从结果来看,Radiohead 五位成员进入了原来的乐队区域,人物处理后的质感与整张海报基本衔接;左下方的信息被重新压缩,ESSENTIAL LISTENING 则直接融入右侧版面,没有留下突兀的白色背景。

对于刚才给出的三张参考图来说,第一张负责版式和风格,第二张负责人物身份,第三张只负责文字内容和结构。模型必须先将这三件事分开理解,最后才能重新合成到一张图中。

但在真实设计工作中,还有一种需求没有前面这么复杂,却可能出现得更加频繁——修改几个字。

这次,我们输入原始图片后,Prompt 如下:

请将左下角深蓝色矩形信息栏内的展览时间与地址详情,从
“JUNE 15 – JULY 30, 2024
URBAN GALLERY
123 CREATIVE WAY
ARTSVILLE, USA”
替换为
“AUGUST 10 –
SEPTEMBER 28, 2024
METRO MUSEUM
456 DESIGN ROAD
CREATIVITY CITY, UK”,
保持原有的白色与粉色字体样式及排版布局不变。

最终,左下角的信息完成了替换,画面中心巨大的“RHYTHM OF FORM”、周围高饱和度的几何图形,以及原有的文字层级,都保留在了原来的位置。

先拆开练,再合回来

看完这些效果后,接下来的问题是:一个8B模型是如何做到文字、美学、复杂布局、长指令和局部编辑都表现良好的?

据了解,SenseNova U1.5 Lite 继续沿用了NEO-unify 原生统一多模态架构,将视觉理解、图像生成和编辑置于同一套模型中。

也就是说,在真正修改像素之前,模型首先要理解画面。

哪里是主体,谁在谁旁边,哪些是文字,用户指的是哪块区域,一张参考图中究竟哪些元素值得保留……这些理解过程,并不会与后续的生成、编辑彻底分离。

而正式版这次较为关键的一处变化,发生在训练阶段。商汤采用了一种很容易理解的方法:先拆开练,再合回来。

文字渲染、美学表达、图像编辑等目标,会先分别训练对应的专项 Expert。

等这些 Expert 训练完成后,再通过多教师在线策略蒸馏技术 MOPD,将它们的专项能力重新融合回同一个 SenseNova U1.5 Lite 中。

因此,训练时虽然有多个专项教师,到了最终交付和部署时,用户拿到的依然只有一个8B模型。

没有额外的 Router 在背后判断“这次应该调用哪个子模型”,用户也不需要在文字、美学和编辑几个模型之间来回切换。

这种做法与前面的案例其实是对应的。

比如 Radiohead 那组多参考图任务,模型首先要理解原海报的视觉骨架,再识别人物,还要从另一张图中提取文字结构,最后才能完成生成。

海报改字也是一样。

“只改左下角”首先需要理解什么叫“左下角”,哪些文字属于目标区域,以及周围哪些图形、字体和版式不能改动。等这些判断完成后,才轮到最后的像素生成。

因此,在统一训练体系中,视觉语义理解和空间建模形成的结构化认知,可以继续反过来帮助生成和编辑。商汤在新闻稿中将这件事概括为“理解与生成双向反哺”。

而要让这种能力在复杂任务中保持稳定,正式版在后训练阶段又专门强化了三件事。

第一件叫指令遵循。用户写了一大串要求,包括主体有几个、谁在左边、文字放在哪里、使用什么颜色、哪些元素不能修改,最终模型究竟执行了多少。

第二件叫视觉偏好。在完成指令后,整张图的构图、材质、光影和最终质感是否达到要求。

第三件是编辑保持。需要修改的区域能否准确修改,原本已经正确的区域能否保留下来。

这三项,恰好对应了前面几个案例中最容易出现问题的地方:复杂信息图容易遗漏要求,STYLE 这样的封面直接考验美学完成度,而卧室修改、Radiohead 和文字替换,则都离不开对非编辑区域的保持。

此外,还有提示词增强。如果用户只给出一句比较简短的需求,PE 可以先帮助整理意图,形成更完整的创作方案,再交由 U1.5 Lite 执行。

以上便是正式版 SenseNova U1.5 Lite 背后的技术关键。

生图模型的标准,得变了

如果把时间线拉长一些,回头再看 SenseNova U 系列的几次变化,其实可以发现一个比较明显的趋势。

早期大家评价生图模型时,最容易比较的是效果是否足够惊艳。但随着 AI 生图能力日益普及,真正决定模型能否进入工作流的问题,开始出现在第一张图生成之后。

这也是 SenseNova U1.5 Lite 正式版反复强调“稳定”的原因。相比增加几个看起来新鲜的玩法,它更想解决的是一项视觉任务从生成到交付的完整链路。

相应地,评价模型的标准也在发生变化。一张图是否足够漂亮依然重要,但真正拉开差距的,越来越可能是模型能否从理解需求、生成内容,一路完成修改、细化和最终交付。

统一模型的价值也正是在这里体现出来。

SenseNova U1.5 Lite 最终交付的依然只有8B。它没有不断叠加外部路由,也没有将不同任务拆分给多个模型分别完成,而是先通过多个专项 Expert 补强能力,再将这些能力重新收进一个统一模型中。这样做的好处很直接:调用链路更短、部署更轻,同时还能尽量保持不同任务之间的一致性。

落实到开发者和创作者的实际使用中,最终对应的其实就是三个字:快、好、省。

商汤的判断是,多模态仍将是 AI 走向物理世界、真正进入生产环节的重要方向。因此,这次 U1.5 Lite 正式版继续将大量精力放在稳定性、指令遵循和编辑精度上。它们未必像某个新玩法一样第一眼就很吸引人,却更直接地决定了模型能否真正被用起来。

如果说三周前的 Preview 版本更多是在验证:一个8B统一模型的视觉能力究竟能够覆盖多广。

那么到了正式版,问题已经开始变成另一件事:

这些已经铺开的能力,究竟能不能稳定地拿来干活。

GitHub:
https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:
https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio 在线体验:
https://unify.light-ai.top/