SenseNova U1.5-Lite-Preview – 商汤科技开源多模态模型

SenseNova U1.5-Lite-Preview

SenseNova U1.5-Lite-Preview(或 SenseNova-U1.5-8B-MoT Preview)是商汤开源的轻量级原生统一多模态生图与图像编辑模型。用户输入自然语言长指令、单张或多张参考图,以及红框、坐标或视觉标记(Marker)等定位约束条件。模型基于 NEO-Unify 架构在内部将语言、视觉语义与像素生成联合建模,执行视觉理解、推理、空间规划与重绘动作。最终直接交付原生4K分辨率的复杂信息图、海报、多图组合画面及精准局部修改后的图像实体。

SenseNova U1.5-Lite-Preview - 商汤科技开源多模态模型

SenseNova U1.5-Lite-Preview 的主要功能

原生高分辨率与质感生成

  • 原生4K生成:支持高分辨率图像直出,在保持全局结构一致性的同时,渲染细粒度纹理、材质与光照。
  • 抑制生成伪影:通过空间重建机制,减少常见的网格感、拼接痕迹与纹理断裂现象。

复杂指令与排版解析

  • 支持长篇与结构化指令:能够接住长篇、多约束、层次化的提示词(如Render JSON格式),精确遵循色彩、版式与禁止项要求。
  • 高密度图文排版:具备强大的中英文文字渲染与密集文本组织能力,能够合理分配标题、时间线、结构拆解说明与视觉层级的空间位置。

深度视觉理解与图像编辑

  • 设计框架与逻辑复刻:提取参考图的弯曲路径、节点节奏、留白与版式关系,在不推倒重来的前提下,将其整体替换为新主题元素(例如将影视里程碑设计图重构为邮政邮件流转图)。
  • 多图组合与风格融合:同时读取多张参考图片。提取一张图的版式与画风,结合另一张真实照片的物体内容,补齐标题、步骤说明与装饰元素,输出风格统一的新图像。
  • 保持主体特征的背景重构:保留原图人物的身份特征、姿势与服装,重排整体画面比例、色彩风格,并生成特定的封面文字。
  • 精准定位修改(指哪改哪)
    • 利用红框对特定小区域进行字符或数字的精确替换,维持原有字体样式。
    • 利用Marker定位修改画面氛围(如将满月改为血月、增加浓雾、调整为暗调夜景),同时保持原有主体(如帆船、人物)的位置与结构稳定。
  • 文字造型融合:将画面中的物理元素与自然纹理(如海浪、船只航行轨迹)重新组织,拼写构成特定的汉字结构。

SenseNova U1.5-Lite-Preview 的技术机制与评测表现

底层运作机制

SenseNova U系列采用 NEO-Unify 原生统一多模态架构。模型摒弃了独立的编码器设计,将语言、视觉语义与像素生成放置在同一套架构中建模。这使得模型在执行编辑任务时,能够同步完成读懂指令、分析参考图、判断保留区域与生成像素的完整闭环。

针对图像重建,模型从逐Patch独立预测改为通过 ConvDecoder 进行渐进式空间重建。将视觉Token重塑为二维特征网格后,经多级 Pixel Shuffle 上采样与3×3卷积处理,使相邻Patch交互融合,从而输出连续的高质量图像。

评测表现

  • Qwen-Image Bench:在结合Prompt Enhance条件下,英文得分为55.17,中文得分为55.22。
  • ImgEdit-Bench:综合得分(Overall)达到4.37。
  • GEdit-Bench:英文目标生成得分8.172,中文目标生成得分8.051。
  • WeEdit:整体平均分为6.852。
SenseNova U1.5-Lite-Preview - 商汤科技开源多模态模型 SenseNova U1.5-Lite-Preview - 商汤科技开源多模态模型

如何使用 SenseNova U1.5-Lite-Preview

基础环境配置与安装

  1. 克隆官方仓库:git clone https://github.com/OpenSenseNova/SenseNova-U1.git
  2. 进入目录并同步环境:cd SenseNova-U1 然后执行 uv sync
  3. 激活虚拟环境:source .venv/bin/activate

执行推理命令

  • 文生图生成:运行 python examples/t2i/inference.py,配置参数 --model_path sensenova/SenseNova-U1.5-8B-MoT-Preview,输入 --prompt,并设定 --width--height
  • 图像编辑:运行 python examples/editing/inference.py,配置基础参数并传入 --image input.png 与编辑指令 --prompt

高阶工作流工具

  • Editing PE (Prompt Enhancement):在执行编辑推理时加入 --use-edit-pe 参数,调用多模态Prompt重写器。该功能保留用户的核心意图,自动补全编辑目标、参考图角色、精确文字与保留主体约束,将简短指令转化为详尽的底层指令。
  • Caption-to-Prompt提取:执行 python src/sensenova_u1_5/caption/caption.py path/to/reference.jpg。该脚本负责拆解参考图的构图、层级、配色、字体与光照,输出结构化JSON描述,便于用户后续替换主题与文案。

SenseNova U1.5-Lite-Preview 的应用场景

  • 高信息密度技术图解与科普长图:处理包含大量专业知识的长文本逻辑。在深色或低饱和度底色上,规划核心等距爆炸拆解图、剖面图、时间线节点,并使用准确细致的引线标注连接各个知识模块,输出工程制图级海报(如银盐相机拆解图解、海龟生命周期图)。
  • 带有实物展示的手绘图文与社交媒体排版:将产品实拍图转化为水彩或手绘风格,嵌入网格笔记本、牛皮纸或拼贴手账背景中。自动排布多栏步骤说明、属性标签、小贴士框与卡通装饰元素,直接输出高完程度的传播素材(如武康路Citywalk手账、韩式双拼炸鸡食谱)。
  • 设计稿件的低成本修改与迭代:面对已有排版方案进行要素更换。在保持原有纵向排版占位、字距、颜色与材质纹理不变的情况下,仅替换主标题文字内容,或对特定日期时间进行区域化重写(如修改固定式储能电池海报的复古主标题)。
  • 人像延展与文档版式重组:读取普通的人像摄影照片,将人物头像置于顶端,延展原图中的背景元素充当主视觉封面,顺势排开姓名、联系方式与工作经历技能条,将其转化为一份完整的单栏视觉简历。

已知限制与避坑指南

当前预览版本在处理以下任务时存在限制:

  • 当输入的Prompt简短或描述不充分时,可能生成非预期的文字内容。
  • 在渲染密集或较长的中英文混排内容,特别是小字号文字时,依然可能出现错误。
  • 面对极度复杂的版式(包含精确数量、严格对齐关系与深层嵌套逻辑)时,遵循度仍不完整。
  • 画面中的小尺寸人脸、手部、肢体及细粒度物体细节存在不稳定的情况。
  • 在执行范围较广、多轮次或多参考图的复杂编辑任务时,可能会发生结构漂移。
    应对策略:强烈建议结合官方提供的 SenseNova Image PE Skill 插件或 Caption-to-Prompt 脚本,将短指令转化为规范的 Render JSON 格式,通过锁定约束项来规避理解偏差。

SenseNova U1.5-Lite-Preview 的官网地址(或其他联系信息)

© 版权声明

相关文章

暂无评论

暂无评论...