SenseNova U1.5-Lite-Preview 是什么
SenseNova U1.5-Lite-Preview(或 SenseNova-U1.5-8B-MoT Preview)是商汤开源的轻量级原生统一多模态生图与编辑模型预览版。用户输入自然语言长指令、单张或多张参考图,以及红框、坐标、视觉标记(Marker)等定位元素,触发模型。模型基于NEO-Unify架构,在内部将语言、视觉语义与像素生成统一建模,执行视觉理解、推理、空间规划与编辑动作。最终直接交付原生4K分辨率的复杂信息图、排版海报、图文手绘、照片及精准局部修改后的图像实体。
SenseNova U1.5-Lite-Preview 的主要功能
原生高质量图像生成
- 支持原生4K分辨率图像直出,兼顾高分辨率下的全局一致性与细粒度细节。
- 渲染高保真纹理、材质与光照,抑制网格感、拼接痕迹与纹理断裂现象。
复杂指令与排版控制
- 接收并解析长篇、多约束、层次化和结构化的Render JSON格式视觉指令。
- 具备中英文文字渲染与密集文本组织能力,输出高信息密度内容的清晰版式设计。
图像结构与视觉编辑
- 参考图风格重绘:提取单张参考图的设计框架、版式关系与组织方式,重构新主题图像。
- 多图组合重构:同时读取多张参考图(如一张画风版式图+一张实体照片),消除风格割裂并融合生成新视觉结果。
- 参考主体生成:保持输入图像的主体身份与结构不变,重组背景、排版生成带文字的封面。
- 局部内容与文字编辑:支持特定区域的文字修正、替换,以及文字造型的重构(如利用画面物理元素拼成指定汉字)。
- 定位编辑:通过红框、边界框、蒙版和Marker实现细粒度区域的字符精准修改或画面光影氛围重构,且不改变非目标主体的空间关系。
如何使用 SenseNova U1.5-Lite-Preview
- 环境配置:克隆官方仓库
git clone https://github.com/OpenSenseNova/SenseNova-U1.git,进入目录后执行uv sync,并激活虚拟环境source .venv/bin/activate。 - 执行文生图推理:使用Python命令
python examples/t2i/inference.py --model_path sensenova/SenseNova-U1.5-8B-MoT-Preview --prompt "指令内容" --width 2048 --height 2048 --device_map auto --output output.png。 - 执行图像编辑推理:使用Python命令
python examples/editing/inference.py --model_path sensenova/SenseNova-U1.5-8B-MoT-Preview --image input.png --prompt "修改指令" --output edited.png。 - 调用 Editing PE 增强预处理:在编辑命令后附加
--use-edit-pe参数,将简短提示词交由多模态重写器扩展为包含版式、文字、对象分配约束的详细Prompt后再进行生成。
SenseNova U1.5-Lite-Preview 的应用场景
- 高密度技术与科普知识图解:基于长篇结构化文本,生成包含时间线、拆解流程、剖面图及精准中文说明的工程制图级信息海报(如银盐摄影相机拆解图、海龟生命周期科普图)。
- 社交媒体图文与排版内容生产:将真实产品照片无缝转入特定的手绘、拼贴排版模板中,生成带有文字标签、评分与步骤说明的传播素材(如小红书风格的武康路旅行手账、韩式双拼炸鸡手绘食谱)。
- 视觉物料修改与迭代:保留已有设计图的排版结构与配色逻辑,仅更换核心视觉主体或局部标题文本(如将古建筑宣纸插图中的主体替换,或修正活动海报上的日期时间数字)。
- 照片到文档的排版转换:读取普通人物风景照片,识别要素并提取主视觉配色,直接重组输出带职位、工作经历条目的单栏简历布局。
SenseNova U1.5-Lite-Preview 地址
- GitHub:https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/u1.5_preview.md
- Hugging Face:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-Preview
- 魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT-Preview
SenseNova U1.5-Lite-Preview 的底层架构与性能评测
NEO-unify 原生架构机制
- 采用无编码器的多模态统一架构,使用Word-Emb Encoding/Decoding与Patch-Emb Encoding/Decoding模块处理文本与图像序列。
- 引入ConvDecoder进行渐进式空间重建:将视觉Token重塑为二维特征网格,经多级Pixel Shuffle上采样与3×3卷积处理,实现相邻Patch融合。
基准测试成绩
- Qwen-Image Bench:综合得分为49.93(英文)/ 50.25(中文);开启Prompt Enhance条件后提升至55.17(英文)/ 55.22(中文)。
- ImgEdit-Bench:综合得分(Overall)达到4.37。
- GEdit-Bench:英文得分8.172,中文得分8.051。
- WeEdit:整体平均分(Overall Average)为6.852。
相关导航
暂无评论...
