English | 简体中文
注意: SenseNova-U1.5(预览版)提前展示了我们在图像生成与编辑方面的最新进展。功能更强大、体验更完善的正式版本也将在不久后正式发布。
SenseNova-U1.5(预览版) 是基于 NEO-unify 构建的原生统一多模态模型,并引入了全新的 patch 编码层和解码层。我们进一步扩充并优化了文生图训练语料,同时面向单图参考与多图参考场景,对编辑数据进行了大规模筛选与合成。因此,模型在原生图像生成和编辑方面实现了显著跃升:
[2026.07.16] 发布 SenseNova-U1-8B-MoT-Infographic-V3 📊。新版本同时支持信息图生成与编辑。在保留信息图生成能力的基础上,显著提升了局部文字、局部内容、全局风格和全局布局的编辑能力,包括对密集文本的精确文字修正。模型详情与基准测试结果请参阅 ✨ U1 Infographic Model Series。
[2026.06.29] 发布 SenseNova-U1-8B-MoT-Infographic-V2 📊。该版本提升了密集小字渲染能力,使字符边缘更加锐利;增强了复杂、高信息密度图形的版式生成能力;提升了整体视觉质量和一致性,并修复了黑色背景问题。模型详情与可视化示例请参阅 ✨ U1 Infographic Model Series。
[2026.06.12] 发布 SenseNova-U1-8B-MoT-Infographic-LoRA-8step-V1.0,用于快速生成信息图。请参阅推理示例。
[2026.06.11] 发布 SenseNova-U1-8B-MoT-Interleaved 📖,专门针对图文交错生成进行优化。它显著提升了绘本、故事书、幻灯片和图文教程等多页内容的叙事连贯性、角色与风格一致性以及图文对齐能力。
[2026.05.21] 发布 SenseNova U1 全参数微调训练代码。
[2026.05.15] 发布 SenseNova-U1-8B-MoT-Infographic 📊,提升信息图生成能力。模型详情请参阅 U1 Infographic Model Series;100 个生成示例请参阅 ✨ Infographic Showcases。
[2026.05.10] 发布 🔥 SenseNova U1 技术报告 🔥,并开源 SenseNova-U1-A3B-MoT-SFT 和 SenseNova-U1-A3B-MoT 模型权重。
[2026.05.08] 新增 GGUF 量化权重支持和分层加载 VRAM 模式,便于在单张低显存 GPU 上进行推理。详情请参阅低显存推理指南。SenseNova-U1-8B-MoT-Merger 的 GGUF 权重可从 🤗 smthem/SenseNova-U1-8B-MoT-Merger-gguf 获取。感谢 @smthem 为社区贡献量化权重。
[2026.05.06] 发布 SenseNova-U1-8B-MoT-LoRA-8step-V1.0。请参阅推理示例。
[2026.04.30] 发布 8 步推理预览版 SenseNova-U1-8B-MoT-8step-preview。在大多数情况下,其图像生成质量接近基础模型。请参阅对比结果与已知问题。运行时请参考推理脚本,并使用 --cfg_scale 1.0 --num_steps 8。
[2026.04.27] 首次发布 SenseNova-U1-8B-MoT-SFT 和 SenseNova-U1-8B-MoT 模型权重。
[2026.04.27] 首次发布 SenseNova U1 推理代码。
SenseNova-U1 原有的 MLP head 会独立重建每个 RGB patch。在高分辨率下,这可能使 token 边界以网格纹理、接缝或纹理断裂的形式显现。SenseNova-U1.5 则通过 ConvDecoder 采用渐进式空间重建:先将视觉 token 重塑为二维特征网格,再经过多级 Pixel Shuffle 进行上采样,并在中间使用 3×3 卷积,让相邻 patch 能够交互并融合为更加连续的图像。
定性结果表明,这一设计在整个预训练过程中显著抑制了网格状伪影;同时也提升了下游适配的鲁棒性,降低了在新领域微调时类似伪影再次出现的可能性。
SenseNova-U1 主要依赖公开的图像编辑数据集,其中许多数据存在监督噪声、样本质量偏低以及明显的合成或修图伪影。针对 SenseNova-U1.5,我们对编辑语料进行了大规模清洗、筛选与合成,同时改善中英文数据平衡,并扩大对单图参考和多图参考场景的覆盖。
定量结果表明,无编码器的 NEO-unify 架构仅使用一段参考图像 token 序列,就能同时实现出色的指令遵循、主体身份保持和结构保持。这带来了更强的编辑性能与显著更高的推理效率,进一步验证了原生统一多模态建模的有效性。
用于训练 SenseNova-U1.5 的生成与编辑语料只包含少量简单的 JSON 格式提示词,并不包含长篇、层次化或高度结构化的指令。此外,更复杂的类 JSON 格式仅出现在理解任务训练语料中,其内容、结构和任务目标均有显著差异。
尽管存在这种差异,模型在图像生成和编辑任务中仍能很好地泛化到长篇和结构化指令。这表明,原生统一多模态建模能够在同一个模型中融合从理解与生成任务中学到的能力,使结构化理解和视觉规划能力无需针对固定提示词模板进行专项训练,即可跨任务迁移。
| 模型 | 质量 | 美学 | 对齐度 | 真实世界保真度 | 创意生成 | 综合 | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
EN ↑ | ZH ↑ | EN ↑ | ZH ↑ | EN ↑ | ZH ↑ | EN ↑ | ZH ↑ | EN ↑ | ZH ↑ | EN ↑ | ZH ↑ | |
| GLM Image | 49.86 | 49.26 | 49.98 | 50.64 | 47.49 | 47.90 | 44.25 | 44.69 | 44.67 | 45.23 | 47.86 | 48.19 |
| Qwen Image | 48.45 | 48.44 | 51.18 | 52.25 | 50.04 | 50.72 | 43.45 | 43.16 | 45.37 | 47.30 | 48.48 | 49.23 |
| HunyuanImage 3.0 | 50.76 | 50.35 | 54.66 | 53.57 | 53.16 | 52.00 | 45.33 | 44.31 | 48.33 | 49.12 | 51.35 | 50.81 |
| Qwen Image 2512 | 51.84 | 51.76 | 54.40 | 54.74 | 51.44 | 52.72 | 47.80 | 47.00 | 47.75 | 50.19 | 51.32 | 52.06 |
| GPT Image 1 | 52.50 | 52.34 | 55.77 | 55.09 | 55.35 | 56.28 | 48.25 | 48.14 | 57.29 | 55.78 | 54.24 | 54.07 |
| Qwen Image 2* | 53.60 | 53.09 | 57.51 | 56.30 | 56.48 | 57.48 | 52.17 | 51.74 | 57.40 | 59.01 | 55.69 | 55.63 |
| GPT Image 2 | 59.09 | 58.65 | 68.48 | 67.53 | 65.78 | 65.85 | 59.40 | 57.38 | 75.34 | 75.23 | 65.23 | 64.69 |
| U1 | 47.30 | 45.79 | 50.30 | 47.07 | 50.58 | 47.78 | 43.13 | 42.53 | 46.15 | 43.88 | 48.28 | 45.99 |
| U1.5-Preview | 49.14 | 49.19 | 52.02 | 51.87 | 52.46 | 52.61 | 45.22 | 45.11 | 47.23 | 48.80 | 49.93 | 50.25 |
| U1.5-Preview† | 50.21 | 50.01 | 57.26 | 56.44 | 58.52 | 59.28 | 48.26 | 48.24 | 60.43 | 60.95 | 55.17 | 55.22 |
注:Qwen Image 2* 表示由我们评测所得的结果;U1.5-Preview† 表示使用Cosmos3一致的提示词增强(PE)后的结果。
| Model |
ImgEdit-Bench
|
GEdit-Bench
|
WeEdit
| ||||
|---|---|---|---|---|---|---|---|
Overall ↑ | EN GO ↑ | CN GO ↑ | IA ↑ | TC ↑ | BP ↑ | Average ↑ | |
| Qwen-Image-Edit-2511 | 4.51 | 7.877 | 7.819 | 3.180 | 3.930 | 4.630 | 3.913 |
| Qwen-Image-2 | 4.28 | 8.369 | 8.348 | 5.044 | 6.079 | 5.680 | 5.601 |
| FireRed-Image-Edit | 4.56 | 7.943 | 7.887 | 4.150 | 6.330 | 7.140 | 5.873 |
| LongCat-Image-Edit | 4.45 | 7.748 | 7.731 | 3.390 | 5.590 | 6.710 | 5.230 |
| HY-Image-3-Instruct | — | — | — | 4.160 | 5.990 | 7.030 | 5.727 |
| Nano-Banana | 4.29 | 7.291 | 7.399 | 3.920 | 7.140 | 7.800 | 6.287 |
| Nano-Banana-Pro | 4.37 | 7.738 | 7.799 | 8.580 | 9.100 | 8.850 | 8.843 |
| GPT-Image-1.5 | — | — | — | 6.520 | 7.780 | 6.150 | 6.817 |
| U1 | 3.90 | 7.470 | 7.420 | 5.729 | 6.604 | 7.157 | 6.497 |
| U1.5-Preview | 4.37 | 8.172 | 8.051 | 6.532 | 7.271 | 6.752 | 6.852 |
以下示例涵盖多种类型的文生图任务。点击左栏中的标题可展开完整的原始 Prompt。
| 提示词 | SenseNova-U1.5(预览版) |
|---|---|
复古汽水广告 |
|
海龟科普信息图 |
|
武康路旅行手账 |
|
银盐摄影技术图解 |
|
高动态范围单板滑雪摄影
|
|
点击 Prompt 可展开全文;点击图片可查看原始分辨率。
为帮助用户对 SenseNova-U1.5(预览版)建立明确预期,其当前限制包括:
为了帮助用户更充分地发挥模型当前的能力上限,我们提供以下两种可选的开源实践。
对于主体明确、约束较少的任务,直接使用自然语言 Prompt 即可。以下两条路径主要适用于设计信息不完整,或用户希望依据参考图复现成熟视觉方案的任务。它们是模型之外的可选工作流,不应与模型本身的原始能力混为一谈。
当输入仅为简短的创意需求时,可采用此路径。该 Skill 会将需求转换为紧凑的 Render JSON Prompt,同时保留必要的主体、可见文案、数量、版式约束和排除项。
在仓库根目录下,将该 Skill 复制到 Agent 的 skills 目录:
SKILL_DIR="$HOME/.agents/skills/sensenova-u1-5-prompt-enhancement"
mkdir -p "$SKILL_DIR"
cp src/sensenova_u1.5/prompt-enhancement-skill/SKILL.md "$SKILL_DIR/"
cp -R src/sensenova_u1.5/prompt-enhancement-skill/agents \
src/sensenova_u1.5/prompt-enhancement-skill/references \
"$SKILL_DIR/"Skill 是面向 Agent 的一组任务指令和参考资料,并非独立程序。安装完成后,通过所用 Agent 的 Skill 机制调用 sensenova-u1-5-prompt-enhancement,并提交下方请求。Agent 会遵循 SKILL.md 及 references/ 中的资料,将需求转换为 Render JSON。具体调用语法因 Agent 而异。$SKILL_DIR 仅是安装命令中用于表示目标目录的 shell 变量。
Convert the brief below into one compact Render JSON object. Save only the JSON
object, without Markdown fences, to enhanced_prompt.json.
Brief:
Design a 3:4 portrait autumn lakeside wedding invitation with embossed paper
and delicate botanical linework. Use only this copy: "OUR DAY / AUTUMN WEDDING
/ 10.18 / LAKESIDE GARDEN".使用仓库中已提交的 Render JSON,通过 SenseNova-U1.5 生成图像:
MODEL_PATH="sensenova/SenseNova-U1.5-8B-MoT-Preview"
python examples/t2i/inference.py \
--model_path "$MODEL_PATH" \
--prompt "$(cat src/sensenova_u1_5/prompt-enhancement-skill/examples/u1_5_pe_skill_wedding_prompt.json)" \
--width 1760 \
--height 2368 \
--cfg_scale 4.0 \
--cfg_norm global \
--timestep_shift 3.0 \
--num_steps 50 \
--seed 1730675618 \
--device_map auto \
--output output.png当抽象风格术语不足以准确描述设计目标时,一种更直接的方法是先检索一张设计完成度较高的参考图,再使用我们的 Caption 脚本,将参考图中的视觉决策转换为可编辑的 Prompt:
创意目标
└─► 检索并选择参考图
└─► SenseNova Caption 脚本
└─► 构图 / 层级 / 配色 / 字体 / 材质 / 光照 / 约束
└─► 替换主题、内容、文案、主体或局部结构
└─► 使用 SenseNova-U1.5 复现或重新诠释这条路径的关键并非简单复制参考图,而是将该设计为何有效拆解为模型可以执行的描述。Caption 脚本会尝试提取版式网格、视觉焦点、文字层级、配色、材质、相机、光照和负向约束。用户随后可以在保留设计语言的同时,替换主题、文案、主体或局部结构。使用外部参考图时,请确保其来源、授权和使用方式符合适用的许可协议。
Caption 脚本:src/sensenova_u1_5/caption/caption.py
pip install openai pillow
export OPENAI_API_KEY="your-api-key"
# 输出结构化 JSON Prompt 和自然语言 Prompt
python src/sensenova_u1_5/caption/caption.py path/to/reference.jpg
# 保存结果,便于后续修改主题、文案、主体或局部结构
python src/sensenova_u1_5/caption/caption.py path/to/reference.jpg > result.json以下示例使用 Caption 脚本从原始参考图生成结构化描述 result.json,再使用该描述进行图像重建,以及文字和物体的局部编辑。
| 场景 | 推荐方式 |
|---|---|
| 主体明确、约束较少 | 直接使用自然语言 Prompt |
| 只有简短的创意需求,但希望自动补全完整设计方案 | SenseNova Image PE Skill |
| 已找到理想的构图或视觉语言,希望复现、改换主题或进行修改 | 参考图检索 + Caption-to-Prompt |
Editing PE 是面向图像编辑和参考图引导生成的 Prompt 预处理步骤。它会将按顺序排列的输入图像与原始指令一并发送给多模态 Prompt 重写器;重写器会保留用户使用的语言和核心意图,同时让图像模型更明确地理解请求。根据任务需要,它可以明确编辑目标与位置、为多张参考图分配角色、提取参考图的视觉语言、指定精确文字和版式,以及说明哪些主体或区域必须保持不变。重写后的 Prompt 随后会传给 SenseNova-U1.5 生成图像;Editing PE 本身不会修改像素。
独立实现位于 src/sensenova_u1_5/edit/edit_pe.py。如需在不启动图像生成的情况下查看重写后的 Prompt:
export OPENAI_API_KEY="your-api-key"
# 可选:
# export OPENAI_MODEL="gpt-5.5"
# export OPENAI_BASE_URL="https://your-openai-compatible-endpoint/v1"
python src/sensenova_u1_5/edit/edit_pe.py \
path/to/input.png \
"把天空改成晚霞"该命令会将重写后的 Prompt 输出到标准输出。多张输入图像可按顺序列在原始 Prompt 之前。
在 examples/editing/inference.py 中,Editing PE 默认关闭。需要时可通过 --use-edit-pe 启用,并设置 OPENAI_API_KEY。使用 --print-edit-pe 可查看原始 Prompt 和重写后的 Prompt,使用 --edit-pe-model 可选择重写模型。对于多图任务,请按预期顺序提供图像,并在原始指令中说明每张图像的角色。
以下示例展示了如何将简短的风格参考请求扩展为面向模型的详细指令,并对比增强前后的输出结果。
参考推理实现位于 SenseNova-U1 GitHub 仓库。
git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
uv sync
source .venv/bin/activate上游环境当前使用 Python 3.11、PyTorch 2.8 和 CUDA 12.8。其他 CUDA 版本及可选的 FlashAttention 配置请参阅安装指南。
python examples/t2i/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT-Preview \
--prompt "A cinematic mountain lake at sunrise, realistic photography." \
--width 2048 --height 2048 \
--device_map auto \
--output output.pngpython examples/editing/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT-Preview \
--image input.png \
--prompt "Change the jacket to cobalt blue. Preserve the face, pose, background, lighting, and framing." \
--output edited.png如需使用 Image PE 生成更详细、面向模型的编辑 Prompt:
python examples/editing/inference.py \
--model_path sensenova/SenseNova-U1.5-8B-MoT-Preview \
--prompt "参考这张图的青花水墨视觉语言,生成一张中国古建筑屋顶形制图鉴。" \
--image docs/assets/showcases/editing_gallery/case1_ancient_roof_infographic.webp \
--output edited_with_pe.png \
--use-edit-peSenseNova-U1.5 的参考配置为 cfg_scale=4.0、timestep_shift=3.0 和 num_steps=50。
SenseNova-U1.5 的生成预训练代码位于 training 目录。配置好模型、tokenizer 和数据路径后,使用以下命令启动所提供的 pixel-head PT 配方:
cd training
bash shell/train_u1/U1.5_8B.sh环境变量驱动的 PT 配置文件为 sensenovau1_5_8b_mot_pt.py。
Join our growing community to share feedback, get support, and stay updated on the latest SenseNova-U1 developments — we'd love to hear from you!
| Discord | Feishu Group |
![]() | ![]() |
如果本项目对您的研究有所帮助,欢迎 Star ⭐ 并引用 📝:
@article{sensenova2026sensenovau1,
title = {SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture},
author = {Diao, Haiwen and Wu, Penghao and Deng, Hanming and Wang, Jiahao and Bai, Shihao and Wu, Silei and Fan, Weichen and Ye, Wenjie and Tong, Wenwen and Fan, Xiangyu and others},
journal = {arXiv preprint arXiv:2605.12500},
year = {2026}
}