SenseNova/SenseNova-U1.5-8B-MoT-LoRAs
模型介绍
文件和版本
Pull Requests
讨论
分析

SenseNova-U1.5-8B-MoT-LoRAs

英文 | 简体中文

GitHub Hugging Face 上的 SenseNova-U1.5 NEO-unify SenseNova-U 演示 许可证

SenseNova-U1.5 原生统一多模态架构

概述

本仓库托管 SenseNova-U1.5-8B-MoT 的官方 LoRA 权重。首个发布的 SenseNova-U1.5-8B-MoT-LoRA-8step 是一个 0.4B 参数的蒸馏适配器,用于在 8 个去噪步骤中实现更快、更高效的文生图推理。

SenseNova-U1.5-8B-MoT 是我们最新的原生统一多模态检查点,面向更精准、一致、可靠且更具审美吸引力的视觉创作。基于 NEO-unify,它在 patchify 层、数据质量与分布、任务设定、提示词增强以及后训练流程方面进行了强化。

本次官方发布聚焦于六项用户可感知的改进:

  • 更高质量的图像生成: 改善构图与色彩和谐,材质渲染更真实,光影更自然,视觉保真度更强,局部细节更精细。
  • 更优质的文字渲染与信息图生成: 中英文文字更易读,在海报、信息图、品牌资产及其他文本密集型设计中信息层级更清晰。
  • 更高效的原生 4K 生成: 全局结构更连贯,色彩更和谐,高分辨率输出更稳定,生成效率更高。
  • 更可靠的原生图像编辑: 在局部编辑、文字编辑、多参考编辑、插入和替换编辑中,能更好地保持主体身份与未编辑内容的一致性。
  • 更强的复杂指令遵循: 在单次请求中,对物体数量、空间关系、布局、风格以及多重约束的执行更加一致。
  • 更精确的视觉控制: 通过边界框、视觉标记以及单图或多图参考,实现更准确的区域级和对象级控制。

展示

SenseNova-U1.5 生成与编辑展示

核心基准测试

SenseNova-U1.5 基准测试概览

查看详细基准测试结果

SenseNova-U1.5 详细基准测试结果

快速开始

参考推理实现可在 SenseNova-U1 GitHub 仓库 中获取。

安装

git clone https://github.com/OpenSenseNova/SenseNova-U1.git
cd SenseNova-U1
uv sync
source .venv/bin/activate

上游环境使用 Python 3.11、PyTorch 2.8 和 CUDA 12.8。关于其他 CUDA 版本以及可选的 FlashAttention 配置,请参阅 安装指南。

8-Step LoRA Text-to-Image(推荐)

下载 LoRA 权重,并将其应用于官方基础 checkpoint:

hf download sensenova/SenseNova-U1.5-8B-MoT-LoRAs \
  SenseNova-U1.5-8B-MoT-LoRA-8step.safetensors \
  --local-dir ./sensenova/SenseNova-U1.5-8B-MoT-LoRAs

python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --lora_path ./sensenova/SenseNova-U1.5-8B-MoT-LoRAs/SenseNova-U1.5-8B-MoT-LoRA-8step.safetensors \
  --prompt "A cinematic mountain lake at sunrise, realistic photography." \
  --width 2048 --height 2048 \
  --cfg_scale 1.0 --cfg_norm none --timestep_shift 3.0 --num_steps 8 \
  --device_map auto \
  --output output.png

[!IMPORTANT] 该 LoRA 专用于 sensenova/SenseNova-U1.5-8B-MoT,与早期的 SenseNova-U1.5-8B-MoT-Preview checkpoint 不兼容。

基础模型文生图

python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --prompt "A cinematic mountain lake at sunrise, realistic photography." \
  --width 2048 --height 2048 \
  --device_map auto \
  --output output.png

基础模型图像编辑

python examples/editing/inference.py \
  --model_path sensenova/SenseNova-U1.5-8B-MoT \
  --image input.png \
  --prompt "Change the jacket to cobalt blue. Preserve the face, pose, background, lighting, and framing." \
  --output edited.png

请参阅推理示例,了解更多选项、支持的分辨率和批量处理。

最佳实践

对于约束较少的清晰任务,直接使用自然语言提示词通常效果较好。对于复杂的生成或编辑任务,在需要额外规划时使用提示增强,并明确指定需要保持不变的内容。

请参阅 SenseNova-U1.5 Cookbook,查看设置说明以及可选的 Image PE、Caption-to-Prompt 和 Editing PE 实践方案。

🌐 使用 SenseNova-Studio

体验 SenseNova-U1.5 的最快捷方式是通过 SenseNova-Studio——一个 🆓 免费在线体验平台,可直接在浏览器中试用模型,无需安装或 GPU。

持续优化

正式版相较 Preview 版本已有改进,但在以下方面仍存在挑战:

  • 细节或色彩过度突出: 某些提示词可能产生过多的高频细节或过饱和的色彩,通常可通过降低 cfg_scale 来缓解。
  • 密集文本错误: 密集、长段、小字号或中英混排文本可能出现错误。
  • 受限布局: 在高度受限的布局中,精确数量、对齐方式或层级关系可能不够完善。
  • 人物细节不稳定: 小尺寸人脸、手部、肢体以及细粒度物体结构可能仍不稳定。
  • 复杂编辑漂移: 大范围、多轮或多参考编辑可能出现漂移,尤其是在需要同时保留多个区域时。

模型

模型阶段HF 权重
SenseNova-U1.5-8B-MoTRL🤗 模型
SenseNova-U1.5-8B-MoT-LoRA-8step8 步蒸馏 LoRA(0.4B)🤗 权重
SenseNova-U1.5-8B-MoT-SFT监督微调🤗 模型

🌐 加入社区!

加入我们日益壮大的社区,分享反馈、获取支持,并第一时间了解 SenseNova-U1 的最新进展——我们期待听到你的声音!

Discord飞书群

引用

如果本项目对您的研究有所帮助,请考虑为仓库添加 Star,并引用:

@misc{sensenova2026neounify,
  title        = {NEO-unify: Building Native Multimodal Unified Models End to End},
  author       = {SenseNova},
  journal      = {Hugging Face blog},
  url          = {https://huggingface.co/blog/sensenova/neo-unify},
  year         = {2026}
}

@article{sensenova2026sensenovau1,
  title        = {SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture},
  author       = {Diao, Haiwen and Wu, Penghao and Deng, Hanming and Wang, Jiahao and Bai, Shihao and Wu, Silei and Fan, Weichen and Ye, Wenjie and Tong, Wenwen and Fan, Xiangyu and others},
  journal      = {arXiv preprint arXiv:2605.12500},
  year         = {2026}
}

许可

本模型基于 Apache 2.0 License.