---
title: SenseNova-U1-8B-MoT-Infographic-V2
canonical_url: "https://www.modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic-V2"
md_url: "https://www.modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic-V2.md"
repository: SenseNova/SenseNova-U1-8B-MoT-Infographic-V2
last_updated: 2026-07-07
license: apache-2.0
pipeline_tag: any-to-any
tasks:
  - any-to-any
model_type:
  - neo_chat
architectures:
  - NEOChatModel
parameters: 17.6B
tensor_type:
  - BF16
library_name:
  - lora
  - safetensors
  - pytorch
frameworks:
  - pytorch
downloads: 160
stars: 5
tags:
  - multimodal
  - text-to-image
  - image-to-text
  - image-editing
  - interleaved-generation
  - custom_code
---

# SenseNova-U1-8B-MoT-Infographic-V2

> SenseNova-U1-8B-MoT-Infographic-V2 - SenseNova 在 ModelScope 开源的模型。SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova/SenseNova-U1-8B-MoT-Infographic-V2 是 ModelScope 魔搭社区上的 17.6B 参数any-to-any模型，采用 apache-2.0 许可。

- **Repository**: SenseNova/SenseNova-U1-8B-MoT-Infographic-V2
- **License**: apache-2.0
- **Tasks**: any-to-any
- **Parameters**: 17.6B
- **Tags**: multimodal, text-to-image, image-to-text, image-editing, interleaved-generation, custom_code
- **Downloads**: 160
- **Stars**: 5
- **Last updated**: 2026-07-07

Source: https://www.modelscope.cn/models/SenseNova/SenseNova-U1-8B-MoT-Infographic-V2

---

# SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

<p align="center">
  <strong>English</strong> | <a href="https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic-V2/blob/main/README_CN.md">简体中文</a>
</p>

<p align="center">
  <a href="https://arxiv.org/abs/2605.12500"><img src="https://img.shields.io/badge/arXiv-2605.12500-b31b1b.svg" alt="arXiv"></a>
  <a href="https://huggingface.co/collections/sensenova/sensenova-u1"><img src="https://img.shields.io/badge/%F0%9F%A4%97%20HuggingFace-Model-yellow" alt="HuggingFace Model"></a>
  <a href="https://modelscope.cn/collections/SenseNova/SenseNova-U1"><img src="https://img.shields.io/badge/%F0%9F%A4%96%20ModelScope-模型-purple" alt="ModelScope-模型"></a>
  <a href="https://unify.light-ai.top/"><img src="https://img.shields.io/badge/%F0%9F%A4%97%20SenseNova_U1-Demo-Green" alt="SenseNova-U1 Demo"></a>
  <a href="./LICENSE"><img src="https://img.shields.io/badge/License-Apache%202.0-blue.svg" alt="License"></a>
  <a href="https://discord.com/invite/BuTXPHmQub"><img src="https://img.shields.io/badge/Discord-Join-5865F2?logo=discord&logoColor=white" alt="Discord"></a>
</p>

<p align="center">
  <img src="docs/assets/teaser.webp" alt="SenseNova-U1" width="900">
</p>

<!-- <p align="center">
  <img src="docs/assets/teaser_2.webp" alt="visualization" width="900">
</p> -->

## 📣 Updated News
- `[2026.06.29]` Release [SenseNova-U1-8B-MoT-Infographic-V2 📊](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic-V2), an upgraded infographic model with improved dense small-text rendering with sharper text edges, stronger complex dense-layout generation, and better overall visual aesthetics and harmony, plus a fix for the black-background issue. Model details and visual examples are available in [✨ U1 Infographic Model Series](docs/u1_infographic_model.md).

<details>
<summary>✨ Click to expand older news</summary>

- `[2026.06.12]` Release [SenseNova-U1-8B-MoT-Infographic-LoRA-8step-V1.0](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-LoRAs/blob/main/SenseNova-U1-8B-MoT-Infographic-LoRA-8step-V1.0.safetensors) for faster infographic generation. Please see the [example script](docs/base_vs_distill.md#run-base-and-distilled-model).

- `[2026.06.11]` Release [SenseNova-U1-8B-MoT-Interleaved 📖](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Interleaved), specially optimized for interleaved image-text generation, with notably improved narrative coherence, character and style consistency, and text-image alignment in multi-page content.

- `[2026.05.21]` Release the full-parameter fine-tuning [training code](https://github.com/OpenSenseNova/SenseNova-U1/blob/main/training/README.md) for SenseNova-U1.

- `[2026.05.15]` Release [SenseNova-U1-8B-MoT-Infographic 📊](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic) model for improved infographic generation. See [U1 Infographic Model Series](docs/u1_infographic_model.md) for details, and [✨ Infographic Showcases ](docs/u1_infographic_showcases.md) for 100 generated examples.

- `[2026.05.10]` Release [🔥SenseNova-U1 Technical Report🔥](https://github.com/OpenSenseNova/SenseNova-U1/blob/main/docs/pdf/SenseNOVA_U1.pdf) and the weights for [SenseNova-U1-A3B-MoT-SFT](https://huggingface.co/sensenova/SenseNova-U1-A3B-MoT-SFT) & [SenseNova-U1-A3B-MoT](https://huggingface.co/sensenova/SenseNova-U1-A3B-MoT).

- `[2026.05.08]` Add **GGUF quantized checkpoints** and **layer-offload VRAM modes** for low-VRAM single-GPU inference. See [Memory-efficient inference](#-memory-efficient-inference-gguf--vram-modes). GGUF weights for `SenseNova-U1-8B-MoT-Merger` are available at [🤗 smthem/SenseNova-U1-8B-MoT-Merger-gguf](https://huggingface.co/smthem/SenseNova-U1-8B-MoT-Merger-gguf) — many thanks to [@smthem](https://github.com/smthem) for contributing the quantized weights.

- `[2026.05.06]` Release [SenseNova-U1-8B-MoT-LoRA-8step-V1.0](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-LoRAs/blob/main/SenseNova-U1-8B-MoT-LoRA-8step-V1.0.safetensors). Please see the [example script](docs/base_vs_distill.md#run-base-and-distilled-model).

- `[2026.04.30]` Release the preview version of the 8-step inference model [SenseNova-U1-8B-MoT-8step-preview](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-8step-preview). In most cases, the image generation quality of this model closely matches that of the base model (see [comparison and existing issues](docs/base_vs_distill.md)). To test this model, you can use the [inference scripts](examples/README.md), but with the following parameters: ```--cfg_scale 1.0 --num_steps 8``` .

- `[2026.04.27]` Initial release of the weights for [SenseNova-U1-8B-MoT-SFT](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT-SFT) and [SenseNova-U1-8B-MoT](https://huggingface.co/sensenova/SenseNova-U1-8B-MoT).

- `[2026.04.27]` Initial release of the [inference code](https://github.com/OpenSenseNova/SenseNova-U1/blob/main/examples/README.md) for SenseNova-U1.  

</details>

## 🌟 Overview

🚀 **SenseNova U1** is a new series of native multimodal models that unifies multimodal understanding, reasoning, and generation within a monolithic architecture. 
It marks a fundamental paradigm shift in multimodal AI: **from modality integration to true unification**. Rather than relying on adapters to translate between modalities, SenseNova U1 models think-and-act across language and vision natively.

<details>
<summary>✨ Click to expand architecture details</summary>

Unifying visual understanding and generation in an end-to-end architecture from pixel to word opens tremendous possibilities, enabling highly efficient and strong understanding, generation, and interleaved reasoning in a natively multimodal manner.

<p align="center">
  <img src="docs/assets/teaser_1.webp" alt="radar plot" width="900">
</p>

#### 🏗️ *Key Pillars:*      

At the core of SenseNova U1 is **[NEO-unify](https://huggingface.co/blog/sensenova/neo-unify)**, a novel architecture designed from the first principles for multimodal AI:  *It eliminates both Visual Encoder (VE) and Variational Auto-Encoder (VAE) where pixel-word information are inherently and deeply correlated.* Several important features are as follows:

- 🔗 Model language and visual information end-to-end as a unified compound.   
- 🖼️ Preserve semantic richness while maintaining pixel-level visual fidelity.     
- 🧠 Reason across modalities with high efficiency & minimal conflict via native MoTs. 

</details>

Powered by this new core architecture, **SenseNova U1-8B-MoT-Infographic** (infographic-specifically enhanced version of SenseNova U1-8B-MoT) delivers exceptional efficiency and state-of-the-art infographic performance:

<table align="center">
  <tr>
    <td align="center" width="50%">
      <img src="docs/assets/perform_vs_speed_infobench.webp" width="100%" />
      <br>
      Generation Latency vs. Averaging Performance on <b>Infographic Benchmarks</b> (BizGenEval, IGenBench).
    </td>
    <td align="center" width="50%">
      <img src="docs/assets/perform_vs_speed_5bench.webp" width="100%" />
      <br>
      Generation Latency vs. Averaging Performance on general benchmarks (OneIG, LongText, CVTG).
    </td>
  </tr>
</table>

- **Benchmark Performance:** Compared with **SenseNova-U1-8B-MoT-Infographic**, V2 improves BizGenEval hard/easy from 46.6 / 65.4 to 50.3 / 67.9 (+3.7 / +2.5), and IGenBench Q-ACC/I-ACC from 69.5 / 17.0 to 71.4 / 18.3 (+1.9 / +1.3). OneIG(EN/ZH) is 55.4 / 53.5, roughly on par with the previous version, indicating that infographic-specific capability improves while general generation ability remains stable.
- **Generation Quality:** V2 further improves small-text rendering, complex dense layout, and overall visual aesthetics: text edges are sharper, high-information-density layouts are more stable, and poster, dashboard, and report-style infographics look more polished. It also fixes the black-background issue, avoiding unintended black or overly dark backgrounds.

<details>
<summary>✨ Click to expand Benchmark Details</summary>


| Model | BizGenEval Avg. (hard / easy) ↑ | IGenBench Q-ACC ↑ | IGenBench I-ACC ↑ | OneIG(EN) ↑ | OneIG(ZH) ↑ |
| --- | ---: | ---: | ---: | ---: | ---: |
| ***Commercial Models*** | | 
| Nano-Banana-Pro | 76.7 / 93.7 | 90.6 | 48.8 | 58.1 | 56.8 |
| Nano-Banana-2.0 | 68.5 / 92.5 | 85.6 | 34.4 | 54.0 | 54.9 |
| GPT-Image-1.5 | 35.9 / 81.6 | 55.0 | 12.0 | - | - |
| Qwen-Image-2.0 | 45.5 / 65.8 | 50.0 | 3.0 | 54.1 | 50.9 |
| Seedream-4.5 | 30.1 / 66.2 | 61.0 | 6.0 | 56.4 | 55.0 |
| ***Open-source Models*** | | | | | |
| **SenseNova-U1-8B-MoT-Infographic-V2** | **50.3 / 67.9** | **71.4** | **18.3** | 55.4 | 53.5 |
| **SenseNova-U1-8B-MoT-Infographic** | 46.6 / 65.4 | 69.5 | 17.0 | **55.6** | 53.3 |
| **SenseNova-U1-8B-MoT** | 39.8 / 61.1 | 51.3 | 4.2 | 54.5 | 53.8 |
| Z-Image | 8.2 / 43.8 | 30.0 | 1.0 | 54.6 | 53.5 |
| Qwen-Image-2512 | 6.3 / 41.0 | 32.2 | 1.0 | 53.0 | 51.5 |
| Qwen-Image | 2.8 / 23.8 | 36.0 | 0.0 | 53.9 | 54.8 |
| Bagel | 2.0 / 3.7 | 4.9 | 0.0 | 36.1 | 37.0 |

<sub>Note: IGenBench scores are reported as percentages. Commercial and open-source models are sorted separately by the average of BizGenEval hard/easy and IGenBench Q-ACC/I-ACC. OneIG is included as a general generation reference.</sub>

- 📰 **High-density information rendering (Specialized)**: This specific model demonstrates strong capabilities in dense visual communication, generating richly structured layouts for knowledge illustrations, posters, presentations, comics, resumes, and other information-rich formats.
  
- 🏆 **Open-source SoTA**: SenseNova U1 sets a new standard for unified multimodal understanding and generation, achieving state-of-the-art infographic performance among open-source models.

</details>


</details>

## 🎨 Infographic Showcases 

<details open>
<summary>✨ Click to collapse infographic showcases</summary>

<table width="100%" style="table-layout: fixed; text-align: center;">

<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/13681c75-9e86-4af7-85b4-f1983f0f0251" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/cc5c1a6f-f1eb-4db8-bfd5-e96d99725e80" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/4f4b4bf8-114c-445d-99b2-f6abe7293870" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/0e44d710-fb90-4b4e-81d2-7141ac96914c" width="100%"></td>
</tr>

<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/780508fa-bec1-4616-9c28-d42afef6e326" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/91ff360b-6aba-4ddf-ac26-3d63e72332c6" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/99b097d5-ecfc-4d67-b085-984ea605ed41" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/45c75eeb-64b0-45d8-a735-d6908a93e914" width="100%"></td>
</tr>

<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/b17b4d8b-234c-49fe-8d97-bf8f6767278d" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/c5b8a4ff-e3df-4871-a445-0c6b7c2aedf9" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/1e996fdd-8ae8-4abe-97dd-e0d6a58137e1" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/b3e70fc0-392a-4cea-9270-dbebae31a27e" width="100%"></td>
</tr>

<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/63dcc0ff-8a32-4fd4-b611-6bcc511b0ed3" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/e0e75a48-cc2e-48be-8990-90327c9a577b" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/a0155b52-4a5d-4704-b573-6918d3a66e92" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/f314765c-8059-4483-bf2c-cf853014066b" width="100%"></td>
</tr>
</table>

</details>  


## V2 Qualitative Comparison: SenseNova-U1-8B-MoT-Infographic vs. SenseNova-U1-8B-MoT-Infographic-V2

We present a qualitative comparison between the **SenseNova-U1-8B-MoT-Infographic** (V1) model and the upgraded **SenseNova-U1-8B-MoT-Infographic-V2** model across three key dimensions: small-text rendering, complex dense-layout generation and overall aesthetics, and background stability. For the full comparison, please refer to [✨ U1 Infographic Model Series](docs/u1_infographic_model.md).

### Small-Text Rendering

<table width="100%" style="table-layout: fixed; text-align: center;">
<tr>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
</tr>
<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/87cb801a-9d6c-4766-bb1f-34a8f997e5e2" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/120a8b47-5dd9-4d6c-b6ab-aa4de2e3cd5d" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/31c2842d-119e-49cb-869d-d960e70313c3" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/e70cb418-efe4-41f4-baa5-89d37a7bdcb8" width="100%"></td>
</tr>
<tr>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">这是一张以漫画风格设计的中文信息图，主题为“异世界穿越手册：穿越指南与生存法则全解析”，副标题说明其旨在系统梳理异世界穿越的核心准备步骤、初期生存成果与长远发展规划，为后续穿越者提供标准化参考与方向指引。整体采用红、蓝、黄三色分区布局，顶部有红色爆炸形图案内含“魔法传送门”图标，右侧为黄色“WOW!”感叹号，下方说明文字指出本图系统梳理异世界穿越的核心运作模式、落地成效与典型经验，为后续同类穿越活动提供标准化参考与方向指引。<br><br>信息图主体分为三个垂直板块，由左至右通过红色箭头连接，体现逻辑递进关系：<br><br>**一、异世界穿越核心准备模式（红色背景）**<br>标题为“穿越准备 魔力觉醒 安全降临”，并列出“异世界穿越核心准备三步法”：<br>1. **穿越媒介确认**：图标为魔法阵与传送门，文字说明“确认穿越媒介（卡车、魔法阵、神秘道具），制定应急预案，明确初始降临点与基础属性。”<br>2. **双系统绑定**：图标为系统面板加勾选标记，文字说明“建立‘语言+常识’双下载机制：瞬间1次语言包加载、基础世界观常识注入。”<br>3. **初始天赋觉醒**：图标为发光的水晶，文字说明“搭建初始天赋觉醒平台，觉醒战斗、辅助、生活三类核心天赋，确保开局优势。”<br><br>**二、穿越初期核心生存成果（蓝色背景）**<br>标题为“三大领域适应见效 初期生存成果显著”，包含“穿越首月核心生存成果汇总”，分为三个子栏目：<br>- **生存适应成果（红色边框）**：图标为帐篷与篝火；成功搭建临时安全营地：12个；组织野外采集与狩猎实践：36次；储备基础生存物资：1200余份；底部配有“POW!”漫画音效。<br>- **战斗与探索成果（蓝色边框）**：图标为剑与魔法书；讨伐低阶魔物与探索副本：18个；解锁隐藏地图与宝箱：7个；获取初始金币与素材累计：2300枚/单位；底部配有“BANG!”漫画音效。<br>- **社交与阵营成果（绿色边框）**：图标为公会徽章；结识当地NPC与冒险者同伴：427人；成功加入初级冒险者公会：196次；触发隐藏主线/支线任务：28个；底部配有“OK!”漫画音效。<br><br>**三、生存经验与长远进阶方向（黄色背景）**<br>标题为“总结经验稳生存 谋划长远成大业”，包含两个部分：<br>- **可复制经验与后续进阶方向**<br>- **典型经验（红色标签）**：坚持谨慎苟道的生存属性（配盾牌图标）；精准找准当地势力与公会利益契合点（配握手图标）；避免“重莽撞、轻情报”（配放大镜图标）。<br>- **长效推进方向（蓝色标签）**：拓展个人势力与领地覆盖领域（配城堡图标）；向深渊探索、神界飞升等高阶场景延伸（配神殿图标）；建立年度实力评估与境界突破机制，保障持续变强（配向上箭头图标）。<br><br>底部黄色区域绘有红色道路通向远方的魔法城堡与巨龙，象征发展方向。整体设计充满动感，使用大量漫画元素如爆炸形对话框、音效词、箭头和图标，增强视觉吸引力与信息传达效果。所有文本均为中文，无英文或数字以外的符号。</div></details></td>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">该信息图以报纸文化版为主题设计，整体背景为白色报纸版面，由多个栏目模块围绕视觉中心呈三栏式布局。中心是一个巨大的红色泼墨/笔触背景，内部包含穿着宇航服的宇航员，自然优美的姿态，周围点缀太空探索设备与星尘效果。中心上方有主标题"首映"，白色粗体字，副标题"在《新纪元》首映之际，粉丝们纷纷讨论关于该系列新电影的各种理论——无论是否合理。"。顶部报头："大众日报 星期三 2023年10月25日"，右侧有二维码及"大众日报在线门户：www.dazhongdaily.com"。刊名："生活与艺术"，采用黑色粗体与手写体结合。 信息图共分为三个主要栏目，分布在视觉中心下方： **1. 左侧栏目：首映盛况与制作亮点（左侧栏模块）** - **作者信息**：李明 特约撰稿，邮箱"liming@dazhongdaily.com" - **正文开篇**（巨大””随“”开头）："着《新纪元》在全球影院震撼上映，这部备受期待的科幻史诗再次点燃了影迷们的热情。距离上一部作品已经过去了整整五年，导演用前所未有的视觉效果和深刻的哲学思考，为观众呈现了一个既熟悉又陌生的宇宙世界。影片开场仅三天，全球票房便突破五亿美元大关，创下了该系列的历史新高。社交媒体上，关于剧情走向、角色命运以及隐藏彩蛋的讨论热度持续攀升，各大论坛几乎被各种理论分析所淹没。" - **第二段落**："特别值得一提的是，本次电影在特效制作上投入了前所未有的资源，超过2000名视觉艺术家参与了长达三年的制作周期。影片中的太空场景采用了最新的虚拟拍摄技术，使得每一个镜头都充满了令人窒息的真实感。" **2. 中间栏目：核心悬念与角色命运剖析（中间栏模块）** - **标题**："在这部全新科幻史诗的众多疑问中，最大的悬念莫过于主角是否已经堕入黑暗面，成为被邪恶力量支配的终极反派。" - **正文内容**："自从预告片发布以来，关于主角命运走向的猜测便从未停止。在上一部影片的结尾，我们看到他在生死关头做出了一个令人震惊的选择。这个选择究竟是出于无奈，还是早有预谋？导演在最近的采访中透露，主角的内心挣扎将是本片的核心主题之一。'我们想要探讨的是，当一个人面对绝对的力量诱惑时，他会如何抉择？'导演表示，'这不仅仅是关于善恶的简单对立，更是关于人性复杂性的深刻剖析。' 影评人张华认为：'这部电影最成功的地方在于，它没有给出非黑即白的答案。主角的转变是一个渐进的过程，观众能够理解他的每一个决定，即便那些决定最终将他引向了黑暗。' 此外，影片中新增的角色也为故事增添了更多层次。神秘的女战士、隐居的智者、以及一个出人意料回归的老朋友，他们各自承载着推动剧情发展的关键线索。" **3. 右侧栏目：粉丝热门理论大赏（右侧栏模块，标题"部分理论"）** - **小标题"最后的绝地武士究竟是谁？"** 正文："根据预告片中的蛛丝马迹，许多粉丝推测最后的绝地武士可能并非我们一直认为的那个人。有理论指出，在影片中段出现的神秘老人，其身上的能量波动与传说中的初代绝地宗师极为相似。更有细心的观众发现，老人的手部特写镜头中，隐约可见一枚古老的绝地徽章。这是否意味着绝地武士团还有不为人知的幸存者？" - **小标题"主角会成为新的反派吗？"** 正文："从已发布的剧照来看，主角身穿的黑色战甲与反派军团的制服有着惊人的相似之处。而且，在一段 leaked 的花絮视频中，我们可以清楚看到主角使用了一种从未出现过的黑暗能量。导演虽然对此保持沉默，但主演在采访中的一句'有时候，拯救世界的唯一方法就是成为怪物'引发了无限遐想。" - **小标题"女主角的神秘身世究竟是什么？"** 正文："女主角在预告片中的表现令人印象深刻，她展现出的超能力似乎超越了现有设定。有粉丝通过分析她的服装纹样，发现其中隐藏着与古代星际文明相关的符号。更有趣的是，她的口音与某个已被摧毁的星球方言高度吻合。这一切是否暗示着她与那个失落文明有着千丝万缕的联系？" - **小标题"反派首领会是潜伏的卧底吗？"** 正文："最令人震惊的理论莫过于反派首领的真实身份。有分析指出，在前三部作品中，这位看似忠诚的指挥官曾多次在关键时刻做出看似不合理却最终帮助主角团的决定。如果这一理论成立，那么他可能一直在执行一项长达数十年的潜伏任务，而《新纪元》将是真相大白于天下的时刻。" **底部信息模块（底部横幅）** 包含："详情请查阅第6版影院排片表"，并附有"扫描二维码获取独家幕后花絮及主创访谈"的提示。 整体视觉风格专业、结构清晰，通过报纸三栏式布局增强可读性和权威感，强调在电影首映报道中遵循新闻专业性、深度解析、多角度呈现，并通过视觉中心与文字内容的结合达成信息传播的目标。所有文本均为中文，语言规范严谨，适合用于文化娱乐新闻报道场景。</div></details></td>
</tr>
<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/7586dcd2-2ab9-4201-89f3-4c6bfcfe55c0" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/4bbb3240-8fe4-47e7-85d2-ab3b7aa094ca" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/bb554b08-772e-4e97-881f-c1bc51ce74da" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/2890b99c-db53-4a74-9cc9-14402b64652f" width="100%"></td>
</tr>
<tr>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">该信息图以“互联网物流平台服务介绍与核心功能全解析”为标题，副标题说明其旨在系统梳理互联网物流平台的核心服务类别、实用功能及竞争优势，帮助货主、司机、物流企业等各类用户快速掌握平台价值与使用逻辑。整体设计采用明亮的蓝紫色调，搭配卡通人物插画和清晰的信息模块，风格现代、直观，通过左右对比结构展现传统物流与互联网物流平台的差异，并在中部突出转型痛点与核心功能。<br><br>信息图布局分为三个主要区域：<br><br>**左侧：传统物流模式**<br>标题为“传统物流模式”，并附有橙色标签“互联网物流相比传统模式优势显著”。下方列出四个问题点：<br>1) 供需匹配效率：平均2-3天找车/找货，配有时钟图标。<br>2) 运输透明度：仅发货/到货节点手动通知，配有文件夹图标。<br>3) 结算周期：1-3个月常规账期，配有日历图标。<br>4) 货损率：≥5%，配有纸箱图标。<br>底部插画描绘一位焦虑的男性坐在悬崖边，周围散落着包裹、文件和电话，旁边标注“信息割裂 / 响应慢 / 对账繁琐 / 风险高”。<br><br>**中间：转型痛点与核心功能**<br>顶部是“三类核心用户专属服务全覆盖”模块，包含货主（西装男）、司机（绿衣戴帽男）和物流企业（蓝衣女）的卡通形象，说明平台针对不同角色需求定制全链路解决方案。<br>下方是红色边框的“转型痛点”模块，列出五个痛点：<br>- 找车难（卡车+放大镜图标）<br>- 找货慢（包裹+放大镜图标）<br>- 过程不透明（眼睛被划掉图标）<br>- 结算周期长（日历+时钟图标）<br>- 货损风险高（盾牌带感叹号图标）<br><br>再往下是“四大核心功能实现提效降本”的桥梁式结构，强调“数字化技术重构物流全流程体验”，四个功能模块从左至右排列：<br>1) 智能供需匹配：大数据算法自动匹配货源与运力，匹配准确率95%+，找货/找车时间缩短60%。<br>2) 可视化在途管控：全节点GPS实时追踪，异常自动预警，货损率较传统物流降低40%。<br>3) 数字化极速结算：线上一键开票、实时对账、运费T+0到账，结算周期缩短80%。<br>4) 数据增值服务：自动生成运量、成本、时效多维分析报表，为运营决策提供数据支撑。<br><br>**右侧：互联网物流平台模式**<br>标题为“互联网物流平台模式”，下设三个子模块：<br>A. 货主端服务（紫色背景）：<br>- 货源发布<br>- 运力匹配<br>- 在途追踪<br>- 对账结算<br>- 物流保险<br><br>B. 司机端服务（绿色背景）：<br>- 货源推荐<br>- 路线规划<br>- 油气优惠<br>- ETC办惠<br>- 运费快速结算<br><br>C. 物流企业端服务（蓝色背景）：<br>- 运力调度<br>- 订单管理<br>- 数据分析<br>- 合规报税<br><br>此部分下方列出四大优势指标：<br>1) 供需匹配效率：平均10分钟完成匹配。<br>2) 运输透明度：全程GPS追踪 + 异常实时预警。<br>3) 结算周期：支持运费T+0到账。<br>4) 货损率：≤1%。<br><br>底部横幅总结“核心差距”：传统物流依赖人工与信息孤岛，互联网物流平台通过“匹配、追踪、结算、数据”能力实现全流程数字化提效降本。右侧配有一个向上增长的柱状图，颜色由紫到蓝渐变，象征绩效提升。<br><br>整张信息图通过左右对比、上下层级和桥接结构，系统性地呈现了互联网物流平台相较于传统模式的优势，结合数据、图标和人物插画，使复杂信息易于理解。所有文本均为中文，无英文内容。</div></details></td>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">生成一张关于节约用水的竖版公益宣传海报。海报整体色调以蓝色和白色为主，局部点缀橙色。海报背景的上半部分是带有白云的蓝天，下方是临水的城市天际线建筑群。画面右侧的前景是一片干涸开裂的棕色土地。<br><br>海报左上方有巨大的深蓝色粗体标题文字“珍惜水资源”，下方是同样巨大的深蓝色粗体文字“节约用水”。标题下方有一行稍小的文字“从点滴做起 共建”，紧接着是橙色文字“节水型”和深蓝色文字“城市”。再下方是一个深蓝色圆角矩形横幅，里面有白色文字“节约每一滴水 守护生命之源”。海报右侧，在干涸开裂的土地上方，悬浮着一滴巨大的透明立体水滴，水滴内部映射出高楼林立的现代城市景观，水滴底部在干涸的土地上激起一圈圈蓝色的水波纹。<br><br>在城市背景和干涸土地的下方，有一个横跨画面的浅米色圆角矩形信息卡片区域，被细灰线分为四个部分。第一部分有一个深蓝色地球图标，上方文字“地球表面约”，中间是巨大的深蓝色数字“71%”，下方文字“被水覆盖”。第二部分有一个深蓝色水滴轮廓图标，上方文字“淡水资源仅占”，中间是巨大的深蓝色数字“2.5%”，下方文字“能被人类直接利用”。第三部分有一个深蓝色的人物半身图标，上方文字“我国人均水资源量约为”，中间是巨大的深蓝色数字“2000”，下方文字“立方米/年 仅为世界平均水平的1/4”。第四部分有一个深蓝色的水龙头图标，上方文字“城市生活用水占比”，中间是巨大的深蓝色文字“约14%”，下方文字“节水潜力巨大”。<br><br>信息卡片下方是一个横向的行动号召横幅。横幅左侧是一个橙色矩形，内有白色文字“行动号召”。横幅主体为深蓝色，中间有醒目的白色大字“今天不节水，明天无水用！”，右侧有两行较小的白色文字“节水是一种美德，更是一份责任。”。<br><br>横幅下方是一个占据海报下半部分大面积的浅米色圆角矩形容器，内容分为左、中、右三列。<br>左列顶部是一个深蓝色胶囊形标签，内有白色房屋图标和白色文字“家庭节水建议”。下方垂直排列了五个建议项，每个项目左侧都有一个深蓝色圆形背景的白色图标。第一个是水龙头图标，右侧深蓝色粗体字“随手关闭水龙头”，下方黑色小字“刷牙、洗脸、洗手时，及时关闭水龙头，避免长流水。”。第二个是洗衣机图标，右侧深蓝色粗体字“合理使用家电”，下方黑色小字“洗衣机、洗碗机等家电，尽量集中清洗，减少使用次数。”。第三个是淋浴喷头图标，右侧深蓝色粗体字“缩短淋浴时间”，下方黑色小字“淋浴时间控制在5-10分钟，避免长时间冲淋。”。第四个是水桶图标，右侧深蓝色粗体字“一水多用”，下方黑色小字“洗菜水、淘米水可用于浇花、冲厕所、拖地等。”。第五个是水龙头和扳手图标，右侧深蓝色粗体字“定期检查漏水”，下方黑色小字“检查家中水管、马桶、水龙头等，及时维修，避免漏水浪费。”。<br><br>中间一列顶部是一个深蓝色胶囊形标签，内有白色大楼图标和白色文字“公共场所节水建议”。下方同样垂直排列了五个建议项。第一个是学校/机构建筑图标，右侧深蓝色粗体字“公共机构率先示范”，下方黑色小字“机关、学校、医院等公共机构应带头节水，推广节水器具。”。第二个是水龙头图标，右侧深蓝色粗体字“减少跑冒滴漏”，下方黑色小字“加强供水管网巡查维护，及时发现和修复漏损。”。第三个是字母P图标，右侧深蓝色粗体字“加强宣传引导”，下方黑色小字“在公共场所开展节水宣传，提高公众节水意识。”。第四个是水滴图标，右侧深蓝色粗体字“使用节水器具”，下方黑色小字“公共场所优先选用节水型器具，降低用水消耗。”。第五个是循环回收标志图标，右侧深蓝色粗体字“循环利用水资源”，下方黑色小字“推广中水回用、雨水收集利用，提高水资源利用效率。”。<br><br>右侧一列包含一个表格和一个小贴士框。上方是一个表格，表头是一个深蓝色圆角矩形，内有白色文字“生活用水参考表”。表格主体背景为浅蓝色，带有深蓝色网格线。表格包含两列，第一行表头为“项目”和“用水量（升/次）”。第二行为“洗手（节水）”和“约 1-2”。第三行为“刷牙（节水）”和“约 0.5-1”。第四行为“淋浴（节水）”和“约 40-60”。第五行为“洗衣机（节水）”和“约 80-120”。第六行为“冲厕所（节水）”和“约 3-6”。第七行为“洗菜（节水）”和“约 5-10”。表格下方是一个提示框，顶部是橙色圆角矩形，内有白色文字“节水小贴士”。下方是一个带有橙色边框的浅橙色背景框，内有四条带黑色圆点的黑色文字列表：第一条“● 按需取水，避免浪费；”，第二条“● 养成节水习惯，持之以恒；”，第三条“● 发现浪费，及时劝阻；”，第四条“● 人人参与，人人受益。”。<br><br>海报底部是一个深蓝色的横向区域。左侧有一个白色的水滴滴落在一圈圈蓝色和白色的水波纹中。中间是居中的白色大字“节水优先 人人有责 共建美丽家园”。在深蓝色区域的最下方，海报的最底端边缘，是浅灰白色的背景，上面有居中对齐的深蓝色落款文字，分两行排列。第一行是“× × 市 住 房 和 城 乡 建 设 局”，第二行是“× × 市 水 务 局”，在这两行文字的右侧，有一个垂直居中的深蓝色大字“宣”。</div></details></td>
</tr>
<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/6b79e789-e138-4eef-8b49-c5a1db78d8c9" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/ae64309e-2c67-4d4e-8ed6-581bb603f43c" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/95698dd8-5464-4a3a-a022-3f01fde700cb" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/0152db87-926c-4ecc-bf3f-3a3227036508" width="100%"></td>
</tr>
<tr>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">生成一张放在木纹桌面上的社区活动宣传海报。海报整体采用米黄色背景，搭配橙色和棕色文字与边框，顶部有彩旗装饰。顶部主标题为红色大字“桂花里社区周末暖市集”，副标题为“— 邻里共创 | 手作餐饮 | 亲子互动 | 公益回收 —”。标题左侧有红白条纹帐篷插画，右侧有带“暖·市集”绿牌的摊位插画。标题下方列有基本信息：时间图标及“时间：2026年6月20日 周六 10:00-18:30”，定位图标及“地点：桂花里广场东侧步行街（近地铁2号线云桥站B口）”，双人图标及“主办：桂花里社区居委会、云桥商圈服务中心”，五角星图标及“承办：拾光市集运营组”。海报右侧有一个深色背景的“快速索引：”侧栏，包含五个带图标的列表项：“01 时间”、“02 地点”、“03 报名”、“04 交通”、“05 志愿者”。海报中部由多个带编号的圆角矩形卡片组成。卡片“★01 活动亮点”内容为“手作摊位48个、轻食饮品16家、二手交换区、儿童绘本角、社区乐队表演”。卡片“02 摊位分区表格”包含一个四列表格，表头为“区位、内容、时间、负责人”，数据行依次为：“A区、手作饰品、10:00-18:00、林老师”，“B区、咖啡甜品、10:30-18:30、陈店长”，“C区、亲子体验、11:00-17:00、周社工”，“D区、公益回收、10:00-16:00、志愿队”。卡片“03 节目安排”列出：“1 开市巡游 10:10”，“2 亲子绘本 11:00”，“3 爵士小组 14:30”，“4 抽奖兑换 16:20”，“5 闭市整理 18:10”。卡片“04 报名方式”内容为“摊主报名截止6月12日，扫码填写表单，审核后短信通知；咨询电话 021-8899-6200”。卡片“05 交通提示”内容为“建议绿色出行；地铁B口步行260米；停车请至云桥商场P2，前2小时免费。”。卡片“06 志愿者说明”内容为“需年满16周岁，提供午餐与服务时长证明，岗位含引导、秩序、环保分类。”。卡片“07 温馨提示”内容为“请自备环保袋；宠物需牵引；雨天活动转至商场一层中庭；现场禁止明火。”。卡片“08 费用与票券”内容为“入场免费，体验券10元起，消费满88元可至服务台领取抽奖券1张。”。卡片“09 备注脚注”内容为“最终摊位以现场公示为准，食品摊位已完成备案，未成年人须由监护人陪同。”。卡片区域右下方有一个二维码，旁边写着“扫码报名 / 查看摊位图 / 志愿者登记”并带有向左的箭头，右侧有野餐篮插画。海报底部是一条橙红色色块，包含三组白色文字及图标：礼物图标及“赞助：云桥商场、四季鲜超市、南岸咖啡、乐芽亲子馆”，报纸图标及“合作媒体：城市邻里报”，树叶图标及“公益支持：绿芽环保”。</div></details></td>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">生成一张城市公共服务满意度数据报告图。<br><br>顶部左侧标题为“城市公共服务满意度监测简报 2026 | 内部研究版”，右侧为“P.08”。<br><br>主标题为“图 2-1 城市公共服务满意度综合排名（2026）”，下方副标题为“基于居民问卷、热线工单、政务服务评价与公共设施可达性数据”。右上角有两行说明，第一行为时钟图标加“数据来源：国家统计公开资料、地方政务服务评价、样本问卷 N=48,260”，第二行为信息图标加“统计口径：满分100；同比为较2025年变化；置信区间95%”。<br><br>页面左侧为主体水平条形图，表头依次为：排名、城市、满意度得分（满分100）、得分、同比变化、简要注释（主要亮点）。条形图X轴刻度为0、20、40、60、80、100，下方图例为：深蓝方块“80分及以上（满意）”，蓝色方块“70-80分（基本满意）”，灰色方块“70分以下（需改进）”。<br><br>图表数据逐行如下（包含排名、城市、得分、同比变化及颜色、注释）：<br>1，杭州，91.6，+1.8（蓝色），医疗便捷提升<br>2，成都，90.3，+1.5（蓝色），交通服务优化<br>3，苏州，89.1，+1.2（蓝色），政务效率领先<br>4，南京，87.9，+0.9（蓝色），教育资源均衡<br>5，武汉，86.5，+1.6（蓝色），医疗供给改善<br>6，广州，85.2，+0.7（蓝色），公共交通升级<br>7，深圳，84.3，+0.6（蓝色），政务服务便捷<br>8，青岛，83.2，+1.1（蓝色），环境质量改善<br>9，宁波，82.4，+0.8（蓝色），港口城市服务优<br>10，长沙，81.3，+0.5（蓝色），养老服务完善<br>11，厦门，80.6，+0.4（蓝色），公共环境优美<br>12，西安，80.1，+0.2（蓝色），文旅服务提升<br>13，合肥，79.6，+0.3（蓝色），政务响应及时<br>14，郑州，79.0，-0.1（红色），交通拥堵缓解中<br>15，天津，78.7，-0.2（红色），养老资源不足<br>16，重庆，78.3，-0.3（红色），山地交通挑战大<br>前12名条形为深蓝色，后4名为蓝色。<br><br>右侧上方为“分项指标概览”表格，表头为：指标、权重、均值、变化。数据行如下：<br>医疗（十字图标），25%，84.7，+1.2<br>教育（学士帽图标），20%，82.9，+0.6<br>交通（公交车图标），20%，86.4，+1.5<br>养老（老人图标），15%，80.2，+0.3<br>政务（政府建筑图标），10%，88.1，+2.0<br>环境（树叶图标），10%，83.5，+0.8<br>变化列数值均为蓝色。<br><br>右侧下方为“本期监测要点”虚线框卡片，包含三个圆点列表：<br>16个重点城市综合满意度均值为 83.6 分，较2025年提升 +0.7 分。<br>医疗、政务、交通项提升最为明显，体现公共服务供给优化成效。<br>天津、重庆两地得分低于80分，建议重点关注服务响应时效与资源匹配。<br><br>底部上方有六个带图标的信息块：<br>监测周期：2026年1月1日-2026年5月31日。<br>样本结构：覆盖16城常住居民，有效样本 48,260 份。<br>数据来源：问卷调查：39,872 份，热线工单：4,651 条，政务评价：3,737 条。<br>数据处理：标准化处理、缺失值校正，异常值剔除、加权汇总。<br>质量控制：双重校验机制，有效样本率 98.7%。<br>说明：得分经标准化处理，置信区间95%。<br><br>最底部为备注说明区：<br>“备注”栏内容：注1：样本按常住人口规模分层加权； 注2：低于80分城市需重点关注服务响应时效； 注3：排名仅反映本期监测结果，不作为行政考核结论。<br>“编号说明”栏内容：1. 排名按综合满意度得分由高到低排序； 2. 同比均较2025年变化，正值表示上升，负值表示下降； 3. 分项指标权重依据《城市公共服务评价指标体系（2026版）》确定； 4. 本报告为内部研究使用，未经许可请勿外传。<br>右下角为一个二维码，右侧文字为“扫码查看口径与附表”和“获取完整指标说明、数据明细与城市分项排名表（Excel）”。</div></details></td>
</tr>
</table>

### Complex Dense Layout and Overall Aesthetics


<table width="100%" style="table-layout: fixed; text-align: center;">
<tr>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
</tr>
<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/3547976c-5876-4a80-aeca-597d2c414186" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/cce60d3b-33f3-4779-a792-9edc33460be3" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/dd0f42c6-cb9e-4776-a4be-a8ee27ab2a31" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/773e2cf2-8a96-4e1b-8fee-f63c18b6fbe4" width="100%"></td>
</tr>
<tr>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">该信息图以黑板粉笔画风格呈现，主题为《青春启航·职场之约》，副标题为“大学生就业指南与求职通关全攻略图鉴”。整体布局采用垂直分栏结构，中央为主表格区域，左侧为就业小贴士和装饰性插画，右侧为求职相关物品及场景的示意图，顶部和底部配有装饰性文字与图案。视觉风格清新活力，使用绿色、蓝色、橙色等明快色彩勾勒线条与文字，点缀书本、星星、火箭等元素，营造出浓厚的青春与奋斗氛围。<br><br>顶部标题《青春启航·职场之约》以绿色粗体粉笔字书写，两侧各有一本手绘书籍，长着翅膀，周围环绕星星与火箭装饰。副标题下方有英文“Overview”说明：“本信息图梳理当前大学生就业的形势与政策导向，解析主流就业渠道、求职核心技能与避坑指南，为毕业生规划职业路径、顺利斩获心仪Offer提供清晰参考。”<br><br>主内容区是一个七列多行的表格，第一列为“内容模块×对比维度”，其余六列分别为“数据统计”、“引用语录”、“核心术语”、“风格偏好”、“排版偏好”、“其他要求”。<br><br>表格分为四个主要模块：<br><br>**A. 就业 = 时代机遇与政策导向的宏观解析**<br>- 数据统计：✓2024届高校毕业生规模预计达1179万人<br>- 引用语录：“国家稳就业政策护航青春梦想”<br>- 核心术语：促就业政策 / 基层就业 / 灵活就业<br>- 风格偏好：权威感、政策解读、趋势分析<br>- 排版偏好：3点分栏 + 小图标注释<br>- 其他要求：突出标签：国家就业支持政策的由来<br>- 表格下方三个子项标签（带图标）：国家宏观政策（国徽图标）；地方引才计划（城市地标图标）；高校帮扶举措（校园图标）。<br><br>**B. 主流就业渠道与岗位类型全景解析**<br>- 数据统计：国企30% / 互联网大厂25% / 考公考编45%<br>- 引用语录：“从体制内稳定到市场化高薪全覆盖”<br>- 核心术语：校园招聘 / 社会招聘 / 定向选调<br>- 风格偏好：务实、清晰、职业规划导向<br>- 排版偏好：3卡片并列 + 比例醒目标注<br>- 其他要求：突出标签：人气就业渠道代表作<br>- 表格下方三个子项卡片（带公文包图标）：体制内优选：公务员与事业单位招考；市场化高薪：互联网与外企管培生；稳健发展型：国企与央企校园招聘。<br><br>**C. 求职核心技能与软实力跨界提升**<br>- 数据统计：★掌握数据分析技能的应届生起薪平均高出20%<br>- 引用语录：“不止于专业知识的硬核表达”<br>- 核心术语：简历优化 / 面试技巧 / 职场沟通<br>- 风格偏好：实战场景、能力提升、干货分享<br>- 排版偏好：图文双区 + 路线箭头<br>- 其他要求：加入模拟面试与无领导小组讨论小图示<br>- 表格下方两个子项标签（带图标）：核心硬技能提升（电脑代码图标）；职场软实力应用（握手沟通图标）。<br><br>**D. 求职避坑指南与劳动权益保护**<br>- 数据统计：✓警惕黑中介 ✓拒交培训费 ✓慎签三方协议<br>- 引用语录：“依法维权求职不踩坑”<br>- 核心术语：试用期规定 / 五险一金 / 违约金<br>- 风格偏好：实用导向、清晰决策、避坑提示<br>- 排版偏好：3步骤建议 + 对勾提示<br>- 其他要求：强调合同合规性与个人权益保护<br>- 表格下方三个子项标签（带图标）：黑中介防范技巧（盾牌图标）；试用期避坑技巧（合同图标）；三方协议签约技巧（印章图标）。<br><br>左侧边栏包含“就业小贴士”框，内含三点：★国家：实施“百万就业见习岗位募集计划”，助力毕业生积累经验；★地方：多地出台“人才新政”，提供租房补贴与落户便利；★高校：开展“宏志助航计划”，强化困难群体毕业生就业帮扶。上方有“青春逢盛世 奋斗正当时”的标语，配火箭图案。<br><br>右侧边栏竖向排列多个求职主题物品的手绘示意图，并标注名称：个人简历；面试正装；录用Offer；三方协议；职场工牌。<br><br>右下角有一个蓝色边框的“求职三要点”框：✓ 简历与岗位匹配；✓ 面试表现与礼仪；✓ 薪资福利与发展潜力。<br><br>底部横幅文字：“青春之约，因奋斗而闪耀。让每一份Offer，都承载未来的无限可能。”，配有星星与对勾装饰。<br><br>整体信息图通过结构性表格、图文结合、政策背景补充和视觉化元素，系统性地展示了大学生就业的形势深度、主流渠道表现形式及求职指导，兼具知识性、指导性和实用性。</div></details></td>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">这是一张以漫画风格设计的中文信息图，主题为“拒绝恋爱脑：大学生健康恋爱通关指南”。整体采用高饱和度的漫画波普色彩（红、黄、蓝、黑为主），结合速度线、爆炸贴、漫画分镜框等元素。在排版与结构上，摒弃了传统的线性流程，采用了“左右对称卡片 + 中心金字塔 + 底部漫画分镜”的全新复合式布局，视觉重心更集中，层次感更丰富。<br><br>顶部标题区：漫画速度线背景。主标题位于顶部中央，采用红黑撞色的立体漫画字体：“拒绝恋爱脑：大学生健康恋爱通关指南”，背景带有强烈的黑色放射状速度线，凸显冲击力。副标题位于主标题下方，悬浮在一个黄色爆炸框中，内有黑色加粗文字：“打怪升级不迷路，谈一场高质量的校园恋爱！”<br><br>左侧区域：恋爱雷区排雷（纵向卡片布局）。该区域以暗红色调为主，采用“扫雷游戏”界面风格，纵向排列3个带有“💣”和红色大叉的漫画炸弹卡片，警示感极强。区块标题：“💣 避雷区：这些操作直接Game Over”。<br>卡片1：【无底线讨好】插图：卑微送花、黑眼圈极重的Q版小人。说明：“丧失自我，沦为‘舔狗’，感动自己却感动不了对方。”<br>卡片2：【查岗式控制】插图：拿着放大镜查手机、带有锁链元素的卡通手。说明：“夺命连环Call，翻看手机，窒息的爱只会把人推远。”<br>卡片3：【冷暴力处理】插图：被冰冻住的对话气泡和静音符号。说明：“拒绝沟通，玩失踪，用沉默惩罚对方是感情头号杀手。”<br><br>中心区域：健康恋爱金字塔（阶梯式核心布局）。该区域位于画面正中央，以蓝黄色调为主，采用三层阶梯金字塔结构，自下而上递进，象征感情的稳固与升华。区块标题：“🏆 核心玩法：恋爱进阶金字塔”。<br>底层基石：【自我独立】（蓝色宽大基座）。核心法则：“先爱己，再爱人。”说明：“保持自己的社交圈、学业与兴趣爱好不脱节，不做依附的藤蔓。”配发光的书本与盾牌图标。<br>中层桥梁：【双向奔赴】（黄色中层台阶）。核心法则：“情绪价值互换。”说明：“有效沟通，遇事一起扛，拒绝单方面‘扶贫’或‘吸血’。”配双向箭头与握手图标。<br>顶层目标：【共同成长】（红色尖顶发光）。核心法则：“1+1&gt;2的化学反应。”说明：“互相督促考研/拿奖/实习，在顶峰相见，成为更好的人。”配上升曲线与奖杯图标。<br><br>右侧区域：恋爱Buff加持（纵向卡片布局）。该区域以清新绿色调为主，采用“游戏装备栏”风格，纵向排列3个带有“✨”和绿色加号的魔法能量卡片，与左侧雷区形成鲜明对比。区块标题：“✨ 加Buff：让感情升温的神仙操作”。<br>卡片1：【边界感清晰】插图：虚线栅栏保护着一颗爱心。说明：“尊重对方隐私与独处时间，亲密有间才是长久之道。”<br>卡片2：【仪式感制造】插图：带有日历标记的精美礼物盒。说明：“不一定要贵，但一定要用心。记住纪念日，偶尔准备小惊喜。”<br>卡片3：【情绪稳定器】插图：贴着创可贴的温暖笑脸。说明：“遇到分歧先处理情绪，再处理问题，做彼此的避风港。”<br><br>底部区域：恋爱分镜剧场（横向漫画分镜布局）。底部打破常规横幅，采用三个黑白线稿+局部高光的漫画分镜框横向排列，通过场景对比直击痛点，最后以金句收尾。<br>分镜1（错误示范 - 红色大叉）：画面为女生生气流泪，男生戴着耳机背对冷战。旁白气泡：“冷处理 = 火上浇油！”<br>分镜2（正确示范 - 绿色大勾）：画面为女生委屈，男生递上奶茶并耐心倾听，头顶有爱心冒出。旁白气泡：“先共情情绪，后解决问题！”<br>分镜3（终极金句 - 贯穿横幅）：画面为一对情侣背影，共同指向远方的星空与未来。底部拉出一条贯穿的红色粗体横幅：“好的爱情，不是互相凝视，而是望向同一个方向！❤️”<br><br>整体排版与视觉总结：布局创新，从传统的“线性流程图”转变为“左右对比+中心聚焦+底部剧场”的模块化拼图布局，视觉引导从两侧向中心汇聚，最后落幅于底部的故事感分镜。视觉语言大量使用漫画分镜框、游戏UI元素（炸弹、Buff、金字塔）、高对比度色彩，极具Z世代年轻人的审美偏好。信息传达清晰直观，强调健康恋爱中的避雷意识、自我独立、双向奔赴、共同成长、边界感、仪式感与情绪稳定。</div></details></td>
</tr>
</table>


<table width="100%" style="table-layout: fixed; text-align: center;">
<tr>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
</tr>
<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/16d444b7-f202-4708-9e56-360c7bd94250" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/42d8db3a-ab4f-44b7-8c87-748d3e095ed0" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/44f57f7d-d409-408c-8502-93234b1f68b3" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/a20d00c9-9cfa-4281-92f1-7e3483f5e1e0" width="100%"></td>
</tr>
<tr>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">该信息图题为《交通运输行业的发展与管理工作全景解析》，副标题为“系统梳理行业发展历程、核心成效、管理重点与未来方向”。整体采用竖向三段式结构，配色以粉、绿、紫为主，风格卡通可爱，点缀心形、星星和云朵等装饰元素，营造温馨活泼的视觉氛围。各部分通过箭头连接，体现从现状到管理再到未来的逻辑递进关系。<br><br>第一部分标题为“发展成效：建成全球规模最大的综合交通网络”，背景为粉色，顶部有金色星星图标。此部分强调数十年建设实现了从“瓶颈制约”到“基本适应”再到“适度超前”的历史性跨越。包含三个主要数据模块：<br><br>- **总里程超600万公里**：配地球图标，文字说明“截至2023年底，全国综合交通网络总里程超600万公里”，下方配有蜿蜒山路插画。<br>- **三项运营里程世界第一**：配奖杯图标，列出“高速铁路、高速公路、城市轨道交通运营里程均居世界第一”，并配有高铁卡通形象。<br>- **智能化渗透率年增12%**：配上升柱状图图标，说明“自动驾驶、智慧港口、智慧物流等新业态快速落地”。<br><br>底部补充统计：“2023年客运量超110亿人次 / 货运量超500亿吨”，配有乘客和货物图标。<br><br>第二部分标题为“行业管理四大核心方向”，背景为浅绿色，顶部有星形装饰。副标题为“聚焦行业可持续发展与民生服务需求，构建现代化治理体系”。分为四个模块，每个模块均有图标和卡通车辆插画：<br><br>- **安全监管**（盾牌图标）：内容包括“隐患排查 + 动态监控 + 应急处置”，以及“重点营运车辆动态监控覆盖率100%”，配有警车卡通形象。<br>- **绿色转型**（叶子图标）：内容包括“落实‘双碳’要求”，“2023年新增新能源城市公交占比超90%”，配有绿色公交车卡通形象。<br>- **市场规范**（剪贴板图标）：内容包括“整治货运/网约车/省际客运违规经营”，“投诉办结率98%以上”，配有蓝色货车卡通形象。<br>- **城乡均等**（乡村小路图标）：内容包括“推进‘四好农村路’建设”，“具备条件建制村全部通硬化路、通客车”，配有黄色小型客车卡通形象。<br><br>第三部分标题为“未来方向：加快建设交通强国”，背景为淡紫色，顶部有卫星和星星图标。副标题为“到2035年基本建成‘人民满意、保障有力、世界前列’的交通强国”。分为三个子方向，分别用A、B、C标识：<br><br>- **A 智慧交通升级**：配电脑屏幕和卫星图标，内容包括“推进国家综合交通运输信息平台建设”，“到2027年干线公路、重点港口、枢纽场站全要素数字化感知覆盖率达80%”。<br>- **B 绿色低碳发展**：配风力发电机和太阳能板图标，内容包括“到2030年单位换算周转量碳排放强度较2020年下降约9.5%”，配有绿色新能源车卡通形象。<br>- **C 产业融合创新**：配行李箱、相机和物流箱图标，内容包括“推动交通与旅游、物流、先进制造深度融合”，“培育‘交旅融合’‘通道经济’等增长点”，配有飞机、轮船、集装箱等小图标。<br><br>底部设有图例说明：<br>- 粉色三角形代表“基础现状（发展成效与现况成果）”<br>- 绿色矩形代表“落地举措（管理方向与实施重点）”<br>- 紫色三角形代表“长期规划（面向未来的发展目标）”<br><br>整张信息图通过清晰的分区、丰富的卡通插画和明确的数据呈现，全面展示了中国交通运输行业的成就、管理策略和未来愿景。</div></details></td>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">该信息图题为“甘肃省各地人民法院执行裁定书摘要速览”，副标题说明“甘肃省各级法院出具的执行裁定书均遵循统一法定格式”。整体布局清晰，采用三段式横向结构，分为上、中、下三个主要区域，并配有右侧图例说明，以蓝色、绿色和橙色区分不同内容模块。设计风格简洁现代，使用圆角矩形卡片、图标和颜色编码进行视觉引导，便于快速理解。<br><br>**第一部分：执行裁定书核心构成要素（蓝色主题）**<br>此部分位于信息图顶部，由三个并列的蓝色边框卡片组成，分别对应执行裁定书的三大组成部分：<br>1. **首部**（图标：文件）：包含“法院名称/文号/当事人信息/执行背景”。<br>2. **正文**（图标：三行文本）：包含“申请请求/事实/理由/依据/裁定主文”。<br>3. **尾部**（图标：人形签名）：包含“署名/日期/公章/救济途径”。<br><br>**第二部分：甘肃省常见执行裁定案件类型（绿色主题）**<br>此部分位于中部，由五个绿色边框卡片横向排列，展示案件类型及其占比数据，每个卡片包含编号、类别名称、百分比、图标和简要说明：<br>1. **金融借贷类 42%**（图标：银行）：金融机构申请执行借款人及担保财产。<br>2. **买卖合同类 28%**（图标：握手）：中小微企业追讨货款。<br>3. **劳务报酬类 15%**（图标：工人头盔）：务工人员追讨欠薪。<br>4. **不动产处置类 8%**（图标：房屋）：房屋买卖与土地使用权处置。<br>5. **其他类型 7%**（图标：汽车）：机动车处置与侵权赔偿等。<br><br>**第三部分：执行相关权利义务与救济途径（橙色主题）**<br>此部分位于底部，由三个橙色边框卡片横向排列，说明执行过程中的关键程序与权利：<br>1. **按期履行义务提示**（图标：日历带勾选）：逾期可采取查封/冻结/扣划/失信惩戒。<br>2. **不服裁定复议通道**（图标：天平）：送达之日起10日内向上一级法院申请复议。<br>3. **案外人异议申请通道**（图标：文件带感叹号）：执行程序终结前向执行法院提交书面异议。<br><br>**右侧图例说明**<br>一个虚线框内包含三个条目，解释各颜色区块含义：<br>- 蓝色方块：一、执行裁定书核心构成要素<br>- 绿色方块：二、甘肃省内常见执行裁定案件类型<br>- 橙色方块：三、执行相关权利义务与救济途径<br><br>**底部信息栏**<br>底部横线分隔出三个信息点，分别用图标标识：<br>- 文件图标：信息源：公开裁定文书整理<br>- 日历图标：统计区间：2021–2023年<br>- 放大镜图标：关键词：执行裁定 / 复议 / 异议 / 查封 / 冻结 / 扣划<br><br>整张信息图通过结构化布局、色彩编码和图标辅助，系统呈现了甘肃省法院执行裁定书的标准化格式、高频案件类型及法律救济路径，适用于公众、法律从业者或研究人员快速掌握执行程序要点。所有文本均为中文，符合题目要求。</div></details></td>
</tr>
</table>


### Background Stability

<table width="100%" style="table-layout: fixed; text-align: center;">
<tr>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic</th>
<th width="25%" align="center">SenseNova-U1-8B-MoT-Infographic-V2</th>
</tr>
<tr>
<td valign="top"><img src="https://github.com/user-attachments/assets/09734165-a72e-4220-9ba5-a8dfb865fb36" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/911a760a-11b6-4dde-a3f5-9034ebf66140" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/0adb02cc-7637-45e5-aaa1-30660c5c5771" width="100%"></td>
<td valign="top"><img src="https://github.com/user-attachments/assets/6c4845a8-f3d4-4c7a-ba79-ce3be6e3ee95" width="100%"></td>
</tr>
<tr>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">The infographic is titled "Car Launch Purchase Campaign Overview" with the subtitle "Roewe Summer Refresh Car Purchase Season: Promotion Policies & New Product Guide." It uses a bridge-over-canyon metaphor to help users cross the confusion of purchase decision-making. The center contains a dark rocky canyon with question mark, calculator, coin, and checklist icons; both sides are white platforms connected by a suspension bridge showing three purchase plans. The style is modern and clean, with a blue-white-gray palette plus orange and green accents.<br><br>The left platform introduces three new car models covering family, commuting, and outdoor use cases; the center bridge compares full-payment purchase, 24-month zero-interest loan, and 60-month low-interest loan plans; the right platform presents five purchase gifts, including cash discounts, trade-in benefits, after-sales service, and in-store gifts. The lower-right block includes campaign rules such as dates, scope, and special notes.</div></details></td>
<td colspan="2" valign="top"><details><summary><b>Prompt</b></summary><div style="text-align: left; max-height: 200px; overflow-y: auto; font-size: 0.85em; font-weight: normal; font-style: normal;">Create an image of a heatmap chart. Top title is "Shopping Mall Visitor Traffic by Hour" with italic subtitle "Weekend afternoons drive the highest footfall; weekday mornings remain quiet." Top right legend says "Visitors per hour" over a blue-to-red gradient bar, labeled "Low" (&lt;700), "Medium" (1,500), "High" (3,500+).<br><br>Left Y-axis is "Weekday" (rotated) with Mon, Tue, Wed, Thu, Fri, Sat, Sun. Top X-axis is 9 AM, 11 AM, 1 PM, 3 PM, 5 PM, 7 PM, 9 PM. Bottom X-axis label is "Hour of Day".<br><br>Grid values by row:<br>Mon: 420, 520, 820, 1,120, 1,480, 1,320, 680.<br>Tue: 480, 580, 880, 1,160, 1,520, 1,380, 540.<br>Wed: 500, 620, 1,180, 1,560, 1,880, 1,620, 720.<br>Thu: 460, 560, 980, 1,360, 1,740, 1,520, 660.<br>Fri: 600, 780, 1,260, 1,860, 2,240, 1,900, 820.<br>Sat: 1,080, 1,520, 2,480, 3,860, 3,620, 2,680, 1,320.<br>Sun: 940, 1,360, 2,180, 3,420, 3,100, 2,420, 1,180.<br>Cell colors range from light blue (low) to red (high).<br><br>Callouts: A blue line connects Mon/Tue 9 AM to text "Low: weekday mornings before stores fully open". A red line connects Sat 5 PM to text "Peak: Saturday 3-5 PM, family shopping and dining".<br><br>Bottom summary card has a bar chart icon and "Quick summary". It contains three sections: "Busiest window: Sat 3-5 PM", "Quietest window: Mon-Thu 9-11 AM", and "Planning use: staffing and cleaning rotations".</div></details></td>
</tr>
</table>

## 🛠️ Quick Start
### 🌐 Use with SenseNova-Studio

The fastest way to experience SenseNova-U1 is through **[SenseNova-Studio](https://unify.light-ai.top/)** — a 🆓 free online playground where you can try the model directly in your browser, no installation or GPU required.

> **Note:** To serve more users, U1-Fast has undergone step and CFG distillation, and is dedicated to infographic generation.


### 🦞 Use with SenseNova-Skills (OpenClaw)

The easiest way to integrate SenseNova-U1 into your own agent or application is through our companion repository **[SenseNova-Skills (OpenClaw) 🦞](https://github.com/OpenSenseNova/SenseNova-Skills)**, which ships SenseNova-U1 as a ready-to-use skill with a unified tool-calling interface.

> Refer to the [SenseNova-Skills README](https://github.com/OpenSenseNova/SenseNova-Skills) for installation and usage details.

<details open>
<summary>✨ Click to collapse and view interesting cases made through Skills and Studio</summary>

<p align="center">
  <img src="docs/assets/showcases/t2i_infographic/u1-case2.webp" alt="Skill Cases">
</p>

</details>

### 🤗 Run with transformers (Default)

> **Setup:** Follow the [Installation Guide](./docs/installation.md) to clone the repo and install dependencies with [uv](https://github.com/astral-sh/uv).

**🌟 Generate High-Quality Infographics**

For generating complex infographics, we highly recommend using the following parameters: `--cfg_scale 4.0`, `--timestep_shift 3.0`, and `--num_steps 50`.

```bash
python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1-8B-MoT-Infographic-V2 \
  --prompt "该信息图以复古漫画/动漫风格为主题设计，整体背景为深蓝色星空背景（带有颗粒质感），由多个带有技术网格线和星座线图案装饰的模块围绕中心主题呈海报式上下左右分布布局。中心是一个由两位角色与驾驶舱构成的主体视觉区域，内部包含主标题“SENSETIME”（带星星装饰的黄色大号粗体字），副标题“2026 走向未来！”（蓝色文字），下方有左上角信息框和文字“任务编号：K-2026-ALPHA | 发布日期：2026.06.27 | 保密等级：公开”。中心上方有散落的黄色星星与星座线图案装饰。 信息图共分为六个主要部分，编号1至6，分布在中心周围： **1. 顶部区域（标题与信息框模块）** - **主标题**（黄色大号粗体字带星星装饰）：“SENSETIME”。 - **副标题**（蓝色文字）：“2026 走向未来！”。 - **左上角信息框**（信息标签）：包含“任务编号：K-2026-ALPHA”、“发布日期：2026.06.27”、“保密等级：公开”。 **2. 中心主视觉（角色与装备展示模块）** 以三位角色及驾驶舱按顺序排列，标签连接： - **左侧男性角色**（戴护目镜、红围巾、弹药带，手持武器，帅气姿态动作）：标签文字“左轮手枪”（指向枪套），描述文字“标准配备｜口径：.45｜弹容量：6发｜重量：1.1kg”。 - **中心女性角色**（戴护目镜、红围巾、条纹衫，弹奏白色空心电吉他，吉他上有“KATAO”字样，优美姿态）：标签文字“格雷奇”（指向角色），描述文字“装备型号：G-77电吉他｜频率范围：80Hz-12kHz｜输出功率：50W”。 - **背景右侧角色**（驾驶舱内两名角色，女性调整护目镜，男性戴护目镜看前方）：驾驶舱标签“驾驶舱控制面板｜导航系统：GPS-2025｜通讯频道：CH-77”。 **3. 左侧边栏（任务简报模块）** 包含一段说明文字：“任务简报” 下方配有五项核心指标列表： - 目标：探索未知领域 - 时间：2025年启动 - 地点：黑空 - 队员：精英组 - 装备：未来科技武装 **4. 右侧边栏（成员档案模块）** 包含一段说明文字：“探险队成员档案” 下方配有五名成员及技能列表： - 队长：经验丰富的领航员 - 副队长：技术专家 - 成员A：武器专家 - 成员B：通讯专员 - 特殊技能：时空导航、能量操控、战术分析 **5. 右下角区域（批次规格模块）** 包含一个金色警长星徽图案，内文：“活力 编号01 未来”。 - **大标题**（醒目文字）：“ETB-77”。 - **描述文字**：“这是将分配给未来探险任务的批次。” - **详细信息框**（下方数据框）：“批次规格｜成员数量：2人｜任务时长：365天｜装备清单：完整｜能源补给：充足｜目标区域：未定”。 **6. 底部横幅与背景装饰（标语与元素模块）** 包含一段说明文字：“KATAO探险队｜连接过去与未来｜探索无限可能｜官方网站：www.SENSETIME.com｜联系我们：SENSETIME” 下方配有背景元素装饰：散落的黄色星星、星座线图案、技术网格线装饰。 整体视觉风格复古、结构清晰，通过鲜艳色彩与颗粒质感增强视觉冲击力和未来感，强调在未来探险任务中遵循精英组队、装备未来科技武装，并通过时空导航与能量操控达成探索无限可能的目标。所有文本均为中文（保留特定英文标识），语言简洁硬核，适合用于科幻探险主题的复古漫画风格海报宣传场景。" \
  --width 2720 --height 1536 \
  --cfg_scale 4.0 --cfg_norm none --timestep_shift 3.0 --num_steps 50 \
  --output output.png --profile
```

> Default resolution is 2048×2048 (1:1). See [supported resolution buckets](https://github.com/OpenSenseNova/SenseNova-U1/blob/main/examples/README.md#supported-resolution-buckets) for other aspect ratios.

> For high-quality infographic generation, it is recommended to apply [prompt enhancement](./docs/prompt_enhancement.md) before generating images.

### 💾 Memory-efficient inference (GGUF + VRAM modes)

For users running on a single consumer GPU, two complementary features lower the VRAM footprint of the `transformers` path. They can be combined freely.

#### `--vram_mode`: single-GPU layer offload

Pass `--vram_mode` to keep the language-model layers resident on CPU pinned memory and stream them onto the GPU on-demand during forward, freeing weight VRAM while keeping activations on-device.

| Mode | Behavior | When to use |
| :--- | :--- | :--- |
| `full` *(default)* | No offload; whole model on GPU | Plenty of VRAM, best speed |
| `low` | Synchronous per-layer CPU↔GPU swap | Lowest VRAM footprint |
| `balanced` | Async prefetch overlaps H2D copy with compute | Tight on VRAM but want to recover speed |

```bash
python examples/t2i/inference.py \
  --model_path sensenova/SenseNova-U1-8B-MoT-Infographic-V2 \
  --vram_mode balanced \
  --prompt "..." --output output.png
```

`--gguf_checkpoint` and `--vram_mode` compose: a Q4 GGUF + `balanced` is the recommended setup for ~10–12 GB consumer cards.


### ⚡ Run with LightLLM + LightX2V (Recommended)

For production serving, we co-design a dedicated inference stack on top of **[LightLLM](https://github.com/ModelTC/lightllm)** (understanding) and **[LightX2V](https://github.com/ModelTC/lightx2v)** (generation). The two engines are disaggregated so that each path can use its own parallelism and resource budget, with a low-overhead transfer channel in between.

On a single node with `TP2 + CFG2`, this stack delivers roughly **~0.15 s/step** and **~9 s end-to-end** for a **2048×2048** image on H100 / H200, with a ~**2.4–3.2×** prefill speedup from our FA3-based hybrid-mask attention over the Triton baseline. Full per-GPU performance are reported in [`docs/inference_infra.md`](./docs/inference_infra.md).

An official docker image is provided for one-command deployment:

```bash
docker pull lightx2v/lightllm_lightx2v:20260407
```

> ⚙️ **Deployment guide (Docker, launch flags, modes, quantization, API test):** see [`docs/deployment.md`](./docs/deployment.md).
>
> 📖 **Full design and performance profiling:** see [`docs/inference_infra.md`](./docs/inference_infra.md).

<!-- ## 🖊️ Citation

```bibtex

``` -->

## 🌐 Join the Community!

Join our growing community to share feedback, get support, and stay updated on the latest SenseNova-U1 developments — we'd love to hear from you!

<div align="center">
<table>
  <tr>
    <td align="center"><b><a href="https://discord.com/invite/BuTXPHmQub">Discord</a></b></td>
    <td align="center"><b>WeChat Group</b></td>
  </tr>
  <tr>
    <td align="center"><a href="https://discord.com/invite/BuTXPHmQub"><img src="docs/assets/discord_qr.webp" width="160"/></a></td>
    <td align="center"><img src="docs/assets/wechat_qr.webp" width="160"/></td>
  </tr>
</table>
</div>

## ⚖️ License

This project is released under the [Apache 2.0 License](./LICENSE).
