---
title: ArtAug-lora-FLUX.1dev-v1
canonical_url: "https://www.modelscope.cn/models/DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1"
md_url: "https://www.modelscope.cn/models/DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1.md"
repository: DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1
chinese_name: "ArtAug FLUX 增强 LoRA"
last_updated: 2025-03-07
license: "Apache License 2.0"
pipeline_tag: text-to-image-synthesis
tasks:
  - text-to-image-synthesis
base_model:
  - AI-ModelScope/FLUX.1-dev
base_model_relation: adapter
parameters: 325.5M
tensor_type:
  - F32
library_name:
  - pytorch
  - lora
  - safetensors
frameworks:
  - Pytorch
supports_inference: txt2img
downloads: 39143
stars: 80
tags:
  - LoRA
  - text-to-image
---

# ArtAug-lora-FLUX.1dev-v1

> ArtAug-lora-FLUX.1dev-v1 - DiffSynth-Studio 在 ModelScope 开源的模型。这是一个为 FLUX.1-dev 训练的 LoRA 模型，能够使模型生成的图像更符合人类的审美，包括但不限于：丰富的细节、唯美的光影、美学的构图、清晰的画面。本模型不需要任何触发词。

DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1 是 ModelScope 魔搭社区上的 325.5M 参数text-to-image-synthesis模型，采用 Apache License 2.0 许可，基于 AI-ModelScope/FLUX.1-dev 构建，并支持在线推理（txt2img）。

- **Repository**: DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1
- **License**: Apache License 2.0
- **Tasks**: text-to-image-synthesis
- **Parameters**: 325.5M
- **Base model**: AI-ModelScope/FLUX.1-dev
- **Online inference**: txt2img
- **Tags**: LoRA, text-to-image
- **Downloads**: 39143
- **Stars**: 80
- **Last updated**: 2025-03-07

Source: https://www.modelscope.cn/models/DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1

---

# FLUX 艺术增强 LoRA

## 简介

这是一个为 FLUX.1-dev 训练的 LoRA 模型，能够使模型生成的图像更符合人类的审美，包括但不限于：丰富的细节、唯美的光影、美学的构图、清晰的画面。本模型不需要任何触发词。

* 论文: https://arxiv.org/abs/2412.12888
* 开源代码: https://github.com/modelscope/DiffSynth-Studio
* 模型: [ModelScope](https://www.modelscope.cn/models/DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1), [HuggingFace](https://huggingface.co/ECNU-CILab/ArtAug-lora-FLUX.1dev-v1)
* 在线体验：点击右上角“一键生成”

## 训练方法

![](workflow.jpg)

ArtAug 这项研究工作受到 GPT-o1 这类依靠模型交互和自我纠正式推理的启发，我们构建了一套训练链路，旨在通过图像理解模型和图像生成模型的交互增强图像生成模型的能力。ArtAug 的训练链路包括以下几个步骤：

1. **生成理解交互**：使用图像生成模型生成一张图像之后，我们使用多模态大语言模型（Qwen2-VL-72B）分析图像内容并给出修改建议，进而重新生成一张质量更好的图像。
2. **数据生成与过滤**：交互生成需要很长的推理时间，也可能出现糟糕的画面内容，所以我们离线地生成了大批图像对，进行过滤后用于后续的训练。
3. **差分训练**：我们使用差分训练技术训练 LoRA 模型，使 LoRA 模型能够学习到增强前和增强后的图像差异，而非直接在增强后的图像数据集上训练。
4. **迭代增强**：把训练好的 LoRA 模型融合到底模中，并基于融合后的模型重复以上步骤，循环多次，直到交互算法不再能提供明显增强效果。将每次迭代产生的 LoRA 模型合并，得到本模型。

这个模型可以将 Qwen2-VL-72B 对于美学的理解融入到 FLUX.1[dev] 中，提升其生成的图像质量。

## 使用方式

本模型使用 [DiffSynth-Studio](https://github.com/modelscope/DiffSynth-Studio) 训练而来，我们推荐使用 DiffSynth-Studio 进行生成。

```shell
git clone https://github.com/modelscope/DiffSynth-Studio.git
cd DiffSynth-Studio
pip install -e .
```

```python
import torch
from diffsynth import ModelManager, FluxImagePipeline, download_customized_models

lora_path = download_customized_models(
    model_id="DiffSynth-Studio/ArtAug-lora-FLUX.1dev-v1",
    origin_file_path="merged_lora.safetensors",
    local_dir="models/lora"
)[0]
model_manager = ModelManager(torch_dtype=torch.bfloat16, device="cuda", model_id_list=["FLUX.1-dev"])
model_manager.load_lora(lora_path, lora_alpha=1.0)
pipe = FluxImagePipeline.from_model_manager(model_manager)

image = pipe(prompt="a house", seed=0)
image.save("image_artaug.jpg")
```

由于本模型使用了通用的 FLUX LoRA 格式封装，可以被大多数 LoRA 加载器加载，你可以将这个 LoRA 模型接入到你的工作流中。

## 图像样例

|FLUX.1-dev|FLUX.1-dev + ArtAug LoRA|
|-|-|
|![](gallary/image_1_base.jpg)|![](gallary/image_1_enhance.jpg)|
|![](gallary/image_2_base.jpg)|![](gallary/image_2_enhance.jpg)|
|![](gallary/image_3_base.jpg)|![](gallary/image_3_enhance.jpg)|
|![](gallary/image_4_base.jpg)|![](gallary/image_4_enhance.jpg)|
|![](gallary/image_5_base.jpg)|![](gallary/image_5_enhance.jpg)|
|![](gallary/image_6_base.jpg)|![](gallary/image_6_enhance.jpg)|
