LLaDA-Image – 60亿参数统一图像生成与编辑模型

LLaDA-Image是由inclusionAI团队推出并完全开源的6B参数统一图像生成与编辑模型家族。”训练配方全公开”——不只放出模型权重,还完整披露了从图像预训练、中期训练到语言监督对齐、生成编辑联合训练的每个阶段,这在图像生成领域极为罕见。模型家族包含两个版本:Base版采用50步采样,主打高保真文生图与指令引导编辑;Turbo版经过蒸馏只需4步即可完成生成,面向速度敏感场景。两者共用同一套架构,单个checkpoint同时承担生成与编辑任务,无需额外的编辑专用网络。在Qwen-Image-Bench评测中,该模型取得了英文53.53、中文53.38的整体成绩,达到当前最优水平。

LLaDA-Image - 60亿参数统一图像生成与编辑模型

LLaDA-Image特点

  • 生成与编辑统一:一个模型权重同时支持文生图和参考图编辑,切换仅需改变generation_mode参数。
  • 纯扩散架构:主干网络和DiT均为扩散模型,在统一框架下联合训练,不存在生成与编辑两套骨干。
  • 写实质感突出:输出图像在自然光照、毛发纹理等细节表现和场景构图一致性上接近真实摄影。
  • 中英文文字渲染:支持在图像中直接生成中英文文字,可用于海报、封面等需要文字排版的创作。
  • 权重多格式提供:BF16与FP8两种精度版本同步上线Hugging Face和ModelScope,低显存设备可选FP8。
  • 生态适配:社区已推出ComfyUI工作流节点,可直接接入现有创作管线。

LLaDA-Image技术原理

训练分三步推进。第一步是纯图像预训练与中期训练,让模型先建立扎实的视觉先验,理解光影、结构、材质等基础规律,此阶段不引入任何文本。第二步加入图文配对数据进行语言监督,让模型学会将自然语言描述映射到视觉概念。第三步进行生成与编辑联合训练,使单一模型掌握两种任务模式。

推理阶段提供三种模式:

  • text模式:标准文生图,输入提示词直接生成。
  • vq模式:由LLaDA2模型先将提示词转成图像VQ token,经SigVQ嵌入后再交给扩散模型精修,该模式下不提供输入图像。
  • editing模式:加载参考图像,按文字指令做保留原内容的定向修改。

Turbo版使用Twin-DMD蒸馏技术,将50步采样压缩到2-4步,采样配置中stochastic_sampling设为false时细节表现会更锐利。

LLaDA-Image项目地址

  • GitHub仓库:https://github.com/inclusionAI/LLaDA-Image

LLaDA-Image功能

  • 高质量文生图,输出1024×1024等分辨率的写实或风格化图像
  • 指令引导图像编辑,保留原图内容的同时完成风格转换、元素替换等修改
  • VQ条件生成,适合需要更强结构控制的场景
  • 图像内中英文文字渲染,直接产出带标语、标题的海报
  • 支持负向提示词控制,排除不想要的画面元素

LLaDA-Image应用场景

  • 设计与广告:海报、Banner、社交媒体配图的快速产出,中英文标题一次生成,省去后期排版。
  • 电商产品图:以实拍图为参考,通过编辑模式批量更换背景、调整光线,保持产品主体不变。
  • 影视概念图:写实光照和景深表现适合前期分镜与场景概念设计。
  • 内容创作:Turbo版4步出图的速度可满足直播、互动应用等实时性要求较高的场合。
  • 二次开发:训练配方完整公开,研究团队可在此基础上复现实验、做领域微调,而非只能黑盒调用。

LLaDA-Image使用教程

环境准备

官方验证环境为Python 3.11、PyTorch 2.8、Transformers 4.57.6、Diffusers 0.39.0。

bash

1git clone https://github.com/inclusionAI/LLaDA-Image.git
2cd LLaDA-Image
3conda create -n llada-image python=3.11 -y
4conda activate llada-image
5pip install -r requirements.txt

Base版文生图(50步)

python

1import torch
2from src import LLaDAImagePipeline
3
4pipe = LLaDAImagePipeline.from_pretrained(
5    "inclusionAI/LLaDA-Image",
6    torch_dtype=torch.bfloat16,
7    device="cuda",
8)
9
10image = pipe(
11    prompt="A cinematic photograph of a red fox standing in fresh snow, "
12           "soft winter light, detailed fur, shallow depth of field",
13    negative_prompt="",
14    generation_mode="text",
15    height=1024, width=1024,
16    num_inference_steps=50,
17    guidance_scale=5.0,
18    generator=torch.Generator("cuda").manual_seed(42),
19).images[0]
20
21image.save("output.png")

首次运行会自动从Hugging Face拉取权重。

Turbo版快速生成(4步)

python

1pipe = LLaDAImagePipeline.from_pretrained(
2    "inclusionAI/LLaDA-Image-Turbo",
3    torch_dtype=torch.bfloat16,
4    device="cuda",
5)
6
7image = pipe(
8    prompt="A quiet observatory above a sea of clouds at sunrise",
9    generation_mode="text",
10    height=1024, width=1024,
11    num_inference_steps=4,
12    guidance_scale=1.0,
13).images[0]

少步推理时guidance_scale建议设为1.0。

图像编辑

python

1from diffusers.utils import load_image
2
3reference_image = load_image("/path/to/input.png")
4
5image = pipe(
6    prompt="Turn it into a watercolor painting",
7    image=reference_image,
8    generation_mode="editing",
9    height=1024, width=1024,
10    num_inference_steps=50,
11    guidance_scale=5.0,
12).images[0]

参数约束

text和vq模式要求高宽能被16整除,editing模式要求能被32整除。vq模式下不要传入image参数。

开源进度

推理代码与模型权重已发布,训练代码标注为”即将上线”。国内用户可从ModelScope下载同版本权重,规避Hugging Face访问问题。

© 版权声明
为这篇文章评分
0.0/ 10
0 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...