LLaDA-Image是由inclusionAI团队推出并完全开源的6B参数统一图像生成与编辑模型家族。”训练配方全公开”——不只放出模型权重,还完整披露了从图像预训练、中期训练到语言监督对齐、生成编辑联合训练的每个阶段,这在图像生成领域极为罕见。模型家族包含两个版本:Base版采用50步采样,主打高保真文生图与指令引导编辑;Turbo版经过蒸馏只需4步即可完成生成,面向速度敏感场景。两者共用同一套架构,单个checkpoint同时承担生成与编辑任务,无需额外的编辑专用网络。在Qwen-Image-Bench评测中,该模型取得了英文53.53、中文53.38的整体成绩,达到当前最优水平。

LLaDA-Image特点
- 生成与编辑统一:一个模型权重同时支持文生图和参考图编辑,切换仅需改变
generation_mode参数。 - 纯扩散架构:主干网络和DiT均为扩散模型,在统一框架下联合训练,不存在生成与编辑两套骨干。
- 写实质感突出:输出图像在自然光照、毛发纹理等细节表现和场景构图一致性上接近真实摄影。
- 中英文文字渲染:支持在图像中直接生成中英文文字,可用于海报、封面等需要文字排版的创作。
- 权重多格式提供:BF16与FP8两种精度版本同步上线Hugging Face和ModelScope,低显存设备可选FP8。
- 生态适配:社区已推出ComfyUI工作流节点,可直接接入现有创作管线。
LLaDA-Image技术原理
训练分三步推进。第一步是纯图像预训练与中期训练,让模型先建立扎实的视觉先验,理解光影、结构、材质等基础规律,此阶段不引入任何文本。第二步加入图文配对数据进行语言监督,让模型学会将自然语言描述映射到视觉概念。第三步进行生成与编辑联合训练,使单一模型掌握两种任务模式。
推理阶段提供三种模式:
- text模式:标准文生图,输入提示词直接生成。
- vq模式:由LLaDA2模型先将提示词转成图像VQ token,经SigVQ嵌入后再交给扩散模型精修,该模式下不提供输入图像。
- editing模式:加载参考图像,按文字指令做保留原内容的定向修改。
Turbo版使用Twin-DMD蒸馏技术,将50步采样压缩到2-4步,采样配置中stochastic_sampling设为false时细节表现会更锐利。
LLaDA-Image项目地址
- GitHub仓库:https://github.com/inclusionAI/LLaDA-Image
LLaDA-Image功能
- 高质量文生图,输出1024×1024等分辨率的写实或风格化图像
- 指令引导图像编辑,保留原图内容的同时完成风格转换、元素替换等修改
- VQ条件生成,适合需要更强结构控制的场景
- 图像内中英文文字渲染,直接产出带标语、标题的海报
- 支持负向提示词控制,排除不想要的画面元素
LLaDA-Image应用场景
- 设计与广告:海报、Banner、社交媒体配图的快速产出,中英文标题一次生成,省去后期排版。
- 电商产品图:以实拍图为参考,通过编辑模式批量更换背景、调整光线,保持产品主体不变。
- 影视概念图:写实光照和景深表现适合前期分镜与场景概念设计。
- 内容创作:Turbo版4步出图的速度可满足直播、互动应用等实时性要求较高的场合。
- 二次开发:训练配方完整公开,研究团队可在此基础上复现实验、做领域微调,而非只能黑盒调用。
LLaDA-Image使用教程
环境准备
官方验证环境为Python 3.11、PyTorch 2.8、Transformers 4.57.6、Diffusers 0.39.0。
bash
1git clone https://github.com/inclusionAI/LLaDA-Image.git
2cd LLaDA-Image
3conda create -n llada-image python=3.11 -y
4conda activate llada-image
5pip install -r requirements.txt
Base版文生图(50步)
python
1import torch
2from src import LLaDAImagePipeline
3
4pipe = LLaDAImagePipeline.from_pretrained(
5 "inclusionAI/LLaDA-Image",
6 torch_dtype=torch.bfloat16,
7 device="cuda",
8)
9
10image = pipe(
11 prompt="A cinematic photograph of a red fox standing in fresh snow, "
12 "soft winter light, detailed fur, shallow depth of field",
13 negative_prompt="",
14 generation_mode="text",
15 height=1024, width=1024,
16 num_inference_steps=50,
17 guidance_scale=5.0,
18 generator=torch.Generator("cuda").manual_seed(42),
19).images[0]
20
21image.save("output.png")
首次运行会自动从Hugging Face拉取权重。
Turbo版快速生成(4步)
python
1pipe = LLaDAImagePipeline.from_pretrained(
2 "inclusionAI/LLaDA-Image-Turbo",
3 torch_dtype=torch.bfloat16,
4 device="cuda",
5)
6
7image = pipe(
8 prompt="A quiet observatory above a sea of clouds at sunrise",
9 generation_mode="text",
10 height=1024, width=1024,
11 num_inference_steps=4,
12 guidance_scale=1.0,
13).images[0]
少步推理时guidance_scale建议设为1.0。
图像编辑
python
1from diffusers.utils import load_image
2
3reference_image = load_image("/path/to/input.png")
4
5image = pipe(
6 prompt="Turn it into a watercolor painting",
7 image=reference_image,
8 generation_mode="editing",
9 height=1024, width=1024,
10 num_inference_steps=50,
11 guidance_scale=5.0,
12).images[0]
参数约束
text和vq模式要求高宽能被16整除,editing模式要求能被32整除。vq模式下不要传入image参数。
开源进度
推理代码与模型权重已发布,训练代码标注为”即将上线”。国内用户可从ModelScope下载同版本权重,规避Hugging Face访问问题。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



