FLUX GGUF 和 safetensors / checkpoint 有什么区别?8GB 显卡为什么优先用 GGUF
先说结论
新手最容易犯的错:把 GGUF 当成普通 checkpoint 扔进 models/checkpoints/,然后用 Load Checkpoint 去找。 找不到,就以为模型坏了。
事实是:GGUF 不是普通 checkpoint。在 FLUX GGUF 工作流里,UNet 用 GGUF 格式,T5、CLIP、VAE 仍然是单独的 safetensors 文件。各文件有各自的目录、各自的加载节点。
这是我在 RTX 4060 Laptop 8GB + FLUX GGUF Q6_K + T5 FP8 上的实测记录,不是官方文档。
这篇文章适合谁
- 不知道 GGUF 和 safetensors 有什么区别
- 把 GGUF 放进
checkpoints/后在 ComfyUI 里找不到 - 不知道为什么 FLUX 工作流里要同时有
.gguf和.safetensors文件 - 想知道 Q4、Q5、Q6 到底是什么意思
- 8GB 显卡想跑 FLUX,不知道该下载哪些模型文件
我的测试环境
| 项目 | 配置 |
|---|---|
| GPU | NVIDIA GeForce RTX 4060 Laptop GPU |
| 专用显存 | 8GB |
| 系统内存 | 32GB |
| ComfyUI | 0.24.0 |
| UNet | flux1-dev-Q6_K.gguf |
| Text Encoder | t5xxl_fp8_e4m3fn_scaled.safetensors + clip_l.safetensors |
| VAE | ae.safetensors |
| 默认采样 | 1024x1024, batch 1, CFG 1.0, euler, simple |
safetensors / checkpoint 是什么?别用 SD 经验硬套
很多 SD 1.5 或 SDXL 工作流里,一个 checkpoint 文件(.safetensors 或 .ckpt)可能包含模型主体,用 Load Checkpoint 节点一键加载。
但 FLUX GGUF 工作流不是这种方式。FLUX 的几个关键部分——UNet、文本编码器、VAE——是分开存放、分别加载的。不要把 SD 的习惯直接搬过来。
简单记:
- 普通 checkpoint:一个文件打包很多东西,
Load Checkpoint一次加载。 - FLUX GGUF 方案:UNet 是 GGUF 文件,T5 和 CLIP 是单独的 safetensors 文件,VAE 也是单独的。各自用对应节点加载。
GGUF 是什么
GGUF 可以理解成一种更适合量化模型保存和加载的格式。它把模型参数按特定精度存储,减少体积和加载时的资源占用。
在本站测试方案里,flux1-dev-Q6_K.gguf 是 FLUX 的 UNet 部分。它不是完整的一键 checkpoint——它只管扩散模型的采样过程。
关键: GGUF 文件通常放 models/unet/,不是 models/checkpoints/。放错目录,ComfyUI 的 Unet Loader (GGUF) 看不到它。
为什么 8GB 显卡更常用 GGUF
原版 FLUX 的 UNet 用 FP16 精度时,文件体积和显存占用对 8GB 显卡很不友好。通常会依赖 offload 机制在 CPU 内存和 GPU 显存之间搬数据,速度和稳定性都不好保证。
GGUF 量化后:
- 文件体积更小
- 加载和运行时显存压力更低
- 更适合 8GB 这种低显存机器
但量化不等于没有代价。不同量化级别(Q4/Q5/Q6)在细节、速度、稳定性上可能有差异。具体差异需要实测,本文不写没测过的结论。
Q4、Q5、Q6 是什么意思
量化级别越高(Q6 > Q5 > Q4),模型精度保留越多,但体积和显存压力也越大。
| 量化级别 | 大致特点 | 本站测试状态 |
|---|---|---|
| Q4_K_M | 体积最小,显存压力最低 | 后续待测,暂无本站实测数据 |
| Q5_K_M | 中间档,体积和精度折中 | 后续待测,暂无本站实测数据 |
| Q6_K | 体积较大,本站目前主要实测这个 | 已实测,当前默认方案 |
本站目前 Q6_K 实测最多,Q4 和 Q5 还没有完整的同 prompt 对比。 不要因为 Q4 体积更小就直接认为它”更好”或”更差”——需要跑了才知道。
详见:ComfyUI FLUX GGUF Q4_K_M、Q5_K_M、Q6_K 怎么选?
FLUX GGUF 工作流里各文件分别负责什么
| 文件 | 放置目录 | 作用 | 加载节点 |
|---|---|---|---|
| flux1-dev-Q6_K.gguf | models/unet/ | FLUX 扩散模型主体 | Unet Loader (GGUF) |
| t5xxl_fp8_e4m3fn_scaled.safetensors | models/text_encoders/ | T5 文本编码器 | DualCLIPLoader |
| clip_l.safetensors | models/text_encoders/ | CLIP-L 文本编码器 | DualCLIPLoader |
| ae.safetensors | models/vae/ | VAE 解码 latent 为图像 | VAELoader |
这几个文件缺一不可。 只下载 GGUF,没有 T5、CLIP、VAE,工作流会报错或无法正常出图。
为什么不是一个文件解决全部
FLUX 的架构决定了 UNet、文本编码器、VAE 是分开的模块。好处是你可以独立替换各个部分——比如换不同版本的 T5、换不同量化级别的 GGUF——而不需要重新下载整套模型。
坏处是:新手得搞清楚每个文件放哪、用哪个节点加载。这就是为什么本站写了一系列文章帮你理清。
新手最容易放错的地方
- GGUF 放到
models/checkpoints/——应该放models/unet/。 - T5 FP8 放到
models/clip/——应该放models/text_encoders/。 - 忘记下载 clip_l.safetensors——只下了 T5 和 GGUF,结果 DualCLIPLoader 缺一个输入。
- 忘记下载 VAE——KSampler 能跑,VAE Decode 报错或出图异常。
- 安装 ComfyUI-GGUF 后没重启——节点列表里看不到
Unet Loader (GGUF)。 - 用
Load Checkpoint节点找 GGUF——应该用Unet Loader (GGUF)。 - 文件名对不上——下拉菜单里模型的显示名称来自文件实际文件名,确认拼写和大小写。
Load Checkpoint 和 Unet Loader (GGUF) 的区别
| 节点 | 适合加载什么 | 本站 FLUX GGUF 方案是否使用 |
|---|---|---|
| Load Checkpoint | 普通 safetensors / ckpt checkpoint | 不作为 FLUX GGUF 主加载方式 |
| Unet Loader (GGUF) | GGUF 量化 UNet 文件 | 使用 |
| DualCLIPLoader | T5 + CLIP 文本编码器 | 使用 |
| VAELoader | VAE 模型 | 使用 |
关键: 如果你在 ComfyUI 里搜不到 Unet Loader (GGUF),说明 ComfyUI-GGUF 节点没有安装或没有正确启用。先去 ComfyUI-Manager 里安装,然后重启。
我的新手建议
按这个顺序来:
- 先确认自己要跑的是 GGUF 方案(不是原版 FP16)
- 下载四个文件:GGUF UNet、T5 FP8、CLIP-L、VAE
- GGUF 放
models/unet/ - T5 + CLIP 放
models/text_encoders/ - VAE 放
models/vae/ - 在 ComfyUI-Manager 里安装 ComfyUI-GGUF
- 重启 ComfyUI
- 用
Unet Loader (GGUF)选择 gguf 文件 - 用
DualCLIPLoader选择 T5 和 CLIP,type 选 flux - 先用 768x768 / 20 steps 测试能否出图
跑通以后再调分辨率和 steps。不要一上来就改一堆参数。
FAQ
Q: GGUF 是 checkpoint 吗?
不是同一种东西。GGUF 是一种量化模型格式,不能直接用 Load Checkpoint 加载。FLUX GGUF 工作流里用的是 Unet Loader (GGUF)。
Q: 为什么我的 Load Checkpoint 找不到 GGUF 文件?
因为 GGUF 文件不应该放 models/checkpoints/,也不应该用 Load Checkpoint 去找。把它放到 models/unet/,用 Unet Loader (GGUF) 加载。
Q: 只有 GGUF 文件能不能出图? 不能。FLUX 工作流还需要 T5 文本编码器、CLIP-L、VAE。缺任何一个都无法正常出图。
Q: Q6_K 一定比 Q4_K_M 画质好吗? 不一定。Q6 精度更高,理论上保留更多细节,但本站还没有做过同 prompt 同 seed 的 Q4/Q5/Q6 对比。不要在没有实测的情况下写结论。
Q: 8GB 显卡是不是只能用 GGUF? 不是”只能”,但在本站 RTX 4060 Laptop 8GB 上,GGUF Q6_K + T5 FP8 是目前实测可行的方案。原版 FP16 通常依赖 offload,速度和稳定性不好保证,对新手不友好。
Q: safetensors 文件是不是没用了? 有用。在 FLUX GGUF 工作流里,T5、CLIP、VAE 仍然是 safetensors 格式。GGUF 只替代了 UNet 部分,其他组件不变。
后续待测
- Q4_K_M、Q5_K_M、Q6_K 同 prompt 同 seed 的对比
- FP8 T5 和其他 T5 版本的差异
- 不同量化级别的显存占用实测
- 1024x1024 下各量化级别的出图稳定性