← ComfyUI 实测笔记

FLUX GGUF 和 safetensors / checkpoint 有什么区别?8GB 显卡为什么优先用 GGUF

ComfyUIFLUXGGUFsafetensorsRTX4060beginner

先说结论

新手最容易犯的错:把 GGUF 当成普通 checkpoint 扔进 models/checkpoints/,然后用 Load Checkpoint 去找。 找不到,就以为模型坏了。

事实是:GGUF 不是普通 checkpoint。在 FLUX GGUF 工作流里,UNet 用 GGUF 格式,T5、CLIP、VAE 仍然是单独的 safetensors 文件。各文件有各自的目录、各自的加载节点。

这是我在 RTX 4060 Laptop 8GB + FLUX GGUF Q6_K + T5 FP8 上的实测记录,不是官方文档。

这篇文章适合谁

  • 不知道 GGUF 和 safetensors 有什么区别
  • 把 GGUF 放进 checkpoints/ 后在 ComfyUI 里找不到
  • 不知道为什么 FLUX 工作流里要同时有 .gguf.safetensors 文件
  • 想知道 Q4、Q5、Q6 到底是什么意思
  • 8GB 显卡想跑 FLUX,不知道该下载哪些模型文件

我的测试环境

项目配置
GPUNVIDIA GeForce RTX 4060 Laptop GPU
专用显存8GB
系统内存32GB
ComfyUI0.24.0
UNetflux1-dev-Q6_K.gguf
Text Encodert5xxl_fp8_e4m3fn_scaled.safetensors + clip_l.safetensors
VAEae.safetensors
默认采样1024x1024, batch 1, CFG 1.0, euler, simple

safetensors / checkpoint 是什么?别用 SD 经验硬套

很多 SD 1.5 或 SDXL 工作流里,一个 checkpoint 文件(.safetensors 或 .ckpt)可能包含模型主体,用 Load Checkpoint 节点一键加载。

但 FLUX GGUF 工作流不是这种方式。FLUX 的几个关键部分——UNet、文本编码器、VAE——是分开存放、分别加载的。不要把 SD 的习惯直接搬过来。

简单记:

  • 普通 checkpoint:一个文件打包很多东西,Load Checkpoint 一次加载。
  • FLUX GGUF 方案:UNet 是 GGUF 文件,T5 和 CLIP 是单独的 safetensors 文件,VAE 也是单独的。各自用对应节点加载。

GGUF 是什么

GGUF 可以理解成一种更适合量化模型保存和加载的格式。它把模型参数按特定精度存储,减少体积和加载时的资源占用。

在本站测试方案里,flux1-dev-Q6_K.gguf 是 FLUX 的 UNet 部分。它不是完整的一键 checkpoint——它只管扩散模型的采样过程。

关键: GGUF 文件通常放 models/unet/,不是 models/checkpoints/。放错目录,ComfyUI 的 Unet Loader (GGUF) 看不到它。

为什么 8GB 显卡更常用 GGUF

原版 FLUX 的 UNet 用 FP16 精度时,文件体积和显存占用对 8GB 显卡很不友好。通常会依赖 offload 机制在 CPU 内存和 GPU 显存之间搬数据,速度和稳定性都不好保证。

GGUF 量化后:

  • 文件体积更小
  • 加载和运行时显存压力更低
  • 更适合 8GB 这种低显存机器

但量化不等于没有代价。不同量化级别(Q4/Q5/Q6)在细节、速度、稳定性上可能有差异。具体差异需要实测,本文不写没测过的结论。

Q4、Q5、Q6 是什么意思

量化级别越高(Q6 > Q5 > Q4),模型精度保留越多,但体积和显存压力也越大。

量化级别大致特点本站测试状态
Q4_K_M体积最小,显存压力最低后续待测,暂无本站实测数据
Q5_K_M中间档,体积和精度折中后续待测,暂无本站实测数据
Q6_K体积较大,本站目前主要实测这个已实测,当前默认方案

本站目前 Q6_K 实测最多,Q4 和 Q5 还没有完整的同 prompt 对比。 不要因为 Q4 体积更小就直接认为它”更好”或”更差”——需要跑了才知道。

详见:ComfyUI FLUX GGUF Q4_K_M、Q5_K_M、Q6_K 怎么选?

FLUX GGUF 工作流里各文件分别负责什么

文件放置目录作用加载节点
flux1-dev-Q6_K.ggufmodels/unet/FLUX 扩散模型主体Unet Loader (GGUF)
t5xxl_fp8_e4m3fn_scaled.safetensorsmodels/text_encoders/T5 文本编码器DualCLIPLoader
clip_l.safetensorsmodels/text_encoders/CLIP-L 文本编码器DualCLIPLoader
ae.safetensorsmodels/vae/VAE 解码 latent 为图像VAELoader

这几个文件缺一不可。 只下载 GGUF,没有 T5、CLIP、VAE,工作流会报错或无法正常出图。

为什么不是一个文件解决全部

FLUX 的架构决定了 UNet、文本编码器、VAE 是分开的模块。好处是你可以独立替换各个部分——比如换不同版本的 T5、换不同量化级别的 GGUF——而不需要重新下载整套模型。

坏处是:新手得搞清楚每个文件放哪、用哪个节点加载。这就是为什么本站写了一系列文章帮你理清。

新手最容易放错的地方

  1. GGUF 放到 models/checkpoints/——应该放 models/unet/
  2. T5 FP8 放到 models/clip/——应该放 models/text_encoders/
  3. 忘记下载 clip_l.safetensors——只下了 T5 和 GGUF,结果 DualCLIPLoader 缺一个输入。
  4. 忘记下载 VAE——KSampler 能跑,VAE Decode 报错或出图异常。
  5. 安装 ComfyUI-GGUF 后没重启——节点列表里看不到 Unet Loader (GGUF)
  6. Load Checkpoint 节点找 GGUF——应该用 Unet Loader (GGUF)
  7. 文件名对不上——下拉菜单里模型的显示名称来自文件实际文件名,确认拼写和大小写。

详见:ComfyUI FLUX 模型文件放哪里?

Load Checkpoint 和 Unet Loader (GGUF) 的区别

节点适合加载什么本站 FLUX GGUF 方案是否使用
Load Checkpoint普通 safetensors / ckpt checkpoint不作为 FLUX GGUF 主加载方式
Unet Loader (GGUF)GGUF 量化 UNet 文件使用
DualCLIPLoaderT5 + CLIP 文本编码器使用
VAELoaderVAE 模型使用

关键: 如果你在 ComfyUI 里搜不到 Unet Loader (GGUF),说明 ComfyUI-GGUF 节点没有安装或没有正确启用。先去 ComfyUI-Manager 里安装,然后重启。

详见:ComfyUI-GGUF 节点怎么安装?

我的新手建议

按这个顺序来:

  1. 先确认自己要跑的是 GGUF 方案(不是原版 FP16)
  2. 下载四个文件:GGUF UNet、T5 FP8、CLIP-L、VAE
  3. GGUF 放 models/unet/
  4. T5 + CLIP 放 models/text_encoders/
  5. VAE 放 models/vae/
  6. 在 ComfyUI-Manager 里安装 ComfyUI-GGUF
  7. 重启 ComfyUI
  8. Unet Loader (GGUF) 选择 gguf 文件
  9. DualCLIPLoader 选择 T5 和 CLIP,type 选 flux
  10. 先用 768x768 / 20 steps 测试能否出图

跑通以后再调分辨率和 steps。不要一上来就改一堆参数。

详见:从安装节点到第一次出图的完整顺序

FAQ

Q: GGUF 是 checkpoint 吗? 不是同一种东西。GGUF 是一种量化模型格式,不能直接用 Load Checkpoint 加载。FLUX GGUF 工作流里用的是 Unet Loader (GGUF)

Q: 为什么我的 Load Checkpoint 找不到 GGUF 文件? 因为 GGUF 文件不应该放 models/checkpoints/,也不应该用 Load Checkpoint 去找。把它放到 models/unet/,用 Unet Loader (GGUF) 加载。

Q: 只有 GGUF 文件能不能出图? 不能。FLUX 工作流还需要 T5 文本编码器、CLIP-L、VAE。缺任何一个都无法正常出图。

Q: Q6_K 一定比 Q4_K_M 画质好吗? 不一定。Q6 精度更高,理论上保留更多细节,但本站还没有做过同 prompt 同 seed 的 Q4/Q5/Q6 对比。不要在没有实测的情况下写结论。

Q: 8GB 显卡是不是只能用 GGUF? 不是”只能”,但在本站 RTX 4060 Laptop 8GB 上,GGUF Q6_K + T5 FP8 是目前实测可行的方案。原版 FP16 通常依赖 offload,速度和稳定性不好保证,对新手不友好。

Q: safetensors 文件是不是没用了? 有用。在 FLUX GGUF 工作流里,T5、CLIP、VAE 仍然是 safetensors 格式。GGUF 只替代了 UNet 部分,其他组件不变。

后续待测

  • Q4_K_M、Q5_K_M、Q6_K 同 prompt 同 seed 的对比
  • FP8 T5 和其他 T5 版本的差异
  • 不同量化级别的显存占用实测
  • 1024x1024 下各量化级别的出图稳定性

相关文章