← ComfyUI 实测笔记

ComfyUI FLUX 8GB 显卡参数怎么选?分辨率、steps、batch、CFG 实测建议

ComfyUIFLUXGGUFRTX4060settingslow-vram

先说结论

这篇不是万能参数表,只是我这台 RTX 4060 Laptop 8GBFLUX GGUF Q6_K + T5 FP8 方案下的实测建议。

如果你是新手,我建议先从这一组开始:

参数推荐值
分辨率1024×1024
steps20
batch size1
CFG1.0
samplereuler
schedulersimple

这组参数的意义不是”画质一定最好”,而是比较适合先把流程跑通。
在我这台机器上,1024×1024、20 steps 能正常出图,耗时也比 30 steps 更容易接受。

如果已经调好 prompt,想最终定稿,可以再试:

参数推荐值
分辨率1024×1024
steps30
batch size1
CFG1.0
samplereuler
schedulersimple

30 steps 会更慢,但如果只是最终出一两张图,多等一会儿问题不大。

相关实测可以先看:


我的测试环境

项目配置
GPUNVIDIA GeForce RTX 4060 Laptop GPU
专用显存8GB
系统内存32GB
系统Windows 11
ComfyUI0.24.0
方案FLUX GGUF Q6_K + T5 FP8
UNetflux1-dev-Q6_K.gguf
Text Encodert5xxl_fp8_e4m3fn_scaled.safetensors + clip_l.safetensors
VAEae.safetensors

这里的数据只代表这台机器。不同显卡、不同驱动、不同 ComfyUI 版本、不同模型方案,结果都可能不一样。


推荐参数总表

使用场景分辨率stepsbatchCFGsamplerscheduler说明
快速试 prompt768×7682011.0eulersimple适合快速看方向,节省等待时间
日常出图1024×10242011.0eulersimple我目前最常用的平衡参数
最终定稿1024×10243011.0eulersimple更慢,但适合最终出图
显存紧张768×7682011.0eulersimple如果 1024 OOM,先降到这里
不建议新手直接试1280×1280 或更高20 或 3011.0eulersimple8GB 显存压力明显变大,先别上来就试

核心原则很简单:
先跑通,再提分辨率;先 batch 1,再考虑别的;先 20 steps 调 prompt,最后再 30 steps 定稿。


分辨率怎么选

768×768

768×768 适合快速试提示词。
如果你只是想看 prompt 方向对不对,没必要一开始就 1024×1024。

这档的优点是快,显存压力也低。缺点是细节不如 1024。

896×896

896×896 可以作为中间档。
但是我之前测到过一次 896×896 比 1024×1024 还慢,这不是因为 896 本身一定更差,而是因为两次测试的系统状态不同。

比如模型是否已经加载、缓存是否热、ComfyUI 是否刚启动、后台有没有别的程序,都会影响耗时。

所以不要只凭一次结果就判断”某个分辨率一定更快”。

1024×1024

1024×1024 是我这台 RTX 4060 Laptop 8GB 目前比较实用的上限。
在 GGUF Q6_K + T5 FP8 的方案下,1024×1024 可以正常出图。

如果你也用类似配置,可以先从 1024×1024 + 20 steps 开始。

更高分辨率

1280×1280、1536×1536 这类更高分辨率,我没有做完整稳定测试。
8GB 显存本来就不宽裕,新手不建议一上来就试高分辨率。

如果要试,也应该先确认 1024×1024 已经稳定,再逐步往上加。


steps 怎么选

20 steps

20 steps 更适合调 prompt、批量看方向、快速试不同 seed。
在我这台机器上,1024×1024 下 20 steps 明显比 30 steps 快。

如果你一天要试很多次 prompt,20 steps 更实用。

30 steps

30 steps 更适合最终定稿。
如果 prompt 已经确定,只想出一张更稳一点的图,多等几十秒是可以接受的。

但这里要说清楚:我没有做严格画质 A/B 评测,所以不能说 30 steps 一定明显更好。这里只是从实际使用习惯上说,最终图可以多给一点 steps。

steps 不是解决 OOM 的主要办法

很多人以为 OOM 就把 steps 降低。
但 steps 主要影响计算时间,不是主要显存占用。

真正影响显存的,通常是:

  • 分辨率
  • batch size
  • UNet 模型大小
  • T5 文本编码器大小
  • 是否用 GGUF 量化
  • 是否还有浏览器、录屏、其他 AI 程序占用 GPU

OOM 排查可以看这篇:
ComfyUI FLUX 8GB 显存不够怎么办?OOM、加载慢、爆显存排查记录


batch_size 为什么必须是 1

8GB 显存下,batch_size 不建议大于 1。

batch_size 从 1 改成 2,不只是”多出一张图”那么简单,它会明显增加显存压力。
如果你本来就接近显存上限,batch_size 变成 2 很容易 OOM。

我目前所有稳定测试都按 batch_size = 1 来做。

所以新手先记住一句话:
8GB 显卡跑 FLUX,batch size 先固定 1。


CFG 为什么用 1.0

我这套工作流里 CFG 用的是 1.0。
这里不是说所有 FLUX 工作流都必须 1.0,而是说:

在 FLUX GGUF Q6_K + T5 FP8 + euler + simple 这个组合里,我目前用 1.0 比较稳定。

新手不要一开始就乱改 CFG。
先用 1.0 跑通,确认模型、节点、分辨率都没问题,再慢慢试其他参数。


哪些参数省显存,哪些只是省时间

参数或操作是否主要省显存说明
降低分辨率Latent 变小,显存压力会明显下降
batch_size = 18GB 显卡最重要的设置之一
使用 GGUF 量化UNet 显存压力明显降低
使用 T5 FP8比全精度 T5 更适合 8GB
减少 steps否,主要省时间steps 少了会更快,但不是主要省显存手段
关闭浏览器和其他 GPU 程序可能能释放被占用的显存
调 CFG不是主要因素CFG 不是排查 OOM 的第一优先级

总结一下:
显存不够时,先看分辨率、batch、模型方案和后台 GPU 占用。不要只盯着 steps。

模型文件目录可以看这篇:
ComfyUI FLUX 模型文件放哪里?UNet、T5、CLIP、VAE 目录对照


新手推荐顺序

如果你是第一次搭 FLUX GGUF,我建议按这个顺序来:

  1. 先确认 ComfyUI-GGUF 节点已经装好。
  2. 确认模型文件放在正确目录。
  3. 确认 Unet Loader (GGUF) 能选到 flux1-dev-Q6_K.gguf。
  4. 先用 768×768 / 20 steps / batch 1 跑通。
  5. 跑通后再改 1024×1024 / 20 steps。
  6. 最后再试 1024×1024 / 30 steps。
  7. 如果 OOM,优先检查 batch_size、T5、浏览器显存、其他 GPU 程序。

GGUF 节点安装问题可以看:
ComfyUI-GGUF 节点怎么安装?Unet Loader (GGUF) 找不到怎么办


常见误区

”steps 降低就一定不 OOM”

不一定。
steps 主要影响耗时,不是主要显存因素。

“分辨率越高越好”

不一定。
分辨率越高,显存压力越大。8GB 显卡先把 1024×1024 跑稳更实际。

“batch_size 调大只是多出几张图”

不是。
batch_size 调大会显著增加显存压力。8GB 显卡建议先固定 1。

“能跑 768 就一定能跑 1024”

不一定。
768 和 1024 的显存压力不同。768 跑通只能说明流程没错,不代表 1024 一定稳。

“一次成功就代表以后永远不会 OOM”

不一定。
后台程序、浏览器、显存碎片、模型加载状态都会影响结果。一次成功只能说明当时那次成功。


FAQ

8GB 显卡推荐多少分辨率?

我建议先用 768×768 跑通,再用 1024×1024 日常出图。
不要一上来就试 1280×1280 或更高。

20 steps 够不够?

在我这套 FLUX GGUF Q6_K + T5 FP8 工作流里,20 steps 已经够日常试 prompt 和出图。
如果是最终定稿,可以再试 30 steps。

30 steps 值不值得?

如果只是最终出一两张图,30 steps 可以试。
但如果你还在频繁调 prompt,20 steps 更省时间。

batch_size 可以改 2 吗?

不建议。
8GB 显存下 batch_size = 2 很容易增加显存压力。新手先固定 1。

OOM 后第一步检查什么?

先检查 batch_size 是否为 1。
然后检查模型方案、T5 是否用 FP8、分辨率是否过高,以及浏览器或其他 GPU 程序有没有占显存。

CFG 要不要调高?

我这套工作流里先用 1.0。
新手不要一开始就调 CFG,先确认模型、节点和分辨率都稳定。


后续待测

后面如果继续测试,我会优先补这些方向:

  • 768×768 / 20 steps 的准确耗时
  • 896×896 多轮平均耗时
  • 1024×1024 不同采样器对比
  • Q4_K_M、Q5_K_M、Q8_0 的差异
  • 12GB 显卡下是否能更稳地上更高分辨率
  • 30 steps 是否真的有明显画质收益
  • 同 seed、同 prompt 下的画质 A/B 对比