直接用 512x512 出图再手动拉伸,得到的往往是一张模糊发虚的图,人物五官糊成一团,画面细节全靠脑补。SD WebUI 的 Hires Fix(高清修复)就是为解决这个问题设计的:它在初次采样完成后,将图片放大再做一轮低强度重绘,让模型在高分辨率画布上补充细节。但很多人打开 Hires Fix 后发现,要么细节是有了、构图却面目全非,要么画面保住了、放大后依旧糊。问题基本都出在参数组合上。这篇文章把放大倍数、降噪强度、放大算法三个核心参数讲透,并给出可直接套用的组合方案。

Hires Fix 的工作原理:为什么参数之间会互相牵制
理解参数之前,先要知道 Hires Fix 到底做了什么。它并不是简单地把图片锐化,而是一个两阶段的采样流程:第一阶段按你设定的原始分辨率(比如 768x512)正常采样出一张底图;第二阶段将这张底图通过指定的放大算法放大到目标尺寸,然后以一个较低的降噪强度重新采样一遍,让模型在新画布上重绘细节。
这里的关键在于 Denoising strength(降噪强度)。它决定了第二阶段中原图信息被保留多少:值越低,模型越倾向于信任放大后的底图,只做轻微修补;值越高,模型会大刀阔斧地重画,原始构图就可能面目全非。而放大倍数又直接影响画面内容在放大后的“颗粒感”——倍数越大,放大算法补出来的伪细节越多,需要的降噪强度就越高才能把这些伪细节修掉。这就是三个参数互相牵制的原因:单独调任何一个都很难得到理想效果。
另外一个容易被忽略的点是,SD 1.5 系列模型是在 512x512 附近训练的,直接出 1024x1024 的图会出现重复肢体、双头等诡异现象。Hires Fix 的意义就在于先在模型熟悉的分辨率下生成正确的构图,再放大补细节,本质上是一种绕开模型分辨率局限的妥协方案。
三个核心参数怎么设:放大倍数、降噪强度与算法选择
放大倍数(Upscale by)
放大倍数建议控制在 1.5 到 2 倍之间。以 512x768 出图为例,1.5 倍得到 768x1152,2 倍得到 1024x1536,都在模型能稳定发挥的范围内。如果一次放大 2.5 倍以上,放大算法产生的模糊和伪影会非常明显,后续无论怎么调降噪强度都很难补救。
如果你需要 4K 级别的大图,正确做法是分阶段放大:先用 1.5 倍做一次 Hires Fix,出图后再用 Extras 标签页的 Tiled Diffusion 或 img2img 分两次继续放大,每一步的降噪都保持低位,这样比一步到位稳定得多。
降噪强度(Denoising strength)
这是 Hires Fix 成败的核心参数。经验区间是 0.3 到 0.6:低于 0.3 时基本只是给放大后的图做了轻微锐化,细节改善有限;高于 0.6 后构图开始明显漂移,人物姿势、面部朝向都可能改变,失去了“修复”的意义。
不同放大算法对应的最优降噪值也不同:Latent 系列放大本身比较模糊,需要 0.5 以上的降噪来重绘细节;而 4x-UltraSharp 这类效果锐利的模型放大,0.35 左右就足够。一个实用技巧是先固定其他参数,用 X/Y/Z plot 脚本对降噪值做 0.3 到 0.6 的批量测试,一次跑出对比图,直接挑最好的那档。
放大算法(Upscaler)
WebUI 内置和社区扩展提供了大量放大模型,按特性可以分成几类,各自适用场景如下:
- Latent(Latent bilinear / Latent nearest):在潜空间直接放大,速度极快,几乎不引入额外信息,适合配合较高降噪(0.5~0.6)让模型完全重绘细节,写实人像常用。
- ESRGAN 系(RealESRGAN_x4plus、RealESRGAN_x4plus_anime_6B):老牌通用算法,plus 版偏写实,anime_6B 专精二次元线条,降噪 0.4 左右即可。
- 4x-UltraSharp:细节锐利、还原度高,适合追求画面干净的场景,配合 0.35 左右低降噪效果出色,是目前社区口碑最高的通用放大模型之一。
- SwinIR / LDSR:SwinIR 综合表现均衡,LDSR 细节丰富但速度极慢,适合最终成图前的精细放大。
- R-ESRGAN 4x+ / 6B:RealESRGAN 的改良版,4x+ 偏照片质感,适合写实风。
简单记:二次元选 anime 模型加低降噪,写实人像选 Latent 加高降噪,通用场景选 4x-UltraSharp 加中低降噪。
进阶设置与常见翻车场景排查
容易被忽略的辅助参数
Hires steps(高清修复步数)默认只有 20 步,对低降噪来说够用,但如果降噪开到 0.5 以上,建议提到 25~30 步,否则细节重绘不充分。Hires prompt 允许你在第二阶段使用不同的提示词,比如底图阶段只写主体,修复阶段补充 skin texture、detailed eyes 之类的细节词,效果往往比全程堆词更好。
另外注意 Hires resize 和 Upscale by 二选一即可:前者直接指定目标分辨率,后者按倍数计算,同时填写时容易把图画到超出显存承受范围的尺寸。
常见翻车场景
场景一:放大后脸崩了。这是最典型的投诉。原因是人物脸部在整图中占比小,放大后模型重绘时精度不够。解决办法有两个:一是把降噪降到 0.4 以下保住脸部结构,再配合 ADetailer 扩展对人脸做专门的二次修复;二是改用 Latent 放大加高降噪,让模型整张脸重画一遍。
场景二:构图完全变了。降噪超过 0.65 的典型后果。如果你确实需要大幅重绘(比如底图质量很差),可以用 ControlNet 的 Tile 模型锁住构图再拉高降噪,这样即使降噪开到 0.7 以上,画面结构依然稳定。
场景三:画面出现网格状噪点或油笔画质感。多半是放大倍数过大叠加高降噪导致的过度重绘,把倍数降到 1.5、降噪降 0.05 一档通常就能缓解。
推荐参数速查
| 场景 | 放大算法 | 放大倍数 | 降噪强度 |
|---|---|---|---|
| 二次元插画 | RealESRGAN anime_6B | 1.5~2.0 | 0.35~0.45 |
| 写实人像 | Latent nearest | 1.5 | 0.5~0.6 |
| 通用风景 | 4x-UltraSharp | 2.0 | 0.3~0.4 |
| 追求极致细节 | LDSR | 1.5 | 0.35 |
最后强调一点:参数没有唯一正确答案,不同 checkpoint 对降噪的敏感度差异很大,同一个 0.45 在 A 模型上恰到好处、在 B 模型上可能已经崩坏。养成用固定种子加 X/Y/Z plot 做小范围批量测试的习惯,比死记任何数值都靠谱。把上面这套思路跑通之后,你会发现高清出图的成功率会有非常明显的提升。
Hires FixStable Diffusion WebUI高清修复修改时间:2026-09-13 05:18:31