AI深度学习生成图片:从模糊到能用的调参记录
简单说:我固定同一组提示词跑了180多次,画面能不能用主要看采样器和CFG,步数超过35基本白等。新手直接抄 DPM++ 2M Karras、30步、CFG 6.5,能省两个月弯路。
接触ai深度学习图片生成整四个月,我第一张图糊得像隔着毛玻璃拍的,上个月交付的那张已经印成了奶茶店的店面海报。中间没换过模型,也没买付费插件。全靠调参。
工具是本地部署的 Stable Diffusion WebUI,显卡 RTX 3060 12G,跑一张 768×512 约14秒。四个月攒了两本半"炼丹笔记"。这篇就是笔记的脱水版,参数全是我自己跑出来的,翻的车也全是我自己翻的。
步数实验:同一组提示词,ai深度学习图片差别有多大
原子答案:同一组提示词只改步数,15步糊脸、30步成型、60步冒脏点,可用率在30步附近见顶。我的甜点区是28到35步,低于20步人物手部必崩,高于40步纯属浪费电。
实验设计很土。固定提示词、固定种子1745032、固定采样器 DPM++ 2M Karras,只动步数,每档跑6张。15步那组,脸是糊的,背景像没干透的水彩。20步,脸能看了,手指还黏在一起。到30步,手分开了,光影有了层次。35步往上,我盯了很久。说实话,分不出谁是谁。
60步那张反而在头发丝上冒出一堆脏点,像烤过头的面包边。计时也记了:30步14秒,60步27秒。不划算。
老实讲,我以前是"步数崇拜"患者,图一糊就加步数。测完才认账:图糊七成是采样器和CFG的锅,步数只背三成。
采样器选谁:我固定用DPM++ 2M Karras,理由很主观
原子答案:Euler a 快但画面软,DDIM 出图带塑料感,DPM++ SDE Karras 质感最扎实但慢且不稳,DPM++ 2M Karras 是速度和稳定性的平衡点。我九成的图都用它,起稿和成图不用换。
主流采样器我挨个跑过。Euler a 20步就有完整构图,颜色偏灰,适合找感觉。DDIM 我个人觉得最不讨喜,50步出的图皮肤像打了蜡。DPM++ SDE Karras 的质感真好,布料纹理一根根立着,代价是慢一倍,六张里常废两张。方差太大。
最后锁定 DPM++ 2M Karras。理由就一个字:稳。30步加 CFG 6.5,六张里五张能用。接商单的时候,稳比上限值钱。
提示词权重那些坑:(光影:1.5)毁了我一晚上
原子答案:权重语法 (词:1.2) 只对本来就压得住的词有效,加到1.4以上,画面会往色偏和畸变跑。我的红线是1.3,再高宁可换词也不硬加。
踩坑现场还原。上个月做奶茶店海报,我在提示词里写了 (cinematic lighting:1.5),想着电影感光嘛,加重些。出图直接傻眼:整张图橙得像蒙了层琥珀,杯身高光糊成一片白。降回1.2,立刻正常。那晚我调到凌晨一点半,第二天中午就要交稿。挺崩溃的。
负面提示词同理。(worst quality:1.4) 这种写法在社区里传得很广,我实测1.2就够,开到1.4整张图发灰,等于泼了盆水。还有个冷知识:中文词直译后塞进去,权重基本不起作用,模型对英文原词敏感得多。吃过亏我才记住这条。
权重不是力度旋钮。更像盐,少许提鲜,多撒毁锅。
随机种子:ai深度学习图片里最容易被忽视的变量
原子答案:随机种子决定构图和姿态的底牌,同参数同种子可复现,换种子等于重新洗牌。做参数对比必须锁死种子,不然你分不清是参数变好了还是种子运气好。
我干过一件傻事。前两个月对比两组参数,A组锁了种子,B组随手随机,结果B组效果惊艳,我兴奋地以为是 CFG 调对了。复跑,废了。再跑,又废。折腾到半夜才发现变量没控住——种子一换,等于换副牌重洗。
现在的流程固定死了:先抽到构图满意的种子,记下号码,后面所有实验都基于它跑。种子1745032陪我跑了两百多张,笔记里我管它叫"老熟人"。
顺带数了个数。同参数连换20个种子,能用的约13张,可用率65%上下。这数字比教程里承诺的真实。
话说回来,记到第三本笔记时我有点走火入魔,一度想把参数网格化全扫一遍,算下来得跑三千多张,显卡风扇响得像要起飞。后来想通了,调参是手段。真不是目的。
刚上手的朋友,与其背参数,不如先花十分钟弄懂扩散模型在干嘛——从一片噪声里一步步把图"擦"出来,步数是擦的次数,采样器是擦的手法。可以看这篇AI深度学习是什么的白话解释,嫌浅就去翻维基百科的扩散模型词条。原理懂了,很多"玄学"就变成常识。
我的参数对照表(主观打分,不服来吵)
原子答案:这是11个商单沉淀下来的组合,主力是 DPM++ 2M Karras 加30步加 CFG 6.5,SDE 只留给精修。打分纯属个人口味,你可以骂我。
| 参数组合 | 单张耗时 | 可用率(我自己数的) | 主观评价 |
|---|---|---|---|
| DPM++ 2M Karras / 30步 / CFG 6.5 | 约14秒 | 5/6 | 主力,闭眼用 |
| Euler a / 20步 / CFG 7 | 约9秒 | 4/6 | 起稿用,颜色偏灰 |
| DPM++ SDE Karras / 25步 / CFG 7 | 约28秒 | 2/6 | 质感王,脾气大 |
| DDIM / 50步 / CFG 11 | 约23秒 | 1/6 | 塑料感,劝退 |
表里没有最优解。只有最不容易翻车的解。
翻车实录:这三个参数组合我劝你别碰
原子答案:CFG 超过11再叠高步数必烤糊,高清修复 denoising 低于0.35等于没修,Euler a 配1.4的负面权重画面必灰。三个坑我都替你踩完了。
坑一,CFG 12加60步:饱和度高到刺眼,皮肤橙红,像美颜拉满的直播截图。CFG 是"提示词服从度",不是画质旋钮,我以前一直理解错。坑二,高清修复把 denoising 开到0.3:重绘幅度太小,放大两倍后噪点纹丝不动,细节全靠脑补,开到0.45至0.55才有放大意义。坑三,Euler a 加1.4的负面权重:这个采样器色彩本就偏淡,再压一道直接没气色。
补个背景数据。Stable Diffusion 官方模型卡写明它基于 LAION-5B 数据集训练,LAION 官方口径是58.5亿个图文对。模型见过什么,决定它听得懂什么——生僻的中文概念怎么加权都画不出来,根子在这条。技术路线的差异也大,OpenAI 的 DALL-E 2 走的是另一套生成方式,出图味道和本地炼丹完全两回事。
常见问题
采样步数到底设多少合适?
28到35步覆盖九成场景。低于20步人物手部容易崩,高于40步画面几乎没变化,纯耗时间。"步数越高越清晰"这句话,实测不成立。
提示词权重最高能加到多少?
我的红线是1.3。1.2是常用档,1.4以上色偏和畸变的概率明显上升;负面提示词超过1.3,整张图会发灰,等于自废武功。
固定了随机种子为什么出图还是不一样?
查三个地方:步数或 CFG 动没动,采样器换没换,有没有开启影响计算精度的加速选项。种子只在其他参数全部锁死时保证复现。
显卡只有8G显存还能玩ai深度学习图片吗?
能玩。8G跑512×768没压力,768×1152开显存优化也行。再不行就上云端算力,参数经验照样通用,我笔记里有一半是在云上跑出来的。
从模糊到能用,中间隔着两百次抽卡
四个月,180多次实验,两本半笔记,这就是我从糊图侠到能接单的全部成本。ai深度学习图片这件事,入门十分钟,上头一辈子。喜欢抠参数的人,会在这件事里获得一种奇怪的快乐。
想照着练,路线我也替你趟过了:先用学AI绘画的工具选择和练习方法入门,再按炼成第一张能看的图的路径找信心,进阶时补一点AI绘图背后的深度学习基础,想靠它吃饭的,直接看从出图到商单的半年记录。
觉得这份笔记有用,转给那个还在把步数拉到100等出图的朋友,帮他省点电费。