基于Stable Diffusion的AI角色服饰生成:从工作流构建到审美评估
1. 先搞清楚“赵姬的衣橱”到底在讨论什么
看到“赵姬的衣橱,哪一套最好看呢”这个标题,很多人第一反应可能是某个历史人物或影视剧角色的服饰盘点。实际上,在近期的网络讨论和内容创作中,这更可能指向一个基于AI图像生成技术(如Stable Diffusion、Midjourney等)的特定主题创作实践。简单说,就是利用AI绘画工具,围绕“赵姬”这个人物形象,批量生成不同风格、不同款式的服饰造型,然后进行审美比较和选择。
这类项目最核心的价值,不在于单纯地“选美”,而在于它完整地展示了一个从创意构思到技术实现,再到结果筛选的AIGC工作流。对于想学习AI绘画、探索角色设计,或者希望系统化产出系列化视觉内容的人来说,这是一个非常具体且有操作性的切入点。它解决了“有了一个角色概念后,如何高效地探索其视觉可能性并做出有效决策”的问题。
所以,如果你对AI绘画感兴趣,或者你的工作涉及角色设计、视觉内容策划,这个主题就值得一看。整个过程会涉及提示词工程、模型选择、参数调整、批量生成以及最终的审美与实用评估。下面,我就以一个实践者的角度,拆解从零开始到选出“最好看”一套的完整路径。
2. 动手前的准备:明确目标与搭建环境
在开始让AI“打开衣橱”之前,必须先做好两件事:定义清晰的“赵姬”,以及准备好稳定运行的AI绘画工具链。方向错了,再好的工具也出不来想要的结果。
2.1 定义角色锚点:你的“赵姬”是谁?
“赵姬”可以有很多种理解:历史记载中的秦始皇生母、影视剧中的某个经典形象(如《寻秦记》、《大秦赋》等)、甚至是融合了现代审美的二次元创作形象。这个定义将直接决定你所有提示词的基调和最终画面的风格。
我建议先建立一个简单的角色设定文档,哪怕只是几句话:
- 时代背景:是严格考据的战国风,还是架空混搭的古风?
- 核心气质:是威严的太后、柔美的妃子、还是带有传奇色彩的民间女子?
- 视觉关键词:哪些元素是必须的?例如,特定的发型(高髻、垂髻)、标志性配饰(玉簪、步摇)、或经典色彩(玄色、朱红)。
- 希望探索的风格:写实厚涂、唯美插画、二次元平涂、还是水墨风格?
这个设定不需要复杂,但必须明确。它将是你所有提示词的“锚”,确保生成的系列图片具有统一性和可比性,而不是一堆杂乱无章的“古风美女”。
2.2 搭建与测试你的AI绘画工作台
目前,对于这类需要高度定制化、批量尝试的项目,在本地部署的Stable Diffusion WebUI(如Automatic1111或ComfyUI)通常是更优选择。它提供了最大的控制自由度,并且适合长时间、大批量的生成测试。在线工具虽然方便,但在生成数量、模型切换和参数深度调整上往往有限制。
基础环境准备清单:
- 硬件:拥有一张显存不少于6GB的NVIDIA显卡是流畅运行的基础。4GB显存可以尝试,但需要调低分辨率并忍受更慢的速度。纯CPU模式基本无法用于这种探索性工作。
- 软件:安装Python(3.10+版本兼容性最好)、Git,并按照官方教程部署Stable Diffusion WebUI。这个过程现在已有非常成熟的一键安装包,大大降低了门槛。
- 核心模型:这是“衣橱”的布料和裁缝。你需要准备一个或多个基础大模型。对于古风人物:
- 写实风格:可以考虑
chilloutmix、realisticVision等模型,它们对亚洲人脸型和古典气质的融合做得不错。 - 二次元/插画风格:
anything、counterfeit等模型是常见选择。 - 专门古风模型:在模型分享社区(如Civitai、LiblibAI)直接搜索“Chinese style”、“guofeng”、“hanfu”等关键词,能找到很多训练好的专用模型,效果往往更精准。
- 写实风格:可以考虑
- LoRA/Embedding:这是“衣橱”里的配饰和花纹。下载一些高质量的古风服饰、发型、珠宝等LoRA模型,能极大地丰富你的细节表现力,避免所有衣服看起来都像同一个裁缝做的。
环境验证步骤:部署完成后,不要急着做“赵姬”。先用一个简单提示词(例如:1girl, solo, portrait, detailed face)生成几张图。目的是确认:
- 软件能正常启动,不报错。
- 模型加载成功,能出图。
- 显存占用在正常范围内(可通过任务管理器或
nvidia-smi命令查看)。 - 生成速度在可接受范围(如20秒/张以内)。
只有基础环境跑通了,后续的创意工作才不会被打断。
3. 构建“衣橱”:提示词工程与批量生成策略
这是最核心的创作环节。我们的目标不是一张好图,而是一个风格统一但服饰各异的“系列图”,这样才能公平比较。
3.1 设计“基础人像”提示词
首先,固定住“赵姬”的脸和基本气质。编写一段包含以下部分的提示词:
(高质量前缀,如:masterpiece, best quality, ultra-detailed,) (角色设定,如:Zhao Ji, queen mother of Qin, mature beauty, elegant,) (固定外貌,如:pale skin, black long hair, phoenix eyes,) (基础场景,如:in ancient Chinese palace, soft lighting,) (画面构图,如:full body shot, facing viewer,)负面提示词也要认真设置,用以过滤常见瑕疵:
(低质量过滤,如:lowres, bad anatomy, bad hands, text, error,) (风格过滤,如:modern clothes, jeans, t-shirt,) (多余元素,如:extra fingers, too many fingers,)用这套提示词生成几张图,直到得到一张你认可的角色基础形象。保存这张图的种子值。在后续生成不同服装时,使用相同的种子值和基础提示词,可以最大限度地保持人脸、身材和场景的一致性,让变量只剩下“服装”。
3.2 创建“服装变量”提示词库
现在,我们来规划“衣橱”里的内容。不要天马行空地随机想,而是有系统地规划几个服饰方向,每个方向下再细化。例如:
| 服饰类型 | 具体描述关键词(可组合使用) | 可能对应的历史时期/场合 |
|---|---|---|
| 礼服/朝服 | hanfu, formal robes, wide sleeves, intricate embroidery, dragon and phoenix patterns, headdress | 重大典礼、朝会 |
| 常服/便服 | elegant dress, light silk, simple embroidery, flowing skirt, hair stick | 日常起居、花园漫步 |
| 深衣/曲裾 | shenyi, deep garment, wrapped style, elegant and dignified | 战国至汉经典款式 |
| 飘逸大袖 | wide flowing sleeves, fairy-like, light gauze, ribbons | 更具艺术夸张感的造型 |
| 戎装/骑射服 | riding attire, fitted design, leather belt, boots, heroic style | 狩猎、出行场合 |
将每种服装类型总结成一段简短的提示词片段,例如“elegant hanfu, light blue silk, peach blossom embroidery, flowing ribbons”。
3.3 执行批量生成
在Stable Diffusion WebUI中,利用其批量生成功能:
- 固定参数:填入之前得到的基础提示词、负面提示词、种子值、采样步数(20-30)、采样方法(DPM++ 2M Karras等)、以及一个中等分辨率(如768x1024)。
- 变量替换:在提示词中,将描述服装的部分替换为
[outfit1|outfit2|outfit3]这样的形式,或者在“脚本”中使用“提示词矩阵”功能,来轮流生成不同服装。 - 控制生成数量:为每套服装生成2-4个变体(不同姿势、细微角度),以观察其在不同构图下的稳定性。这样,如果你规划了5套服装,每套生成3个变体,最终会得到15张图,一个初具规模的“衣橱”就建好了。
注意:批量生成时,务必先设置好输出目录,并建议在文件名中包含服装类型编号(如
zhaoji_outfit01_v1.png),否则后期整理会是一场灾难。
4. 评估与选择:建立你的“好看”标准
生成了几十张图后,面对一个“衣橱”,如何客观地选出“最好看”的一套?这不仅仅是主观审美,更需要一套可操作的评估体系。我通常会从四个维度进行筛选,分轮进行。
4.1 第一轮筛选:技术质量与角色一致性
这一轮只看硬伤,快速淘汰不合格品。把有明显问题的图移出候选池:
- 画面崩坏:脸崩、手部畸形、身体结构不合理、服饰穿模(如袖子穿过身体)。
- 元素污染:出现了现代物品、风格完全不符的装饰。
- 角色漂移:人物长相、年龄、气质与之前设定的“赵姬”基础形象差异过大,看起来像另一个人。
- 提示词遵循度:生成的服装完全不是你描述的样子(比如你要曲裾,它给了对襟襦裙)。
这一轮是纯淘汰,不纠结。目标是留下那些技术过关、角色统一的图。
4.2 第二轮筛选:服饰设计的完成度与美感
在技术合格的图片中,开始评价服装本身:
- 结构准确性:服装的层次、系带、裁剪是否符合基本逻辑?交领是否左右正确?虽然不要求百分百考据,但不能看起来像胡乱披了块布。
- 细节丰富度:刺绣花纹是否精致?面料质感(如丝绸的柔光、麻布的纹理)是否有表现?配饰(腰带、玉佩、发簪)是否清晰合理?
- 色彩搭配:颜色是否和谐?是否符合角色气质和场合?(例如,朝服用庄重的玄色、朱红,便服可用更雅致的浅绿、月白)。
- 整体美感:这套服装穿上身,是否提升了角色的气质?是显得雍容华贵,还是清丽脱俗,或是英姿飒爽?
在这一轮,你可以开始给每套服装的每个变体打分(比如1-5分),或者进行分组排序。
4.3 第三轮筛选:与场景、光影的融合度
服装不是孤立存在的。需要检查:
- 物理合理性:服装的垂感、褶皱是否与角色的姿势、所处的场景(如站立、端坐、微风)相匹配?在花园场景中,衣袂是否有些许飘动?
- 光影互动:光线照射在服装上,是否能正确表现出高光和阴影?丝绸的高光是否过曝?暗部细节是否丢失?
- 氛围营造:这套服装是否强化了你想要营造的整体画面氛围?例如,一套飘逸的纱衣在柔光下可能仙气十足,但在强烈的戏剧光下可能就显得单薄。
4.4 最终决策:定义“最好看”的上下文
经过前三轮,可能还剩2-3套最强的候选。最终选择取决于你的核心目的:
- 如果是为了角色设定:选择最能代表角色核心身份和性格的那一套。例如,作为太后的赵姬,一套庄重华丽的朝服可能比便服更“好看”(在角色设定层面)。
- 如果是为了视觉冲击力:选择在色彩、构图、细节上最具艺术感染力,最让人眼前一亮的一套。
- 如果是为了技术展示:选择在AI生成中表现最稳定、细节最复杂、最不容易出错的那一套,这能体现工作流的可靠性。
- 如果是为了叙事:选择最适合你构思的某个具体场景(如“夜会吕不韦”、“嫪毐之乱”)的那一套。
一个实用的方法:将最后几套候选图并排放在一起,离开屏幕几分钟,再回来看。第一眼抓住你目光的,往往就是你内心偏好的“最好看”。然后,再用上述理性标准去验证这个直觉选择是否成立。
5. 进阶优化与常见问题排查
当你已经能稳定产出一个系列的“赵姬衣橱”后,可能会追求更精细的控制和更高的出图率。这里有几个进阶思路和常见坑点。
5.1 利用ControlNet实现精准控制
如果你想严格固定姿势、构图,让服装的变化更加纯粹,ControlNet是神器。
- OpenPose:可以先用基础形象生成一张满意的姿势图,提取其骨骼姿势,然后应用到所有服装生成中,确保人物姿态完全一致。
- Canny/Lineart:如果你有服装设计线稿,可以用它来精确控制服装的轮廓,让AI只负责填充色彩和纹理。
- Depth:用于固定场景的景深和人物与背景的关系,使不同服装的图片在空间感上保持一致。
使用ControlNet时,需要调整其“权重”和“引导介入时机”,一开始权重不宜过高(如0.5-0.8),避免生成的图像过于僵硬,失去AI的创造力。
5.2 迭代优化与局部重绘
很少有图片能一次完美。善用“图生图”和“局部重绘”功能:
- 整体微调:选中一张不错的图,发送到图生图,微调提示词(例如将“simple embroidery”改为“intricate dragon embroidery”),用较低的“重绘幅度”(如0.2-0.3)进行迭代,优化细节。
- 修复瑕疵:对于小范围的崩坏(如奇怪的手指、扭曲的配饰),使用局部重绘框选该区域,用相同的提示词进行修复,通常能取得很好效果。
5.3 常见问题与排查清单
在生成过程中,你肯定会遇到各种问题。不要慌,按以下顺序排查:
图像模糊或畸形:
- 检查分辨率:分辨率太低(如512x512)容易导致脸部畸形。尝试提高到768x1024或以上,并使用高分辨率修复功能。
- 检查采样步数:步数太少(如<20)可能导致细节渲染不充分。适当增加到25-30。
- 强化负面提示词:增加
blurry, malformed hands, bad anatomy等。
服装不符合描述:
- 提示词权重:给服装关键词加上括号增加权重,例如
(elegant hanfu:1.3)。 - 提示词顺序:AI更关注提示词靠前的内容,确保服装描述在靠前位置。
- 模型能力:当前使用的大模型可能不擅长此类服装。尝试切换专门古风模型或加载对应的服饰LoRA。
- 提示词权重:给服装关键词加上括号增加权重,例如
生成速度慢或显存溢出:
- 降低分辨率:这是最有效的方法。
- 启用xFormers:在启动参数中确保已启用,可优化显存和速度。
- 使用--medvram参数:对于中等显存(6-8GB)显卡,使用此参数启动。
- 检查VAE:有些VAE模型会显著增加显存消耗,尝试换回默认或轻量VAE。
系列图风格不统一:
- 固定种子:这是最重要的手段。
- 固定模型和VAE:整个系列使用完全相同的基础模型和VAE。
- 使用风格LoRA:加载一个统一的画风LoRA,可以让所有图片带有相同的色彩和笔触倾向。
6. 从项目到经验:构建可复用的AIGC工作流
完成一次“赵姬的衣橱”项目,收获不应该只是一张“最美”的图片。更重要的是,你实践并固化了一套适用于角色视觉开发的AIGC工作流。这套流程可以迁移到任何其他角色或主题上。
我的核心经验总结:
- 定义先行:永远在生成前,用文字尽可能清晰地定义你的目标。模糊的输入必然导致随机的输出。
- 分层测试:不要想着一口吃成胖子。先跑通单张(固定角色),再测试变量(更换服装),最后才进行批量生成。每一步都确认结果符合预期。
- 善用工具:种子、提示词矩阵、ControlNet、LoRA,这些都是为了增加控制力。理解每个工具的作用边界,组合使用。
- 建立标准:审美是主观的,但评估可以客观。建立从技术到美学、从整体到细节的逐层筛选标准,能让选择不再纠结。
- 管理资产:规范的命名、清晰的文件夹结构、记录关键参数(种子、模型、提示词),这些“苦活”能让你在后续修改和复用时节省大量时间。
最终,哪一套“赵姬”的衣服最好看,答案在你的标准里,也在你控制AI实现创意的能力里。这个项目最有价值的部分,正是你为了找到这个答案,所走过的每一步思考、每一次调试和每一轮筛选。这远比一张孤立的“美图”重要得多。
