用Stable Diffusion(Stable)自动生成原创插图的3个步骤【新手向】
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
本文你将了解到
Stable Diffusion(Stable Diffusion)是一款只需输入文字就能自动生成插图和图像的AI工具。截至2026年8月,最新版Stable Diffusion 3.5已正式发布,其最大魅力在于可以免费无限次使用。其他图像生成AI每月往往只能生成数十张,或者需要支付月费,而Stable Diffusion是开源软件(任何人都可以自由使用的机制),没有次数限制。此外,生成的图像可用于商业用途,因此可以直接用于SNS发帖插图、YouTube缩略图、博客配图等商业场景。即使没有编程知识,也可以安装到自己的电脑上使用,对保密性要求较高的图像也可以放心制作。
首先,搭建使用Stable Diffusion所需的环境。推荐新手在电脑上安装名为"Stable Diffusion web UI"的免费软件。所需条件为:Windows或Mac电脑、NVIDIA显卡(推荐RTX 3060及以上)、内存16GB及以上。即使电脑没有独立显卡,也可以使用Google Colab(谷歌提供的免费云端环境),仅通过浏览器即可运行。安装步骤非常简单:从官方GitHub下载最新版,解压后双击文件夹内的可执行文件即可。首次启动时会自动下载所需文件,需等待约10分钟。启动完成后,浏览器会自动打开操作界面。
操作界面打开后,进行生成插图所需的设置。界面上方有一个名为"Prompt(提示词)"的输入框,在此用英语写下"希望画什么样的图"。例如,写得越具体,越能生成符合预期的图像,如"a cute cat sitting on a chair, anime style(坐在椅子上的可爱猫咪,动漫风格)"。下方的"Negative Prompt(负面提示词)"用于填写"不希望出现的内容"。例如,输入"low quality, blurry(低质量,模糊)"可以避免生成低质量的图像。接下来,将界面右侧的"Sampling Steps(采样步数)"从20调整为30。数值越大,绘制越精细,但耗时也越长。"CFG Scale(CFG比例)"保持默认值7即可,该数值决定了提示词被忠实还原的程度。
设置完成后,点击界面下方橙色的"Generate(生成)"按钮。随后,界面右侧会实时显示图像的生成过程。根据电脑配置不同,大约需要30秒至1分钟完成生成。生成的图像会自动保存到web UI文件夹内的"outputs/txt2img-images"目录中。如果生成的图像不符合预期,重新修改提示词后再次点击"Generate"即可,可以反复尝试。即使使用相同的提示词,通过更改"Seed(种子值)"这一随机数,每次也能生成不同的图像。找到满意的图像后,复制该图像下方显示的设置信息,日后可以再现相同风格的图像。生成的图像以PNG格式保存,可以直接上传到SNS,也可以用图像编辑软件进行后期处理。
新手常见的问题主要有以下3点。第一是"只生成全黑图像"的现象。这是由显卡显存不足导致的,将图像尺寸降至512×512,或在启动配置文件中添加"–medvram"启动参数即可解决。第二是"用日语写提示词没有效果"的问题。由于Stable Diffusion基于英语进行训练,使用日语精度会下降。请先用DeepL或Google翻译将其翻译成英语后再输入。第三是"面部和手部严重变形"的问题。为了避免这种情况,可以在负面提示词中添加"bad anatomy, extra fingers(异常体型,多余的手指)",或者勾选"Restore faces(面部修复功能)"来改善。此外,更换模型数据也能大幅提升图像质量,建议从Civitai等模型分享网站下载评分较高的模型进行尝试。
熟悉基本操作后,可以挑战更高级的用法。第一是使用名为"LoRA(LoRA)"的追加训练数据。导入LoRA后,可以轻松还原特定角色或画风。例如,模仿"吉卜力风格""皮克斯风格"等知名工作室画风的LoRA已免费发布。第二是"img2img(图像到图像)"功能。上传自己绘制的草图或照片后,AI会以此为基础进行精细化处理。可以将粗略草图转换为精美插图,或将白天的照片变成夜景。第三是名为"ControlNet(ControlNet)"的扩展功能,可以精确指定姿势和构图。只需画出火柴人线稿,AI便能按照该姿势绘制角色,大大简化了插图构图的过程。将这些功能组合使用,甚至可以制作出媲美专业水准的插图。
本文转载自 AI Friends。