Настройки графики Stable Diffusion: полное руководство по параметрам генерации

Разбираем все ключевые настройки Stable Diffusion: сэмплеры, шаги, CFG Scale, Hires fix, Seed и другие. Узнайте, как настроить графику для получения качественных изображений.

Зачем нужны настройки графики в Stable Diffusion

Stable Diffusion — это нейросеть с открытым исходным кодом, которая генерирует изображения по текстовому описанию. В отличие от облачных сервисов вроде Midjourney, она запускается локально на вашем компьютере, что даёт полный контроль над процессом. Однако без понимания настроек графики сложно получить предсказуемый результат: одна и та же модель может выдавать как шедевр, так и размытое пятно в зависимости от параметров.

Настройки графики определяют, как именно нейросеть преобразует случайный шум в осмысленное изображение. Они влияют на детализацию, соответствие промпту, скорость генерации и стабильность результата. Освоив эти параметры, вы сможете не только улучшить качество картинок, но и ускорить работу, а также избежать типичных ошибок новичков.

В этой статье мы разберём все основные настройки, доступные в популярных интерфейсах — от Automatic1111 до Easy Diffusion. Вы узнаете, что означает каждый параметр, как он влияет на результат и какие значения выбирать в разных ситуациях.

Основные разделы интерфейса: Txt2img и Img2img

Почти все интерфейсы Stable Diffusion, включая Automatic1111 и Easy Diffusion, имеют два главных раздела: Txt2img (текст в изображение) и Img2img (изображение в изображение). В Txt2img вы вводите текстовый промпт, и нейросеть создаёт картинку с нуля. В Img2img вы загружаете исходное изображение, и модель преобразует его согласно вашему запросу — это удобно для стилизации или изменения деталей.

В разделе Txt2img находятся все ключевые настройки генерации: Sampling Method, Sampling Steps, CFG Scale, Width/Height, Seed и другие. В Img2img добавляется параметр Denoising Strength, который определяет, насколько сильно модель изменит исходное изображение. При значении 0 картинка останется почти без изменений, при 1 — полностью перерисуется.

Онлайн-версии Stable Diffusion, например на Hugging Face, обычно имеют лишь базовые настройки — промпт, негативный промпт и кнопку генерации. Полный набор параметров доступен только в десктопной версии, которую можно установить локально. Поэтому для серьёзной работы рекомендуется использовать локальные интерфейсы.

Sampling Method: как выбрать сэмплер

Сэмплер (Sampling Method) определяет алгоритм, который преобразует шум в изображение за заданное количество шагов. Разные сэмплеры дают разное качество, скорость и стиль результата. Наиболее популярные варианты:

  • DPM++ 2M Karras — часто считается лучшим балансом качества и скорости. Подходит для большинства задач, даёт чёткие детали и насыщенные цвета.
  • Euler a — быстрый и стабильный, хорош для начальных экспериментов. Даёт немного «мягкие» изображения.
  • Euler — похож на Euler a, но менее стохастичен, результат более предсказуем.
  • DDIM — один из первых сэмплеров, работает быстро, но качество может быть ниже современных методов.

Выбор сэмплера зависит от ваших целей. Если вы хотите максимальную детализацию — используйте DPM++ 2M Karras. Если важна скорость и вы готовы пожертвовать качеством — Euler или DDIM. Для стилизованных изображений, например аниме, часто выбирают DPM++ SDE Karras.

Экспериментируйте с разными сэмплерами на одном и том же промпте, чтобы понять, какой лучше подходит для вашего стиля. В интерфейсах есть функция X/Y/Z plot, которая позволяет сравнить несколько сэмплеров в одной таблице.

Sampling Steps: сколько шагов нужно для идеальной картинки

Sampling Steps — это количество итераций, которые нейросеть выполняет для преобразования шума в изображение. Чем больше шагов, тем детальнее и качественнее результат, но тем дольше генерация. Однако после определённого порога дополнительные шаги перестают улучшать картинку и лишь тратят время.

Для большинства моделей оптимальное значение — 25–30 шагов. При 20 шагах изображение может быть слегка недообработанным, а при 50+ вы вряд ли заметите разницу, но время генерации увеличится в два раза. Некоторые сэмплеры, например DPM++ 2M Karras, хорошо работают уже при 20 шагах.

Если вы используете Hires fix (увеличение разрешения), количество шагов для апскейла можно задать отдельно. Обычно достаточно 10–15 шагов на этом этапе, так как основная детализация уже выполнена.

Правило простое: начинайте с 25 шагов, смотрите результат и при необходимости увеличивайте до 30–40. Если изображение выглядит шумным или размытым, добавьте шагов; если генерация слишком медленная — уменьшите.

CFG Scale: управление соответствием промпту

CFG Scale (Classifier-Free Guidance Scale) — параметр, который определяет, насколько строго нейросеть следует вашему текстовому запросу. При низких значениях (1–5) модель игнорирует промпт и генерирует случайные изображения. При высоких (15–20) она буквально «выжимает» из запроса максимум, что часто приводит к перенасыщенным цветам, артефактам и искажениям.

Оптимальный диапазон — 7–12. Для большинства промптов хорошо работает значение 7–8: баланс между точностью и художественной свободой. Если вы хотите более точного следования описанию, увеличьте до 10–12. Если изображение получается слишком «перегруженным», снизьте до 5–6.

Важно понимать, что CFG Scale взаимодействует с сэмплером и шагами. Например, при высоком CFG и малом количестве шагов изображение может стать шумным. Поэтому подбирайте параметры в связке.

Полезный совет: используйте скрипт X/Y/Z plot, чтобы визуально сравнить, как разные значения CFG Scale влияют на результат. Это сэкономит время и поможет найти идеальное значение для вашего стиля.

Width и Height: выбор разрешения и его влияние на качество

Width и Height задают ширину и высоту генерируемого изображения в пикселях. Стандартное разрешение для Stable Diffusion — 512×512, так как большинство моделей обучались на изображениях этого размера. Генерация в других пропорциях, например 768×768 или 512×768, возможна, но может привести к искажениям или дублированию объектов.

Если вам нужно изображение большего размера, не стоит сразу генерировать в 1024×1024 — это может вызвать артефакты и перегрузку видеопамяти. Вместо этого используйте Hires fix или отдельный апскейлер. Hires fix генерирует изображение в базовом разрешении, а затем увеличивает его с помощью выбранного алгоритма, добавляя детали.

При выборе разрешения учитывайте возможности вашей видеокарты. Для 512×512 достаточно 4–6 ГБ VRAM, для 768×768 — 8 ГБ, для 1024×1024 — 12 ГБ и более. Если видеопамяти мало, уменьшите разрешение или используйте опцию «Низкое использование памяти» в настройках.

Также помните о соотношении сторон: для портретов лучше 512×768, для пейзажей — 768×512. Экспериментируйте, но следите за тем, чтобы объекты не деформировались.

Hires fix и апскейлеры: как получить изображение высокого разрешения

Hires fix — это функция, которая позволяет увеличить разрешение изображения после первичной генерации. Она работает в два этапа: сначала создаётся изображение в базовом разрешении (например, 512×512), затем оно увеличивается до заданного размера (например, 1024×1024) с добавлением деталей. Это помогает избежать артефактов, которые возникают при прямой генерации в большом разрешении.

В настройках Hires fix можно выбрать апскейлер (Upscaler) — алгоритм, который определяет, как именно будет увеличено изображение. Популярные варианты:

  • Latent — быстрый, но может добавлять шум.
  • ESRGAN — даёт хорошую детализацию, но требует больше времени.
  • SwinIR — один из лучших по качеству, но медленный.

Также можно задать количество шагов для апскейла (Hires steps) и коэффициент увеличения (Upscale by). Обычно достаточно 10–15 шагов и коэффициента 1.5–2.0.

Если вы хотите получить изображение сверхвысокого разрешения (например, 4K), можно использовать отдельные программы для апскейла, такие как Real-ESRGAN или Waifu2x. Однако Hires fix встроен в интерфейс и удобен для быстрой работы.

Помните, что Hires fix увеличивает время генерации в 2–3 раза, поэтому используйте его только тогда, когда действительно нужно высокое разрешение.

Seed: как воспроизводить и модифицировать результаты

Seed (зерно) — это число, которое определяет начальное случайное состояние генерации. При одном и том же промпте и настройках, но разных Seed, вы получите разные изображения. Если Seed равен -1, нейросеть выбирает случайное значение каждый раз.

Использование фиксированного Seed позволяет воспроизводить понравившийся результат. Например, вы сгенерировали изображение и хотите изменить только цвет платья. Скопируйте Seed из информации о сгенерированном изображении (обычно отображается внизу), вставьте его в поле Seed, измените промпт и запустите генерацию. Модель возьмёт за основу исходную композицию и внесёт только ваши изменения.

Seed также полезен для экспериментов: вы можете генерировать серию изображений с разными Seed, чтобы найти лучший вариант. В интерфейсах есть кнопка «Randomize» для автоматического выбора случайного Seed.

Важно: Seed работает только при одинаковых настройках (сэмплер, шаги, CFG Scale, разрешение). Если вы измените любой параметр, результат будет другим, даже с тем же Seed.

Дополнительные настройки: Batch count, Batch size и Refiner

Batch count и Batch size управляют количеством генерируемых изображений. Batch count — это число изображений, которые будут созданы последовательно. Batch size — количество изображений, генерируемых параллельно. Увеличение Batch size ускоряет процесс, но требует больше видеопамяти. Например, Batch size 4 на видеокарте с 8 ГБ VRAM может вызвать ошибку памяти.

Refiner — это функция, которая позволяет использовать вторую модель для улучшения детализации. Вы выбираете основную модель (например, SD 1.5) и модель-рефайнер (например, SDXL). Нейросеть сначала генерирует изображение основной моделью, а затем обрабатывает его рефайнером, добавляя больше деталей и улучшая качество. Параметр Refiner strength определяет, насколько сильно рефайнер изменит изображение.

Эти настройки полезны для профессиональной работы, но для новичков могут быть избыточны. Начните с базовых параметров, а затем постепенно осваивайте дополнительные возможности.

Тонкая настройка: LoRA, Textual Inversion и Hypernetworks

Помимо базовых параметров, Stable Diffusion поддерживает методы тонкой настройки, которые позволяют обучать модель на ваших данных. Это особенно полезно, если вы хотите генерировать изображения в определённом стиле или с конкретным персонажем.

LoRA (Low-Rank Adaptation) — это небольшой файл-дополнение к основной модели, который меняет её поведение. LoRA часто используется для стилей. Например, вы можете обучить LoRA на изображениях в стиле киберпанк и затем применять его к любым промптам. Файл LoRA имеет небольшой вес (около 200 МБ) и быстро загружается.

Textual Inversion — метод, который обучает не модель, а специальный токен (слово-триггер). Вы создаёте токен, например «стиль_моего_бренда», и обучаете его на наборе изображений. После этого, добавив токен в промпт, вы получите изображения в нужном стиле. Это самый быстрый метод, но он менее стабилен.

Hypernetworks — это отдельные нейронные сети, которые подключаются к Stable Diffusion и влияют на стиль. Они также имеют небольшой вес и могут быть скачаны с сайтов вроде Civitai.

Выбор метода зависит от задачи: для стиля — LoRA, для конкретного объекта — Dreambooth (более мощный, но требует много ресурсов), для быстрых экспериментов — Textual Inversion.

Практические советы и типичные ошибки

Начинающие пользователи часто совершают одни и те же ошибки. Вот несколько советов, которые помогут их избежать:

  • Не пишите в негативном промпте то, чего не должно быть. Нейросеть часто добавляет объект в противовес требованию. Вместо «без машин» лучше написать «городская улица, пешеходная зона».
  • Не используйте слишком высокий CFG Scale. Значения выше 15 приводят к перенасыщению и артефактам.
  • Не генерируйте сразу в большом разрешении. Используйте Hires fix или апскейлеры.
  • Следите за видеопамятью. Если возникает ошибка CUDA out of memory, уменьшите разрешение или Batch size.
  • Экспериментируйте с Seed. Если результат не понравился, измените Seed, а не все настройки.

Также важно правильно составлять промпты. Пишите на английском языке, так как модель лучше понимает его. Будьте конкретны: вместо «красивая девушка» напишите «портрет молодой женщины с голубыми глазами, длинными светлыми волосами, в красном платье, студийное освещение, фотография». Чем детальнее описание, тем точнее результат.

Вопросы и ответы

Какие настройки Stable Diffusion влияют на качество изображения?

Основные параметры: Sampling Method, Sampling Steps, CFG Scale, разрешение (Width/Height), Hires fix, Seed. Сэмплер определяет алгоритм обработки шума, шаги — количество итераций, CFG Scale — точность следования промпту. Для высокого качества используйте DPM++ 2M Karras, 25–30 шагов, CFG 7–8 и Hires fix для увеличения разрешения.

Сколько шагов нужно для хорошего результата в Stable Diffusion?

Оптимальное количество шагов — 25–30. При 20 шагах изображение может быть слегка недообработанным, а при 50+ вы не заметите улучшений, но время генерации увеличится. Для Hires fix достаточно 10–15 шагов на этапе апскейла.

Что такое CFG Scale и какое значение выбрать?

CFG Scale определяет, насколько строго модель следует промпту. Низкие значения (1–5) дают больше свободы, высокие (15+) — перенасыщение и артефакты. Оптимальный диапазон — 7–12. Для точного следования промпту используйте 10–12, для художественных экспериментов — 5–6.

Как использовать Seed для воспроизведения результата?

Seed — это число, определяющее начальное состояние генерации. Чтобы воспроизвести результат, скопируйте Seed из информации о сгенерированном изображении и вставьте его в поле Seed. Затем измените промпт или другие параметры, и модель создаст изображение на основе исходной композиции.

Что такое Hires fix и как он работает?

Hires fix — функция, которая увеличивает разрешение изображения после первичной генерации. Сначала создаётся изображение в базовом разрешении (например, 512×512), затем оно увеличивается до заданного размера с добавлением деталей. Это позволяет избежать артефактов при генерации в большом разрешении.

Какая видеокарта нужна для Stable Diffusion?

Минимально — 2 ГБ VRAM, но для комфортной работы рекомендуется 8 ГБ и более. Для генерации в 512×512 достаточно 4–6 ГБ, для 768×768 — 8 ГБ, для 1024×1024 — 12 ГБ. Если видеокарты нет, можно использовать CPU, но это будет медленно.