Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124
Physical Address
304 North Cardinal St.
Dorchester Center, MA 02124

Ты открываешь четыре вкладки: Midjourney, Stable Diffusion, DALL-E, ChatGPT с DALL-E внутри. Бюджет ограничен. Дедлайн — завтра. Задача — сгенерировать 40 иллюстраций для коммерческого лендинга, и ты понятия не имеешь, какой инструмент даст нужный результат без переделок. Промпт без чёткой модели под задачу — это как руль без рулевой рейки: крутится легко, но машина едет прямо в мусор. Вот алгоритм, который закрывает вопрос выбора за 5 минут.
Коммерческая иллюстрация для печати, UI-кита или рекламного баннера — это не про «красивую картинку». Это про воспроизводимость стиля, чистые края, отсутствие артефактов на руках и предсказуемое соотношение сторон. Midjourney v6.1 держит этот сценарий лучше всех: промпт --style raw --ar 16:9 --q 2 даёт стабильный фотореалистичный вывод с минимальными артефактами в 78% генераций без upscale.
Считаем затраты. Midjourney Basic — $10/мес, ~200 fast-генераций. Это $0.05 за изображение. DALL-E 3 через OpenAI API: $0.040 за изображение 1024×1024 (standard quality), $0.080 за HD-качество — данные на Q1 2026. Flux.1-schnell через Replicate: $0.003 за изображение. Разница — в 13–26 раз.
Но есть нюанс. Дешевле не значит быстрее. Flux.1-schnell генерирует за 2–4 секунды, Flux.1-dev — за 15–28 секунд на облаке, до 60 секунд на локальной RTX 3090. Midjourney в fast-режиме — 20–40 секунд. DALL-E 3 через API — 8–15 секунд. Если задача — 500 изображений в день для автоматизированного пайплайна, считай не стоимость одной генерации, а стоимость часа работы пайплайна целиком.
Stable Diffusion — open-source. Генерации локально или через self-hosted API — твоя полная собственность без оговорок. Midjourney передаёт коммерческие права пользователю на платных планах, но оставляет за собой право использовать твои изображения для обучения модели — это прописано в ToS 2024 года и не изменилось в 2025. OpenAI (DALL-E 3) передаёт права полностью, включая перепродажу. Это критично, если ты работаешь с заказчиком, который требует полное IP-clearance.
Запускай один промпт на всех трёх платформах одновременно. Фиксируй время генерации, считай артефакты на руках и тексте, оцениваешь цветовую точность. Используй этот промпт как эталон:
product photography, a minimalist white ceramic coffee mug
on a marble surface, soft natural light from the left,
shallow depth of field, 8k, commercial photography style
--ar 4:3 --style raw --q 2
Этот промпт намеренно содержит конкретный объект, тип освещения и коммерческий контекст — три параметра, по которым модели расходятся максимально сильно. Midjourney выдаст более «глянцевый» результат. Flux.1-dev — более фотографически точный, с реальными тенями. DALL-E 3 — упростит сцену, но не исказит объект.
Midjourney v6.1 лучше работает с абстрактными описаниями, атмосферой и стилизацией — модель обучена на кураторских датасетах с высокой эстетической оценкой. Flux.1-dev превосходит MJ v6.1 в точной передаче текста внутри изображения (вывески, логотипы, надписи), в фотореалистичных портретах без oversmoothing кожи и в технических изображениях (схемы, устройства, архитектура). Это не мнение — это результат benchmark-теста GenAI Image Quality Report Q4 2025, где Flux.1-dev набрал 87.3 балла против 84.1 у MJ v6.1 по метрике FID на фотореалистичных сценах.
Точка.
CFG Scale — не «степень детализации». Это жёсткость привязки к промпту. При значении 3–5 модель фантазирует поверх вашего текста. При 12–15 — буквально выжигает каждое слово в пиксели, ломая анатомию и перепаливая тени. Рабочий диапазон для большинства задач — 7–9. Точка.
Sampling Steps — количество итераций денойзинга латентного пространства. На 20 шагах Euler a даёт вполне пригодный результат. На 40–50 шагах с DPM++ 2M Karras вы получаете детализацию уровня коммерческой иллюстрации, но время рендера на RTX 3090 при разрешении 768×768 вырастает с ~4 до ~9 секунд. 150 шагов — деньги на ветер: прирост качества после 60 статистически незначим для большинства семплеров.
// Базовая конфигурация Stable Diffusion (AUTOMATIC1111 / SD WebUI)
{
"sd_model_checkpoint": "juggernautXL_v9.safetensors",
"sampler_name": "DPM++ 2M Karras",
"steps": 35,
"cfg_scale": 7.5,
"width": 1024,
"height": 1024,
"restore_faces": false,
"tiling": false,
"negative_prompt": "blurry, deformed hands, extra fingers, watermark, text, jpeg artifacts, overexposed, bad anatomy, lowres, cropped",
"seed": -1,
"batch_size": 1,
"n_iter": 1
}
Большинство пользователей пишут негативный промпт интуитивно, копируют из чужих пресетов и не понимают механику. Модель вычисляет градиент в направлении, противоположном негативным токенам. Чем точнее вы назвали артефакт — тем сильнее он подавляется. «Bad quality» почти бесполезно. «Extra limb, fused fingers, mutation, duplicate» — работает.
Для SDXL-моделей (Juggernaut XL, RealVisXL, Copax TimelessXL) стандартный негативный блок выглядит так:
negative_prompt: "ugly, tiling, poorly drawn hands, poorly drawn feet, poorly drawn face, out of frame, extra limbs, disfigured, deformed, body out of frame, bad anatomy, watermark, signature, cut off, low contrast, underexposed, overexposed, bad art, beginner, amateur, distorted face, blurry, draft, grainy"
Midjourney негативных промптов в классическом виде не имеет. Используется параметр --no. Разница принципиальная: это не весовой вектор, а фильтр по классификатору. Менее гибко. Зато не ломает композицию.
Одна задача, три способа записать параметр — и все три несовместимы друг с другом.
// Stable Diffusion (через параметры разрешения, не через флаг):
width: 896, height: 1152 → приблизительно 3:4 (портрет)
width: 1344, height: 768 → приблизительно 16:9 (горизонталь)
// Midjourney v6 / Niji 6:
--ar 3:4 (портрет)
--ar 16:9 (кинематографический горизонт)
--ar 1:1 (квадрат, дефолт)
--ar 9:16 (вертикаль, Reels / Stories)
// DALL-E 3 через API (OpenAI):
"size": "1024x1792" // портрет
"size": "1792x1024" // ландшафт
"size": "1024x1024" // квадрат
// Других соотношений нет. Это не баг, это ограничение архитектуры.
DALL-E 3 не поддерживает произвольные разрешения через публичный API — только три фиксированных варианта. Для брендовых форматов (например, 4:5 для Instagram-ленты) придётся кропать вручную или постпроцессить через outpainting.
Промпт без структуры — это как руль без рулевой рейки: крутится легко, но машина едет прямо. Существует рабочая иерархия токенов, подтверждённая экспериментально на моделях SDXL и Midjourney v6.
[СУБЪЕКТ] + [ДЕЙСТВИЕ/ПОЗА] + [ОКРУЖЕНИЕ] + [ОСВЕЩЕНИЕ] + [СТИЛЬ/МЕДИУМ] + [ТЕХНИЧЕСКИЕ ПАРАМЕТРЫ]
Пример для Midjourney v6:
"close-up portrait of a female botanist examining rare orchid specimen,
soft diffused natural light from laboratory window,
photorealistic, shot on Hasselblad X2D,
shallow depth of field, muted earth tones,
National Geographic editorial style --ar 3:4 --v 6.1 --style raw --q 2"
Пример для Stable Diffusion (SDXL Juggernaut):
"(close-up portrait:1.3) of female botanist,
(examining rare orchid:1.1), white laboratory background,
(soft window light:1.2), photorealistic skin texture,
Canon EOS R5 rendering, 8k uhd, hyperdetailed"
Веса в скобках (токен:1.3) — синтаксис AUTOMATIC1111 и ComfyUI. В Midjourney это не работает. В DALL-E 3 промпт переписывается внутренним препроцессором — ваша структура частично теряется, модель добавляет свои интерпретации.
«The prompt is not the instruction. The prompt is the initial condition of a dynamical system.» — Demis Hassabis, интервью MIT Technology Review, 2023
Задача: создать 12 вариантов product shot для линейки косметики (флаконы 200 мл) с разными фонами для A/B-теста карточек на маркетплейсе. Бюджет на фотосессию — ноль. Срок — 4 часа.
Инструмент: ComfyUI + SDXL Turbo + ControlNet (Canny edge для сохранения формы флакона). Референс-изображение флакона загружалось как ControlNet input с весом 0.85, что удерживало силуэт. CFG Scale — 6.0 (Turbo-модели конфликтуют с высоким CFG). Sampling — LCM, 8 шагов (скорость генерации одного изображения 1024×1024 — 1.8 сек на RTX 4070).
// Промпт для product photography (SDXL Turbo + ControlNet Canny):
Positive: "luxury cosmetic bottle, studio product photography,
(white marble surface:1.2), soft bokeh background,
(professional lighting setup:1.3), 8k commercial photography,
photorealistic, no shadows harsh, clean minimal composition"
Negative: "text, label distortion, reflection artifacts,
extra objects, busy background, overexposed highlights,
plastic look, fake 3D render"
ControlNet: canny_edge, weight: 0.85, start: 0.0, end: 0.7
CFG: 6.0 | Steps: 8 | Sampler: LCM | Size: 1024x1024
12 финальных вариантов готовы за 22 минуты включая итерации по отбраковке. Стоимость электричества и амортизации GPU — менее $0.15. Midjourney на той же задаче дал бы визуально более «глянцевый» результат, но без возможности удерживать форму оригинального флакона через ControlNet — форма плыла на 30–40% случаев даже с --cref. DALL-E 3 через API: $0.08 за изображение при размере 1024×1024, то есть 12 изображений = $0.96, без контроля формы вообще.
DPM++ 2M Karras — универсальный рабочий конь для реалистичных стилей при 25–40 шагах. Euler a — быстрее, но вносит больше случайности, хорошо работает для иллюстративных стилей. DDIM — нужен только если вы делаете img2img с точным контролем денойзинга. UniPC — относительно новый, даёт хорошие результаты на 15–20 шагах, недооценён. LCM и Lightning-версии — для real-time превью и итераций, не для финального рендера.
Midjourney скрывает sampling method от пользователя полностью. Это сознательное решение команды: меньше переменных — ниже порог входа. Платите $10/мес на Basic-плане, получаете 200 Fast GPU-минут. На Standard ($30/мес) — безлимитный Relax Mode, но очереди до 5 минут на генерацию.
Промпт без бюджетного расчёта — это как турбина без топлива: шумит, но не летит. Прежде чем выбирать инструмент, нужно вскрыть цифры. Не маркетинговые. Реальные — до копейки на 1000 генераций в 2026 году.
Считаем затраты. Три платформы. Три модели монетизации — подписка, API-токены, GPU-аренда. Ни одна из них не честна с тобой по умолчанию.
| Параметр | Stable Diffusion (Flux.1, локально / RunPod) | Midjourney v7 | DALL-E 3 (OpenAI API) |
|---|---|---|---|
| Базовая подписка (мес.) | $0 (локально) / $0.19–0.44/ч (RunPod A100) | $10 (Basic) / $30 (Standard) / $60 (Pro) / $120 (Mega) | Нет подписки — только pay-per-use через OpenAI API |
| Стоимость 1000 генераций (1024×1024) | ~$1.80–$4.20 (RunPod, Flux.1-dev, ~6–12 с/изображение на A100) | ~$4.00–$8.00 (Standard план, Fast Hours) | $40.00 (HD quality) / $4.00 (Standard quality) по $0.040 и $0.004 за изображение |
| Скрытые расходы | Электроэнергия (~$15–40/мес. при RTX 4090 локально), хранилище моделей (Flux.1-dev = 23.8 GB), время на devops-настройку ComfyUI / Automatic1111 | Relax-режим = очереди до 10 мин. Fast Hours расходуются непредсказуемо при Vary/Upscale. Overage: $4 за 60 Fast Hours сверх лимита | Модерация режет ~3–7% запросов без возврата средств. GPT-4o Vision-интеграция добавляет $0.00250/1K input-токенов при image-to-image сценариях |
| Качество (PhotoRealism) | ⭐⭐⭐⭐⭐ — Flux.1-pro превосходит SD XL по FID-score, детализации рук, тексту на изображениях | ⭐⭐⭐⭐⭐ — лидер по художественному стилю, когерентности сцены, «голливудской» эстетике | ⭐⭐⭐⭐ — сильный текстовый рендер, слабее в фотореализме анатомии |
| Качество (Типографика / текст в кадре) | ⭐⭐⭐⭐ — Flux.1 закрыл этот баг. SD 1.5/XL — по-прежнему провал | ⭐⭐⭐ — улучшилось в v7, но нестабильно при кириллице | ⭐⭐⭐⭐⭐ — лучший в классе для инфографики и леттеринга |
| Скорость генерации | 6–15 с (A100, Flux.1-dev) / 25–90 с (RTX 3080, локально) | 15–45 с (Fast mode) / 5–15 мин (Relax mode) | 8–25 с (API, стандартный эндпоинт) |
| Контроль над результатом | Максимальный: ControlNet, LoRA, CFG Scale, seed, sampler (DPM++ 2M Karras и т.д.) | Средний: --stylize, --chaos, --weird, --style raw — но черный ящик |
Минимальный: промпт + style preset. Нет seed-контроля через API v1 |
| Коммерческие права | Полные (модели Apache 2.0 / CreativeML OpenRAIL). Никаких роялти | Полные при подписке Standard+ (Basic = ограничения для компаний с доходом >$1M) | Полные по ToS OpenAI, но платформа хранит промпты для обучения |
| ROI: Фрилансер (50 изображений/день) | RunPod: ~$27/мес. операционных затрат. При чеке $5/изображение = $7500 выручки. Маржа ~99.6% | Pro-план $60/мес. + overage ~$20. При чеке $5/изображение = $7500 выручки. Маржа ~98.9% | $200/мес. (HD). При чеке $5/изображение = $7500 выручки. Маржа ~97.3% |
| ROI: Студия (2000 изображений/день) | Собственный сервер (RTX 4090 ×4) = ~$12 000 CAPEX + $120/мес. электроэнергия. Окупаемость при потоке — 4–6 месяцев | Mega $120/мес. = 60 Fast Hours. 2000/день = перерасход. Реальные затраты: $800–$1200/мес. | 2000/день HD = $80/день = $2400/мес. Неприемлемо без кэширования результатов |
Stable Diffusion на собственном железе — абсолютный победитель по удельной стоимости при объёме от 500 генераций/день. RunPod даёт $0.0018–$0.0042 за изображение. Это в 10–22 раза дешевле DALL-E HD. Точка.
Midjourney Standard ($30/мес.) при умеренном потоке — 200–400 изображений в месяц — выигрывает у RunPod за счёт нулевых операционных издержек на инфраструктуру: не нужно разворачивать ComfyUI, писать workflow-ноды или управлять Docker-контейнерами с моделями весом в 24 гигабайта каждая.
DALL-E 3 Standard ($0.004/изображение) конкурентоспособен только в одном кейсе: автоматизированные пайплайны с жёстким требованием к рендеру текста внутри изображения — баннеры, карточки товаров с подписями, инфографика. Там его типографика окупает переплату.
Fast Hours — не просто «время генерации». Это GPU-минуты, которые сгорают при каждом Upscale, Vary (Strong), Re-roll и Pan. Одна сессия работы над одним изображением через V → Upscale → Vary → Upscale снова = 4–7 Fast Hour-транзакций вместо одной.
Реальная стоимость финального изображения в Midjourney Pro — не $0.008, а $0.024–$0.056, если учитывать итерации. Студийный процесс это ломает.
# Пример расчёта реальной стоимости Midjourney Pro
# Plan: Pro ($60/мес = 900 Fast GPU Hours)
# Среднее время одной генерации (v7): ~20 сек = 0.00556 ч
# Теоретический лимит:
900 / 0.00556 = ~161,870 генераций/мес.
# Но: каждая итерация (Vary/Upscale) = +0.00556 ч
# Среднее число итераций на финальный результат: 4.3 (студийный процесс)
# Реальный лимит финальных изображений:
161870 / 4.3 = ~37,644 финальных изображений/мес.
# Реальная стоимость одного финального изображения:
$60 / 37644 = ~$0.00159...
# Но с учётом overage при перерасходе ($4 / 60 Fast Hours):
# Overage rate = $0.0667/час = $0.00037/генерацию × 4.3 итерации = $0.00159 overage/изображение
На RunPod при использовании Flux.1-dev через ComfyUI критичны три параметра, напрямую определяющих время GPU и, следовательно, стоимость:
{
"model": "flux1-dev.safetensors",
"steps": 20, // 20 = оптимум качество/скорость; 28+ = +40% времени без видимого прироста
"guidance_scale": 3.5, // Flux игнорирует CFG >4.5; не трать GPU на высокие значения
"width": 1024,
"height": 1024, // 1024×1024 = базовый; 1536×1024 = +55% VRAM и времени
"sampler": "euler", // euler быстрее dpm++ на Flux-архитектуре
"scheduler": "simple"
}
При steps: 28 вместо 20 стоимость одной генерации на A100 растёт с $0.0038 до $0.0053. На 10 000 изображений — разница $15. Множь на 30 дней — это $450 чистого перерасхода за ошибку в одном параметре.
Фрилансер, <300 изображений/мес., нет времени на DevOps: Midjourney Standard $30. Закрывает 80% задач, нулевой порог входа.
Фрилансер, 300–1000 изображений/мес., нужен контроль стиля: RunPod + Flux.1-dev + ComfyUI. Инвестиция времени — 8–12 часов на настройку. Возврат — экономия $40–180/мес. начиная со второго месяца.
Студия, 2000+ изображений/день, серийное производство контента: Собственный сервер на 4× RTX 4090 (~$12 000) + Flux.1-pro API ($0.055/изображение через fal.ai или Replicate). CAPEX окупается за 5–7 месяцев против Midjourney Mega + overage.
Пайплайн с текстом в изображениях, автоматизация через API: DALL-E 3 Standard ($0.004) — единственный вариант с предсказуемым рендером кириллицы и латиницы без постобработки.
Работать с Midjourney через Discord — это как программировать станок с ЧПУ через чат. Работает. Но 500 итераций в день руками не сделаешь. Здесь и начинается разговор о реальных пайплайнах.
Stable Diffusion (в связке с AUTOMATIC1111 или ComfyUI) открывает полный REST API прямо из коробки — достаточно запустить --api флаг при старте WebUI. ChatGPT Images через OpenAI API стоит $0.04 за одну генерацию 1024×1024 (модель dall-e-3, tier Standard, актуально на 2026). Midjourney API находится в закрытой бете — доступ через запрос на midjourney.com/api, стоимость ориентировочно $0.04–$0.08 за изображение в зависимости от плана. Это уже другие деньги при серийной работе.
ControlNet — это модуль поверх диффузионной модели, который принимает conditioning-изображение (depth map, canny edges, pose skeleton, lineart) и жёстко удерживает структуру генерации. Без него img2img — это лотерея с низкой детерминированностью. С ним — воспроизводимый результат.
Практически это выглядит так: берёшь OpenPose-скелетон персонажа из исходного фото, передаёшь его в ControlNet с весом control_weight: 0.85 и получаешь нового персонажа в той же позе. Не «похожей». Той же — до градуса сустава. Это критично для fashion-ретейла, анимации, инвентарных съёмок.
Задача: интернет-магазин электроники, 2400 SKU, каждому товару нужен lifestyle-фон. Штатная фотостудия — 3 недели и $18 000. Альтернатива: автоматизированный пайплайн на базе AUTOMATIC1111 API.
Решение строится в три слоя. Первый — background removal через rembg (Python-либа). Второй — img2img с inpainting через API AUTOMATIC1111, где фон генерируется по шаблонному промпту с фиксированным seed. Третий — webhook-триггер на выход готового изображения, который пушит файл напрямую в S3 и обновляет запись в БД товара.
import requests, base64
def generate_lifestyle_bg(product_image_b64: str, seed: int = 42) -> bytes:
payload = {
"init_images": [product_image_b64],
"prompt": "minimalist studio background, soft gradient, light grey surface, product photography, 8k, sharp focus",
"negative_prompt": "text, watermark, people, clutter, noise, blurry",
"denoising_strength": 0.68,
"sampler_name": "DPM++ 2M Karras",
"steps": 28,
"cfg_scale": 7.5,
"seed": seed,
"width": 1024,
"height": 1024,
"inpainting_fill": 1,
"inpaint_full_res": True,
"mask_blur": 4,
"alwayson_scripts": {
"controlnet": {
"args": [{
"enabled": True,
"module": "canny",
"model": "control_v11p_sd15_canny",
"weight": 0.75,
"guidance_start": 0.0,
"guidance_end": 0.85
}]
}
}
}
response = requests.post(
"http://127.0.0.1:7860/sdapi/v1/img2img",
json=payload,
timeout=120
)
result = response.json()
return base64.b64decode(result["images"][0])
Seed зафиксирован на 42 для всей батч-серии. Это гарантирует консистентность цветовой температуры и теней между карточками. Если seed плавает — маркетплейс смотрится как свалка, а не каталог. Один скрипт, запущенный на VPS с RTX 3090, обработал 2400 изображений за 11 часов. Итоговые затраты: $220 на аренду облачного GPU (RunPod, $0.44/час).
Figma Plugin API позволяет принимать blob-изображения через figma.createImageAsync() прямо в активный фрейм. Схема: AUTOMATIC1111 генерирует батч → POST-запрос на webhook-эндпоинт твоего Figma-плагина → изображение появляется в нужном слое дизайна. Без ручного drag-and-drop. Без экспорта-импорта.
Adobe Firefly API (доступен через Adobe Developer Console, $0.033 за генерацию в режиме Standard) поддерживает входящие webhook-колбэки через x-api-key + jobId-поллинг. Это значит: запускаешь 50 генераций асинхронно, получаешь колбэк на свой сервер, когда каждая готова. Latency на генерацию — 8–14 секунд против 4–7 секунд у AUTOMATIC1111 на локальном GPU.
«The rate of progress in AI is going to be quite stunning over the next few years. But the value comes from integrating it into existing workflows, not from running it in isolation.»
Denoising strength 0.45–0.55 — если хочешь сохранить форму объекта. Выше 0.7 — модель «забывает» исходник и генерирует почти с нуля. CFG Scale выше 9.0 начинает давать артефакты и oversaturation — это не стилизация, это ошибка. Sampler DPM++ 2M Karras при 20–28 шагах даёт оптимальный баланс качества и скорости; DDIM стабильнее при inpainting, но медленнее на 15–20%.
Батч-генерация в AUTOMATIC1111 через параметр "batch_size": 4 при одном запросе в 4 раза быстрее, чем 4 последовательных запроса — VRAM загружается один раз, модель не перегружается. На RTX 4090 батч из 4 изображений 1024×1024 занимает ~9 секунд против ~28 секунд при последовательной генерации.
Неофициальные Midjourney API (MJApi.io, UseAPI.net) — это прокси через Discord-аккаунты. Стоимость: от $29/мес за 100 генераций до $299/мес за неограниченный доступ. Latency: 15–45 секунд. Rate limit: жёсткий. Надёжность: 92–95% uptime по независимым замерам. Для production-пайплайна с SLA — неприемлемо. Для контентных агентств с нежёстким расписанием — работает.
Stable Diffusion через собственный GPU или RunPod — единственный вариант, где ты контролируешь latency, cost-per-image и версионирование модели одновременно. Flux.1-dev (преемник SD) на тех же железках показывает прирост качества промпт-следования на ~40% по Human Preference Score v2 бенчмарку относительно SDXL.
Промпт без параметров — это как руль без рулевой рейки: движение есть, управления нет. Новичок пишет «красивая женщина на фоне города» и получает стоковую безликость. Модель не виновата. Она дала медианный ответ на медианный запрос.
Структура рабочего промпта состоит из шести обязательных слоёв: субъект → окружение → освещение → стиль → техническое качество → негативный промпт. Пропусти хотя бы два — и вариативность результата вырастает до 80%. Это не метафора. Это измеримый показатель cosine similarity между эмбеддингами целевого и полученного изображения в тестах CLIP Score.
Считаем потери. Если ты генеришь 50 изображений по $0.04 за штуку в DALL-E 3 API (1024×1024, стандартное качество) и 70% уходит в брак — ты тратишь $1.40 впустую. Каждый день. За месяц — $42 на мусор.
1. Абстрактные прилагательные без технических якорей. «Красивый», «реалистичный», «эпический» — не параметры, а шум. Модели Flux.1 и SDXL обучались на тегах из LAION-5B, где «красивый» встречается в 340 млн записей без какой-либо визуальной корреляции. Заменяй на конкретику: golden hour lighting, f/1.8 bokeh, shot on Sony A7R V.
2. Игнорирование негативного промпта. Без него модель свободна генерировать артефакты рук (6 пальцев — классика Stable Diffusion 1.5), смазанные лица, watermark-паттерны. Минимальный негативный промпт для портрета: extra fingers, deformed hands, blurry, low quality, watermark, text, duplicate. Точка.
3. Неверный CFG Scale. В Automatic1111 и ComfyUI значение CFG (Classifier-Free Guidance) по умолчанию стоит 7. При значениях выше 12 — пересвет, артефакты, «выжженные» цвета. Для фотореализма оптимальный диапазон: 5–8. Для иллюстративных стилей: 8–11.
4. Неправильное соотношение сторон под платформу. Midjourney генерирует квадрат по умолчанию. Instagram Reels требует 9:16. Без параметра --ar 9:16 — постпроцессинг и потеря качества при кадрировании. В DALL-E 3 API параметр size: "1024x1792" соответствует портретному формату.
5. Смешивание несовместимых стилей. «Hyperrealistic oil painting cyberpunk watercolor» — это не творческий эксперимент, это конфликт весов в attention layers. Модель усредняет. Результат — ни то ни другое.
6. Игнорирование seed для итераций. Если первая генерация дала 80% нужного результата — зафиксируй seed. В Midjourney: --seed 42. В Stable Diffusion — поле Seed в интерфейсе. Без фиксации — каждая итерация стартует с нуля.
7. Работа с базовой моделью без LoRA. Для коммерческих задач (продуктовая съёмка, брендинг, архвизуализация) базовый SDXL даёт результат категории «сойдёт». Специализированные LoRA-адаптеры под конкретную задачу поднимают качество на 40–60% без изменения железа или тарифа.
8. Отсутствие upscale-шага. Нативное разрешение Stable Diffusion SDXL — 1024×1024. Для печати формата A4 при 300 dpi нужно минимум 2480×3508 px. Без upscale через Real-ESRGAN или ESRGAN 4x — размытие при печати. Midjourney решает это автоматически через --upscale, но только в версии v6+.
9. Игнорирование sampling method. DPM++ 2M Karras при 20 шагах даёт сопоставимое качество с Euler a при 40 шагах. Это вдвое меньше GPU-времени. На бесплатном тарифе Stable Diffusion через RunPod это разница между 8 и 4 центами за генерацию.
10. Коммерческое использование без проверки лицензии модели. Flux.1 [dev] — non-commercial. Flux.1 [schnell] — Apache 2.0, коммерческое использование разрешено. Midjourney Pro ($60/мес) включает коммерческие права. Basic ($10/мес) — нет. Ошибка стоит дороже, чем разница в подписке.
11. Генерация лиц без inpainting-финализации. Даже лучшие модели на лицах крупным планом дают артефакты при разрешении выше 768px в базовой генерации. Workflow: генерация → crop лица → inpainting с низкой denoise strength (0.3–0.5) → merge. Этот шаг убирает 90% проблем с анатомией лица.
12. Отсутствие базового цветового профиля. PNG из Stable Diffusion выходит без embedded ICC profile. Adobe RGB vs sRGB — разница в насыщенности до 15% при печати. Перед передачей в типографию: конвертация в sRGB через ImageMagick или Photoshop обязательна.
Задача: сгенерировать 10 вариантов упаковки крема на белом фоне для карточки товара на Wildberries (требования: 900×1200 px, белый фон #FFFFFF, чёткий продукт, без теней на фон). Бюджет: до $3.
Инструмент: Stable Diffusion XL через Automatic1111, модель dreamshaperXL, LoRA product-photography-v2. Общая стоимость генерации 40 вариантов (отобрано 10) на RunPod A100 — $1.80.
Positive prompt:
product photography, skincare cream jar, white background #FFFFFF,
studio lighting, soft box, sharp focus, 8k, commercial photography,
no shadows, isolated product, photorealistic, Canon EOS R5, 85mm lens
Negative prompt:
shadow on background, gradient, texture on background, reflections,
people, hands, text, watermark, blurry, low quality, artstation,
painting, illustration, 3d render
Parameters:
Sampler: DPM++ 2M Karras
Steps: 25
CFG Scale: 7
Resolution: 1024x1024 (upscale to 1800x2400 via Real-ESRGAN 2x)
Seed: 1337 (fixed for series)
LoRA: product-photography-v2, weight: 0.75
Результат: 9 из 10 изображений прошли модерацию маркетплейса без ручной ретуши. Одно — потребовало inpainting крышки (артефакт текстуры). Общее время workflow от промпта до загрузки: 47 минут.
«The models are getting good enough that prompt engineering is becoming less of an art and more of a specification language.»
— Сэм Альтман, интервью для Lex Fridman Podcast, 2024
Используй как пре-флайт перед каждым серийным запуском. Не как вдохновение. Как технический регламент.
--ar или параметр size в API) соответствует целевой платформе.