Генеративные модели: короткая карта местности
Моделей много, а задач у обычного человека — три: сделать картинку, отредактировать готовую картинку и получить короткое видео. Ниже — что под какую задачу брать и чем инструменты реально отличаются друг от друга.
Что выбрать под задачу
| Задача | Чем делать | Что учесть |
|---|---|---|
| Правка готового фото: убрать объект, поменять фон, переодеть героя | Nano Banana | Держит лицо и композицию между правками — главное её отличие |
| Картинка с нуля по описанию | Nano Banana, Midjourney, Flux | Тут разница в основном в стиле «по умолчанию», а не в качестве |
| Короткое видео из текста или из одной картинки | Seedance, Kling | 5–10 секунд за раз; длинное собирается из кусков |
| Видео со звуком и репликами | Veo | Единственный из перечисленных, кто генерирует звук вместе с картинкой |
Три вещи, которые экономят больше всего времени
- Не переписывайте промпт целиком. Меняйте по одному параметру за итерацию — иначе непонятно, что именно улучшило результат.
- Сохраняйте удачные промпты. Заведите текстовый файл: рабочая формулировка ценнее готовой картинки, её можно применить ещё сто раз.
- Начинайте с картинки, а не с текста, если делаете видео. Сначала добейтесь нужного кадра в генераторе изображений, потом оживляйте его — управляемость выше.
Nano Banana
Модель Google для генерации и — что важнее — редактирования изображений обычными словами. Вы даёте фотографию и говорите, что с ней сделать.
Зачем её берут
- Постоянство персонажа. Лицо остаётся тем же лицом после десяти правок подряд — то, на чём сыпалось большинство прошлых редакторов.
- Правка словами. Не нужны маски и слои: «убери провода на фоне» работает как есть.
- Смешивание кадров. Можно подать несколько изображений и попросить собрать из них один.
Как формулировать правку
Работает принцип «одна правка — одна фраза». Модель понимает обычную речь, но плохо реагирует на список из семи требований сразу.
сделай фото лучше, поменяй фон на город, убери лишнее, добавь контраст, пусть будет вечер и куртка другая
1) замени фон на вечернюю городскую улицу, освещение от витрин слева, героя не трогай 2) теперь поменяй куртку на джинсовую, остальное сохрани 3) добавь лёгкую дымку на заднем плане, чтобы отделить героя от фона
Что помогает
- Прямо просите сохранить то, что менять не надо: «лицо и позу оставь как есть».
- Указывайте источник света — «свет сзади слева» даёт предсказуемый результат чаще, чем «красиво освети».
- Для замены объекта опишите не только новый объект, но и как он должен вписаться: «поставь на стол чашку, тень падает вправо, как у остальных предметов».
Seedance
Видеомодель от ByteDance. Делает короткие ролики из текста или из одной картинки; сильная сторона — движение камеры и связность сцены при смене плана.
Два режима
Текст → видео
Быстрее всего попробовать, но кадр каждый раз новый. Годится, когда важен сюжет, а не конкретная внешность героя.
Картинка → видео
Даёте готовый кадр — модель его оживляет. Управляемость заметно выше: композиция и герой уже зафиксированы вами.
Структура промпта для видео
В отличие от картинки, в видео нужно описать ещё и что меняется во времени. Рабочая схема — четыре блока подряд:
[кто и что в кадре] → [что делает] → [камера] → [свет и стиль] пример: пожилой рыбак чинит сеть на деревянном причале, поднимает голову и смотрит вдаль, камера медленно едет вправо и чуть приближается, раннее утро, туман над водой, мягкий холодный свет
Движение камеры — словарь
| Хотите | Пишите |
|---|---|
| Камера приближается | медленный наезд, dolly in |
| Камера едет вбок | проезд влево / вправо, tracking shot |
| Облёт вокруг объекта | орбита вокруг героя, orbit shot |
| Камера стоит | статичный кадр, штатив |
Veo
Видеомодель Google. Главное отличие от остальных — генерирует звук вместе с картинкой: шумы окружения, музыку и реплики персонажей.
Как заказать звук
Звук описывается в том же промпте, отдельным предложением. Реплики — в кавычках.
двое сидят в вагоне поезда у окна, вечер, за стеклом мелькают огни. звук: стук колёс, приглушённый гул вагона. она говорит: «мы почти приехали».
Что учитывать
- Реплику стоит держать короткой — на пару секунд. Длинная не влезает в ролик и обрывается.
- Если звук не нужен, так и напишите: «без музыки, только шум улицы». Иначе модель добавит фоновую музыку по своему вкусу.
- Физика в кадре обычно убедительнее, чем у конкурентов: вода, ткань, дым ведут себя правдоподобно. На этом и стоит строить сцену.
Kling
Видеомодель Kuaishou. Ценится за естественное движение человека — походку, жесты, мимику. Частый выбор, когда в кадре живой герой, а не пейзаж.
Полезные приёмы
- Стартовый и финальный кадр. Можно задать обе крайние точки — модель придумает движение между ними. Самый управляемый режим из всех.
- Одно действие на ролик. «Встаёт со стула» — сработает. «Встаёт, подходит к окну, открывает его и закуривает» — почти наверняка развалится.
- Негативный промпт. Отдельным полем перечислите, чего быть не должно: лишние пальцы, дрожание камеры, искажения лица.
Промпты: общие правила
Приёмы ниже одинаково работают почти во всех моделях — и для картинок, и для видео.
Порядок слов имеет значение
Первое в промпте весит больше последнего. Ставьте вперёд главное — субъект и действие, а стиль и техничку оставляйте в хвосте.
кинематографично, 8k, детализировано, красиво, женщина с зонтом
женщина с красным зонтом переходит улицу под дождём, вид сзади, вечер, отражения фонарей в лужах, кинематографичный кадр, мягкий боковой свет
Пять рычагов, которые стоит крутить
Ракурс
вид сверху, с уровня глаз, снизу, вид сзади, крупный план
Свет
контровой, мягкий рассеянный, жёсткий полуденный, неон, золотой час
Оптика
широкий угол, портретный объектив, малая глубина резкости
Материал
матовый пластик, шершавый бетон, мокрый асфальт, лён
Настроение
тревожно, спокойно, торжественно — влияет на цвет и композицию
Что почти никогда не помогает
- Нагромождение усилителей: «супер ультра максимально детализировано 16k».
- Абстрактные оценки: «красиво», «качественно», «профессионально».
- Отрицания внутри основного промпта: «без людей» часто читается как «люди». Для этого есть отдельное поле негативного промпта.
Частые вопросы
Почему один и тот же промпт даёт разный результат?
Из-за случайного сида. Если модель позволяет его задать — зафиксируйте, и результат станет воспроизводимым. Тогда же можно менять по одному слову и честно сравнивать, что изменилось.
Руки и пальцы всё ещё выходят кривыми?
Реже, чем пару лет назад, но случается. Дешёвый обход — не делать руки главным в кадре: другой ракурс, руки в карманах, предмет в руках. Либо перегенерировать только проблемную область в редакторе.
Как получить одного и того же героя на разных картинках?
Прикладывать один и тот же реф на каждой генерации и просить сохранить внешность. Модели с редактированием (Nano Banana) держат персонажа лучше, чем генерация с нуля по одному лишь описанию.
Видео получается дёрганым, объекты «плывут».
Почти всегда причина — слишком много событий в одном ролике. Оставьте одно действие и один тип движения камеры. Второй по частоте виновник — слишком подробный фон: модель тратит «внимание» на него.
Что делать с мелким текстом на картинке?
Не генерировать его вовсе. Оставьте пустое место — вывеску, табличку, этикетку — и наберите текст сверху в любом редакторе. Так быстрее и результат предсказуем.
Сколько попыток — это нормально?
Для картинки — три-пять итераций до приемлемого. Для видео — больше, потому что проверять приходится не кадр, а движение. Если после десятка попыток не сдвинулось, проблема обычно в постановке задачи, а не в модели.