Z-Image — фотореалистичное фото за 1,2 ₽ Veo 3.1 и Seedance — видео со звуком, от 120 ₽ Gemini Omni — говорящий персонаж с русской озвучкой GPT-5 и Claude 4.8 Opus — ответы от 3 ₽ Suno 5.5 — песня целиком за 99 ₽ Sora 2 и Kling 3 — уже внутри, за рубли Grok Video — рекламный ролик за 36 ₽ +20% бонусами к первому пополнению — до 6000 ₽

Нейросеть видео из фото: свои герои и товар в кадре

Нейросеть видео из фото: свои герои и товар в кадре

Нейросеть видео из фото в Вайб-Маркетологе научилась держать в кадре именно ваших героев: загрузите до семи снимков — человека, товар, интерьер, фирменный стиль — и опишите словами, что должно произойти. Модель соберёт ролик, в котором лицо, упаковка и цвет бренда останутся такими же, как на ваших фотографиях. Раньше ссылку на каждое фото приходилось набирать вручную, и одна лишняя запятая ломала всю задачу. Теперь ссылка вставляется одним нажатием на снимок, а описание проверяется до запуска генерации.

Нейросеть видео из фото: что изменилось в режиме «Референсы»

Режим «Референсы» живёт в модели PixVerse V6 на вкладке «Видео». Он отличается от привычного «оживления» кадра: там нейросеть берёт одну картинку и добавляет ей движение, а здесь вы даёте набор образцов и пишете сценарий с нуля. Фотографии работают как актёрский состав и реквизит — модель смотрит на них, чтобы понять, как выглядит герой, какой формы флакон и в каких цветах должен быть кадр.

Ссылку на фото вставляет нажатие, а не клавиатура

Каждому загруженному снимку платформа присваивает короткое имя — первое фото становится Image1, второе Image2 и так далее. В описании вы ссылаетесь на них, чтобы модель поняла, кто именно должен войти в дверь и какую коробку взять в руки. Прежде это имя нужно было напечатать самому, и здесь скрывалась ловушка: сервис распознаёт имя до ближайшего пробела, поэтому «Image1,» с запятой вплотную он читал как совсем другое имя и отклонял задачу целиком.

Теперь достаточно нажать на миниатюру нужного снимка — ссылка встанет в описание туда, где стоит курсор, с правильными отступами с обеих сторон. Курсор останется сразу за ней, чтобы вы продолжили фразу, не отвлекаясь. Если фото удалить, ссылки в описании пересчитаются сами: раньше после удаления второго снимка из трёх ссылка на третий повисала в пустоте и роняла генерацию.

Нейросеть видео из фото: нажатие на снимок вставляет ссылку на него в описание сцены

Описание проверяется до запуска, а не после

Под галереей референсов появилась подсказка, которая разбирает ваш текст ещё до нажатия кнопки. Она скажет, если в описании есть ссылка, которой не соответствует ни одно загруженное фото, и мягко напомнит, если какой-то снимок вы забыли упомянуть — такое фото модель может проигнорировать, и вы получите не тот результат, за который платили. Это принципиальный момент: любая проверка, которая срабатывает после списания, приходит слишком поздно.

Пунктуация больше не мешает писать по-человечески

Самое частое, что ломало генерацию, — обычная живая речь. «Хулиган пытается толкнуть девушку Image1, но она уходит в стойку» — фраза написана правильно, а запятая сразу за именем превращала его в незнакомое для сервиса слово. Платформа теперь расставляет служебные отступы сама, на стороне сервера, поэтому вы пишете сценарий так, как говорите, а техническими тонкостями занимается система. Это же исправление работает и для тех, кто обращается к платформе через API или поручает генерацию ИИ-агенту.

Кому пригодится видео из фото по описанию

Режим создавался для тех, у кого уже есть визуальный материал и нужен ролик, а не абстрактная красивая картинка из головы нейросети.

Магазину — товар в руках, а не похожий предмет

Если вы продаёте косметику, украшения или технику, обычная генерация видео нарисует «похожий» флакон: другая форма крышки, другой шрифт на этикетке. Загрузите фотографию своего товара как референс, добавьте кадр с моделью — и в ролике окажется именно ваша упаковка. Для маркетплейсов это разница между роликом, который можно поставить в карточку, и роликом, который вводит покупателя в заблуждение.

Личному бренду — одно и то же лицо во всех роликах

Эксперту, коучу, врачу, юристу важна узнаваемость: зритель должен видеть одного человека из выпуска в выпуск. Фотография лица в референсах удерживает внешность в кадре, поэтому серия коротких видео выглядит как единый контент одного автора, а не как галерея случайных персонажей.

Сценам с несколькими героями

Семь слотов позволяют собрать в кадре небольшую сцену: два человека, предмет, фон и фирменный элемент. В описании вы прямо распределяете роли — кто открывает дверь, кто держит коробку, где стоит вывеска. Именно ради таких сцен и нужны имена у снимков: без них нейросеть сама решает, кто есть кто, и обычно решает не так, как задумал автор.

Рекламному отделу — вариации одного креатива

Когда нужно проверить пять подходов к одному предложению, съёмка каждой версии превращается в отдельный проект. С референсами герой и товар остаются неизменными, а меняется только описание сцены: та же модель с тем же флаконом сначала в ванной комнате, потом в дороге, потом на рабочем столе. Получается серия однородных роликов для теста, где отличается ровно то, что вы проверяете, а не случайные детали внешности.

Тем, кто снимает короткие вертикальные ролики

Формат 9:16 поддерживается наравне с горизонтальным, а длительность от трёх секунд позволяет собирать короткие сцены под ленты соцсетей и рекламные площадки, не переплачивая за лишние секунды. Если нужна не сцена с нуля, а движение в готовом кадре, рядом в той же модели работает режим оживления фотографии.

Видео из нескольких фото нейросетью: герой, товар и фон в одной сцене

Как это работает

Внутри всё устроено просто, и понимать техническую сторону вам не нужно, но общая логика помогает писать описания точнее.

Загруженные снимки уходят в модель отдельным списком, где у каждого есть имя. Ваше описание — это сценарий, в котором вы обращаетесь к этим именам. Нейросеть сопоставляет одно с другим: встречая ссылку, она подставляет в это место сцены внешность с соответствующего фото. Чем конкретнее описание — кто что делает, куда движется камера, какое время суток — тем ближе результат к задуманному.

Несколько правил, которые заметно повышают попадание с первого раза. Упоминайте каждое загруженное фото хотя бы один раз, иначе снимок останется без роли. Описывайте действие, а не только внешность: «выходит из двери и оборачивается» работает лучше, чем «стоит красиво». Указывайте план и движение камеры — крупный план, наезд, лёгкое покачивание. И не перегружайте один ролик: три-четыре секунды действия на одну сцену дают более чистый результат, чем попытка уместить целую историю в десять секунд.

Звук модель генерирует вместе с изображением, отдельным шагом озвучивать ролик не нужно. Если звук не требуется — отключите его и заплатите меньше.

Сколько стоит видео из фото

Оплата посекундная, без подписки и абонентской платы: вы платите только за секунды готового ролика. Тариф зависит от двух вещей — разрешения и наличия звука.

РазрешениеБез звукаСо звукомРолик 5 секунд со звуком
360p4 ₽/сек6 ₽/сек30 ₽
540p6 ₽/сек8 ₽/сек40 ₽
720p8 ₽/сек10 ₽/сек50 ₽
1080p15 ₽/сек19 ₽/сек95 ₽

Для черновика сцены разумно взять 360p и убедиться, что композиция и роли распределены верно, а уже финальный дубль собрать в 720p или 1080p. Проверка идеи обойдётся в сумму меньше чашки кофе, и это честнее, чем платить за высокое разрешение до того, как стало ясно, работает ли сама задумка.

Если генерация не удалась по вине сервиса, деньги возвращаются на баланс автоматически — отдельно ничего просить не нужно.

Как попробовать

  1. Откройте вкладку «Видео» в кабинете и выберите модель PixVerse V6.
  2. В переключателе режимов нажмите «Референсы».
  3. Загрузите от одного до семи фотографий: героя, товар, фон, фирменный элемент.
  4. Нажмите на нужный снимок — ссылка на него встанет в описание.
  5. Допишите сценарий вокруг ссылок: что происходит, как движется камера, какое настроение.
  6. Выберите длительность, разрешение и нужен ли звук — стоимость пересчитается сразу.
  7. Проверьте подсказку под галереей: она предупредит, если какое-то фото осталось без роли.
  8. Запустите генерацию и заберите готовый ролик из истории генераций.

Что учесть при первой генерации

Несколько наблюдений, собранных по реальным попыткам пользователей за последний месяц — они экономят и деньги, и время.

Фотография решает больше, чем описание

Снимок в тени, с сильным поворотом головы или в низком разрешении даёт размытую внешность в ролике, сколько бы уточнений вы ни добавили в текст. Перед загрузкой посмотрите на фото глазами покупателя: понятно ли, как выглядит человек и что за предмет у него в руках. Товар лучше снимать на однородном фоне — тогда нейросети не приходится гадать, где заканчивается упаковка и начинается стол.

Роли распределяйте явно

Формулировка «двое стоят у входа» оставляет модели свободу, и она ею воспользуется. «Первый герой открывает дверь, второй выходит следом с коробкой» — уже сценарий, где каждому снимку назначено действие. Чем однозначнее распределение, тем меньше дублей потребуется.

Начинайте с короткого ролика

Три-пять секунд достаточно, чтобы понять, поймала ли модель замысел. Если сцена собралась верно, тот же текст можно повторить на большей длительности и в высоком разрешении. Это дешевле, чем сразу заказывать пятнадцать секунд в 1080p и обнаружить, что герой смотрит не в ту сторону.

Готовые ролики никуда не пропадают

Все генерации складываются в историю кабинета: их можно пересмотреть, скачать, показать коллеге или взять за основу следующей сцены. Ролик остаётся доступным и после того, как вы закрыли вкладку — ждать на странице не нужно, платформа сообщит о готовности.

Профиль бренда подхватывается автоматически

Если в кабинете заполнен профиль компании — название, палитра, тон общения, — платформа учитывает его при генерации, не заставляя повторять эти сведения в каждом описании. Так ролики разных сотрудников выходят в одной стилистике, даже если сценарии пишут разные люди.

Частые вопросы

Сколько фотографий можно загрузить в один ролик?

До семи. Практика показывает, что три-четыре снимка дают более предсказуемый результат: чем больше объектов нужно удержать в кадре одновременно, тем сложнее модели собрать сцену без искажений.

Нужна ли подписка, чтобы сделать видео из фото нейросетью?

Нет. Оплата только за секунды готового ролика, деньги списываются с баланса кабинета. Абонентской платы и обязательного тарифа нет.

Чем режим «Референсы» отличается от оживления фотографии?

Оживление берёт одну картинку и добавляет ей движение — композиция остаётся той же, что на снимке. «Референсы» строят новую сцену по вашему описанию, а фотографии служат образцами внешности. Если нужно, чтобы кадр остался прежним, выбирайте оживление; если нужна новая сцена с вашими героями — «Референсы».

Сохранится ли лицо человека точно таким же?

Внешность узнаваема, но это не фотокопия: нейросеть перерисовывает героя в новой сцене. Чем лучше исходный снимок — резкий, при хорошем свете, лицо крупно и без сильного поворота, — тем ближе сходство.

Можно ли сделать вертикальное видео из фото для соцсетей?

Да, доступен формат 9:16, а также горизонтальный и квадратный. Пропорция выбирается до генерации и на цену не влияет — на неё влияют разрешение, звук и длительность.

На каком языке писать описание?

На русском. Описывайте сцену обычными словами, знаки препинания расставляйте как удобно — платформа приведёт текст к нужному виду сама.

Сколько ждать готовый ролик?

Обычно от одной до нескольких минут — время зависит от длительности, разрешения и загруженности сервиса. Ждать на странице не обязательно: можно закрыть вкладку и вернуться позже, готовый ролик будет ждать в истории генераций.

Можно ли использовать такие ролики в рекламе?

Да, готовое видео вы скачиваете себе и распоряжаетесь им как своим материалом: карточка товара на маркетплейсе, лента в соцсетях, рекламный кабинет. Единственное разумное ограничение касается исходников: загружайте фотографии, права на которые есть у вас, — свои снимки, съёмку товара, изображения сотрудников с их согласия.

Что делать, если герой в ролике получился не похож?

Чаще всего дело в исходной фотографии. Замените снимок на более резкий, где лицо занимает заметную часть кадра и смотрит примерно в камеру, и повторите генерацию на короткой длительности. Если нужен максимально точный внешний вид товара, добавьте второй ракурс тем же референсом — нейросеть видео из фото собирает форму предмета точнее, когда видит его с двух сторон.

Что будет, если генерация не удалась?

Если сбой произошёл на стороне сервиса, списанные деньги возвращаются на баланс автоматически, и в истории генераций у попытки появляется пометка с причиной. Обращаться в поддержку за возвратом не нужно — но если причина непонятна, напишите нам, мы разберёмся вместе.

Коротко

Нейросеть видео из фото в режиме «Референсы» перестала требовать от человека знания служебного синтаксиса: ссылка на снимок ставится нажатием, описание проверяется до списания, а пунктуация внутри фразы больше ни на что не влияет. Остаётся то, ради чего инструмент и нужен — собрать ролик со своими героями и своим товаром за несколько десятков рублей. Рядом в каталоге работают Seedance 2.5 с роликами до 30 секунд и монтажная студия для сборки роликов, а собрать из готовых роликов рекламные креативы помогает русская озвучка роликов.

Собрать видео из своих фото Академия Пошаговый разбор со скриншотами: Как сделать видео из фото нейросетью