MiniMax H3: видео 2K со звуком от 148 ₽
Видео нейросетью со звуком теперь можно получить сразу в 2K и с готовой стереодорожкой: в Вайб-Маркетологе открылась MiniMax H3 — новая флагманская модель компании MiniMax, известной по семейству Hailuo. Она не просто рисует картинку и оставляет вас наедине с монтажом: звук рождается вместе с изображением, в одном проходе. Шаги по мокрому камню, ветер в листве, музыкальная подложка, реплика героя — всё это модель сочиняет синхронно с кадром. Длительность — от 4 до 15 секунд, оплата посекундная: 37 ₽ за секунду, то есть от 148 ₽ за короткий ролик, в рублях и без подписки.

Что нового: MiniMax H3 и три способа получить видео со звуком
Главное отличие MiniMax H3 от большинства видеомоделей — она мультимодальная не на словах. Одним запросом модель принимает текст, изображения, видео и аудио, понимает их вместе и выдаёт цельный результат. Поэтому в кабинете она живёт не как три разные карточки, а как одна модель с переключателем режимов: вы выбираете, из чего делаете ролик, а остальное совпадает.
Режим «По описанию» — видео из текста
Классический text-to-video, но с двумя важными поправками. Первая — разрешение: на выходе честные 2560×1440, это 2K, а не апскейл из мыла. Такое видео не стыдно поставить на главный экран сайта или показать на переговорах с проектора. Вторая — звук: он приходит в том же файле, отдельной дорожкой, и совпадает с тем, что происходит в кадре. Если вы описали дождь по жестяному карнизу, вы услышите дождь по жестяному карнизу.
Формат кадра выбирается из шести: 16:9 для сайта и YouTube, 9:16 для Reels, Shorts и сторис, 1:1 для ленты, 4:3 и 3:4 для карточек товара, а также кинематографический 21:9 для широких промо-баннеров. Промпт можно писать длинный, до 7000 символов, — модель хорошо держит подробную раскадровку с таймингами вида «0–3 секунды: общий план, 3–7 секунд: наезд на лицо».
Режим «Оживить кадры» — видео из вашей картинки
Сюда загружается готовое изображение, и оно становится опорным кадром ролика. Можно добавить второй — тогда модель строит движение от первого кадра ко второму, то есть вы задаёте и начало, и финал. Это удобно, когда нужен предсказуемый результат: скажем, товар лежит на столе, а в конце он должен оказаться в руках у модели.
Пропорции в этом режиме модель берёт из самого изображения. Квадратная фотография даёт квадратное видео, вертикальная — вертикальное. Ничего не обрезается по краям и не растягивается, а значит, товар на карточке останется таким, каким вы его сняли.
Режим «Референсы» — собрать ролик из чужих кусочков
Самый интересный режим и главный аргумент в пользу мультимодальности. В одном запросе можно передать до девяти изображений, до трёх видео и до трёх аудиофайлов, а в описании объяснить, что из чего берётся. Например: «возьми движение камеры из Видео 1, персонажа из Изображения 2, а голос — из Аудио 3». Модель разберёт эти роли и соберёт новый ролик.
Это то, чего обычно добиваются неделю в монтажной программе: перенести проезд камеры с понравившегося референса на свою сцену, сохранить лицо и одежду героя из фотосессии, положить поверх нужный тембр голоса. Здесь всё это делается одним запросом и занимает пару минут.
Для кого и зачем
Если вы ведёте товарную карточку на маркетплейсе. У вас уже есть студийные фотографии товара, и они хорошие. Раньше, чтобы сделать из них видео, нужно было либо заказывать съёмку заново, либо мириться с тем, что нейросеть перерисует товар по-своему. Теперь загружаете своё фото в режиме кадров, описываете движение — и получаете короткий ролик, где ваш товар остаётся вашим товаром, а пропорции карточки не съезжают.
Если вы снимаете Reels и Shorts. Вертикальный формат 9:16, длительность до 15 секунд и встроенный звук закрывают полный цикл: не нужно отдельно искать музыку без копирайта, подгонять её по длине и сводить в редакторе. Ролик приходит готовым к публикации. А если нужен конкретный вайб — берите понравившийся ролик как видео-референс и просите повторить его динамику на своём материале.
Если вы делаете рекламу для Директа и ВКонтакте. Формат 16:9 и 2K подходят под требования площадок к качеству, а посекундная оплата позволяет не переплачивать: тестовому креативу хватит четырёх секунд за 148 ₽, а финальному — пятнадцати за 555 ₽. Можно сгенерировать пять коротких вариантов, открутить их на малом бюджете и вложиться уже в победивший. Готовые креативы дальше уходят в Вайб-Контекстолог и загружаются в кампанию.
Если у вас есть маскот или лицо бренда. Режим референсов позволяет передать несколько фотографий персонажа, и он сохранится узнаваемым в новом ролике. Первые пять изображений не тарифицируются вовсе, так что показать модели героя с разных ракурсов ничего не стоит — это как раз тот случай, когда больше референсов означает лучший результат, а не больший счёт.
Если вы озвучиваете ролик своим голосом. Аудиофайл можно передать как референс, и модель будет ориентироваться на него. Входное аудио бесплатно — за него не берут ни рубля, ни секунды. Это заметно дешевле, чем собирать ролик по частям: сначала видео, потом отдельная озвучка, потом сведение.

Как это работает
Открываете вкладку «Видео» в кабинете, выбираете карточку MiniMax H3 — она стоит второй в списке моделей, сразу после PixVerse V6. Дальше панель настроек подстраивается под выбранный режим: в режиме описания вы видите только формат кадра и ползунок длительности, в режиме кадров появляется загрузка изображений, в режиме референсов — сразу три зоны: для фото, для видео и для аудио.
Ползунок длительности двигается от 4 до 15 секунд, и рядом с ним всегда живая цена. Она пересчитывается на лету и показывает не просто итог, а из чего он складывается: столько-то секунд видео по 37 ₽, столько-то фотографий сверх бесплатных, столько-то секунд исходного ролика, если вы загрузили видео-референс. Никаких сюрпризов после списания: сумма на кнопке — это ровно то, что уйдёт с баланса.
Про секунды исходного видео стоит сказать отдельно, потому что это честная особенность модели, а не наша наценка. MiniMax H3 обрабатывает загруженный ролик так же, как генерирует свой, и берёт за это по той же ставке. То есть если вы просите десятисекундное видео и даёте четырёхсекундный референс, оплачиваются четырнадцать секунд. Мы измеряем длительность вашего файла на сервере и показываем результат в подсказке заранее — до того, как вы нажмёте кнопку. Ролики длиннее пятнадцати секунд обрезаются при загрузке, чтобы референс случайно не стал дороже самой генерации.
Генерация занимает от одной до нескольких минут, в зависимости от длительности. Готовый ролик появляется в истории вкладки, его можно скачать или сразу отправить в другие инструменты кабинета — например, в Монтажную студию, если хочется склеить несколько сцен в один сюжет. Если генерация по какой-то причине не удалась, деньги возвращаются на баланс автоматически, отдельно просить об этом не нужно.
Что писать в описании, чтобы получилось с первого раза
MiniMax H3 сильна в следовании инструкции, и это меняет подход к промпту: чем конкретнее вы формулируете, тем ближе результат к задуманному. Расплывчатое «красивое видео с товаром» модель выполнит по-своему, а подробная раскадровка — так, как вы просили.
Разбивайте ролик по секундам
Пятнадцать секунд — это не одна сцена, а маленький сюжет. Пишите его отрезками: «0–4 секунды: общий план кофейни, камера медленно едет вперёд. 4–9 секунд: бариста ставит чашку на стойку, крупный план рук. 9–15 секунд: пар поднимается над чашкой, камера замирает». Такая структура убирает главную беду длинных генераций — когда модель мечется между идеями и ролик разваливается на несвязанные куски.
Описывайте звук отдельной строкой
Звук здесь не бонус, а полноправная часть запроса, и он подчиняется тексту. Добавьте в конце промпта строку вида «Звук: шипение кофемашины, приглушённые разговоры, мягкая фоновая музыка на фортепиано». Без этой строки модель придумает звуковую картину сама — часто удачно, но не обязательно ту, что нужна вам. Если в кадре должен звучать голос, напишите реплику дословно и укажите, что произнести её нужно один раз.
Отдельно перечислите, чего быть не должно
Полезная привычка, знакомая всем, кто работал с генеративным видео: в конце промпта перечислить нежелательное. «Без текста и логотипов в кадре, без резких склеек, без лишних людей на фоне, без искажений рук». Это заметно снижает долю брака и экономит повторные генерации — а значит, и деньги.
В режиме референсов называйте источники по номерам
Модель различает загруженные файлы по порядку, поэтому самый надёжный способ объяснить задачу — ссылаться на них явно: «Видео 1», «Изображение 2», «Аудио 3». Формулировка «повтори проезд камеры из Видео 1, героя возьми с Изображения 2, музыку — из Аудио 3» работает точнее, чем общее «сделай похоже на референсы».
Сколько стоит
Тариф простой: 37 ₽ за секунду итогового видео. Разрешение, наличие звука и выбранный режим на цену не влияют — 2K и стереодорожка входят в стоимость по умолчанию, доплачивать за качество не нужно.
| Что генерируем | Длительность | Цена |
|---|---|---|
| Короткий тестовый креатив | 4 секунды | 148 ₽ |
| Ролик для карточки товара | 6 секунд | 222 ₽ |
| Вертикальный Reels | 10 секунд | 370 ₽ |
| Максимальная сцена | 15 секунд | 555 ₽ |
| Изображения-референсы | первые 5 | бесплатно |
| Каждое следующее изображение | 6-е и далее | 11 ₽ |
| Аудио-референс | любой | бесплатно |
| Секунда загруженного видео-референса | за секунду | 37 ₽ |
Подписки нет, абонентской платы нет, неиспользованные деньги не сгорают. Вы пополняете рублёвый баланс кабинета и тратите его на любые инструменты: сегодня на видео, завтра на картинки или озвучку. Оплата российскими картами, закрывающие документы для юрлиц — по запросу.
Как попробовать
- Войдите в кабинет и откройте вкладку «Видео». Новым пользователям на баланс начисляется приветственный бонус — его хватит, чтобы посмотреть на результат до первого пополнения.
- Выберите карточку MiniMax H3 — она вторая в списке моделей, сразу после PixVerse V6, с пометкой NEW.
- Определитесь с режимом. Если материала нет — «По описанию». Если есть фотография — «Оживить кадры». Если хочется смешать несколько источников — «Референсы».
- Опишите сцену. Пишите не только про то, что видно, но и про то, что слышно: модель генерирует звук по вашему тексту, и фраза «слышны шаги по гравию и далёкий гул города» действительно даст шаги и гул.
- Поставьте длительность ползунком и сверьтесь с ценой — она показана рядом и разложена по составляющим.
- Нажмите «Создать» и подождите пару минут. Готовый ролик со звуком появится в истории; оттуда его можно скачать в исходном качестве.

Частые вопросы
Сколько стоит сгенерировать видео нейросетью в MiniMax H3?
37 ₽ за секунду готового ролика. Минимальная длительность — 4 секунды, это 148 ₽; максимальная — 15 секунд, это 555 ₽. Разрешение 2K и звуковая дорожка уже включены, отдельной платы за них нет. Если вы загружаете видео-референс, его секунды тарифицируются по той же ставке — так считает сама модель, и это видно в подсказке о цене до нажатия кнопки.
Нужна ли подписка или VPN?
Ни того, ни другого. Вайб-Маркетолог работает из России напрямую: вы пополняете рублёвый баланс российской картой и тратите его по мере надобности. Никаких ежемесячных списаний, никаких зарубежных карт и обходных путей — вся связь с моделью идёт с нашей стороны.
Звук действительно генерируется вместе с видео?
Да, это стереодорожка внутри того же файла, а не отдельно наложенная музыка. Модель сочиняет звук исходя из содержания сцены, поэтому он совпадает с действием: шаги звучат тогда, когда персонаж идёт. Чтобы получить нужный результат, описывайте звук в промпте так же подробно, как картинку.
Чем MiniMax H3 отличается от других видеомоделей кабинета?
Тремя вещами. Разрешением — 2K на выходе против привычных 720p и 1080p. Звуком — он встроенный и синхронный. И мультимодальностью — это единственная модель, которая принимает изображения, видео и аудио в одном запросе и позволяет объяснить словами, что из какого источника взять. Если нужна русская речь с точным липсинком, посмотрите на Gemini Omni; если важна максимально низкая цена за секунду — на PixVerse V6 (от 4 ₽ за секунду, до 1080p) или Seedance 2 Mini (от 14 ₽ за секунду).
Сохранится ли мой персонаж или товар без изменений?
В режиме кадров изображение становится опорным кадром, поэтому внешний вид сохраняется точнее всего. В режиме референсов можно передать до девяти фотографий одного героя с разных сторон — чем больше ракурсов, тем устойчивее узнаваемость, а первые пять снимков бесплатны. Полной гарантии, как в монтаже, нейросеть не даёт, но при нескольких хороших референсах результат обычно попадает с первой-второй попытки.
Что будет, если генерация не удастся?
Деньги вернутся на баланс автоматически, без обращения в поддержку. Возврат приходит той же суммой и виден в истории операций. Это общее правило кабинета для всех моделей, не только для этой.
Коротко
MiniMax H3 закрывает задачу, ради которой раньше приходилось собирать цепочку из трёх инструментов: сгенерировать видео, отдельно озвучить, потом свести. Теперь это один запрос, две минуты ожидания и готовый файл в 2K со звуком — по описанию, по вашей фотографии или по смеси референсов. Посекундная оплата означает, что эксперимент стоит 148 ₽, а не абонемента на месяц.
Модель уже доступна всем пользователям во вкладке «Видео». Если хотите разобраться подробнее и посмотреть примеры промптов под каждый режим — загляните в Академию: там разобраны все видеомодели кабинета, от бюджетных до флагманских.