Клонирование голоса: озвучка своим голосом
Клонирование голоса нейросетью появилось в Вайб-Маркетологе: загрузите запись своей речи на десять секунд — и платформа создаст цифровую копию вашего голоса, которой можно озвучивать любые тексты. Разово создание голоса стоит 249 ₽, дальше озвучка идёт по 10 ₽ за тысячу знаков. Без подписки, без абонентской платы, без ограничений по количеству записей.
Одновременно мы вернули в кабинет линейку ElevenLabs, снизили цены на всю озвучку и подняли лимит длинного текста до десяти миллионов знаков за один проект. Разбираем по порядку, что изменилось и как этим пользоваться.
Клонирование голоса: своя озвучка без студии
Что это такое
Раньше выбор голоса означал выбор из готового каталога: пятнадцать вариантов, все чужие. Хороший диктор в каталоге найдётся, но он звучит как диктор из каталога — и у ваших конкурентов на том же тарифе он звучит точно так же.
Теперь можно добавить свой. Механика простая: вы записываете отрывок собственной речи длиной от десяти секунд до пяти минут, загружаете файл в кабинет, и нейросеть строит по нему голосовую модель. Через минуту в списке голосов появляется ваш собственный — с вашим тембром, манерой, характерными интонациями. Дальше он работает как любой другой голос платформы: вставили текст, нажали кнопку, получили аудиофайл.
Чем это отличается от обычной озвучки
Синтез речи по готовому голосу — это подбор наиболее подходящего чужого тембра. Клонирование голоса — создание нового, вашего. Разница ощущается там, где голос является частью бренда: в подкасте, в обучающих роликах, в аудиосообщениях клиентам, в озвучке рекламы.
Технически цифровая копия голоса создаётся один раз и хранится постоянно. Не нужно каждый раз прикладывать образец, не нужно ничего перезаписывать. Один платёж 249 ₽ — и голос остаётся в вашем личном списке столько, сколько нужно. Удалить его можно в любой момент одной кнопкой.
Какая запись подойдёт
Требования к образцу минимальные, но они есть. Запись должна быть длиннее десяти секунд — на более коротком фрагменте нейросети не хватает материала, чтобы уловить особенности голоса. Верхняя граница — пять минут, дальше качество копии не растёт.
Гораздо важнее длины чистота записи. Нужна ровная спокойная речь без музыки на фоне, без эха пустой комнаты, без шума улицы и без наложения других голосов. Подойдёт запись на телефон в тихой комнате: этого достаточно. А вот отрывок из видео с музыкальной подложкой даст смазанный результат — нейросеть попытается воспроизвести и музыку тоже.
Для кого и зачем
Клонирование голоса выглядит эффектной игрушкой, пока не появляется задача, где оно экономит недели работы. Вот сценарии, ради которых мы это делали.
Если вы ведёте подкаст или канал — теперь можно озвучивать выпуски, не садясь к микрофону. Написали сценарий, прогнали через свой голос, получили готовую дорожку. Слушатель слышит привычный голос ведущего, а вы экономите вечер на запись и сведение.
Если вы записываете обучающие курсы — самая дорогая часть производства это переозвучка. Поменялась цена в уроке, обновился интерфейс в программе, нашлась ошибка в формулировке — и надо заново арендовать студию ради тридцати секунд текста. С цифровой копией голоса правка занимает минуту и стоит рубли.
Если вы делаете рекламу для клиентов — можно предлагать озвучку голосом заказчика. Владелец бизнеса записывает вам пять минут речи один раз, а дальше вы делаете ему ролики, аудиорекламу и сообщения для автоответчика от его лица, без его участия.
Если вы озвучиваете книги или длинные материалы — свой голос плюс режим длинного текста дают полноценную аудиокнигу. Об этом отдельно ниже: лимит теперь десять миллионов знаков.
Если у вас команда — каждый сотрудник может завести свой голос. Голоса не пересекаются между аккаунтами: чужой голос из вашего списка недоступен, и наоборот.
Как это работает
Откройте раздел «Аудио», переключитесь на вкладку «Озвучка» и выберите карточку «Мой голос». Если голосов ещё нет, платформа предложит создать первый.
Разверните блок «Склонировать новый голос», дайте голосу название — оно нужно только вам, чтобы отличать записи друг от друга, — и прикрепите аудиофайл. Поддерживаются форматы mp3, wav, ogg и webm, размер до двадцати мегабайт. Нажмите кнопку создания: обработка занимает до минуты.
Готовый голос появится в списке с пометкой, что он готов к работе. Дальше всё как с обычной озвучкой: вставляете текст, при желании подкручиваете скорость речи и нажимаете «Озвучить». Файл сохранится в галерее генераций, откуда его можно скачать или переслать.
Если что-то пойдёт не так — например, запись окажется слишком короткой или слишком шумной, — платформа скажет об этом словами и вернёт деньги на баланс. Списание за неудачную попытку не остаётся.
Вернулся ElevenLabs, и подешевела вся озвучка
Вторая часть обновления касается тех, кому свой голос не нужен, а нужен хороший чужой.
Линейка ElevenLabs две недели была недоступна из-за аварии у поставщика. Мы перевели её на другой канал доставки, и модели вернулись в каталог — с теми же голосами, что были раньше. Заодно пересчитали тарифы, и озвучка подешевела для всех.
Что доступно сейчас
В разделе озвучки пять движков. ElevenLabs Turbo — быстрая генерация с тонкой настройкой подачи: стабильность, выразительность, скорость, схожесть с оригинальным голосом. ElevenLabs Multilingual — максимальная чистота речи и поддержка двадцати девяти языков. Отдельный режим диалога, где голос назначается на каждую реплику: получается сцена с несколькими персонажами, а не начитка. Плюс две модели Google Gemini и ваш собственный голос.
Дефолтный голос сменился, и вот почему
Отдельная история, которая стоит упоминания. Мы проверили все пятнадцать голосов каталога на русском тексте — прогнали одинаковый фрагмент и замерили, насколько естественно распределяются паузы между фразами. У живой речи их четырнадцать-двадцать пять в минуту.
Результат оказался неожиданным: голос, который стоял по умолчанию, показал две паузы в минуту. Это значит, что он «сливает» русские фразы в сплошной поток — на английском такой голос звучит прекрасно, а на русском заметно хуже. Мы поменяли голос по умолчанию на тот, что показал лучший результат, а в каталоге появился фильтр «Лучшие для русского» и честные пометки у голосов, которые на русском проседают. Теперь это видно до генерации, а не после.
Длинный текст: до десяти миллионов знаков

Режим «Длинный текст» снимает ограничение в пять тысяч знаков: платформа сама режет материал на части по границам предложений, озвучивает по кускам и склеивает в один файл. Раньше лимит был два миллиона знаков за проект, теперь — десять.
Десять миллионов знаков это примерно сто девяносто часов звучания. Такой объём очередь обрабатывает около суток, поэтому на практике комфортный потолок — около пятисот тысяч знаков, то есть книга среднего размера за несколько часов. Но техническое ограничение снято: если материала действительно много, он пройдёт.
Важная деталь для качества: соседние куски передаются модели как контекст, чтобы интонация не обрывалась на стыках. Без этого каждый фрагмент звучал бы как начало новой мысли, и склейка была бы слышна. Контекст не тарифицируется — вы платите только за то, что реально звучит.
Режим доступен и для ElevenLabs, и для Gemini. Свой клонированный голос в длинном тексте пока не поддерживается — планируем добавить.
Сколько стоит
Оплата посимвольная, считается за каждую начатую тысячу знаков. Никакой подписки: деньги списываются с баланса только за фактические генерации.
| Что | Цена | Было |
|---|---|---|
| Клонирование голоса (разово) | 249 ₽ | не было |
| Озвучка своим голосом | 10 ₽ / 1000 знаков | не было |
| ElevenLabs Turbo | 8 ₽ / 1000 знаков | 29 ₽ за генерацию |
| ElevenLabs Multilingual | 18 ₽ / 1000 знаков | 39 ₽ за генерацию |
| Диалог с разными голосами | 18 ₽ / 1000 знаков | 49 ₽ за генерацию |
| Google Gemini Flash | 13 ₽ / 1000 знаков | 13 ₽ / 1000 знаков |
| Google Gemini Pro | 18 ₽ / 1000 знаков | 18 ₽ / 1000 знаков |
Отдельно стоит объяснить, что изменилось в принципе расчёта. Раньше Multilingual и режим диалога стоили фиксированную сумму за генерацию независимо от длины: и десять слов, и пять тысяч знаков обходились одинаково. Это было невыгодно для коротких текстов — за реплику в двадцать слов вы платили как за полную страницу. Теперь считается длина, и короткая озвучка стала дешевле в разы.
Для примера: страница текста на две тысячи знаков в ElevenLabs Turbo обойдётся в 16 ₽, статья на десять тысяч знаков — 80 ₽, книга на пятьсот тысяч знаков — 4 000 ₽.
Как попробовать
- Зайдите в раздел «Аудио» в личном кабинете и переключитесь на вкладку «Озвучка».
- Выберите движок: «Мой голос» для клонирования, ElevenLabs Turbo для быстрой качественной начитки или Gemini, если нужен другой характер звучания.
- Для своего голоса — разверните «Склонировать новый голос», прикрепите запись от десяти секунд и дождитесь обработки.
- Вставьте текст, при необходимости настройте скорость и выразительность.
- Нажмите кнопку озвучки. Готовый файл появится в галерее — оттуда его можно скачать.
- Для больших материалов переключитесь на режим «Длинный текст» и загрузите файл .txt или .docx целиком.
Частые вопросы
Сколько стоит клонировать голос?
Создание цифровой копии голоса стоит 249 ₽ единоразово. Дальше вы платите только за озвучку — 10 ₽ за каждую тысячу знаков. Голос хранится в кабинете постоянно, повторно платить за него не нужно.
Какая запись нужна для клонирования?
Аудиофайл длиной от десяти секунд до пяти минут в формате mp3, wav, ogg или webm, размером до двадцати мегабайт. Главное требование — чистая речь без музыки, эха и посторонних шумов. Записи на телефон в тихой комнате достаточно.
Нужна ли подписка?
Нет. Вся озвучка работает с рублёвого баланса: пополнили на удобную сумму, тратите по факту генераций. Ежемесячных платежей и минимальных пакетов нет.
Чем клонированный голос отличается от голосов из каталога?
Голоса каталога — это профессионально записанные чужие тембры, доступные всем пользователям платформы. Клонированный голос строится по вашей записи, звучит как вы и доступен только в вашем аккаунте. Для брендированного контента, где голос узнаётся, разница принципиальна.
Можно ли озвучить книгу целиком?
Да, для этого есть режим «Длинный текст». Лимит — десять миллионов знаков за проект, платформа сама разобьёт материал, озвучит по частям и склеит в один файл. Книга на пятьсот тысяч знаков обрабатывается несколько часов и стоит около 4 000 ₽ на тарифе Turbo.
Какой голос лучше звучит на русском?
В каталоге появился фильтр «Лучшие для русского» — он показывает голоса, которые прошли нашу проверку на естественность русской речи. У голосов, которые на русском проседают, стоит честная пометка. По умолчанию платформа теперь предлагает голос с лучшим результатом замера.
Что будет, если озвучка получится некачественной?
Платформа автоматически проверяет результат синтеза и при браке перегенерирует запись. Если и повторные попытки не дали нормального результата, деньги возвращаются на баланс. Платить за испорченную озвучку не придётся.
Что дальше
Клонирование голоса — первый шаг. В планах поддержка своего голоса в режиме длинного текста, чтобы аудиокниги можно было начитывать собственным тембром, и в режиме диалога, где ваш голос будет одним из участников сцены.
Обновление уже доступно всем пользователям. Загляните в раздел озвучки, попробуйте свой голос или сравните движки на коротком тексте — это стоит несколько рублей. Если пользуетесь озвучкой регулярно, обратите внимание на режим длинного текста и на разбор движков Gemini — там подробно про сценарии, где какой движок уместнее.