Пополните на 30 000 ₽ — ИИ-агент на месяц в подарок, до 31 июля Z-Image — фотореалистичное фото за 1,2 ₽ Veo 3.1 и Seedance — видео со звуком, от 120 ₽ Gemini Omni — говорящий персонаж с русской озвучкой GPT-5 и Claude 4.8 Opus — ответы от 3 ₽ Suno 5.5 — песня целиком за 99 ₽ Sora 2 и Kling 3 — уже внутри, за рубли Grok Video — рекламный ролик за 36 ₽ +20% бонусами к первому пополнению — до 6000 ₽
Музыка и голос

Как склонировать свой голос и озвучить текст

Как склонировать свой голос и озвучить им текст — разбираем по шагам, с реальными экранами кабинета. К концу урока у вас будет собственная голосовая модель и готовый аудиофайл, начитанный вашим тембром. Никакой студии, микрофона за сто тысяч и звукорежиссёра: хватит записи на телефон длиной в двадцать секунд.

lk.vibemarketolog.ru/#audio
Раздел клонирования голоса в кабинете Вайб-Маркетолога
Вкладка «Озвучка», карточка «Мой голос»: отсюда начинается работа со своим голосом.

Что такое клонирование голоса и когда оно нужно

Клонирование голоса — это создание цифровой модели вашего тембра по короткому образцу речи. Нейросеть разбирает запись: как вы тянете гласные, где делаете паузы, с какой интонацией заканчиваете фразу, насколько высок ваш голос. По этим признакам она строит модель, которая потом произносит любой новый текст так, будто его прочитали вы.

От обычного синтеза речи это отличается принципиально. В каталоге платформы пятнадцать готовых голосов — это чужие профессиональные дикторы. Они звучат хорошо, но они не ваши, и точно такой же голос доступен любому другому пользователю. Клонированный голос существует только в вашем аккаунте.

Когда стоит заводить свой голос

Есть задачи, где голос — часть узнавания. Если вы ведёте канал или подкаст, аудитория привыкла к вашему тембру: подмена на диктора из каталога заметна сразу. Если вы записываете курсы, ваш голос уже звучит в тридцати уроках, и тридцать первый чужим голосом выбивается. Если вы делаете рекламу для клиента, голос владельца бизнеса в ролике работает лучше безликого диктора.

Когда достаточно готового голоса

Не в каждой задаче нужен именно ваш тембр. Для фоновой озвучки презентации, для служебных объявлений, для черновой начитки сценария готовый голос из каталога быстрее и дешевле — его не надо создавать, он доступен сразу. Ориентир простой: если слушатель не должен узнать конкретного человека, берите каталог.

Для кого этот инструмент

Авторам каналов и подкастов. Сценарий превращается в готовый выпуск без записи. Особенно выручает, когда голос сел, а выпуск должен выйти по расписанию.

Авторам обучающих курсов. Самая дорогая часть в курсе — не съёмка, а переозвучка. Поменялась цифра, обновился интерфейс программы, нашлась ошибка — и ради тридцати секунд приходится заново разворачивать запись. С цифровой копией правка занимает минуту.

Агентствам и фрилансерам. Можно предлагать клиенту озвучку его собственным голосом: он записывает вам пять минут речи один раз, дальше ролики, аудиореклама и приветствие на автоответчике делаются без его участия.

Тем, кто озвучивает книги и лонгриды. Свой голос плюс режим длинного текста дают аудиокнигу, начитанную вами, без месяца работы у микрофона.

Командам. Каждый сотрудник заводит свой голос в своём аккаунте. Голоса не пересекаются: чужой голос в вашем списке не появится, ваш — в чужом.

Как склонировать голос: пошагово

  1. Запишите образец речи. Подойдёт диктофон в телефоне. Говорите ровно и спокойно, как обычно рассказываете что-то коллеге — не читайте нарочито «дикторским» голосом, иначе копия унаследует эту искусственность. Длина — от десяти секунд до пяти минут.
  2. Откройте раздел «Аудио» в личном кабинете и переключитесь на вкладку «Озвучка» в верхнем ряду.
  3. Выберите карточку «Мой голос» среди карточек нейросетей. Если голосов ещё нет, платформа покажет приглашение создать первый.
  4. Разверните блок «Склонировать новый голос». Он свёрнут, чтобы не мешать тем, у кого голоса уже созданы.
  5. Дайте голосу название. Оно нужно только вам — чтобы отличать «рабочий голос» от «голоса для рекламы» или голоса коллеги. В озвучку название не попадает.
  6. Прикрепите аудиофайл кнопкой выбора записи. Принимаются mp3, wav, ogg и webm размером до двадцати мегабайт.
  7. Нажмите кнопку создания голоса. Обработка занимает до минуты. За это время нейросеть разбирает запись и строит модель.
  8. Дождитесь пометки «Готов к работе» в карточке голоса. Теперь он выбирается кликом, как любой другой голос платформы.
Выбор голоса для озвучки текста нейросетью
Голос выбирается кликом по карточке — свой или из каталога платформы.

Как озвучить текст готовым голосом

  1. Выберите голос в списке — он подсветится рамкой.
  2. Вставьте текст в поле озвучки. За один раз обрабатывается до пяти тысяч знаков; для материалов длиннее есть отдельный режим, о нём ниже.
  3. Настройте скорость, если нужно. Ползунок двигается от половинной до двойной; обычно хватает значения по умолчанию, замедление полезно для обучающих материалов, ускорение — для динамичной рекламы.
  4. Посмотрите на цену — она пересчитывается прямо во время набора и показывается рядом с полем ввода.
  5. Нажмите кнопку озвучки. Генерация занимает от нескольких секунд до минуты в зависимости от длины.
  6. Заберите файл — он появится в галерее генераций внизу раздела, откуда скачивается одним кликом.
Двадцать секунд: от записи на телефон до готовой озвучки своим голосом.

Свой голос создаётся один раз и остаётся в кабинете навсегда. Дальше вы платите только за озвучку — по факту, без подписки.

Попробовать озвучкуПополнить баланс

Разбор опций и настроек

Какую запись загружать

Требований всего два, но они решают всё. Первое — длина: минимум десять секунд, максимум пять минут. На более коротком фрагменте нейросети не хватает материала, чтобы уловить характер голоса, а после пяти минут качество копии уже не растёт.

Второе, и более важное, — чистота. Нужна одна речь и ничего больше: без музыкальной подложки, без эха пустой комнаты, без шума кафе и без второго говорящего на фоне. Нейросеть воспроизводит всё, что слышит, — если в образце играла музыка, модель попытается «спеть» её и в вашей озвучке.

Практический совет: сядьте в комнате с мягкой мебелью и шторами (они гасят эхо), держите телефон на расстоянии ладони и прочитайте вслух любой абзац из книги. Двадцати-тридцати секунд достаточно для хорошего результата.

Голоса из каталога и пометки о русском

Если свой голос не нужен, берите каталог — там пятнадцать вариантов, мужских и женских. Но есть нюанс, о котором стоит знать: часть голосов записана носителями английского, и на русском тексте они звучат заметно хуже — «сливают» фразы в сплошной поток без естественных пауз.

Мы прогнали все голоса каталога одинаковым русским текстом и замерили, как распределяются паузы между фразами. Результаты вынесены прямо в интерфейс: у голосов, которые на русском проседают, стоит честная пометка, а фильтр «Лучшие для русского» показывает только те, что прошли проверку. Голос по умолчанию — из проверенных.

lk.vibemarketolog.ru/#audio
Каталог голосов с фильтром лучшие для русского языка
Фильтр «Лучшие для русского» и пометки у голосов, которые на русском звучат слабее.

Настройки подачи у голосов каталога

У движка ElevenLabs Turbo есть четыре ползунка в блоке «Настройки голоса». Стабильность отвечает за ровность: чем выше, тем предсказуемее интонация, но тем меньше живости — для новостной начитки ставьте выше, для эмоционального рассказа ниже. Схожесть определяет, насколько жёстко модель держится оригинального тембра. Выразительность усиливает интонационные перепады. Скорость меняет темп речи.

Начинайте со значений по умолчанию и меняйте по одному ползунку за раз — так понятно, что именно повлияло на результат.

Режим диалога

Если нужна сценка с несколькими персонажами, переключитесь на режим «Диалог». Там голос назначается на каждую реплику отдельно: получается разговор, а не начитка от одного лица. Удобно для рекламных роликов «продавец и покупатель», для обучающих диалогов и для озвучки переписки.

Режим длинного текста

Пятитысячный лимит снимается переключателем «Длинный текст». В этом режиме можно вставить материал целиком или загрузить файл .txt или .docx — платформа сама разрежет его по границам предложений, озвучит по частям и склеит в единый файл. Верхняя граница — десять миллионов знаков за проект.

Практический ориентир: книга среднего объёма в пятьсот тысяч знаков обрабатывается несколько часов. Прогресс виден в интерфейсе, вкладку можно закрыть — работа продолжится.

Сколько стоит

Оплата с рублёвого баланса, посимвольно, за каждую начатую тысячу знаков. Подписки нет — деньги списываются только за фактические генерации.

ОперацияЦенаКомментарий
Создание своего голоса249 ₽разово, голос хранится постоянно
Озвучка своим голосом10 ₽ / 1000 знаковбез ограничений по количеству
ElevenLabs Turbo8 ₽ / 1000 знаковсамый доступный движок каталога
ElevenLabs Multilingual18 ₽ / 1000 знаковмаксимальная чистота речи
Диалог несколькими голосами18 ₽ / 1000 знаковпо сумме всех реплик
Google Gemini Flash13 ₽ / 1000 знаковживые интонации
Google Gemini Pro18 ₽ / 1000 знаковстудийное качество

Чтобы прикинуть бюджет: страница текста примерно две тысячи знаков — это 20 ₽ своим голосом. Статья на десять тысяч знаков — 100 ₽. Часовой подкаст, а это около сорока тысяч знаков, обойдётся в 400 ₽.

Частые ошибки и как их избежать

  • Загружают отрывок из видео с музыкой. Самая частая причина плохой копии. Музыка на фоне искажает модель — берите чистую речь.
  • Записывают в ванной или на кухне с кафелем. Эхо от твёрдых поверхностей попадает в модель, и озвучка звучит «в бочке». Мягкая мебель и шторы решают проблему.
  • Читают образец нарочито дикторским голосом. Копия унаследует эту неестественность и будет звучать напряжённо во всех текстах. Говорите обычно.
  • Берут запись ровно на десять секунд. Это самый минимум, на нём результат нестабилен. Двадцать-тридцать секунд заметно лучше.
  • Выбирают голос из каталога, не глядя на пометки. Голос с пометкой о слабом русском звучит хуже независимо от настроек — ползунки это не лечат, нужно менять голос.
  • Вставляют текст с сокращениями и символами. «ул.», «руб.», «т.д.», знак процента озвучиваются буквально. Пишите словами то, что должно прозвучать словами.
  • Забывают про знаки препинания. Интонация строится по пунктуации: текст без запятых и точек читается монотонно. Ставьте их щедрее, чем в обычном письме.

Частые вопросы

Сколько стоит склонировать голос?

Создание голосовой модели стоит 249 ₽ и платится один раз. Голос остаётся в кабинете постоянно, повторных платежей за него нет. Дальше вы платите только за озвучку — 10 ₽ за каждую тысячу знаков.

Какая запись нужна для клонирования голоса?

Аудиофайл от десяти секунд до пяти минут в формате mp3, wav, ogg или webm, размером до двадцати мегабайт. Главное — чистая речь без музыки, эха и посторонних шумов. Записи на телефон в тихой комнате достаточно.

Нужна ли подписка?

Нет. Всё работает с рублёвого баланса: пополнили на удобную сумму и тратите по факту. Ежемесячных списаний и обязательных пакетов нет.

Можно ли создать несколько голосов?

Да, ограничения на количество нет. Каждый новый голос создаётся за те же 249 ₽ и появляется отдельной карточкой в списке. Удобно, если нужны разные голоса под разные проекты или если вы работаете с несколькими клиентами.

Как удалить свой голос?

В карточке голоса есть кнопка удаления. Голос вместе с исходным образцом стирается сразу. Ранее сгенерированные аудиофайлы при этом остаются в галерее — они уже созданы.

Почему озвучка звучит не так, как я говорю?

Чаще всего дело в образце. Проверьте, не было ли на записи музыки или эха, не читали ли вы нарочито «дикторским» тоном и хватило ли длины. Перезапишите образец в тихой комнате обычным разговорным голосом и создайте голос заново — разница обычно слышна сразу.

Можно ли озвучить книгу целиком?

Да, для этого переключитесь на режим «Длинный текст». Ограничение — десять миллионов знаков за проект, платформа сама разобьёт материал и склеит результат в один файл. Книга на пятьсот тысяч знаков обрабатывается несколько часов.

Что будет, если озвучка получится бракованной?

Платформа проверяет результат автоматически и при браке перегенерирует запись. Если и повторные попытки не помогли, деньги возвращаются на баланс — платить за испорченный файл не придётся.

Какой голос выбрать для русского текста?

Включите фильтр «Лучшие для русского» — он оставит только проверенные голоса. Голос, предложенный по умолчанию, уже из этого списка. Если у голоса стоит пометка о слабом русском, лучше выбрать другой: настройками это не исправляется.

Советы

  • Прежде чем озвучивать длинный материал, прогоните два-три абзаца — это стоит рубли и сразу покажет, устраивает ли вас результат.
  • Держите один образец голоса «про запас» в облаке: если захотите пересоздать голос с другими настройками, не придётся записываться заново.
  • Для длинных материалов разбивайте текст на смысловые абзацы с пустой строкой — платформа режет по границам предложений, и осмысленная разбивка даёт более естественные паузы.
  • Сравните движки на одном коротком фрагменте: разница в характере звучания между ElevenLabs и Gemini заметнее, чем кажется по описанию.
  • Подробнее о том, что изменилось в озвучке и почему сменился голос по умолчанию, — в анонсе обновления. О работе с большими текстами есть отдельный разбор, а про движки Google — материал о Gemini.
Поделиться уроком
Telegram ВКонтакте
Обновление Что нового: Клонирование голоса: озвучка своим голосом
Попробовать +100 ₽ в подарок Пополнить баланс