Голосовой ассистент: живой диалог с ИИ без VPN
Голосовой ассистент в Вайб-Маркетологе снова работает — и теперь без VPN, из любого российского города и с любого устройства. Это живой голосовой диалог с нейросетью: вы говорите вслух, ИИ слышит вас в реальном времени и отвечает голосом, а не текстом. Можно перебивать на полуслове, думать вслух, задавать уточняющие вопросы — как в обычном телефонном разговоре с толковым коллегой. Под капотом — свежая модель OpenAI Realtime версии 2.1, десять голосов на выбор и оплата по минутам без подписки.
Что нового: голосовой ассистент без VPN
Разговор больше не упирается в блокировки
Раньше живой голосовой режим работал по прямой схеме: ваш браузер сам соединялся с серверами OpenAI и гонял туда звук напрямую. Для зарубежного пользователя это идеально — минимальная задержка, никаких посредников. Для российского — тупик: адрес недоступен, соединение не устанавливается, разговор не начинается. Часть пользователей видела только бесконечное «Подключаюсь…», и спасал лишь VPN.
Мы перестроили схему целиком. Теперь браузер разговаривает только с нашим доменом, а всю связь с нейросетью держит наш собственный сервер: он принимает ваш голос, передаёт его модели, забирает ответ и возвращает вам. Для вас это выглядит как обычная страница кабинета, которая просто работает. Ни VPN, ни расширений, ни настроек — нажали кнопку микрофона и говорите.
Побочный, но важный эффект: голосовой режим перестал зависеть от того, какой у вас провайдер и что он фильтрует сегодня. Раньше один и тот же кабинет у одного пользователя работал, а у другого — нет, и понять причину со стороны было невозможно. Теперь путь звука один и тот же для всех.

Новая модель: gpt-realtime-2.1
Одновременно с переездом мы обновили саму нейросеть до gpt-realtime-2.1 — это свежая realtime-модель OpenAI, самая новая в линейке, доступной сервисам вроде нашего. По сравнению с предыдущей версией она заметно живее в трёх вещах, которые в голосовом диалоге чувствуются сразу:
Меньше задержка. Пауза между вашим вопросом и началом ответа сократилась примерно на четверть. В разговоре это разница между «робот думает» и «человек отвечает» — беседа перестаёт спотыкаться.
Лучше понимает паузы. Модель аккуратнее отличает «человек закончил мысль» от «человек набирает воздуха». Можно спокойно диктовать длинную задачу с естественными паузами, и ассистент не влезет в середину предложения.
Спокойнее относится к шуму и перебиваниям. Фоновый шум офиса, кафе или улицы сбивает её реже. А если вы захотите оборвать ассистента на полуслове и переспросить — он замолкает мгновенно и слушает вас, а не дочитывает свой абзац.
Десять голосов — и каждый говорит о себе правильно
В ассистенте десять голосов: пять женских и пять мужских. Раньше была неприятная мелочь, которая ломала ощущение живого разговора: вы выбирали Марину, а нейросеть отвечала «я понял», «я готов», «я сам посмотрю». Формально мелочь, на слух — сразу видно робота.
Мы привязали род речи к голосу: теперь Марина говорит «я поняла» и «я готова», Кирилл — «я понял» и «я готов». Каждый голос знает своё имя и представляется им, если вы спросите, с кем разговариваете.
Заодно мы проверили, совпадает ли тембр каждого голоса с именем, которое ему присвоено. Проверяли не на слух, а замером: у записи каждого голоса измерили высоту основного тона. Выяснилось, что два голоса были подписаны неправильно — один звучал мужчиной под женским именем, второй наоборот. Мы это исправили, и теперь список выглядит честно:

| Голос | Как звучит | Пример речи о себе |
|---|---|---|
| Марина (по умолчанию) | женский, спокойный | «Я поняла, сейчас посмотрю» |
| Светлана | женский, низкий | «Я готова разобрать вашу кампанию» |
| Дарья | женский, звонкий | «Я подобрала пять вариантов» |
| София | женский, мягкий | «Я записала, продолжайте» |
| Полина | женский, лёгкий | «Я уточню и вернусь с ответом» |
| Кирилл | мужской, деловой | «Я понял задачу» |
| Максим | мужской, глубокий | «Я готов помочь с бюджетом» |
| Артём | мужской, бодрый | «Я посмотрел, вот что вижу» |
| Андрей | мужской, низкий | «Я сам проверю цифры» |
| Алексей | мужской, ровный | «Я подготовил три варианта» |
Считаем минуты честно и возвращаем деньги
Третье изменение не видно на экране, но касается денег. Раньше время разговора считал сам браузер: он раз в минуту сообщал серверу, что беседа продолжается. Теперь минуты считает сервер, который эту беседу и ведёт, — ошибиться или потеряться при этом уже негде.
И главное: если разговор не состоялся, деньги возвращаются автоматически. Не открылся звук, оборвалась сеть, закрыли вкладку в момент подключения — списанная минута вернётся на баланс сама, без обращения в поддержку. Раньше в такой ситуации деньги просто уходили.
Для кого и зачем
Голосовой ассистент — это не игрушка «поговорить с нейросетью». Это способ работать руками занятыми и головой свободной. Вот сценарии, в которых им пользуются чаще всего.
Если вы за рулём или в дороге. Идея рекламной кампании приходит в самый неудобный момент. Вместо того чтобы держать её в голове до офиса, вы проговариваете задачу вслух: «Придумай пять заголовков для доставки пиццы в спальном районе, упор на скорость». Ассистент отвечает голосом, вы обсуждаете и отбираете, а к рабочему столу приходите с готовыми формулировками.
Если вы не любите печатать длинные вводные. Рассказать про бизнес голосом за минуту проще, чем набирать пять абзацев брифа. Ассистент слушает столько, сколько нужно, задаёт уточняющие вопросы про нишу, бюджет и географию — и это уже готовая постановка задачи, а не обрывок.
Если нужно быстро разобраться в цифрах. Спросите вслух, чем ДРР отличается от ROAS, какой CTR считать нормальным для поисковой рекламы или почему растёт цена клика. Ассистент отвечает как практикующий маркетолог, а не как справочник, и переспросить «а если проще?» можно голосом, не переключая контекст.
Если вы учитесь. Голосовой формат прощает глупые вопросы. Спрашивать вслух «а что такое ретаргетинг вообще» психологически легче, чем писать это в чат, и объяснение усваивается быстрее — оно звучит как разговор, а не как статья.
Если вы ищете нужный раздел кабинета. Ассистент знает платформу и подскажет, где сделать креативы, где собрать сайт, где запустить кампанию в Директе. Достаточно описать задачу словами — он направит в нужный инструмент.
Как это работает
С вашей стороны всё просто: вы открываете раздел «Голос», нажимаете большую круглую кнопку с микрофоном, браузер спрашивает разрешение на запись — и можно говорить. Никакой кнопки «отправить»: ассистент сам понимает, когда вы закончили фразу, и отвечает. Хотите перебить — просто начните говорить, он замолчит.
Что происходит внутри. Ваш голос идёт на наш сервер небольшими порциями по сорок миллисекунд — это примерно двадцать пять кусочков в секунду, поэтому задержка почти не ощущается. Сервер держит постоянное соединение с нейросетью и передаёт ей звук в том виде, в котором она его понимает лучше всего. Ответ возвращается тем же путём и начинает звучать раньше, чем модель договорила фразу до конца, — именно поэтому диалог получается живым.
Параллельно ведётся текстовая расшифровка: всё, что сказали вы и что ответил ассистент, появляется в окне диалога. Разговор можно перечитать, а нужные формулировки — скопировать в работу. Если в ответе упоминается раздел платформы, его название становится ссылкой: нажали — и вы уже в нужном инструменте.
Ещё ассистент умеет искать в интернете. Когда для точного ответа нужны свежие данные — курс, цена, новость, информация о конкретной компании — он сам обращается к поиску и отвечает с учётом найденного, не прерывая разговор.
Сколько стоит
Живой разговор оплачивается поминутно и списывается с рублёвого баланса. Никакой подписки, абонентской платы и пакетов «на месяц»: не разговариваете — не платите.
| Что именно | Цена | Как считается |
|---|---|---|
| Живой голосовой диалог | 20 ₽ за минуту | Первая минута — при старте, дальше по минуте разговора |
| Разговор не состоялся | 0 ₽ | Списанная минута возвращается на баланс автоматически |
| Расшифровка диалога | Бесплатно | Текст обеих сторон появляется в окне сам |
| Поиск в интернете во время разговора | Бесплатно | Ассистент обращается к поиску сам, когда нужны свежие данные |
| Выбор голоса и смена голоса | Бесплатно | Любой из десяти, меняется между разговорами |
| Длительность одного разговора | до 30 минут | Потолок на сессию; новый разговор можно начать сразу |
Для сравнения: минута живого диалога стоит примерно столько же, сколько пара картинок в разделе «Изображения». Пятиминутный разговор, из которого вы выходите с готовой структурой кампании, обходится в сто рублей — дешевле часа собственного времени, потраченного на то же самое в переписке.
Если баланс заканчивается прямо в разговоре, ассистент предупредит и корректно завершит беседу — без обрыва на полуслове и без ухода баланса в минус. Пополнить счёт можно в любой момент в кабинете, разговор после этого начинается заново.
Как попробовать
- Войдите в кабинет и откройте раздел «Голос» — он в верхнем меню.
- Выберите голос в списке под кнопкой. По умолчанию стоит Марина; послушать другие можно, начав короткий разговор.
- Нажмите круглую кнопку с микрофоном и разрешите браузеру доступ к записи. Разрешение спрашивается один раз.
- Говорите обычным голосом, как по телефону. Закончили фразу — просто замолчите, ассистент ответит сам.
- Чтобы перебить ответ, начните говорить поверх него. Чтобы завершить разговор, нажмите ту же кнопку ещё раз.
Совет из практики: первую фразу сделайте содержательной. Вместо «привет, что ты умеешь» скажите «я продаю кухни на заказ в Казани, бюджет тридцать тысяч в месяц, хочу заявки из Директа» — и сразу получите разбор по делу, а не общее знакомство.
Частые вопросы
Нужен ли VPN, чтобы поговорить с нейросетью голосом?
Нет. Это и есть главное изменение: раньше без VPN живой режим у части пользователей не запускался, теперь весь голосовой трафик идёт через наш сервер и работает из России напрямую. Никаких расширений и настроек ставить не нужно.
Сколько стоит минута разговора с ИИ?
Двадцать рублей за минуту, оплата с рублёвого баланса, без подписки. Первая минута списывается при старте разговора, каждая следующая — по факту. Если разговор не состоялся, деньги возвращаются на баланс автоматически.
Работает ли голосовой ассистент на телефоне?
Да, на смартфоне он работает так же, как на компьютере: откройте кабинет в браузере, зайдите в раздел «Голос» и разрешите доступ к микрофону. Отдельное приложение устанавливать не нужно. Наушники не обязательны, но с ними разговор комфортнее — меньше эха.
Чем это отличается от озвучки текста?
Озвучка — это односторонняя операция: вы даёте текст, получаете аудиофайл, который можно скачать и вставить в ролик. Голосовой ассистент — двусторонний разговор в реальном времени: он слышит вас, отвечает голосом и помнит контекст беседы. Если нужен именно готовый аудиофайл, для этого есть раздел «Аудио» с озвучкой, дикторами и клонированием собственного голоса.
Почему у ассистента лёгкий акцент?
Голоса модели изначально англоязычные, поэтому в русской речи иногда слышен небольшой акцент — чаще всего на заимствованных словах и терминах. На понятность это не влияет. Если нужна безупречная русская речь без тени акцента, лучше подойдут дикторы из раздела озвучки: там голоса записаны носителями языка.
Есть ли ограничение по длительности разговора?
Да, один разговор длится не дольше 30 минут — это потолок на сессию, который защищает от случайно забытой вкладки с включённым микрофоном и незаметно тающего баланса. Дошли до потолка — ассистент попрощается сам, а новый разговор можно начать той же кнопкой. Минуты считает сервер, поэтому оплачивается ровно столько, сколько разговор длился.
Сохраняется ли разговор?
Текстовая расшифровка видна в окне диалога, пока вы находитесь в разделе, — её можно перечитать и скопировать. Кнопка «Очистить диалог» убирает историю разговора с экрана.
Может ли ассистент говорить в стиле моего бренда?
Да, если вы заполнили профиль компании: платформа подставляет его во все инструменты, включая голосовой. Подробнее об этом — в новости про единый фирменный стиль во всех нейросетях.
Коротко
Живой голосовой диалог с нейросетью снова доступен всем пользователям из России без VPN, работает на свежей модели gpt-realtime-2.1, отвечает одним из десяти голосов, говорит о себе в правильном роде и стоит 20 ₽ за минуту без подписки. Если разговор не состоялся — деньги возвращаются сами.
Разобраться с постановкой задач голосом помогает урок Академии. А попробовать прямо сейчас можно в разделе «Голос» — первая фраза, и станет понятно, ваш это формат работы или нет.