Z-Image — фотореалистичное фото за 1,2 ₽ Veo 3.1 и Seedance — видео со звуком, от 120 ₽ Gemini Omni — говорящий персонаж с русской озвучкой GPT-5 и Claude 4.8 Opus — ответы от 3 ₽ Suno 5.5 — песня целиком за 99 ₽ Sora 2 и Kling 3 — уже внутри, за рубли Grok Video — рекламный ролик за 36 ₽ +20% бонусами к первому пополнению — до 6000 ₽

Голосовой ввод текста в чате ИИ — бесплатно

Голосовой ввод текста в чате ИИ — бесплатно

Голосовой ввод текста заработал прямо в чате с нейросетями: нажмите микрофон в поле ввода, продиктуйте вопрос обычным голосом — и он появится в строке уже готовым текстом, со знаками препинания и заглавными буквами. Печатать не нужно, править после расшифровки обычно тоже. Функция бесплатная и работает без VPN: речь распознаёт наш собственный сервер, а не заграничный сервис.

Заодно в поле ввода появилась скрепка — теперь фотографию, скриншот или документ можно приложить к вопросу в один клик, не вспоминая про сочетание Ctrl+V.

Что нового: голосовой ввод текста и файлы в один клик

Микрофон в поле ввода чата

Раньше на странице «Текст» вопрос нейросети можно было только напечатать. Теперь рядом с полем ввода стоит круглая кнопка микрофона. Нажали — пошла запись: видно красную точку, секундомер и живую звуковую дорожку, которая реагирует на голос. Сказали, что хотели, нажали галочку — через секунду-полторы текст уже в поле. Дальше его можно поправить руками, дописать деталей и отправить любой из моделей: бесплатной VibeM AI, GPT-5.6, Opus 5, Gemini 3 Pro, DeepSeek — выбор моделей от голосового ввода не зависит.

Ошиблись или передумали посреди фразы — крестик рядом отменяет запись целиком, ничего никуда не отправляется.

Расшифровка сразу с пунктуацией

Речь превращается в текст не «сплошной простынёй», как это делают многие бесплатные сервисы, а с точками, запятыми и заглавными буквами. Числа записываются цифрами, а не словами. Это принципиально: расшифровку не нужно вычитывать перед тем, как отправить её нейросети — модель сразу видит нормальный русский текст и понимает интонационные границы предложений.

Скрепка: файлы и фото в один клик

Вторая новая кнопка в поле ввода — скрепка. Через неё можно приложить к вопросу изображение (PNG, JPG, WebP, GIF) или документ (PDF, DOC, DOCX, XLS, XLSX, TXT). Файл виден миниатюрой прямо под строкой ввода, лишний убирается крестиком. Раньше приложить файл на первом экране можно было только вставкой из буфера обмена — про эту возможность знали единицы.

Голосовой ввод текста в чате нейросети на телефоне: запись с таймером и звуковой дорожкой
Панель записи: красная точка, секундомер и живая звуковая дорожка. Галочка расшифровывает, крестик отменяет.

Для кого и зачем

Тем, кто печатает медленно. Средняя скорость речи — 120–150 слов в минуту, набора на клавиатуре — 30–40. Развёрнутое техзадание нейросети, которое печатается пять минут, проговаривается за минуту.

Тем, кто работает с телефона. На маленькой экранной клавиатуре длинный запрос набирать мучительно, и именно поэтому с телефона люди пишут нейросети короткие обрывочные вопросы — и получают такие же поверхностные ответы. Голосом длинный подробный запрос даётся так же легко, как короткий.

Тем, кто думает вслух. Формулировка задачи вслух — отдельный жанр: «мне нужен текст для рассылки, у меня кофейня в спальном районе, аудитория — люди, которые идут на работу мимо, хочу рассказать про новый сезонный напиток и не звучать навязчиво». Такое проще сказать, чем напечатать, а нейросеть на подробный запрос отвечает заметно лучше, чем на «напиши текст для рассылки».

Тем, у кого заняты руки. За рулём, на прогулке, во время готовки — задать вопрос нейросети и получить ответ можно, не садясь за клавиатуру.

Тем, кто ведёт заметки после встреч. Пересказать вслух итоги созвона и попросить нейросеть превратить их в структурированный протокол — минутное дело.

Как это работает

Когда вы нажимаете микрофон, браузер спрашивает разрешение на доступ к нему — это стандартное окно, разрешение выдаётся один раз. Дальше запись идёт локально в вашем браузере: пока вы говорите, ничего никуда не отправляется. По нажатию галочки записанный фрагмент уходит на наш сервер, там его разбирает модель распознавания русской речи, и обратно возвращается только текст.

Распознаёт речь GigaAM третьей версии — открытая модель Сбера, которую он выложил под свободной лицензией. На русском языке она точнее популярного зарубежного Whisper: в независимых слепых сравнениях расшифровки GigaAM выигрывают примерно в семи случаях из десяти. Для русской речи это логично — модель обучалась именно на ней, включая телефонные разговоры, голосовые сообщения и речь с акцентом, а не на сборной солянке из десятков языков.

Важная деталь для России: модель работает на нашем собственном сервере в российском дата-центре. Ваш голос не уходит ни в OpenAI, ни в Google, ни в какой-либо другой заграничный сервис — а значит, ничего не ломается из-за блокировок и не нужен VPN. Пятнадцать секунд речи расшифровываются примерно за полторы секунды.

Ограничение одно: непрерывная запись длится до полутора минут. Этого хватает примерно на 200 слов — очень подробное техзадание. Если мысль длиннее, продиктуйте её в два приёма: второй фрагмент допишется к первому, а не затрёт его.

Чем это отличается от голосового ввода в телефоне

Встроенная в клавиатуру диктовка на смартфоне и голосовой ввод на сайте решают одну задачу, но по-разному. Клавиатурная диктовка работает во всех приложениях сразу, зато на многих аппаратах она пишет сплошным текстом без знаков препинания, спотыкается на длинных фразах и на части устройств требует, чтобы данные уходили на серверы производителя телефона. Наш голосовой ввод работает только на сайте, зато расставляет пунктуацию, держит длинную мысль целиком, одинаково ведёт себя на компьютере и на телефоне и никуда не отправляет запись, кроме нашего сервера.

Ещё одно отличие от голосового ввода в браузере: некоторые сайты используют встроенное в Chrome распознавание, которое работает через серверы Google. Из России оно то работает, то нет, а в Safari и Firefox его нет вовсе. У нас распознаёт наш сервер, поэтому поведение одинаковое в любом браузере.

Как говорить, чтобы нейросеть поняла лучше

Расшифровка отдаёт модели ровно то, что вы сказали, — значит, качество ответа зависит от того, насколько внятно поставлена задача вслух. Работает простое правило: скажите, кто вы и какой у вас бизнес, что нужно получить и для кого, добавьте ограничения — объём, тон, площадку. Одна произнесённая фраза «нужен пост для Телеграма про новый сезонный латте, аудитория — офисные сотрудники рядом, тон дружелюбный, без восклицательных знаков, до 600 знаков» даст результат лучше, чем десять уточняющих переписок после «напиши пост».

Диктовать удобно и по частям: сначала надиктовали суть, посмотрели, что получилось в поле ввода, дописали недостающее вторым нажатием микрофона — новый фрагмент добавится к уже набранному, а не сотрёт его.

Вот три фразы, которые хорошо звучат вслух и дают нейросети достаточно контекста с первого раза. Первая: «У меня студия маникюра в Казани, хочу разослать клиенткам сообщение про скидку на комбо-услугу в будни до трёх часов дня, напиши три варианта до трёхсот знаков, тон тёплый, без слова „акция“». Вторая: «Разбери, почему у меня плохо работает объявление в Директе: заголовок такой-то, текст такой-то, кликов много, заявок нет, посадочная — страница с прайсом». Третья: «Я записал мысли после встречи с подрядчиком, сейчас продиктую как есть, а ты собери из этого протокол с задачами и сроками». Обратите внимание: в каждой есть кто, что нужно, для кого и в каком виде — именно эти четыре вещи модель и ждёт от вас.

Чего делать не стоит: диктовать вперемешку несколько разных задач в одну запись. Модель ответит на всё сразу и поверхностно. Лучше задать их по очереди — благо теперь на каждый вопрос уходит несколько секунд, а не минута набора.

Сколько стоит

Голосовой ввод бесплатный. Он не списывает ни рубля с баланса, не требует подписки и не входит ни в какой платный тариф — мы платим только временем работы собственного сервера, а сервер уже наш. Платите вы, как и раньше, только за ответ нейросети, и цена ответа не зависит от того, надиктовали вы вопрос или напечатали.

Что делаетеСтоимостьКомментарий
Голосовой ввод (диктовка вопроса)0 ₽Без подписки и без лимита по количеству ответов моделей
Прикрепить файл или фото к вопросу0 ₽Сама загрузка бесплатна
Ответ бесплатной модели VibeM AI0 ₽Подходит для большинства бытовых задач
Ответ GPT-5.6 Luna3 ₽Списывается с рублёвого баланса за ответ
Ответ Gemini 3 Pro5 ₽Хорошо работает с длинными текстами
Ответ Opus 5от 8 ₽Самая сильная модель для сложных задач

Цены указаны за один ответ, без абонентской платы: сколько ответов взяли — столько и заплатили. Пополнить баланс можно на любую сумму на странице пополнения.

Как попробовать

  1. Откройте раздел «Текст» в кабинете. Голосовой ввод доступен зарегистрированным пользователям — регистрация бесплатная, на новый счёт начисляется приветственный бонус.
  2. Нажмите кнопку с микрофоном справа в поле ввода.
  3. Разрешите браузеру доступ к микрофону. Окно появится один раз, дальше запись будет стартовать сразу.
  4. Говорите обычным темпом, как человеку. Видите красную точку, таймер и звуковую дорожку — запись идёт.
  5. Нажмите галочку. Через секунду-полторы текст появится в поле ввода — можно править и дополнять.
  6. Выберите модель и отправьте вопрос. Если нужно приложить фото или документ — нажмите скрепку слева.

Работает и на компьютере, и на телефоне: на смартфоне кнопка микрофона стоит в том же поле ввода, а панель записи всплывает над клавиатурой.

Частые вопросы

Голосовой ввод текста платный?

Нет, полностью бесплатный, без подписки и без ограничения по числу расшифровок в разумных пределах. Деньги списываются только за ответ платной модели, и ровно столько же, сколько при обычном наборе с клавиатуры.

Нужен ли VPN?

Нет. Речь распознаёт модель на нашем сервере в России, к заблокированным сервисам браузер не обращается. Это отличает наш голосовой ввод от встроенного в некоторые зарубежные чаты — тот из России часто просто не работает.

Почему не работает голосовой ввод — кнопка есть, а запись не идёт?

Почти всегда дело в доступе к микрофону. Если вы однажды нажали «Блокировать», браузер больше не спросит: нажмите на замок слева в адресной строке, найдите пункт «Микрофон» и переключите на «Разрешить», затем обновите страницу. Вторая причина — сайт открыт по незащищённому адресу или в очень старом браузере: доступ к микрофону работает только по HTTPS и в актуальных версиях Chrome, Safari, Firefox, Яндекс.Браузера.

Насколько точно распознаётся русская речь?

Модель GigaAM v3 обучена именно на русском и на русском же точнее универсального Whisper. Она нормально понимает разговорный темп, лёгкий акцент и записи с бытовым шумом. Слабое место у любой модели распознавания — редкие имена собственные, названия брендов и узкие термины: их стоит проверить глазами перед отправкой.

Сколько можно говорить за один раз?

До полутора минут непрерывно — примерно 200 слов. Запись остановится сама, и всё сказанное расшифруется. Длинную мысль просто продиктуйте в два захода: новый фрагмент дописывается к уже набранному тексту.

Работает ли голосовой ввод текста на телефоне?

Да, на смартфоне он даже полезнее, чем на компьютере: длинный запрос голосом набирается за секунды вместо минут возни с экранной клавиатурой. Кнопка микрофона стоит в том же поле ввода, панель записи всплывает над клавиатурой. На айфоне первый запуск запросит разрешение — его нужно выдать один раз.

Чем голосовой ввод отличается от голосового ассистента?

Голосовой ввод — это только диктовка: вы говорите, получаете текст в поле, ответ читаете глазами. Голосовой ассистент — полноценный разговор вслух: нейросеть отвечает голосом, как в телефонном звонке. Ассистент живёт в отдельном разделе кабинета и тарифицируется поминутно, а диктовка в чате бесплатна.

Куда попадает моя запись?

Аудио уходит только на наш сервер, распознаётся там и не сохраняется — обратно возвращается текст. Ваш голос не передаётся сторонним сервисам и не покидает страну.

Какие файлы можно приложить к вопросу?

Изображения (PNG, JPG, WebP, GIF) и документы (PDF, DOC, DOCX, XLS, XLSX, TXT). По картинке нейросеть ответит, что на ней изображено, поможет с текстом объявления или разбором скриншота; документ прочитает и перескажет, найдёт нужное или сделает выжимку.

Что дальше

Голосовой ввод — часть большой работы над разделом «Текст»: там же живёт каталог текстовых моделей с ценами за ответ, а для полноценного разговора вслух, когда нейросеть отвечает голосом, есть отдельный голосовой ассистент. Пошаговый разбор с картинками — в уроке Академии по ссылке ниже.

Попробуйте прямо сейчас: откройте раздел «Текст», нажмите микрофон и продиктуйте первый вопрос вслух.

Попробовать голосовой ввод Академия Пошаговый разбор со скриншотами: Голосовой ввод текста онлайн: как надиктовать