ВЛАДИМИР ИЖМУКОВБесплатные материалы по Reels и нейросетям: промпты, гайды, разборы. Забирай в боте.
Статьи

Озвучка нейросетью: чем озвучить ролик и что открывается из России

Какие сервисы синтеза речи дают живой русский голос, сколько это стоит, где клонируют голос, что закрыто для российских адресов и как написать текст, который хорошо звучит вслух.

_Владимир Ижмуков · автор системы роста Instagram через короткие ролики_

Синтез речи за пару лет прошёл путь от «слышно робота с первой секунды» до «на коротком ролике подмену замечают редко». Это открыло формат тем, кто не хочет писать голосом сам: ролик собирается из кадров и текста, а озвучка делается за минуту.

Проблем осталось две. Первая: половина подборок в сети рекламирует сервисы, которые либо не открываются с российских адресов, либо закрылись насовсем. Вторая: тот же движок на одном тексте звучит живо, а на другом механически, и дело тут в тексте.

Разбираю обе. Сначала чем озвучивать, потом как написать так, чтобы звучало. Про сборку самого ролика у меня есть отдельные разборы: нейросети для видео и как сделать рилс из длинного видео.

Что открывается из России

Проверяла 24 августа: прогоняла домены через узлы в Москве и Петербурге плюс два зарубежных для контроля. Граница у проверки та же, что всегда. Она показывает, отдаёт ли сайт страницу на запрос из России. Пустят ли внутрь и пройдёт ли оплата, так узнать нельзя, и это я не проверяла.

Отвечают всем одинаково. ElevenLabs, Яндекс SpeechKit, SaluteSpeech от Сбера, HeyGen, Google Cloud Text-to-Speech, Voicemaker. У Murf два российских узла из трёх ответили, третий устойчиво не достучался в трёх прогонах подряд, зарубежные ответили; на маршрут это похоже больше, чем на страну.

Отказ приходит только с российских узлов. Speechify, OpenAI TTS и CapCut. У CapCut случай самый прямой: он отдаёт российским узлам код 451 «Недоступно по юридическим причинам», зарубежным при этом отвечает нормально.

Сервис закрылся насовсем. PlayHT, он же Play.ai, висит почти в каждой подборке в сети. Домен сегодня не отвечает ни с одного узла на планете, потому что у него больше нет адресных записей DNS. В последней живой версии главной страницы стоял прощальный баннер вендора. Русский он, к слову, не поддерживал никогда. Любой обзор с его тарифами устарел целиком.

Отдельно про Сбер, это важно для российских пользователей. В документации SaluteSpeech сказано прямо: с 15 июля 2026 года прекращена продажа новых пакетов и продление бесплатного тарифа для физических лиц. Для юрлиц сервис живой и цена там самая низкая из всех, кого я смотрела, но с порогом: минимальная стоимость использования 15 000 рублей в месяц. При этом в их же базе знаний до сих пор висит страница, где бесплатный тариф описан как действующий. Ориентируйтесь на документацию тарифов, она свежее.

Чем озвучивать: раскладка по задачам

Самый большой бесплатный объём. Google Cloud Text-to-Speech: 4 миллиона символов в месяц на стандартных голосах, дальше 4 доллара за миллион. Это порядки против остальных. Плата за вход своя: нужна привязка карты, и превышение лимита списывается автоматически.

Живой голос и широкий выбор языков. ElevenLabs. Бесплатно дают 10 000 символов в месяц, это примерно десять минут речи, платный вход начинается с 6 долларов. Клонирование голоса открывается с этого же тарифа, продвинутое клонирование с 22 долларов.

Русский как основной язык продукта. Яндекс SpeechKit, у него 19 русских голосов из 29 в каталоге, то есть две трети. Оплата рублями. Цена по последнему официальному снимку страницы тарифов около 1 320 ₽ за миллион символов с НДС, и тут честная оговорка: живую страницу тарифов машиной прочитать нельзя, там капча, а на самой странице предупреждают о росте ставки НДС с января. Значит цифру считайте ориентиром и сверяйте в кабинете.

Клонирование голоса у Яндекса корпоративное: разовый платёж 9 000 ₽ за создание голоса плюс хостинг модели от 100 000 ₽ в месяц. Для блогера это мимо, для компании с постоянной озвучкой имеет смысл.

Голос вместе с говорящим аватаром. HeyGen. Единственный в подборке, кто отдаёт не только дорожку, но и человека в кадре, который её произносит. На бесплатном тарифе доступен один свой аватар, полноценное клонирование голоса с 29 долларов.

Самый низкий порог входа в коммерцию. Voicemaker: 5 долларов в месяц, и на этом тарифе уже дают пять слотов клонирования голоса.

Про Murf осторожно. Сервис популярный, тарифы прозрачные, вход 19 долларов при годовой оплате. По русскому языку он противоречит сам себе: справка называет русский среди поддерживаемых, а в списке языков клонирования его нет прямым текстом, и в библиотеке голосов API русской локали не нашлось вовсе. Для русской озвучки я бы его не брала без личной проверки на своём тексте.

Про CapCut отдельно. Озвучка встроена прямо в монтажку, отдельный сервис не нужен, и этим он удобен. Два обстоятельства делают его негодным для коммерческого ролика: с российских адресов он отвечает отказом по юридическим причинам, а в его условиях использования прямо сказано, что сервис предоставляется для частного некоммерческого использования.

Про права на озвучку

Это место, где ошибаются чаще всего. Бесплатный тариф часто разрешает слушать результат и запрещает публиковать его в коммерческом контенте. Speechify, например, пишет запрет прямым текстом и в тарифе, и в договоре, и это честно по отношению к пользователю. У большинства остальных вопрос закрыт общим договором, где права появляются вместе с платным тарифом.

Правило простое: если ролик продаёт что-то ваше, озвучка должна идти с тарифа, где коммерческое использование разрешено явно. Стоит это от пяти долларов, спор с площадкой стоит дороже.

Как написать текст, который хорошо звучит голосом

Синтез читает ровно то, что написано, поэтому половина качества озвучки решается до всякого сервиса. Как собрать сам текст ролика, разбираю в статье про сценарий для рилса.

  1. Короткие предложения. Длинная фраза с двумя придаточными звучит механически у любого движка. Разбивайте на части по 8 до 12 слов.
  2. Пишите так, как говорите. Причастные обороты и канцелярит в устной речи не встречаются, и на слух это сразу заметно.
  3. Цифры и сокращения пишите словами. «2026» движок прочитает по-разному, «две тысячи двадцать шестой» прочитает одинаково всегда. То же с «т.д.», «руб.», «км».
  4. Расставьте паузы точками. Точка даёт паузу, запятая короткую заминку. Там, где нужна тишина перед сильной фразой, ставьте точку и начинайте новое предложение.
  5. Ударения проверяйте в спорных словах. Замок, стоит, дорога. Многие сервисы позволяют задать ударение вручную, и это единственный способ убрать смешную ошибку в середине ролика.

Как выбрать голос под ролик

Голос решает больше, чем кажется. Один и тот же текст, прочитанный по-разному, даёт разное доверие.

Под экспертный контент берите ровный голос среднего темпа без актёрской подачи. Чем спокойнее, тем весомее звучит содержание.

Под динамичный ролик темп выше, паузы короче. Здесь важно проверить, что синтез не съедает окончания на быстром темпе.

Под сторителлинг нужны интонационные перепады. Тут разница между сервисами самая заметная, дешёвые движки читают историю тем же тоном, что и прогноз погоды.

Проверяйте выбранный голос на своём тексте. Демо-фраза из витрины сервиса подобрана так, чтобы движок звучал лучше всего, поэтому она мало что говорит про вашу задачу.

Пять ошибок, из-за которых озвучка выдаёт робота

  1. Текст написан для чтения глазами. Он и звучит как прочитанный вслух документ.
  2. Один голос на весь ролик без единой паузы. Слушателю не за что зацепиться, внимание уходит через десять секунд.
  3. Громкость не выровнена с музыкой. Голос тонет в подложке. Музыка должна быть тише голоса заметно, разница в пару делений тут не работает.
  4. Не проверили ударения. Одно смешное ударение обесценивает весь ролик.
  5. Голос не совпадает с картинкой. Молодой энергичный голос поверх спокойного экспертного кадра читается как чужая дорожка.

Что делать с губами, если в кадре человек

Когда в кадре говорящий человек, синтез поверх видео заметен сразу: губы не совпадают со звуком. Тут два пути.

Первый: закрыть лицо. Ролик собирается из перебивок, записи экрана и текста на экране, голос идёт поверх. Так делают почти все ролики-разборы.

Второй: синхронизация губ. Сервисы говорящих аватаров подгоняют движение губ под звуковую дорожку, включая перевод на другой язык. Качество за последний год выросло заметно, и на коротком ролике подмену замечают редко.

Забрать сборку на полный цикл

Озвучка это одно звено. Целиком ролик собирается из шести сервисов: текст, картинка, видео, голос, аватар, монтаж. Я собрал их в один материал: по каждому лежит живая ссылка, честные условия бесплатного входа со всеми ограничениями и первое действие, которое можно сделать сегодня вечером.

Забрать по слову ЭРА

Частые вопросы

Какая нейросеть лучше озвучивает на русском?

Под русский язык сильнее всех заточен Яндекс SpeechKit: 19 русских голосов из 29 в каталоге и оплата рублями. Если нужен широкий выбор интонаций и языков, берут ElevenLabs, русский там заявлен и звучит живо.

Можно ли озвучить ролик бесплатно?

Да. Самый большой бесплатный объём у Google Cloud Text-to-Speech, 4 миллиона символов в месяц, но с обязательной привязкой карты. У ElevenLabs бесплатно дают около десяти минут речи в месяц. Проверьте условия по правам: часть сервисов запрещает публиковать бесплатную озвучку в коммерческом контенте.

Как клонировать свой голос?

У ElevenLabs это открывается с тарифа за 6 долларов, у Voicemaker с 5 долларов, у HeyGen с 29. Везде нужен образец вашей речи, а у части сервисов ещё и отдельная запись согласия. У Яндекса клонирование корпоративное и стоит от 100 тысяч рублей в месяц за хостинг голоса.

Почему синтез звучит как робот?

Чаще всего дело в тексте: длинные предложения, канцелярит, цифры и сокращения написаны символами. Разбейте фразы на короткие, напишите числа словами и расставьте паузы точками, разница слышна сразу.

Заметят ли зрители, что голос синтезированный?

На коротком ролике редко, особенно когда в кадре нет говорящего человека. Выдаёт обычно не тембр, а ровная интонация на длинном тексте и ошибки в ударениях.

Что делать, если в кадре человек и губы не совпадают?

Либо убрать лицо из кадра и собрать ролик из перебивок и текста на экране, либо использовать синхронизацию губ в сервисе говорящих аватаров. Про сборку такого ролика есть отдельный разбор: рилс без съёмок.

Забирай материалы в боте
Статья прочитана. Дальше самое полезное я отдаю в боте: промпты, гайды и разборы, по которым можно работать сразу.
Готовые промпты под Reels, хуки и длинные описания
Разборы, почему одни ролики залетают, а другие нет
Гайды по нейросетям для контента, коротко и по делу