# Озвучка нейросетью: чем озвучить ролик и что открывается из России

_Владимир Ижмуков · автор системы роста Instagram через короткие ролики_

Синтез речи за пару лет прошёл путь от «слышно робота с первой секунды» до «на коротком ролике подмену замечают редко». Это открыло формат тем, кто не хочет писать голосом сам: ролик собирается из кадров и текста, а озвучка делается за минуту.

Проблем осталось две. Первая: половина подборок в сети рекламирует сервисы, которые либо не открываются с российских адресов, либо закрылись насовсем. Вторая: тот же движок на одном тексте звучит живо, а на другом механически, и дело тут в тексте.

Разбираю обе. Сначала чем озвучивать, потом как написать так, чтобы звучало. Про сборку самого ролика у меня есть отдельные разборы: [нейросети для видео](/guides/neyroseti-dlya-video-2026/) и [как сделать рилс из длинного видео](/guides/rils-iz-video/).

## Что открывается из России

Проверяла 24 августа: прогоняла домены через узлы в Москве и Петербурге плюс два зарубежных для контроля. Граница у проверки та же, что всегда. Она показывает, отдаёт ли сайт страницу на запрос из России. Пустят ли внутрь и пройдёт ли оплата, так узнать нельзя, и это я не проверяла.

**Отвечают всем одинаково.** ElevenLabs, Яндекс SpeechKit, SaluteSpeech от Сбера, HeyGen, Google Cloud Text-to-Speech, Voicemaker. У Murf два российских узла из трёх ответили, третий устойчиво не достучался в трёх прогонах подряд, зарубежные ответили; на маршрут это похоже больше, чем на страну.

**Отказ приходит только с российских узлов.** Speechify, OpenAI TTS и CapCut. У CapCut случай самый прямой: он отдаёт российским узлам код 451 «Недоступно по юридическим причинам», зарубежным при этом отвечает нормально.

**Сервис закрылся насовсем.** PlayHT, он же Play.ai, висит почти в каждой подборке в сети. Домен сегодня не отвечает ни с одного узла на планете, потому что у него больше нет адресных записей DNS. В последней живой версии главной страницы стоял прощальный баннер вендора. Русский он, к слову, не поддерживал никогда. Любой обзор с его тарифами устарел целиком.

**Отдельно про Сбер, это важно для российских пользователей.** В документации SaluteSpeech сказано прямо: с 15 июля 2026 года прекращена продажа новых пакетов и продление бесплатного тарифа для физических лиц. Для юрлиц сервис живой и цена там самая низкая из всех, кого я смотрела, но с порогом: минимальная стоимость использования 15 000 рублей в месяц. При этом в их же базе знаний до сих пор висит страница, где бесплатный тариф описан как действующий. Ориентируйтесь на документацию тарифов, она свежее.

## Чем озвучивать: раскладка по задачам

**Самый большой бесплатный объём.** Google Cloud Text-to-Speech: 4 миллиона символов в месяц на стандартных голосах, дальше 4 доллара за миллион. Это порядки против остальных. Плата за вход своя: нужна привязка карты, и превышение лимита списывается автоматически.

**Живой голос и широкий выбор языков.** ElevenLabs. Бесплатно дают 10 000 символов в месяц, это примерно десять минут речи, платный вход начинается с 6 долларов. Клонирование голоса открывается с этого же тарифа, продвинутое клонирование с 22 долларов.

**Русский как основной язык продукта.** Яндекс SpeechKit, у него 19 русских голосов из 29 в каталоге, то есть две трети. Оплата рублями. Цена по последнему официальному снимку страницы тарифов около 1 320 ₽ за миллион символов с НДС, и тут честная оговорка: живую страницу тарифов машиной прочитать нельзя, там капча, а на самой странице предупреждают о росте ставки НДС с января. Значит цифру считайте ориентиром и сверяйте в кабинете.

Клонирование голоса у Яндекса корпоративное: разовый платёж 9 000 ₽ за создание голоса плюс хостинг модели от 100 000 ₽ в месяц. Для блогера это мимо, для компании с постоянной озвучкой имеет смысл.

**Голос вместе с говорящим аватаром.** HeyGen. Единственный в подборке, кто отдаёт не только дорожку, но и человека в кадре, который её произносит. На бесплатном тарифе доступен один свой аватар, полноценное клонирование голоса с 29 долларов.

**Самый низкий порог входа в коммерцию.** Voicemaker: 5 долларов в месяц, и на этом тарифе уже дают пять слотов клонирования голоса.

**Про Murf осторожно.** Сервис популярный, тарифы прозрачные, вход 19 долларов при годовой оплате. По русскому языку он противоречит сам себе: справка называет русский среди поддерживаемых, а в списке языков клонирования его нет прямым текстом, и в библиотеке голосов API русской локали не нашлось вовсе. Для русской озвучки я бы его не брала без личной проверки на своём тексте.

**Про CapCut отдельно.** Озвучка встроена прямо в монтажку, отдельный сервис не нужен, и этим он удобен. Два обстоятельства делают его негодным для коммерческого ролика: с российских адресов он отвечает отказом по юридическим причинам, а в его условиях использования прямо сказано, что сервис предоставляется для частного некоммерческого использования.

### Про права на озвучку

Это место, где ошибаются чаще всего. Бесплатный тариф часто разрешает слушать результат и запрещает публиковать его в коммерческом контенте. Speechify, например, пишет запрет прямым текстом и в тарифе, и в договоре, и это честно по отношению к пользователю. У большинства остальных вопрос закрыт общим договором, где права появляются вместе с платным тарифом.

Правило простое: если ролик продаёт что-то ваше, озвучка должна идти с тарифа, где коммерческое использование разрешено явно. Стоит это от пяти долларов, спор с площадкой стоит дороже.

## Как написать текст, который хорошо звучит голосом

Синтез читает ровно то, что написано, поэтому половина качества озвучки решается до всякого сервиса. Как собрать сам текст ролика, разбираю в статье про [сценарий для рилса](/guides/scenariy-dlya-rilsa/).

1. **Короткие предложения.** Длинная фраза с двумя придаточными звучит механически у любого движка. Разбивайте на части по 8 до 12 слов.
2. **Пишите так, как говорите.** Причастные обороты и канцелярит в устной речи не встречаются, и на слух это сразу заметно.
3. **Цифры и сокращения пишите словами.** «2026» движок прочитает по-разному, «две тысячи двадцать шестой» прочитает одинаково всегда. То же с «т.д.», «руб.», «км».
4. **Расставьте паузы точками.** Точка даёт паузу, запятая короткую заминку. Там, где нужна тишина перед сильной фразой, ставьте точку и начинайте новое предложение.
5. **Ударения проверяйте в спорных словах.** Замок, стоит, дорога. Многие сервисы позволяют задать ударение вручную, и это единственный способ убрать смешную ошибку в середине ролика.

## Как выбрать голос под ролик

Голос решает больше, чем кажется. Один и тот же текст, прочитанный по-разному, даёт разное доверие.

**Под экспертный контент** берите ровный голос среднего темпа без актёрской подачи. Чем спокойнее, тем весомее звучит содержание.

**Под динамичный ролик** темп выше, паузы короче. Здесь важно проверить, что синтез не съедает окончания на быстром темпе.

**Под сторителлинг** нужны интонационные перепады. Тут разница между сервисами самая заметная, дешёвые движки читают историю тем же тоном, что и прогноз погоды.

Проверяйте выбранный голос на своём тексте. Демо-фраза из витрины сервиса подобрана так, чтобы движок звучал лучше всего, поэтому она мало что говорит про вашу задачу.

## Пять ошибок, из-за которых озвучка выдаёт робота

1. **Текст написан для чтения глазами.** Он и звучит как прочитанный вслух документ.
2. **Один голос на весь ролик без единой паузы.** Слушателю не за что зацепиться, внимание уходит через десять секунд.
3. **Громкость не выровнена с музыкой.** Голос тонет в подложке. Музыка должна быть тише голоса заметно, разница в пару делений тут не работает.
4. **Не проверили ударения.** Одно смешное ударение обесценивает весь ролик.
5. **Голос не совпадает с картинкой.** Молодой энергичный голос поверх спокойного экспертного кадра читается как чужая дорожка.

## Что делать с губами, если в кадре человек

Когда в кадре говорящий человек, синтез поверх видео заметен сразу: губы не совпадают со звуком. Тут два пути.

Первый: закрыть лицо. Ролик собирается из перебивок, записи экрана и текста на экране, голос идёт поверх. Так делают почти все ролики-разборы.

Второй: синхронизация губ. Сервисы говорящих аватаров подгоняют движение губ под звуковую дорожку, включая перевод на другой язык. Качество за последний год выросло заметно, и на коротком ролике подмену замечают редко.

## Забрать сборку на полный цикл

Озвучка это одно звено. Целиком ролик собирается из шести сервисов: текст, картинка, видео, голос, аватар, монтаж. Я собрал их в один материал: по каждому лежит живая ссылка, честные условия бесплатного входа со всеми ограничениями и первое действие, которое можно сделать сегодня вечером.

[Забрать по слову ЭРА](https://t.me/izhmukov777_bot?start=era)

## Частые вопросы

### Какая нейросеть лучше озвучивает на русском?

Под русский язык сильнее всех заточен Яндекс SpeechKit: 19 русских голосов из 29 в каталоге и оплата рублями. Если нужен широкий выбор интонаций и языков, берут ElevenLabs, русский там заявлен и звучит живо.

### Можно ли озвучить ролик бесплатно?

Да. Самый большой бесплатный объём у Google Cloud Text-to-Speech, 4 миллиона символов в месяц, но с обязательной привязкой карты. У ElevenLabs бесплатно дают около десяти минут речи в месяц. Проверьте условия по правам: часть сервисов запрещает публиковать бесплатную озвучку в коммерческом контенте.

### Как клонировать свой голос?

У ElevenLabs это открывается с тарифа за 6 долларов, у Voicemaker с 5 долларов, у HeyGen с 29. Везде нужен образец вашей речи, а у части сервисов ещё и отдельная запись согласия. У Яндекса клонирование корпоративное и стоит от 100 тысяч рублей в месяц за хостинг голоса.

### Почему синтез звучит как робот?

Чаще всего дело в тексте: длинные предложения, канцелярит, цифры и сокращения написаны символами. Разбейте фразы на короткие, напишите числа словами и расставьте паузы точками, разница слышна сразу.

### Заметят ли зрители, что голос синтезированный?

На коротком ролике редко, особенно когда в кадре нет говорящего человека. Выдаёт обычно не тембр, а ровная интонация на длинном тексте и ошибки в ударениях.

### Что делать, если в кадре человек и губы не совпадают?

Либо убрать лицо из кадра и собрать ролик из перебивок и текста на экране, либо использовать синхронизацию губ в сервисе говорящих аватаров. Про сборку такого ролика есть отдельный разбор: [рилс без съёмок](/guides/reels-bez-semok-neyrosetyami/).
