_Владимир Ижмуков · автор системы роста Instagram через короткие ролики_
Собрать ролик нейросетью сейчас можно целиком с телефона, за один вечер и без монтажного опыта. Компьютер тут добавляет удобства, а обязательным перестал быть примерно год назад.
Ниже порядок, по которому я собираю ролики сам. Он рассчитан на человека, который делает это впервые: восемь шагов, на каждом сказано, что именно делать, сколько времени закладывать и где обычно ломается.
Соседние разборы: генерация видео по тексту про механику, озвучка нейросетью про голос и музыка для рилс про звук.
Что понадобится до начала
Проверено 29 августа 2026 года на телефоне с Android и на айфоне.
Нужны три вещи: телефон, доступ к одному сервису генерации видео и любой мобильный редактор. Всё остальное добавляется по желанию. Оплата у большинства сервисов идёт зарубежной картой, поэтому первый ролик имеет смысл собрать на бесплатном уровне и только потом решать, за что платить.
Заложите на первый ролик два часа. Полтора из них уйдут на знакомство с интерфейсами, и это нормально: пятый ролик занимает уже минут сорок.
Шаг 1. Текст ролика, до всякой генерации
Начинают с текста. Пока текст слабый, красивая картинка его не вытянет.
Для ролика на тридцать секунд нужно примерно шестьдесят пять слов. Структура рабочая и простая:
- Первая фраза называет проблему или обещание. У вас на неё три секунды.
- Середина отдаёт суть: три коротких пункта или один разобранный пример.
- Последняя фраза говорит человеку, что сделать дальше.
Проверка текста делается вслух. Читаете и спотыкаетесь, значит зритель споткнётся тоже, только он ещё и уйдёт.
Шаг 2. Разбивка на сцены по пять секунд
Ролик собирается из коротких генераций. Причина техническая: модели держат согласованность кадров на отрезке в пять или десять секунд, дальше картинка начинает расползаться.
Возьмите свой текст и разделите на куски по одной мысли. Каждый кусок это одна сцена. Для тридцатисекундного ролика выходит пять или шесть сцен.
Рядом с каждой сценой напишите одной строкой, что зритель видит в этот момент. Пока без красот, простым языком: «руки над клавиатурой», «город вечером», «чашка на столе».
Шаг 3. Промпты под сцены
Описание для видео состоит из шести частей: кто или что в кадре, что делает, где происходит, какой свет, как движется камера, в каком стиле снято.
Заготовка, которую можно взять и переписать под себя:
> Человек за письменным столом закрывает ноутбук и откидывается на спинку кресла. Вечер, настольная лампа справа, тёплый свет. Камера медленно отъезжает от среднего плана к общему. Кинематографическая съёмка, мягкое зерно, приглушённые цвета.
Три правила, которые экономят генерации:
- Одно действие на сцену. Два действия подряд модель смешивает.
- Движение камеры называйте словами. Иначе камера ведёт себя случайно.
- Обстановку держите одинаковой во всех сценах. Одно и то же помещение, один и тот же свет. Иначе куски не склеятся в цельный ролик.
Шаг 4. Генерация
Сгенерируйте все сцены подряд, ничего не правя по ходу. Первый проход нужен целиком: отдельные кадры обманывают, ролик виден только собранным.
Закладывайте полуторный запас генераций к числу сцен. На пять сцен обычно уходит семь или восемь попыток, потому что одна или две сцены переделываются.
Что делать, когда сцена не получается третий раз подряд
Меняйте сам кадр, а описание оставьте в покое. Крупный план рук замените средним планом, лицо уберите из ближнего кадра, предмет в движении замените предметом в покое. Модели ломаются предсказуемо, и обходить их слабые места дешевле, чем побеждать.
Шаг 5. Озвучка
Голос добавляют одним из двух способов.
Свой голос. Записывается прямо в редакторе или диктофоном. Живее любой генерации, и для личного блога это лучший вариант.
Синтез речи. Нужен, когда голос в кадре не подходит или запись даётся тяжело. Русский язык сейчас звучит естественно у нескольких сервисов, разбор с условиями я вынес в отдельную статью.
Одно техническое правило важнее выбора сервиса: пишите голос до монтажа. Длительность сцен подгоняется под голос, обратный порядок заставляет переделывать всё.
Шаг 6. Сборка в редакторе
Мобильных редакторов достаточно, и для этой задачи между ними мало разницы. Порядок действий одинаковый:
- Положите сцены в нужном порядке на дорожку.
- Наложите голос и подрежьте длительность сцен под него.
- Добавьте текст поверх: первая фраза на первые три секунды, дальше короткие подписи по смыслу.
- Положите музыку и опустите её громкость примерно до пятой части от голоса.
- Добавьте лёгкое зерно на всё видео. Это единственный приём, который заметно снижает узнаваемость генерации.
Текст внутри генерации не делайте вовсе: буквы получатся похожими на буквы и не будут значить ничего.
Шаг 7. Субтитры
Восемь зрителей из десяти смотрят ленту без звука, поэтому субтитры перестали быть украшением.
Все крупные мобильные редакторы умеют распознавать речь автоматически. После распознавания обязательно прочитайте текст глазами: имена, названия сервисов и числа распознаются хуже всего.
Держите субтитры в средней трети кадра. Низ закрывается интерфейсом приложения, и подпись там частично не видна.
Шаг 8. Проверка перед публикацией
Короткий список, по которому стоит пройтись до выкладки:
- Первые три секунды понятны без звука.
- Голос слышен, музыка не перебивает.
- Субтитры не заходят на интерфейс.
- В кадре нет текста, сгенерированного моделью.
- Ролик смотрится с телефона на солнце: контраст достаточный.
- Описание под роликом написано и заканчивается одним конкретным действием.
Инструменты под каждый шаг
| Шаг | Что нужно | Замечание |
|---|---|---|
| Текст ролика | любой чат с языковой моделью | правите руками, готовый текст берут редко |
| Генерация сцен | Veo, Kling, Hailuo, Luma, Pika | у всех есть бесплатный уровень с лимитом |
| Озвучка | свой голос или синтез речи | пишется до монтажа |
| Сборка | мобильный редактор | различий между ними для этой задачи мало |
| Субтитры | встроенное распознавание редактора | перечитывать глазами обязательно |
| Музыка | библиотека с ясной лицензией | разбор источников |
Пять ошибок первого ролика
- Сначала картинка, потом текст. Самая частая и самая дорогая. Ролик получается красивым и пустым.
- Разная обстановка в сценах. Куски не склеиваются, ролик выглядит нарезкой чужих видео.
- Музыка вровень с голосом. На колонках кажется нормально, в наушниках слов не разобрать.
- Крупные планы рук. Модели ломаются на пальцах, и зритель это замечает мгновенно.
- Идеально гладкая картинка. Полное отсутствие изъянов читается как генерация. Зерно решает.
Частые вопросы
Можно ли сделать видео нейросетью бесплатно?
Да. У большинства сервисов генерации есть бесплатный уровень с лимитом генераций в сутки и водяным знаком. Мобильные редакторы бесплатны в базовом наборе функций. Первый ролик собирается без единого платежа, платить имеет смысл, когда стало ясно, каким сервисом вы реально пользуетесь.
Нужен ли компьютер?
Нет. Генерация идёт в браузере или в приложении сервиса, сборка в мобильном редакторе. Компьютер удобнее на длинных роликах и при сложном монтаже, для коротких вертикальных роликов разницы почти нет.
Сколько времени занимает один ролик?
Первый около двух часов, из них полтора на знакомство с интерфейсами. Пятый примерно сорок минут. Десятый пятнадцать, потому что промпты к тому моменту повторяются и меняются в них две строки.
Как сделать, чтобы человек в ролике выглядел одинаково во всех сценах?
Самый надёжный способ это строить кадры так, чтобы лицо не было крупным планом. Дальше по надёжности идёт генерация всех сцен от одной опорной картинки, такую возможность дают Kling, Luma и Runway. Третий способ, дословно одинаковое описание внешности в каждом промпте, работает через раз.
Поймёт ли зритель, что видео сгенерировано?
На общих и средних планах в ленте телефона чаще всего нет. Выдают три вещи: пальцы в крупном плане, текст внутри кадра и слишком гладкая картинка. Первые две убираются построением кадра, третья зерном на монтаже.
Что дальше
Инструмент даёт картинку, а результат в коротких роликах приносит формат: первые три секунды и длинное описание, которое человек дочитывает, пока ролик идёт по кругу.
Про сам формат: почему рилс не набирают просмотры и как снимать рилсы.


