Из речи в готовый ролик: распознавание, смена языка и синхронизация губ
Один креатив размножается на 5 и более языков и стран автоматически. Whisper расшифровывает речь → GPT-4o переводит и переписывает под рынок и тип покупателя → ElevenLabs воспроизводит голос с нужным акцентом → wav2lip подгоняет движение губ под новую звуковую дорожку. Что раньше требовало студии звукозаписи и неделю работы — теперь делается за вечер.
Спай-данные есть, но руками не масштабируется
В интернет-рекламе сервисы наблюдения за конкурентами (AdHeart, AdSpy, AdsLibrary, Anstrex) дают тысячи работающих рекламных роликов конкурентов — но заимствовать можно только то, что не нарушает авторские права. Голос диктора, фон, лицо актёра, движение губ — всё, что защищено авторским правом, приходится создавать заново.
Раньше всё делалось вручную: смотрю чужой ролик → расшифровываю речь в текст → отдаю копирайтеру переписать под своё предложение → нанимаю диктора через Fiverr → жду 1–3 дня → монтирую в Final Cut → повторяю заново. 4–6 часов работы на одну версию, и это без синхронизации губ.
При бюджетах $2–5 тыс. в день на A/B-тесты скорость выпуска роликов и есть конкурентное преимущество. Когда одновременно идёт 8-10 рекламных наборов и каждому нужно 20-30 свежих креативов в неделю, ручная работа перестаёт справляться.
Конвейер из четырёх шагов: распознали речь → переписали текст → озвучили → свели с губами
Whisper расшифровывает видео конкурентов
whisper-large-v3 или OpenAI whisper-1 через API. Поддержка русского, английского, балканских, тюркских, испанского. Выдаёт SRT с таймкодами — знаем точно, на какой секунде какая фраза.
GPT переводит, адаптирует и переписывает под нужного покупателя
GPT-4o делает три задачи в одном проходе: (a) разбирает расшифровку на смысловые блоки — зацепка (первые 3 секунды), боль, доказательство, призыв к действию; (b) переводит на целевой язык (русский / английский / сербский / польский / турецкий) с учётом культурных нюансов — не дословно, а как «носитель бы это сказал»; (c) переписывает под нужное предложение, тип покупателя и страну, сохраняя ритм и эмоциональные триггеры оригинала.
Промпты с готовыми примерами «было → стало» для каждого языка и ниши. Главный фокус — сохранить таймкоды: каждая фраза по длительности должна совпадать с оригиналом, иначе движение губ разойдётся со звуком. Выход — 10–30 версий × 5+ языков, отсортированные по ожидаемому отклику аудитории.
ElevenLabs воспроизводит голос с нужным акцентом
ElevenLabs Multilingual v2 поддерживает 29 языков в одной модели — клонированный голос звучит на любом из них с правильным акцентом. Это важно: если оригинальный диктор — американка с южным акцентом, её клон на сербском не будет звучать как робот, а как естественная сербка-носительница.
Две стратегии: (a) voice cloning — 30-секундного сэмпла достаточно для high-quality клона; (b) готовые голоса для быстрых A/B-тестов по тембру (мужской или женский, возраст, интонация). Настройки стабильности, схожести и стиля подбираются под нишу. На выходе — звуковая дорожка той же длительности с оригиналом (важно для следующего шага).
wav2lip подгоняет движение губ
На этом этапе появляется «магия» — актриса в видео начинает говорить на новом языке так, будто это сняли заново. wav2lip разбирает исходное видео и новую звуковую дорожку и перерисовывает область рта кадр за кадром, чтобы движение губ совпадало с новой речью. Нужна видеокарта, но это часы расчётов, а не дни работы студии.
Простой случай (voice-over / off-screen): ffmpeg просто заменяет звуковую дорожку. Сложный случай, когда в кадре говорящий человек: wav2lip или SadTalker для синхронизации лица. На выходе — готовый mp4 под рекламные площадки (FB Ads / TikTok / VK Ads / Yandex Direct).
Технологии и инфраструктура
- OpenAI Whisper API (whisper-1)
- whisper-large-v3 на своём сервере — при больших объёмах
- Разбор субтитров ради точных таймкодов
- GPT-4o / Claude Sonnet 4.5
- Промпты с примерами «зацепка → переписанный текст»
- Ответ модели в строгой структуре JSON
- ElevenLabs Multilingual v2
- Воспроизведение голоса — хватает 30-секундного образца
- Настройки голоса: стабильность, схожесть, стиль
- ffmpeg для замены звуковой дорожки
- wav2lip и SadTalker — когда в кадре говорящий человек
- Управление шагами на Python и очередь задач
Что меняется в воронке
на один вариант ролика (замена звука, без синхронизации губ)
версий × языков (одна актриса → 5+ стран без повторных съёмок)
Whisper + GPT + ElevenLabs (по тарифам сервисов, без синхронизации губ)
Главный эффект — скорость итерации. A/B-тест 20 вариантов первой фразы вместо двух запускается за вечер, а не за неделю. Выигравшие сочетания видно уже в первые 24-48 часов, проигравшие отключаются раньше, чем сожгут бюджет. Установка дешевеет на 15-30% за счёт того, что первая фраза точнее попадает в нужного покупателя.
Где работает, где нет
- · Рекламные агентства, где 5 и более человек делают креативы
- · Рекламные команды и интернет-магазины с большим потоком креативов
- · Свой отдел маркетинга интернет-магазина, который регулярно снимает ролики «как от покупателей»
- · Запуски в 5 и более странах одновременно — все языки из одного исходного сценария
- · Подкасты и онлайн-школы — для нарезки коротких роликов
- · Прямое копирование чужих роликов — это нарушение авторских прав
- · Ниши со строгим регулированием (медицина, фармацевтика, финансы) — там нужны юристы по рекламе
- · Воспроизведение чужого голоса без согласия его владельца — запрещено законом ЕС об ИИ
- · Длинные видео от 10 минут — озвучка и монтаж обойдутся не дешевле дорогого живого диктора
Этическая нота: конвейер предназначен для масштабирования собственных идей и оригинальных сценариев. Использование чужих видео и голосов без разрешения — нарушение авторских прав и европейского регламента об ИИ (AI Act). Я делаю расшифровку чужих роликов, чтобы понимать рынок, а затем пишу собственный сценарий и делаю собственные звук и видео.
Похожие кейсы
GMBSPYLAB — сбор публичной FB Ad Library в свой канал в Telegram
Асинхронный Python и Postgres 16: 30–75k сырых карточек в сутки, отсев похожих оставляет 5–12k уникальных…
Сквозная атрибуция: от рекламного клика до заказа
Свой сервис на стандартной библиотеке Python принимает вебхуки Shopify, проверяет HMAC, шлёт заказ в трекер и…
Оплаченные заказы Shopify → рабочие таблицы склада
Заказы, номера отправлений, статусы и отмены проставляются сами каждые 30 минут. Приёмник на Advanced Sheets…
Аудит за 5 000 ₽ — с конкретным отчётом и сметой
Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).
Или просто напишите свой вопрос — отвечу в течение 2 часов