Перейти к содержимому
VC
Кейс 10 из 28 · Реклама с оплатой за результат

Из речи в готовый ролик: распознавание, смена языка и синхронизация губ

Один креатив размножается на 5 и более языков и стран автоматически. Whisper расшифровывает речь → GPT-4o переводит и переписывает под рынок и тип покупателя → ElevenLabs воспроизводит голос с нужным акцентом → wav2lip подгоняет движение губ под новую звуковую дорожку. Что раньше требовало студии звукозаписи и неделю работы — теперь делается за вечер.

Отрасль
Реклама с оплатой за результат · партнёрский маркетинг
Стек
Whisper · GPT-4o · ElevenLabs · ffmpeg
Сроки
≈ 5 рабочих дней (первая версия)
Итог
1 видео → 10-30 вариантов
01 · Боль

Спай-данные есть, но руками не масштабируется

В интернет-рекламе сервисы наблюдения за конкурентами (AdHeart, AdSpy, AdsLibrary, Anstrex) дают тысячи работающих рекламных роликов конкурентов — но заимствовать можно только то, что не нарушает авторские права. Голос диктора, фон, лицо актёра, движение губ — всё, что защищено авторским правом, приходится создавать заново.

Раньше всё делалось вручную: смотрю чужой ролик → расшифровываю речь в текст → отдаю копирайтеру переписать под своё предложение → нанимаю диктора через Fiverr → жду 1–3 дня → монтирую в Final Cut → повторяю заново. 4–6 часов работы на одну версию, и это без синхронизации губ.

При бюджетах $2–5 тыс. в день на A/B-тесты скорость выпуска роликов и есть конкурентное преимущество. Когда одновременно идёт 8-10 рекламных наборов и каждому нужно 20-30 свежих креативов в неделю, ручная работа перестаёт справляться.

02 · Решение

Конвейер из четырёх шагов: распознали речь → переписали текст → озвучили → свели с губами

01
РАСПОЗНАВАНИЕ

Whisper расшифровывает видео конкурентов

whisper-large-v3 или OpenAI whisper-1 через API. Поддержка русского, английского, балканских, тюркских, испанского. Выдаёт SRT с таймкодами — знаем точно, на какой секунде какая фраза.

02
МОДЕЛЬ · ПЕРЕВОД

GPT переводит, адаптирует и переписывает под нужного покупателя

GPT-4o делает три задачи в одном проходе: (a) разбирает расшифровку на смысловые блоки — зацепка (первые 3 секунды), боль, доказательство, призыв к действию; (b) переводит на целевой язык (русский / английский / сербский / польский / турецкий) с учётом культурных нюансов — не дословно, а как «носитель бы это сказал»; (c) переписывает под нужное предложение, тип покупателя и страну, сохраняя ритм и эмоциональные триггеры оригинала.

Промпты с готовыми примерами «было → стало» для каждого языка и ниши. Главный фокус — сохранить таймкоды: каждая фраза по длительности должна совпадать с оригиналом, иначе движение губ разойдётся со звуком. Выход — 10–30 версий × 5+ языков, отсортированные по ожидаемому отклику аудитории.

03
ОЗВУЧКА · ГОЛОС

ElevenLabs воспроизводит голос с нужным акцентом

ElevenLabs Multilingual v2 поддерживает 29 языков в одной модели — клонированный голос звучит на любом из них с правильным акцентом. Это важно: если оригинальный диктор — американка с южным акцентом, её клон на сербском не будет звучать как робот, а как естественная сербка-носительница.

Две стратегии: (a) voice cloning — 30-секундного сэмпла достаточно для high-quality клона; (b) готовые голоса для быстрых A/B-тестов по тембру (мужской или женский, возраст, интонация). Настройки стабильности, схожести и стиля подбираются под нишу. На выходе — звуковая дорожка той же длительности с оригиналом (важно для следующего шага).

04
ГУБЫ

wav2lip подгоняет движение губ

На этом этапе появляется «магия» — актриса в видео начинает говорить на новом языке так, будто это сняли заново. wav2lip разбирает исходное видео и новую звуковую дорожку и перерисовывает область рта кадр за кадром, чтобы движение губ совпадало с новой речью. Нужна видеокарта, но это часы расчётов, а не дни работы студии.

Простой случай (voice-over / off-screen): ffmpeg просто заменяет звуковую дорожку. Сложный случай, когда в кадре говорящий человек: wav2lip или SadTalker для синхронизации лица. На выходе — готовый mp4 под рекламные площадки (FB Ads / TikTok / VK Ads / Yandex Direct).

03 · Стек

Технологии и инфраструктура

Распознавание речи
  • OpenAI Whisper API (whisper-1)
  • whisper-large-v3 на своём сервере — при больших объёмах
  • Разбор субтитров ради точных таймкодов
Работа с моделями
  • GPT-4o / Claude Sonnet 4.5
  • Промпты с примерами «зацепка → переписанный текст»
  • Ответ модели в строгой структуре JSON
Синтез речи
  • ElevenLabs Multilingual v2
  • Воспроизведение голоса — хватает 30-секундного образца
  • Настройки голоса: стабильность, схожесть, стиль
Видео и синхронизация губ
  • ffmpeg для замены звуковой дорожки
  • wav2lip и SadTalker — когда в кадре говорящий человек
  • Управление шагами на Python и очередь задач
04 · Результат

Что меняется в воронке

Время на выпуск
4-6 ч ~30 мин

на один вариант ролика (замена звука, без синхронизации губ)

Объём из 1 видео
1-2 10-30 × 5+

версий × языков (одна актриса → 5+ стран без повторных съёмок)

Цена одного ролика
$40-80 ~$2

Whisper + GPT + ElevenLabs (по тарифам сервисов, без синхронизации губ)

Главный эффект — скорость итерации. A/B-тест 20 вариантов первой фразы вместо двух запускается за вечер, а не за неделю. Выигравшие сочетания видно уже в первые 24-48 часов, проигравшие отключаются раньше, чем сожгут бюджет. Установка дешевеет на 15-30% за счёт того, что первая фраза точнее попадает в нужного покупателя.

05 · Применимость

Где работает, где нет

Подходит
  • · Рекламные агентства, где 5 и более человек делают креативы
  • · Рекламные команды и интернет-магазины с большим потоком креативов
  • · Свой отдел маркетинга интернет-магазина, который регулярно снимает ролики «как от покупателей»
  • · Запуски в 5 и более странах одновременно — все языки из одного исходного сценария
  • · Подкасты и онлайн-школы — для нарезки коротких роликов
Не подходит
  • · Прямое копирование чужих роликов — это нарушение авторских прав
  • · Ниши со строгим регулированием (медицина, фармацевтика, финансы) — там нужны юристы по рекламе
  • · Воспроизведение чужого голоса без согласия его владельца — запрещено законом ЕС об ИИ
  • · Длинные видео от 10 минут — озвучка и монтаж обойдутся не дешевле дорогого живого диктора

Этическая нота: конвейер предназначен для масштабирования собственных идей и оригинальных сценариев. Использование чужих видео и голосов без разрешения — нарушение авторских прав и европейского регламента об ИИ (AI Act). Я делаю расшифровку чужих роликов, чтобы понимать рынок, а затем пишу собственный сценарий и делаю собственные звук и видео.

Готовы начать?

Аудит за 5 000 ₽ — с конкретным отчётом и сметой

Расскажу что внедрить в вашем бизнесе в первую очередь, какая будет окупаемость, и нужен ли вообще AI для вашей задачи (иногда — нет).

Или просто напишите свой вопрос — отвечу в течение 2 часов