Содержание статьи +
- Кратко
- Почему это важно
- Три способа преодолеть языковой барьер
- Один конвейер, три выхода
- Стадия первая: транскрипция – возьмите слова и часы
- Стадия вторая: перевод – и проблема длины, которая ломает наивные конвейеры
- Стадия третья: голос – синтетический диктор или клонированный спикер
- Авто-субтитры как надо: формат и правила скорости чтения
- Контроль качества: где каждая стадия тихо проваливается
- Закон: раскрытие для голосов, доступность для субтитров
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Кратко
Есть три способа сделать видео понятным на другом языке – субтитры на экране, синтетический закадровый голос поверх оригинала и полный дубляж, который заменяет голос и попадает в губы, – и все три работают на одном машинном конвейере: распознать речь, перевести её и либо набрать текстом, либо озвучить. Сложность никогда не в переводе, а в тайминге: немецкая фраза может быть на четверть длиннее английского оригинала, поэтому наивный конвейер выдаёт дубляж, ускоренный до писка, или субтитр, который мелькает быстрее, чем его успеваешь прочитать. В 2026 году ИИ-дубляж стоит примерно $1–20 за минуту против $20–40 за минуту у студии с людьми – экономия около 90%, и именно поэтому функция локализации теперь есть в дорожной карте каждого видео-продукта. Этот урок строит конвейер по стадиям, чинит проблему тайминга с показанной арифметикой, задаёт правила форматов и скорости чтения субтитров по реальным спецификациям W3C и Netflix и приземляет два юридических обязательства – статью 50 EU AI Act для клонированных голосов и закон FCC/CVAA о доступности для субтитров.
Почему это важно
Раньше локализация была бюджетной строкой, которую утверждают раз в год, и подрядчиком, которому пишут письмо; теперь это функция, которую вы выпускаете внутри собственного продукта, и кто-то в команде должен заставить её работать. Урок написан для продакт-менеджера, основателя или техлида, которому нужно добавить «смотреть на испанском» или «включить субтитры» в видео-платформу и который хочет понять детали достаточно, чтобы оценить объём работ, выбрать подрядчика и избежать сбоев, делающих локализованное видео хуже, чем его отсутствие. Урок стоит ниже по течению от речевых уроков – урока про потоковый ASR и урока про WhisperX и диаризацию для транскрипции, урока про клонирование голоса и урока про потоковый TTS для голоса – и собирает эти части в одну выпускаемую функцию.
Три способа преодолеть языковой барьер
До любого кода решите, какой из трёх продуктов вы строите, потому что они стоят по-разному, несут разные риски и служат разным зрителям. Люди говорят «переведите моё видео» и имеют в виду одну из трёх очень разных вещей.
Самое лёгкое – субтитры: оригинальная дорожка играет нетронутой, а переведённый текст появляется внизу экрана. Зритель слышит настоящий голос и читает смысл. Это дешевле всего в производстве, безопаснее всего юридически – ничей голос не клонируется – и проще всего сделать правильно, но это требует от зрителя читать, на что готова не всякая аудитория.
Средний вариант – закадровый голос (voice-over, иногда «UN-style» или начитка). Синтетический диктор говорит перевод поверх, а оригинал приглушают (ducking), но он всё ещё слабо слышен снизу. Зритель слышит новый язык без чтения, и губы на экране больше не совпадают – но для документалок, новостей, обучающих и объясняющих видео это никого не смущает, потому что рот говорящего и не был сутью.
Самое тяжёлое – полный дубляж: оригинальный голос убирают и заменяют переведённым, в идеале клонированным под исходного спикера, и в идеале – с таймингом и попаданием в губы. Это вариант кинокачества. Он дороже всех, ошибается чаще всех и единственный запускает закон, потому что клонированный голос реального человека – это дипфейк.
Ошибка, которую совершают команды, – тянуться к полному дубляжу по умолчанию, потому что он звучит эффектнее всего, когда субтитры или закадр послужили бы аудитории лучше за долю стоимости и риска. Выбирайте самый лёгкий режим, который решает задачу.
Один конвейер, три выхода
Вот идея, которая упорядочивает всё ниже: все три режима проходят одну и ту же переднюю половину конвейера, а затем ветвятся. Общая передняя половина отвечает на два вопроса – что было сказано и что это значит на целевом языке – и оба ответа нужны каждому режиму. Ветвление – только про то, как доставлен ответ: текстом на экране, голосом поверх или голосом-заменой.
Пройдёмся по стадиям слева направо. Приходит видео. Транскрипция превращает речь в текст с таймкодом на каждом слове и меткой, кто говорил. Перевод превращает этот текст в целевой язык, стараясь сохранить правильную длину. Затем конвейер разветвляется. Для субтитров стадия вёрстки режет перевод на экранные реплики (cue), подчиняющиеся правилам скорости чтения, и пишет файл субтитров. Для закадра и дубляжа стадия синтеза речи превращает перевод в аудио моделью text-to-speech или клонирования голоса, стадия тайминга растягивает или переформулирует его под исходную длительность, опциональная стадия lip-sync деформирует рот, а стадия мукса возвращает новую дорожку на видео.
Видеть это как один конвейер выгодно практически: дорогая, критичная к точности работа – распознавание и перевод – общая, поэтому её строят один раз и переиспользуют во всех трёх продуктах. Дешёвая на словах, легко недооцениваемая работа – тайминг – это место, где каждый режим преуспевает или проваливается.
Стадия первая: транскрипция – возьмите слова и часы
Конвейер начинается с превращения речи в текст – работа модели автоматического распознавания речи, программы, которая слушает аудио и записывает слова, сокращённо ASR. Доминирующая открытая модель в 2026 году – OpenAI Whisper и её продакшн-обёртка WhisperX, которую мы разбираем в уроке про WhisperX; управляемые сервисы вроде Deepgram и AssemblyAI делают ту же работу, и мы сравниваем их в уроке про потоковый ASR.
Для локализации ASR должен выдать три вещи, а не одну. Очевидный выход – слова. Два выхода, о которых забывают, – часы и состав. Часы – это таймкод на каждом слове, момент его начала и конца, потому что и субтитры, и дубляж надо размещать во времени, а транскрипт без тайминга бесполезен для обоих. Состав – это метка спикера: «эту фразу сказала Anna, ту – Boris», – её даёт шаг под названием диаризация, и он важен в тот момент, когда в видео говорит больше одного человека, ведь дубляжу нужен свой клонированный голос на каждого спикера.
Качество этой стадии измеряют частотой ошибок по словам, сокращённо WER (word error rate), – она считает ошибки на сто слов. Формула складывает три вида ошибок и делит на число действительно сказанных слов:
WER = (замены + пропуски + вставки) / слов_в_эталонеЕсли клип из 100 слов вернулся с 3 неверными словами, 1 пропущенным и 1 выдуманным, арифметика такова:
WER = (3 + 1 + 1) / 100 = 0.05 = 5%5% ошибок по словам звучит немного, но каждая из них течёт вниз по течению: неверно расслышанное слово переводят неправильно, а потом уверенно произносят на чужом языке. Стадия транскрипции – там, где ошибки дешевле всего поймать и дороже всего проигнорировать; поэтому серьёзный конвейер даёт человеку поправить транскрипт до перевода, особенно для имён собственных и жаргона, которого модель никогда не слышала.
Стадия вторая: перевод – и проблема длины, которая ломает наивные конвейеры
Перевод – стадия, которую все ждут сложной и с которой современные модели в основном справляются хорошо. Ловушка в другом месте: в длине. Языки тратят разное число слогов на одно и то же. Строка, которая на английском занимает три секунды, на немецком или испанском займёт три и три четверти – расширение перевода на 20–30% для этих пар нормально. Перевод верен; он просто не помещается во время, которое потратил исходный спикер.
Для субтитров это значит, что реплика, которая должна висеть три секунды, теперь держит больше текста, чем зритель успевает прочесть за три секунды. Для дубляжа хуже: синтетический голос должен впихнуть более длинную фразу в тот же слот, поэтому он либо ускоряется – тот самый «писклявый» дубляж, который все слышали и ненавидели, – либо вылезает за край и наезжает на следующую строку.
Инженерный термин для цели – изохрония (isochrony): переведённая речь должна быть выровнена во времени с оригиналом, совпадая не только по общей длине, но и по паузам, а для lip-sync – и по движениям рта. Есть два способа этого добиться, и хорошие конвейеры используют оба.
Первый – перевод с контролем длины: попросить модель перевода версию не просто точную, а близкую к целевой длине, измеренной в символах или оценочном времени произнесения. Исследовательские системы вроде isochrony-aware machine translation и VideoDubber встраивают цель по длительности прямо в шаг перевода, так что модель предпочитает более короткий синоним более длинному, когда оба верны. Второй – ограниченное растяжение во времени: после генерации голоса растянуть или сжать аудио под слот – но только в узкой полосе, потому что за пределами примерно ±10–15% человеческое ухо слышит искажение. Если перевод всё ещё слишком длинный после обоих, конвейер укорачивает формулировку, а не разгоняет голос за грань естественности.
Качество перевода оценивают двумя способами. Старый стандарт – BLEU, который считает, сколько последовательностей слов машинный вывод делит с человеческим эталоном; он быстр и дёшев, но груб. Дефолт 2026 года для чего угодно серьёзного – COMET, нейронная метрика, обученная предсказывать человеческие оценки качества, и коррелирует с ними куда лучше BLEU. Используйте BLEU для быстрой проверки на регресс и COMET – для настоящего контроля качества.
Стадия третья: голос – синтетический диктор или клонированный спикер
Когда перевод помещается, вы превращаете его в звук. Существуют два пути, и выбор несёт и качественный, и юридический вес.
Простой путь – text-to-speech, сокращённо TTS, – программа, которая читает текст вслух обобщённым, но естественным голосом из библиотеки. Это правильно для закадра: диктор документалки, ведущий обучающего курса, начитка новостей. Ничей реальный голос не копируется, поэтому нет вопроса о согласии. Мы сравниваем продакшн-движки TTS – ElevenLabs, Kokoro, Cartesia, OpenAI – в уроке про потоковый TTS.
Более тяжёлый путь – клонирование голоса – захват тембра и ритма исходного спикера из короткого образца, чтобы дубляж звучал как он на новом языке. Это то, что делает полный дубляж родным на слух, и это же превращает вывод в дипфейк реального человека, с обязанностями по согласию и раскрытию, которые из этого следуют. Мы подробно разбираем механику клонирования и инженерию согласия в уроке про клонирование голоса.
Качество голоса измеряют средней экспертной оценкой, сокращённо MOS (mean opinion score), – это средняя оценка, которую слушатели ставят синтетической речи по шкале от одного до пяти; субъективный метод стандартизован в Рекомендации ITU-T P.800. MOS около 4.0 – примерная линия, выше которой большинство слушателей перестаёт замечать синтетичность голоса для начитки; синхронный с губами диалог судят строже, потому что глаз смотрит на рот.
Инструменты, упаковывающие это от и до, в 2026 году теснятся. ElevenLabs Dubbing покрывает 90+ языков и тарифицирует каждый целевой язык отдельно, с Dubbing Studio, где можно править транскрипт, переназначать спикеров и перегенерировать отдельный клип. HeyGen Video Translate охватывает 175+ языков с lip-sync, по фиксированной ставке за минуту на тарифе для авторов. Rask ИИ покрывает 130+ языков и считает поминутно, что дорожает на масштабе. Google Aloud, встроенный в YouTube Studio, дублирует узкий набор языковых пар бесплатно, но без эмоций и без lip-sync. Правильный выбор зависит от покрытия языков, нужен ли lip-sync и как ложится поминутная математика на вашем объёме – та же дисциплина юнит-экономики, что мы применяем в уроке про стоимость.
Авто-субтитры как надо: формат и правила скорости чтения
Субтитры выглядят лёгким режимом, и сделать неправильные действительно легко. Хорошие подчиняются двум наборам правил: формату файла, который понимает плеер, и правилам тайминга, которые человек реально может прочитать.
Выберите правильный формат
Есть четыре формата, которые важны, и они не взаимозаменяемы. Таблица ниже – это решение в одном месте.
| Формат | Что это | Где используется | Стилизация | Статус стандарта |
|---|---|---|---|---|
| SRT (SubRip) | Простой текст: номер, таймкод, строка | Окна загрузки, YouTube, монтажки | Нет | Только де-факто; нет спецификации |
| WebVTT | Веб-наследник SRT, .vtt | Браузеры (HTML <track>), HLS, DASH | Позиционирование, базовый CSS | W3C Candidate Recommendation |
| TTML | XML timed-text, broadcast-авторинг | TV-обмен, мастеринг | Богатая (XML + CSS-like) | W3C Recommendation |
| IMSC1 | Ограниченный профиль TTML для доставки | Broadcast/OTT в fMP4/CMAF | Цвет, позиция, ruby на реплику | W3C Recommendation |
На практике: принимайте SRT на входе, потому что он есть у всех; отдавайте WebVTT для веба и адаптивного стриминга; отдавайте IMSC1 – broadcast-профиль, переносимый внутри фрагментированных сегментов MP4, W3C Recommendation с 2018 года, – когда выпускаете на OTT или телеплатформы. Взаимодействие субтитров и форматов в стриминговом стеке мы разбираем в статье про субтитры и мульти-аудио в разделе Streaming.
Подчинитесь арифметике скорости чтения
Субтитр, технически правильный, но появляющийся на экране слишком кратко, – это провалившийся субтитр. Индустрия кодифицирует это через лимит скорости чтения, измеряемый в символах в секунду (CPS, characters per second), плюс границы на длину строки и длительность. Широко копируемый Netflix Timed Text Style Guide задаёт для большинства языков максимум около 17 CPS для взрослого контента и 13 CPS для детского, не более двух строк на реплику, не более 42 символов в строке, минимум пять шестых секунды и максимум семь секунд.
Превратите лимит скорости чтения в правило, которое управляет нарезкой реплик. Если реплика висит на экране три секунды, а ваш лимит – 17 символов в секунду, максимум текста, который она может держать:
макс. символов = 3.0 с × 17 CPS = 51 символЗначит, переведённая строка в 80 символов не может жить в трёхсекундной реплике: конвейер должен либо разбить её на две реплики, либо держать дольше, а если речь длилась лишь три секунды, разбиение – единственный честный вариант. Это арифметика, которую стадия авто-субтитров прогоняет на каждой реплике: взять слова и их таймкоды из ASR, сгруппировать в реплики и резать дальше, пока каждая не пройдёт проверки по CPS, числу строк, длине строки и длительности. Пропустите её – и получите авто-сабы, которые все видели: стену текста, исчезающую раньше, чем её прочтёшь.
«Частая ошибка: выпускать сырой транскрипт ASR как субтитры. Самый частый сбой локализации – взять транскрипт с таймкодами прямо из речевой модели и сохранить его как SRT. Результат нарушает все правила читаемости разом – реплики слишком длинные, слишком быстрые, разорванные не в том месте и разрезанные посреди фразы. ASR даёт вам слова и времена; он не даёт вам субтитры. Стадия вёрстки, которая превращает одно в другое – навязывая CPS, максимум в две строки, 42 символа на строку и разрывы по границам клауз, – это не опциональная полировка. Это разница между подписью и читаемой подписью, и это ровно та работа, которую пропускают дешёвые функции «авто-субтитров».»
Контроль качества: где каждая стадия тихо проваливается
Каждая стадия этого конвейера может провалиться так, что машине покажется нормально, а человеку – неправильно, поэтому функции локализации нужен автоматический контроль качества с числом на каждой стадии – та же дисциплина «падать закрыто», что мы излагаем в уроке про контроли генеративного видео. Задайте потолок WER на транскрипцию, нижний порог COMET на перевод, проверку скорости чтения на каждую реплику субтитров и проверку MOS или попадания по длительности на сгенерированное аудио. Когда клип не проходит порог, отправляйте его человеку, а не в выпуск – потому что уверенно неправильный дубляж на языке, которого ваша команда не знает, невидим вам и очевиден вашей аудитории. Самая дешёвая страховка – двуязычная человеческая выборочная проверка на части вывода, размером под ваш аппетит к риску, с полным просмотром выборки для всего в регулируемой вертикали вроде телемедицины или e-learning.
Закон: раскрытие для голосов, доступность для субтитров
Этого конвейера касаются два разных свода права, и они тянут в противоположные стороны – один говорит скажи людям, что это синтетика, другой говорит сделай доступным для всех.
Клонированные голоса надо раскрывать
Дубляж, клонирующий голос реального человека, производит синтетическое аудио реального человека – аудио-дипфейк. С 2 августа 2026 года статья 50 EU AI Act выдвигает два требования, которые приземляются сюда. Провайдеры систем, генерирующих синтетическое аудио, должны помечать вывод как искусственно созданный в машиночитаемой форме. Деплойеры, генерирующие дипфейк – контент реального человека, который ложно выглядел бы подлинным, – должны раскрыть зрителям, что он искусственный. Нарушение этих правил прозрачности попадает в тариф штрафов до 15 миллионов евро или 3% мирового годового оборота. Практическая инженерия следует тому же трёхслойному паттерну, что и генеративное видео – машиночитаемая метка, запись и видимая метка, – и начинается до генерации, с согласия: вы захватываете разрешение исходного спикера на клонирование его голоса и храните эту запись, дисциплину мы детализируем в уроке про клонирование голоса и согласие. Обычный TTS-закадр не несёт ничего из этого, потому что не имитируется ни один реальный человек, – ещё одна причина выбирать самый лёгкий рабочий режим.
Субтитры – это обязательство по доступности
Пока закон о раскрытии управляет синтетическими голосами, закон о доступности управляет субтитрами и подписями – и он старше и хорошо применяется. В США FCC задаёт четыре стандарта качества для closed captions на охваченном видео: точность (подписи совпадают со словами и передают тон), синхронность (они совпадают с аудио и остаются читаемыми), полнота (идут от начала до конца) и размещение (не перекрывают лица или экранный текст). 21st Century Communications and Video Accessibility Act, CVAA, расширяет это на онлайн-видео, ранее выходившее в эфире, требуя подписей «как минимум того же качества», что и в эфире. Web Content Accessibility Guidelines, WCAG, трактуют подписи для предзаписанного видео как базовое требование к доступному сайту. Смысл для вашего конвейера: правила скорости чтения и размещения выше – это не просто ремесло, это измеримое ядро юридического стандарта, и функция авто-субтитров, игнорирующая их, может провалить соответствие так же, как и читаемость.
Где здесь Фора Софт
Мы строим видео-продукты, внутри которых живут функции локализации, – видеоконференции, OTT- и Internet-TV-платформы, e-learning-системы и телемедицинские приложения – и встраиваем эти конвейеры в них задолго до того, как появились ИИ-версии. Когда клиент хочет свои e-learning-курсы на восьми языках, или свой OTT-каталог с субтитрами под broadcast-спеку, или конференц-продукт с живыми переведёнными подписями, модель – лёгкая часть; работа – это подгон тайминга, стадия субтитров с правильной скоростью чтения, дубляж с учётом спикеров и слои раскрытия и доступности, которые держат функцию законной в каждом рынке. Мы относимся к выбору между субтитрами, закадром и полным дубляжом как к продуктовому решению, принимаемому по вертикали и по бюджету, а не как к умолчанию, – потому что в регулируемых вертикалях самый лёгкий совместимый режим обычно и есть правильный.
Ключевые выводы
- Локализация – это три продукта (субтитры, закадр, дубляж) на одном общем конвейере.
- Общая передняя половина – транскрипция плюс перевод; различается только ветка доставки.
- Сложность не в переводе, а в тайминге: целевой текст расширяется, и его надо вместить.
- Изохрония через перевод с контролем длины плюс растяжение в пределах ±10–15% чинит это.
- Авто-субтитры подчиняются арифметике скорости чтения: 3 с × 17 CPS = максимум 51 символ.
- Клонированные голоса запускают раскрытие по ст. 50 EU AI Act; субтитры – закон FCC/CVAA.