Многоязычный перевод речи в реальном времени в звонках

Автор: Николай СапуновОбновлено: август 202629 мин чтения
Содержание статьи +

Коротко

Перевод речи в реальном времени позволяет двум людям на звонке, говорящим на разных языках, понимать друг друга прямо в разговоре – с задержкой, достаточно короткой, чтобы беседа всё ещё текла. Строят его одним из двух способов: старый связывает три модели (услышать, перевести, сказать), а новый использует одну модель, которая слушает на одном языке и говорит на другом. Главный компромисс – не «что лучше», а сколько система ждёт, прежде чем зафиксировать перевод: ждать дольше – это точнее, но дороже по плавности. В статье разберём этот компромисс «задержка против точности» простыми словами, а затем расставим системы, задающие 2026 год: встроенный перевод в Google Meet, OpenAI gpt-realtime-translate, открытая Meta SeamlessStreaming и корпоративные платформы синхронного перевода (KUDO, Interprefy, Wordly). К концу вы поймёте, почему «две-три секунды» – это число, на котором остановилась сама команда Google, как фича едет внутри видеозвонка и какие две ошибки – дословный перевод и забытое согласие на клонированный голос – превращают демо в проблему.

Зачем это нужно

Если ваш продукт сводит на одном звонке людей из разных стран – продажи, телемедицинский приём, вебинар, занятие, линия поддержки – язык становится стеной, а перевод в реальном времени – единственное, что её убирает, не нанимая живого синхрониста на каждый разговор. Статья – для продакт-менеджера, основателя или техлида, который решает: строить эту фичу, покупать или подождать. К концу вы поймёте главный компромисс любой системы перевода в реальном времени – скорость против точности – достаточно, чтобы оценивать демо вендора; четыре типа систем, борющихся за эту задачу в 2026-м, и в чём каждая реально сильна; а также юридические и качественные ловушки, незаметные в постановочном демо и всплывающие в ту же секунду, когда подключаются настоящие люди с настоящим акцентом. Цель – чтобы вы пришли на разговор «строить или покупать» и задавали правильные вопросы, а не покупались на один эффектный ролик.

Что значит «перевод в звонке в реальном времени»

Начнём с самого простого. Вы на видеозвонке. Вы говорите по-английски; собеседник – по-испански. Фича перевода в реальном времени слушает вас, понимает, что вы сказали, и доносит это до собеседника по-испански – пока вы ещё в разговоре, а не после встречи. Потом то же в обратную сторону. Цель схватывает фраза машинная интерпретация: софт делает вживую то, что живой синхронист делает в кабине на заседании ООН.

Полезно разделить две формы, которые это может принимать, потому что продукты их путают, а покупателям путать не стоит. Первая – устный перевод, когда собеседник слышит голос, произносящий ваши слова на его языке; это ближе всего к живому синхронисту. Вторая – перевод субтитрами, когда собеседник читает ваши слова переведёнными подписями на экране. Обе – «перевод в реальном времени»; в использовании они ощущаются совершенно по-разному и стоят разного в инженерии. Устный перевод сложнее, потому что должен ещё и произвести естественный голос достаточно быстро, чтобы не отставать. Мы будем отмечать, кто что делает.

Представьте устный перевод как звонок через синхрониста, который нашёптывает вам на ухо, а перевод субтитрами – как просмотр иностранного фильма с живыми субтитрами. Синхронист человечнее, но может говорить поверх других; субтитры никогда не перебивают, но заставляют читать вместо того, чтобы слушать. Большинство продуктов 2026 года дают и то и другое и оставляют выбор пользователю.

Два способа построить: связать три модели или взять одну

Любая фича перевода в реальном времени строится одним из двух способов, и выбор задаёт её скорость, цену и естественность. Разложим работу на три шага. Сначала услышать: превратить входящий звук в слова. Затем перевести: превратить эти слова на другой язык. Наконец сказать: превратить переведённые слова обратно в звук.

Старый, более распространённый способ даёт каждому шагу свою специализированную модель. Модель распознавания речи – софт, который превращает звучащую речь в письменные слова, сокращённо ASR (automatic speech recognition), – отвечает за «услышать». Модель машинного перевода – та, что стоит за переводчиком, – отвечает за «перевести»: читает слова на одном языке и пишет на другом. Модель синтеза речи, сокращённо TTS (text-to-speech), отвечает за «сказать». Инженеры называют это каскадом или пайплайном, потому что выход одной модели втекает в следующую, как вода по ступеням.

Новый способ сворачивает задачу в одну модель, которая принимает звук на одном языке и выдаёт звук или текст на другом, без отдельных передач между шагами. Исследователи называют это end-to-end речевым переводом – «от края до края», сокращённо S2ST (speech-to-speech translation). Команда Meta описывает свою потоковую версию как модель, которая генерирует «переводы с низкой задержкой, не дожидаясь полных исходных высказываний» – простыми словами, она начинает переводить раньше, чем вы закончили фразу (Seamless Communication, 2023).

Вот аналогия, от которой компромисс становится понятным. Каскад – это эстафета: три бегуна, каждый отлично проходит свой этап, но каждая передача палочки стоит времени, а палочку можно уронить. End-to-end-модель – один бегун, проходящий весь круг: меньше передач, быстрее, и он доносит до финиша вашу интонацию и эмоцию, которые передача палочки потеряла бы. Цена – нельзя заменить одного слабого бегуна: вы берёте либо всего бегуна, либо никого.

Рис. 1. Каскад связывает три специализированные модели с читаемым текстом между этапами; end-to-end-модель делает весь перевод за один проход, меняя проверяемость на скорость и более естественный голос.

Почему каскад всё ещё выигрывает у многих команд

Заманчиво решить, что новая end-to-end-модель просто лучше. В 2026-м это не консенсус, особенно в бизнесе. Каскад остаётся корпоративным дефолтом, потому что он прозрачен и его можно отлаживать: если перевод неверен, можно прочитать расшифровку на каждом этапе и увидеть, где именно сломалось – на слухе, переводе или речи (Coval, 2026). Для аудиторского следа или регулируемой отрасли читаемая середина – не приятный бонус, а требование.

Каскад также позволяет выбрать лучшую модель для каждого этапа – самое точное распознавание, самый сильный движок перевода, самый естественный голос – каждую от своего вендора, и заменить любую, не трогая остальные. С современными потоковыми компонентами хорошо настроенный каскад достигает примерно одной-двух секунд от края до края, и этого хватает для многих встреч (отраслевые бенчмарки, 2026).

Почему end-to-end выигрывает, когда важно ощущение

End-to-end-модель зарабатывает место по двум осям, где каскаду тяжело: скорость и человечность. Поскольку передач меньше, задержка ниже – современные end-to-end speech-to-speech-системы работают примерно за 400–700 миллисекунд, где миллисекунда – это одна тысячная секунды, против одной-двух секунд у каскада (отраслевые бенчмарки, 2026). А поскольку модель никогда не уплощает ваш голос в текст и обратно, она может сохранить то, что текст выбрасывает. Выразительная версия Meta специально сохраняет «вокальный стиль и просодию» – ритм, паузы, темп речи, которые делают голос вашим, а не роботизированным (Seamless Communication, 2023). Для приложения-компаньона, премиальной линии поддержки или везде, где эмоциональная фактура голоса – часть продукта, это стоит потери читаемой середины.

Компромисс, который управляет всем: скорость против точности

Вот единственная идея, которая, стоит её усвоить, делает любое решение о переводе в реальном времени понятным. Переводчик – человек или машина – в каждый момент сталкивается с дилеммой: переводить сейчас по тому, что уже услышал, или ждать новых слов, чтобы быть уверенным. Перевести рано – беседа течёт, но риск ошибиться, потому что смысл фразы часто проясняется только в конце. Подождать – точнее, но дольше. Нет настройки, выигрывающей оба разом; вы всегда меняете одно на другое.

Это не причуда софта – ту же дилемму живой синхронист решает в реальном времени, и языки делают её сложнее или легче. Возьмём немецкий, где глагол часто стоит в самом конце предложения. Синхронист, переводящий с немецкого на английский, буквально не может закончить английскую фразу, пока не придёт немецкий глагол, потому что английскому глагол нужен рано. Поэтому синхронист либо ждёт (больше задержки), либо угадывает (больше риска). Команда Google столкнулась ровно с этим: близкие по структуре языки – испанский, итальянский, португальский, французский – переводить вживую легче, тогда как «структурно отличные языки, такие как немецкий, давали больше трудностей» (Google, 2025).

У правила, решающего, когда фиксировать, есть имя. Простейшее – политика wait-k: система читает фиксированное число слов – назовём его k – прежде чем начать переводить, а затем держит постоянную дистанцию за говорящим (Ma et al., 2019). Малое k – низкая задержка и больше ошибок; большое k – больше задержки и меньше ошибок. Более продвинутые системы используют адаптивную политику, которая решает от момента к моменту, услышала ли она достаточно, чтобы безопасно перевести – SeamlessStreaming от Meta использует механизм Efficient Monotonic Multihead Attention (EMMA) именно для этого, переводя «не дожидаясь полных исходных высказываний», но всё же выжидая, когда фраза этого требует (Seamless Communication, 2023).

Рис. 2. Точность растёт по мере того, как система ждёт новых слов, затем выходит на плато. Рабочее окно для живого разговора – около двух-трёх секунд: достаточно быстро, чтобы ощущаться вживую, достаточно медленно, чтобы быть понятым.

Где же рабочее окно? Команда Google Meet после двух лет работы с DeepMind дала точный ответ: «Мы обнаружили, что две-три секунды – это что-то вроде оптимума. Быстрее – трудно понять, медленнее – не получается естественного разговора» (Google, 2025). Это число стоит запомнить, потому что оно задаёт ожидания. Для сравнения: старые цепочки «расшифровать-перевести-озвучить» несколько лет назад работали по десять-двадцать секунд – так долго, что естественный разговор был невозможен (Google, 2025). И есть жёсткий потолок с другой стороны: как только задержка в диалоге переваливает за две секунды, участники начинают говорить поверх друг друга, потому что ритм человеческой смены реплик ломается (отраслевые бенчмарки, 2026).

«Частая ошибка. Самая частая ошибка первой сборки – дословный перевод. Команда Google отметила, что их ранняя модель «переводит большинство выражений буквально, что приводит к забавным недоразумениям» (Google, 2025) – идиома вроде «break a leg» («ни пуха ни пера») выходит как указание сломать себе ногу. Дословный переводчик выглядит нормально в демо с простыми фразами и проваливается, как только настоящие люди используют идиомы, сарказм или отраслевой жаргон. Лекарство – модель перевода с достаточным пониманием языка, чтобы переводить смысл, а не слова; именно поэтому поле движется к более крупным моделям, схватывающим контекст, тон и даже иронию.»

Четыре типа систем, задающих 2026 год

С архитектурой и компромиссом «скорость–точность» в руках ландшафт 2026 года раскладывается на четыре типа систем. Две – фичи, встроенные в платформу, которой вы уже пользуетесь; одна – открытая модель, которую вы хостите сами; одна – категория корпоративных сервисов синхронного перевода.

Встроено в платформу – Google Meet

Google Meet выпустил устный перевод в реальном времени для обычных пользователей – первым из крупных конференц-платформ сделал это в масштабе. Он использует модель на базе Gemini, которая, по описанию Google, слушает говорящего и доносит перевод «голосом, похожим на ваш», работая в окне две-три секунды, найденном командой (Google, 2025). К началу 2026-го фича достигла общей доступности, сосредоточившись на двунаправленном переводе между английским и горсткой основных языков – испанским, французским, немецким, португальским и итальянским – с другими в разработке (Google Workspace, 2026). Что заметить: это управляемая фича, а не то, что вы строите, и она оставляет слабое эхо оригинального голоса под переводом, чтобы разговор всё ещё ощущался человеческим.

Модель в аренду – OpenAI gpt-realtime-translate

В мае 2026-го OpenAI выпустила модель, сделанную специально под эту задачу: gpt-realtime-translate – потоковую модель речевого перевода, доступную через отдельный эндпоинт перевода (OpenAI, 2026). Три детали делают её заметной для тех, кто строит продукт. Первая – охват: она принимает более 70 входных языков и выдаёт переведённое аудио на 13 (OpenAI, 2026). Вторая – её обучили на тысячах часов записей профессиональных синхронистов, что учит её оставаться только переводчиком – интерпретировать, а не отвечать – и выжидать достаточно контекста, прежде чем заговорить (OpenAI, 2026). Третья – она использует динамическую адаптацию голоса: вместо фиксированного выходного голоса переведённая речь следует тону, высоте и стилю исходного говорящего, а в сессии с несколькими спикерами голос меняется по мере появления каждого нового (OpenAI, 2026). Цена – около $0,034 за минуту перевода, и стандартный паттерн – одна сессия перевода на один выходной язык, так что встреча, переводимая на три языка, идёт тремя сессиями (OpenAI, 2026).

Открытая модель в хостинг – Meta SeamlessStreaming

Семейство Seamless от Meta – вариант с открытыми весами: обученные файлы модели опубликованы, чтобы вы скачали их и запустили на своём железе. SeamlessStreaming – потоковый член семейства под живое использование; это, по словам Meta, «первая в своём роде» система, обеспечивающая одновременный речевой и текстовый перевод на многих языках сразу, используя описанный выше адаптивный механизм внимания, чтобы переводить до завершения фразы (Seamless Communication, 2023). Она стоит на фундаментальной модели SeamlessM4T v2, которая понимает около 100 языков как звуковой вход (Hugging Face, 2026). Важны две оговорки. Её потоковая задержка сопоставима с живыми синхронистами – около двух секунд – но фундаментальная модель идёт под некоммерческой лицензией (CC-BY-NC), так что отгрузка её внутри продукта, который вы продаёте, требует отдельного соглашения с Meta (Hugging Face, 2026). Относитесь к Seamless как к открытому эталонному дизайну и проверьте лицензию, прежде чем строить на ней бизнес.

Сервис по контракту – корпоративные платформы синхрона

Для ответственных событий – заседаний правления, многоязычных конференций, звонков для инвесторов – есть категория платформ между чистым ИИ и живыми синхронистами. KUDO, Interprefy и Wordly предлагают перевод в реальном времени и живые субтитры с возможностью ввести живого синхрониста в контур ради точности, которую один ИИ пока не гарантирует. Interprefy, пионер удалённого синхронного перевода, интегрируется с более чем 80 конференц-платформами и заявляет тысячи языковых комбинаций (Interprefy, 2026). KUDO сообщил, что число встреч с его ИИ-переводом и субтитрами резко выросло год к году (KUDO, 2026). Паттерн: когда ошибка перевода имеет реальные последствия, покупатели платят за платформу, способную откатиться к человеку, а не доверяют одной модели.

Рис. 3. Четыре типа систем, выстроенные по тому, что это, как вы это получаете, как обрабатывается голос, охвату языков и тому, где каждая лучше подходит.

Как это едет внутри видеозвонка

Знать, какую модель брать, – половина дела; вторая – доставить звук к ней и обратно, не сломав задержку самого звонка. У видеозвонка уже есть система доставки, и перевод должен ехать поверх неё.

Большинство современных видеозвонков гонят аудио и видео через selective forwarding unit, сокращённо SFU – сервер, который принимает поток каждого участника и пересылает остальным, не микшируя и не перекодируя, что держит задержку самого звонка низкой (Фора Софт, 2026). Фича перевода подключается к этому серверу как то, что инженеры в 2026-м называют sidecar: отдельный компонент, который снимает аудиопоток, отправляет его в модель перевода и впрыскивает переведённое аудио или субтитры обратно как новую дорожку (отраслевые тренды, 2026). Аудио исходного говорящего течёт нетронутым; перевод приходит как дополнительный канал, который слушатель может выбрать.

Вот почему этот дизайн важен для бюджета и сборки. Поскольку перевод – отдельная дорожка, каждый слушатель выбирает свой язык, и вы платите за одну сессию перевода на язык, а не на участника. Вебинар на 50 человек, переводимый на испанский, французский и немецкий, – это три сессии перевода, питающие три аудиодорожки, а не 50; SFU разводит каждую переведённую дорожку всем, кто её хочет. Это та же логика веера, что делает эффективными живые субтитры на стороне SFU, а более широкий выбор транспорта за ней разобран в уроке про speech-to-speech.

Рис. 4. Sidecar перевода снимает аудио с сервера звонка, прогоняет его через модель перевода и подаёт переведённые дорожки обратно. Слушатели выбирают язык; вы платите за язык, а не за человека.

Форм-фактор наушников – перевод вне экрана

Не каждый переводимый разговор происходит в конференц-приложении. Самая быстрорастущая потребительская версия этой технологии живёт в наушниках, и её стоит понимать, потому что покупатели всё чаще ждут той же магии на звонке. К 2026-му живой перевод работает на флагманских наушниках по всему рынку – Google Pixel Buds, Samsung Galaxy Buds и Apple AirPods предлагают ту или иную его форму (SoundGuys, 2026).

Заметный сдвиг 2026-го – Google отвязал фичу от конкретного железа: живой звуковой перевод теперь работает через любые Bluetooth- или проводные наушники на Android, на модели Gemini с нативным аудио и, по описанию Google, улучшенным пониманием тона и темпа на более чем 70 языках (TechRadar, 2026). Урок для вашего продукта не в том, что надо строить наушники, – а в том, что ваши пользователи уже пережили почти мгновенный перевод прямо в ушах, и неуклюжий десятисекундный перевод внутри вашего приложения будет ощущаться сломанным на их фоне. Планка сдвинулась.

Слой безопасности, который никто не показывает в демо

Переводчик реального времени, говорящий голосом пользователя, технически – система клонирования голоса, работающая вживую, и это рождает две реальные обязанности, которых в демо никогда не видно.

Первая – согласие на клонированный голос. Когда система воспроизводит вокальный стиль говорящего на другом языке, она синтезирует его голос, и применяются те же правила согласия, что и для любого клонирования голоса. Юридические и инженерные детали – включая рамку согласия NO FAKES Act – разобраны в уроке про ElevenLabs и клонирование голоса; короткая версия – у вас должно быть ясное основание клонировать голос участника, и «он подключился к звонку» не является им автоматически.

Вторая – происхождение, доказательство того, что фрагмент звука сгенерирован машиной. Meta встроила это в Seamless с самого начала через «неслышимый локализованный механизм водяных знаков, призванный смягчить влияние дипфейков», вместе с детекцией токсичности, ловящей добавление моделью оскорбительного содержания, которого не было в оригинале (Seamless Communication, 2023). Для фичи перевода эта проверка токсичности не абстрактна: модель, которая переводит нейтральную фразу в оскорбление, создаёт реальный инцидент, и детекция добавленной токсичности на выходе – настоящая мера защиты, а не бумажка.

Сколько на самом деле стоит минута перевода

Цена – это место, где выбор архитектуры встречается с бюджетом, поэтому стоит один раз посчитать вслух. Возьмём OpenAI gpt-realtime-translate по примерно $0,034 за минуту перевода и правило: одна сессия на выходной язык (OpenAI, 2026). Теперь оценим часовой вебинар, переводимый на три языка:

одна сессия на язык              = 3 сессии (испанский, французский, немецкий)
минут на сессию                  = 60 минут
цена за минуту                   = $0,034
   ────────────────────────────────────────────────
   3 × 60 × $0,034               = $6,12 за час

Шесть долларов двенадцать центов, чтобы сделать часовой вебинар понятным на трёх дополнительных языках. Поставьте это против альтернативы – живой синхронист обычно берёт за полдня по ставке на порядки выше и нужен по одному на языковую пару – и причина распространения ИИ-перевода становится очевидной. Честная оговорка: человек всё ещё выигрывает в точности на ответственном контенте, поэтому корпоративные платформы держат человека в контуре. Дисциплина – моделировать свой объём и свои требования к точности так же, как разбирает более широкий урок про модель стоимости ИИ в видеопродуктах. Одностраничная памятка ниже упаковывает это решение, чтобы его можно было прогнать на встрече.

Где здесь Фора Софт

Перевод в реальном времени – не отдельная фича, а паттерн, всплывающий в разных продуктах, которые мы строим. В видеоконференциях это живой синхронист между участниками, которые не делят язык, поданный либо устной дорожкой, либо переведёнными субтитрами. В телемедицине это даёт врачу и пациенту консультироваться через языковой барьер, где ошибка перевода имеет реальный клинический вес и важен человеческий откат. В онлайн-образовании это открывает курс, записанный на одном языке, ученикам по всему миру. В прямом эфире и OTT это становится живым дубляжом события по мере его хода. Инженерное суждение в каждом случае – то же, что задаёт эта статья: каскад или end-to-end, сколько ждать перед фиксацией перевода, какой из четырёх типов систем подходит и как звук едет по звонку – и это суждение, сделанное рано, отделяет фичу, которая действительно соединяет людей, от той, что выдаёт забавную бессмыслицу, как только приходит настоящий акцент.

Ключевые выводы

  • Перевод в реальном времени бывает устным (голос) или субтитрами; устный сложнее и человечнее.
  • Каскад связывает модели «услышать-перевести-сказать»; одна end-to-end-модель быстрее и хранит голос.
  • Главный компромисс – скорость против точности: ждать дольше точнее, но дороже по плавности.
  • Рабочее окно – две-три секунды; за двумя секундами участники говорят поверх друг друга.
  • Четыре варианта 2026-го: Google Meet (встроено), OpenAI (аренда), Seamless (хостинг), корпоративный синхрон (контракт).
  • Дословный перевод и клонирование голоса без согласия – ловушки, топящие демо.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.