Содержание статьи +
- Коротко
- Зачем это нужно
- Что такое «speech-to-speech» на самом деле
- Два способа построить: связать три модели или взять одну
- Число, которое решает, живой ли разговор
- Три способа подключиться: браузер, сервер или телефон
- Самое трудное, что не показывают в демо: знать, когда говорить
- Три системы, задающие 2026 год
- Как три системы соотносятся
- Сколько на самом деле стоит минута разговора
- Где здесь Фора Софт
- Ключевые выводы
- Что почитать дальше
Коротко
Speech-to-speech – это система, которая слышит произнесённую речь и отвечает голосом, причём читаемый текст в середине ей не нужен; это самое близкое к настоящему разговору, что умеет софт. Построить её можно двумя способами: старый связывает три отдельные модели (услышать, подумать, сказать), а новый использует одну модель, которая делает всё сразу – она быстрее и сохраняет «человечность» голоса, но её труднее проверять и чинить. В статье разберём обе архитектуры, а затем три системы, которые задают ландшафт 2026 года: OpenAI Realtime API (одна speech-to-speech-модель, доступная через WebRTC, WebSocket или телефонную сеть), Google Gemini Live (модель с нативным аудио, цена за минуту которой заметно ниже, чем у OpenAI) и Meta SeamlessM4T (открытая модель для речевого перевода примерно на 100 языков). К концу вы поймёте, какая архитектура подходит вашему продукту, сколько на самом деле стоит минута разговора и какие две ошибки – измерение не той задержки и забытая обработка перебиваний – топят большинство первых сборок.
Зачем это нужно
Если ваш продукт будет вести голосовой разговор – ассистент на созвоне, который отвечает вслух, приёмная линия в телемедицине, голосовой агент поддержки, синхронный переводчик внутри видеозвонка или языковой репетитор, – вы рано столкнётесь с одним решением, которое задаёт и задержку, и счёт, и то, насколько систему можно будет потом отлаживать. Это решение: брать одну speech-to-speech-модель или самому связывать модель распознавания речи, языковую модель и модель синтеза речи. Статья – для продакт-менеджера, основателя или техлида, который делает этот выбор. К концу вы поймёте, почему «меньше 800 миллисекунд от голоса до голоса» – это число, решающее, живой получится разговор или нет, чем три ведущие системы 2026 года различаются по скорости, цене и открытости и какие инженерные ловушки выглядят нормально в демо, но ломаются в проде. Цель – чтобы вы пришли на разговор «строить или покупать» и задавали правильные вопросы, а не покупались на один красивый заголовок.
Что такое «speech-to-speech» на самом деле
Начнём с простейшего определения. Система speech-to-speech, сокращённо S2S, принимает на вход звук речи и отдаёт на выходе звук речи. Вы говорите – она говорит. За этой общей формой скрываются две разные задачи, и их стоит сразу разделить, потому что вся статья к этому различию возвращается.
Первая задача – разговор: вы задаёте вопрос по-английски, и система отвечает по-английски, как голосовой ассистент. Вторая задача – перевод: вы говорите по-английски, а система произносит тот же смысл по-испански, как синхронный переводчик. Обе принимают голос и отдают голос, поэтому обе – «speech-to-speech», но устройство и лидеры рынка разные. OpenAI Realtime API и Google Gemini Live сделаны прежде всего под разговор; Meta SeamlessM4T – под перевод. Мы будем отмечать, что есть что.
Представьте разговор как звонок умному коллеге, а перевод – как звонок через синхрониста. В обоих случаях вы не видите текста на экране: смысл в том, что звук входит и звук выходит. Существует ли текст внутри системы и может ли его кто-то прочитать – это ровно тот архитектурный вопрос, к которому мы переходим.
Два способа построить: связать три модели или взять одну
Любой speech-to-speech-продукт строится одним из двух способов, и выбор красит всё остальное. Разложим работу на три шага. Сначала услышать: превратить входящий звук в нечто, о чём машина может рассуждать. Затем подумать: решить, что сказать. Наконец сказать: превратить решение обратно в звук.
Старый, более распространённый способ даёт каждому шагу свою специализированную модель. Модель распознавания речи – софт, который превращает звучащую речь в письменные слова, сокращённо ASR (automatic speech recognition), – отвечает за «услышать». Языковая модель – та, что стоит за чат-ботом, – отвечает за «подумать»: читает текст и пишет ответ текстом. Модель синтеза речи, сокращённо TTS (text-to-speech), отвечает за «сказать»: превращает этот ответ обратно в звук. Инженеры называют это каскадом или пайплайном, потому что выход одной модели втекает в следующую, как вода по ступеням.
Новый способ сворачивает все три шага в одну модель, которая принимает звук и сразу выдаёт звук, без читаемого текста в середине. OpenAI называет результат «speech-to-speech-моделью» и отмечает: в отличие от традиционных пайплайнов, что связывают распознавание и синтез речи, она «обрабатывает и генерирует аудио напрямую через одну модель и один API», что «снижает задержку, сохраняет нюансы речи и даёт более естественные, выразительные ответы» (OpenAI, 2025). Исследователи называют это моделью end-to-end – «от края до края», потому что одна модель покрывает всю задачу целиком.
Вот аналогия, от которой компромисс становится понятным. Каскад – это эстафета: три бегуна, каждый отлично проходит свой этап, но каждая передача палочки стоит времени, а палочку можно уронить. End-to-end-модель – один бегун, проходящий весь круг: меньше передач, быстрее, и он доносит интонацию и эмоцию до финиша, которые передача палочки потеряла бы. Цена – нельзя заменить одного слабого бегуна: вы получаете либо всего бегуна, либо никого.
Почему каскад до сих пор выигрывает у многих команд
Легко решить, что новая end-to-end-модель просто лучше. В 2026 году это не так. Для большинства продакшен-внедрений каскадный пайплайн остаётся выбором по умолчанию, потому что даёт прозрачность, отлаживаемость и свободу заменить любой компонент, не трогая остальные (Coval, 2026). Если система сказала не то, можно прочитать текст на каждом этапе и увидеть, где именно сломалось – на «услышать», «подумать» или «сказать». У end-to-end-модели читаемого текста в середине нет, поэтому ошибку отследить труднее.
Каскад ещё и позволяет выбрать лучшую модель для каждого этапа: самое точное распознавание, самую умную языковую модель, самый естественный голос – каждый от своего поставщика. End-to-end-модель – это взгляд одного вендора на все три задачи сразу, а значит, вы живёте с её слабейшим этапом и принимаете то, что инженеры называют vendor lock-in – цену невозможности легко уйти от одного поставщика.
Почему end-to-end выигрывает, когда важно ощущение
End-to-end-модель берёт своё по двум осям, на которых каскад буксует: скорость и человечность. Передач нет – задержка ниже. И модель ни разу не уплощает ваш голос в простой текст и обратно, поэтому сохраняет то, что текст выбрасывает: смешок, заминку, восходящую вопросительную интонацию, акцент. End-to-end speech-to-speech-модели отвечают мгновенно и естественно справляются со сменой реплик, поддакиванием и перебиваниями, тогда как каскадные пайплайны дают более сильные ответы ценой задержки, растущей с размером модели (Coval, 2026). Для премиальной линии поддержки, приложения-компаньона или всюду, где эмоциональная фактура голоса и есть продукт, эта естественность стоит потери прозрачности.
Число, которое решает, живой ли разговор
Есть одно число, отделяющее разговор, который ощущается настоящим, от разговора, похожего на голосовое меню, и легко измерить не то. Правильная метрика – задержка от голоса до голоса (voice-to-voice): промежуток между моментом, когда вы перестали говорить, и моментом, когда вы услышали первый звук ответа. Это та тишина, которую собеседник реально переживает.
Почему именно это число так важно? Потому что у человеческого разговора есть встроенный ритм. Когда один замолкает, другой обычно начинает примерно через две десятых секунды – около 200 миллисекунд, где миллисекунда – одна тысячная секунды. Этот промежуток настолько устойчив между языками и культурами, что наши уши воспринимают всё заметно большее как заминку или оборвавшуюся связь. Растяните паузу до ответа дольше секунды – и разговор перестаёт ощущаться разговором.
Что достижимо сегодня? OpenAI сообщает, что с Realtime API достижимо около 800 миллисекунд от голоса до голоса, при этом время до первого байта от модели – около 500 миллисекунд в регионах США, что оставляет примерно 300 миллисекунд на захват микрофона, определение, что вы закончили, передачу аудио по сети и воспроизведение ответа (OpenAI, 2026). Обратите внимание на форму этого бюджета. Модель – лишь половина. Вторая половина – всё, что вокруг модели, и именно её команды забывают.
Пройдём бюджет вслух – арифметика делает мысль наглядной. Возьмём достижимую сумму и вычтем долю модели:
общий бюджет от голоса до голоса = 800 мс (цель «ощущается живым»)
время до первого байта модели − 500 мс (задержка API, регион США)
───────────────────────────────────────────
всё остальное = 300 мс (захват + определение конца реплики
+ сетевые задержки + воспроизведение)Эти 300 миллисекунд остатка должны покрыть буфер микрофона, момент решения, что вы договорили, путь до дата-центра и обратно и старт воспроизведения в ухе слушателя. Если ваши пользователи далеко от региона модели, одна только сеть может съесть почти всё. Поэтому «модель быстрая» – никогда не весь ответ, и поэтому выбор соединения, о котором ниже, двигает стрелку не меньше самой модели.
Три способа подключиться: браузер, сервер или телефон
Speech-to-speech-модель живёт в дата-центре; голос пользователя начинается у микрофона где-то ещё. Путь между ними – транспорт – это реальный инженерный выбор с реальными последствиями для задержки, и ведущие API дают три варианта. OpenAI Realtime API поддерживает все три: WebRTC, WebSocket и SIP (OpenAI, 2025).
Первый – WebRTC, браузерная технология, созданная именно под живое аудио и видео между двумя точками и спроектированная с нуля так, чтобы держать задержку низкой. Используйте её, когда аудио захватывается или воспроизводится в браузере или мобильном приложении – то есть когда устройство пользователя и есть один конец звонка. Рекомендация OpenAI прямая: для браузерных и мобильных клиентов, которые сами захватывают или воспроизводят аудио, используйте WebRTC (OpenAI, 2026).
Второй – WebSocket, более простое постоянно открытое соединение между двумя серверами. Используйте его, когда аудио уже у вашего собственного сервера – например, телефонная система или вещательный поток, втекающий в ваш бэкенд, – и вы хотите переслать его модели. Правило OpenAI: для серверных медиапайплайнов вроде телефонных звонков или вещательного ингеста используйте WebSocket (OpenAI, 2026).
Третий – SIP, протокол публичной телефонной сети, та самая «сантехника» за каждым офисным телефоном. OpenAI добавила прямую поддержку SIP, чтобы голосовой агент мог отвечать на настоящий телефонный звонок, подключаться к офисным АТС и дозваниваться до других телефонных конечных точек без того, чтобы вы сами строили мост (OpenAI, 2025). Если ваш продукт – это телефонная линия, вот ваша дверь.
Самое трудное, что не показывают в демо: знать, когда говорить
Демо, записанное одним вежливым человеком, аккуратно соблюдающим очередь реплик, прячет единственную самую трудную проблему голосовых агентов: понять, когда человек закончил, и что делать, когда человек вклинивается. Ошибётесь – и агент либо говорит поверх людей, либо сидит в неловкой тишине. С этим справляются два механизма.
Первый – определение голосовой активности (voice activity detection, сокращённо VAD): маленький быстрый компонент, единственная задача которого – отличать речь от тишины и фонового шума. Именно он замечает, что вы начали говорить, и, что важнее, замечает, что вы перестали. Определение остановки называют end-of-turn detection (определением конца реплики), и это триггер, который говорит агенту «твой ход». Слишком короткий порог тишины – агент перебивает вас на полумысли; слишком длинный – каждый ответ ощущается вялым. Сочетание VAD с уверенностью модели распознавания повышает точность этого решения (Coval, 2026). Фоновый шум усложняет задачу – поэтому к speech-to-speech-фиче часто добавляют подавление шума в реальном времени, о котором есть отдельный урок: чистый звук даёт VAD более ясный сигнал.
Второй – обработка перебиваний, часто называемая barge-in: что происходит, когда пользователь начинает говорить, пока агент ещё говорит. Люди перебивают постоянно, и система, которая это игнорирует, ощущается сломанной. В каскадном пайплайне обработка – это явная работа: когда VAD ловит речь пользователя посреди фразы агента, он запускает событие перебивания, которое немедленно останавливает аудио агента, выбрасывает уже поставленный в очередь на воспроизведение звук и перезапускает проход слушания (Coval, 2026). End-to-end-модели обычно справляются со сменой реплик, поддакиванием и перебиваниями естественнее, потому что одна модель училась на ритме настоящего диалога, а не получила обработку перебиваний прикрученной задним числом (Coval, 2026). Эта врождённая беглость – один из сильнейших доводов взять end-to-end-модель, когда разговор должен ощущаться человеческим.
«Частая ошибка. Самая частая причина, по которой голосовой агент, «работавший в демо», падает в проде, – не модель, а определение конца реплики и barge-in. Команды настраивают порог тишины на своей чистой речи в тихой комнате, потом выкатывают пользователям с акцентами, фоновым шумом и человеческой привычкой делать паузу посреди фразы, чтобы подумать. Агент начинает обрывать людей. Всегда тестируйте определение конца реплики на реальном, «грязном» аудио ваших настоящих пользователей, прежде чем доверять порогу, и закладывайте инженерное время на обработку перебиваний как на полноценную фичу, а не финальную полировку.»
Три системы, задающие 2026 год
Когда архитектура, бюджет задержки, транспорты и проблема смены реплик в руках, три названные системы легко расставить по местам. Две – это движки разговора, которые вы арендуете; одна – модель перевода, которую можно держать у себя.
OpenAI Realtime API – продакшен-движок разговора
OpenAI Realtime API – самая массово развёрнутая speech-to-speech-система разговора в 2026 году. Она стала общедоступной (generally available – стабильной и поддерживаемой для прода, а не экспериментом) вместе с моделью gpt-realtime, первой общедоступной speech-to-speech-моделью OpenAI, отвечающей на аудио и текст через WebRTC, WebSocket или SIP (OpenAI, 2025). В течение 2026 года семейство расширилось: текущая документация перечисляет gpt-realtime-2 для голосовых агентов, отдельный gpt-realtime-translate для живого перевода и gpt-realtime-whisper для потоковой транскрипции, а новейшие голосовые модели умеют рассуждать, переводить и транскрибировать прямо по ходу прослушивания (OpenAI, 2026; 9to5Mac, 2026).
Модель измеримо сильнее версии декабря 2024 года, которую заменила. На оценке Big Bench Audio, измеряющей рассуждение по звучащему вводу, gpt-realtime набирает 82,8% против 65,6% у старой модели; на бенчмарке следования инструкциям – 30,5% против 20,6%; на бенчмарке вызова функций – способности модели запускать инструменты вашего приложения в нужный момент – 66,5% против 49,7% (OpenAI, 2025). Последние два числа важны для реальных продуктов: агенту поддержки нужно дословно зачитать дисклеймер и в нужный момент посмотреть заказ, и обе способности резко выросли.
API также доступен через Microsoft Azure как «GPT Realtime API», поэтому команды на Azure могут внедрить его, не покидая своё облако (Microsoft, 2026).
Gemini Live – нативное аудио по цене, рассчитанной на масштаб
Ответ Google – Gemini Live, режим живого разговора моделей Gemini. Его ключевая техническая идея – нативное аудио: одна модель обрабатывает сырой звук напрямую, а не превращает его сначала в текст, и именно это срезает задержку (Google Cloud, 2026). В API живые модели принимают текст, изображения, аудио и видео и созданы под низкозадержный диалог туда-обратно, который ведётся по WebSocket-соединению (Google, 2026).
Причина, по которой Gemini Live появляется в каждом сравнении «строить или покупать» 2026 года, – цена. Аудио тарифицируется по токенам звука: входное аудио считается по 32 токена в секунду, выходное – по 25 токенов в секунду (Google, 2026). На больших объёмах эта токенная математика выходит заметно дешевле поминутного тарифа OpenAI – независимые сравнения 2026 года ставят цену входного аудио Gemini примерно на порядок ниже, чем у OpenAI, для высокообъёмной голосовой работы (Finout, 2026). Если ваш продукт прогоняет миллионы минут разговора, эта разница – граница между фичей, которая окупается, и той, что нет. Реальные числа – в разделе о стоимости ниже.
SeamlessM4T – открытая модель перевода, которую можно держать у себя
Meta SeamlessM4T выбивается из ряда – и намеренно: она сделана под задачу перевода, а не разговора, и она open-weights, то есть обученный файл модели опубликован, чтобы вы скачали его и запустили на своём железе. Вторую версию выпустила команда Seamless Communication в Meta; это одна модель, которая делает речевой перевод, распознавание речи, синтез речи и обычную транскрипцию на широком наборе языков – примерно 101 язык понимается как речевой вход, а прямой речевой перевод на выходе покрывает десятки языков (Meta AI, 2023; Hugging Face, 2026).
Внутри это, по сути, каскад, спрятанный в одном выпущенном пакете: речевой энкодер на основе 24-слойной модели wav2vec-BERT, предобученной на 4,5 миллионах часов аудио, текстовый декодер, заимствованный из переводной модели Meta NLLB, и неавторегрессионный декодер единиц под названием UnitY2, который генерирует звук переведённой речи, завершаемый вокодером, превращающим эти единицы в слышимую волну (Meta AI, 2023). UnitY2 – это и есть прорыв v2: он предсказывает речевые единицы быстрее и эффективнее по данным, чем v1, улучшая и качество, и скорость (Hugging Face, 2026).
Подвох – в лицензии. SeamlessM4T выпущена под CC-BY-NC, где «NC» значит non-commercial (некоммерческая), так что исследовать и прототипировать с ней можно свободно, но использование внутри продукта, который вы продаёте, требует отдельной коммерческой договорённости с Meta (Hugging Face, 2026). Для фичи синхронного перевода, которую вы собираетесь выпускать, относитесь к SeamlessM4T как к эталонному дизайну и открытой базовой линии и проверьте лицензию, прежде чем строить на ней бизнес. Для перевода внутри звонка в реальном времени, где также важно, как он едет по WebRTC-пайплайну, эта статья передаёт эстафету отдельным урокам – мультиязычный речевой перевод в звонках в реальном времени и перевод речи в реальном времени в WebRTC-звонке, – а не дублирует их здесь.
Как три системы соотносятся
Таблица ниже выстраивает три системы по осям, которые решают сборку: какую задачу делают, держите вы их у себя или арендуете, как подключаетесь, охват языков и компромисс открытости. Слегка подкрашенная ячейка в каждой строке – вариант, который обычно выигрывает в этом критерии, хотя «выигрывает» полностью зависит от того, какую задачу вы решаете.
| Критерий | OpenAI Realtime API | Gemini Live | SeamlessM4T v2 |
|---|---|---|---|
| Основная задача | Разговор (голосовой агент) | Разговор (голосовой агент) | Перевод (синхронист) |
| Архитектура | End-to-end speech-to-speech | End-to-end, нативное аудио | Каскад внутри одного пакета |
| Держать или арендовать | Аренда (хостинговый API) | Аренда (хостинговый API) | Держать (open-weights) |
| Подключение | WebRTC · WebSocket · SIP | WebSocket | Связываете сами |
| Языки на выходе | Многоязычно, переключение в фразе | Многоязычно | ~Десятки, прямой речевой перевод |
| Форма стоимости | Аудио по токенам, ~$0,18–0,46/мин | По токенам, ~10× дешевле вход | GPU + электричество (свой хостинг) |
| Читаемая середина | Нет читаемого текста | Нет читаемого текста | Есть – текстовый этап открыт |
| Лицензия | Коммерческая, pay-as-you-go | Коммерческая, pay-as-you-go | CC-BY-NC (некоммерческая) |
| Когда брать | Продакшен-агент, телефонная поддержка | Высокий объём при ограниченном бюджете | Открытая база перевода, research |
Главный вывод: для разговорного голосового агента вы выбираете между двумя арендуемыми end-to-end-движками, где OpenAI лидирует по вариантам подключения и продакшен-зрелости, а Gemini – по цене на масштабе. Для фичи перевода вы на другом рынке, где SeamlessM4T – открытый эталон, но её некоммерческая лицензия – это барьер, который нужно преодолеть.
Сколько на самом деле стоит минута разговора
Цена – это место, где выбор архитектуры встречается с бюджетом, поэтому стоит один раз проделать арифметику вслух. Хостинговые speech-to-speech-API тарифицируют по токенам, и для аудио токен – это кусочек времени, а не кусочек текста. В OpenAI Realtime API аудио пользователя считается по одному токену на 100 миллисекунд, а звучащее аудио ассистента – по одному токену на 50 миллисекунд (CallSphere, 2026). Переведём это в цену за минуту.
Возьмём минуту речи пользователя. Минута – это 60 секунд, то есть 60 000 миллисекунд. При одном токене на 100 миллисекунд:
токены аудио пользователя в минуту = 60 000 мс ÷ 100 мс/токен = 600 токеновТеперь минута ответа ассистента, при одном токене на 50 миллисекунд:
токены аудио ассистента в минуту = 60 000 мс ÷ 50 мс/токен = 1 200 токеновgpt-realtime тарифицируется в $32 за миллион входных аудиотокенов и $64 за миллион выходных (OpenAI, 2025). Значит, минута речи пользователя и минута ответа ассистента стоят:
стоимость входа = 600 токенов × $32 / 1 000 000 = $0,0192
стоимость выхода = 1 200 токенов × $64 / 1 000 000 = $0,0768
───────────────────────────────────────────────────────
за минуту (в обе стороны, без кэша) ≈ $0,096На практике реальный агент ещё пересылает историю разговора каждый ход – поэтому независимые замеры ставят типичную минуту без кэша примерно в $0,18–0,46, падающую до $0,05–0,10 при включённом prompt caching – переиспользовании неизменной части промпта с резкой скидкой (CallSphere, 2026). Рычаг тут реальный: OpenAI тарифицирует кэшированный аудиовход в $0,40 за миллион токенов против $32 за свежий – 80-кратная скидка на повторяющуюся часть (OpenAI, 2025).
Именно здесь Gemini Live меняет математику. Поскольку входное аудио тарифицируется по куда более низкой токенной ставке, продукт, прогоняющий миллионы минут в месяц, может увидеть, как его крупнейшая статья – входное аудио – падает примерно на порядок (Finout, 2026). На малом масштабе разница – шум; на большом она может решить, выйдет ли фича вообще. Дисциплина – прогнать свой объём против обоих прайс-листов, прежде чем выбрать, ровно так, как раскладывает урок о реальной стоимости ИИ в видеопродуктах. Памятка на одну страницу ниже упаковывает это сравнение, чтобы вы прогнали его прямо на встрече.
Где здесь Фора Софт
Speech-to-speech – не одна фича, а паттерн, который проявляется во всех продуктах, что мы строим. В видеоконференциях это ассистент на созвоне, который слушает и отвечает вслух, или синхронный переводчик между участниками. В телемедицине – низкозадержная приёмная линия, проговаривающая пациенту вопросы перед визитом. В онлайн-обучении – разговорный репетитор, которого ученик может перебить и попросить помедленнее. В OTT и интернет-ТВ – голосовая навигация и живое дублирование. Инженерное суждение в каждом случае одно и то же, и его задаёт эта статья: каскад или end-to-end, какой транспорт, чей прайс-лист и насколько аккуратно настроена смена реплик – и именно это суждение, принятое рано, удерживает голосовую фичу от ощущения роботизированной, когда приходят настоящие пользователи.
Ключевые выводы
- Speech-to-speech – это две задачи: разговор (OpenAI, Gemini) и перевод (SeamlessM4T).
- Каскад связывает модели «услышать-подумать-сказать»; одна end-to-end-модель быстрее и человечнее, но её труднее отлаживать.
- Целитесь меньше чем в 800 мс от голоса до голоса; модель – лишь около половины бюджета.
- Выбирайте транспорт по тому, где живёт аудио: устройство (WebRTC), сервер (WebSocket), телефон (SIP).
- Определение конца реплики и обработка перебиваний ломают больше демо, чем когда-либо модель.
- Аудио Gemini Live по токенам примерно в 10× дешевле на входе, чем у OpenAI, на больших объёмах.