Материал
Памятка: выбор архитектуры «речь в речь»
Одна страница: каскад против сквозной модели, бюджет 800 мс от голоса до голоса, выбор транспорта WebRTC/WebSocket/SIP, тесты смены реплик и перебивания и сравнение OpenAI Realtime API, Gemini Live и SeamlessM4T по задаче, цене, подключению и лицензии.
Что внутри
- 1 · Три системы 2026 одним взглядом
- 2 · Каскад или end-to-end?
- 3 · Перед запуском speech-to-speech-функции
Кому пригодится
Архитекторам, выбирающим схему голос-в-голос. Памятка сравнивает каскад и end-to-end, раскладывает бюджет 800 мс от голоса до голоса, разбирает транспорт WebRTC, WebSocket или SIP, тесты смены реплик и перебивания и ставит рядом OpenAI Realtime API, Gemini Live и SeamlessM4T – каскад собирают, а потом упираются в задержку, которую не разложили заранее.

Без регистрации и почты – файл открывается сразу
Источник
Из какого курса материал
ИИ в видеоинженерии
Компьютерное зрение, речь, мультимодальные модели, генеративное видео, агенты и регламент ЕС об ИИ.
Speech-to-speech – Realtime API, Gemini Live, SeamlessM4T
Speech-to-speech – это система, которая слышит произнесённую речь и отвечает голосом, причём читаемый текст в середине…
Ещё материалы
Похожие материалы
Все материалы →Выбираете технологию под проект?
Пройдём чек-лист вместе и посчитаем стоимость вариантов на ваших объёмах.