ИИ в видеоконференцсвязи – инженерный плейбук

Автор: Николай СапуновОбновлено: август 202623 мин чтения
Содержание статьи +

Кратко

Добавить ИИ в продукт для видеозвонков – это не одно решение, а меню функций, которые делятся на четыре задачи: очистить звонок, сделать его понятным, сохранить знание и помогать людям в реальном времени. Главный инженерный вопрос – никогда не «какую функцию?», а «где именно она выполняется?», потому что каждая ИИ-функция в звонке считается в одном из трёх мест (на устройстве пользователя, на вашем медиасервере или в облачном API), и именно этот выбор определяет задержку, цену и приватность сильнее, чем выбор модели. Денежные функции – ИИ-ассистент встреч и ИИ-ноутейкер, которые буквально ищут покупатели, – можно купить готовыми, прикрутить отдельным ботом или встроить нативно в собственный real-time-конвейер, и только третий путь оставляет транскрипт и резюме внутри продукта, который вы поставляете. Этот плейбук даёт продакту и инженеру одну общую карту: меню функций, решение «где это выполняется» из трёх ярусов, разбор «строить или покупать» для ассистента, бюджет задержки, который можно посчитать на пальцах, и правила согласия, превращающие функцию в юридическую обязанность.

Почему это важно

Каждый видеопродукт теперь конкурирует по ИИ-функциям, и конференцсвязь – арена, где конкуренция жёстче всего: рынок ИИ-ассистентов встреч составлял около $3,5 млрд в 2025 году и растёт примерно на 26% в год, а опросы сообщают, что 62% пользователей экономят около четырёх часов в неделю, как только ассистент появляется в их встречах. Если вы строите или владеете продуктом для конференцсвязи, телемедицины, онлайн-обучения или звонков отдела продаж, в вашей дорожной карте теперь два вопроса – «какие ИИ-функции добавить и в каком порядке?» и «купить ноутейкер или встроить эту способность в собственное приложение?». Этот плейбук отвечает на оба именно для вертикали конференцсвязи. Он написан так, чтобы продакт-менеджер спланировал набор функций и приватность без инженерного образования, а инженер увидел, где выполняется каждая функция и сколько она стоит. Это карта вертикали; более глубокие уроки Phase 6 этого раздела – пофункциональные инженерные руководства, на которые он ссылается.

Что на самом деле значит «ИИ в видеоконференцсвязи»

Уберите маркетинг – и видеозвонок окажется потоком аудио и видео, который в реальном времени идёт между людьми. «ИИ в видеоконференцсвязи» означает вставить модель куда-то в этот поток – чтобы изменить медиа, прочитать его или действовать по нему – достаточно быстро, чтобы звонок всё ещё ощущался живым.

В этом вся идея, и три глагола держат остальной плейбук ясным. Модель может изменить медиа: убрать фоновый шум, размыть то, что позади вас, заменить фон, выровнять освещение. Модель может прочитать медиа: превратить речь в субтитры, перевести её, разметить, кто говорит, написать резюме. Или модель может действовать по тому, что прочитала: подсказать ответ прямо в звонке, набросать письмо-follow-up, обновить CRM. Почти любая ИИ-функция конференцсвязи на рынке – это один из трёх глаголов, применённый к живому потоку.

Для планирования это важно потому, что у трёх глаголов очень разная инженерная цена. Изменение медиа должно произойти заметно быстрее десятой доли секунды, иначе звонок ощущается сломанным. Чтение медиа может слегка отставать – субтитр, опоздавший на четверть секунды, не страшен. Действие по медиа может занять целые секунды, потому что человек сам его попросил и ждёт паузу. Сортируйте список желаний сначала по глаголу – и дедлайны выстроятся сами.

Меню функций, сгруппированное по задаче

Покупатели думают функциями; инженеру стоит думать задачами. Одни и те же четыре задачи покрывают практически всё, что поставляет продукт конференцсвязи, и группировка по задаче – а не по вендору – держит дорожную карту честной.

Рисунок 1. Меню ИИ-функций конференцсвязи. Четыре задачи, четыре очень разных дедлайна – планируйте в этом порядке, а не по названию продукта.

Первая задача – очистить звонок: шумоподавление, убирающее стук клавиатуры и лай собак, эхоподавление, останавливающее петлю обратной связи, когда кто-то сидит на динамиках, размытие и замена фона ради приватности, авто-кадрирование, держащее лицо в центре. Это считается на каждом кадре и каждом аудиопакете, поэтому живёт под самым жёстким дедлайном во всём продукте. Современное шумоподавление срезает 10–20 децибел фонового шума – децибел это стандартная единица громкости звука, и 10 децибел это примерно «вдвое тише» на человеческий слух – оставляя речь разборчивой.

Вторая задача – сделать звонок понятным: живые субтитры, перевод в реальном времени и метки говорящих. Субтитры производит автоматическое распознавание речи, обычно сокращаемое до ASR – это просто софт, превращающий произнесённый звук в написанные слова. На чистом английском звуке лучшие движки сейчас ошибаются менее чем в 5% слов; на шумном звонке с несколькими говорящими они кучкуются ниже 10%. Перевод добавляет шаг и чуть больше задержки – переведённые субтитры в Google Meet на базе Gemini охватывают 60+ языков, и частичный субтитр обычно появляется менее чем за полсекунды.

Третья задача – сохранить знание, и здесь деньги. ИИ-ноутейкер и ИИ-ассистент встреч делают по сути одно и то же: держат транскрипт звонка с поиском и пишут короткое резюме с выделенными пунктами действий. Это функции, которые реально ищут покупатели – один только запрос «ai notetaker» собирает тысячи поисков в месяц – и ради них существует этот урок. Им посвящён отдельный глубокий раздел ниже.

Четвёртая задача – помогать людям вживую: копайлот, отвечающий на вопрос прямо в звонке, набрасывающий follow-up, пока звонок ещё идёт, или обновляющий запись в продажах без единого нажатия. Это самая новая и наименее зрелая группа, и поскольку человек явно её просит и ждёт ответа, она может занять секунду-другую, не ощущаясь сломанной.

Решение, проходящее сквозь каждую функцию: где она выполняется?

Вот вопрос, решающий больше, чем любой выбор модели: для каждой функции – какая машина считает? Ответов всего три, и каждая ИИ-функция конференцсвязи живёт на одном из них.

Рисунок 2. Три яруса выполнения. Хребет всего плейбука – каждая функция это ответ на вопрос «устройство, медиасервер или облако?».

Первое место – собственное устройство пользователя: его браузер или приложение, на процессоре или графическом чипе ноутбука. Размытие фона и шумоподавление обычно считаются здесь. Выигрыш в том, что аудио и видео не покидают машину пользователя ради очистки, поэтому задержка почти нулевая, а приватность отличная. Подвох в том, что вы зависите от того железа, что есть у пользователя, и работа делается по разу на человека, а не один раз на комнату.

Второе место – ваш медиасервер: та инфраструктура, что и так стоит в середине каждого группового звонка. В WebRTC, открытом стандарте, которым браузеры ведут real-time-звонки, эта средняя коробка обычно Selective Forwarding Unit, или SFU: сервер, получающий аудио и видео всех и пересылающий нужные потоки нужным людям. Поскольку у SFU уже есть звук всех, это естественное место, чтобы транскрибировать один раз и отправить субтитры всемпаттерн субтитров на стороне SFU – и естественный дом для записи и ноутейкера. Выигрыш – одна транскрипция на всю комнату под вашим контролем. Цена – вы запускаете и оплачиваете эти вычисления, и звук проходит через ваши серверы.

Третье место – облачный AI-API: сервис вроде хостингового распознавания речи или языковой модели, куда вы отправляете аудио или текст и получаете результат. Тяжёлая транскрипция, перевод, резюме и живой копайлот обычно считаются здесь, потому что качество выше всего, а моделей вы не держите. Плата – поминутный тариф, лишний круг по сети и тот факт, что данные покидают ваш периметр – а это, как мы увидим, ровно там, где начинаются юридические вопросы.

Почти ни один реальный продукт не выбирает один ярус. Типичное приложение конференцсвязи размывает фон на устройстве, транскрибирует на SFU или в облачном ASR и пишет резюме в облачной языковой модели. Мастерство – сопоставить каждую функцию правильному ярусу, и правило следует из глаголов выше: функции изменения медиа хотят устройство, функции чтения медиа хотят SFU или облако, функции действия по медиа хотят облако.

Денежные функции вблизи: ИИ-ноутейкер и ИИ-ассистент встреч

Ноутейкер и ассистент встреч – функции, которые называют ваши покупатели, поэтому им нужна точность. В быту два термина сливаются, но различие полезно. Ноутейкер – более узкая задача: захватить звонок, транскрибировать и выдать заметки и резюме после; его результат – документ. Ассистент встреч – более широкая роль: всё, что делает ноутейкер, плюс живая помощь во время звонка и действия после него – черновик follow-up или синхронизация с CRM; его результат – документ и активность. Каждый ноутейкер – часть ассистента; не каждый ассистент останавливается на заметках.

Для продукта конференцсвязи есть три способа дать эту способность пользователям, и они чисто ложатся на то, где происходит захват.

Рисунок 3. Три пути к ассистенту встреч. Только нативная сборка оставляет транскрипт, резюме и данные внутри вашего продукта.

Первый путь – использовать встроенный ассистент платформы. У Zoom есть AI Companion, у Microsoft Teams – Copilot, у Google Meet – «take notes for me» на базе Gemini. Ассистент Zoom транскрибирует и переводит на 30+ языках и входит в платные планы; ассистент Google пишет структурированные заметки прямо в Google Doc. Это верный ответ, если ваша команда просто встречается на одной из этих платформ и хочет заметки. Это неверный ответ, если вы строите продукт, потому что ассистент привязан к платформе, а его результат никогда не попадает внутрь вашего приложения.

Второй путь – прикрутить внешнего бота. Инструменты вроде Otter, Fireflies и Fathom – или инфраструктурный API вроде Recall.ai, на котором вы строите, – отправляют в звонок программного участника. Под капотом этот «бот» обычно headless-браузер – настоящий веб-браузер на сервере без экрана, – который входит по ссылке встречи через WebRTC так же, как браузер человека. Это быстро интегрировать, и работает на всех платформах, но он виден в списке участников, а звук течёт через третью сторону. Полная пофункциональная инженерия этих ботов – отдельный урок, см. разбор Otter / Fireflies / Fathom и ландшафт инструментов транскрипции – и граница важна для покупателей, борющихся с тем, что индустрия теперь зовёт «усталостью от ботов» – измеримой реакцией против видимых ботов-ноутейкеров в чувствительных звонках.

Третий путь, и единственный, делающий способность частью вашего продукта, – встроить её в собственный real-time-конвейер. Когда встреча уже идёт внутри вашего приложения, боту не нужно входить снаружи – ваш сервер уже в звонке. Вы добавляете тихого участника, который слушает, транскрибирует и резюмирует, и рисуете результат на собственной панели. Стандартный способ в 2026-м – LiveKit-агент: LiveKit это open-source WebRTC-фреймворк, на котором работает и real-time-аудио в продуктах вроде голосового режима ChatGPT, а его agents-фреймворк позволяет программе на Python или Node войти в звонок полноценным участником. Агент транскрибирует через потоковый ASR-движок, резюмирует языковой моделью и пишет обратно в ваше приложение – полная сборка ноутейкера это отдельный разбор. Этот путь стоит больше всего инженерии и меньше всего за место, оставляет данные внутри периметра и позволяет заложить согласие с первого спринта.

Посчитанный бюджет задержки – чтобы дедлайны перестали быть абстрактными

«Реальное время» – это число, а не настроение, и самый дешёвый способ не построить нечто сломанное – сложить миллисекунды до того, как писать код. Вот бюджет для живого субтитра: звук покидает рот говорящего, и слова должны появиться на экранах всех, прежде чем задержка станет раздражать.

Рисунок 4. Бюджет задержки живого субтитра. Каждый этап стоит миллисекунд; сумма – единственное число, решающее, ощущается ли функция живой.

Пройдём по нему с показанной арифметикой. Захват и кодирование звука на устройстве стоят около 30 миллисекунд – миллисекунда это одна тысячная секунды. Сетевой прыжок от устройства до вашего медиасервера добавляет около 40 миллисекунд. Движку распознавания речи нужно примерно 150 миллисекунд, чтобы выдать первый частичный субтитр. Раздача субтитра обратно каждому участнику стоит ещё 40 миллисекунд, а отрисовка текста на каждом экране – около 20.

Сложим: 30 + 40 + 150 + 40 + 20 = 280 миллисекунд. Линия комфорта для живых субтитров – около 300 миллисекунд, так что бюджет умещается – впритык. Теперь заметьте рычаг. Самая крупная статья – 150 миллисекунд распознавания. Если бы вы вместо этого отправили звук в далёкий облачный ASR с круговым ходом в 120 миллисекунд сверху, итог был бы 400 миллисекунд, и субтитры ощущались бы тормозными. Вот почему «где это выполняется» – главное решение: перенос распознавания из далёкого облака на ваш сервер или на устройство – разница между функцией, которая ощущается живой, и той, которая нет. Та же дисциплина бюджета применима к любой real-time-функции; полный метод – в уроке про бюджет задержки до 100 миллисекунд.

Сколько это стоит и арифметика «строить или покупать»

Стоимость ИИ в конференцсвязи приходит в двух формах, и путать их – способ взорвать бюджет. Купленные инструменты берут за место: фиксированная плата за пользователя в месяц, предсказуемая и дешёвая для обычной команды, дорогая в крупной организации, где многие места почти не встречаются. Встроенная способность берёт за минуту использования: вы платите облачному провайдеру за звук, который он транскрибирует, и за токены, которые генерирует модель, что стоит ноль в простое и масштабируется с реальным использованием.

Таблица делает формы конкретными цифрами 2026 года; проверьте актуальные числа до фиксации, потому что эта категория переоценивается часто.

ПодходЗа что платитеХорош, когдаПодвох
Встроенный в платформу (Zoom / Teams / Meet)Включено в план, который вы и так берётеВстречаетесь на одной платформе и хотите заметкиПривязка к платформе; в ваш продукт ничего не попадает
Внешний бот (Otter / Fireflies / Fathom)~$8–19 за пользователя в месяцМаленькая команда, много платформ, быстрый стартВидимый бот; данные через третью сторону; цена за места растёт
Build-it API захвата (Recall.ai)~$0,50 за час записи + ~$0,15/ч транскрипцииПродукт, который транскрибирует, только когда есть звонкиРезюме, хранение и UI вы всё равно строите
Нативный конвейер (ваш SFU + LiveKit-агент)Ваш облачный ASR + LLM + инфраструктураВстреча и есть ваш продукт; данные должны остаться внутриБольше всего инженерии вперёд; вы это эксплуатируете

Считайте числа «строить или покупать», а не угадывайте их. Допустим, продукт для продаж, чьи клиенты в сумме проводят 10 000 часов записанных звонков в месяц, строит на API захвата по примерно $0,50 за час захвата плюс $0,15 за час транскрипции. Это 10 000 × ($0,50 + $0,15) = 10 000 × $0,65 = $6 500 в месяц за захват и транскрипцию, до модели резюме и хранения. Бьёт ли это плату за места, целиком зависит от того, сколько мест представляют эти 10 000 часов – ровно ради этого и нужно умножение, а не прикидка на глаз. Полная модель стоимости, включая математику токенов модели, – в уроке про реальную стоимость ИИ в видеопродуктах.

«Частая ошибка: считать ИИ-ассистента функцией, которую включают, а не системой, которую эксплуатируют. Команды скоупят ноутейкер как «добавить транскрипцию и резюме» и выкатывают, а потом обнаруживают, что настоящая работа была везде вокруг: обработать звонок, где двое говорят разом, верно расставить метки говорящих, хранить транскрипты по политике хранения и – что бьёт больнее всего – собрать согласие. На чистом звуке все ASR-движки в паре процентов друг от друга, поэтому демо всегда выглядит отлично. Продукт ломается на шумном звонке, на многоязычном звонке и на юридической проверке. Бюджетируйте систему вокруг модели, а не только модель.»

То, что превращает функцию в юридическую обязанность: согласие

Здесь дорожная карта конференцсвязи тихо становится юридической, и 2026-й поднял ставки. Считайте дальнейшее инженерно-полезным контекстом, а не юридической консультацией – уточняйте конкретику у квалифицированного юриста под вашу юрисдикцию.

Запись разговора регулируется. В США правило делится по штатам: 39 штатов плюс округ Колумбия допускают согласие одной стороны – один участник разговора может согласиться на запись, – тогда как 11 штатов, включая Калифорнию, Иллинойс и Пенсильванию, требуют согласия всех сторон, то есть сначала согласиться должны все. По европейскому GDPR захват чьего-то голоса требует законного основания и ясного информированного согласия. Ловушка, в которую попадают команды: видимый бот в списке участников сам по себе не является юридическим согласием. Ни одна крупная юрисдикция не считает «они же видели Notetaker» тем информированным согласием, которого требует закон.

Два более новых риска заслуживают флага для тех, кто это строит. Первый – голосовые отпечатки это биометрия: шаг разметки говорящих, питающий «кто что сказал», строит голосовую подпись, и в 2026-м эта подпись всё чаще трактуется как защищённый биометрический идентификатор по законам вроде иллинойсского BIPA, что может запускать обязанности явного opt-in. Второй – судебные процессы идут: коллективные иски, поданные в конце 2025-го – Brewer v. Otter.ai в Калифорнии и Cruz v. Fireflies.ИИ в Иллинойсе – утверждают ровно эти провалы: что боты перехватывали коммуникации и собирали голосовые данные без согласия всех сторон. Каким бы ни был исход, они сделали корпоративных юристов осторожными и во многом поэтому встраивание согласия нативно в собственный конвейер стало аргументом продажи, а не только мерой защиты.

Если вы встраиваете ассистента в продукт, закладывайте согласие с самого начала: раскройте ИИ до того, как он включится, соберите согласие и дайте пользователям реальный способ отказаться. В ЕС статья 50 EU AI Act делает это раскрытие обязанностью прозрачности, а не любезностью – та же дисциплина в уроке про инженерию раскрытия и в уроке про регуляторику EU AI Act. Нативная сборка – путь, позволяющий выполнить эти обязанности чисто, потому что запрос согласия – часть вашего продуктового потока, а не внешнего бота.

Плейбук: короткий путь от списка желаний к работающей функции

Сложите кусочки – и дорожная карта ИИ в конференцсвязи сводится к четырём вопросам, заданным по порядку, на каждую функцию.

Рисунок 5. Плейбук одним путём. Задача задаёт дедлайн, дедлайн задаёт ярус, продукт-фит задаёт «строить или покупать», а согласие – ворота перед каждым запуском.

Сначала – какая это задача: очистить, понять, сохранить или помогать? Задача задаёт дедлайн задержки, а дедлайн отсекает ярусы, которые его не вытянут. Второе – где это выполнять: если дедлайн меньше примерно десятой доли секунды, работа на устройстве; если небольшая задержка допустима и всей комнате нужен один результат – медиасервер; если работа тяжёлая и пауза допустима – облачный API. Третье – строить или покупать: если результат должен жить внутри вашего продукта, стройте нативно в свой конвейер; если способность нужна лишь рядом с встречами – купите инструмент или прикрутите бота. Четвёртое, и без исключений, – ворота согласия: раскройте ИИ, соберите согласие и соблюдите штаты с согласием всех сторон, GDPR и EU AI Act до того, как функция уйдёт в релиз. Каждая функция проходит эти ворота; ни одна их не минует.

В этом весь плейбук. Уроки Phase 6 этого раздела – подробные руководства по каждому квадрату: размытие фона, шумоподавление, живые субтитры, перевод в реальном времени и паттерны интеграции WebRTC с ИИ – а этот плейбук – указатель, подсказывающий, какой из них открыть и в каком порядке.

Где здесь Фора Софт

Мы строим продукты конференцсвязи, внутри которых живут эти ИИ-функции – видеоплатформы для встреч, приложения телемедицины, классы онлайн-обучения и инструменты для звонков продаж, – поэтому регулярно прогоняем этот плейбук с клиентами. Когда функции нужно лишь стоять рядом с встречами клиента, мы помогаем выбрать верный инструмент и верный ярус и интегрировать его. Когда она должна жить внутри продукта – заметка визита телездоровья, сгенерированная на самой платформе, живые субтитры, раздаваемые каждому студенту вебинара, резюме продаж на собственной панели клиента, – мы строим её на real-time-конвейере WebRTC, обычно с LiveKit-агентом как тихим участником, чтобы захват был нативным для приложения, а не прикрученным внешним ботом, с согласием и раскрытием, заложенными с первого спринта. Четыре вопроса этого плейбука – те же, что мы взвешиваем в скоуп-звонках, когда клиент спрашивает, купить ноутейкер или владеть способностью.

Ключевые выводы

  • ИИ-функции конференцсвязи делятся на четыре задачи: очистить, понять, сохранить, помогать – у каждой свой дедлайн.
  • Главное решение – где выполняется каждая функция: устройство, медиасервер или облако.
  • ИИ-ноутейкер и ассистент встреч можно купить, прикрутить ботом или построить нативно.
  • Только нативная сборка оставляет транскрипт, резюме и данные внутри вашего продукта.
  • Складывайте миллисекунды до кода; сумма решает, ощущается ли функция живой.
  • Видимый бот это не согласие – штаты с согласием всех сторон, GDPR и статья 50 EU AI Act применимы.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.