Агент-копилот встречи – кейс видеоконференций

Автор: Николай СапуновОбновлено: август 202620 мин чтения
Содержание статьи +

Коротко

Агент-копилот встречи – это ИИ-система, которая находится внутри живого видеозвонка, следит за разговором и помогает его участникам: вытаскивает нужный документ ровно в тот момент, когда он понадобился, фиксирует задачи по мере того, как принимаются решения, и пишет письмо-follow-up ещё до того, как кто-то покинул звонок. Это знакомый по прошлым урокам цикл агента, наведённый на встречу: он слушает через инструмент speech-to-text, планирует, чем мог бы помочь дальше, вызывает инструменты, чтобы достать факт или записать задачу, и либо тихо подсказывает что-то одному человеку, либо постит итог всем. Инженерное ограничение, которое формирует весь дизайн, – это время: у говорящего копилота есть меньше секунды на ответ, иначе он перебьёт человека, поэтому тяжёлую работу делят на то, что обязано происходить вживую, и то, что может подождать конца встречи. Тот же паттерн вышел в 2026 году как Facilitator в Microsoft 365 Copilot, как Zoom AI Companion 3.0 и как волна real-time-копилотов для продаж, но он же упирается в закон о согласии на запись и в запрет ЕС читать эмоции сотрудников – поэтому грамотный дизайн раскрывает себя, берёт согласие и никогда не оценивает, что люди чувствуют.

Почему это важно

Встречи – это сценарий, где копилот окупается особенно быстро, потому что работа вокруг встречи (вести заметки, искать нужный файл, помнить, кто что обещал, писать итог) – это ровно та скучная и легко портящаяся работа, которую люди больше всего хотят с себя снять. Если вы делаете софт для видеоконференций, продаж, телемедицины или онлайн-обучения, ваши пользователи уже ждут эту помощь внутри звонка, а не приделанной сбоку после него, и они будут судить о продукте по тому, насколько копилот полезен и насколько ему можно доверять. Писать конвейер самому вам не нужно, но нужно понимать достаточно, чтобы отличить грамотный дизайн от безрассудного – спросить, отвечает ли агент достаточно быстро, чтобы его были рады видеть, спросил ли он разрешение слушать и подтверждает ли человек что-либо, прежде чем агент это отправит. Это второй из трёх прикладных уроков про агентов; он использует тот же скелет, что и агент-исследователь видео, но наведённый на живой разговор, а не на записанную съёмку.

Что такое агент-копилот встречи – и чем он не является

Начнём с того, что большинство уже знает, потому что копилот часто путают именно с этим. Notetaker (заметочник) – это инструмент, который записывает звонок, расшифровывает его и пишет итог постфактум; ту же работу делают Otter, Fireflies и функция recap, встроенная в большинство конференц-приложений. Он полезен, и весь этот ландшафт мы разбираем в уроке про ИИ-транскрипцию встреч. Но notetaker пассивен и работает в основном задним числом: он слушает, потом отчитывается. Он не решает что-либо делать.

Агент-копилот встречи – это активная версия. Слово агент указывает на конкретное отличие: он не просто расшифровывает встречу, он во время встречи преследует цель, совершая действия. Когда разговор переходит к цифрам прошлого квартала, копилот достаёт их и показывает. Когда кто-то говорит «пусть Мария возьмёт раскатку на себя к пятнице», копилот записывает это как задачу с исполнителем Марией и сроком в пятницу и предлагает положить её в трекер. К концу звонка он уже набросал письмо-follow-up. Notetaker помнит встречу; агент помогает её вести и действует по её итогам.

Полезно зафиксировать границу и с другой стороны. Копилот-агент – это не автономный бот, который заходит на ваши звонки и сам принимает решения. Весь дизайн держится на простом правиле, к которому мы ещё вернёмся: агент предлагает, человек решает. Он может набросать письмо, но отправляет его человек; может подсказать ответ на возражение, но продавец сам выбирает, использовать его или нет. В 2026 году именно эта форма – активная, но под присмотром – вышла в продакшен в большом масштабе: агент Facilitator в Teams ведёт заметки, держит лёгкий тайминг и превращает произнесённые обязательства в назначенные задачи, а Zoom AI Companion 3.0 распознаёт пункты задач во время звонка и может назначить follow-up – и в обоих случаях человек сохраняет контроль над всем, что покидает комнату.

Рисунок 1. Три вещи, которые называют «ИИ на встрече». Notetaker отчитывается постфактум; лента подсказок предлагает пассивные prompts; копилот-агент планирует, вызывает инструменты и действует. Этот урок – про третье.

Цикл копилота

Любой агент крутит цикл – воспринять, рассудить, действовать, наблюдать – и этот цикл мы нарисовали в уроке про цикл агента. Копилот встречи – это тот же цикл, наведённый на живой разговор, и он оборачивается много раз в минуту. Пройдём один оборот медленно – и цикл станет осязаемым.

Копилот воспринимает, слушая: инструмент speech-to-text превращает живое аудио в бегущую расшифровку, помеченную по говорящему, так что у агента всегда перед глазами последние несколько фраз разговора. Он рассуждает над этой расшифровкой с одним вопросом – есть ли сейчас что-то полезное, что я мог бы сделать? Чаще всего ответ «нет», и копилот молчит, а это само по себе навык. Когда ответ «да», он планирует наименьший полезный шаг: «продавца только что спросили про интеграцию с Salesforce, и в наших доках есть однострочный ответ – достань его». Он действует, вызывая инструмент – ретривер – с этим запросом. Результат (фрагмент дока) ложится обратно в рабочую память агента как новое наблюдение. Копилот рассуждает снова: стоит ли это показывать и кому? Он тихо показывает фрагмент продавцу, а не всей комнате. На следующей фразе цикл оборачивается опять.

Заметьте, что понадобилось на каждом обороте. Понадобились планирование, чтобы выбрать, делать ли что-то и что именно, использование инструментов, чтобы достать или записать, и память, чтобы держать цель встречи и вспоминать контекст. Это ровно три примитива из урока про примитивы агента; копилот встречи – это место, где они работают в реальном времени, под часами. И для всего значимого цикл всегда заканчивается одинаково: агент пишет черновик, а человек его утверждает. Копилот может предложить письмо, обновление CRM, назначенную задачу – но он не отправляет, не сохраняет и не назначает сам.

Рисунок 2. Одна встреча как быстрый цикл. Копилот слушает, решает, действовать ли, планирует наименьший шаг, вызывает инструмент и помнит контекст – оборачиваясь много раз в минуту, – затем готовит черновик, который человек утверждает, прежде чем что-то покинет комнату.

Пояс инструментов – что копилот реально умеет

Агент способен ровно настолько, насколько хороши данные ему инструменты, и искусство в том, чтобы дать немного острых, а не много тупых. Копилоту встречи нужен небольшой пояс, и большинство инструментов – это части, которые мы разбирали раньше в этом разделе.

Первый инструмент – живой транскрайбер: потоковая speech-to-text-модель, которая превращает аудио в текст по мере произнесения и помечает каждую строку тем, кто её сказал (шаг под названием speaker diarization). Это ухо копилота, и оно не выключается никогда; от него зависит всё остальное. Production-варианты – потоковые движки из урока про streaming ASR.

Второй инструмент – ретривер: способ достать нужный встрече факт из знаний компании – карточку CRM по этому клиенту, слайд с цифрами прошлого квартала, обсуждаемый тикет поддержки, ответ в продуктовых доках. Это та же поисковая машинерия, что и мультимодальный RAG по архиву, но наведённая на документы и записи вместо видео. Ретривер позволяет копилоту ответить «что мы им квотировали в Q3?», не заставляя никого выходить из звонка.

Третий инструмент – писатель задач: агент замечает, что было дано обязательство («Мария отвечает за раскатку, пятница»), и превращает его в структурированную задачу с исполнителем и сроком. Само по себе это просто текст; его ценность появляется со следующим инструментом.

Четвёртый инструмент – коннектор к задачам и календарю: действие записи в системы, которыми команда реально пользуется – создать задачу в трекере, обновить стадию сделки в CRM, предложить follow-up-встречу в календаре. Этот инструмент превращает разговоры в сделанное, и он же самый опасный, потому что меняет настоящие системы – поэтому каждая запись проходит через утверждение человеком.

Пятый инструмент – ответчик, который используют только копилоты, говорящие или пишущие в ответ. Для говорящего копилота это голос text-to-speech (потоковые движки из урока про TTS); для молчаливого – карточка в боковой панели. Так копилот сообщает результат, и говорит ли он вслух всем или шепчет одному – это дизайн-решение с реальными последствиями, о чём ниже.

Шестой инструмент – писатель итогов: агент собирает расшифровку, решения, задачи и открытые вопросы в короткий итог после звонка. Это вообще не real-time-инструмент; он работает один раз, в конце, когда никаких часов обгонять не нужно. Это старая работа notetaker'а, которую теперь делает тот же агент, что помогал во время встречи.

ИнструментЧто делаетКогда работаетИз чего
Живой транскрайберРечь в помеченный текст, вживуюНепрерывноStreaming ASR + diarization
РетриверДостать факт из CRM / доков / прошлых звонковПо требованию, вживуюМультимодальный RAG
Писатель задачЗаметить обязательство, структурироватьПо требованию, вживуюLLM-извлечение
Коннектор задач / календаряЗапись в трекер, CRM, календарьПосле утверждения человекомИнтеграции с приложениями
Ответчик (голос или карточка)Сообщить результатКогда копилот помогаетStreaming TTS или UI
Писатель итоговРезюмировать решения и задачиОдин раз, после звонкаLLM-суммаризация

Частая и дорогая ошибка – перегрузка инструментами: дать агенту тридцать коннекторов, потому что каждый казался полезным. Чем больше инструментов на выбор, тем чаще агент берёт не тот или зависает на решении, и точность выбора инструмента падает по мере роста меню. Начните с шести выше и добавляйте седьмой, только когда реальные встречи докажут, что его не хватает.

Рисунок 3. Пояс инструментов копилота, сгруппированный по тому, когда работает каждый инструмент: транскрайбер работает непрерывно, ретривер и писатели – по требованию во время звонка, а писатель итогов – один раз в конце. Инструменты записи срабатывают только после утверждения человеком.

Ограничение реального времени – почему всё решают часы

Самая важная мысль этого урока в том, что копилот встречи живёт под часами, и именно часы решают, что агент может сделать вживую, а что обязан отложить на потом. Понимание бюджета времени – вот что отделяет копилота, которого рады видеть, от того, который хочется выключить.

Сделаем арифметику для говорящего копилота – того, что отвечает голосом в звонке. В естественном человеческом разговоре пауза между тем, как один договорил, и тем, как начал следующий, – около двух десятых секунды. Люди замечают паузу дольше примерно полусекунды, а как только задержка переваливает за секунду – начинают говорить поверх собеседника. То есть у говорящего копилота бюджет примерно одна секунда от начала до конца, и эта секунда должна вместить четыре шага подряд. Агенту надо заметить, что вы договорили, и превратить ваше аудио в текст (speech-to-text с детектором конца реплики, ≈ 300 мс), придумать ответ (время языковой модели до первого слова, ≈ 500 мс), начать превращать ответ в аудио (первый звук text-to-speech, ≈ 250 мс) и доставить аудио по сети (≈ 150 мс). Складываем: 300 + 500 + 250 + 150 = 1200 мс. Это уже за чертой в одну секунду, где люди начинают перебивать, – и вот почему задача трудная.

Это не худший случай, а примерно середина дороги. На миллионах реальных звонков голосовых агентов в 2025–2026 опубликованная медианная суммарная задержка для такого каскада – трёх отдельных моделей, сцепленных speech-to-text, затем языковая модель, затем text-to-speech, – около 1,4–1,7 секунды, а самый медленный один оборот из ста тянет 3–5 секунд. Есть два выхода, и оба важны для дизайна. Первый – единая speech-to-speech-модель, которая берёт аудио на входе и отдаёт аудио на выходе без трёхшаговой эстафеты; такие укладываются в 320–800 миллисекунд от начала до конца, уверенно внутри бюджета, и мы разбираем их в уроке про speech-to-speech. Второй – сделать большинство копилотов молчаливыми: они показывают карточку, а не голос, поэтому правило одной секунды к ним вообще не применяется, и пользователь чувствует лишь подсказку, появляющуюся на удар позже нужной фразы.

Ещё две детали реального времени решают, кажется ли говорящий копилот живым. Первая – детекция конца реплики (turn detection): понять, что вы действительно договорили, а не просто сделали вдох. Ответ 2026 года сочетает быструю акустическую проверку, которая слышит тишину, с небольшой языковой моделью (LiveKit ставит примерно на 135 миллионов параметров), которая читает уже сказанные слова и предсказывает, звучит ли фраза законченной. Вторая – barge-in: дать пользователю перебить. Когда пользователь начинает говорить, пока копилот ещё говорит, система обязана мгновенно остановить собственную речь, выбросить недоговорённый ответ и слушать. Копилот, который продолжает говорить поверх вас, хуже, чем отсутствие копилота.

Часы же и делят работу надвое, и это деление – весь production-дизайн. Полоса во время встречи – расшифровка, поиск, редкая живая подсказка – работает под бюджетом в одну секунду и делает только дешёвое и быстрое. Полоса после встречи – полный итог, вылизанное письмо-follow-up, обновления CRM, развёрнутый план задач – работает по окончании звонка, без часов, где агент может не торопиться и взять модель побольше и помедленнее. Пытаться делать работу качества «после встречи» во время встречи – самый частый способ собрать копилот, который лагает и раздражает. Денежную сторону непрерывного запуска моделей можно сверить с реальной стоимостью ИИ в видеопродуктах; урок про бюджет там – денежный близнец урока про задержку здесь.

Во время встречи (вживую)После встречи (батч)
Бюджет времениМеньше ~1 секунды на оборотМинуты – часов нет
Что работаетРасшифровка, поиск, короткие подсказкиПолный итог, письмо, записи в CRM
Размер моделиМаленькая и быстраяБольшая и тщательная
Если говоритДолжен уложиться в черту ~1 сНе относится – это текст, читают потом
Сбой при путаницеКопилот лагает и перебиваетНет – это правильное место для тяжёлой работы
Рисунок 4. Бюджет задержки говорящего копилота. Трёхшаговый каскад выходит около 1200 мс – за чертой ~1000 мс, где люди начинают говорить поверх агента. Единая speech-to-speech-модель влезает в бюджет; молчаливый копилот убирает часы совсем.

Память – почему копилот обязан помнить

Копилот, который забывает всё между встречами, – это инструмент расшифровки, а не агент. Разница – память, и копилоту встречи нужны все четыре вида, которые мы назвали в уроке про примитивы агента.

Его рабочая память – это встреча, идущая прямо сейчас: бегущая расшифровка, принятые решения, ещё открытые вопросы – и она живёт в окне контекста модели на длину звонка. Его семантическая память – стоячее знание, нужное встрече: кто этот клиент, что он купил, стадия сделки в CRM, факты о продукте в доках. Его эпизодическая память – запись прошлых встреч с теми же людьми («в прошлый звонок они спорили по цене; квота, что мы прислали, была $48 000»), чтобы копилот входил уже зная историю. Его процедурная память – это playbook: стоячая рутина, которой копилот следует, скажем, для звонка-дискавери в продажах против звонка поддержки против проектного стендапа. Первые две делают копилот компетентным внутри одной встречи; вторые две – то, что заставляет его чувствоваться так, будто он ведёт этот аккаунт уже месяцами.

Эпизодическую память команды пропускают чаще всего, и пропуск – причина, по которой столько инструментов для встреч ощущаются беспамятными: каждый звонок начинается с нуля, и человеку приходится заново объяснять контекст, который инструмент уже должен бы держать. Копилот, который зачитывает «в ваших последних двух звонках открытым был вопрос про security review – он закрыт?», делает ровно то, что сделал бы толковый человек-ассистент: помнит отношения, а не только встречу.

Самое сложное – что закон не позволит копилоту

Видеоконференции – место, где инженерия агентов в лоб встречается с законом о приватности, ведь копилот слушает, как люди говорят, а во многих местах записывать людей без их разрешения нельзя. Ошибиться здесь – не мелкий баг. Есть три границы, которые надо уважать, и грамотный дизайн проходит все три по построению, а не на удачу.

Первая граница – согласие на запись. В США федеральный закон позволяет одной стороне разговора согласиться на его запись, но одиннадцать штатов – включая Калифорнию, Флориду, Иллинойс, Пенсильванию и Вашингтон – требуют согласия каждого участника. Калифорнийский закон о вторжении в приватность (CIPA, Penal Code §§ 631 и 632) – строгий шаблон, и его штрафы реальны: $5 000 за нарушение или тройной размер фактического ущерба. Подвох, удивляющий инженеров, в том, что простое появление бота-записи в списке участников не считается ни одним судом достаточным согласием – молчание не есть согласие. В 2026 году это не теория: консолидированный иск In re Otter.ai в Северном округе Калифорнии, со слушанием по ходатайству об отклонении 20 мая 2026 года, упирается ровно в этот вопрос – записывал ли notetaker людей, которые так и не дали согласия. Безопасный дизайн просит ясного, утвердительного согласия у всех до начала записи и логирует его.

Вторая граница – правила платформ, которые в начале 2026 года резко затянули как раз из-за проблемы согласия. В марте 2026 года Google Meet начал помечать сторонние боты-notetaker'ы как потенциальный риск и по умолчанию отказывать им во входе; в том же месяце уведомление Microsoft MC1251206 объявило, что Teams будет помечать внешние боты встреч как «Unverified» в лобби и требовать, чтобы организатор впускал их явно, с выходом в общую доступность к середине 2026 года. Инженерное следствие конкретно: эпоха тихого захода на звонок необъявленным ботом закрывается. Долговечный путь – строить на официальных медиа-интерфейсах платформы (как Read.ai запустился на Google Meet Media API в марте 2026 года) или поместить копилот внутрь собственного конференц-приложения, где вы прямо управляете согласием и раскрытием.

Третья граница – EU AI Act, и у него две части, касающиеся встреч. Правило прозрачности, Article 50, требует сообщать людям, что они взаимодействуют с ИИ-системой, и отдельно требует информировать всякого, кто подвергается системе распознавания эмоций; эти обязанности применяются с 2 августа 2026 года. Куда более острое правило – Article 5, который запрещает ИИ, выводящий эмоции людей на рабочем месте, с узкими исключениями только для медицинских целей или безопасности; этот запрет уже в силе с февраля 2025 года и несёт штрафы до €35 млн или 7% мирового оборота. Для копилота встречи это рисует яркую черту. Расшифровать сказанное, достать факт и записать задачи – обычная, разрешённая помощь. Оценивать, насколько участники вовлечены, напряжены или убеждены, по их лицам или голосам («клиент звучал раздражённо», «этот сотрудник выглядит незаинтересованным») – это распознавание эмоций на рабочем месте, и в ЕС оно исключено. Ту же биометрическую границу подробно проводит урок про распознавание лиц и EU AI Act; копилоту стоит уважать её по дизайну, оставаясь на уровне что было сказано и решено, а не что люди чувствовали.

Над всеми тремя границами стоит дизайн-принцип, который облегчает их соблюдение: агент предлагает, человек решает. Копилот набрасывает письмо, но отправляет человек; предлагает задачу, но назначает человек; показывает ответ, но выбрать его – дело человека. Так человек остаётся ответственным за каждое значимое действие – а это ровно то, чего хотят и регуляторы, и клиенты, – и поэтому каждый рисунок этого урока заканчивается шагом утверждения, а не автоматическим.

Что делает копилотКакое правило применяетсяПрактический дизайн
Записывает звонокСогласие всех в 11 штатах США; бот в списке ≠ согласиеСпросить всех, получить явное «да», залогировать
Заходит на встречуКонтроль ботов платформами (Google Meet, Teams, 2026)Официальные медиа-API или своё приложение
Сообщает, что он ИИEU AI Act Article 50 (прозрачность, с 2 авг 2026)Раскрыть ИИ и запись с самого начала
Читает эмоции участниковEU AI Act Article 5 – на рабочем месте запрещеноНе строить это; оставаться на словах и решениях
Отправляет, назначает, обновляетУбирает человеческий надзорВсегда через утверждение человеком

Один разбор встречи, от начала до конца

Свяжем части одним звонком с продаж. Копилот заходит, и первое, что он делает, – раскрывает себя и просит всех участников согласиться на запись; он не начинает слушать, пока они не согласятся. Получив согласие, живой транскрайбер работает непрерывно, помечая каждого говорящего. Копилот достаёт историю аккаунта из эпизодической памяти: два прошлых звонка, открытый вопрос по security review, квота $48 000, присланная в Q3. На десятой минуте клиент говорит: «у вас цена выше, чем у другого вендора, которого мы смотрим». Копилот планирует один полезный шаг, вызывает ретривер за утверждённой заметкой по работе с возражениями и сравнением ценности и показывает их продавцу одному – не вслух, не клиенту. Он не комментирует, звучал ли клиент раздражённо; это было бы распознавание эмоций, и оно не построено. Ближе к концу кто-то говорит: «пришлём обновлённое предложение к четвергу». Писатель задач ловит это как задачу – исполнитель: продавец, срок: четверг – и держит её. Звонок заканчивается. Теперь полоса после встречи работает без часов: писатель итогов готовит резюме, письмо-follow-up и обновление CRM, двигающее сделку в «предложение отправлено», и показывает все три продавцу, который правит и утверждает их. Сработал каждый примитив; живая работа осталась внутри бюджета в одну секунду; согласие взято; ни одна эмоция не оценена; и человек нажал каждую кнопку, что коснулась настоящей системы.

Купить, собрать или обернуть

У вас три честных варианта, и правильный зависит от того, насколько эта функция центральна для вашего продукта. Можно купить готовый копилот – включить Microsoft 365 Copilot, Zoom AI Companion или notetaker в стиле Otter, – это быстрее всего и верно, когда копилот – удобство, а не ваш продукт. Можно обернуть: положить real-time-агента в собственное конференц-приложение через фреймворк вроде агентов LiveKit, которых мы разбираем в уроке про ИИ-ассистента встреч на LiveKit, сохранив свой видео-стек и управляя согласием, раскрытием и тем, какие инструменты агент может вызывать. Или можно собрать конвейер из примитивов этого раздела – streaming ASR, ретривер, LLM, TTS, фреймворк агента из урока про фреймворки – это верно, когда поведение копилота и есть ваш продукт, как у специализированного коуча продаж или клинического скрайба. Большинству команд стоит начать с покупки или обёртки, чтобы понять, с чем пользователи реально хотят помощи, и собирать самим только те части, которые готовые копилоты делают плохо для их домена.

Где здесь Фора Софт

Мы делаем видеопродукты в видеоконференциях, WebRTC-приложениях реального времени, телемедицине, онлайн-обучении, стриминге, OTT, видеонаблюдении и AR/VR, и копилот встречи лежит ровно в конференц- и real-time-работе, которую мы поставляем. Когда клиент хочет копилот внутри собственных звонков, наша дизайн-дисциплина – та, что в этом уроке: уважать часы в одну секунду, держа живую работу маленькой и оставляя тяжёлую на после звонка, давать агенту небольшой острый набор инструментов, брать согласие до того, как слушать, раскрывать ИИ и ставить человека на каждое действие, что покидает комнату. Мы держим копилот на уровне того, что было сказано и решено, а не того, что чувствовали участники, чтобы продукт проходил яркие черты EU AI Act по дизайну, а не по настройке. Тот же скелет служит скрайбу приёма в телемедицине или ассистенту учебной сессии в e-learning без пересборки агента под каждую вертикаль.

Ключевые выводы

  • Агент-копилот действует во время и после звонка; notetaker только отчитывается потом.
  • Это цикл агента плюс пояс из шести инструментов: расшифровать, достать, поймать задачи, записать в системы, ответить, резюмировать.
  • У говорящего копилота меньше секунды на оборот – делите живую работу и работу после встречи.
  • Эпизодическая память даёт копилоту входить, зная отношения, а не только встречу.
  • Берите согласие всех на запись; бот в списке участников – не согласие.
  • В ЕС читать эмоции сотрудников запрещено – оставайтесь на сказанном и решённом.
  • Агент предлагает, человек решает – каждую отправку, назначение и обновление через утверждение.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.