Содержание статьи +
- Кратко
- Почему это важно
- Сначала: что такое LiveKit
- LiveKit в 2026: компания и новости
- Что такое «ИИ-ассистент встреч»
- Как ИИ-агент входит во встречу: архитектура диспатча
- Внутри агента: речевой конвейер
- Как именно строить ассистента встреч
- Цены LiveKit в 2026: как устроена модель
- Разбор на цифрах: сколько на самом деле стоит ИИ-ноутейкер
- Строить на LiveKit или купить готовый сервис?
- Где здесь Фора Софт
- Главное
- Что почитать дальше
Кратко
LiveKit – это open-source софт, который переносит живое аудио и видео между людьми, а его фреймворк Agents позволяет посадить в звонок ИИ-участника, который слушает, расшифровывает, резюмирует и при необходимости говорит. ИИ-ассистент встреч на нём работает так: в комнату диспатчится небольшая программа, которая входит в звонок ровно как человек, подписывается на аудио всех участников и крутит цикл speech-to-text → языковая модель → text-to-speech. LiveKit Cloud тарифицирует это слоями – бесплатный уровень Build, уровень Ship за $50/мес и Scale за $500/мес, – отдельно считая минуты подключения, минуты ИИ-агента и трафик, тогда как open-source сервер остаётся бесплатным для self-host. Эта статья объясняет архитектуру простыми словами, проходит реальные цены 2026 года с арифметикой и показывает, когда строить на LiveKit, а когда купить готовый сервис.
Почему это важно
Если вы продакт-менеджер, основатель или техлид и думаете, добавить ли в продукт ИИ-ноутейкер, копилот встреч или голосового агента, LiveKit – первое имя, которое вы услышите: на нём работает голосовой режим ChatGPT от OpenAI и четверть звонков 911 в США, а в начале 2026 года компания привлекла деньги по оценке в миллиард долларов. Эта популярность делает LiveKit лёгким для внедрения и лёгким для ошибки в оценке. Архитектура решает, что ассистент умеет, а цены – окупается ли функция на масштабе. Эта статья даёт и то и другое – языком, который не предполагает, что вы хоть раз писали код на WebRTC, – чтобы решение «build или buy» вы приняли до того, как вложитесь, а не после.
Сначала: что такое LiveKit
LiveKit – это три вещи под одним именем, и путаница между ними – первая ошибка. Если их развести, всё остальное становится ясным.
Первое – медиасервер с открытым кодом. Медиасервер – это программа в середине группового звонка, которая раздаёт аудио и видео каждого всем остальным. Сервер LiveKit бесплатный, опубликован под разрешительной лицензией Apache 2.0, написан на языке Go, и его можно запустить самому на одной машине, в Docker или в кластере. Технически это Selective Forwarding Unit, коротко SFU, – маршрутизатор, который получает поток каждого участника один раз и пересылает копии остальным, не смешивая их. Почему SFU – стандартная форма для групповых звонков, мы разбираем в сравнении video SDK и WebRTC AI; здесь важно одно – это бесплатное открытое ядро.
Второе – фреймворк Agents. Это отдельный open-source инструментарий, тоже бесплатный, который позволяет написать программу – «агента», – входящую в комнату LiveKit и ведущую себя как участник, только это софт. Фреймворк берёт на себя тяжёлую real-time-инженерию, чтобы ваш код думал лишь о том, что агенту слышать, обдумывать и говорить. Именно эта часть превращает обычный звонок в звонок с ИИ внутри.
Третье – LiveKit Cloud. Это платная хостинговая версия сервера, которую держит сама компания, чтобы вам не пришлось эксплуатировать инфраструктуру. Вы пишете тот же код, но глобальную сеть медиасерверов за ним держит LiveKit и берёт деньги за использование. Cloud – это опция: сервер и фреймворк Agents полностью открыты и работают на вашей инфраструктуре без лицензионных платежей.
Всё это построено на WebRTC. WebRTC, сокращение от Web Real-Time Communication, – открытый стандарт, позволяющий браузерам и приложениям обмениваться аудио, видео и данными с очень малой задержкой. Он достиг финальной вехи, когда World Wide Web Consortium – орган, стандартизирующий веб, – опубликовал WebRTC как полную Recommendation 13 марта 2025 года. Все продукты в этой статье говорят на этом общем языке; различается лишь то, какую его часть каждый отдаёт вам.
LiveKit в 2026: компания и новости
Поскольку «livekit news» – одно из самых частых, что ищут перед внедрением, вот текущая картина с датой, чтобы вы оценили её свежесть.
LiveKit основан в 2021 году Рассом д'Са, ранним инженером Twitter, и Дэвидом Чжао, бывшим директором по инженерии в Motorola. Они запустили его как open-source-проект на волне пандемийного всплеска видеозвонков; компания базируется в Сан-Хосе, Калифорния. Бесплатный сервер достиг версии 1.0 в мае 2022 года, и бизнес вырос поверх него.
Главная новость – финансирование и охват. 22 января 2026 года LiveKit объявил раунд Series C на $100 млн по оценке в $1 млрд, который возглавил Index Ventures при участии прежних инвесторов Altimeter, Hanabi Capital и Redpoint Ventures. Это случилось примерно через десять месяцев после Series B на $45 млн в апреле 2025-го. Инвесторов держит список клиентов: на LiveKit работает голосовой режим ChatGPT от OpenAI, а среди прочих пользователей – xAI, Salesforce, Tesla, Spotify, Meta, Microsoft и Character AI. По оценке самой компании, это real-time-основа примерно для четверти экстренных звонков 911 в США. На open-source-стороне репозиторий ядра набрал около 19 000 звёзд на GitHub, а фреймворк Agents – около 10 800, при заявленных более 100 000 разработчиков на платформе.
Практический вывод для покупателя: LiveKit больше не ставка на маленький проект. Это инфраструктурный слой по умолчанию, на котором уже работает заметная доля индустрии голосового ИИ, – это снижает риск строить на нём и повышает ценность понимания, как он устроен.
Что такое «ИИ-ассистент встреч»
ИИ-ассистент встреч – это программа, которая участвует в живом звонке ради полезной работы вокруг него: записать всё сказанное, понять, кто что сказал, составить резюме, выписать задачи, ответить на вопрос, а в некоторых сценариях – говорить вслух. Его же называют ИИ-ноутейкером, когда его работа – в основном расшифровка и резюме, или копилотом встреч, когда он может действовать во время звонка.
Важна простая модель в голове. Ассистент – не фича, прикрученная к экрану одного человека; это дополнительный участник. Когда вы планируете звонок и «ноутейкер подключается», технически происходит вот что: программа подключается к той же комнате, что и люди, слушает общее аудио и выдаёт результат текстом, записью или речью. Написали вы эту программу сами или арендовали – это и есть вопрос «build или buy», которым статья заканчивается. В любом случае форма одна: участник, сделанный из кода.
Эта рамка объясняет и силу, и пределы. Раз ассистент – настоящий участник, он слышит каждого с тем же качеством, что и человек. Но раз он участник, он потребляет те же ресурсы подключения, что и человек, и – как покажет раздел о ценах – вы платите за его время в комнате так же, как за время всех остальных.
Как ИИ-агент входит во встречу: архитектура диспатча
Первый настоящий архитектурный вопрос – как программа оказывается именно в этом звонке. В LiveKit это называется диспатч (dispatch) – процесс назначения агента в комнату. Один проход по нему снимает большую часть загадки.
Начнём с деталей. Комната – это один звонок, именованное пространство, к которому подключаются участники. Участник – любой, кто подключён к комнате, человек или агент. Сам агент работает внутри агент-сервера – долгоживущего процесса, который LiveKit называет AgentServer; он простаивает в ожидании работы и запускает свежего агента под каждый звонок, которому он нужен. Важно: агент каждого звонка работает в отдельном процессе операционной системы, поэтому падение одного агента не уронит других на той же машине.
Когда звонку нужен ассистент, агент-сервер запускает задание (job). Точка старта этого задания – функция в вашем коде под названием entrypoint; считайте её парадной дверью, которую фреймворк открывает, чтобы передать управление вам, – почти как веб-сервер передаёт запрос обработчику. Внутри entrypoint ваш код подключается к комнате, подписывается на аудиодорожки участников (дорожка, track, – один поток медиа, например микрофон одного человека) и начинает работу. Задание живёт, пока все не выйдут из комнаты или пока вы его не остановите.
Способов запустить диспатч три, и разница важна для продукта встреч. Явный (explicit) диспатч – рекомендуемый вариант по умолчанию: ваш бэкенд просит LiveKit отправить агента в конкретную комнату и может приложить данные под задание – например, какая это встреча или кто ведущий – в виде метаданных. Диспатч по токену встраивается в токен доступа, который пользователь и так предъявляет при входе: вы указываете агента в токене, и когда первый человек создаёт комнату, агент диспатчится автоматически. Подвох в том, что диспатч по токену срабатывает только при первом создании комнаты; если комната уже существует, инструкция игнорируется. Автоматический диспатч шлёт агента в каждую новую комнату без исключений – LiveKit не советует это для большинства продуктов, так как это тратит ресурсы и не несёт метаданные.
LiveKit сообщает, что этот путь диспатча рассчитан на масштаб – обычно сотни тысяч новых подключений в секунду при времени постановки агента в комнату менее ~150 миллисекунд. Для продукта встреч это значит, что ассистент в комнате фактически в момент начала звонка, а не с заметным опозданием.
Внутри агента: речевой конвейер
Как только агент в комнате и слышит аудио, второй архитектурный вопрос – что с этим аудио происходит. Фреймворк Agents предлагает три внутренних устройства, и выбор между ними – самое весомое решение для того, как ассистент ощущается и сколько стоит.
Устройство по умолчанию называется конвейер STT-LLM-TTS, и это эстафета из трёх этапов. Аудио проходит их по порядку. Сначала speech-to-text – сокращённо STT, его же зовут автоматическим распознаванием речи или ASR – превращает произнесённые слова в текст; продакшен-варианты мы разбираем в глубоком обзоре потокового ASR. Затем большая языковая модель, или LLM – тот тип ИИ, что читает текст и пишет ответ, – генерирует реплику. Наконец, text-to-speech, или TTS, превращает этот ответ обратно в речь – тема нашего сравнения потокового TTS. У каждого этапа чистая граница, поэтому одну модель можно заменить на другую, не трогая остальные. Собственная рекомендация LiveKit: для большинства продакшен-агентов этот трёхэтапный конвейер – верный выбор по умолчанию.
Второе устройство – realtime-модель, иногда называемая speech-to-speech. Здесь одна модель – например, realtime-модель OpenAI или Gemini Live от Google – принимает аудио на вход и выдаёт аудио на выход напрямую, без отдельных текстовых этапов в середине. Это ощущается самым естественным и отзывчивым, потому что ничто не ждёт передачи между этапами; категорию мы исследуем в статье о speech-to-speech-моделях. У неё есть одна ловушка для продукта встреч, о ней – в выноске ниже.
Третье устройство – half-cascade: realtime-модель понимает входящую речь и выдаёт текстовый ответ, а отдельный этап text-to-speech его озвучивает. Это сочетает сильное «слушание» realtime-подхода с контролем конвейера на стороне вывода.
Вокруг всех трёх устройств стоят два меньших компонента. Детекция голосовой активности, или VAD, – лёгкая модель (LiveKit поставляет одну, Silero), которая просто решает, говорит ли кто-то прямо сейчас, – не даёт агенту тратить силы на тишину. А детекция конца реплики (turn detection) – трансформерная модель, оценивающая, действительно ли говорящий закончил мысль, а не просто сделал паузу, – не даёт ассистенту перебивать. Оба нужны, чтобы взаимодействие ощущалось человеческим. Заявленная цель LiveKit – держать сквозную задержку ответа под одной секундой, порог, ниже которого устный обмен ощущается естественным; полный бюджет разобран в нашей статье о задержке до 100 мс.
«Частая ловушка: команды, строящие ноутейкер, тянутся к realtime speech-to-speech-модели, потому что она звучит продвинутее всего, а потом обнаруживают, что она не отдаёт промежуточные транскрипты – текущий, слово за словом, текст, на котором держится функция субтитров или конспекта. Для ассистента, чья вся работа и есть транскрипт, это неверный дефолт. Либо используйте конвейер STT-LLM-TTS, дающий текст на первом этапе, либо добавьте отдельный STT-плагин рядом с realtime-моделью, чтобы слова всё-таки были. Выбирать архитектуру по тому, как впечатляюще она звучит, а не по тому, что нужно функции, – самая дорогая ранняя ошибка здесь.»
Как именно строить ассистента встреч
Общий конвейер – для агентов, которые ведут диалог. У ассистента встреч задача уже и полезнее, и строительные блоки LiveKit ложатся на неё напрямую.
Ядро – расшифровка всех, а не одного говорящего. Во фреймворке есть паттерн многопользовательского транскрайбера – агент, который выдаёт транскрипты от всех участников комнаты сразу, и это ровно хребет ноутейкера. Поскольку аудио каждого участника приходит отдельной дорожкой, ассистент расшифровывает их независимо и может приписывать реплики нужному человеку; объединение этого с распознаванием говорящих – задача диаризации диктора. Сами логи задания фиксируют транскрипт пользователя и данные детекции реплик в структурированном JSON, так что запись у вас есть без лишней обвязки.
Большинству ассистентов встреч стоит слушать, а не говорить. Фреймворк поддерживает конфигурацию «только слушать» и текстовый режим, где тот же код агента работает, ни разу не озвучивая, – просто потребляет аудио и выдаёт текст. Это делает ассистента ненавязчивым и, как покажут цены, дешевле, потому что полностью пропускает этап text-to-speech. Когда же вы хотите, чтобы ассистент отвечал вслух – копилот, которого можно посреди звонка спросить «что мы решили по бюджету?», – вы возвращаете этап TTS либо берёте realtime-модель в паре с отдельным транскрайбером.
Запись – отдельная задача со своим инструментом. LiveKit Egress – компонент, который записывает или ре-стримит комнату и может выгружать дорожку каждого участника по отдельности. Ноутейкер, которому нужно сохранить аудио или видео на потом – для комплаенса или чтобы переобработать встречу позже, – использует Egress, а не пытается захватить медиа внутри агента. Держать запись и живую расшифровку как разные задания чище и соответствует тому, как их считают цены.
Ещё два элемента дополняют настоящего ассистента. Вызов инструментов (tool calling) позволяет языковой модели совершать действия – создать запись в календаре, завести задачу, что-то найти, – когда разговор того требует, в том числе через Model Context Protocol, стандартизирующий доступ моделей к внешним инструментам. А если продукту нужно помечать недопустимый контент по ходу встречи, это место – проход модерации в реальном времени, а не встройка в ноутейкер.
Цены LiveKit в 2026: как устроена модель
Теперь вторая половина решения. Цены LiveKit Cloud на первый взгляд кажутся пёстрыми, потому что считают несколько вещей по отдельности, но в основе – несколько идей. Понять счётчики полезнее, чем заучить числа: числа меняются, всё ниже снято со страницы цен LiveKit 2 июня 2026 года и должно перепроверяться перед закупкой.
Опубликованных планов четыре. Build бесплатный, $0 в месяц и без карты. Ship – от $50 в месяц. Scale – от $500 в месяц. Enterprise – по индивидуальной цене. Каждый план включает квоту каждого считаемого ресурса, а сверх квоты берёт плату за перерасход.
Для ассистента встреч важны три счётчика. Первый – минуты WebRTC, время подключения каждого участника, человека или агента, на участника в минуту. Build включает 5 000 таких минут; Ship – 150 000, далее $0,0005 за минуту; Scale – 1,5 млн, далее $0,0004 за минуту. Второй счётчик – минуты сессии агента, время, которое ИИ-агент проводит в звонках, считается поверх времени подключения. Build включает 1 000 минут агента; Ship – 5 000, далее $0,01 за минуту; Scale – 50 000, далее $0,01 за минуту. Третий – исходящий трафик, отдаваемая участникам полоса, в гигабайтах. Build включает 50 ГБ; Ship – 250 ГБ, далее $0,12 за ГБ; Scale – 3 ТБ, далее $0,10 за ГБ.
Несколько лимитов определяют, какой план вам реально нужен. Одновременные сессии агентов – сколько звонков могут иметь ассистента в один момент – ограничены 5 на Build, 20 на Ship и до 600 на Scale. Одновременные подключения – 100, 1 000 и 5 000 по уровням. Так что выбор плана часто диктует число одновременных встреч, а не суммарные минуты.
И ещё – стоимость самих ИИ-моделей. Этапы speech-to-text, языковой модели и text-to-speech не бесплатны: их крутят провайдеры вроде Deepgram, OpenAI или Cartesia. LiveKit может брокерить их через функцию Inference и кладёт небольшую квоту кредитов в каждый план (около $2,50 кредитов на Build, $5 на Ship, $50 на Scale), а дальше вы платите поминутные тарифы моделей. Можно подключить и собственные аккаунты провайдеров. Так или иначе, стоимость моделей – отдельная статья поверх счётчиков подключения и агента.
Разбор на цифрах: сколько на самом деле стоит ИИ-ноутейкер
Числа делают модель конкретной. Допустим, ваш продукт держит ИИ-ноутейкер, который подключается к встречам средней по размеру клиентской базы. Заложим 2 000 встреч в месяц, каждая по 45 минут, каждая с пятью людьми плюс один агент.
Начнём с минут подключения, ведь каждый присутствующий – включая агента – оплачивается за время в комнате. Сначала сосчитаем присутствующих на встрече:
5 человек + 1 агент = 6 участников на встречуТеперь суммарное время подключения за месяц:
2 000 встреч
× 45 минут
× 6 участников
= 540 000 участнико-минут WebRTC / месяцДальше собственное время сессии агента, оно считается отдельно и только для агента:
2 000 встреч
× 45 минут
× 1 агент
= 90 000 минут сессии агента / месяцНа плане Scale обе величины укладываются во включённые квоты – 540 000 минут подключения меньше включённых 1,5 млн, а 90 000 минут агента превышают включённые 50 000, так что 40 000 минут идут по $0,01:
40 000 минут агента сверх квоты
× $0,01
= $400
+ $500 месячная база
= $900 / месяц до стоимости моделей и трафикаСтоимость моделей – то, о чём забывают, и обычно она доминирует. Ноутейкеру «только слушать» нужен speech-to-text, но не text-to-speech, поэтому возьмём типичный потоковый тариф STT около $0,006 за минуту аудио. Агент расшифровывает речь встречи 45 минут на звонок:
2 000 встреч
× 45 минут
× $0,006
= $540 / месяц на speech-to-textСложим – и ноутейкер выходит около $1 440 в месяц плюс трафик, а урок – в пропорциях, не в итоге. Минуты подключения внутри квоты Scale оказались фактически бесплатными; двигают счёт перерасход агента и поминутная стоимость модели. Поэтому ассистент «только слушать» без text-to-speech куда дешевле говорящего копилота: типичный тариф TTS $0,03 за минуту сам по себе добавил бы около $2 700 в месяц, почти утроив стоимость. Эту юнит-экономику по функциям мы разбираем в реальной стоимости ИИ в видеопродуктах.
LiveKit публикует свою поминутную иллюстрацию для другой формы агента – голосового агента телефонии, – и она делает слои видимыми: около $0,01 за сессию агента, $0,01 за телефонию, $0,0077 за языковую модель, $0,0058 за speech-to-text, $0,03 за text-to-speech и $0,01 за наблюдаемость, итого примерно $0,0735 за минуту. Ваши числа изменятся с моделями и тем, говорит ли агент, но структура – стопка отдельно считаемых слоёв – всегда одна.
Строить на LiveKit или купить готовый сервис?
LiveKit – это фреймворк, а не готовый продукт. В этом и сила, и причина притормозить перед выбором. Честное решение – три варианта, а не два.
Первый – строить на LiveKit Cloud. Вы пишете агента, LiveKit держит инфраструктуру, и вы получаете полный контроль над поведением ассистента – что он расшифровывает, как резюмирует, какие модели берёт, какие действия может совершать – платя по счётчикам выше. Это подходит командам, чей продукт и есть интеллект встреч, или тем, кому нужен ассистент, вшитый в уже контролируемое приложение.
Второй – self-host open-source-сервера и фреймворка Agents. Софт бесплатен под Apache 2.0, поэтому вы платите только за свои серверы и трафик, а ваше медиа не покидает инфраструктуру, которой вы управляете, – это важно для здравоохранения, обороны или строгих требований к месту хранения данных. Цена – операционная: вы сами эксплуатируете, масштабируете и защищаете медиасерверы. Это подходит командам с инфраструктурными мощностями и жёсткими требованиями приватности.
Третий – купить готовый сервис бота встреч и не строить вовсе. Сервисы вроде Recall.ai продают готового бота, который сам входит в Zoom, Google Meet или Teams и возвращает транскрипты и записи через API, по цене около $0,50 за час записи – без медиаинженерии с вашей стороны. Фреймворки вроде Pipecat от Daily или хостинговые платформы голосовых агентов вроде Vapi и Retell ИИ занимают середину между «строй сам» у LiveKit и готовым ботом. Размен обычный: чем готовее купленный продукт, тем дешевле старт и тем меньше вы можете изменить.
Правило решения то же, что управляет любым «build против buy» в real-time-видео. Если ассистент – товар широкого потребления («дайте пользователям транскрипт»), купить готового бота почти всегда быстрее и дешевле для запуска. Если ассистент и есть продукт или должен работать внутри медиа, которым вы владеете, строить на LiveKit (Cloud или self-host) даёт потолок для дифференциации. Решите, что из этого у вас, до сравнения цен, ведь самый дешёвый путь, который не может сделать нужное продукту, – самый дорогой выбор.
| Вариант | Что получаете | Форма цены, 2026 | Когда лучше |
|---|---|---|---|
| LiveKit Cloud | Полный контроль, хостинг | По счётчикам: WebRTC + мин. агента + трафик + тарифы моделей | Ассистент – ваш продукт |
| LiveKit self-host | Полный контроль, свои серверы | Бесплатный софт (Apache 2.0) + своя инфраструктура | Строгая приватность / место данных |
| Recall.ai (бот-SaaS) | Готовый бот в Zoom/Meet/Teams | ~$0,50 / час записи | Транскрипт – рядовая функция |
| Pipecat / Vapi / Retell | Фреймворки и платформы голосовых агентов | Плата платформы + тарифы моделей | Голосовые агенты, средний контроль |
Где здесь Фора Софт
Мы строим продукты живого видео с 2005 года – видеоконференции, e-learning, телемедицину и инструменты живой совместной работы, – и вопрос об ассистенте встреч теперь возникает почти на каждом проекте конференций и телемедицины, который мы оцениваем. Мы запускались на managed-платформах, когда важна была скорость, и на открытых фреймворках вроде LiveKit, когда ценностью продукта был ИИ внутри звонка, включая агентов, входящих как участники, чтобы расшифровывать и резюмировать. В телемедицине тот же паттерн становится ИИ-скрайбом, готовящим заметку приёма; в e-learning – конспектом занятия; в конференциях – ноутейкером, которого пользователи уже ждут. Работа, которая нам важна, – подобрать архитектуру и ценовой уровень под нужного ассистента, чтобы ноутейкер «только слушать» не строился – и не оплачивался – как говорящий копилот.
Главное
- LiveKit – это open-source WebRTC-сервер плюс фреймворк Agents плюс опциональный платный Cloud.
- ИИ-ассистент встреч – программа, диспатченная в звонок как дополнительный участник.
- Конвейер выбирают по нужде: трёхэтапный – для транскриптов, realtime – для естественной речи.
- Realtime speech-to-speech-модели пропускают промежуточные транскрипты – плохой дефолт для ноутейкера.
- Cloud считает минуты подключения, минуты агента и трафик отдельно, плюс стоимость моделей.
- Text-to-speech – самый тяжёлый слой цены; ноутейкер «только слушать» куда дешевле.