Otter, Fireflies, Fathom, Supernormal – Разбор Meeting-Ботов

Автор: Николай СапуновОбновлено: август 202619 мин чтения
Содержание статьи +

Кратко

Otter, Fireflies, Fathom и Supernormal на страницах с фичами выглядят почти одинаково, но под капотом делают разные инженерные ставки: как бот заходит в звонок, как он слышит каждого говорящего и как превращает звук в резюме. Бот, которого вы видите в списке участников, – это обычно настоящий веб-браузер на сервере без экрана: он открывает ссылку на встречу и подключается по той же реал-тайм-технологии, что и ваш браузер, а затем шлёт звук в сервис распознавания. Трое из четырёх различаются в основном бизнес-моделью и слоем поверх этой общей механики; Supernormal – исключение, потому что позволяет вообще обойтись без бота и писать звук прямо на вашем устройстве. Этот урок разбирает каждый продукт на части, показывает, что на самом деле делает его бот, и описывает три конкретных способа встроить ту же возможность в продукт, который вы выпускаете, – арендовать API захвата, использовать новый нативный стриминговый API платформы или расширить реал-тайм-пайплайн, которым вы уже владеете.

Почему это важно

Если вы выбираете инструмент для заметок по встречам, маркетинговые страницы не скажут вам, что вы на самом деле покупаете, потому что у всех продуктов один и тот же список фич – резюме, пункты действий, синхронизация с CRM, чат-со-встречей. Важное решение – архитектурное, и с прайс-листа его не видно. Если же вы строите софт – платформу продаж, телемед-приложение, рекрутинговый продукт, – насущнее вопрос: продолжать платить этим инструментам за каждое место или встроить транскрипцию внутрь своего продукта; у этого выбора есть понятная цена и инженерная форма, как только вы поймёте, как устроены боты. Этот урок – инженерное продолжение нашего обзора ландшафта транскрипции встреч: обзорный урок раскладывает весь рынок на четыре паттерна, а этот вскрывает четыре самых популярных в поиске бота и пути их сборки. Он написан так, чтобы продакт-лид прошёл каждый шаг, а старший инженер при этом доверял каждому утверждению.

Анатомия, общая для любого meeting-бота

Прежде чем разбирать четыре продукта, полезно увидеть конвейер, который запускают они все, – различия имеют смысл только на фоне общего устройства. Meeting-бот делает по порядку пять вещей, и их названия держат остальной урок предметным.

Сначала он входит во встречу. Большинство ботов делают это как человек: программа открывает ссылку на встречу в веб-браузере и жмёт «присоединиться». Подвох в том, что у браузера нет экрана, мыши и человека – это так называемый headless-браузер, настоящий браузерный движок на сервере, которым управляет код, а не руки. Для встречи это выглядит как ещё один гость, выключивший камеру; поэтому один и тот же бот заходит в Zoom, Google Meet и Microsoft Teams без отдельной доработки под каждый.

Во-вторых, он захватывает звук. Оказавшись в звонке, бот получает микрофонный звук всех участников по WebRTC – реал-тайм-технологии передачи аудио и видео, которую браузеры используют для видеозвонков и которую стандартизировал W3C. Полезная деталь: WebRTC помечает звук каждого человека идентификатором потока, поэтому хорошо собранный бот может отделять «это говорит Мария» от «это говорит Сэм», а не получать одну смешанную дорожку. Именно это разделение по дикторам делает возможными точные метки говорящих дальше.

В-третьих, он запускает распознавание речи – шаг, превращающий звук в сырой текст. Технический термин – automatic speech recognition, или ASR. Сегодня это уже товар: под большинством продуктов на рынке сидит одна и та же горстка движков, и именно поэтому ни один из этих четырёх не выигрывает по голой точности. Сами движки мы разбираем в уроке про потоковый ASR.

В-четвёртых, он добавляет понимание – два слоя поверх текста. Один слой – диаризация, неуклюжее слово, которое просто означает разметку «кто что сказал». Другой – резюме: большая языковая модель читает весь транскрипт и пишет пересказ плюс список задач. Когда страница продукта говорит «ИИ-резюме встречи», имеется в виду этот слой.

В-пятых, он доставляет результат – отправляет транскрипт, резюме и задачи в инструменты, которыми ваша команда уже пользуется (CRM вроде Salesforce или HubSpot, доки вроде Notion, чат вроде Slack), а для «строящихся» продуктов ещё и шлёт webhook – автоматическое сообщение, которое говорит вашему софту: «встреча закончилась, вот данные».

Рисунок 1. Пять стадий, которые проходит любой meeting-бот. Четыре продукта из этого урока почти точь-в-точь совпадают на стадиях со второй по четвёртую; различаются они в том, как входят (стадия один) и как упаковывают и продают результат (стадия пять).

Держите эти пять стадий в голове. Каждый продукт ниже – это разный набор решений про одни и те же пять шагов.

Otter – собственный движок речи, теперь в суде

Otter – гигант категории по поисковому спросу и самый вертикально интегрированный из четырёх. Там, где большинство ноутейкеров арендуют распознавание речи у внешнего провайдера, Otter построил собственный ASR-движок, обучил его на большом корпусе аудио, собранном за годы, и соединил со своим слоем обработки естественного языка для резюме и ассистентом «OtterPilot». На практике это значит, что Otter владеет большей частью пятистадийного конвейера, чем конкуренты, – захват, распознавание и понимание у него в основном собственный код, а не тонкая обёртка над чужим API.

Механически Otter следует стандартному паттерну бота: автозаходит на встречи из подключённого календаря в Zoom, Google Meet и Microsoft Teams, расшифровывает в реальном времени с живыми метками говорящих и таймкодами, захватывает показанные слайды и выдаёт резюме после звонка. Его реал-тайм-режим – настоящая сила: транскрипт прокручивается, пока люди говорят, а не появляется только после звонка.

Цены Otter в 2026 году имеют четыре уровня. Basic бесплатен с 300 минутами расшифровки в месяц и лимитом 90 минут на разговор. Pro стоит $16.99 в месяц или $8.33 в месяц при оплате за год вперёд и поднимает лимит до 1 200 минут в месяц. Business – $20 за пользователя в месяц при годовой оплате (или $30 помесячно), снимает лимит на встречу, разрешает расшифровывать до трёх встреч одновременно и добавляет командные рабочие пространства и админ-контроль. Enterprise – по индивидуальной цене, и это единственный уровень, открывающий доступ к API, единый вход (SSO), аттестацию безопасности SOC 2 и OtterPilot for Sales. Закономерность, которую стоит заметить: важная для разработчика возможность – доступ к API – сидит за самой дорогой дверью.

Otter ведёт этот урок не только из-за размера. В 2026 году он стал юридическим тестом для всей категории. Коллективный иск Brewer v. Otter.ai (Северный округ Калифорнии, подан в августе 2025) утверждает, что бот Otter заходит на встречи и записывает людей, которые на это не соглашались, и что его шаг распознавания говорящего строит голосовые отпечатки без согласия. Четыре связанных иска объединили в октябре 2025 года (консолидированное дело In re Otter.AI Privacy Litigation, 5:25-cv-06911, под судьёй Eumi K. Lee), и претензии опираются на федеральный закон о прослушке (ECPA), калифорнийский Invasion of Privacy Act и иллинойсский Biometric Information Privacy Act. Чем бы дело ни кончилось, оно уже изменило то, как предприятия оценивают каждого бота из этого урока, – поэтому раздел про согласие ниже не сноска, а ключевая инженерная забота.

Fireflies – ассистент сверху и проблема голосового отпечатка

Fireflies делает противоположную Otter ставку на интеграцию: вместо того чтобы владеть движком речи, он сосредотачивает инженерные силы на слоях над транскрипцией – разговорном ассистенте по имени Fred (вы спрашиваете свои встречи через «AskFred»), аналитике разговоров вроде долей времени речи и глубокой автоматизации рабочих процессов в CRM. Его бот, который появляется в списке участников как «Fireflies.ai Notetaker», заходит на те же платформы и ведёт себя как стандартный headless-браузерный паттерн.

Две инженерные детали делают Fireflies особенным. Первая – его модель ИИ-кредитов. Простая расшифровка и письма с пересказом безлимитны на платных уровнях, но более ценные ИИ-действия – запросы AskFred, кастомные резюме, автозаполнение CRM, функции Sales Assist и Voice Agent – расходуют пул кредитов. Free и Pro включают одноразовый пул около 20 кредитов, Business – 30, Enterprise – 50, доступны докупаемые наборы. Покупателю это важно, потому что заголовочное «безлимитно» относится к расшифровке, а не к ИИ-функциям, ради которых люди и берут инструмент. Строителю это полезный урок про учёт: дешёвый, ставший товаром шаг (расшифровка) включён в пакет, а дорогой шаг (инференс LLM) тарифицируется.

Вторая деталь – та, что сейчас тянет за собой иск. Функция Fireflies «Speaker Recognition», которая и даёт чистые метки по дикторам, работает, строя голосовой отпечаток – математический слепок голоса человека. В декабре 2025 года иск Cruz v. Fireflies.AI был подан в Иллинойсе (3:25-cv-03399, Северный округ Иллинойса) от имени человека, который никогда не был клиентом Fireflies: она вошла на встречу, где хост включил бота, и иск утверждает, что бот сгенерировал её голосовой отпечаток без согласия, нарушив иллинойсский закон о биометрической приватности. Механизм, на который нацелен иск, – диаризация через голосовой отпечаток – это тот же механизм, на который опирается почти каждый продукт из этого урока. Это и есть самый важный инженерный вывод всей статьи, и мы вернёмся к нему ниже.

Цены Fireflies в 2026 году: Free ($0, с 800 минутами хранения и пулом из 20 кредитов), Pro по $10 за пользователя в месяц при годовой оплате ($18 помесячно) с безлимитной расшифровкой и 8 000 минут хранения на место, Business по $19 с синхронизацией CRM и аналитикой разговоров и Enterprise по $39. Интеграции с CRM, которые нужны большинству команд, – Salesforce, HubSpot – начинаются с уровня Pro.

Fathom – «сначала бесплатно» как инженерная и ростовая стратегия

Определяющий выбор Fathom – его бизнес-модель, и этот выбор формирует его инженерию. Там, где Otter и Fireflies тарифицируют минуты на бесплатных уровнях, Fathom отдаёт безлимитную запись и хранение навсегда и вместо этого ограничивает ИИ-слой: бесплатный план разрешает лишь пять ИИ-резюме в месяц. Запись и транскрипт бесплатны; платите вы за понимание.

Это сознательная инверсия структуры затрат. Захват и хранение дёшевы и дешевеют дальше; ИИ-резюме стоят реальных денег за звонок, потому что каждое – это запрос на инференс к большой модели. Отдавая дешёвую часть и беря деньги за дорогую, Fathom набирает пользователей почти с нулевой предельной стоимостью и монетизирует только ценное действие. Premium стоит $19 в месяц (около $15 при годовой оплате) за безлимитные резюме, задачи и письма-фоллоуапы; Team Edition добавляет админ-контроль, общие клипы и аналитику от $29 в месяц (около $19 годовых), выше идёт Team Edition Pro; уровень Business около $25 за пользователя добавляет синхронизацию CRM.

Функционально Fathom заходит в Zoom, Google Meet и Teams как бот, записывает и расшифровывает, затем предлагает чат над встречей в стиле ChatGPT и более пятнадцати шаблонов резюме под конкретные процессы – среди них фреймворки продаж вроде BANT и Sandler. Его интеграции покрывают Slack, Salesforce, HubSpot, Notion и Asana. Для строителя Fathom – самый ясный кейс урока про то, что транскрипт – это товар, а резюме – это продукт, – ровно тот раздел, который мы моделируем в уроке про реальную стоимость ИИ в видеопродуктах.

Supernormal – тот, что умеет обходиться без бота

Supernormal – архитектурное исключение и «золотой» ключ этого урока: высокий интент, низкая конкуренция. Его отличительный инженерный выбор – гибкость захвата: вместо того чтобы пихать бота в каждый звонок, он предлагает три режима – обычный meeting-бот, расширение для Chrome и desktop-приложение без бота, которое пишет собственный звук компьютера, не появляясь в списке участников. Последний режим – это паттерн «без бота», который мы разбираем в обзорном уроке, и наличие всех трёх позволяет клиенту выбирать видимость под встречу, а не под продукт.

На слое понимания Supernormal запускает гибрид фронтирной модели (GPT-4o) и собственных проприетарных моделей, чтобы выдавать резюме – под брендом «The Gist», – и это типичный паттерн 2026 года: сильная общая модель для гладкости, меньшие внутренние модели для дешёвой повторяющейся классификации. В 2026 году Supernormal ещё и перепозиционировался из «записывалки встреч» в «ИИ-агента для агентств», используя транскрипт встречи как контекст, чтобы делать работу – собирать презентации, таблицы и исследовательские отчёты из обсуждённого, – плюс функция Memory, переносящая контекст между встречами с одними и теми же людьми.

Его цены – самые доступные из четырёх: Free покрывает 15 встреч в месяц, Starter – $16 в месяц, Pro – $25 в месяц, Enterprise – по запросу (примерно $40 за пользователя), со скидкой около 20% при годовой оплате. По комплаенсу он силён для своего размера – сертификат SOC 2, соответствие HIPAA с доступным Business Associate Agreement и согласованность с GDPR, – что делает его достоверным выбором для здравоохранения и других регулируемых сфер, где более крупные имена требуют корпоративного контракта, чтобы дать то же самое.

Четыре продукта рядом

Таблица ниже – срез на 2026 год. Читайте её по архитектуре и модели, а не по галочкам фич, которые почти идентичны у всех четырёх. Проверяйте актуальные цифры перед решением – категория переоценивается часто.

ПродуктСпрос (KD)Метод захватаСтавка на движок речиСигнатурный слойПлатный вход (год)Заметный инженерный факт
Otterotter ai 141K (KD 67)Облачный бот, реал-таймСвой ASROtterPilot, живой транскрипт$8.33/польз./мес (Pro)API только на Enterprise; главный ответчик в иске о прослушке 2026
Firefliesfireflies ai 21K (KD 49)Облачный ботСторонний ASR + свои слоиAskFred + учёт ИИ-кредитов$10/польз./мес (Pro)Диаризация по голосовому отпечатку в центре иллинойсского иска BIPA
Fathomfathom ai 11K (KD 42)Облачный ботСторонний ASRБеспл. безлимитная запись, платные резюме~$15/польз./мес (Premium)Инвертирует модель затрат: отдаёт захват, берёт за ИИ
Supernormalsupernormal ai 200 (KD 9)Бот или без бота или расширениеGPT-4o + проприетарный гибридАгентский вывод + Memory$16/мес (Starter)Единственный из четырёх, кто умеет захват без бота

Бросаются в глаза две закономерности. Первая: поисковый спрос и инженерная глубина не связаны – у Otter в 700 раз больше объёма поиска, чем у Supernormal, но именно Supernormal единственный с гибкостью захвата и самой низкой сложностью ранжирования. Вторая: реальные различия – на двух концах конвейера: как они захватывают (стадия один) и как упаковывают и тарифицируют результат (стадия пять), – ровно как предсказывал Рисунок 1.

Как встроить это в свой продукт

Вот вопрос, который реально окупается. Если вы выпускаете софт, где происходят встречи, – инструмент продаж, телемед-платформу, рекрутинговый продукт, – вы можете перестать платить за каждое место и положить транскрипцию внутрь своего приложения. Есть три инженерных пути, и они предсказуемо разменивают контроль на усилия.

Рисунок 2. Три пути сборки. Выбирайте по тому, где живёт встреча: на чужой платформе, которую надо посетить (арендуйте API бота или используйте её нативный стрим), или внутри вашего приложения (расширьте пайплайн, который вы уже запускаете).

Путь первый – арендовать API захвата. Самый быстрый маршрут – вообще не строить бота. Инфраструктурный провайдер вроде Recall.ai даёт один API, который отправляет meeting-бота (или desktop-записывалку без бота) в Zoom, Teams, Google Meet, Webex и другие и возвращает вашему продукту звук, видео и транскрипт через webhook. Вы не держите парк headless-браузеров, не возитесь с особенностями каждой платформы и не гоняетесь за их изменениями интерфейса. На 2026 год Recall.ai берёт $0.50 за час записи как для API бота, так и для desktop-SDK – снижено с $0.70 ранее в году – плюс $0.15 за час встроенной расшифровки, с бесплатной интеграцией календаря и без ежемесячной платы за платформу.

Вот этот расчёт предметно. Допустим, пользователи вашего продукта суммарно проводят 8 000 часов записанных звонков в месяц. Захват: 8 000 × $0.50 = $4 000. Добавьте расшифровку: 8 000 × $0.15 = $1 200. Ваш месячный счёт за захват и расшифровку – $4 000 + $1 200 = $5 200, поверх чего вы добавляете стоимость своей модели резюме и хранения. Побьёт ли это инструменты «за место», полностью зависит от того, сколько мест представляют эти 8 000 часов, – а это и есть причина считать, а не гадать.

Путь второй – использовать нативный стриминговый API платформы. В 2026 году платформы встреч начали предлагать более чистую альтернативу ботам. Zoom Real-Time Media Streams (RTMS) теперь общедоступен: он гонит живой звук, видео и транскрипт прямо в ваше приложение без лишнего участника в звонке и с доставкой за миллисекунды. Google Meet Media API даёт такой же нативный доступ к реал-тайм-потокам по WebRTC. Подвох – привязка к платформе и контроль: RTMS только для Zoom и работает, лишь когда организация хоста его включила; Meet API только для Google и пока в превью-доступе; а у Microsoft Teams нет прямого аналога – его реал-тайм-медиаплатформа ждёт media-ботов с собственным хостингом, написанных на C#/.NET. Так что нативный API – это вариант с минимальной задержкой и без бота для одной платформы, но вам всё равно нужен запасной путь (обычно арендованный бот) для платформ без него.

Путь третий – расширить реал-тайм-пайплайн, которым вы уже владеете. Если встреча и есть ваш продукт – конференц- или телемед-приложение, которое вы уже запускаете на WebRTC, – вам не нужен бот, заходящий снаружи, потому что ваш медиасервер уже в звонке. Можно расшифровывать централизованно на сервере и раздавать субтитры всем (паттерн ASR на стороне SFU), запустить LiveKit-агента как молчаливого участника, который выдаёт тот же результат ноутейкера, что продают эти продукты, или вынести распознавание до самого браузера. У этого пути нет платы за встречу и полный контроль над данными, но он применим, только когда звонок ваш.

Выбор между тремя – не про то, какой «лучше», а про то, где живёт встреча. Если ваши пользователи встречаются на платформах, которыми вы не владеете, – арендуете API бота (и при желании докладываете нативные API там, где они есть). Если встреча происходит внутри вашего приложения – расширяете свой пайплайн. Большинству продуктов, которым нужно широкое покрытие, разумно начать с аренды, а затем добавлять нативные API и свой пайплайн по мере того, как объём оправдывает инженерные затраты.

Слой согласия – это инженерное требование, а не юридическая запоздалость

Каждый путь сборки выше делит одно обязательство, которое иски 2026 года превратили из «было бы неплохо» в «блокер релиза». Воспринимайте дальнейшее как инженерно-релевантный контекст, а не юридический совет – конкретику сверьте с квалифицированным юристом для вашей юрисдикции.

Сталкиваются два факта. Первый: закон о согласии на запись в США делится по штатам – 39 штатов плюс округ Колумбия допускают согласие одной стороны (если вы в разговоре, можете записывать), но 11 – включая Калифорнию, Иллинойс и Пенсильванию – требуют согласия всех сторон. По европейскому GDPR вам нужны законное основание и информированное согласие, чтобы вообще захватывать чей-то голос. Второй, и его-то инженеры упускают: функция диаризации, дающая чистые метки говорящих, работает, строя голосовой отпечаток, а голосовой отпечаток всё чаще считается защищённым биометрическим идентификатором – ровно та теория, что стоит за иллинойсскими исками против Otter и Fireflies. Функция, делающая ваш транскрипт читабельным, – это та же функция, что создаёт юридический риск.

«Частая ошибка: считать, что видимый бот – это согласие. Бот с именем «Notetaker» в списке участников сам по себе не является тем информированным согласием, которого требует закон, – ни одна крупная юрисдикция не считает «они же видели» согласием. А режим захвата без бота тише, но не безопаснее: убирая видимого участника, вы убираете социальный сигнал, но увеличиваете свою обязанность раскрытия, а не уменьшаете её. Если вы строите любой из трёх путей выше, согласие надо проектировать с первого спринта: раскрывайте ИИ до того, как он включится, фиксируйте явное согласие (особенно в штатах с согласием всех сторон и для любого шага с голосовым отпечатком/диаризацией), давайте участникам реальную возможность отказаться и ведите график хранения и удаления. Статья 50 EU AI Act делает раскрытие до начала работы жёстким продуктовым требованием в ЕС. Это та же дисциплина раскрытия, которую мы разбираем в уроке про EU AI Act и инженерию раскрытия.»
Рисунок 3. Согласие – это не один шлагбаум на старте: оно привязано к конкретным шагам жизненного цикла бота, и шаг с голосовым отпечатком (диаризация) – тот, что сейчас в суде.

Где здесь Фора Софт

Мы строим видеопродукты, внутри которых живут эти функции транскрипции, – конференц-платформы, телемед-приложения, инструменты для e-learning и системы видеонаблюдения, – поэтому регулярно встречаем решение «купить или построить» с инженерной стороны. Когда клиенту нужны только заметки рядом со встречами, мы помогаем выбрать инструмент и аккуратно его интегрировать. Когда транскрипция должна жить внутри продукта – заметка по телемед-приёму, сгенерированная на самой платформе, живые субтитры, раздаваемые каждому зрителю вебинара, резюме продаж, отрисованное на дашборде клиента, – мы строим её на реал-тайм-пайплайне WebRTC, чтобы захват был нативной частью приложения, а не прикрученным снаружи ботом, с согласием, раскрытием и графиком удаления, заложенными с первого спринта. Три пути сборки из этого урока – те же, что мы взвешиваем с клиентами, когда они решают: продолжать арендовать ноутейкер или владеть возможностью самим.

Главное

  • Все четыре бота проходят пять стадий; различаются они в том, как входят и как тарифицируют результат.
  • Otter владеет своим движком речи; Fireflies, Fathom и Supernormal различаются над транскрипцией.
  • Модель «бесплатная безлимитная запись» у Fathom отражает: захват дёшев, а ИИ-резюме – реальная статья затрат.
  • Supernormal – единственный из четырёх, кто умеет захват без бота в звонке.
  • Постройте сами тремя способами: арендуйте API захвата, используйте нативный стрим платформы или расширьте свой пайплайн.
  • Диаризация строит голосовой отпечаток; этот биометрический шаг – центр исков 2026 года, поэтому проектируйте согласие.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.