Содержание статьи +
- Кратко
- Почему это важно
- Единственное, что реально разделяет эти инструменты
- Работа, которую все они делают, за 30 секунд
- Паттерн 1 – Собственный ИИ платформы
- Паттерн 2 – Облачный бот встречи
- Паттерн 3 – Desktop-приложение без бота
- Паттерн 4 – Build-it инфраструктурный API
- От звука к действию: стек, общий для всех
- Миф о точности, с цифрами
- Сколько эти инструменты реально стоят
- Что таблицы фич умалчивают: согласие и закон
- Как выбрать – короткий путь решения
- Где здесь Фора Софт
- Главные выводы
- Что почитать дальше
Кратко
Все инструменты ИИ-транскрипции встреч делают одно и то же – превращают разговор в звонке в текст с возможностью поиска и короткое резюме, – но сильнее всего различаются в том, как они забирают звук, и именно этот выбор определяет их отношение к приватности, их цену и то, можно ли вообще встроить их внутрь вашего собственного продукта. На рынке есть четыре способа захвата: собственный ИИ самой платформы для звонков, облачный «бот», который входит в звонок как видимый участник, desktop-приложение без бота, которое пишет звук прямо с вашего компьютера, и инфраструктурный API, на котором вы строите, когда транскрипция должна жить внутри вашего софта. Точность больше не отличает лидеров – на чистом звуке все они дают около 90–97% правильных слов, – поэтому настоящее решение про согласие, развёртывание и интеграции, а не про проценты. Эта статья – карта: она объясняет каждый паттерн простыми словами, показывает, где на самом деле лежат деньги и юридический риск, и подсказывает, какой паттерн выбрать – покупаете ли вы инструмент для команды или встраиваете транскрипцию в видеопродукт.
Почему это важно
Транскрипция встреч перестала быть новинкой и стала рынком: объём сегмента ИИ-заметок составлял около $623 млн в 2025 году и переваливает примерно за $740 млн в 2026-м, внутри более широкого рынка ИИ-ассистентов встреч, который растёт примерно на 26% в год. Если вы ведёте продуктовую команду, отдел продаж или видеоплатформу, на ваш стол ложатся два вопроса – «какой ноутейкер взять за стандарт?» и всё чаще «не построить ли это внутри нашего приложения вместо оплаты за каждое место?». Эта статья отвечает на оба, давая единую модель – четыре паттерна захвата и одно правило приватности, – чтобы продакт-менеджер выбрал инструмент, не утонув в таблицах фич, а инженер увидел, где именно проходит граница «купить или построить». Статья продолжает серию про LiveKit в этом разделе: ранние уроки показывают, как построить агента-транскрипцию, а этот отступает на шаг и показывает весь рынок вокруг неё.
Единственное, что реально разделяет эти инструменты
Откройте любую подборку «лучших ноутейкеров» – и получите стену галочек: резюме, пункты действий, синхронизация с CRM, метки говорящих, чат-со-встречей. Почти у всех есть почти всё. Таблица фич – не то место, где живёт настоящее решение.
Решение живёт на слой ниже, в вопросе, который большинство гайдов пропускает: как инструмент вообще получает звук? Этот единственный архитектурный выбор – назовём его паттерном захвата – определяет три вещи, которые вас действительно волнуют. Он решает, видят ли остальные участники встречи, что идёт запись, – это вопрос приватности и доверия. Он решает, сколько и как вы платите, потому что у инструмента, работающего на вашем ноутбуке, совсем другая структура расходов, чем у того, что держит сервер на каждый звонок. И он решает, сможет ли инструмент когда-нибудь жить внутри продукта, который вы строите, или только стоять рядом со встречами отдельным приложением.
Поэтому статья выстроена вокруг захвата, а не фич. Как только вы знаете четыре паттерна, любой продукт из любой подборки укладывается в один из них, и правильный выбор под вашу ситуацию становится очевидным.
Работа, которую все они делают, за 30 секунд
Перед паттернами – про саму работу. Каждый инструмент здесь проходит три одинаковых шага, и их названия делают остальную часть статьи понятной.
Первый – захват: вытащить произнесённый звук из встречи и завести его в софт. Этот шаг различается сильнее всего, и он – главная тема статьи.
Второй – распознавание речи: превратить звук в текст. Технический термин – automatic speech recognition, обычно сокращают до ASR. Сегодня это уже достаточно товарная вещь; одна и та же горстка движков (мы разбираем их в уроке про потоковый ASR) лежит почти под каждым продуктом на рынке – именно поэтому точность их больше не разделяет.
Третий – понимание: два слоя поверх сырого текста. Один слой – диаризация, неуклюжее слово, которое просто означает разметку, кто произнёс какую строку, чтобы транскрипт читался «Мария: …» и «Сэм: …», а не одной нерасчленённой стеной слов. Другой слой – резюме: языковая модель читает весь транскрипт и пишет несколько абзацев пересказа плюс список действий. Когда гайд говорит «ИИ-резюме встречи» (ai meeting summary), он имеет в виду именно этот слой – модель пишет текст поверх транскрипта, а не отдельное волшебство.
Держите эти три шага в голове. Четыре паттерна ниже – это, по сути, четыре разных ответа на первый шаг.
Паттерн 1 – Собственный ИИ платформы
Самый простой паттерн – использовать транскрипцию, которая уже встроена в ваше приложение для звонков. У Zoom есть AI Companion (и личная функция заметок My Notes). У Microsoft Teams – Copilot с «интеллектуальным итогом» (intelligent recap). У Google Meet – «Take notes for me» на модели Gemini. Вы включаете это во встрече, и оно даёт живые субтитры во время звонка плюс резюме после.
Плюсы очевидны: ничего не нужно ставить, участникам нечего одобрять, а транскрипт делает та же компания, что и так держит звук встречи, – то есть третьей стороны в цепочке нет. Для команды, которая полностью живёт внутри одной платформы, это часто правильный ответ, и он не стоит ничего сверх тарифа, который вы, возможно, уже платите.
Ограничения тоже ясны. Встроенный ИИ привязан к платформе: ноутейкер Zoom помогает вам в Zoom и больше нигде, так что команда, которая за неделю встречается в Zoom, Teams и Google Meet, получает три разных формата транскриптов в трёх разных местах, без единого поискового архива по всем. Хорошие функции обычно спрятаны за более дорогим тарифом. А поскольку всё невидимо и привязано к аккаунту хоста, часто вы не можете вытащить транскрипт в свои собственные системы без ручного экспорта.
Одна практическая оговорка про время, потому что она удивляет людей. Живые субтитры идут в реальном времени, но аккуратный транскрипт и резюме из облачной записи – не мгновенны. На пути облачной записи Zoom готовый транскрипт обычно появляется примерно за вдвое большее время, чем длилась встреча: 30-минутный звонок может занять около часа до готовности транскрипта. Если ваш сценарий предполагает, что резюме падает в ту же секунду, как кончился звонок, проверьте это допущение, прежде чем на нём строить.
Паттерн 2 – Облачный бот встречи
Это паттерн, который большинство представляет, услышав «ИИ-ноутейкер», и именно его по умолчанию используют Otter, Fireflies и Fathom. Программа – «бот» – входит в вашу встречу, как будто это ещё один участник. Она появляется в списке участников с именем вроде «Fireflies.ai Notetaker», подключается к звуку и видео звонка так же, как это сделал бы браузер человека, и стримит этот звук в облачный сервис, который транскрибирует и резюмирует.
Как бот «входит» в звонок, куда его не звали как человека? Под капотом бот – это обычно headless-браузер, то есть настоящий веб-браузер, запущенный на сервере без экрана, который открывает ссылку встречи и подключается по WebRTC – той же технологии реального времени для звука и видео, что использует ваш браузер для видеозвонков. Для встречи это выглядит как ещё один гость, выключивший камеру. Поэтому бот может одинаково входить в Zoom, Teams и Google Meet: он просто заводит браузер в каждый из них.
Сила этого паттерна – охват и удобство. Один инструмент покрывает все платформы, он авто-подключается из календаря, так что вы никогда не забудете его запустить, а поскольку тяжёлая работа идёт в облаке, неважно, мощный у вас ноутбук или дешёвый телефон. Именно поэтому боты доминировали на раннем рынке.
Слабость – сам бот. Он видимый – все видят «Notetaker» в списке участников, и в чувствительных разговорах это присутствие меняет, как люди говорят. Хуже того, видимость – это не то же самое, что юридическое согласие (об этом ниже). Итог в 2026 году – то, что отрасль теперь открыто называет «усталостью от ботов»: измеримый откат, когда клиенты отказываются встречаться с ботом в комнате, а корпоративные IT-команды начинают прямо запрещать сторонние авто-подключатели. Приватность сегодня – самый часто называемый барьер для внедрения в этой категории.
Паттерн 3 – Desktop-приложение без бота
Реакция на усталость от ботов породила третий паттерн, и это самый быстрорастущий угол рынка. Инструмент без бота – самый известный Granola, рядом с приложениями вроде Jamie – ставится как нативное приложение на ваш компьютер (Mac, Windows, иногда мобильный). Вместо того чтобы входить в звонок, он снимает звук, который ваш компьютер и так обрабатывает: звук из ваших динамиков (все остальные), смешанный со звуком вашего микрофона (вы). Захват идёт на уровне звука операционной системы, на вашей машине, и в саму встречу ничего не входит.
Поскольку показывать некого, нет объявления «Notetaker присоединился», нет имени в списке и нет одобрения в зале ожидания. А поскольку он снимает звук самого устройства, а не подключение конкретного приложения, он работает со всем: Zoom, Teams, Google Meet, Slack-хадл, звонок в браузере, даже телефон на громкой связи рядом с ноутбуком. Если звук выходит из компьютера, приложение его транскрибирует.
Компромиссы реальны, и о них стоит сказать прямо, потому что privacy-маркетинг их обычно пропускает. Приложение нужно поставить и держать запущенным на машине каждого, так что оно снимает вашу версию встречи, а не чистый серверный поток, – один инструмент на пользователя, а не один бот на звонок. Многие инструменты без бота намеренно вообще не хранят аудиозапись (Granola, например, выбрасывает звук после распознавания и не даёт воспроизведения), что отлично для приватности, но означает, что переслушать звонок позже нечего. И у нативных desktop-приложений есть пробелы по платформам: на 2026 год некоторые, включая Granola, выходят для macOS, Windows и iOS, но не для Android, что исключает их для части команд.
Тонкость, которую покупатели упускают: «без бота» – про видимость, а не про согласие. Запись человека без видимого бота не делает запись законной там, где закон требует согласия всех. «Без бота» убирает социальное трение от бота в комнате; оно не убирает вашу юридическую обязанность раскрыть запись и получить согласие.
Паттерн 4 – Build-it инфраструктурный API
Первые три паттерна – продукты, которые вы покупаете. Четвёртый – для команд, которым транскрипция нужна внутри продукта, который они выпускают: платформа продаж, показывающая резюме звонков на своём дашборде; телемед-приложение, пишущее заметку приёма; рекрутинговый инструмент, фиксирующий интервью. Для них платить за место отдельному ноутейкеру – не та задача; задача в том, чтобы транскрипты попадали в их собственный софт.
Сделать это можно двумя способами, и они ложатся на те же варианты захвата, что и выше.
Первый – арендовать слой захвата у инфраструктурного провайдера. Recall.ai здесь доминирует: он даёт единый API, который отправляет бота встречи (или запускает desktop-рекордер без бота) в Zoom, Teams, Google Meet, Webex и другие, и возвращает вашему продукту звук, видео и транскрипт. Вам никогда не нужно держать флот headless-браузеров самому. На 2026 год его цена pay-as-you-go – $0,50 за час записанной встречи, что для bot API, что для desktop SDK, плюс встроенная транскрипция за дополнительные $0,15 за час записи, бесплатная интеграция с календарём и без месячной платы за платформу. Конкуренты в этой нише – MeetingBaaS, Skribby, Nylas Notetaker и open-source Attendee.
Второй способ – построить захват самому внутри своего стека реального времени; это уместно, когда встреча и есть ваш продукт, например конференц- или телемед-приложение, которое вы уже держите на WebRTC. Здесь бот для входа извне не нужен, потому что ваш сервер уже в звонке. Можно распознавать централизованно на медиа-сервере и рассылать субтитры всем (паттерн ASR fan-out на стороне SFU), запустить агента LiveKit молчаливым участником, который выдаёт результат ноутейкера, или вовсе протолкнуть распознавание в браузер. Это отдельные уроки; здесь суть в том, что у «построить» две двери – арендовать внешний API захвата или расширить пайплайн, которым вы уже владеете.
От звука к действию: стек, общий для всех
Какой бы паттерн ни захватывал звук, шаги после захвата одинаковы по всему рынку. Если увидеть их как один пайплайн, легче читать список фич любого продукта и понимать, на каком этапе живёт каждая фича.
Поток такой: захват, затем ASR превращает звук в сырые слова, затем диаризация привязывает имя говорящего к каждой строке, затем языковая модель пишет резюме и вытаскивает действия, затем интеграции отправляют результат в инструменты, которыми команда уже пользуется, – CRM вроде Salesforce или HubSpot, документы вроде Notion, чат вроде Slack. Точность транскрипта целиком решается на первых двух технических этапах. Всё, за что вендор берёт наценку – гладкое резюме, синхронизация с CRM, аналитика разговоров, – лежит на последних двух этапах, и именно поэтому лидеры так похожи по точности и так различны по цене.
Миф о точности, с цифрами
Вендоры рекламируют «точность 99%». Относитесь к этому, как к «до» в любой рекламе. Вот обоснованные цифры из бенчмарков 2026 года.
Профессиональный человек-транскрибатор по чистому звуку ошибается примерно на 1–2%. Стандартный способ мерить ошибки транскрипции – word error rate, или WER: посчитать слова, которые машина переврала – заменила, вставила или удалила, – и поделить на число реально произнесённых слов. Если из 100 слов вернулось 5 неверных, это 5 ÷ 100 = 0,05, то есть WER 5%, что вольно называют «точностью 95%». Меньше WER – лучше.
На чистом звуке – по одному говорящему за раз, хорошие микрофоны, носители английского – лучшие ИИ-движки попадают в диапазон WER 4–10%, то есть 90–96% точности. На грязных реальных звонках – перебивания, фоновый шум, акценты, плохая телефонная связь – вся отрасль кучкуется около 90–97% и дальше деградирует. Честный итог: на хорошем звонке любой ведущий инструмент примерно так же точен, как любой другой, и ни один не сравнится с внимательным человеком на трудном звонке.
Диаризация – разметка «кто что сказал» – труднее самих слов и ошибается чаще. Независимое тестирование 2026 года ставит точность атрибуции говорящего около 91% у Otter и в середину 90-х у лучших, причём главный фактор – делают ли говорящие короткую паузу между репликами, а не говорят ли друг через друга. Если ваш сценарий зависит от идеальных меток говорящих – допрос, многосторонние переговоры, – считайте, что будете править их руками, и прочитайте наши уроки про пословные тайм-коды WhisperX и диаризацию Pyannote, прежде чем доверять автоматическому выводу.
«Частая ошибка: выбирать по цифре точности на главной странице. Поскольку каждый ведущий инструмент в нескольких пунктах от любого другого на чистом звуке, рекламируемая точность – наименее полезная база для решения. Гораздо важнее на практике две вещи: как инструмент справляется с вашими условиями звука (сильные акценты, конкретный язык, трое на одной громкой связи) и какой паттерн захвата подходит под ваши требования к приватности и развёртыванию. Пилотируйте на своих реальных встречах – не на демо-клипе вендора – и судите по резюме и меткам говорящих, а не по проценту слов.»
Сколько эти инструменты реально стоят
Ценники кучкуются в узкой полосе, а бесплатные тарифы различаются сильнее платных. Таблица ниже – срез 2026 года по четырём самым сравниваемым инструментам плюс build-it вариант; проверьте текущие цифры перед коммитом, потому что эта категория перепрайсивается часто.
| Инструмент | Паттерн захвата | Бесплатный тариф | Платный старт (год) | Заметное ограничение |
|---|---|---|---|---|
| Otter | Облачный бот | 300 мин/мес, 30 мин на звонок | $8,33/польз./мес (Pro) | ~4 языка; лимиты по минутам |
| Fireflies | Облачный бот | 800 мин общего хранилища | $10/польз./мес (Pro) | CRM-синк нужен Business ($19) |
| Fathom | Облачный бот | Безлимит записи, 5 ИИ-резюме/мес | ~$15/польз./мес (Premium) | CRM-синк нужен Team Edition |
| Granola | Desktop без бота | Бесплатно навсегда, ограниченная история | $14/польз./мес (Business) | Нет Android; нет воспроизведения |
| Recall.ai | Build-it API | Пробные кредиты | $0,50/час записи | По потреблению; продукт строите вы |
Читайте таблицу по тому, как вы платите, а не только сколько. Инструменты с оплатой за место (Otter, Fireflies, Fathom, Granola) стоят фиксированную сумму с человека в месяц – это предсказуемо и дёшево для команды, которая встречается умеренно, но дорого на большую организацию, где многие почти не пользуются. Вариант по потреблению (Recall.ai) ничего не стоит в простое и масштабируется с записанными часами – это подходит продукту, который транскрибирует только тогда, когда его пользователи реально проводят звонки.
Вот арифметика «купить или построить» в конкретике. Допустим, вы строите инструмент для продаж, и ваши клиенты вместе проводят 10 000 часов записанных звонков в месяц. На инфраструктуре Recall.ai это 10 000 × ($0,50 захват + $0,15 транскрипция) = 10 000 × $0,65 = $6 500 в месяц на захват и транскрипцию, поверх чего вы добавляете свою модель резюме и хранилище. Победит ли это оплату за место – зависит целиком от того, сколько мест представляют эти 10 000 часов, и именно поэтому числа надо считать, а не угадывать. Полная модель расходов – в уроке про реальную стоимость ИИ в видеопродуктах.
Что таблицы фич умалчивают: согласие и закон
Здесь решение про инструмент тихо становится юридическим, и здесь 2026 год изменил картину. Считайте следующее инженерно-важным контекстом, а не юридической консультацией, – конкретику сверяйте с квалифицированным юристом под вашу юрисдикцию.
В США закон о согласии на запись делится по штатам. В 39 штатах плюс округ Колумбия действует согласие одной стороны: если вы в разговоре, вы можете его записывать. В 11 штатах – включая Калифорнию, Иллинойс и Пенсильванию – действует согласие всех сторон, то есть каждый участник должен согласиться до того, как запись станет законной. По GDPR в ЕС вам нужно правовое основание и ясное, информированное согласие на захват чьего-то голоса. Ключевой момент, на котором команды попадаются: видимый бот в списке участников сам по себе не является юридическим согласием. Ни одна крупная юрисдикция не считает «они могли видеть Notetaker» тем информированным согласием, которого требует закон. Захват без бота ещё тише, и это делает обязанность раскрытия важнее, а не наоборот.
Два новых риска заслуживают флага. Первое – биометрия: шаг распознавания говорящего, питающий диаризацию, строит «голосовой отпечаток» (voiceprint), и в юридическом анализе 2026 года этот отпечаток всё чаще трактуется как защищённый биометрический идентификатор по законам вроде иллинойсского BIPA – то есть привычная функция «кто что сказал» может включать обязанность явного opt-in. Второе – судебные иски идут: коллективные иски конца 2025 года – Brewer v. Otter.ai в Калифорнии и Cruz v. Fireflies.ИИ в Иллинойсе – утверждают ровно эти провалы: что боты перехватывали коммуникации и собирали биометрические голосовые данные без согласия всех сторон. Каким бы ни был исход, они сделали корпоративных юристов осторожнее и во многом объясняют, почему паттерны без бота и self-hosted растут.
Если вы строите транскрипцию в продукт, закладывайте согласие с самого начала: раскрывайте присутствие ИИ до того, как он включится, фиксируйте согласие и давайте реальную возможность отказаться – та же дисциплина раскрытия, что в уроке про EU AI Act и инженерию раскрытия. Обязанность прозрачности из статьи 50 EU AI Act делает это продуктовым требованием в ЕС, а не любезностью.
Как выбрать – короткий путь решения
Уберите списки фич, и выбор сводится к нескольким вопросам по порядку.
Должна ли транскрипция жить внутри софта, который вы выпускаете? Если да – вы строите, и выбор между арендой API захвата вроде Recall.ai и расширением пайплайна реального времени, которым вы уже владеете. Если нет – вы покупаете, и тогда: все ли встречи проходят на одной платформе? Если да – собственный ИИ платформы самый дешёвый и простой ответ. Если вы встречаетесь на нескольких платформах, спросите, чувствительна ли обстановка к приватности или клиенты не любят ботов: если да – desktop-приложение без бота держит вас невидимым; если нет – облачный бот даёт самый широкий охват и самые богатые интеграции. Каким бы ни был путь, проверьте закон о согласии для штатов и стран, где работаете, прежде чем что-либо включать.
Где здесь Фора Софт
Мы строим видеопродукты, внутри которых живут эти функции транскрипции, – конференц-платформы, телемед-приложения, e-learning, OTT, – поэтому встречаемся с решением «купить или построить» с инженерной стороны регулярно. Когда транскрипции достаточно стоять рядом со встречами клиента, мы помогаем выбрать правильный паттерн и интегрировать его. Когда она должна жить внутри продукта – заметка телемед-приёма, сгенерированная на самой платформе; живые субтитры, разосланные каждому зрителю вебинара; резюме продаж, отрисованное на собственном дашборде клиента, – мы строим это на пайплайне реального времени WebRTC, так что захват нативен приложению, а не прикручен внешним ботом, с согласием и раскрытием, заложенными с первого спринта. Паттерны из этого урока – те же, что мы взвешиваем с клиентами, когда они спрашивают, купить ноутейкер или владеть функцией.
Главные выводы
- Инструменты различаются прежде всего паттерном захвата, а не фичами; этот выбор задаёт приватность, цену и пригодность для продукта.
- Четыре паттерна: нативный ИИ платформы, облачный бот, desktop-приложение без бота, build-it инфраструктурный API.
- На чистом звуке любой ведущий инструмент даёт ~90–97% точности; цифра с главной страницы – слабейший критерий выбора.
- Облачные боты видимы и удобны; приложения без бота невидимы, но локальны и по одному на пользователя.
- Видимый бот – не юридическое согласие; действуют штаты с согласием всех сторон, GDPR и биометрия голосовых отпечатков.
- Строить внутри продукта можно арендой API захвата или расширением своего WebRTC-пайплайна.