Разработка телемедицинских приложений – инженерный плейбук по ИИ-скрайбу

Автор: Николай СапуновОбновлено: август 202619 мин чтения
Содержание статьи +

Кратко

ИИ-скрайб (AI medical scribe) – это программа, которая слушает приём врача и пишет за него клиническую заметку, и именно она стала самой востребованной ИИ-функцией в разработке телемедицинских приложений, потому что выгорание у врачей вызывает не диагностика, а документация. Функции, которые покупатель называет по брендам – Freed, Abridge, Suki, Dragon Copilot от Nuance, Heidi, – все работают по одному и тому же конвейеру из четырёх стадий: захватить звук, расшифровать его, структурировать в заметку и отдать черновик врачу на проверку и подпись. Единственное правило, делающее всё это безопасным и законным, – модель пишет черновик, а подписывает врач: скрайб никогда ничего не сохраняет сам, и это удерживает его в статусе вспомогательного инструмента, а не регулируемого медицинского изделия, и оставляет медико-юридическую ответственность за человеком. Этот плейбук даёт продакту и инженеру одну общую карту: что такое ИИ-скрайб, почему видеовизит – самое удобное место его правильно построить, конвейер, ловушки точности, разбор «строить или покупать», математику затрат на один приём и ворота согласия и HIPAA, превращающие удобную функцию в юридическую обязанность.

Почему это важно

Рынок большой и быстро растёт: мировой рынок телемедицины составлял около $141 млрд в 2024 году и, по прогнозам, достигнет примерно $380 млрд к 2030-му, а более узкий рынок ИИ-инструментов клинической документации растёт ещё быстрее с меньшей базы. Если вы строите, ведёте или скоупите телемед-продукт – приложение видеовизитов, платформу консультаций со специалистами, сервис психотерапии или портал удалённого мониторинга, – пункт «добавить ИИ-скрайб» уже в дорожной карте, и за ним стоят реальные инженерные решения: встроить вендора, собрать своё на речевых и языковых API или построить из open-source-моделей; как держать точность; и чего требует закон до того, как записан хоть один приём. Этот плейбук отвечает на эти вопросы именно для вертикали телемедицины. Он написан так, чтобы продакт-менеджер спланировал функцию и её риск-профиль без медицинского или инженерного образования, а инженер увидел, где скрайб подключается к видеозвонку и где он может ошибиться. Более глубокие уроки этого раздела – пофункциональные руководства; это карта вертикали, подсказывающая, какой из них открыть.

Что такое ИИ-скрайб на самом деле

Медицинский скрайб в исходном смысле – это человек, который сидит в кабинете и пишет заметку о приёме, чтобы врач смотрел на пациента, а не на клавиатуру. ИИ-скрайб – его ещё называют ambient-скрайбом, потому что он слушает кабинет в фоне, – это программа, которая делает ту же работу: захватывает разговор, а затем готовит структурированную клиническую заметку, которую врач проверяет и утверждает.

Эта функция существует из-за цифры, которая годами не улучшается. На каждые восемь часов приёма пациентов врач первичного звена тратит дополнительно 5,3 часа в электронной медкарте – программной системе хранения карты пациента, по-английски EHR, – и около 2,1 из этих часов уходит на написание заметок. Многое утекает за пределы рабочего дня в то, что врачи называют «pajama time» – документацию, которую доделывают дома после ужина. На 2025 год примерно каждый пятый врач по-прежнему проводил в EHR более восьми часов в неделю вне рабочего времени – та же доля, что и в 2022-м.

Эта канцелярская нагрузка – один из главных драйверов выгорания, и именно против выгорания и продаётся ИИ-скрайб. В исследовании 2025 года, опубликованном в JAMA Network Open, наблюдали 263 врача из шести медсистем США, которые 30 дней пользовались ambient-скрайбом; доля сообщавших о выгорании упала с 51,9% до 38,8%, а шансы выгорания с инструментом были на 74% ниже. То же исследование отметило меньшую когнитивную нагрузку и меньше документации во внерабочее время и заключило, что ambient-ИИ масштабируем «по более низкой цене, чем человек-скрайб». Эта последняя фраза и есть бизнес-обоснование в пяти словах.

Внедрение шло за болью. К 2025 году ambient-скрайбом пользовались более 40 000 врачей в США – против менее 8 000 в 2022-м, то есть примерно пятикратный рост за три года. Когда функция растёт так быстро, её просят у каждого телемед-продукта.

Нюанс телемедицины: звук уже у вас в конвейере

Вот идея, связывающая «ИИ-скрайб» с «разработкой телемедицинских приложений», и именно её пропускает большинство обзоров скрайбов. В физической клинике ambient-скрайб трудно сделать хорошо: нужен микрофон в кабинете, и приходится бороться с дальним полем, двумя-тремя говорящими разом и шумом аппаратуры. Видеовизит даёт обратную ситуацию.

В телемед-приложении разговор уже идёт как чистый, цифровой, по-человечно разделённый звук через ваш real-time-конвейер – стек WebRTC, несущий звонок. Связь реального времени в вебе, сокращённо WebRTC, отправляет каждого участника отдельной медиадорожкой. Это значит, что голос врача и голос пациента приходят двумя отдельными потоками, каждый записан рядом с собственным микрофоном говорящего.

Из этого вытекают три полезных следствия. Во-первых, вы получаете почти студийный звук на человека вместо одной мутной записи комнаты – расшифровка точнее. Во-вторых, вы получаете диаризацию – задачу пометить, кто какие слова сказал, – почти даром, потому что каждый говорящий уже отдельная дорожка, а не голос, который софт должен различать постфактум. В-третьих, у вас уже есть естественное место, чтобы снять звук, и естественное место, чтобы спросить согласие: сам звонок. Серверный участник, присоединяющийся к сессии, или хук в вашем selective forwarding unit – медиасервере (SFU), который маршрутизирует потоки в групповом звонке, – может захватить ровно тот звук, который нужен скрайбу. Механика та же, что в уроке про ASR-fan-out на стороне SFU.

Практический вывод: телемед-продукт – самое удобное место правильно добавить ambient-скрайб, потому что вы не встраиваете микрофон в шумную комнату, а снимаете чистый поток, который у вас уже есть.

Конвейер из четырёх стадий, по которому работает любой скрайб

Уберите бренды – и Freed, Abridge, Suki, Dragon Copilot и Heidi работают по одной сборочной линии. Понимание четырёх стадий – это и есть то, что позволяет рассуждать о точности, цене и о том, какую стадию строить, а какую покупать.

Рисунок 1. Конвейер ИИ-скрайба из четырёх стадий. В телемед-приложении нулевая стадия почти бесплатна – звонок уже отдаёт чистый звук с разделением по говорящим.

Первая стадия – расшифровка. Автоматическое распознавание речи – технология, превращающая речь в текст, сокращённо ASR – превращает каждую аудиодорожку в текст с таймкодами. Медицинская расшифровка труднее обычной диктовки: система должна верно брать названия лекарств и дозы, раскрывать клинические сокращения, справляться с акцентами и разделять говорящих. Инженерия продакшн-распознавания речи – отдельная тема, разобранная в уроке про streaming ASR, а пометка говорящих – в уроке про диаризацию WhisperX и уроке про диаризацию Pyannote.

Вторая стадия – структурирование – превращение сырой расшифровки в клиническую заметку. Безопасный способ – делать это в два шага, а не в один. Сначала модель извлекает клинические факты – симптомы, находки, лекарства, план – и привязывает каждый к точному фрагменту расшифровки, откуда он взят. Затем языковая модель пишет заметку из этих извлечённых фактов, обычно в стандартный формат SOAP: Subjective (что сообщает пациент), Objective (что наблюдает врач), Assessment (диагноз) и Plan (дальнейшие шаги). Сначала извлекать, потом генерировать важно потому, что каждую строку готовой заметки можно проследить до реально сказанного. Почему этот порядок и есть разница между безопасным и небезопасным – ниже.

Третья стадия – проверка и подпись. Врач читает черновик, исправляет неверное и подписывает. Только тогда заметка становится частью медицинской карты, и только тогда она отправляется в EHR. Эта стадия – не формальность, прикрученная в конце, а несущая стена всей конструкции, о чём следующий раздел.

Единое правило для всего: модель пишет черновик, врач подписывает

В видеозвонке архитектуру определяет решение, где выполняется функция, потому что ограничивающий фактор – задержка. В OTT-каталоге это когда выполняется функция, потому что ограничитель – цена. В медицинском скрайбе ограничивающий фактор – доверие, и правило отсюда простое: модель пишет черновик, врач подписывает, и ничего не сохраняется автоматически.

Рисунок 2. Ворота подписи. Черновик – никогда не документ; документ – это подпись врача. Три следствия – ответственность, регуляторный статус и точность – держатся на этих воротах.

На этих воротах держатся три следствия, и потому они не любезность, а обязательное условие.

Первое – ответственность. Врач, подписавший заметку, владеет ею ровно так же, как владел бы заметкой, которую набрал сам. Ответственность за содержимое карты остаётся за лицензированным человеком, а не за моделью вендора. Проектируйте продукт так, чтобы подпись была осознанным действием, а не значением по умолчанию, мимо которого пролистывают.

Второе – регуляторный статус. Поскольку скрайб только помогает, а решает врач, большинство ИИ-скрайбов сегодня считают вспомогательными инструментами, а не медицинскими изделиями, и это держит их вне надзора FDA за изделиями. Этот статус условен, а не постоянен: как только скрайб начинает подсказывать диагнозы или лечение, а не записывать решённое, он сдвигается к статусу программы как медицинского изделия. Ворота подписи и аккуратная граница того, что модели вообще позволено утверждать, и удерживают инструмент на безопасной стороне этой черты.

Третье – точность, и его инженеры недооценивают. Шаг проверки – не показуха качества, а реальный контроль безопасности. Языковая модель время от времени напишет что-то гладкое и неверное, и единственная надёжная защита – человек, знающий пациента, который читает черновик до того, как он становится значимым. Всё ранее в конвейере – чистый звук по говорящим, «сначала извлечь, потом сгенерировать», прослеживаемое доказательство – существует, чтобы сделать эту проверку быстрой и достойной доверия, а не чтобы её заменить.

Проблема точности, под которую надо проектировать

Заметка, которая читается идеально и содержит лекарство, которое пациент не называл, опаснее очевидно неряшливой, потому что напрашивается на доверие, которого не заслужила. Важны два режима отказа, и телемед-продукт надо строить под оба.

Первый – галлюцинация на стадии расшифровки: модель придумывает слова, которые не были сказаны. Это не гипотеза. Исследование 2024 года, представленное на ACM Conference on Fairness, Accountability, and Transparency, прогнало клинический по характеру звук через широко используемую модель Whisper от OpenAI и нашло, что около 1% фрагментов содержали галлюцинированный текст – выдуманные предложения, а иногда придуманные названия лекарств или вредные фразы, которых никто не говорил. Whisper тогда использовали, по оценке, 30 000 врачей в 40 медсистемах – вот как 1% превращается в десятки тысяч испорченных расшифровок на масштабе. Исследователи отметили, что несколько других коммерческих движков такого поведения не показали, – напоминание, что выбор ASR-движка это решение по безопасности, а не просто сравнение цен.

Второй – собственные ошибки языковой модели на стадии структурирования: галлюцинации, но и пропуски, когда реальная и важная деталь теряется. Исследования LLM-сводок ставят общую долю ошибок в нижние единицы процентов; один анализ сообщил о 1,47% галлюцинаций наряду с 3,45% пропусков. Пропуски коварнее галлюцинаций, потому что на странице ничто не выглядит неверным – факта просто нет.

Инженерный ответ на оба – порядок «сначала извлечь, потом сгенерировать» со второй стадии. Когда модель сначала вытаскивает структурированные факты, привязанные к конкретным фрагментам расшифровки, и только затем пишет прозу из этих фактов, вы получаете сразу две защиты: заметку труднее выдумать, потому что она строится из извлечённого доказательства, а не из свободных ассоциаций, и каждую строку можно показать врачу вместе со словами, откуда она взята, – а это делает проверку быстрой, а не повторным прослушиванием.

«Частая ошибка: считать ИИ-заметку документом, а не черновиком. Демо, где заметка выходит чистой девяносто девять раз из ста, соблазняет команду сохранять её автоматически и сэкономить врачу клик. Тогда сотая заметка несёт неверную дозу или выдуманный симптом в настоящую карту, и удобная функция становится инцидентом безопасности пациента и юридическим риском. Решение структурное, а не дисклеймер: пусть в EHR попадает только подписанная заметка, пусть черновик зримо остаётся черновиком, показывайте исходный текст за каждой строкой и никогда не давайте системе сохранять самой. Спрашивайте о каждой функции скрайба: «может ли это попасть в карту без подписи человека?» – и если ответ «да», этот путь и есть баг.»

Инструменты, которые называет покупатель: Freed, Abridge, Suki, Dragon Copilot, Heidi

Продуктовые команды редко приходят с запросом «ambient-система документации». Они приходят с вопросом, как вы сравниваетесь с конкретным брендом. Чаще всего всплывают пять, и они чисто сортируются по тому, для кого сделаны.

Рисунок 3. Ландшафт ИИ-скрайбов, отсортированный по покупателю. Левый край самообслуживает отдельных врачей; правый продаёт глубокую интеграцию в EHR медсистемам.

Freed AI – имя, стоящее за поисковыми запросами. Основан в 2022 году, базируется в Сан-Франциско; Freed – это самообслуживаемый край рынка: врач регистрируется и за минуты начинает писать заметки без участия IT, заметка приходит через одну-две минуты после конца приёма, а врач проверяет её и копирует в свою EHR. Цены 2026 года – от примерно $39 в месяц за стартовый план с лимитом до около $79 за безлимитные заметки и около $104–$119 за тариф с отправкой в EHR и кодами для счетов. Он сделан для соло-практика и малой практики, и именно поэтому «freed ai» собирает порядка десятков тысяч запросов в месяц – отдельные врачи ищут для себя.

Abridge – корпоративный лидер. Продаётся крупным медсистемам и развёрнут в Kaiser Permanente, Mayo Clinic, Johns Hopkins, Duke Health и более чем двухстах других; одно только внедрение в Kaiser охватило десятки тысяч врачей. Инвесторы заметили: раунд Series E 2025 года оценил компанию в $5,3 млрд, и она дважды подряд названа Best in KLAS за ambient-AI. Где Freed оптимизирован под мгновенную индивидуальную настройку, Abridge оптимизирован под общесистемное развёртывание, заметки для выставления счетов и глубину интеграции.

Suki – специалист по интеграции в EHR. Позиционируется как ИИ-ассистент, а не просто скрайб; Suki предлагает двустороннюю интеграцию реального времени с основными EHR – Epic, Oracle Health (бывший Cerner), athenahealth и MEDITECH, – так что готовые заметки записываются обратно в карту без копипаста, и может встраиваться прямо в мобильные и десктоп-приложения Epic. Используется в нескольких сотнях медсистем – верный ориентир, когда первый вопрос покупателя «насколько глубоко это входит в нашу EHR?».

Microsoft Dragon Copilot – ответ для тех, кто уже стандартизирован на Microsoft и Nuance. В марте 2025 года DAX Copilot от Nuance слился с Dragon Medical One под брендом Dragon Copilot. Он делает черновики с учётом специальности, поднимает подсказки заказов, которыми можно управлять внутри Epic, и генерирует направительные письма и сводки после визита; цена – в сотнях долларов на провайдера в месяц. Когда покупатель говорит «Nuance DAX», он имеет в виду это.

Heidi Health – наиболее релевантный телемед-продукту, потому что сделан под работу и в очных, и в видеовизитах, по более чем 200 специальностям и на нескольких языках, с бесплатным тарифом под платным планом для врача. Это полезное доказательство, что телемед-сценарий мейнстримен, – но и предостережение: в 2026 году в его публичных отзывах прошла серия жалоб на потерянные записи и сорванные сессии, напоминание, что надёжность стадии захвата – это функция, а не мелочь.

Три способа добавить скрайб в ваш телемед-продукт

Если вы строите сам телемед-продукт, «добавить ИИ-скрайб» сводится к одному из трёх маршрутов, и они меняют скорость на контроль так же, как любые решения по платформе.

Рисунок 4. Три маршрута к скрайбу внутри вашего продукта. Встраивание быстрее всего проверяет гипотезу; построение оставляет звук пациентов, заметки и модель внутри вашего периметра.

Первый маршрут – встроить вендора: подключить SDK или API скрайб-компании в ваше приложение, чтобы их конвейер работал внутри вашего опыта. Это самый быстрый путь, часто дни-несколько недель, и вы наследуете работу вендора над точностью, его коннекторы к EHR и подписанное юридическое соглашение по данным пациентов. Плата за это – заметки, данные пациентов и маржа на каждый визит живут в системе вендора, а кастомизируете вы лишь в пределах того, что он открывает. Это верный выбор, когда вы хотите проверить, что пользователи будут пользоваться функцией, до вложений в обладание ею.

Второй маршрут – собрать на managed AI-API: связать хостинговый speech-to-text-сервис с хостинговой языковой моделью и самим написать логику заметки, форматирование SOAP и экран проверки. Это шаг вверх по усилиям, порядка недель-нескольких месяцев, и он покупает реальный контроль: вы решаете формат заметки, выбираете каждую модель и управляете потоками данных. Цена – интеграция, настройка точности и каждое соглашение о соответствии теперь ваши, их вести и эксплуатировать.

Третий маршрут, и единственный, делающий продукт полностью вашим, – построить на open-weights-моделях: запустить open-модели речи и языка на собственной инфраструктуре, отвечающей правилам по медданным. Это требует больше всего инженерии впереди, обычно месяцев, но звук и готовые заметки пациентов не покидают периметр, нет платы вендору за визит, и вы контролируете модель от и до. Это маршрут для телемед-компании, чьи данные пациентов, качество заметок и клиническая модель и есть бизнес. Метод подсчёта стоимости по функциям за всеми тремя маршрутами – особенно токен-математика для шага языковой модели – в уроке про реальную стоимость ИИ в видео, а адаптация модели под домен – в уроке про дообучение видео-VLM.

Посчитанный пример затрат: цена за визит – вот единица, которая важна

Правильно рассуждать о цене скрайба на один визит, потому что именно она масштабируется с растущей телемед-практикой. Арифметика проста и решает разговор «строить или покупать», так что сделайте её один раз.

Возьмём врача, который видит около 20 пациентов в день, 20 рабочих дней в месяц – примерно 400 визитов в месяц. Сервис скрайба-человека стоит для такого врача грубо $2 000–$4 000 в месяц. Возьмём середину этого диапазона и поделим на число визитов:

скрайб-человек:  $3 000 / месяц ÷ 400 визитов = $7,50 за визит

Теперь встроенный ИИ-скрайб на безлимитном плане, скажем $99 в месяц на этого врача:

встроенный AI:   $99 / месяц ÷ 400 визитов ≈ $0,25 за визит

Это и есть тот примерно тридцатикратный разрыв, который авторы JAMA имели в виду под «масштабируем по более низкой цене, чем человек-скрайб». Если же вы строите на собственных API, предельная стоимость – это вычисления на один визит: расшифровка примерно 15 минут звука стоит несколько центов, а проход языковой модели, структурирующий заметку, ещё несколько центов, так что пол по цене за визит лежит в нижних десятках центов – близко к встроенному числу, но без маржи вендора и вопроса о месте хранения данных.

МаршрутСрок запускаЦена за визит (ориентир)У кого данные пациентаКогда лучше
Скрайб-человекНайм / контракт~$7,50У вашей практикиНужен человек, не софт
Встроить вендораДни–недели~$0,25 (по плану)У вендораПроверка гипотезы
Собрать на APIНедели–месяцы~$0,20–0,40У вас + провайдеры APIНужно владеть заметкой
Построить на openМесяцыНижние десятки центовТолько у васДанные должны быть внутри

Числа выше ориентировочны и двигаются с планами вендоров и ценами API; суть в форме. Скрайб-человек – дорогая единица; любой ИИ-маршрут на один-два порядка дешевле за визит, а выбор между ИИ-маршрутами решает не столько цена, сколько кто обязан держать данные пациентов и насколько вам нужно контролировать заметку.

Ворота, через которые проходит каждый визит: согласие, HIPAA и раскрытие

Здесь дорожная карта телемеда тихо становится юридической, и здесь скрайб-проекты останавливают чаще, чем по любой технической причине. Считайте дальнейшее инженерно-релевантным контекстом, а не юридической консультацией, – уточняйте детали у квалифицированного юриста по юрисдикциям, где вы работаете.

Согласие на запись – первые ворота, и телемедицина делает их труднее, а не легче. Захват звука – это запись, а право записи отдельно от права о приватности здоровья. Федеральный закон США задаёт нижний порог согласия одной стороны, но десяток штатов – включая Калифорнию, Иллинойс, Флориду, Пенсильванию и Вашингтон – требуют согласия всех сторон до записи разговора. Видеовизит регулярно пересекает границы штатов: врач может сидеть в штате с согласием одной стороны, а пациент подключаться из штата с согласием всех. Осторожная и распространённая практика – применять более строгий из двух, что на деле означает получать явное согласие пациента до того, как скрайб начнёт слушать, каждый раз. Ставки реальны – во Флориде запись без согласия всех сторон это уголовное преступление. Инженерное следствие: согласие – первоклассный шаг в потоке звонка, зафиксированный и залогированный до первой секунды снятого звука, а не галочка, спрятанная в пользовательском соглашении.

HIPAA – вторые ворота. Health Insurance Portability and Accountability Act – закон США, регулирующий защищённую медицинскую информацию, по-английски PHI. ИИ-скрайб работает с PHI на каждой стадии – получает звук визита, создаёт заметку, хранит и то и другое и передаёт заметку в EHR, – что делает любого скрайб-вендора «business associate» по HIPAA и требует подписанного Business Associate Agreement (BAA) до того, как записан хоть один реальный пациент. BAA под скрайб должен быть больше типового шаблона: он должен прямо запрещать использование данных ваших пациентов для обучения или улучшения моделей вендора, обязывать обрабатывать только минимально необходимые данные, требовать мер Security Rule и гарантировать, что любой субподрядчик, касающийся звука, сам под BAA. Если вы строите, а не покупаете, реализовать эти меры – на вас.

Раскрытие и прозрачность – третьи ворота, и здесь регулирование ещё устаканивается. По EU AI Act – Регламенту (EU) 2024/1689 – система, напрямую взаимодействующая с человеком, обязана дать ему знать, что он имеет дело с ИИ, и её правила прозрачности вступают в силу 2 августа 2026 года. Обнадёживающе для скрайбов: рутинная административная документация обычно не считается «высокорисковой» по Приложению III Регламента, а сам Регламент явно смягчает обязанности раскрытия там, где ИИ-контент «прошёл процесс человеческой проверки или редакторского контроля и где физическое или юридическое лицо несёт редакторскую ответственность», – а это ровно ворота подписи с Рисунка 2. Иными словами, конструкция, делающая инструмент безопасным, держит его и на более лёгкой стороне регулирования. Более широкая регуляторная инженерия – в уроке про EU AI Act и уроке про раскрытие и C2PA.

Правило для всех трёх ворот одно и то же, что и для всей статьи: человек остаётся у руля. Согласие – это контроль пациента над тем, что его записывают; BAA – ваш контроль над тем, куда идут данные; подпись – контроль врача над тем, что попадает в карту. Скрайб, уважающий все три, – функция; пропускающий любое из них – риск.

Плейбук: от «добавить скрайб» до запущенной функции

Сложите части – и добавление ИИ-скрайба в телемед-продукт сводится к четырём вопросам, заданным по порядку.

Рисунок 5. Плейбук одним путём. Захватывайте из звонка, который у вас уже есть, решайте «строить или покупать» по владению данными, обеспечьте «извлечь, потом сгенерировать» и проводите каждый визит через ворота согласия и подписи.

Во-первых, захват: поскольку это видеопродукт, снимайте чистый звук по говорящим, уже идущий через ваш звонок, а не встраивайте микрофон – это главное преимущество телемедицины по качеству перед скрайбингом в клинике. Во-вторых, строить или покупать: если звук и заметки пациентов должны жить внутри вашего продукта, стройте на open-моделях или собирайте на AI-API; если вы проверяете гипотезу или не обязаны владеть данными, встройте вендора и запуститесь за дни. В-третьих, правило точности: сначала извлеките клинические факты, привязанные к фрагментам расшифровки, потом генерируйте заметку, чтобы каждая строка прослеживалась до доказательства и проверка была быстрой. В-четвёртых, и без исключений, ворота соответствия: получите согласие на запись до захвата звука, примените правило более строгого штата на межштатном визите, подпишите BAA, запрещающий обучение на данных ваших пациентов, и требуйте подписи врача до того, как что-либо попадёт в карту.

Это и есть весь плейбук. Более глубокие уроки этого раздела – руководства для каждого блока: streaming ASR для стадии расшифровки, диаризация для разделения говорящих, ASR-fan-out на стороне SFU для снятия звука со звонка и плейбук по ИИ в видеоконференцсвязи для родственного сценария заметок о встречах, делящего почти весь этот конвейер.

Где здесь Фора Софт

Мы строим телемед- и видеоконференц-платформы, внутри которых живут ИИ-скрайбы, – приложения видеовизитов, продукты консультаций со специалистами, сервисы психотерапии и WebRTC-конвейеры под ними, – поэтому регулярно проходим этот плейбук с клиентами. Когда клиент хочет проверить функцию, мы встраиваем проверенного скрайб-вендора в поток визита и сначала вшиваем шаг согласия в UI звонка. Когда данные пациентов и качество заметок – это и есть продукт, мы строим скрайб на собственном конвейере – снимая чистый звук по говорящим со звонка, структурируя заметки по принципу «извлечь, потом сгенерировать» и держа звук и заметки внутри HIPAA-совместимого периметра клиента – с фиксацией согласия и подписью врача, заложенными в поток с первого спринта. Четыре вопроса этого плейбука – те же, что мы взвешиваем на скоупинг-звонках, когда телемед-клиент спрашивает, покупать скрайб или строить его.

Ключевые выводы

  • ИИ-скрайб пишет заметку о визите; решает он нагрузку документацией, а не диагностику.
  • В видеовизите звук уже чистый и по говорящим – телемедицина проще всего для построения.
  • Любой скрайб идёт по одному конвейеру: захват, расшифровка, структура в SOAP, проверка и подпись.
  • Правило безопасности и законности: модель пишет черновик, врач подписывает, ничего не сохраняется само.
  • Сначала извлеките факты по фрагментам расшифровки, потом генерируйте – это сдерживает галлюцинации.
  • Перед любым визитом – трое ворот: согласие на запись, HIPAA BAA и подпись врача.

Что почитать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.