Содержание статьи +
- TL;DR
- Почему это важно
- Что на самом деле означают «детекция лиц» и «распознавание лиц» – и почему различие имеет юридическое значение
- Продакшен-стек моделей: детекция, выравнивание, эмбеддинг, liveness
- Калибровка выбора – сравнительная таблица
- EU AI Act, Простым Языком, Для Инженеров По Лицам
- Слой GDPR под AI Act
- Эталонная архитектура соответствия
- Где Тут Фора Софт
- Три ошибки, которые продолжают топить деплои лиц
- Численный пример – когда распознавание окупается
- Ключевые выводы
- Что читать дальше
TL;DR
Детекция лиц – поиск прямоугольников, в которых находится лицо на видеокадре, – это commodity-технология, доступная в любом браузере, на любом телефоне и на любой встраиваемой плате. Она реализуется с помощью open-source-моделей объёмом менее мегабайта, работающих быстрее пяти миллисекунд на кадр. Распознавание лиц – то есть сопоставление обнаруженного лица с известной личностью – с 2 августа 2026 года становится регулируемой технологией в Европейском союзе, когда EU AI Act полностью вступает в силу в отношении высокорисковых биометрических систем. Организация, внедряющая такую технологию без законных оснований, одновременно нарушая положения AI Act и GDPR, рискует штрафами до 35 миллионов евро или 7 процентов мирового оборота – в зависимости от категории нарушения.
Самое важное инженерное решение в любой видеофункции, связанной с лицами, в 2026 году – действительно ли вам нужно распознавание, или достаточно одной детекции. Переход через эту границу превращает низкорисковую продуктовую фичу в задокументированную, зарегистрированную и прошедшую оценку основных прав высокорисковую ИИ-систему. Эта статья проведёт вас через технический пайплайн, выбор моделей, защиту от спуфинга, а также обязательства EU AI Act и GDPR, накладываемые на каждый деплой. Мы также расскажем об архитектурном паттерне, который используем в Фора Софт, чтобы обеспечивать соответствие требованиям, не теряя при этом полезности функций.
Почему это важно
Если ваш продукт направляет веб-камеру на человека – инструмент видеоконференций, приложение для телемедицинских консультаций, система онлайн-прокторинга экзаменов, чек-ин на живом мероприятии, ИИ-камера видеонаблюдения, дашборд ритейл-аналитики, приложение для знакомств, фитнес-приложение, онбординг в банке – вас рано или поздно попросят добавить фичу с лицами. Иногда запрос кажется невинным: размыть фон только тогда, когда в кадре есть лицо; автоматически кадрировать говорящего; посчитать, сколько людей в комнате. Иногда он несёт огромный юридический вес: определить, кто в кадре; пометить повторного посетителя; проверить, что человек на онбординге – тот же, что на ID-документе; узнать студента, вошедшего на экзамен.
Раньше эти две категории задач использовали один и тот же код. С тех пор как запреты AI Act вступили в силу 2 февраля 2025 года, а высокорисковые обязательства вступают в силу 2 августа 2026 года, они оказались в разных правовых мирах. Компании, которые перепутали границы – собирая лица из открытого веба, внедряя идентификацию в реальном времени в публичных местах, используя распознавание эмоций при найме или в образовании – уже заплатили восьмизначные штрафы. Те, кто чётко провёл границу – детекция на стороне клиента, распознавание на изолированном, задокументированном и зарегистрированном бэкенде, с полной фиксацией всех действий на бумаге – обошлись без штрафов.
Эта статья показывает, где проходит эта граница и как провести её в коде.
Что на самом деле означают «детекция лиц» и «распознавание лиц» – и почему различие имеет юридическое значение
Люди часто используют термины детекция лиц и распознавание лиц, как будто это синонимы. На самом деле это две разные задачи: у них разные выходные данные, разные вычислительные профили и – начиная с 2026 года в Европейском союзе – разные регуляторные режимы.
Детекция лиц – это задача найти все лица на изображении и определить их ограничивающие рамки. Модель принимает RGB-кадр и возвращает список прямоугольников – по одному на каждое лицо. Некоторые детекторы дополнительно указывают пять ключевых точек: левый глаз, правый глаз, нос, левый угол рта и правый угол рта, а также уровень уверенности для каждого обнаруженного лица. Однако на любом этапе процесс не определяет, кому именно принадлежит лицо. Детектор обрабатывает все лица одинаково – как счётчик людей у входа на стадион: он фиксирует присутствие, но не запоминает личности. Именно детекция запускает автокадрирование миниатюр в Zoom или Google Meet, автофокус по лицу в камере смартфона, триггер, который сообщает конференц-приложению, когда включить размытие фона, и «улыбочный затвор» в бытовой фотокамере.
Распознавание лиц – это задача, в которой обнаруженное лицо используется для ответа на один из двух вопросов. Первая форма – верификация лиц (или сопоставление 1:1) – задаёт вопрос: «Это то же лицо, что и у нас сохранено для данного пользователя?». Вы сталкиваетесь с этим каждый раз, когда разблокируете телефон по лицу или проходите онбординг в банке, где проверяется, совпадает ли только что сделанное селфи с фото в удостоверении личности.
Вторая форма – идентификация лиц (или сопоставление 1:N) – ставит вопрос: «Кто этот человек среди N людей в нашей базе данных?». Вы видите это, когда камеры наблюдения распознают вернувшегося магазинного вора, когда турникет на стадионе определяет владельца абонемента или когда система поиска пропавших людей сравнивает захваченное лицо со списком лиц в базе наблюдения.
Обе формы работают одинаково: обнаруженное лицо передаётся в модель распознавания, которая выдаёт вектор фиксированной длины – обычно 256, 384 или 512 чисел с плавающей точкой – называемый эмбеддингом лица. Затем два эмбеддинга сравниваются по косинусному сходству или евклидову расстоянию, и на основе настраиваемого порога определяется, принадлежат ли они одному человеку.
Две задачи – детекция и распознавание – начинают с одного и того же: входом может быть кадр с вебкамеры, неподвижное фото или поток с CCTV. На первом этапе необходимо найти лицо, прежде чем его можно будет сопоставить. После этого пути расходятся. У детекции нет памяти: она просто определяет, есть ли лицо на изображении. Распознавание же полностью зависит от памяти, поскольку смысл эмбеддинга заключается в том, что вы сохранили его более раннюю версию.
Именно это архитектурное различие – тот шов, по которому проходят границы EU AI Act и GDPR. Общий регламент по защите данных (GDPR) относит данные о лице к особой категории персональных данных по статье 9 только в случае, если они обрабатываются «с целью однозначной идентификации физического лица» – именно эта задача лежит в основе распознавания лиц. Анонимная детекция лиц, применяемая для подсчёта посетителей, запуска автокадрирования или размытия фона, не попадает под это определение и остаётся в рамках более лёгкого режима обработки обычных персональных данных по статье 6. AI Act проводит ту же границу тем же местом, но другими словами: детекция – это функция, а распознавание – система биометрической идентификации. Статья 5 AI Act прямо запрещает некоторые применения биометрической идентификации; приложение III (Annex III) относит остальные к высокому риску и накладывает на каждый запуск строгую, документированную и зарегистрированную систему соответствия, прошедшую оценку основных прав.
Остальную часть статьи будем предполагать, что вы усвоили это различие. Почти каждое инженерное решение в продукте с распознаванием лиц вытекает из него.
Продакшен-стек моделей: детекция, выравнивание, эмбеддинг, liveness
У современного пайплайна обработки лиц – четыре стадии, а не две. На каждой стадии используется своя модель, каждая из которых имеет свои компромиссы по размеру, задержке и точности. Выбор модели на каждой стадии определяет и общую стоимость, и позицию по соблюдению нормативных требований.
Стадия 1 – Детекция
Детектор – это постоянно включённая стадия. Он обрабатывает каждый кадр или, по крайней мере, каждый N-й кадр входного потока. Его задача – обнаружить лица и передать каждой последующей стадии хорошо обрезанное, правильно ориентированное и корректно масштабированное изображение лица. В 2026 году в продакшене доминируют два семейства моделей.
Первое семейство – SCRFD от проекта InsightFace. SCRFD – это одностадийный anchor-free детектор лиц, принятый на ICLR 2022. Опубликованное семейство моделей охватывает диапазон от SCRFD-0.5GF – компактной модели объёмом 0,5 гигафлопа для мобильного и edge-инференса – до SCRFD-34GF, модели на 34 гигафлопа, предназначенной для высокоточной пакетной обработки. На сложном (hard) подмножестве WIDER Face – стандартном академическом бенчмарке, включающем мелкие, перекрытые, в профиль и размытые лица – SCRFD-34GF достигает около 96% средней точности (AP) и превосходит предыдущий лучший детектор TinaFace на 4,78 процентных пункта, при этом работая более чем в три раза быстрее на GPU. SCRFD-2.5GF, модель среднего уровня, – настоящая рабочая лошадка: её размер составляет 2,5 мегабайта после экспорта в ONNX и квантизации, она обрабатывает кадр за ~7 миллисекунд на одном ядре CPU и поддерживает вывод пяти ключевых точек, необходимых для последующего выравнивания.
Второе семейство – YOLOv5-Face, YOLOv8-Face, YOLOv10-Face и YOLOv11-Face – представляет собой продакшен-линию YOLO, адаптированную для детекции лиц путём добавления пяти голов регрессии ключевых точек к стандартной голове YOLO. Варианты YOLO с поддержкой лиц немного уступают SCRFD по точности на WIDER Face hard, но работают быстрее и наследуют богатую поддержку ONNX и TensorRT, присущую экосистеме YOLO. Для команд, уже использующих продакшен-линию YOLO для общей детекции объектов, YOLO-Face – это путь наименьшего сопротивления.
Под этими двумя стоит MediaPipe Face Detector – та самая модель, что отвечает за обнаружение лиц в миниатюрах Google Meet. MediaPipe Face Detector – это single-shot multibox-детектор, оптимизированный для мобильных и веб-приложений. На карте модели указано время обработки около 1 миллисекунды на кадр на GPU Pixel 6, а сама модель поставляется нативно в пакете @mediapipe/tasks-vision, который мы рекомендовали в уроке по размытию фона. MediaPipe Face Detector – правильный выбор, когда функция с обработкой лица работает в браузере, не требует идентификации и не используется как этап распознавания.
Для большинства серверных или задач видеонаблюдения SCRFD-2.5GF – выбор по умолчанию в 2026 году, поскольку он занимает золотую середину по размеру, скорости, точности определения ключевых точек и уровню поддержки экосистемы (в том же репозитории с ним поставляются эмбеддинг-модели InsightFace и согласованные конвенции выравнивания).
Стадия 2 – Выравнивание
Эмбеддинги лиц чувствительны к масштабу, повороту и центрированию. Лицо, наклонённое на двенадцать градусов вправо, даёт другой эмбеддинг, чем то же самое лицо в нейтральном положении, и косинусное сходство между ними может снизиться настолько, что решение о верификации перейдёт порог. Выравнивание исправляет эту проблему. Выравниватель использует пять ключевых точек, обнаруженных детектором, и применяет преобразование подобия (2D-аффинное, допускающее поворот, равномерный масштаб и сдвиг, но не скос), чтобы центры двух глаз оказались в фиксированных пиксельных координатах канонического кропа – обычно 112×112 пикселей для моделей семейства InsightFace ArcFace.
Выравнивание – дешёвое. Преобразование требует шести умножений на выходной пиксель плюс билинейную интерполяцию. На современном CPU это занимает меньше миллисекунды на одно лицо. Причина, по которой мы продолжаем это подчёркивать, в том, что пропуск выравнивания – самая частая причина низкой точности распознавания лиц в продакшене. Команды запускают детектор, запускают эмбеддер, видят уровень ложных отказов 5–10 процентов, винят эмбеддер и после недель отладки обнаруживают, что рамка детектора была не выровнена. Хелпер InsightFace face_align.norm_crop() делает всё правильно всего в семи строках Python – используйте его.
Стадия 3 – Эмбеддинг
Модель эмбеддинга принимает выровненный кадр лица размером 112×112 и генерирует вектор фиксированной длины – обычно 512 чисел с плавающей точкой, – представляющий личность. В продакшене доминируют два семейства.
Первое – семейство ArcFace из того же проекта InsightFace, что и SCRFD. ArcFace был представлен на CVPR 2019 и по сей день остаётся архитектурной основой для распознавания лиц в продакшене в 2026 году. Опубликованный набор моделей включает ArcFace-MobileFaceNet (2 мегабайта, для мобильных устройств), ArcFace-ResNet50 (на базе 50-слойного ResNet, около 95 мегабайт, используется в большинстве серверных развертываний) и ArcFace-ResNet100 (на базе 100-слойной сети, около 250 мегабайт, применяется, когда точность является главным приоритетом). На бенчмарке IJB-C – стандартном академическом тесте идентификации, включающем 130 000 изображений 3 500 человек – ArcFace-ResNet100 достигает примерно 96 % уровня истинного срабатывания (TAR) при уровне ложного срабатывания (FAR) 10⁻⁵, что соответствует порогу, используемому NIST Face Recognition Technology Evaluation для своего высшего уровня точности.
Второе – AdaFace, улучшение 2022 года, которое адаптирует отступ (margin) в функции потерь в зависимости от сложности каждого обучающего примера. AdaFace примерно эквивалентен ArcFace на чистых бенчмарках вроде LFW и немного превосходит его на сложных бенчмарках, таких как IJB-C и TinyFace, при этом топология модели и количество параметров остаются теми же, что и у ArcFace, а значит, стоимость развертывания идентична. Для нового проекта «с нуля» в 2026 году AdaFace – разумный выбор по умолчанию; в случае же уже существующего проекта на базе ArcFace выгода от перехода будет незначительной.
Какое бы семейство вы ни выбрали, модель эмбеддинга – это точка в пайплайне, с которой начинается режим Статьи 9 GDPR. Ограничивающей рамкой не являются биометрические данные: 512-мерный эмбеддинг, способный идентифицировать человека, сам по себе является биометрическими данными. Всё, что происходит ниже эмбеддера в потоке – хранение, передача, сравнение, удержание – теперь оперирует персональными данными особой категории, и дизайн защиты данных должен это учитывать.
Стадия 4 – Liveness / анти-спуфинг
Система распознавания, которая не проверяет, принадлежит ли лицо на экране реальному живому человеку перед камерой, может быть обманута с помощью распечатанной фотографии или воспроизведением deepfake-видео. Защита от этого – проверка живости (liveness detection) или анти-спуфинг лиц. В 2026 году продакшен-паттерн совмещает пассивную модель – нейросеть, классифицирующую один кадр как реальный или поддельный, – с опциональным активным челленджем: подсказкой, просящей пользователя моргнуть, повернуть голову или выполнить определённый жест.
Пассивная модель обучена на датасете вроде CelebA-Spoof, который включает 625 537 изображений 10 177 человек, среди которых есть поддельные изображения, снятые в 8 сценах более чем на 10 сенсорах. Типичная пассивная liveness-модель – это небольшой классификатор на базе MobileNetV3 или EfficientNet-B0, который принимает тот же выровненный кроп 112×112, что и эмбеддер, и выдаёт вероятность «реальный или подделка». Лучшие опубликованные пассивные модели на 6-м Face Anti-Spoofing Challenge достигают усреднённого уровня ошибки классификации (ACER) около 2,1 процента.
Для сценариев с высокой степенью защиты – онбординг в банке, государственный KYC, прокторинг экзаменов – одной пассивной проверки liveness недостаточно. Промышленным стандартом является сертификация iBeta Presentation Attack Detection Level 1 или Level 2 – независимый сторонний тест на устойчивость к атакам с использованием распечатанных фото, экранных повторов, 3D-напечатанных масок и силиконовых масок. Сертификацию iBeta активно используют платёжные процессоры и платформы верификации личности (Onfido, Jumio, Veriff, Persona), когда предлагают свои решения по проверке liveness. Если вы разрабатываете такую систему самостоятельно, следует планировать лицензирование сертифицированного SDK от вендора: воспроизведение защиты уровня iBeta своими силами требует 12–24 месяцев сосредоточенной работы и постоянной программы состязательного тестирования.
Калибровка выбора – сравнительная таблица
| Компонент пайплайна | Модель | Размер | Задержка (одно лицо, CPU) | Когда выбирать |
|---|---|---|---|---|
| Детектор | MediaPipe Face Detector | 0,2 MB | ~3 мс | В браузере, анонимная детекция, без распознавания дальше |
| Детектор | SCRFD-0.5GF | 1,1 MB | ~3 мс | Мобильный или edge, нужно распознавание дальше |
| Детектор | SCRFD-2.5GF | 2,5 MB | ~7 мс | Серверный или surveillance по умолчанию |
| Детектор | YOLOv8-Face | 5–6 MB | ~5 мс | Команды, уже на стеке YOLO |
| Выравниватель | InsightFace norm_crop | н/д | <1 мс | Всегда |
| Эмбеддер | ArcFace-MobileFaceNet | 2 MB | ~5 мс | Мобильное распознавание |
| Эмбеддер | ArcFace-R50 | 95 MB | ~15 мс | Серверный по умолчанию |
| Эмбеддер | ArcFace-R100 / AdaFace-R100 | 250 MB | ~35 мс | Критично к точности (банк, KYC, высокие ставки ID) |
| Liveness | Кастомный MobileNetV3 + CelebA-Spoof | 5 MB | ~6 мс | Конференции, e-learning |
| Liveness | iBeta-сертифицированный вендорский SDK | н/д | варьируется | Банк, KYC, платежи, гос. ID |
Задержки – ориентировочные значения для одного лица на современном ядре x86 CPU с ONNX Runtime; на GPU время обработки примерно в 4–6 раз меньше для более тяжёлых моделей. Приведённые цифры соответствуют данным из карточек моделей, оригинальных статей и публичных бенчмарков InsightFace. Используйте их как ориентиры для планирования, а не как замену замерам на вашем целевом оборудовании.
EU AI Act, Простым Языком, Для Инженеров По Лицам
EU AI Act – это горизонтальный регламент Европейского союза об искусственном интеллекте. Полный текст – Регламент (ЕС) 2024/1689 – вступил в силу 1 августа 2024 года. Обязательства вводятся поэтапно в течение трёх лет. Фазы, имеющие значение для любой функции, связанной с лицами, таковы:
- 2 февраля 2025. Вступили в силу запреты Статьи 5. После этой даты в ЕС стало незаконным выводить на рынок или использовать любую ИИ-систему, относящуюся к одной из восьми запрещённых категорий. Четыре из этих категорий напрямую связаны с технологиями, работающими с лицами.
- 2 августа 2025. Вступили в силу обязательства для провайдеров моделей ИИ общего назначения (верхний уровень базовых моделей). Эти требования в основном касаются организаций, которые разрабатывают или распространяют крупные vision-language-модели.
- 2 августа 2026. Вступают в силу обязательства по высокорисковым ИИ-системам, перечисленным в Приложении III. Этот срок имеет значение практически для любого внедрения систем распознавания лиц в ЕС. С этой даты любая организация, выводящая на рынок или внедряющая систему распознавания лиц в ЕС, обязана соблюдать полный режим для высокорисковых систем: управление рисками, контроль качества, техническая документация, пострыночный мониторинг, оценка соответствия, регистрация в базе данных ЕС, обеспечение прозрачности для пользователей и наличие человеческого надзора.
Закон применяется национальными органами в каждом государстве-члене ЕС при координации Европейского офиса по ИИ (European AI Office). Штрафы за запрещённые практики достигают 35 миллионов евро или 7 процентов мирового годового оборота – в зависимости от того, что больше. За нарушение высокорисковых обязательств штрафы составляют до 15 миллионов евро или 3 процентов мирового оборота. Оба лимита превышают максимальный штраф по GDPR (20 миллионов евро или 4 процента мирового оборота).
Четыре запрещённых применения лиц
Статья 5(1) AI Act прямо запрещает применение таких систем, связанных с людьми, в ЕС. Ни сертификации, ни механизма opt-in, ни «тихой гавани» для отрасли не предусмотрено. Разработка или продажа таких систем является незаконной.
- Нецелевой сбор изображений лиц для создания или расширения баз данных распознавания лиц. Статья 5(1)(e) прямо описывает практику Clearview: автоматический сбор изображений с веб-сайтов или записей с камер видеонаблюдения с целью формирования поисковой системы по лицам. Именно за это французский орган по защите данных оштрафовал Clearview AI на 20 миллионов евро.
- Распознавание эмоций на рабочих местах и в образовательных учреждениях. Статья 5(1)(f) запрещает использование систем, автоматически определяющих эмоции физических лиц в рабочей среде или образовательной среде, за исключением узких случаев, связанных с медицинскими целями или обеспечением безопасности. «Анализатор настроения кандидата» в процессе видеонабора или «оценщик вовлечённости студента» в онлайн-уроке являются незаконными в ЕС.
- Биометрическая категоризация по чувствительным признакам. Статья 5(1)(g) запрещает системы, классифицирующие физических лиц на основе биометрических данных с целью определения расы, политических взглядов, членства в профсоюзах, религиозных или философских убеждений, сексуальной ориентации или половой жизни. «Детектор расы» или «классификатор религии», построенный на основе анализа лица, является незаконным.
- Биометрическая идентификация в реальном времени в публичных местах для правоохранительных органов. Статья 5(1)(h) запрещает распознавание лиц в реальном времени в открытых пространствах, за исключением трёх строго ограниченных случаев, разрешённых исключительно для правоохранительных целей и только при наличии судебного разрешения: поиск жертв похищения, торговли людьми или сексуальной эксплуатации; предотвращение немедленной угрозы жизни или теракта; розыск лиц, подозреваемых в тяжких преступлениях, наказуемых лишением свободы на срок не менее четырёх лет. Эти исключения требуют проведения оценки воздействия на основные права в соответствии со статьёй 27 и регистрации в реестре ЕС согласно статье 49. Коммерческий продукт, обеспечивающий идентификацию лиц в реальном времени в торговом центре, на стадионе или вокзале, продаваемый частным операторам, не подпадает ни под одно из исключений и является незаконным.
Высокорисковый режим для всего остального
Распознавание лиц, которое не запрещено, по умолчанию считается высокорисковым. Согласно пункту 1 Приложения III (Annex III) AI Act, к высокорисковым относятся любые системы искусственного интеллекта, предназначенные для использования в качестве «системы удалённой биометрической идентификации» (с узким исключением для биометрической верификации – например, «разблокировка телефона» по принципу 1:1), а также для биометрической категоризации по чувствительным признакам (если она не запрещена напрямую) или для распознавания эмоций (если это не запрещено напрямую).
Высокорисковая классификация влечёт за собой девять конкретных обязательств. Мы кратко опишем каждое из них, а затем расскажем об инженерной работе, которую они предполагают.
1. Система управления рисками (Статья 9). Непрерывный, задокументированный процесс, идентифицирующий, анализирующий и снижающий риски на всех этапах жизненного цикла системы. В инженерных терминах это означает наличие письменного реестра рисков, назначенного ответственного лица (владельца) для каждого риска, подтверждающих документов о мерах по снижению рисков и ежеквартального повторного анализа. Используйте уже существующую у вас основу – ISMS или систему управления качеством – и не изобретайте новое.
2. Управление данными (Статья 10). Обучающие, валидационные и тестовые наборы данных должны быть релевантными, репрезентативными, точными и полными. В системах, работающих с лицами, это напрямую связано с демографической справедливостью. Система должна демонстрировать паритет точности по возрасту, полу и тону кожи. Трек верификации 1:1 и трек идентификации 1:N FRVT NIST публикуют именно такие оценки, и высокорисковый оператор должен ссылаться на результаты NIST FRVT или провести эквивалентную оценку самостоятельно.
3. Техническая документация (Статья 11, Annex IV). Подробное досье, включающее назначение системы, её архитектуру, используемые датасеты, метрики производительности, управление рисками, план мониторинга и инструкции по эксплуатации. Этот документ потребуется нотифицированному органу или национальному регулятору при аудите соответствия. Объём – от 30 до 80 страниц в зависимости от сложности системы.
4. Ведение записей (Статья 12). Автоматическое логирование событий, имеющих значение для выявления рисков. В случае системы распознавания лиц это означает создание защищённого от подделки журнала каждого решения об идентификации (совпадение / несоответствие), каждого изменения порога, каждой развернутой версии модели и каждой модификации базы данных.
5. Прозрачность для деплоеров (Статья 13). Система должна сопровождаться инструкциями по использованию, в которых раскрываются её точность, ограничения, границы предполагаемого применения и требования к человеческому надзору.
6. Человеческий надзор (Статья 14). Система должна быть спроектирована так, чтобы человек мог вмешаться, интерпретировать результаты и отменить решения. В случае идентификации лиц это означает обязательную проверку человеком любого значимого совпадения до принятия каких-либо действий (никаких полностью автоматических арестов, отказов во входе или расторжения договоров на основании одного только совпадения лица).
7. Точность, устойчивость, кибербезопасность (Статья 15). Количественные заявления об точности, устойчивость к состязательным входам и соблюдение стандартных мер кибербезопасности.
8. Оценка соответствия (Статьи 43, 44). Формальная оценка соответствия до вывода на рынок. Для систем с лицами это обычно внутренняя оценка соответствия по Приложению VI, подтверждаемая нотифицированным органом только в случае, если гармонизированные стандарты ещё недоступны.
9. Регистрация в базе данных ЕС (Статья 49). Провайдер обязан зарегистрировать систему в публичной базе данных Европейского союза до её вывода на рынок. Деплоеры (организации, вводящие систему в эксплуатацию, которые могут не совпадать с провайдером) также обязаны зарегистрировать своё использование, если они являются государственными органами.
Две другие статьи пересекают эти обязательства и имеют значение для систем с участием лиц:
- Статья 27 – оценка воздействия на основные права. Публичные органы и частные операторы высокорисковых биометрических систем обязаны провести оценку воздействия на основные права (FRIA) до первого использования системы. FRIA должна документировать категории затронутых физических лиц, конкретные риски причинения вреда, меры человеческого надзора и механизмы управления рисками. Банк, внедряющий онбординг с верификацией лица, обязан подготовить такую оценку до запуска системы в ЕС.
- Статья 50 – обязательства по прозрачности для определённых ИИ-систем. Даже если система не отнесена к высокорисковым, операторы биометрической категоризации или распознавания эмоций (где это не запрещено) обязаны информировать затронутых физических лиц о том, что они взаимодействуют с такой системой. Операторы любой системы, генерирующей или манипулирующей синтетическим контентом (deepfakes), обязаны раскрывать, что контент создан искусственным путём.
Слой GDPR под AI Act
AI Act дополняет GDPR, но не заменяет его. Система распознавания лиц, соответствующая AI Act, всё равно должна соблюдать требования GDPR. Система детекции лиц, не подпадающая под действие AI Act, тем не менее обязана соответствовать GDPR, если детекция осуществляется в ЕС или затрагивает данные резидентов ЕС.
Отношение GDPR к персональным данным имеет две стороны.
Первая сторона – законное основание по статье 6. Каждой операции обработки персональных данных требуется законное основание. Для потребительской функции с распознаванием лиц наиболее распространённые основания – явное согласие (статья 6(1)(a)), исполнение договора (статья 6(1)(b)) и законные интересы (статья 6(1)(f)). Анонимная детекция лиц – например, для автокадрирования, подсчёта посетителей или активации размытия фона – как правило, может опираться на законные интересы при условии проведения теста на баланс, который подтверждает необходимость обработки и минимальность собираемых данных.
Вторая сторона – условие особой категории по Статье 9, которое вступает в силу, когда система обрабатывает биометрические данные с целью однозначной идентификации личности. Статья 9 исходит из запрета по умолчанию: обработка биометрических данных для идентификации запрещена, если не применяется одно из десяти исключений. Для частных секторов единственное реалистичное исключение – Статья 9(2)(a), явное согласие. Явное согласие – более высокая планка, чем обычное согласие по Статье 7: это должен быть ясный утвердительный акт, выраженный в письменной форме или в виде записанного заявления, в котором указаны конкретная операция обработки и её цели, и который может быть отозван в любой момент без каких-либо последствий.
Два известных правоприменительных решения наглядно демонстрируют цену ошибки с любой из сторон. Испанская сеть супермаркетов Mercadona была оштрафована на 2,52 миллиона евро в 2021 году регулятором AEPD за внедрение распознавания лиц в магазинах с целью борьбы с кражами; AEPD не обнаружил ни законного основания, ни пропорциональности применения технологии. Французский CNIL оштрафовал Clearview AI на 20 миллионов евро в 2022 году за сбор биометрических данных из более чем 20 миллиардов онлайн-фотографий без согласия пользователей, а запрет, предусмотренный AI Act 2025 года, позже подтвердил, что такая практика теперь прямо запрещена.
Есть ещё пять положений GDPR, которые особенно строго регулируют системы с обработкой персональных данных и которые инженеры часто недооценивают:
- Минимизация данных (Статья 5(1)(c)). Храните только минимально необходимую информацию, достаточную для решения задачи. Для верификации не нужно сохранять фото – достаточно эмбеддинга. Для идентификации может не потребоваться даже он. Удаляйте пиксели сразу после получения вектора.
- Ограничение хранения (Статья 5(1)(e)). Хранение должно быть строго связано с поставленной целью. Эмбеддинг лица, оставленный «на всякий случай», – это нарушение. Установите политику хранения для каждого случая: по умолчанию – 24 часа для временной идентификации (например, пропуск посетителя), 90 дней для эмбеддингов при расследовании мошенничества и срок жизни аккаунта – для эмбеддингов, привязанных к личности пользователя.
- Право на доступ (Статья 15) и право на удаление (Статья 17). Пользователь должен иметь возможность запросить копию своего эмбеддинга и потребовать его удаления. Архитектура данных должна поддерживать поиск и удаление эмбеддингов по каждому пользователю, включая все векторные индексы.
- Оценка воздействия на защиту данных (Статья 35). Обязательна при «систематической и масштабной обработке персональных аспектов» и при «обработке в крупном масштабе особых категорий данных». Система распознавания лиц в продакшене почти всегда попадает под оба условия – DPIA становится практически обязательным.
- Статья 22 – автоматизированное принятие решений. Если результат распознавания лица используется для «решения, основанного исключительно на автоматизированной обработке… которое влечёт юридические последствия или иначе существенно затрагивает человека», субъект данных получает право на человеческое вмешательство. Это пересекается со Статьёй 14 AI Act: человеческий контроль требуется дважды – по одному разу по каждому регламенту.
Два регламента хорошо сочетаются. Там, где AI Act требует вести логирование решений и проводить FRIA, GDPR предписывает логировать доступ и осуществлять DPIA. Где возможно, используйте один и тот же набор артефактов для обоих требований; не пытайтесь представить, что одно обязательство отменяет другое.
Эталонная архитектура соответствия
Фича с поддержкой лица, разработанная для ЕС в 2026 году, выглядит иначе, чем та, что была создана для США в 2020-м. Архитектурный паттерн, представленный ниже, – тот, что мы применяем в проектах Фора Софт. Он принципиальный: это не единственный допустимый подход, но он устраняет целые классы комплаенс-ошибок на этапе проектирования.
У паттерна четыре направляющих принципа.
Детектируй на клиенте, распознавай на сервере. Детектор работает в браузере или на устройстве с использованием MediaPipe Face Detector или SCRFD-0.5GF в ONNX Runtime Web. Сырой кадр никогда не покидает устройство для функций только-детекции (размытие фона, автокадрирование, определение присутствия). Для функций, требующих распознавания, клиент отправляет на сервер только выровненный кроп лица размером 112×112 – и только после того, как пользователь дал явное согласие на эту конкретную операцию. Пиксели и рамки не попадают в процесс распознавания, пока пользователь не согласился.
Две зоны хранения с односторонним шлюзом. Операционные эмбеддинги (для живых звонков, эфемерной идентификации) хранятся в горячем векторном хранилище с TTL 24 часа. Постоянные эмбеддинги (для верификации, расследования мошенничества) размещаются в отдельном холодном хранилище с чёткими метаданными удержания для каждой записи и контролем доступа по целям. Код, осуществляющий чтение из холодного хранилища, защищён сервисом, который фиксирует каждый доступ для обеспечения аудит-трейла в соответствии со статьёй 12 AI Act.
Никакого удержания изображений по умолчанию. Пайплайн генерирует эмбеддинг и отбрасывает исходные пиксели в рамках одного запроса. Хранение исходных изображений лиц возможно только при наличии явного флага цели, записи согласия, установленного срока хранения и задания на удаление. В 2026 году мы не наблюдали продакшен-кейсов, оправдывающих постоянное хранение сырых пикселей вне контекста расследования мошенничества – даже в таких случаях мы используем зашифрованные блобы с коротким сроком жизни.
Человек в контуре на каждом значимом совпадении. Ни одно бизнес-решение – будь то предоставление доступа, пометка мошенничества или отказ в услуге – не принимается на основании одного совпадения лица. Проверяющий человек видит кандидатское совпадение, исходный кадр, сопоставленный шаблон и структурированную оценку уверенности, прежде чем будет предпринято любое действие. Такое требование закреплено в Статье 14 AI Act и соответствует положениям Статьи 22 GDPR.
В коде эти четыре принципа реализуются через несколько архитектурных компонентов: клиентский пакет детекции, API для подачи кропа лица, принимающее токен согласия, stateless-сервис эмбеддинга, выдающий вектор без хранения пикселей, горячий векторный индекс с TTL, холодное векторное хранилище за сервисом логирования доступа и UI проверки, отображающий совпадения для подтверждения человеком. Ничего экзотического здесь нет – всё это приходится дорабатывать задним числом. Строить это нужно с самого начала.
Где Тут Фора Софт
Мы разрабатываем функции распознавания лиц для конференций, телемедицины, видеонаблюдения, e-learning и приложений для знакомств с 2018 года. Паттерн, описанный в этой статье, основан на опыте этих проектов. Самый частый запрос, который мы слышим в 2026 году, – от продуктовых команд, которые начали с анонимной детекции в 2022 году, добавили функцию «запомни этого пользователя» в 2023-м и теперь должны согласовать эту незаметно внедрённую функцию распознавания с дедлайном по AI Act в августе 2026 года. Исправление редко бывает чисто техническим – чаще всего это организационные изменения: письменный DPIA, письменная FRIA, письменная политика хранения данных, письменный протокол человеческого контроля, регистрация записи в базе данных ЕС и честный разговор с командой поддержки клиентов о том, какую информацию раскрывать конечным пользователям. Мы помогаем с архитектурой и инженерной реализацией; юридические документы передаём специалисту по защите данных клиента на доработку, а не составляем с нуля.
Три ошибки, которые продолжают топить деплои лиц
Три одних и тех же ошибки снова и снова всплывают в комплаенс-аудитах. Распознайте их в своей дорожной карте раньше, чем это сделает аудитор.
Первая ошибка – использование одного и того же кода для детекции и распознавания. Команды пишут FaceService, который одновременно детектирует, выравнивает, эмбеддит и сопоставляет – всё в одном вызове, – а затем применяют его на каждой продуктовой поверхности. В результате фича автокадрирования, которой вообще не требуется распознавание, проходит через код, затрагивающий хранилище эмбеддингов, журнал согласий и аудит-трейл. Каждый аудит обходится в десять раз дороже, чем должен. Разделяйте пути обработки с самого начала. Детекция – отдельный сервис, распознавание – другой. Никакие данные не должны пересекать границу между ними без явного токена согласия.
Вторая ошибка – использование хостингового вендора без ознакомления с соглашением о обработке данных (DPA). Многие API для распознавания лиц – включая некоторые популярные – по умолчанию используют изображения, предоставленные клиентами, для обучения своих моделей, если клиент явно не откажется от этого в письменной форме. Даже если ваш договор соответствует требованиям, эталонная архитектура вендора может им не соответствовать. Проверьте, как вендор обрабатывает данные, потребуйте DPA, запрещающее вторичное использование, и убедитесь в его позиции по AI Act и GDPR до интеграции.
Третья ошибка – отгрузка распознавания без liveness под этикеткой «безопасно». Верификация без антиспуфинга легко обходится с помощью распечатанного фото. Маркетинг фичи разблокировки или онбординга по лицу без задокументированной защиты liveness – это проблема раскрытия риска мошенничества раньше, чем проблема соответствия требованиям; как только первый обход с использованием deepfake попадёт в новости, она становится и тем, и другим. Если сценарий использования – что-либо иное, кроме эфемерной идентификации в контролируемой среде, внедряйте liveness с самого начала и закладывайте бюджет на сертификацию iBeta.
Численный пример – когда распознавание окупается
Короткий пример, чтобы проиллюстрировать выбор моделей с точки зрения стоимости. Допустим, вы используете корпоративную платформу видеоконференций для 10 000 сотрудников. Вы хотите внедрить вход по распознаванию лица: сопоставление 1:1 между кадром с веб-камеры пользователя и фотографией из его досье, применяемой как второй фактор аутентификации после пароля.
Стоимость обработки одного входного изображения: одна детекция (SCRFD-0.5GF, около 3 мс), одно выравнивание (около 0,5 мс), одно извлечение эмбеддинга (ArcFace-MobileFaceNet, около 5 мс), одно вычисление косинусного сходства (пренебрежимо мало). Итого на один вход – около 9 миллисекунд на CPU.
Стоимость хранения на один вход: 1 эмбеддинг × 512 чисел × 4 байта = 2 048 байт = 2 KB на пользователя. На 10 000 пользователей: 20 мегабайт. Векторное хранилище помещается в RAM на самом маленьком облачном инстансе.
Сетевая стоимость на один вход: выровненный кроп 112×112 в градациях серого – 12,5 КБ; ответ-эмбеддинг – 2 КБ. Round-trip уверенно меньше 50 КБ.
При 10 000 входов в день максимальная стоимость вычислений составляет 0,025 CPU-часа в день, или около 0,03 доллара в месяц по стандартным облачным тарифам. Функция верификации окупается уже с первого случая, когда блокирует атаку перебором учётных данных (credential stuffing).
Теперь рассмотрим ту же архитектуру, адаптированную для распознавания 1:10 000 – система должна определить, кто из 10 000 сотрудников только что вошёл в переговорную. На один инференс: одна детекция, один эмбеддинг и 10 000 косинусных сравнений. Косинусное сходство для 512-мерного вектора требует 1 024 операций умножения-сложения; 10 000 сравнений – это примерно 10 миллионов MAC, которые современный CPU обрабатывает за 5–10 миллисекунд при использовании векторизованного кода. Итого на один инференс – около 20 миллисекунд. Объём хранения и пропускная способность сети остаются неизменными.
Стоимость вычислений едва отличается. А вот стоимость соблюдения требований – кардинально. Случай верификации 1:1 исключён из Annex III, требует явного согласия по Статье 9 GDPR, но не считается высокорисковой ИИ-системой по AI Act. Случай идентификации 1:N является высокорисковой ИИ-системой согласно Annex III и запускает полный режим из девяти обязательств, описанных выше. Те же 20 миллисекунд работы CPU переводят проект из двухнедельного спринта в шестимесячную программу по обеспечению соответствия. Выбирайте осознанно.
Ключевые выводы
- Детекция лиц не регулируется AI Act и подпадает под статью 6 GDPR; распознавание лиц относится к высокорисковым системам и регулируется статьёй 9 GDPR.
- Два регуляторных режима пересекаются на этапе эмбеддинга – как только система генерирует 512-мерный вектор личности, включается режим особой категории данных.
- AI Act прямо запрещает четыре конкретных применения распознавания лиц в ЕС с февраля 2025 года; разработка или продажа таких систем будет незаконной независимо от наличия согласия.
- К августу 2026 года вступит в силу полный высокорисковый режим – с обязательной документацией, регистрацией, оценкой FRIA, человеческим контролем – почти для всех остальных развертываний распознавания лиц.
- В продакшене по умолчанию с 2026 года рекомендуются: SCRFD-2.5GF для детекции, выравнивание от InsightFace, ArcFace-R50 или AdaFace для эмбеддинга, CelebA-Spoof для пассивной проверки живости и iBeta для сценариев с высокой степенью достоверности.
- Наиболее экономичная позиция с точки зрения соответствия требованиям – архитектурная: разделить детекцию и распознавание, изолировать шлюз согласия, хранить эмбеддинги, а не пиксели, и включать человека в процесс при каждом значимом совпадении.
Что читать дальше
- SAM 2 для видео – модуль памяти, распространение, ротоскопинг – базовый инструмент сегментации, используемый для создания маски области лица, когда требуется именно маска, а не ограничивающая рамка.
- MediaPipe Selfie Segmentation V2 с WebGPU – production-размытие фона – браузерный пайплайн сегментации, который органично сочетается с анонимной детекцией лиц для задач автокадрирования и определения присутствия.
- Форма ИИ внутри видео-продукта – карта архитектуры – архитектурный обзор, объясняющий, как функции, связанные с лицами, интегрируются в типичный видео-пайплайн.