Маскирование, редактирование, приватная аналитика

Автор: Николай СапуновОбновлено: август 202615 мин чтения
Содержание статьи +

Это инженерное руководство, а не юридический совет. Уточняйте конкретику у квалифицированного юриста.

Кратко

Маскирование лиц, редактирование и приватная аналитика – это три инженерных приёма, которые позволяют системе наблюдения сохранить пользу для безопасности и сбросить почти весь риск приватности, и всем ими управляет один вопрос: можно ли скрытие отменить. Обратимые приёмы – живой блюр с сохранённым оригиналом, замаскированный вид, который оператор снимает ключом, – это псевдонимизация по европейскому GDPR: данные остаются персональными, и все обязанности GDPR действуют. Необратимые приёмы, которые уничтожают исходные пиксели, могут достичь анонимизации, а она по Recital 26 GDPR выводит данные из-под закона целиком – но только если реидентификация больше невозможна любыми средствами, разумно вероятными к применению. Дорогая ошибка – считать пикселизированное или размытое лицо анонимным, когда опубликованные исследования восстанавливали личности именно из такого скрытия, так что наивный блюр – не тот необратимый шаг, за который его принимают.

Почему это важно

Это статья об инженерном слое приватности в блоке комплаенса наблюдения, написанная для системного интегратора, продакт-менеджера, руководителя ритейла или умного здания, владельца городской безопасности – для того, кому нужно сохранить камеры полезными, не превратив систему в источник риска приватности. Маскирование и редактирование – это место, где абстрактные принципы из статьи приватность по умолчанию для видеонаблюдения становятся конкретными функциями, которые вы задаёте, закупаете и включаете, – и где неверное допущение (что любой блюр равен анонимизации, что маскирование просмотра кого-то защищает, если вы всё равно пишете оригинал) тихо встраивает несоответствие нормам в продукт. Юридическое образование или знание машинного обучения для чтения не нужны. Каждый термин определён простым языком и привязан к названной норме или стандарту, а цель – оставить вас способным отличить контроль приватности, который действительно убирает риск, от того, который лишь выглядит так.

Четыре операции, которые путают в одном слове

Слово «маскирование» применяют как минимум к четырём разным задачам, и дизайн наблюдения ломается в момент, когда их считают взаимозаменяемыми. Сначала разведём их.

Privacy-маски (зоны приватности) – это фиксированные забеленные области вида камеры. Вы направляете камеру на парковку, но её край задевает окно соседа – и вы закрашиваете прямоугольник поверх этого окна, и камера никогда не пишет то, что за ним. Маска привязана к сцене, а не к человеку, и задаётся один раз при установке.

Динамическое маскирование (живая анонимизация) – это софт, который находит людей, лица или автомобильные номера в каждом кадре и закрывает их по ходу проигрывания, в реальном времени. Ничто в сцене не запрещено навсегда; система решает кадр за кадром, что скрыть. Это как движущаяся наклейка, которая следует за каждым человеком по картинке.

Редактирование – это вариант постфактум: у вас есть запись, нужно поделиться фрагментом – для страхового случая, суда или запроса субъекта данных, – и вы скрываете всех, кто не относится к делу, прежде чем файл уйдёт из ваших рук. Редактирование – это операция на хранимом видео в момент экспорта, а не живая.

Приватная аналитика – самая непохожая из четырёх: вместо того чтобы прятать людей в видео, вы вообще не храните видео и считаете аналитику на данных, которые изначально не были идентифицирующими, – счётчик, тепловую карту, событие, – обычно прямо на камере, а наружу отдаёте числа.

Рисунок 1. Четыре операции, четыре места в конвейере. Privacy-маски забеливают фиксированные зоны на камере; динамическое маскирование скрывает людей в просмотре; редактирование скрывает посторонних на экспорте; приватная аналитика отдаёт счётчики и события вместо идентифицирующего видео.

Эти четыре – не конкуренты: серьёзная система применяет несколько сразу. Но они стоят в разных точках конвейера, несут разную стоимость и – что важнее всего – ложатся по разные стороны одной границы, которая решает их юридический вес.

Граница, которая решает всё: можно ли это отменить?

Прежде чем любая техника начнёт иметь значение, зафиксируйте различие, вокруг которого вертится вся область. Возьмите изображение человека и скройте его личность. Есть две принципиально разные вещи, которые вы могли сделать.

Если оригинал – лицо без маски – всё ещё где-то существует, или скрытие можно вычислить обратно в узнаваемое изображение, вы псевдонимизировали данные. Статья 4(5) GDPR определяет псевдонимизацию как обработку персональных данных так, что их больше нельзя приписать человеку «без использования дополнительной информации», которая хранится отдельно. Ключевое следствие, прямо сказанное в Recital 26 GDPR: псевдонимизированные данные «следует считать информацией об идентифицируемом физическом лице» – это по-прежнему персональные данные, и все обязанности GDPR действуют. Замаскированный просмотр, чей оригинал лежит в хранилище, – это псевдонимизация. Обратимый блюр – это псевдонимизация. Вы снизили риск, и это ценно, но вы не вышли из-под регламента.

Если оригинал по-настоящему исчез – идентифицирующие пиксели уничтожены, нет ключа и восстановимой копии, – вы, возможно, анонимизировали данные. Recital 26 говорит, что принципы защиты данных «не должны применяться к анонимной информации», так что настоящая анонимизация выводит запись из-под GDPR целиком. Но планка сурова: тот же recital проверяет идентифицируемость на «все средства, разумно вероятные к применению… контролёром или другим лицом», с учётом доступной технологии и её развития. Анонимизация – это не галочка, которую вы ставите; это утверждение, что никто, методами, существующими сейчас или предвидимыми, не сможет вернуть личность.

Рисунок 2. Стержень статьи. Обратимое скрытие – псевдонимизация: это персональные данные, по-прежнему внутри GDPR (ст. 4(5), Recital 26). Только по-настоящему необратимое скрытие достигает анонимизации и выходит за пределы GDPR.

Держите эту границу в голове для каждой техники ниже. Вопрос никогда не «мы это размыли?». Вопрос – «можно ли вернуть личность любыми средствами, разумно вероятными к применению?», и ответ решает, несёте ли вы по-прежнему персональные данные.

Privacy-маски: простейший контроль, стандартизированный на камере

Privacy-маски – старейшая и самая дешёвая функция приватности, и поскольку они настраиваются на самой камере, они же и самые совместимые. Стандарт ONVIF – общий язык, позволяющий камерам и софту разных производителей работать вместе, разобранный в статье ONVIF для инженеров, – стандартизирует их в спецификации Media2 Service. Маска задаётся как полигон в координатах, нормированных к источнику видео; камера сообщает, сколько масок и сколько рёбер полигона она поддерживает (многие устройства ограничиваются прямоугольниками), а VMS может перечислять, создавать, изменять и удалять маски по стандартному интерфейсу. Некоторые устройства даже умеют автоматически обновлять положение маски при движении камеры.

Поскольку маска накладывается на камере до кодирования потока, скрытая область вообще не записывается. Это делает privacy-маску одним из немногих контролей, необратимых по построению, – за ней нет оригинала, который можно вернуть. Её предел – ровно её сила: она статична. Она забеливает фиксированную область сцены, поэтому защищает окно соседа, но ничего не делает с людьми, идущими по парковке, за которой вы как раз хотите следить. Для них нужно нечто движущееся.

Динамическое маскирование: приватность в просмотре и ловушка обратимости

Динамическое маскирование использует аналитику, чтобы обнаруживать людей, лица или номера и закрывать их по ходу проигрывания. Здесь граница обратимого и необратимого работает по-настоящему, потому что динамическое маскирование поставляется в двух очень разных формах, выглядящих на экране одинаково.

Обратимая форма маскирует просмотр для обычного мониторинга, но сохраняет оригинал, зашифрованным, чтобы санкционированное расследование могло снять маску. Genetec KiwiVision Privacy Protector – ясный пример: операторы видят обезличенный вид, а восстановление записи без маски требует дополнительного слоя прав доступа, используемого, только когда того требует событие, с журналом аудита, фиксирующим, кто снял обезличивание и зачем. Это сильный шаблон приватности по умолчанию – он принуждает к минимизации данных в повседневной работе и к двойному контролю над реидентификацией, – но в терминах GDPR это псевдонимизация, а не анонимизация. Оригинал существует; данные остаются персональными; лимиты хранения, правовое основание и права субъектов данных по-прежнему действуют. Это не порок, если только вы не примете это за выход из-под регламента.

Постоянная форма вжигает маску в запись, так что оригинал не хранится. Axis Live Privacy Shield, например, может наложить либо сплошную заливку (сильнейшая приватность, видно только движение), либо мозаику/пикселизацию (низкое разрешение силуэтов), и маскирование записывается в хранимое видео. Постоянное маскирование – настоящий кандидат на анонимизацию, но лишь если метод маскирования нельзя обратить, а именно здесь большинство команд спотыкается.

«Частая ошибка: маскировать просмотр, записывая оригинал без маски. Система, которая показывает операторам размытый поток, но хранит сырое идентифицируемое видео, ничего не анонимизировала – она псевдонимизировала вид и сохранила персональные данные целиком. Все обязанности GDPR (лимит хранения, правовое основание, доступ субъекта, риск утечки) применяются к этому хранимому оригиналу так, будто маскирования не было. Замаскированный монитор – это полезный контроль доступа, а не снижение объёма данных, которые вы держите.»

Редактирование: отдать видео, не раскрыв посторонних

Редактирование – это работа в момент экспорта. Ритейлер получает запрос субъекта на доступ, суд требует фрагмент, закон о публичных записях вынуждает раскрытие – и на записи есть другие люди со своими правами приватности. Европейский совет по защите данных (EDPB) прямо обращается к этому в своих Guidelines 3/2019 о видеоустройствах: когда в материале, выдаваемом по запросу на доступ, идентифицируемы другие люди, эту часть следует обезличить, «например, размыв копию», и подчёркивает, что размытие должно оставлять «никакой возможности задним числом восстановить» данные, чтобы считаться действительно анонимным.

Эта последняя оговорка – вся суть. Современные инструменты редактирования используют модели обнаружения, чтобы отслеживать и скрывать каждое лицо или тело во фрагменте – работа, которая раньше занимала у редактора часы на минуту материала, а теперь идёт за минуты, – но экспорт анонимен, только если скрытие необратимо на экспортированном файле и вместе с ним не отправляется ссылка обратно к источнику. Правильно сделанное редактирование – один из самых ясных законных случаев необратимого скрытия во всём конвейере, потому что вы по определению создаёте одноразовую копию и уничтожаете личность внутри неё.

Ловушка под всем этим: блюр и пикселизация часто обратимы

Вот вывод, который тихо обесценивает много «анонимизированного» видео. Размытие и пикселизация ощущаются так, будто уничтожают информацию. Они её не уничтожают; они её перемешивают – а перемешанную информацию можно восстановить.

В исследовании 2016 года Defeating Image Obfuscation with Deep Learning учёные обучили нейросети опознавать людей на изображениях, скрытых стандартными приёмами. Против лиц, пикселизированных мозаикой 16×16 – того блочного цензурирования, что вы видите по телевизору, – сеть называла верного человека примерно в 57% случаев, поднимаясь до 72% при пяти попытках, на наборе из 530 человек. Против блюра YouTube, наложенного на лица, она превышала 50% точности на наборе из 40 лиц. Более поздние работы пошли дальше, восстанавливая узнаваемые лица из размытых и пикселизированных изображений, а не просто сопоставляя их, потому что идентифицирующая информация была лишь скрыта, а не удалена.

Урок не «никогда не размывайте». Он в том, что лёгкий блюр и грубая пикселизация обратимы, поэтому это псевдонимизация, а не анонимизация – они оставляют видео внутри GDPR и могут провалиться как мера приватности целиком. Если вам нужно, чтобы экспорт был по-настоящему анонимным, используйте метод, уничтожающий пиксели: сплошную заливку поверх области или замену, а не восстановимое размазывание. Именно поэтому развёртывания распознавания лиц, разобранные в статье распознавание лиц в видеонаблюдении, не могут опереться на блюр, чтобы уйти от биометрических правил статьи 9 GDPR.

Рисунок 3. Почему «мы размыли» – это не анонимизация. Измеренная реидентификация из скрытых изображений (Defeating Image Obfuscation with Deep Learning, 2016) показывает, что пикселизация и блюр восстановимы; только методы, уничтожающие пиксели, приближаются к необратимости.

Приватная аналитика: сильнейший ход – не хранить видео

Все техники выше исходят из идентифицирующего видео и пытаются его скрыть. Приватная аналитика переворачивает задачу: устройте систему так, чтобы идентифицирующие данные вообще не хранились. Это самая надёжная позиция приватности, потому что восстанавливать нечего.

Чистейший вариант – обработка только метаданных на краю. Запустите аналитику на камере или edge-устройстве – выбор развёртывания разобран в статье аналитика на краю против облака – и отдавайте наружу только результат: счётчик людей, время пребывания, длину очереди, событие пересечения линии. Сырые кадры не покидают устройство, поэтому центральная система держит числа, а не лица. EDPB Guidelines 3/2019 указывают ровно в эту сторону под принципом минимизации данных, рекомендуя отключать ненужные функции – распознавание лиц, аудио – и маскировать или скрывать то, что не относится к цели.

Пройдём числа один раз, потому что разрыв огромен. Камера ритейла, передающая видео H.265 на 4 Мбит/с в облако для подсчёта людей, отправляет за сутки:

сырое видео/сутки = 4 Мбит/с × 86 400 с ÷ 8 бит/байт
                  = 43 200 мегабайт
                  ≈ 43,2 ГБ на камеру в сутки  (каждое лицо в нём)

Теперь посчитайте на камере и шлите одну маленькую запись каждые 5 минут:

метаданные/сутки = 288 записей × ~200 байт
                 ≈ 57,6 КБ на камеру в сутки  (ни одного лица)

Это примерно в 750 000 раз меньше данных – и, что куда важнее, идентифицирующее содержимое падает до нуля. Облако никогда не получает узнаваемого изображения, поэтому нет биометрии, которую надо защищать, нет оригинала для утечки и куда меньше для хранения под лимитами, которые мы разбираем в статье лимиты хранения и законное удаление.

Когда вам всё же нужно хранить более богатые данные – для поиска по нескольким камерам или анализа трендов, – вы переходите к формальному обезличиванию, и здесь словарь стандартов помогает быть честным. Opinion 05/2014 об обезличивании Рабочей группы по статье 29 сортирует методы на два семейства: рандомизация (добавление шума, перестановка и differential privacy – внесение откалиброванного математического шума, чтобы отдельные записи нельзя было выделить) и обобщение (агрегация и k-anonymity, где каждая запись становится неотличима минимум от k−1 других, с l-diversity и t-closeness как уточнениями). ISO/IEC 20889:2018 стандартизирует эту терминологию и классификацию, а отчёт NIST NISTIR 8053 обозревает обезличивание персональной информации; оба – точки отсчёта, которые узнает аудитор. Тот же Opinion предупреждает, что псевдонимизация – не анонимизация, и что любой метод надо проверять на три остаточных риска: выделение человека, связывание записей между наборами и вывод новых фактов о человеке. Техника, оставляющая открытым хоть один из трёх, данные не анонимизировала.

Рисунок 4. У обезличивания есть словарь. Рандомизация и обобщение (Article 29 WP 05/2014; ISO/IEC 20889) – анонимизация, только если закрыты все три риска реидентификации: выделение, связывание и вывод.

Есть и более новый вариант между скрытием и нехранением – замена на синтетическое лицо, где генеративная модель меняет каждое реальное лицо на правдоподобное, но вымышленное, не принадлежащее никому, так что сцена остаётся пригодной для обучения или демонстрации, а личности исчезают. При аккуратном применении это может быть необратимо, но проходит тот же тест – если отображение обратно к реальному лицу хранится или обучаемо, это снова псевдонимизация.

Техники рядом

Четыре операции и путь обезличивания ложатся по-разному на ту самую границу. Таблица – это вся статья сжато.

ТехникаГде применяетсяОбратимо?Статус по GDPRДля чего лучше
Privacy-маска (ONVIF)На камере, фикс. зонаНет – зона не пишетсяВне сферы для этой зоныИсключить области, что нельзя снимать
Динам. маска, обратимаяПросмотр VMS, оригинал хранитсяДа – по замыслу, с ключомПсевдонимизация – персональныеМониторинг с аудируемым снятием
Динам. / постоянная маскаВжата в записьТолько если пиксели уничтоженыАнонимизация, если необратимоЗапись, где личность не нужна
РедактированиеПри экспорте записиДолжно быть необратимо на копииАнонимная копия, если невосстановимаЗапросы, суд, публичные записи
Обезличенная аналитикаEdge / слой обработкиНет – личность не хранитсяВне сферы, если нет реидентификацииПодсчёт, тепловые карты, тренды
«Частая ошибка: считать ползунок блюра контролем комплаенса. Удовлетворяет ли техника скрытия GDPR, зависит от необратимости и от того, хранится ли оригинал, – а не от того, насколько сильным выглядит блюр. Тяжёлая мозаика поверх записи с хранимым оригиналом – это псевдонимизация; сплошная заливка на экспорте с уничтоженным оригиналом может быть анонимизацией. Задавайте технику по её влиянию на восстановимость, а не по виду на экране.»

Выбор между этими техниками сводится к одному вопросу, заданному рано: что вам понадобится от данных потом? Если расследованию может понадобиться личность, вы на территории обратимого маскирования и несёте данные как персональные. Если оригинал вам никогда не понадобится, его можно уничтожить; а если видео вообще не нужно, сильнейший ход – хранить только счётчик.

Рисунок 5. Выбор в одном дереве. Нужно вернуть личность потом – обратимое маскирование (псевдонимизация); видео не нужно вовсе – аналитика только метаданных на краю, сильнейшая позиция приватности.

Где здесь Фора Софт

Мы строим системы видеонаблюдения и компьютерного зрения, и в этой работе приватность – архитектурное решение, принимаемое на уровне пикселя и конвейера, а не настройка, включаемая в конце. Системы, выдерживающие и реальную нагрузку, и вопросы регулятора, – это те, где аналитика идёт на краю и отдаёт счётчик вместо лица, где маскирование устроено так, что хранимый оригинал управляется ровно как персональные данные, которыми он остаётся, и где любой «анонимный» экспорт сделан уничтожением пикселей, а не размазыванием. Мы проектируем такие конвейеры с реалистичными ожиданиями – детекция, маскирующая людей в реальном времени, несёт диапазон точности и полноты, зависящий от сцены, освещения и плотности, а пропущенная детекция – это незамаскированное лицо, поэтому система настраивается и проверяется соответственно. Сферы, где это важнее всего – видеонаблюдение, компьютерное зрение, аналитика ритейла, умные здания, – ровно те, в которых мы работаем.

Ключевые выводы

  • Privacy-маски, динамическое маскирование, редактирование и обезличенная аналитика – четыре разные задачи в четырёх точках конвейера.
  • Управляющий вопрос – обратимость: восстановимое скрытие это псевдонимизация и остаётся внутри GDPR.
  • Настоящая анонимизация (Recital 26) требует невозможности реидентификации любыми разумно вероятными средствами.
  • Маскировать просмотр, храня оригинал без маски, юридически никого не защищает – оригинал остаётся персональными данными.
  • Пикселизация и блюр часто обратимы; только уничтожение пикселей приближается к анонимизации.
  • Сильнейший контроль – аналитика только метаданных на краю: отдавайте счётчики, не храните лицо.

Что читать дальше

Строите такую систему?

Подберём параметры кодирования под ваш контент и посчитаем стоимость доставки до старта разработки.