Дифференциальная конфиденциальность

Материал из MachineLearning.

Версия от 12:18, 19 июля 2026; Oleg Batsiev (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск
Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 18:00, 11 июля 2026 (MSD).

Промпты и описание проверки приведены в Обсуждение:Дифференциальная конфиденциальность.


Содержание

Дифференциальная конфиденциальность (англ. differential privacy, DP) — формальное свойство рандомизированного алгоритма обработки данных, ограничивающее влияние одной записи на распределение его результатов. Оно применяется при публикации статистики, обучении моделей машинного обучения и анализе чувствительных данных, когда полезность результата необходимо сочетать с количественно заданной защитой приватности.

В отличие от удаления имён, ограничения доступа или шифрования хранилища, дифференциальная конфиденциальность относится к результату вычисления. Неформально она требует, чтобы по опубликованному результату было трудно уверенно определить, участвовали ли данные конкретного человека в обработке. Гарантия действует относительно явно выбранного отношения соседства наборов данных и не заменяет остальные меры информационной безопасности.

Мотивация

Удаление прямых идентификаторов не всегда предотвращает раскрытие информации. Комбинации оставшихся признаков могут повторно идентифицировать человека, а серия точно подобранных статистических запросов — раскрыть вклад отдельных записей или позволить частично восстановить исходные данные. Поэтому приватность нельзя свести к тому, содержит ли опубликованная таблица имена.

Дифференциальная конфиденциальность предлагает сравнительную гарантию. Рассматриваются два почти одинаковых набора данных: один содержит запись человека, другой — нет. Алгоритм должен выдавать статистически близкие распределения результатов в обоих случаях. Обычно для этого ограничивают влияние одной записи, добавляют контролируемую случайность и учитывают совокупную потерю приватности при повторном использовании данных.

DP не обещает скрыть факты, которые можно вывести из общих закономерностей популяции. Например, если определённое заболевание сильно связано с возрастом, знание возраста уже может позволять сделать вероятностный вывод независимо от участия человека в конкретной базе. Гарантия ограничивает дополнительное раскрытие, вызванное включением его записи в вычисление.

Соседние наборы данных и модель защиты

Определение DP начинается с выбора отношения соседства (англ. adjacency relation). В этой статье основным считается отношение добавления или удаления одной записи: D\sim D', если один набор получается из другого добавлением либо удалением данных одного участника. Такая модель непосредственно защищает факт участия в наборе.

Используется также отношение замены: два набора одинакового размера соседствуют, если отличаются значением одной записи. Эта модель удобна, когда размер набора считается общедоступным. Гарантии и чувствительность запроса зависят от выбранного отношения, поэтому его необходимо указывать в описании системы. Нельзя определять приватность через добавление или удаление записи, а затем без оговорки вычислять чувствительность для её замены.

Единицей защиты может быть не строка таблицы, а пользователь, пациент, устройство или организация. Если один человек создаёт много строк, построчная DP не равна пользовательской DP: для защиты всего участника соседними должны считаться наборы, различающиеся всей группой его записей.

Формальное определение

Пусть \mathcal{M} — рандомизированный алгоритм, D\sim D' — соседние наборы данных, а S — любое измеримое множество возможных результатов. Алгоритм \mathcal{M} удовлетворяет (\varepsilon,\delta)-дифференциальной конфиденциальности, если

\Pr[\mathcal{M}(D)\in S]\leq e^\varepsilon\Pr[\mathcal{M}(D')\in S]+\delta

для всех соседних D,D' и всех S.[1]

Параметр \varepsilon ограничивает мультипликативное различие вероятностей результатов. Чем меньше \varepsilon, тем ближе распределения и тем сильнее гарантия при прочих равных условиях. Однако более строгая гарантия обычно требует большего шума и снижает полезность результата.

Параметр \delta задаёт допустимый аддитивный зазор между вероятностями событий. Его иногда неформально описывают как вероятность исключительных исходов, для которых чистая мультипликативная граница недостаточна, но буквально отождествлять \delta с вероятностью «отказа всей защиты» некорректно. Случай \delta=0 называют чистой \varepsilon-дифференциальной конфиденциальностью, а \delta>0 — приближённой DP.

Числа \varepsilon и \delta имеют смысл только вместе с отношением соседства, единицей защиты, описанием алгоритма и составом публикуемого результата. Одинаковое значение \varepsilon в двух системах не гарантирует одинакового практического риска.

Чувствительность запроса

Пусть f(D) — детерминированная функция набора данных: например, сумма, число пользователей с определённым свойством или вектор статистик. Глобальная L_1-чувствительность определяется как

\Delta_1 f=\max_{D\sim D'}\lVert f(D)-f(D')\rVert_1.

Аналогично, L_2-чувствительность равна

\Delta_2 f=\max_{D\sim D'}\lVert f(D)-f(D')\rVert_2.

Для подсчёта числа участников с некоторым свойством при add/remove-соседстве чувствительность равна единице. Для суммы или среднего необходимо заранее ограничить допустимый вклад одной записи. Без ограничения диапазона один экстремальный объект может сделать глобальную чувствительность неограниченной, а требуемый шум — практически бесполезным.

Чувствительность относится не к «типу запроса вообще», а к конкретной функции, области допустимых данных и модели соседства.

Базовые механизмы

Механизм Лапласа

Для числового запроса с конечной L_1-чувствительностью механизм Лапласа имеет вид

\mathcal{M}(D)=f(D)+(Y_1,\ldots,Y_k),\qquad Y_j\sim\operatorname{Lap}\left(0,\frac{\Delta_1 f}{\varepsilon}\right).

Компоненты шума независимы. Этот механизм обеспечивает чистую \varepsilon-DP относительно использованного при вычислении \Delta_1 f отношения соседства.

Гауссовский механизм

Гауссовский механизм добавляет к векторному ответу нормальный шум:

\mathcal{M}(D)=f(D)+\mathcal{N}(0,\sigma^2 I).

Классическая достаточная калибровка для 0<\varepsilon<1 имеет вид

\sigma\geq\frac{\Delta_2 f\sqrt{2\ln(1.25/\delta)}}{\varepsilon}.

Это не единственная и не всегда наиболее точная калибровка; аналитический гауссовский механизм и современные accountants могут давать более тесные оценки. Важно, что масштаб шума зависит от L_2-чувствительности, \varepsilon и \delta.[1]

Экспоненциальный механизм

Если требуется выбрать не числовой ответ, а элемент r из множества кандидатов \mathcal{R}, используют функцию качества u(D,r) с чувствительностью \Delta u. Экспоненциальный механизм выбирает результат с вероятностью

\Pr[\mathcal{M}(D)=r]\propto\exp\left(\frac{\varepsilon u(D,r)}{2\Delta u}\right).

Кандидаты с более высоким качеством получают большую вероятность, но влияние одной записи на распределение выбора ограничивается.[1]

Постобработка и композиция

Постобработка означает, что преобразование уже приватного результата без дополнительного доступа к исходным данным не ухудшает его DP-гарантию. Можно строить график, округлять числа или обучать последующую модель только на выходе \mathcal{M}(D). Однако если постобработка снова обращается к исходным данным, это уже новый механизм, который должен учитываться отдельно.

При последовательной композиции потери приватности накапливаются. Если к одним данным применены механизмы с гарантиями (\varepsilon_i,\delta_i), базовая теорема композиции даёт

\varepsilon_{\mathrm{total}}=\sum_{i=1}^{k}\varepsilon_i,\qquad
\delta_{\mathrm{total}}=\sum_{i=1}^{k}\delta_i.

Эта граница часто консервативна. Для многократных итераций применяют усиленные теоремы композиции, учёт моментов и дифференциальную конфиденциальность Реньи (англ. Rényi differential privacy, RDP). RDP удобно композируется, после чего итоговую гарантию переводят в параметры (\varepsilon,\delta).[1]

Если механизмы работают на непересекающихся группах участников, при определённых условиях действует параллельная композиция: общий расход определяется максимумом, а не суммой бюджетов. Поэтому корректный accountant должен учитывать не только число запусков, но и то, какие участники затронуты каждым из них.

Центральная и локальная модели

В центральной модели (англ. central differential privacy) доверенный оператор получает исходные данные, применяет приватный алгоритм и раскрывает только его результат. DP защищает от вывода по опубликованному результату, но сама по себе не защищает исходное хранилище от взлома или злоупотреблений оператора.

В локальной модели (англ. local differential privacy) каждый пользователь рандомизирует данные до передачи серверу. Сервер получает уже искажённое сообщение и не видит исходное значение. Классический пример подобной идеи — рандомизированный ответ.

Локальная модель уменьшает необходимое доверие к оператору, но обычно требует большего числа участников для той же статистической точности. Это не просто «более сильная центральная DP»: у моделей различаются доверенные стороны, наблюдаемые сообщения и границы достижимой полезности.

Дифференциально конфиденциальное обучение

DP-SGD (англ. differentially private stochastic gradient descent) модифицирует стохастический градиентный спуск. На каждом шаге случайно формируется мини-батч B. Для каждого примера вычисляется индивидуальный градиент g_i, после чего его L_2-норма ограничивается порогом C:

\widetilde g_i=\frac{g_i}{\max\left(1,\frac{\lVert g_i\rVert_2}{C}\right)}.

К сумме ограниченных градиентов добавляется гауссовский шум:

\bar g=\frac1{|B|}\left(\sum_{i\in B}\widetilde g_i+\mathcal{N}(0,\sigma^2C^2I)\right),

где \sigma — множитель шума. Ограничение индивидуальных, а не уже усреднённых градиентов задаёт максимальный вклад одного примера. Случайное семплирование мини-батча может усиливать приватность, но точная гарантия зависит от схемы семплирования.

Итоговые \varepsilon и \delta зависят от доли семплирования, числа шагов, \sigma, модели соседства и выбранного accountant. Их нельзя определить только по величине шума одного шага.[1]

DP-SGD создаёт компромисс между приватностью, точностью и вычислительной стоимостью. Малое значение \varepsilon, большой шум или неудачно выбранный порог C могут ухудшить обучение. Кроме того, формальная гарантия не означает, что модель будет одинаково полезна для всех подгрупп данных.

Связь с федеративным обучением

Федеративное обучение и DP решают разные задачи. Федеративное обучение позволяет не передавать исходные примеры на центральный сервер, но градиенты и обновления модели сами могут содержать информацию об участниках. Поэтому федеративный протокол не является автоматически приватным.

DP можно применять на уровне отдельных примеров или целых пользователей. При пользовательской DP ограничивается совокупный вклад клиента, после чего шум добавляется к агрегированным обновлениям. Защищённая агрегация может скрывать отдельное обновление от сервера, но не заменяет DP: эти механизмы имеют разные модели угроз и могут дополнять друг друга.[1]

Ограничения и типичные заблуждения

Дифференциальная конфиденциальность не означает, что:

  • исходные данные зашифрованы или защищены от кражи;
  • данные стали анонимными во всех возможных смыслах;
  • злоумышленник ничего не узнает о человеке из общих закономерностей;
  • любой выбор \varepsilon и \delta обеспечивает практически сильную защиту;
  • приватная модель автоматически справедлива, точна или безопасна.

Типичные ошибки реализации и отчётности:

  • не указывать отношение соседства и единицу защиты;
  • смешивать построчную и пользовательскую DP;
  • выбирать \varepsilon и \delta без анализа угроз;
  • забывать о композиции запросов, экспериментов и раундов обучения;
  • оценивать чувствительность до ограничения допустимого вклада записи;
  • публиковать только итоговый \varepsilon, не сообщая \delta, схему семплирования и accountant;
  • переносить гарантию алгоритма на логи, резервные копии, исходное хранилище и действия администраторов.

DP может влиять на разные подгруппы неодинаково, поскольку добавление шума и отсечение градиентов меняют качество модели. Поэтому справедливость и полезность необходимо проверять отдельно.

Практический порядок работы

  1. Определить защищаемую единицу: строку, пользователя, устройство или организацию.
  2. Описать противника, доступные ему результаты и доверенные стороны.
  3. Выбрать отношение соседства и центральную либо локальную модель.
  4. Ограничить вклад участника и вычислить чувствительность.
  5. Задать \varepsilon и \delta с содержательным обоснованием.
  6. Выбрать механизм и accountant, учитывающий все обращения к данным.
  7. Проверить полезность, калибровку и качество по значимым подгруппам.
  8. Вместе с результатом опубликовать параметры гарантии, единицу защиты, схему семплирования и ограничения системы.

См. также

Примечания


Литература

  • Dwork C., McSherry F., Nissim K., Smith A. Calibrating Noise to Sensitivity in Private Data Analysis // Theory of Cryptography Conference. — 2006. — С. 265–284.
  • McSherry F., Talwar K. Mechanism Design via Differential Privacy // 48th Annual IEEE Symposium on Foundations of Computer Science. — 2007. — С. 94–103.
  • Dwork C., Roth A. The Algorithmic Foundations of Differential Privacy. — Foundations and Trends in Theoretical Computer Science. — 2014 T. 9. — С. 211–407.
  • Abadi M., Chu A., Goodfellow I., McMahan H. B., Mironov I., Talwar K., Zhang L. Deep Learning with Differential Privacy // Proceedings of the 2016 ACM SIGSAC Conference on Computer and Communications Security. — 2016. — С. 308–318.
  • Mironov I. Rényi Differential Privacy // 2017 IEEE 30th Computer Security Foundations Symposium. — 2017. — С. 263–275.
  • Kairouz P. и др. Advances and Open Problems in Federated Learning // Foundations and Trends in Machine Learning. — 2021. — Т. 14. — № 1–2. — С. 1–210.
  • Kairouz P., McMahan B., Song S., Thakkar O., Thakurta A., Xu Z. Practical and Private (Deep) Learning Without Sampling or Shuffling // Proceedings of the 38th International Conference on Machine Learning. — 2021. — С. 5213–5225.
Личные инструменты