Обсуждение:Дифференциальная конфиденциальность
Материал из MachineLearning.
Содержание |
Как проверялась граница приватности
В этой статье главным был не перечень механизмов, а точное понимание того, что именно гарантирует differential privacy. Если не определить соседние наборы, защищаемую единицу и доступный противнику результат, слова «математическая гарантия» мало что объясняют. Поэтому первая версия строилась от различия между удалением идентификаторов и ограничением влияния одной записи.
Для подготовки использовалась GPT-5.6 Terra High. Оба запроса приведены дословно.
Первый запрос: отделить DP от соседних технологий
Первая версия правильно отделяла DP от шифрования и федеративного обучения, но оставляла несколько опасных упрощений. В разных разделах незаметно смешивались add/remove- и replace-one-соседство, параметр описывался как простая «вероятность отказа», а в композиции учитывалась только сумма
. Практическая часть также требовала точнее связать clipping, семплирование и accountant.
Второй запрос: раскрыть механизмы и ограничения
Ручная проверка после генерации
Финальная редакция потребовала не косметической вычитки, а согласования всей модели защиты:
- за основное принято add/remove-соседство, а replace-one вынесено в отдельное пояснение;
- добавлено различие между построчной и пользовательской DP;
-
описано как аддитивный зазор, а не буквально как вероятность полного отказа защиты;
- в базовой композиции исправлена потерянная сумма
;
- приведены формулы
- и
-чувствительности;
- добавлены явные формулы гауссовского и экспоненциального механизмов с условиями применимости;
- отдельно отмечены последовательная и параллельная композиции;
- в DP-SGD уточнены индивидуальный clipping, случайное семплирование, noise multiplier и зависимость результата от accountant;
- для федеративного обучения разделены example-level и user-level DP, защищённая агрегация и собственно DP;
- удалена несвязанная ссылка на квантование нейронных сетей;
- неработающий шаблон примечаний заменён на <references />;
- выбраны существующие категории «Машинное обучение» и «Прикладная статистика».
Названия, страницы и DOI основных публикаций сверялись отдельно. При проверке я исходил из принципа: численное значение само по себе ничего не говорит читателю, пока не указаны соседство, защищаемая единица,
, состав результата и все повторные обращения к данным.

