|
|
| (2 промежуточные версии не показаны) |
| Строка 1: |
Строка 1: |
| - | == Как проверялась граница приватности ==
| + | Статью я делал с помощью '''GPT-5.6 Terra High'''. Сначала отправил такой промпт: |
| - | | + | |
| - | В этой статье главным был не перечень механизмов, а точное понимание того, что именно гарантирует differential privacy. Если не определить соседние наборы, защищаемую единицу и доступный противнику результат, слова «математическая гарантия» мало что объясняют. Поэтому первая версия строилась от различия между удалением идентификаторов и ограничением влияния одной записи.
| + | |
| - | | + | |
| - | Для подготовки использовалась '''GPT-5.6 Terra High'''. Оба запроса приведены дословно.
| + | |
| - | | + | |
| - | === Первый запрос: отделить DP от соседних технологий ===
| + | |
| | | | |
| | {{well| | | {{well| |
| - | Ты разбираешься в машинном обучении, криптографии и защите данных. Напиши на русском языке подробную энциклопедическую статью для MachineLearning.ru про дифференциальную конфиденциальность (differential privacy).
| + | Напиши подробную статью про дифференциальную конфиденциальность. Сначала простыми словами объясни, зачем она нужна и почему обычного удаления имён из базы недостаточно. |
| | | | |
| - | Сначала объясни идею простыми словами: какую проблему она решает и почему простого удаления имён из базы недостаточно. Затем перейди к строгому определению, соседним наборам данных, параметрам эпсилон и дельта, чувствительности запроса и базовым механизмам добавления шума.
| + | Потом дай точное определение, расскажи про соседние наборы данных, параметры эпсилон и дельта, чувствительность запроса и добавление шума. Добавь механизм Лапласа, гауссовский и экспоненциальный механизмы, композицию и постобработку. |
| | | | |
| - | Обязательно расскажи про композицию, постобработку, центральную и локальную модели конфиденциальности. Отдельно объясни, как работает DP-SGD и зачем нужны clipping градиентов, гауссовский шум и privacy accounting. Покажи связь с федеративным обучением, но не утверждай, что федеративное обучение само по себе гарантирует приватность.
| + | Ещё объясни центральную и локальную модели конфиденциальности, DP-SGD, clipping градиентов, гауссовский шум и privacy accounting. Покажи связь с федеративным обучением, но не пиши, что оно само по себе гарантирует приватность. |
| | | | |
| - | Статья должна быть понятна студенту, но содержать реальные формулы, ограничения методов и научные источники. Не выдумывай факты, авторов, DOI и результаты исследований. Важные термины оформи как внутренние ссылки, добавь литературу и ссылки на первоисточники.
| + | Текст должен быть понятен студенту. Добавь формулы, ограничения, внутренние ссылки и реальные научные источники. Ничего не выдумывай. Формулы пиши через <tex> и </tex>, а перед отдельными формулами ставь два двоеточия. |
| - | | + | |
| - | Для формул используй синтаксис <tex>...</tex>. Отдельные формулы выделяй двойным отступом через два двоеточия.
| + | |
| | }} | | }} |
| | | | |
| - | Первая версия правильно отделяла DP от шифрования и федеративного обучения, но оставляла несколько опасных упрощений. В разных разделах незаметно смешивались add/remove- и replace-one-соседство, параметр <tex>\delta</tex> описывался как простая «вероятность отказа», а в композиции учитывалась только сумма <tex>\varepsilon</tex>. Практическая часть также требовала точнее связать clipping, семплирование и accountant. | + | Первая версия была слишком общей. Не очень чётко объяснялись соседние наборы данных и композиция, а раздел про DP-SGD получился коротким. Также надо было лучше разделить дифференциальную конфиденциальность, шифрование и обычную анонимизацию. |
| | | | |
| - | === Второй запрос: раскрыть механизмы и ограничения ===
| + | После этого я написал второй промпт: |
| | | | |
| | {{well| | | {{well| |
| - | Перепиши и доработай статью «Дифференциальная конфиденциальность» как научный редактор.
| + | Доработай статью про дифференциальную конфиденциальность. Дай точное определение с эпсилон и дельта и объясни все обозначения. Подробнее напиши про чувствительность, механизм Лапласа, гауссовский и экспоненциальный механизмы, композицию и постобработку. |
| | | | |
| - | Добавь точное определение (эпсилон, дельта)-дифференциальной конфиденциальности и объяснение всех обозначений. Добавь раздел о чувствительности запроса, механизме Лапласа, гауссовском и экспоненциальном механизмах. Подробно раскрой композицию и постобработку.
| + | Расширь часть про машинное обучение. Нормально объясни DP-SGD, ограничение индивидуальных градиентов, добавление шума, privacy accounting и компромисс между приватностью и качеством модели. Добавь центральную и локальную модели и аккуратно опиши связь с федеративным обучением. |
| | | | |
| - | Усиль раздел о машинном обучении: объясни DP-SGD, clipping индивидуальных градиентов, добавление гауссовского шума, privacy accounting и компромисс между приватностью и качеством модели. Добавь раздел о центральной и локальной моделях, а также о связи с федеративным обучением.
| + | Отдельно напиши про ограничения и частые заблуждения. Укажи, что дифференциальная конфиденциальность не заменяет шифрование, не равна анонимизации и не делает алгоритм автоматически справедливым. |
| | | | |
| - | Сделай отдельный раздел «Ограничения и типичные заблуждения». В нём прямо укажи, что дифференциальная конфиденциальность не равна шифрованию, анонимизации и автоматической справедливости алгоритма.
| + | Проверь формулы, ссылки и разметку. Используй только <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Убери лишние общие фразы и верни статью целиком. |
| - | | + | |
| - | Проверь формулы и вики-разметку. Не используй теги <math>...</math>; используй только <tex>...</tex>. Не растягивай текст пустыми общими фразами, не выдумывай источники и не добавляй несуществующие шаблоны. Верни готовую статью целиком. | + | |
| | }} | | }} |
| | | | |
| - | === Ручная проверка после генерации ===
| + | Готовый текст я потом проверил вручную. Исправил формулы, ссылки и оформление, а ещё посмотрел, чтобы гарантии приватности не были описаны сильнее, чем они работают на самом деле. |
| - | | + | |
| - | Финальная редакция потребовала не косметической вычитки, а согласования всей модели защиты:
| + | |
| - | | + | |
| - | * за основное принято add/remove-соседство, а replace-one вынесено в отдельное пояснение;
| + | |
| - | * добавлено различие между построчной и пользовательской DP;
| + | |
| - | * <tex>\delta</tex> описано как аддитивный зазор, а не буквально как вероятность полного отказа защиты;
| + | |
| - | * в базовой композиции исправлена потерянная сумма <tex>\delta_i</tex>;
| + | |
| - | * приведены формулы <tex>L_1</tex>- и <tex>L_2</tex>-чувствительности;
| + | |
| - | * добавлены явные формулы гауссовского и экспоненциального механизмов с условиями применимости;
| + | |
| - | * отдельно отмечены последовательная и параллельная композиции;
| + | |
| - | * в DP-SGD уточнены индивидуальный clipping, случайное семплирование, noise multiplier и зависимость результата от accountant;
| + | |
| - | * для федеративного обучения разделены example-level и user-level DP, защищённая агрегация и собственно DP;
| + | |
| - | * удалена несвязанная ссылка на квантование нейронных сетей;
| + | |
| - | * неработающий шаблон примечаний заменён на <references />;
| + | |
| - | * выбраны существующие категории «Машинное обучение» и «Прикладная статистика».
| + | |
| - | | + | |
| - | Названия, страницы и DOI основных публикаций сверялись отдельно. При проверке я исходил из принципа: численное значение <tex>\varepsilon</tex> само по себе ничего не говорит читателю, пока не указаны соседство, защищаемая единица, <tex>\delta</tex>, состав результата и все повторные обращения к данным.
| + | |
| | | | |
| - | — [[Участник:Oleg Batsiev|Oleg Batsiev]]
| + | [[Участник:Oleg Batsiev|Oleg Batsiev]] |
Первая версия была слишком общей. Не очень чётко объяснялись соседние наборы данных и композиция, а раздел про DP-SGD получился коротким. Также надо было лучше разделить дифференциальную конфиденциальность, шифрование и обычную анонимизацию.
Готовый текст я потом проверил вручную. Исправил формулы, ссылки и оформление, а ещё посмотрел, чтобы гарантии приватности не были описаны сильнее, чем они работают на самом деле.