Обсуждение:Дифференциальная конфиденциальность

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
 
(1 промежуточная версия не показана)
Строка 1: Строка 1:
-
== Как проверялась граница приватности ==
+
Статью я делал с помощью '''GPT-5.6 Terra High'''. Сначала отправил такой промпт:
-
 
+
-
Я выбрал тему дифференциальной конфиденциальности, потому что хотел лучше понять её реальные гарантии. В первом запросе я хотел получить понятное объяснение и отделить этот подход от удаления имён, шифрования и федеративного обучения.
+
{{well|
{{well|
-
Ты разбираешься в машинном обучении, криптографии и защите данных. Напиши на русском языке подробную энциклопедическую статью для MachineLearning.ru про дифференциальную конфиденциальность (differential privacy).
+
Напиши подробную статью про дифференциальную конфиденциальность. Сначала простыми словами объясни, зачем она нужна и почему обычного удаления имён из базы недостаточно.
-
Сначала объясни идею простыми словами: какую проблему она решает и почему простого удаления имён из базы недостаточно. Затем перейди к строгому определению, соседним наборам данных, параметрам эпсилон и дельта, чувствительности запроса и базовым механизмам добавления шума.
+
Потом дай точное определение, расскажи про соседние наборы данных, параметры эпсилон и дельта, чувствительность запроса и добавление шума. Добавь механизм Лапласа, гауссовский и экспоненциальный механизмы, композицию и постобработку.
-
Обязательно расскажи про композицию, постобработку, центральную и локальную модели конфиденциальности. Отдельно объясни, как работает DP-SGD и зачем нужны clipping градиентов, гауссовский шум и privacy accounting. Покажи связь с федеративным обучением, но не утверждай, что федеративное обучение само по себе гарантирует приватность.
+
Ещё объясни центральную и локальную модели конфиденциальности, DP-SGD, clipping градиентов, гауссовский шум и privacy accounting. Покажи связь с федеративным обучением, но не пиши, что оно само по себе гарантирует приватность.
-
Статья должна быть понятна студенту, но содержать реальные формулы, ограничения методов и научные источники. Не выдумывай факты, авторов, DOI и результаты исследований. Важные термины оформи как внутренние ссылки, добавь литературу и ссылки на первоисточники.
+
Текст должен быть понятен студенту. Добавь формулы, ограничения, внутренние ссылки и реальные научные источники. Ничего не выдумывай. Формулы пиши через <tex> и </tex>, а перед отдельными формулами ставь два двоеточия.
-
 
+
-
Для формул используй синтаксис <tex>...</tex>. Отдельные формулы выделяй двойным отступом через два двоеточия.
+
}}
}}
-
В первом результате остались упрощения в описании соседних наборов и параметров приватности. Ещё не хватало точного объяснения композиции и работы DP-SGD. Поэтому второй запрос был более конкретным.
+
Первая версия была слишком общей. Не очень чётко объяснялись соседние наборы данных и композиция, а раздел про DP-SGD получился коротким. Также надо было лучше разделить дифференциальную конфиденциальность, шифрование и обычную анонимизацию.
 +
 
 +
После этого я написал второй промпт:
{{well|
{{well|
-
Перепиши и доработай статью «Дифференциальная конфиденциальность» как научный редактор.
+
Доработай статью про дифференциальную конфиденциальность. Дай точное определение с эпсилон и дельта и объясни все обозначения. Подробнее напиши про чувствительность, механизм Лапласа, гауссовский и экспоненциальный механизмы, композицию и постобработку.
-
 
+
-
Добавь точное определение (эпсилон, дельта)-дифференциальной конфиденциальности и объяснение всех обозначений. Добавь раздел о чувствительности запроса, механизме Лапласа, гауссовском и экспоненциальном механизмах. Подробно раскрой композицию и постобработку.
+
-
Усиль раздел о машинном обучении: объясни DP-SGD, clipping индивидуальных градиентов, добавление гауссовского шума, privacy accounting и компромисс между приватностью и качеством модели. Добавь раздел о центральной и локальной моделях, а также о связи с федеративным обучением.
+
Расширь часть про машинное обучение. Нормально объясни DP-SGD, ограничение индивидуальных градиентов, добавление шума, privacy accounting и компромисс между приватностью и качеством модели. Добавь центральную и локальную модели и аккуратно опиши связь с федеративным обучением.
-
Сделай отдельный раздел «Ограничения и типичные заблуждения». В нём прямо укажи, что дифференциальная конфиденциальность не равна шифрованию, анонимизации и автоматической справедливости алгоритма.
+
Отдельно напиши про ограничения и частые заблуждения. Укажи, что дифференциальная конфиденциальность не заменяет шифрование, не равна анонимизации и не делает алгоритм автоматически справедливым.
-
Проверь формулы и вики-разметку. Не используй теги <math>...</math>; используй только <tex>...</tex>. Не растягивай текст пустыми общими фразами, не выдумывай источники и не добавляй несуществующие шаблоны. Верни готовую статью целиком.
+
Проверь формулы, ссылки и разметку. Используй только <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Убери лишние общие фразы и верни статью целиком.
}}
}}
-
После второго запроса я проверил итоговый текст и исправил неточности в описании гарантий и механизмов. Также я привёл формулы, ссылки и вики-разметку в порядок.
+
Готовый текст я потом проверил вручную. Исправил формулы, ссылки и оформление, а ещё посмотрел, чтобы гарантии приватности не были описаны сильнее, чем они работают на самом деле.
[[Участник:Oleg Batsiev|Oleg Batsiev]]
[[Участник:Oleg Batsiev|Oleg Batsiev]]

Текущая версия

Статью я делал с помощью GPT-5.6 Terra High. Сначала отправил такой промпт:


Напиши подробную статью про дифференциальную конфиденциальность. Сначала простыми словами объясни, зачем она нужна и почему обычного удаления имён из базы недостаточно.

Потом дай точное определение, расскажи про соседние наборы данных, параметры эпсилон и дельта, чувствительность запроса и добавление шума. Добавь механизм Лапласа, гауссовский и экспоненциальный механизмы, композицию и постобработку.

Ещё объясни центральную и локальную модели конфиденциальности, DP-SGD, clipping градиентов, гауссовский шум и privacy accounting. Покажи связь с федеративным обучением, но не пиши, что оно само по себе гарантирует приватность.

Текст должен быть понятен студенту. Добавь формулы, ограничения, внутренние ссылки и реальные научные источники. Ничего не выдумывай. Формулы пиши через <tex> и </tex>, а перед отдельными формулами ставь два двоеточия.


Первая версия была слишком общей. Не очень чётко объяснялись соседние наборы данных и композиция, а раздел про DP-SGD получился коротким. Также надо было лучше разделить дифференциальную конфиденциальность, шифрование и обычную анонимизацию.

После этого я написал второй промпт:


Доработай статью про дифференциальную конфиденциальность. Дай точное определение с эпсилон и дельта и объясни все обозначения. Подробнее напиши про чувствительность, механизм Лапласа, гауссовский и экспоненциальный механизмы, композицию и постобработку.

Расширь часть про машинное обучение. Нормально объясни DP-SGD, ограничение индивидуальных градиентов, добавление шума, privacy accounting и компромисс между приватностью и качеством модели. Добавь центральную и локальную модели и аккуратно опиши связь с федеративным обучением.

Отдельно напиши про ограничения и частые заблуждения. Укажи, что дифференциальная конфиденциальность не заменяет шифрование, не равна анонимизации и не делает алгоритм автоматически справедливым.

Проверь формулы, ссылки и разметку. Используй только <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Убери лишние общие фразы и верни статью целиком.


Готовый текст я потом проверил вручную. Исправил формулы, ссылки и оформление, а ещё посмотрел, чтобы гарантии приватности не были описаны сильнее, чем они работают на самом деле.

Oleg Batsiev