|
|
| Строка 1: |
Строка 1: |
| - | == Три разных сигнала: данные, концепт и качество ==
| + | Для статьи про дрейф данных я использовал '''GPT-5.6 Terra High'''. Начал с такого промпта: |
| | | | |
| - | Статья «Дрейф данных» была подготовлена с помощью '''GPT-5.6 Terra High'''. Я выбрал эту тему, потому что после внедрения модель нередко начинает работать хуже не из-за ошибки в алгоритме, а потому что изменились сами данные, пользователи или процесс их сбора. Хотелось сделать статью не только про определение, но и про то, как такую проблему реально замечают и что с ней делают.
| + | {{well| |
| | + | Напиши подробную статью про дрейф данных. Объясни, почему после запуска модель может начать работать хуже, даже если её код и параметры не менялись. |
| | | | |
| - | Первый запрос был таким:
| + | Раздели covariate shift, label shift и concept drift и покажи различия через распределения вероятностей. Напиши, что несколько типов сдвига могут происходить одновременно. |
| | | | |
| - | {{well|Помоги подготовить русскоязычную энциклопедическую статью для MachineLearning.ru под названием «Дрейф данных» (data drift, distribution shift). Пиши для студента, который уже знает основы машинного обучения, но ещё не работал с моделями в эксплуатации.
| + | Добавь причины и разные формы дрейфа во времени. Расскажи про мониторинг признаков, прогнозов и качества, особенно когда правильные ответы приходят с задержкой. Объясни фиксированные и адаптивные окна, ADWIN, периодическое переобучение, скользящее окно, веса по давности, онлайн-обучение и ансамбли. |
| | | | |
| - | Сначала объясни, почему модель, хорошо работавшая на обучающей выборке, может начать ошибаться после внедрения. Затем аккуратно раздели ковариатный сдвиг, сдвиг априорных вероятностей классов и дрейф концепта. Для каждого случая запиши условие через вероятностные распределения. Объясни, что в реальности эти типы могут сочетаться.
| + | Не пиши, что после любого сигнала модель надо сразу переобучать. Отдели реальное изменение среды от поломки сбора или обработки данных. Используй реальные источники и внутренние ссылки. Формулы оформляй через <tex> и </tex>, а отдельные формулы начинай с двух двоеточий. |
| | + | }} |
| | | | |
| - | Обязательно добавь причины дрейфа, формы изменения во времени, мониторинг признаков, предсказаний и качества модели при отложенной разметке. Расскажи про фиксированные и адаптивные окна, ADWIN, переобучение, скользящее окно, взвешивание по давности, онлайн-обучение и ансамбли. Не создавай впечатление, что любой сигнал автоматически означает необходимость переобучения: отдельно поясни разницу между естественным дрейфом и технической ошибкой в данных.
| + | В первом тексте смешивались три разные вещи: изменение входных данных, изменение связи между признаками и ответом и реальное падение качества. Мониторинг без готовой разметки тоже был описан слишком уверенно, а сигнал детектора выглядел почти как команда сразу запускать переобучение. |
| | | | |
| - | Используй вики-разметку MachineLearning.ru. Формулы записывай только через <tex>...</tex>, а отдельные формулы — с двойным отступом :: перед тегом. Сделай связный текст с разделами, внутренними ссылками, категорией «Искусственный интеллект» и реальными научными источниками в формате <ref>. Не выдумывай исследования, DOI и численные результаты.}}
| + | Дальше я написал второй промпт: |
| | | | |
| - | После первого черновика я решил сделать техническую часть точнее: особенно важно не смешивать статистическое изменение входов, ухудшение метрики и проблемы самого конвейера данных. Также хотелось добавить нормальное объяснение ограничений мониторинга без разметки.
| + | {{well| |
| | + | Доработай статью про дрейф данных. Формально и понятно раздели covariate shift, label shift и concept drift. Добавь разложение совместного распределения и объясни, почему заметное изменение входов не всегда ухудшает модель, а стабильные входы ещё не гарантируют прежнее качество. |
| | | | |
| - | Второй запрос был таким:
| + | Подробнее опиши ADWIN как метод с окном переменной длины. Объясни, что он отслеживает выбранную скалярную последовательность, а не автоматически проверяет всю таблицу данных. |
| | | | |
| - | {{well|1=Отредактируй и расширь статью «Дрейф данных». Сохрани понятный стиль, но сделай различия между covariate shift, label shift и concept drift формально точными. Добавь формулу разложения <nowiki>P(X,Y)=P(Y|X)P(X)</nowiki>, поясни, почему заметный сдвиг распределения не всегда ухудшает качество, а отсутствие сдвига во входах не доказывает сохранение качества.
| + | Сравни периодическое переобучение, скользящее окно, веса по давности, онлайн-обучение и ансамбли. Добавь порядок действий после сигнала, работу с задержкой меток и проверку качества по отдельным группам. |
| | | | |
| - | Раскрой ADWIN без лишней математики: он поддерживает окно переменной длины и при сигнале изменения отбрасывает устаревшую часть. В разделе об адаптации покажи плюсы и риски периодического переобучения, скользящего окна, весов по давности, онлайн-обучения и ансамблей. Добавь практический контур: что проверять после сигнала, как учитывать задержку меток и почему важно оценивать качество по подгруппам.
| + | Убери лишние общие фразы и оставь только настоящие источники. Проверь формулы и разметку. Используй <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Верни статью целиком. |
| | + | }} |
| | | | |
| - | Проверь, что все формулы используют именно <tex>...</tex>, а вынесенные формулы начинаются с ::. Не используй шаблоны, которых может не быть на MachineLearning.ru. Сохрани только реальные и проверяемые источники: Gama и соавторы (2014), Bifet и Gavaldà (2007), Lu и соавторы (2019). Верни готовый текст целиком в вики-разметке.}}
| + | Финальный вариант я проверил вручную. Поправил формулы, ссылки и описание ADWIN, а ещё убедился, что изменение распределения, падение качества и техническая ошибка в данных в тексте не выдаются за одно и то же. |
| | | | |
| - | == Что пришлось развести вручную ==
| + | [[Участник:Oleg Batsiev|Oleg Batsiev]] |
| - | | + | |
| - | После генерации я проверял статью не по числу разделов, а по тому, не выдаётся ли один наблюдаемый сигнал за другой. В окончательной версии были сделаны следующие уточнения:
| + | |
| - | | + | |
| - | * оговорено, что термин ''data drift'' может использоваться узко для изменения <tex>P(X)</tex> и широко для распределительного сдвига вообще;
| + | |
| - | * covariate shift, label shift и concept drift записаны через разные разложения совместного распределения;
| + | |
| - | * отдельно указано, что при label shift обычно изменяется <tex>P(Y\mid X)</tex>, поэтому его нельзя определять через неизменность этой зависимости;
| + | |
| - | * исправлена временная типология: сезонное возвращение режима относится к повторяющемуся дрейфу, а инкрементальный дрейф проходит через последовательность промежуточных состояний;
| + | |
| - | * ADWIN описан как детектор изменений среднего ограниченной скалярной последовательности, а не как универсальный анализатор любой многомерной таблицы;
| + | |
| - | * при отложенных метках добавлены когорты по времени прогноза и проверка зрелости исходов;
| + | |
| - | * сигнал мониторинга превращён в начало диагностики, а не в команду немедленно переобучить модель;
| + | |
| - | * естественное изменение среды отделено от изменения схемы, единиц измерения, вычисления признаков и других неисправностей конвейера;
| + | |
| - | * библиографические данные и DOI трёх оставленных источников сверены с записями издателей;
| + | |
| - | * требование добавить категорию «Искусственный интеллект» не перенесено буквально: такой категории на MachineLearning.ru нет, поэтому использована существующая категория «Машинное обучение».
| + | |
| - | | + | |
| - | В результате статья строится вокруг практического различия между четырьмя вопросами: что изменилось в данных, видит ли это модель, ухудшилось ли качество и не вызван ли сигнал технической ошибкой.
| + | |
| - | | + | |
| - | — [[Участник:Oleg Batsiev|Oleg Batsiev]]
| + | |
В первом тексте смешивались три разные вещи: изменение входных данных, изменение связи между признаками и ответом и реальное падение качества. Мониторинг без готовой разметки тоже был описан слишком уверенно, а сигнал детектора выглядел почти как команда сразу запускать переобучение.
Финальный вариант я проверил вручную. Поправил формулы, ссылки и описание ADWIN, а ещё убедился, что изменение распределения, падение качества и техническая ошибка в данных в тексте не выдаются за одно и то же.