Катастрофическое забывание

Материал из MachineLearning.

Версия от 09:13, 19 июля 2026; Sanir Lukianov (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Катастрофическое забывание (Шаблон:Lang-en, также catastrophic interference) — это явление, при котором искусственная нейронная сеть после обучения на новой задаче резко и практически полностью утрачивает способность решать ранее усвоенные задачи. Это фундаментальное ограничение большинства современных алгоритмов глубокого обучения, построенных на стохастическом градиентном спуске, и центральная проблема в области непрерывного обучения (continual learning) [1][1].

В отличие от естественных биологических систем, которые способны накапливать знания на протяжении всей жизни, нейросети при последовательном обучении сталкиваются с дилеммой стабильности-пластичности (stability-plasticity dilemma) [1][1]: высокая пластичность (способность к обучению новому) приводит к разрушению старых знаний; высокая стабильность (сохранение старого) препятствует усвоению нового.

Шаблон:TOC limit

Содержание

Терминология и базовые понятия

Ключевые понятия
Непрерывное обучение Парадигма, в которой модель последовательно обучается на потоке задач, сохраняя знания о всех ранее изученных задачах [1].
Трансферное обучение Использование знаний, полученных при решении одной задачи, для улучшения обучения на другой. Катастрофическое забывание проявляется при тонкой настройке [1].
Дилемма стабильности-пластичности Фундаментальный компромисс между сохранением старых знаний (стабильность) и усвоением новых (пластичность) [1][1].
Потеря пластичности Близкое, но отличное явление, при котором сеть со временем теряет саму способность к обучению [1].

Катастрофическое забывание (catastrophic forgetting, catastrophic interference) — явление, при котором нейронная сеть, обученная на последовательности задач, демонстрирует резкое падение точности на ранее изученных задачах после обучения на новой. Название «катастрофическое» подчёркивает не постепенный, а скачкообразный характер деградации: при обучении на новой задаче точность на старой может упасть с 90% до уровня случайного угадывания всего за несколько эпох.

Исторический контекст

Открытие явления (1980-е годы)

Явление было впервые систематически описано в конце 1980-х годов в работах Роберта Мак-Клоски (Robert McCloskey) и Нила Коэна (Neal Cohen) [1], а также Роджера Ратклиффа (Roger Ratcliff) [1]. В статье «Catastrophic Interference in Connectionist Networks: The Sequential Learning Problem» (1989) авторы показали, что при последовательном обучении перцептронов и сетей с обратным распространением ошибки новое обучение может полностью разрушать старые знания. Они проанализировали причины этого явления, связав их с распределённым характером хранения информации в весах сети [1].

Исследования 1990-х годов

В 1990-х годах исследования продолжились: Роб Френч (Robert French) предложил понятие «полу-распределённых представлений» и механизмы их динамической регуляции для снижения интерференции [1], а также указал на фундаментальную связь между способностью к обобщению и уязвимостью к катастрофическому забыванию.

Современный этап (с 2017 года)

С развитием глубокого обучения и ростом числа параметров моделей проблема не только не исчезла, но и обострилась. В 2017 году вышла ключевая работа Kirkpatrick et al. с методом Elastic Weight Consolidation (EWC) [1], что положило начало современному этапу исследований, сосредоточенному на трёх основных подходах: регуляризация весов, воспроизведение опыта и архитектурная изоляция [1].

Математическая постановка

Формулировка задачи

Пусть имеется последовательность задач \{\mathcal{T}_1, \mathcal{T}_2, \dots, \mathcal{T}_k\}, каждая из которых характеризуется функцией потерь \mathcal{L}_i(\theta) и распределением данных P_i(x, y). Модель с параметрами \theta обучается последовательно: сначала на \mathcal{T}_1 (получаем \theta^*_1), затем на \mathcal{T}_2, инициализируясь от \theta^*_1, и так далее.

Катастрофическое забывание возникает, когда при минимизации \mathcal{L}_n(\theta) для задачи \mathcal{T}_n градиентный спуск изменяет веса \theta таким образом, что \mathcal{L}_m(\theta) для ранее изученной задачи \mathcal{T}_m (где m < n) резко возрастает.

Конфликт градиентов

Интуитивное объяснение заключается в конфликте градиентов. Для двух задач \mathcal{T}_1 и \mathcal{T}_2 градиенты потерь \nabla_\theta \mathcal{L}_1(\theta) и \nabla_\theta \mathcal{L}_2(\theta) могут быть противоположно направлены. Тогда обновление, уменьшающее \mathcal{L}_2, увеличивает \mathcal{L}_1.

Формально, если скалярное произведение градиентов отрицательно:

\nabla \mathcal{L}_1 \cdot \nabla \mathcal{L}_2 < 0

то шаг в направлении минимизации \mathcal{L}_2 неизбежно увеличивает \mathcal{L}_1 (при достаточно малой скорости обучения).

Дилемма стабильности-пластичности

Математически задача непрерывного обучения может быть сформулирована как поиск \theta, минимизирующего эмпирический риск на всех задачах одновременно:


\theta^* = \arg\min_{\theta} \sum_{i=1}^{T} \mathbb{E}_{(x,y) \sim P_i} [\mathcal{L}_i(\theta; x, y)]

При последовательном обучении мы не имеем доступа ко всем данным одновременно. Ограничения на память и вычислительные ресурсы не позволяют хранить все данные \{P_i\}. Поэтому требуется аппроксимировать совместное распределение, что и порождает дилемму [1].

Представление в пространстве параметров

Множество параметров \theta, решающих задачу i, можно представить как подмножество \Theta_i \subset \Theta в пространстве параметров. Задача непрерывного обучения — найти точку \theta \in \cap_{i=1}^T \Theta_i [1]. Показано, что эта задача в общем виде является NP-трудной (сводится к задаче выполнимости SAT) [1].

Механизмы возникновения

Катастрофическое забывание в глубоких нейросетях возникает по нескольким причинам [1][1]:

1. Перезапись весов В распределённых представлениях информация о разных задачах хранится в одних и тех же весах. Обучение на новой задаче изменяет эти веса, разрушая информацию о старой задаче.
2. Конфликт градиентов Градиенты, направленные на минимизацию потерь для разных задач, могут быть ортогональны или противоположно направлены, что приводит к интерференции [1][1].
3. Отсутствие регуляризации по важности Стандартные методы регуляризации (L1, L2) штрафуют все веса одинаково и не защищают те веса, которые критически важны для старых задач.
4. Сложность модели Чем больше параметров у модели, тем больше степеней свободы и тем выше вероятность конфликта градиентов, хотя этот вопрос остаётся предметом дискуссий.

Важно отметить, что катастрофическое забывание — это не просто «переобучение» или «недообучение». Это фундаментальное свойство градиентного спуска в невыпуклых пространствах параметров при последовательном обучении [1].

Методы борьбы с катастрофическим забыванием

Существующие методы делятся на три основные категории [1][1]:

1. Регуляризационные методы (Regularization-based)

Эти методы добавляют к функции потерь на новой задаче штраф, препятствующий значительному изменению весов, важных для старых задач.

Elastic Weight Consolidation (EWC)

EWC [1] — один из первых и наиболее известных методов. Идея основана на байесовском подходе: после обучения на задаче A апостериорное распределение p(\theta | \mathcal{D}_A) аппроксимируется гауссианом с центром в оптимальных весах \theta^*_A и ковариацией, определяемой матрицей Фишера F_A. Функция потерь для задачи B имеет вид:


\mathcal{L}(\theta) = \mathcal{L}_B(\theta) + \frac{\lambda}{2} \sum_i F_{A,i} (\theta_i - \theta_{A,i}^*)^2

где F_{A,i} — диагональные элементы матрицы Фишера, оценивающие важность параметра i для задачи A; \lambda — гиперпараметр [1][1].

Матрица Фишера вычисляется как:


F_i = \mathbb{E}_{(x,y) \sim \mathcal{D}_A} \left[ \left( \frac{\partial}{\partial \theta_i} \log p(y|x,\theta) \right)^2 \right]

Synaptic Intelligence (SI)

SI [1] — метод, аналогичный EWC, но оценивающий важность весов на основе их вклада в изменение функции потерь на протяжении обучения. Для каждого параметра i накапливается «синаптическая значимость» \omega_i, и регуляризационный штраф имеет вид \sum_i \omega_i (\theta_i - \theta_i^*)^2.

Memory Aware Synapses (MAS)

MAS [1] оценивает важность весов на основе чувствительности выхода модели к изменению веса:


\Omega_i = \mathbb{E}_{x \sim \mathcal{D}} \left[ \left\| \frac{\partial f(x; \theta)}{\partial \theta_i} \right\|_2 \right]

Этот подход не требует наличия меток для оценки важности.

Learning without Forgetting (LwF)

LwF [1] использует дистилляцию знаний: при обучении на новой задаче предсказания старой модели на данных новой задачи служат «мягкими метками», которые надо сохранить. Функция потерь комбинирует потерю на новой задаче и потерю дистилляции.

2. Методы воспроизведения опыта (Replay-based)

Эти методы хранят примеры из прошлых задач (или генерируют их) и смешивают с данными текущей задачи при обучении.

Experience Replay (ER)

Простейший метод: сохраняется буфер (buffer) фиксированного размера с примерами из прошлых задач. На каждом шаге обучения семплируется мини-батч из буфера и объединяется с данными текущей задачи [1]. Метод эффективен, но требует памяти для хранения примеров.

A-GEM (Averaged Gradient Episodic Memory)

A-GEM [1] — улучшенная версия GEM (Gradient Episodic Memory) [1]. Основная идея: при обновлении весов градиент текущей задачи проектируется так, чтобы он не увеличивал функцию потерь на старых задачах. В отличие от GEM, A-GEM использует усреднённый градиент по всем задачам из буфера, что значительно ускоряет вычисления [1].

Generative Replay

Generative Replay [1] использует генеративную модель (например, GAN или диффузионную модель) для синтеза данных из прошлых задач, вместо их хранения. Это решает проблему хранения данных, но добавляет вычислительную нагрузку [1][1].

Dark Experience Replay (DER)

DER [1] расширяет ER, сохраняя не только входные данные и метки, но и логиты (выходы до softmax) старой модели. Это позволяет использовать дистилляцию знаний при воспроизведении.

3. Архитектурные методы (Architecture-based)

Эти методы изменяют архитектуру сети, выделяя отдельные подмножества параметров для разных задач.

Progressive Neural Networks

Progressive Neural Networks [1] для каждой новой задачи добавляют новую «колонку» (столбец) нейронов, которая обучается с нуля, но имеет латеральные связи к предыдущим колонкам. Старые колонки замораживаются. Метод полностью устраняет забывание, но масштаб сети растёт линейно с числом задач.

PackNet

PackNet [1] после обучения на задаче применяет структурное прореживание (pruning) к весам, определяет важные веса и «упаковывает» их. Освободившиеся веса используются для следующей задачи.

Hard Attention to the Task (HAT)

HAT [1] использует маски (attention masks) на нейронах для каждой задачи, разрешая или запрещая их использование. Маски обучаются вместе с весами.

Сравнение подходов

Сравнение трёх основных подходов
Характеристика Регуляризационные Реплей Архитектурные
Требует дополнительной памяти Нет Да Да (расширение сети)
Вычислительные накладные расходы Низкие Средние Высокие
Эффективность на 5+ задач Средняя Высокая Высокая
Масштабируемость Высокая Высокая Низкая
Гарантии отсутствия забывания Нет Нет Да (при заморозке)

Оценка катастрофического забывания

Метрики

Пусть a_{i,j} — точность модели на задаче \mathcal{T}_j после обучения на задаче \mathcal{T}_i (где i \ge j). Тогда:

Точность после обучения a_{i,j} для j \le i
Забывание (forgetting) f_{i,j} = \max_{k < i} a_{k,j} - a_{i,j} — разность между максимальной достигнутой точностью и текущей [1].
Среднее забывание Усредняется по всем задачам
Скорость обучения Метрика из A-GEM [1], измеряет, как быстро модель достигает высокой точности на новой задаче

Бенчмарки

Бенчмарк Описание Источник
Split-MNIST MNIST разбивается на 5 задач по 2 класса каждая [1]
Permuted-MNIST Каждая задача — MNIST с фиксированной случайной перестановкой пикселей [1]
Split-CIFAR-10/100 Аналогично Split-MNIST на CIFAR [1]
CORe50 Набор данных для непрерывного обучения с 50 классами объектов [1]
CLEAR / Stream-51 Современные бенчмарки, приближенные к реальным условиям [1]

Применения и последствия

Катастрофическое забывание критически важно для следующих областей:

Робототехника Роботы должны непрерывно обучаться новым навыкам, не забывая старые [1].
Рекомендательные системы Модель должна адаптироваться к новому пользователю, сохраняя знания о других.
Медицина Каждый новый пациент — новая задача (анализ ЭКГ, медицинские изображения).
Большие языковые модели (LLM) При дообучении на новой предметной области модель может потерять способность к общим рассуждениям [1].

Ограничения и открытые вопросы

Несмотря на значительный прогресс, остаются нерешённые проблемы:

1. Масштабируемость Большинство методов плохо работают при числе задач более 50-100. Архитектурные методы не масштабируются, регуляризационные накапливают ошибки.
2. Теоретические гарантии Не существует методов с гарантированным отсутствием забывания. Задача является NP-трудной [1].
3. Биологическая обоснованность Хотя биологический мозг решает эту проблему успешно [1], механизмы остаются не до конца понятыми.
4. Комбинирование методов Гибридные подходы дают лучшие результаты, но их настройка сложна.
5. Стандарты оценки Отсутствует единый стандарт оценки, что затрудняет сравнение методов [1].

Практические рекомендации

Выбор метода

2–5 задач Регуляризационные методы (EWC, SI) — просты и не требуют памяти.
5–20 задач Реплей-методы (ER, A-GEM) — дают лучшее качество [1].
Ограничения по памяти Generative Replay [1].
Критичность забывания Progressive Neural Networks [1] — гарантирует отсутствие забывания.

Стратегия обучения

  • Используйте накопление градиентов (gradient accumulation) для стабилизации обучения.
  • В реплей-методах размер буфера выбирайте как можно больше (в пределах ограничений памяти).
  • Для регуляризационных методов подбирайте гиперпараметр \lambda через валидацию.

Мониторинг и оценка

  • Отслеживайте точность на всех задачах в процессе обучения (accuracy matrix).
  • Используйте метрику забывания (forgetting) в дополнение к средней точности.
  • Для реплей-методов применяйте аугментацию буфера.

См. также

Примечания


Литература

  1. McCloskey, M., & Cohen, N. J. (1989). Catastrophic interference in connectionist networks: The sequential learning problem. Psychology of Learning and Motivation, 24, 109–165.
  2. Ratcliff, R. (1990). Connectionist models of recognition memory: constraints imposed by learning and forgetting functions. Psychological Review, 97(2), 285–308.
  3. Kirkpatrick, J., Pascanu, R., Rabinowitz, N., et al. (2017). Overcoming catastrophic forgetting in neural networks. PNAS, 114(13), 3521–3526.
  4. Huszár, F. (2017). On Quadratic Penalties in Elastic Weight Consolidation. arXiv:1712.03847.
  5. Zenke, F., Poole, B., & Ganguli, S. (2017). Continual Learning Through Synaptic Intelligence. ICML.
  6. Aljundi, R., Babiloni, F., Elhoseiny, M., et al. (2018). Memory Aware Synapses: Learning what (not) to forget. ECCV.
  7. Li, Z., & Hoiem, D. (2017). Learning without Forgetting. IEEE TPAMI, 40(12), 2935–2947.
  8. Shin, H., Lee, J. K., Kim, J., & Kim, J. (2017). Continual Learning with Deep Generative Replay. NIPS, 30, 2994–3003.
  9. Lopez-Paz, D., & Ranzato, M. (2017). Gradient Episodic Memory for Continual Learning. NIPS.
  10. Chaudhry, A., Ranzato, M. A., Rohrbach, M., & Elhoseiny, M. (2019). Efficient Lifelong Learning with A-GEM. ICLR.
  11. Rusu, A. A., Rabinowitz, N. C., Desjardins, G., et al. (2016). Progressive Neural Networks. arXiv:1606.04671.
  12. Mallya, A., & Lazebnik, S. (2018). PackNet: Adding Multiple Tasks to a Single Network by Iterative Pruning. CVPR.
  13. Serra, J., Suris, D., Miron, M., & Karatzoglou, A. (2018). Overcoming Catastrophic Forgetting with Hard Attention to the Task. ICML.
  14. Aleixo, E., Colonna, J. G., Cristo, M., & Fernandes, E. (2024). Catastrophic Forgetting in Deep Learning: A Comprehensive Review. Journal of the Brazilian Computer Society.
  15. Baskaran, R. S. (2025). A Comprehensive Review of Catastrophic Forgetting in Text Processing. Taylor & Francis.
  16. Zenke, F., & Laborieux, A. (2024). Theories of synaptic memory consolidation and intelligent plasticity for continual learning. arXiv:2405.16922.
  17. Liu, Z., Liu, Y., & Liu, J. (2026). OCL-SKD: Balancing plasticity and stability in online continual learning via self-knowledge distillation. Neurocomputing, 680, 133297.
  18. Joudaki, A., Lanzillotta, G., Razlighi, M. S., et al. (2025). Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity. arXiv:2510.00304.

Ссылки