Spike-and-Slab Dropout

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM Qwen3.7-Max и проверена участником Arsen Temirov 00:31, 20 июля 2026 (MSD)

Промпт приводится полностью в Обсуждение:Spike-and-Slab Dropout


Содержание

Введение

Spike-and-Slab Dropout — метод байесовского глубокого обучения, обобщающий классический Dropout и Гауссовский dropout (англ. Gaussian dropout) для более точной оценки неопределённости (англ. uncertainty) предсказаний нейронных сетей. Метод базируется на использовании априорного распределения «спайк-и-сляб» (англ. spike-and-slab prior), которое одновременно моделирует как дискретную неопределённость наличия связи или нейрона (spike), так и непрерывную неопределённость значений весов (slab).

Подход был детально исследован Патриком МакКлюром и Николасом Кригескорте в контексте представления инференциальной неопределённости (2016–2018 гг.) и показал высокую эффективность в задачах, требующих строгой калибровки вероятностей, таких как медицинская визуализация.

Мотивация и интуиция

Стандартный MC Dropout использует распределение Бернулли для обнуления активаций нейронов. С математической точки зрения это эквивалентно использованию вырожденного распределения, в котором вес либо равен нулю (с вероятностью p), либо принимает фиксированное детерминированное значение (с вероятностью 1-p). Такой подход позволяет оценить эпистемическую неопределённость (англ. epistemic uncertainty), связанную с архитектурой сети, но игнорирует непрерывную неопределённость самих параметров.

С другой стороны, методы, использующие непрерывный шум (например, Гауссовский dropout или DropConnect), моделируют непрерывную неопределённость весов, но предполагают, что все связи в сети существуют всегда.

Интуиция Spike-and-Slab Dropout заключается в объединении этих двух парадигм. Модель задаёт два вопроса для каждого параметра или нейрона:

  1. Существует ли эта связь в принципе? (Дискретный выбор, «спайк» — пиковая вероятность в нуле).
  2. Если связь существует, каково её точное значение с учётом шума в данных? (Непрерывное распределение, «сляб» — размазанная гауссовская компонента).

Такой подход обеспечивает более робастную оценку неопределённости, поскольку сеть может не только «выключать» сомнительные признаки, но и варьировать силу оставшихся связей.

Математическое обоснование

Априорное распределение Spike-and-Slab

Концепция «спайк-и-сляб» была изначально предложена Митчеллом и Бошаном в 1988 году для байесовского отбора признаков (англ. Bayesian variable selection). Для отдельного веса w апостериорное распределение аппроксимируется смесью двух компонент:  q(w | \phi) = \pi \mathcal{N}(w | \mu, \sigma^2) + (1 - \pi) \delta_0(w) где:

  • \pi \in [0, 1] — вероятность включения веса (вероятность «сляба»);
  • \mathcal{N}(w | \mu, \sigma^2) — гауссовское распределение (непрерывная компонента, «сляб»), описывающее неопределённость значения веса;
  • \delta_0(w)Дельта-функция Дирака (англ. Dirac delta function) в нуле (дискретная компонента, «спайк»), означающая полное отсутствие связи.

Вариационный вывод и связь с Dropout

В рамках вариационного вывода (англ. variational inference) оптимизируется нижняя оценка доказательной границы (англ. Evidence Lower Bound, ELBO).

  • Классический Dropout является предельным случаем этого распределения, когда дисперсия \sigma^2 \to 0, а математическое ожидание \mu фиксируется (спайк в нуле и спайк в единице).
  • Гауссовский dropout соответствует случаю, когда \pi = 1 (спайк отсутствует, есть только непрерывный сляб).

Прямой проход и сэмплирование

Во время обучения и инференса генеративный процесс для взвешенной суммы (или активации) выглядит следующим образом:

  1. Сэмплируется бинарная маска z \sim \text{Bernoulli}(\pi).
  2. Если z = 0, вклад нейрона или веса обнуляется (срабатывает «спайк»).
  3. Если z = 1, сэмплируется непрерывное значение из гауссовского распределения \mathcal{N}(\mu, \sigma^2) (срабатывает «сляб»), которое умножается на входной сигнал.

На практике для дифференцируемости бинарной маски часто используются методы релаксации, такие как Gumbel-Softmax (англ. Gumbel-Softmax), либо применяется трюк локальной репараметризации (англ. local reparameterization trick).

Оценка неопределённости

Spike-and-Slab Dropout позволяет оценивать эпистемическую и алеаторическую (англ. aleatoric) неопределённость с большей точностью, чем стандартный MC Dropout.

  • Эпистемическая неопределённость: Оценивается путём проведения T стохастических прямых проходов (англ. Monte Carlo sampling). В каждом проходе сэмплируются как новые бинарные маски z^{(t)}, так и новые непрерывные веса w^{(t)} из гауссовского сляба. Дисперсия итоговых предсказаний \frac{1}{T} \sum_{t=1}^T p(y^* | x^*, z^{(t)}, w^{(t)}) служит мерой неуверенности модели в своих структурных и параметрических решениях.
  • Калибровка: Исследования показывают, что комбинация дискретного и непрерывного шума приводит к значительно лучшей калибровке вероятностей (англ. calibration) на тестовой выборке по сравнению с использованием только распределения Бернулли или только гауссовского шума.

Применение в машинном обучении и ИИ

Метод находит применение в областях, где цена ошибки критически высока, а данные часто зашумлены или неполны:

  • Медицинская сегментация изображений: В задачах сегментации МРТ головного мозга Spike-and-Slab Dropout позволяет генерировать карты неопределённости, которые точно выделяют границы опухолей или анатомических структур, где алгоритм «сомневается». Это позволяет врачам фокусировать внимание на проблемных зонах.
  • Обнаружение аномалий (англ. anomaly detection): Высокая дисперсия, обусловленная одновременным сэмплированием масок и весов, позволяет надёжнее детектировать объекты вне обучающего распределения (англ. out-of-distribution).
  • Байесовская оптимизация и Активное обучение (англ. active learning): Более точная оценка инференциальной неопределённости улучшает стратегии исследования пространства признаков, позволяя алгоритму эффективнее выбирать точки для запроса у эксперта.

Преимущества и ограничения

Преимущества

  • Теоретическая обоснованность: Метод строго соответствует байесовскому отбору признаков и предоставляет более богатое вариационное семейство, чем стандартный Dropout.
  • Улучшенная калибровка: Модель реже проявляет излишнюю самоуверенность (англ. overconfidence) на шумных данных и OOD-объектах.
  • Автоматическое разрежение: Компонента «спайк» естественным образом приводит к разреженности (англ. sparsity) сети, выполняя функцию встроенного прунинга (англ. pruning).

Ограничения

  • Вычислительная сложность: Необходимость сэмплировать и дискретные, и непрерывные переменные увеличивает время инференса и усложняет процесс обучения.
  • Проблема недифференцируемости: Сэмплирование из распределения Бернулли (спайка) прерывает путь обратного распространения ошибки (англ. backpropagation). Это требует использования аппроксимаций градиентов (например, Straight-Through Estimator) или методов обучения с подкреплением (REINFORCE), что может дестабилизировать сходимость.
  • Чувствительность к гиперпараметрам: Баланс между вероятностью выпадения \pi и дисперсией сляба \sigma^2 требует тщательной настройки.

См. также

Литература

  • McClure P., Kriegeskorte N. Robustly representing inferential uncertainty in deep neural networks through sampling // arXiv preprint arXiv:1611.01639. — 2016.
  • McClure P., et al. Knowing What You Know in Brain Segmentation Using Bayesian Deep Neural Networks // Frontiers in Neuroinformatics. — 2019. — Т. 13. — С. 1—16.
  • Mitchell T. J., Beauchamp J. J. Bayesian Variable Selection in Linear Regression // Journal of the American Statistical Association. — 1988. — Т. 83. — № 404. — С. 1023—1032.
  • Gal Y., Ghahramani Z. Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning // International Conference on Machine Learning (ICML). — 2016. — С. 1050—1059.
  • Kingma D. P., Salimans T., Welling M. Variational Dropout and the Local Reparameterization Trick // Advances in Neural Information Processing Systems (NeurIPS). — 2015. — С. 2575—2583.
Личные инструменты