Модели на основе энергии
Материал из MachineLearning.
| | Статья написана с использованием LLM GPT-5.6 Sol и проверена участником Kirill Solovev 16:50, 19 июля 2026 (MSD) |
Модели на основе энергии (energy-based models, EBM) — класс моделей машинного обучения, в которых каждому объекту или конфигурации связанных объектов сопоставляется скалярная величина, называемая энергией. Низкая энергия соответствует более правдоподобной, совместимой или предпочтительной конфигурации, а высокая — менее правдоподобной.
Например, модель может вычислять энергию изображения, пары «изображение — метка класса», последовательности слов или совместного состояния наблюдаемых и скрытых переменных. Для изображения собаки энергия пары «изображение — собака» должна быть ниже энергии пары «изображение — автомобиль».
В вероятностной интерпретации энергия определяет ненормированную вероятность посредством экспоненты от отрицательной энергии. Однако модели на основе энергии не обязательно являются вероятностными: их можно обучать только сравнивать правильные и неправильные конфигурации, не вычисляя нормированную вероятность.
Понятие энергии заимствовано из статистической физики, но в машинном обучении энергия обычно не имеет физической размерности. Это обучаемая функция стоимости, относительные значения которой важнее абсолютных.
Основная идея
Модель на основе энергии должна построить энергетический рельеф пространства возможных объектов. Реальным, допустимым или согласованным объектам соответствуют низкие участки этого рельефа, а неправильным и маловероятным объектам — высокие.
Если модель получает одновременно объект и возможный ответ, она вычисляет энергию их совместной конфигурации. Для получения предсказания сравниваются энергии всех допустимых ответов и выбирается ответ с наименьшей энергией.
В генеративной задаче модель оценивает энергию самого объекта. Новые объекты можно получать, постепенно перемещаясь по энергетическому рельефу в сторону областей низкой энергии и добавляя случайность, необходимую для исследования разных правдоподобных областей.
Простые примеры
Классификация изображения по трём классам
Предположим, что модель должна отнести изображение к одному из трёх классов: «кошка», «собака» или «автомобиль». Она рассматривает три пары:
- «изображение — кошка»;
- «изображение — собака»;
- «изображение — автомобиль».
Для каждой пары модель вычисляет одно число — энергию. Например, для изображения кошки могут быть получены следующие значения:
| Пара | Энергия |
|---|---|
| Изображение — кошка | 0,4 |
| Изображение — собака | 1,8 |
| Изображение — автомобиль | 3,2 |
Наименьшую энергию, равную 0,4, получила пара «изображение — кошка», поэтому модель выбирает метку «кошка».
Сами числа 0,4, 1,8 и 3,2 ещё не являются вероятностями. Они выражают относительную совместимость изображения с каждой меткой. Чтобы получить вероятности классов, энергии необходимо преобразовать и нормировать. Это преобразование рассматривается в разделе о вероятностной интерпретации.
Во время обучения модель должна уменьшать энергию правильной пары и увеличивать энергии неправильных пар. Если обучающее изображение имеет метку «кошка», энергия пары «изображение — кошка» должна становиться ниже энергий пар с метками «собака» и «автомобиль».
Одномерные данные с двумя скоплениями
Рассмотрим набор данных, в котором каждый объект описывается одним числом. Например, большая часть наблюдений находится около значений −2 и 2, а около нуля наблюдений почти нет. В данных образуются два скопления.
Модель должна создать две области низкой энергии: одну около −2, другую около 2. Эти области соответствуют двум часто встречающимся группам наблюдений. Между ними, около нуля, энергия должна быть высокой, поскольку такие значения редко встречаются в данных. Энергия также должна возрастать вдали от обоих скоплений.
Полученный энергетический рельеф можно представить как две долины, разделённые холмом. Дно каждой долины соответствует одному скоплению данных, а холм между ними — маловероятной промежуточной области.
Если использовать модель для генерации, случайные объекты должны появляться преимущественно около −2 и 2. Они не должны часто возникать около нуля или далеко от наблюдаемых данных. При этом модель должна сохранять обе долины: если в процессе обучения или генерации учитывается только одна из них, одно из скоплений будет потеряно.
Этот пример показывает отличие поиска минимума от выборки из распределения. Поиск одного минимального значения может привести только в одну долину, тогда как корректная генеративная модель должна воспроизводить оба скопления с соответствующими вероятностями.
Математическая формализация
Энергетическая функция
Пусть обозначает объект из пространства возможных объектов
. Модель с параметрами
вычисляет энергию объекта:
Здесь — скалярная энергия объекта
, а
— параметры модели, например веса нейронной сети.
Обучение должно сформировать энергетический рельеф, в котором области с реальными или допустимыми объектами имеют низкую энергию, а области с неправдоподобными объектами — высокую. Локальные минимумы энергии можно интерпретировать как устойчивые или предпочтительные состояния модели.
Энергия пары «вход — ответ»
Пусть обозначает входной объект, а
— возможный ответ. Тогда модель вычисляет совместную энергию пары:
Множество всех допустимых ответов обозначим через . Предсказанием служит ответ с минимальной энергией:
Здесь — ответ, предсказанный моделью для входа
.
Такая формулировка подходит не только для выбора одного класса. В задачах структурированного предсказания ответом может быть последовательность, дерево, разметка изображения, траектория или другой сложный объект.
Формализация примера классификации
Пусть нейронный классификатор выдаёт три логита ,
и
. Логит
— ненормированная оценка принадлежности объекта
классу
.
Энергию пары «объект — класс» можно определить как отрицательный логит:
Тогда выбор класса с минимальной энергией совпадает с выбором наибольшего логита:
Следовательно, стандартный классификатор можно интерпретировать как условную модель на основе энергии.
Формализация примера с двумя скоплениями
Простейший симметричный энергетический рельеф с двумя минимумами можно задать функцией
Здесь — одномерное наблюдение, а положительный параметр
задаёт положения двух минимумов. Энергия минимальна при
и
, возрастает между минимумами и становится большой вдали от них.
Если два скопления расположены около −2 и 2, можно взять . Эта функция является только наглядным примером. В реальной задаче форму энергетического рельефа и положения его минимумов модель должна восстановить по обучающим данным.
Вероятностная интерпретация
Распределение Гиббса
Для заданной энергии можно определить вероятностное распределение Гиббса:
Здесь — плотность или вероятность объекта
,
— температура, а
— функция разбиения.
Функция разбиения для непрерывного пространства определяется формулой
Здесь — базовая мера, относительно которой задаётся плотность. Для обычных вещественных данных используется мера Лебега.
Для дискретного пространства интеграл заменяется суммой:
Функция разбиения обеспечивает нормировку:
Разность энергий определяет отношение вероятностей двух конфигураций и
:
Поэтому конфигурация с меньшей энергией получает большую вероятность. Абсолютное значение энергии несущественно: добавление одной и той же константы ко всем энергиям не изменяет распределение.
Температура управляет концентрацией распределения. При малой температуре вероятность сосредоточивается около минимумов энергии. При большой температуре распределение становится более сглаженным.
Для существования вероятностной модели необходимо, чтобы было конечным. Произвольная нейронная функция на неограниченном пространстве не обязательно удовлетворяет этому условию. Поэтому ограниченная область входов, форма энергии, базовая мера и используемая регуляризация являются частью определения вероятностной модели.
Условные модели
Для входа и ответа
условное распределение имеет вид
Здесь — условная функция разбиения, зависящая от входа
. Она вычисляется по всем возможным ответам:
Если множество ответов конечно, используется сумма. Во многих задачах классификации она вычисляется точно. Для последовательностей, графов и других структурированных ответов вычисление функции разбиения может требовать динамического программирования или приближённого вывода.
Для классификатора с классами и логитами
условные вероятности принимают обычный вид softmax:
Здесь — число классов, а
— логит класса
.
В условной модели преобразование
не изменяет , поскольку добавка
, одинаковая для всех ответов при данном входе, сокращается при нормировке по
. Поэтому обучение только условной вероятности обычно не определяет распределение входов
. В частности, обычная кросс-энтропия классификатора сама по себе не превращает его в надёжную генеративную модель входных данных.
Скрытые переменные и свободная энергия
Модель может содержать наблюдаемую переменную и скрытую переменную
. Их совместное распределение задаётся формулой
Здесь описывает ненаблюдаемое состояние модели, например скрытые признаки объекта.
Чтобы получить вероятность наблюдаемого объекта, скрытую переменную исключают суммированием или интегрированием:
Свободная энергия наблюдаемого объекта определяется как
Здесь — свободная энергия объекта
, в которой учтены все возможные состояния скрытой переменной
.
Маргинальное распределение наблюдаемой переменной снова имеет энергетическую форму:
Свободная энергия учитывает не только наилучшую конфигурацию скрытых переменных, но и все их возможные состояния. При малой температуре она приближается к минимальной энергии по , а при конечной температуре дополнительно учитывает число и разнообразие низкоэнергетических состояний.
Факторизация энергии
В графических моделях общая энергия часто представляется суммой локальных потенциалов:
Здесь — множество факторов модели,
— подмножество переменных, относящееся к фактору
, а
— соответствующий локальный потенциал.
Тогда ненормированная плотность раскладывается в произведение факторов:
Это связывает модели на основе энергии с марковскими случайными полями, фактор-графами и условными случайными полями.
Суммирование энергий также соответствует произведению ненормированных распределений:
Здесь и
— энергии двух моделей, а
и
— соответствующие им распределения при согласованной температуре и общей базовой мере.
Такое представление называют произведением экспертов (product of experts). Каждый эксперт может задавать отдельное ограничение, а низкую итоговую энергию получают конфигурации, удовлетворяющие нескольким ограничениям одновременно. Однако механическое сложение произвольно обученных энергий не гарантирует содержательно правильной композиции: важны согласованность масштабов, областей определения и обучающих распределений.
Энергия и скор-функция
Для дифференцируемой непрерывной модели скор-функция распределения определяется как градиент логарифма плотности:
Здесь — скор-функция, а
обозначает градиент по компонентам объекта
.
Поскольку функция разбиения не зависит от , для модели на основе энергии выполняется
Следовательно, градиент энергии показывает направление её наиболее быстрого локального увеличения, а отрицательный градиент направлен в сторону уменьшения энергии и увеличения плотности.
Эта связь лежит в основе сопоставления скор-функций (score matching) и сближает модели на основе энергии со скоринговыми и диффузионными моделями. Тем не менее произвольное векторное поле, предсказываемое скоринговой сетью, не обязательно является градиентом некоторой глобальной скалярной энергии. Кроме того, диффузионные модели обычно обучают зависящую от уровня шума скор-функцию, а классическая EBM задаёт один энергетический рельеф для целевого распределения.
Термин «скор» используется неоднозначно. В некоторых работах скором называют совместимость , а в математической статистике — именно градиент
.
Вывод и генерация
Поиск минимума
Если требуется только одно наиболее предпочтительное состояние, решается задача оптимизации:
Здесь — конфигурация с минимальной найденной энергией.
Для дискретного пространства можно использовать полный перебор, динамическое программирование, поиск, распространение сообщений или комбинаторную оптимизацию. Для непрерывного пространства применяют градиентные методы.
Нахождение минимума не равносильно генерации случайной выборки. Оптимизация стремится к одной моде распределения, тогда как корректный выборочный метод должен воспроизводить относительные вероятности всех областей пространства. В примере с двумя скоплениями простой поиск минимума может привести только к одному скоплению, а генеративная модель должна воспроизводить оба.
Методы Монте-Карло
Для генерации из ненормированного распределения часто применяют методы Монте-Карло для марковских цепей (MCMC). В дискретных моделях, например машинах Больцмана, распространён сэмплинг Гиббса.
Для непрерывных дифференцируемых энергий используется динамика Ланжевена. При температуре один шаг её дискретизации можно записать как
Здесь — состояние цепи на шаге
,
— размер шага, а
— независимый стандартный гауссовский шум.
Градиент перемещает состояние к областям низкой энергии, а случайный шум позволяет исследовать распределение и выходить из некоторых локальных минимумов. При достаточно малом шаге и выполнении условий сходимости предельное распределение цепи соответствует . На практике используется конечное число шагов, поэтому возникают ошибки дискретизации и неполного перемешивания.
Сэмплирование может начинаться со случайного шума, примера из обучающей выборки или состояния, сохранённого от предыдущих итераций. Последний вариант применяется в постоянных марковских цепях и буферах воспроизведения.
Обучение
Основная цель обучения состоит не только в уменьшении энергии наблюдаемых данных. Если уменьшать её без дополнительных ограничений, модель может присвоить низкую энергию всему пространству. Поэтому необходимо одновременно понижать энергию правильных конфигураций и повышать её для неправильных, сгенерированных или конкурирующих конфигураций.
Максимизация правдоподобия
Обозначим через распределение, из которого получены обучающие данные. При температуре
ожидаемое отрицательное логарифмическое правдоподобие имеет вид
Здесь — функция потерь, а символ
обозначает математическое ожидание.
Градиент этой функции потерь равен разности двух математических ожиданий:
Первое слагаемое называют положительной фазой, а второе — отрицательной фазой. При градиентном спуске положительная фаза уменьшает энергию обучающих объектов, а отрицательная повышает энергию объектов, часто возникающих в текущем распределении модели .
Положительную фазу обычно легко оценить по мини-пакету данных. Отрицательная фаза значительно сложнее, поскольку требует выборок из самой модели. Для их получения запускают MCMC, но медленное перемешивание цепей может приводить к смещённому градиенту.
В условной модели максимизируется . Если функция разбиения по ответам вычисляется точно, как в обычной классификации, обучение не требует MCMC по пространству входов.
Контрастивная дивергенция
Контрастивная дивергенция (contrastive divergence, CD) была предложена Джеффри Хинтоном как практическое приближение для обучения произведений экспертов и машин Больцмана. Марковская цепь начинается с реального обучающего объекта и выполняет небольшое число переходов. Полученное состояние используется как отрицательный пример.
Метод CD обычно существенно дешевле полного доведения цепи до равновесия, но его градиент является смещённым приближением градиента правдоподобия. Если цепь делает слишком мало шагов, модель может хорошо отличать данные только от их ближайших реконструкций, не формируя правильное глобальное распределение.
В постоянной контрастивной дивергенции (persistent contrastive divergence) состояния цепей сохраняются между обновлениями параметров. Это позволяет цепям дольше исследовать пространство, хотя изменение энергии во время обучения означает, что их целевое распределение также постоянно меняется.
Сопоставление скор-функций
Метод сопоставления скор-функций, предложенный Аапо Хювяриненом, позволяет обучать непрерывную ненормированную модель без явного вычисления функции разбиения. Он сопоставляет градиент логарифма модельной плотности со скор-функцией распределения данных.
При выполнении условий интегрирования по частям исходная цель преобразуется к выражению, не содержащему неизвестную плотность данных:
Здесь — целевая функция сопоставления скор-функций,
— оператор Лапласа по переменной
, а
— слагаемое, не зависящее от параметров
.
Недостатком прямого метода является необходимость вычислять вторые производные или их оценки. В сопоставлении зашумлённых скор-функций (denoising score matching) модель обучается восстанавливать скор-функции распределений, полученных добавлением шума. Эта идея стала одним из оснований современных скоринговых генеративных моделей.
Шумовая контрастивная оценка
Шумовая контрастивная оценка (noise-contrastive estimation, NCE) превращает оценивание ненормированной модели в задачу бинарной классификации. Модель учится отличать реальные наблюдения от объектов, сгенерированных из известного шумового распределения. Нормировочную константу можно рассматривать как дополнительный параметр.
Качество метода зависит от выбора шумового распределения и числа шумовых примеров. Если шум слишком легко отличить от данных, классификационная задача почти не содержит информации о тонкой структуре целевой плотности.
Псевдоправдоподобие
Для дискретных многомерных моделей можно максимизировать произведение условных вероятностей отдельных компонент при известных остальных компонентах:
Здесь — число обучающих объектов,
— число компонент каждого объекта,
— компонента с номером
объекта
, а
обозначает все его компоненты, кроме
-й.
Условная нормировка отдельной переменной часто проще глобальной нормировки всей конфигурации. Однако псевдоправдоподобие оценивает локальные условные зависимости и не всегда обеспечивает хорошее качество глобальной генерации при конечном объёме данных и ограниченной модели.
Потери сравнения и зазора
Если нормированная вероятность не требуется, энергию можно обучать непосредственно по правильным и неправильным парам. Одна из простых функций потерь имеет вид
Здесь — правильный ответ,
— неправильный ответ, а
— требуемый энергетический зазор между ними.
Такая функция потерь штрафует модель, если энергия правильной пары недостаточно ниже энергии неправильной пары. Подобные потери применяются в ранжировании, метрическом обучении и структурированном предсказании. Полученная энергия может хорошо упорядочивать кандидатов, но без дополнительных условий она не обязана задавать нормируемую или откалиброванную вероятность.
Основные представители
Сеть Хопфилда
В классической сети Хопфилда состояние задаётся набором бинарных нейронов, а симметричные связи определяют энергетическую функцию. При асинхронном обновлении нейронов энергия не возрастает, поэтому сеть приходит в локальный минимум. Запомненные образы кодируются как устойчивые минимумы, что позволяет использовать сеть как ассоциативную память.
Работа Джона Хопфилда 1982 года показала, как коллективную динамику нейронной сети можно описывать через энергетический рельеф и устойчивые состояния.
Машина Больцмана
Машина Больцмана добавляет к энергетической сети стохастические обновления. Вероятности состояний определяются распределением Больцмана, а обучение изменяет связи так, чтобы статистики модели приближались к статистикам наблюдаемых данных.
Алгоритм обучения машин Больцмана, опубликованный Дэвидом Акли, Джеффри Хинтоном и Терренсом Сейновски в 1985 году, использует разность корреляций в положительной и отрицательной фазах. Полные машины Больцмана вычислительно трудны из-за связей между всеми блоками переменных.
Ограниченная машина Больцмана
В ограниченной машине Больцмана (restricted Boltzmann machine, RBM) отсутствуют связи между видимыми переменными и между скрытыми переменными. Энергия бинарной RBM обычно записывается как
Здесь — вектор видимых переменных,
— вектор скрытых переменных,
и
— векторы смещений, а
— матрица связей между видимым и скрытым слоями.
Двудольная структура делает скрытые переменные условно независимыми при фиксированных видимых переменных и наоборот. Поэтому один шаг сэмплинга Гиббса выполняется сравнительно просто. Глобальная функция разбиения при этом, как правило, остаётся вычислительно трудной.
Марковские и условные случайные поля
Марковское случайное поле задаёт совместное распределение посредством суммы локальных энергий. Условное случайное поле (conditional random field, CRF) задаёт распределение структурированного ответа при известном входе. Например, в линейно-цепочечном CRF локальные энергии могут учитывать признаки наблюдений, метки отдельных позиций и переходы между соседними метками.
Для цепочек функция разбиения и маргинальные вероятности вычисляются динамическим программированием. Для общих графов точный вывод часто становится недоступным, поэтому применяются вариационные методы, распространение сообщений или MCMC.
Глубокие модели на основе энергии
В глубокой EBM энергия непосредственно задаётся глубокой нейронной сетью:
Здесь — нейронная сеть с одним скалярным выходом. Для условной модели сеть получает пару
либо вычисляет отдельную энергию для каждого кандидата
.
Работа Йилуна Ду и Игоря Мордатча 2019 года продемонстрировала обучение непрерывных глубоких EBM с использованием динамики Ланжевена, буфера ранее сгенерированных примеров и регуляризации. В экспериментах такие модели применялись к генерации изображений, восстановлению повреждённых изображений и моделированию траекторий.
В модели JEM (Joint Energy-based Model), представленной Уиллом Гратволом и соавторами в 2020 году, логиты классификатора интерпретируются как совместная энергия . Модель обучается сочетать дискриминативную классификацию с моделированием входных данных. Этот результат показал возможность использовать одну архитектуру одновременно как классификатор и как ненормированную генеративную модель, однако генеративная часть всё равно требует специальной цели обучения и приближённого сэмплирования.
Применения
Модели на основе энергии применяются в следующих задачах:
- Классификация. Энергия измеряет совместимость объекта с меткой класса. Softmax-классификатор является частным случаем условной EBM.
- Структурированное предсказание. Энергия оценивает целую последовательность, разметку, дерево или граф, позволяя учитывать зависимости между частями ответа.
- Ассоциативная память. Запомненные образы представляются минимумами энергетического рельефа.
- Генеративное моделирование. Выборки получают с помощью MCMC или другого приближённого процесса, стремящегося воспроизвести распределение Гиббса.
- Восстановление и дополнение данных. Наблюдаемые компоненты фиксируются, а отсутствующие или повреждённые переменные изменяются в направлении низкой условной энергии.
- Ранжирование и поиск соответствий. Низкая энергия присваивается совместимым парам, например запросу и документу, изображению и текстовому описанию или пользователю и объекту рекомендации.
- Обнаружение аномалий и данных вне распределения. Энергия может использоваться как один из признаков необычности входа. Однако низкая энергия сама по себе не гарантирует принадлежность обучающему распределению, поэтому порог необходимо проверять на отдельных данных.
- Научное моделирование. В моделях молекул и материалов нейронная сеть может приближать потенциальную энергию, а силы вычисляются как её отрицательный градиент. В этом случае термин «энергия» может иметь непосредственный физический смысл.
Преимущества
К основным преимуществам относятся:
- Гибкость представления. Для определения модели достаточно скалярной функции, которая может быть реализована нейронной сетью, графической моделью или суммой специализированных потенциалов.
- Отсутствие обязательного явного генератора. Модель не обязана строить объект за один проход из заранее заданной скрытой переменной.
- Единая формулировка разных задач. Классификация, структурированное предсказание, ранжирование, генерация и ассоциативная память могут быть описаны через сравнение энергий.
- Работа со сложными выходами. Энергия может оценивать весь структурированный объект без необходимости заранее задавать его покомпонентную нормированную вероятность.
- Композиционность. Несколько ограничений можно в некоторых случаях объединять сложением энергий.
- Адаптивная вычислительная сложность. Для сложного примера можно выполнить больше шагов оптимизации или сэмплирования, постепенно уточняя результат.
Ограничения
Трудность нормировки
Функция разбиения содержит сумму или интеграл по всему пространству объектов. В высоких размерностях она обычно не вычисляется точно. Это затрудняет оценку правдоподобия, обучение максимальным правдоподобием и сравнение разных моделей.
Медленное сэмплирование
Марковская цепь может долго оставаться около одного локального минимума и редко переходить между удалёнными модами. Короткие цепи дают быстрые, но смещённые отрицательные примеры. Длинные цепи увеличивают вычислительные затраты и всё равно не гарантируют обнаружения всех мод.
В примере с двумя скоплениями цепь может надолго остаться около одного из них. Тогда полученные выборки будут создавать ошибочное впечатление, что второе скопление отсутствует.
Нестабильность обучения
Энергетический рельеф меняется одновременно с распределением отрицательных примеров. Если сэмплер не успевает приспособиться к новой энергии, модель обучается на устаревших или слишком простых примерах. Возможны неограниченный рост абсолютных значений энергии, резкие градиенты и численная неустойчивость.
Для стабилизации используют штрафы на величину энергии, спектральную нормализацию, ограничения градиента, буферы примеров, медленное изменение параметров и настройку шагов MCMC. Эти приёмы улучшают практическое обучение, но не заменяют проверку перемешивания цепей.
Зависимость от отрицательных примеров
Модель учится повышать энергию прежде всего там, где появляются отрицательные примеры. Если генератор отрицательных примеров не посещает некоторую область, энергия в ней может остаться необоснованно низкой. Поэтому хорошее различение обучающих и известных отрицательных данных ещё не доказывает правильность глобальной плотности.
Трудность интерпретации абсолютной энергии
Энергии сравнимы только в рамках согласованной модели и выбранной температуры. Сдвиг энергии не изменяет распределение, а изменение масштаба эквивалентно изменению температуры. Энергии двух независимо обученных моделей нельзя непосредственно сравнивать без калибровки.
Оценка качества
Для вероятностной EBM желательно оценивать логарифмическое правдоподобие, но функция разбиения часто неизвестна. Для её приближения применяют выборку по значимости, отжиговую выборку по значимости и другие методы, которые также могут иметь большую дисперсию.
Поэтому дополнительно оценивают:
- качество решения основной задачи;
- качество и разнообразие сгенерированных объектов;
- покрытие мод распределения;
- устойчивость к искажениям;
- калибровку условных вероятностей;
- различение данных внутри и вне распределения;
- перемешивание и воспроизводимость марковских цепей.
Ни одна из этих характеристик по отдельности не подтверждает корректность всей вероятностной модели.
Сравнение с другими генеративными моделями
| Подход | Представление распределения | Получение выборки | Основное отличие от EBM |
|---|---|---|---|
| Модель на основе энергии | Ненормированная плотность | Обычно итеративный MCMC-процесс | Гибкая энергия, но трудны нормировка и сэмплирование |
| Авторегрессионная модель | Произведение нормированных условных вероятностей | Последовательная генерация компонент | Правдоподобие обычно вычисляется точно, но генерация последовательна |
| Нормализующий поток | Нормированная плотность через обратимое преобразование | Один проход из базового распределения | Точное правдоподобие требует обратимой архитектуры и вычислимого якобиана |
| Вариационный автокодировщик | Модель со скрытыми переменными и вариационной нижней оценкой | Один проход декодера после выборки скрытой переменной | Быстрая генерация, но правдоподобие обычно оптимизируется через нижнюю оценку |
| Генеративно-состязательная сеть | Неявное распределение генератора | Один проход генератора | Не задаёт явной нормированной плотности или единой энергии данных |
| Диффузионная модель | Набор зашумлённых распределений или зависящих от времени скор-функций | Итеративное обращение процесса зашумления | Близка к EBM через скор-функции, но обычно не задаёт одну общую скалярную энергию |
Границы между подходами не являются абсолютными. Сэмплер для EBM можно амортизировать отдельной генеративной сетью, классификатор можно дополнительно обучить как совместную энергетическую модель, а сопоставление скор-функций связывает EBM с диффузионными методами.
История и значение
Энергетический подход объединяет несколько направлений, которые первоначально развивались отдельно. В статистической физике распределение Больцмана связывает вероятность состояния с его энергией. В вероятностном моделировании аналогичная запись используется для марковских случайных полей и экспоненциальных семейств.
В 1982 году Джон Хопфилд применил энергетическую функцию для описания устойчивых состояний рекуррентной нейронной сети. В 1985 году Дэвид Акли, Джеффри Хинтон и Терренс Сейновски предложили алгоритм обучения стохастической машины Больцмана.
Условные случайные поля, представленные Джоном Лафферти, Эндрю Маккаллумом и Фернанду Перейрой в 2001 году, стали важным примером условных энергетических моделей для последовательностей. В 2002 году Хинтон предложил контрастивную дивергенцию, которая сделала практическое обучение ограниченных машин Больцмана значительно дешевле полного обучения максимальным правдоподобием.
В 2005 году Хювяринен разработал сопоставление скор-функций для ненормированных непрерывных моделей. В дальнейшем шумовая контрастивная оценка предложила обучать ненормированную модель через различение данных и известного шума.
Развитие глубоких нейронных сетей позволило использовать в качестве энергии сложные свёрточные и другие архитектуры. Современные глубокие EBM сохраняют общую идею ранних энергетических моделей, но используют автоматическое дифференцирование, градиентные MCMC-методы, большие наборы данных и специализированную регуляризацию.
Практические замечания
При построении модели необходимо отдельно определить:
- пространство допустимых конфигураций и базовую меру;
- параметризацию энергии;
- способ получения правильных и отрицательных примеров;
- функцию потерь;
- алгоритм вывода или сэмплирования;
- ограничения, обеспечивающие устойчивость и, при необходимости, нормируемость;
- критерии оценки качества.
Важно также различать три возможные цели:
- ранжирование — правильная конфигурация должна иметь меньшую энергию;
- условное моделирование — требуется корректное распределение
;
- совместное или генеративное моделирование — требуется корректное распределение по самим объектам.
Успех в первой задаче не гарантирует успеха во второй или третьей. Например, классификатор может точно выбирать метку, но присваивать произвольные энергии входам вне обучающего распределения.
См. также
- Сеть Хопфилда
- Машина Больцмана
- Ограниченная машина Больцмана
- Марковское случайное поле
- Условное случайное поле
- Вероятностная графическая модель
- Структурированное предсказание
- Генеративная модель
- Метод Монте-Карло для марковских цепей
- Сопоставление скор-функций
- Диффузионная модель
- Контрастивное обучение
Литература
- LeCun Y., Chopra S., Hadsell R., Ranzato M., Huang F. J. A Tutorial on Energy-Based Learning // Predicting Structured Data. — Cambridge, Massachusetts: MIT Press, 2007. — С. 191—246. — ISBN 978-0-262-02617-8
- Hopfield J. J. Neural Networks and Physical Systems with Emergent Collective Computational Abilities // Proceedings of the National Academy of Sciences. — 1982. — Т. 79. — № 8. — С. 2554—2558.
- Ackley D. H., Hinton G. E., Sejnowski T. J. A Learning Algorithm for Boltzmann Machines // Cognitive Science. — 1985. — Т. 9. — № 1. — С. 147—169.
- Lafferty J., McCallum A., Pereira F. C. N. Conditional Random Fields: Probabilistic Models for Segmenting and Labeling Sequence Data // Proceedings of the 18th International Conference on Machine Learning. — 2001. — С. 282—289.
- Hinton G. E. Training Products of Experts by Minimizing Contrastive Divergence // Neural Computation. — 2002. — Т. 14. — № 8. — С. 1771—1800.
- Hyvärinen A. Estimation of Non-Normalized Statistical Models by Score Matching // Journal of Machine Learning Research. — 2005. — Т. 6. — № 24. — С. 695—709.
- Tieleman T. Training Restricted Boltzmann Machines Using Approximations to the Likelihood Gradient // Proceedings of the 25th International Conference on Machine Learning. — 2008. — С. 1064—1071.
- Wainwright M. J., Jordan M. I. Graphical Models, Exponential Families, and Variational Inference // Foundations and Trends in Machine Learning. — 2008. — Т. 1. — № 1—2. — С. 1—305.
- Vincent P. A Connection Between Score Matching and Denoising Autoencoders // Neural Computation. — 2011. — Т. 23. — № 7. — С. 1661—1674.
- Gutmann M. U., Hyvärinen A. Noise-Contrastive Estimation of Unnormalized Statistical Models, with Applications to Natural Image Statistics // Journal of Machine Learning Research. — 2012. — Т. 13. — № 11. — С. 307—361.
- Du Y., Mordatch I. Implicit Generation and Modeling with Energy Based Models // Advances in Neural Information Processing Systems. — 2019. — Т. 32. — С. 3608—3618.
- Grathwohl W., Wang K.-C., Jacobsen J.-H., Duvenaud D., Norouzi M., Swersky K. Your Classifier Is Secretly an Energy Based Model and You Should Treat It Like One2020.
- Liu W., Wang X., Owens J., Li Y. Energy-Based Out-of-Distribution Detection // Advances in Neural Information Processing Systems. — 2020. — Т. 33. — С. 21464—21475.

