Вероятностно-статистические методы
Материал из MachineLearning.
| | Статья написана с использованием LLM Claude Sonnet 5 и проверена участником Д. Жумабеков 21:28, 19 июля 2026 (MSD) |
Введение
Детерминированная постановка задачи обучения по прецедентам предполагает существование неизвестной функциональной зависимости , которую алгоритм должен приблизить по обучающей выборке
. Вероятностно-статистическая постановка заменяет это предположение более общим: обучающая выборка рассматривается как реализация независимых одинаково распределённых наблюдений из некоторого неизвестного совместного распределения
на множестве
, а не как набор точных значений детерминированной функции.
Это обобщение содержательно, а не формально, и даёт три практических следствия, отсутствующих в детерминированной постановке. Во-первых, вероятностная модель позволяет получить не только точечный ответ, но и оценку неопределённости этого ответа — апостериорную вероятность , а не одно лишь наиболее вероятное значение класса. Во-вторых, вероятностная постановка естественно учитывает зашумлённость данных: объекты с одинаковым признаковым описанием
могут относиться к разным классам с ненулевой вероятностью — ситуация, несовместимая с детерминированной моделью
, но полностью согласующаяся с распределением
общего вида. В-третьих, явное указание вероятностной модели данных позволяет систематически привлекать методы математической статистики для работы на малых выборках — байесовский вывод, разбираемый в разделах ниже, даёт формальный механизм включения априорных знаний о задаче в условиях, когда объёма данных недостаточно для надёжного частотного оценивания.
Все вероятностные методы классификации восстанавливают совместное распределение одним из двух принципиально различных способов — дискриминативным или генеративным, — рассматриваемых в следующих двух разделах.
Дискриминативный подход
Дискриминативный подход раскладывает совместное распределение как
где — параметрическая модель условного распределения класса при заданном объекте с вектором параметров
, а
— безусловное распределение объектов, не моделируемое явно и не зависящее от
. Логарифм правдоподобия выборки при этом разложении:
Второе слагаемое не зависит от , и потому критерий максимума правдоподобия для дискриминативной модели сводится к максимизации только первого слагаемого:
Структурная особенность этой оптимизационной задачи в том, что она решается как единая задача по всей выборке сразу: параметр общий для всех классов, и его настройка происходит по объектам, лежащим вблизи разделяющей границы между классами, в максимальной степени влияющим на значение суммы. Типичные представители дискриминативного подхода — Логистическая регрессия, в которой
задаётся сигмоидной (для двух классов) или softmax (для нескольких классов) функцией от линейной комбинации признаков, а также решающие деревья и леса с вероятностными оценками в листьях, где
оценивается эмпирической частотой класса среди объектов, попавших в соответствующий лист.
Генеративный подход
Генеративный подход раскладывает то же совместное распределение иначе:
где — априорная вероятность класса,
— параметрическая модель условного распределения признаков внутри класса
, как правило, со своим набором параметров
для каждого класса. Логарифм правдоподобия выборки при этом разложении:
В отличие от дискриминативного случая, здесь оптимизационная задача распадается на независимые подзадачи: первое слагаемое максимизируется по отдельно (что даёт эмпирические частоты классов
), а второе слагаемое распадается на сумму по классам, каждое из которых максимизируется по своему набору параметров
независимо, с использованием только объектов данного класса:
Эта структурная независимость задач по классам — принципиальное отличие от дискриминативного подхода, где параметр настраивается совместно по всей выборке. Типичные представители генеративного подхода — Наивный байесовский классификатор, линейный и квадратичный дискриминантный анализ (восстанавливающие
нормальным распределением с общей или индивидуальной для класса ковариационной матрицей), а также смеси распределений для моделирования многомодальных классов.
Сравнение подходов
| Критерий | Дискриминативный подход | Генеративный подход |
|---|---|---|
| Требуемый объём данных | как правило, ниже: достаточно представительной выборки вблизи разделяющей границы | как правило, выше: требуется надёжная оценка полной плотности |
| Устойчивость к нарушению модельных предположений | выше: неверная функциональная форма | ниже: неверная модель |
| Интерпретируемость параметров | как правило, ниже: параметры | как правило, выше: параметры |
| Применимость при дисбалансе классов | требует явной коррекции (перевзвешивание объектов, подбор порога принятия решения) | естественна: |
Метод максимального правдоподобия как общий инструмент оценивания
Оба рассмотренных подхода используют один и тот же общий принцип — Метод максимального правдоподобия: параметры модели выбираются так, чтобы максимизировать вероятность (плотность) наблюдения именно той выборки, которая была получена. Формально, для параметрической модели (где
обозначает либо пару
, либо, после разложения совместного распределения, соответствующий сомножитель) точечная оценка максимального правдоподобия:
При выполнении стандартных регулярных условий оценка максимального правдоподобия состоятельна ( при
) и асимптотически эффективна (её асимптотическая дисперсия достигает нижней границы Крамера — Рао). Однако эти свойства — асимптотические: они гарантируют качество оценки лишь в пределе неограниченного роста объёма выборки и ничего не говорят о поведении оценки при конечном, тем более малом
. На малых выборках точечная ML-оценка систематически проявляет следующие ограничения: она не учитывает никакой информации о параметре
, кроме содержащейся в выборке, из-за чего чувствительна к случайным флуктуациям малой выборки; она может давать вырожденные или экстремальные значения (например, оценку вероятности события, равную нулю или единице, если событие ни разу не наблюдалось либо наблюдалось при каждом испытании); и она не даёт никакой характеристики собственной неопределённости — сама по себе точечная оценка не сообщает, насколько ей можно доверять. Эти ограничения устраняются переходом к байесовскому обучению, рассматриваемому в следующем разделе.
Байесовское обучение
Байесовское обучение рассматривает сам вектор параметров как случайную величину, для которой заданная априорная плотность
отражает знания или предположения о правдоподобных значениях
до наблюдения выборки. По формуле Байеса апостериорное распределение параметров при условии наблюдённой выборки
:
где — правдоподобие выборки при заданном
(то же выражение, что максимизируется в методе максимального правдоподобия), а
— не зависящая от
нормировочная константа. Принципиальное отличие полного байесовского вывода от точечного оценивания состоит в том, что результатом обучения служит не единственное значение
, а целое распределение
, полностью характеризующее оставшуюся после наблюдения выборки неопределённость относительно параметров. Прогноз для нового объекта
при полном байесовском выводе получают усреднением (маргинализацией) по этому распределению, а не подстановкой единственного значения параметра:
Такое усреднение по всем правдоподобным значениям , взвешенным их апостериорной вероятностью, автоматически учитывает неопределённость в оценке параметров: если апостериорное распределение
широкое (что типично для малых выборок), итоговый прогноз
оказывается более сглаженным (менее категоричным) по сравнению с прогнозом, построенным по единственной точечной оценке параметра, — эффект, напрямую снижающий риск переобучения на малых выборках.
MAP-оценка и регуляризация
Вычисление интеграла маргинализации по в общем случае аналитически неразрешимо и требует приближённых методов. Практический компромисс между точечным ML-оцениванием и полным байесовским выводом — MAP-оценка (maximum a posteriori): вместо усреднения по всему апостериорному распределению берётся точка его максимума:
Сопоставление с формулой ML-оценки показывает, что MAP-оценка отличается от неё ровно одним дополнительным слагаемым — логарифмом априорной плотности параметра:
Первое слагаемое — логарифм правдоподобия, в точности совпадающий с максимизируемым в методе максимального правдоподобия; второе слагаемое — логарифм априорной плотности, играющий роль регуляризатора.
Отсюда следует точное соответствие между регуляризацией и байесовским априорным распределением: добавление к функционалу правдоподобия регуляризирующего слагаемого эквивалентно выбору априорного распределения
Это позволяет рассматривать любую регуляризацию как неявный байесовский вывод с фиксированным, но не выписанным явно априорным распределением, и наоборот — выбор конкретной формы регуляризатора как способ задать содержательные априорные предположения о параметрах, не прибегая к полному байесовскому аппарату. Типичные пары «регуляризатор — априорное распределение»:
-
-регуляризация (гребневая регрессия, weight decay),
, соответствует нормальному априорному распределению
с нулевым средним и дисперсией
— предположению, что параметры, скорее всего, невелики по абсолютной величине и симметрично распределены вокруг нуля.
-
-регуляризация,
, соответствует априорному распределению Лапласа
, более острому в нуле, чем нормальное распределение той же дисперсии, что и объясняет склонность
-регуляризации порождать разреженные (с точными нулевыми компонентами) решения.
- Эластичная сеть (elastic net), сочетающая
, соответствует смеси нормального и лапласовского приоров и объединяет свойства разреженности и устойчивости при коррелированных признаках.
Задачи на малых выборках
Рассмотрим геологическую задачу прогноза месторождений: по данным о геологическом строении участка (тип пород, характер тектонических нарушений, результаты предварительной разведки и тому подобные признаки, многие из которых качественные, экспертно оцениваемые и не допускающие точного количественного измерения) требуется оценить вероятность наличия промышленно значимого месторождения на данном участке. Специфика задачи в том, что число уже разведанных и подтверждённых объектов данного геологического типа, как правило, исчисляется единицами или, в лучшем случае, десятками — в отличие от типичных задач классификации с сотнями и тысячами прецедентов.
При таком объёме данных частотные (ML) оценки параметров становятся ненадёжными по нескольким причинам. Во-первых, при малом числе прецедентов оценка доли
(где
— число подтверждённых месторождений среди
разведанных участков данного типа) обладает большой дисперсией: при
изменение результата всего на одном участке меняет оценку на
, то есть на пятую часть всего диапазона
. Во-вторых, малые
регулярно приводят к вырожденным оценкам
(если ни на одном или на всех разведанных участках месторождение подтвердилось), формально утверждающим невозможность либо гарантированность события — вывод, не оправданный столь скудными данными. В-третьих, качественная, экспертная природа многих признаков не позволяет напрямую применить методы, требующие точного числового описания объектов, и вынуждает работать с малым числом дискретных, часто разреженно представленных сочетаний признаков, что ещё больше уменьшает эффективный объём данных, приходящийся на каждое сочетание.
В таких условиях информативное априорное распределение предпочтительнее точечной ML-оценки по существу, а не только по формальным статистическим соображениям: геологическая экспертиза, как правило, располагает содержательными знаниями о базовой частоте месторождений для родственных геологических структур, накопленными по существенно большей совокупности прошлых разведок, — эти знания естественно кодируются как параметры априорного распределения и, в отличие от ML-оценки по единичным новым прецедентам, не обнуляются и не вырождаются при недостатке локальных данных. MAP-оценка, объединяющая скудную локальную статистику с содержательным априорным знанием, систематически даёт более устойчивый и более консервативный (менее подверженный случайным флуктуациям малой выборки) результат, что и демонстрирует численный пример следующего раздела.
Численный пример MAP-оценки с сопряжённым априорным распределением
Пусть — вероятность подтверждения месторождения для данного геологического типа участка, а результат разведки каждого участка — независимое испытание Бернулли с этой вероятностью. Правдоподобие выборки из
испытаний с
подтверждениями:
В качестве сопряжённого априорного распределения для параметра испытаний Бернулли выбирается бета-распределение , где гиперпараметры
кодируют априорные представления о
: априорное среднее равно
, а сумма
играет роль «эквивалентного числа наблюдений», задающих уверенность в этом среднем. Апостериорное распределение находится перемножением правдоподобия и приора:
что с точностью до нормировки в точности бета-распределение с обновлёнными параметрами:
Сопряжённость приора означает именно это: апостериорное распределение принадлежит тому же параметрическому семейству, что и приор, с параметрами, обновлёнными простым добавлением наблюдённых успехов и неудач. MAP-оценка — мода этого бета-распределения:
Численный пример. Пусть для рассматриваемого геологического типа разведано участков, из которых
оказались месторождениями. Точечная ML-оценка:
— величина, основанная всего на пяти испытаниях и статистически крайне ненадёжная. Пусть по совокупности прошлых разведок родственных геологических структур известно, что типичная (базовая) доля подтверждённых месторождений составляет около , и это знание кодируется приором
(априорное среднее
, эквивалент десяти условных наблюдений). Апостериорное распределение по формуле выше:
MAP-оценка:
Апостериорное среднее (использующееся, если требуется не мода, а математическое ожидание апостериорного распределения) даёт близкое значение . Сопоставление
и
наглядно демонстрирует эффект регуляризации малой выборки априорным знанием: ML-оценка, основанная исключительно на пяти локальных наблюдениях, оказывается почти вдвое выше MAP-оценки, «стянутой» в сторону типичной для родственных структур базовой частоты. При увеличении числа локальных наблюдений (росте
и
при сохранении их отношения) вклад приора относительно правдоподобия убывает, и MAP-оценка асимптотически сближается с ML-оценкой — иллюстрация общего принципа, согласно которому влияние априорного распределения существенно именно тогда, когда объём данных мал, и естественным образом ослабевает по мере накопления наблюдений.

