Теорема Неймана-Пирсона

Материал из MachineLearning.

Версия от 13:37, 19 июля 2026; Arina Iarovenko (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Содержание

Теорема Неймана — Пирсона (также лемма Неймана — Пирсона) — фундаментальный результат теории проверки статистических гипотез, определяющий наиболее мощный критерий заданного уровня значимости для различения двух простых статистических гипотез. Критерий сравнивает отношение правдоподобия альтернативной и нулевой моделей с порогом: нулевая гипотеза отвергается для наблюдений, которые относительно более вероятны при альтернативе.[1]

Теорема формализует компромисс между ошибками первого и второго рода. Если допустимая вероятность ложного отклонения нулевой гипотезы заранее ограничена, то отношение правдоподобия задаёт область отклонения, для которой вероятность обнаружить данную альтернативу максимальна. Результат был получен Ежи Нейманом и Эгоном Пирсоном и опубликован в 1933 году.[1]

Постановка задачи

Пусть наблюдение X принимает значения в измеримом пространстве. Рассматриваются две простые гипотезы

H_0:\;X\sim P_0,
H_1:\;X\sim P_1.

Гипотеза называется простой, если она полностью задаёт распределение наблюдения. При каждой из гипотез не остаётся неизвестных параметров, влияющих на распределение. Составная гипотеза, напротив, соответствует семейству распределений.

Статистический критерий можно задать измеримой функцией

\varphi(x)\in[0,1].

Значение \varphi(x) интерпретируется как условная вероятность отклонить H_0 после получения результата x. Обычный, нерандомизированный критерий принимает только значения 0 и 1. Промежуточные значения описывают рандомизированный критерий: окончательное решение дополнительно использует независимый случайный механизм.

Вероятность ошибки первого рода и мощность критерия при заданной альтернативе равны соответственно

\alpha(\varphi)={\rm E}_0\varphi(X),
\pi_1(\varphi)={\rm E}_1\varphi(X).

Здесь {\rm E}_0 и {\rm E}_1 обозначают математические ожидания при распределениях P_0 и P_1. Ошибка первого рода состоит в отклонении истинной нулевой гипотезы. Ошибка второго рода имеет вероятность 1-\pi_1(\varphi) и состоит в сохранении H_0, когда верна H_1.

Критерий имеет уровень значимости не выше \alpha, если

{\rm E}_0\varphi(X)\leq\alpha.

Требуется найти среди всех таких критериев критерий с наибольшей мощностью. Иными словами, вероятность ошибки первого рода служит ограниченным ресурсом, а вероятность обнаружения конкретной альтернативы — оптимизируемой величиной.

Формулировка теоремы

Предположим, что распределения P_0 и P_1 имеют плотности p_0 и p_1 относительно общей меры \mu. Плотностью здесь может быть как плотность относительно меры Лебега, так и функция вероятностей относительно считающей меры. Для пары вероятностных мер общую доминирующую меру всегда можно выбрать как P_0+P_1. Для любого уровня 0<\alpha<1 существуют число k\geq0 и вероятность рандомизации 0\leq\gamma\leq1, при которых критерий \varphi^* имеет следующий вид:[1]

На множестве p_1(x)>k p_0(x) полагается

\varphi^*(x)=1.

На множестве p_1(x)<k p_0(x) полагается

\varphi^*(x)=0.

На границе p_1(x)=k p_0(x) полагается

\varphi^*(x)=\gamma,

причём k и \gamma можно выбрать так, чтобы

{\rm E}_0\varphi^*(X)=\alpha.

Тогда для любого другого критерия \varphi уровня не выше \alpha выполняется

{\rm E}_1\varphi(X)\leq{\rm E}_1\varphi^*(X).

Следовательно, \varphi^* является наиболее мощным критерием уровня \alpha для проверки H_0 против H_1. При естественных условиях верно и обратное утверждение: всякий наиболее мощный критерий должен иметь указанную структуру, за исключением множеств нулевой вероятности и возможного выбора решения на границе.[1]

Если p_0(x)>0, правило удобно записывать через отношение правдоподобия

L(x)={p_1(x)\over p_0(x)}.

Большие значения L(x) свидетельствуют в пользу H_1, поэтому нулевая гипотеза отвергается при L(x)>k. На множестве, где p_0(x)=0, но p_1(x)>0, наблюдение невозможно при нулевой гипотезе и критерий всегда отвергает её. Точки, в которых обе плотности равны нулю, на вероятности ошибок не влияют.

В литературе отношением правдоподобия иногда называют обратную величину p_0(x)/p_1(x). При таком соглашении нулевая гипотеза отвергается при малых, а не при больших значениях статистики. Различие относится только к направлению записи правила.

Обоснование оптимальности

Доказательство опирается на то, что критерий \varphi^* принимает решение в соответствии со знаком разности p_1-kp_0. Для любого другого критерия \varphi поточечно выполняется

\bigl(\varphi^*(x)-\varphi(x)\bigr)\bigl(p_1(x)-k p_0(x)\bigr)\geq0.

Там, где первая плотность в сравнении больше, критерий \varphi^* принимает максимально возможное значение; там, где она меньше, — минимально возможное. На границе второй множитель равен нулю.

Интегрирование по мере \mu даёт

{\rm E}_1\bigl(\varphi^*(X)-\varphi(X)\bigr)-k{\rm E}_0\bigl(\varphi^*(X)-\varphi(X)\bigr)\geq0.

Если уровень \varphi не превосходит \alpha, а размер \varphi^* равен \alpha, то

{\rm E}_0\bigl(\varphi^*(X)-\varphi(X)\bigr)\geq0.

Поскольку k\geq0, отсюда следует

{\rm E}_1\varphi^*(X)-{\rm E}_1\varphi(X)\geq0.

Таким образом, никакое иное перераспределение области отклонения при том же ограничении на ошибку первого рода не может увеличить мощность против заданного распределения P_1. Доказательство одновременно объясняет вид оптимального правила: в область отклонения в первую очередь включаются наблюдения с наибольшей относительной правдоподобностью альтернативы.

Если множество p_1=kp_0 имеет нулевую вероятность и нет иных участков, на которых перестановка решений не меняет обе вероятности, наиболее мощный критерий единственен почти наверное. При положительной вероятности границы возможны эквивалентные способы рандомизации.

Выбор порога и рандомизация

Порог определяется распределением отношения правдоподобия при нулевой гипотезе. Для критерия точного уровня должно выполняться

P_0\{L(X)>k\}+\gamma P_0\{L(X)=k\}=\alpha.

Сначала выбирается порог k, при котором вероятность строгого превышения не больше \alpha, а вероятность нестрогого превышения не меньше \alpha. Затем значение \gamma заполняет возможный разрыв. Построение критерия эквивалентно упорядочению исходов по величине L и включению исходов с наибольшими значениями до исчерпания допустимой вероятности ошибки первого рода.

Для непрерывного распределения L(X) при H_0 вероятность равенства порогу обычно равна нулю, и критерий можно сделать нерандомизированным. В дискретных моделях распределение статистики имеет скачки. Тогда критерий без рандомизации нередко достигает лишь уровня, строго меньшего \alpha; рандомизация позволяет получить точный уровень и максимальную мощность в полном классе критериев. В приложениях случайное решение может быть нежелательно, поэтому часто выбирают консервативный нерандомизированный критерий и указывают его фактический размер.

Дискретный пример

Пусть имеется одно наблюдение X из распределения Бернулли, а гипотезы имеют вид

H_0:\;P_0\{X=1\}={1\over5},\qquad H_1:\;P_1\{X=1\}={3\over5}.

Отношение правдоподобия равно 3 при X=1 и 1/2 при X=0. Поэтому исход X=1 должен входить в область отклонения первым. При требуемом уровне \alpha=1/10 безусловное отклонение при X=1 дало бы размер 1/5, превышающий ограничение. Оптимальный критерий отвергает H_0 при этом исходе с вероятностью 1/2 и никогда не отвергает её при X=0. Его размер равен 1/10, а мощность — 3/10.

Пример: проверка среднего нормального распределения

Пусть X_1,\ldots,X_n — независимые наблюдения из нормального распределения со средним \mu и известной дисперсией \sigma^2. Рассматриваются простые гипотезы

H_0:\;\mu=\mu_0,\qquad H_1:\;\mu=\mu_1,

где \mu_1>\mu_0. Логарифм отношения правдоподобия равен

\log L(X_1,\ldots,X_n)={\mu_1-\mu_0\over\sigma^2}\sum_{i=1}^n X_i-{n(\mu_1^2-\mu_0^2)\over2\sigma^2}.

При фиксированных параметрах это выражение строго возрастает с выборочным средним \overline X. Поэтому критерий Неймана — Пирсона отвергает нулевую гипотезу при больших значениях выборочного среднего. Порог уровня \alpha имеет вид

\overline X>\mu_0+{\sigma\over\sqrt n}z_{1-\alpha},

где z_{1-\alpha} — квантиль стандартного нормального распределения, определяемый равенством

\Phi(z_{1-\alpha})=1-\alpha.

Мощность этого критерия при указанной альтернативе составляет

\pi(\mu_1)=1-\Phi\left(z_{1-\alpha}-{\sqrt n(\mu_1-\mu_0)\over\sigma}\right).

Формула показывает, что мощность возрастает с объёмом выборки и стандартизованным расстоянием между средними. Критическая граница не зависит от конкретного значения \mu_1, если \mu_1>\mu_0. Поэтому тот же критерий является равномерно наиболее мощным для односторонней составной альтернативы \mu>\mu_0.[1] Это свойство связано с монотонностью отношения правдоподобия и не является общим для составных гипотез.

Составные гипотезы и связанные критерии

Равномерно наиболее мощные критерии

Теорема непосредственно сравнивает только два полностью заданных распределения. Если альтернатива содержит несколько распределений, наиболее мощные критерии для разных её точек могут иметь разные области отклонения. Критерий называется равномерно наиболее мощным, если при соблюдении ограничения на размер он обладает не меньшей мощностью, чем любой конкурирующий критерий, одновременно для каждого распределения из альтернативы.

Равномерно наиболее мощный критерий существует не всегда. В однопараметрических семействах с монотонным отношением правдоподобия критерии Неймана — Пирсона для односторонних альтернатив часто имеют общую критическую область. Это приводит к теореме Карлина — Рубина и объясняет оптимальность многих односторонних критериев для экспоненциальных семейств.[1] Для двусторонних альтернатив единая область, оптимальная во всех направлениях, обычно отсутствует; тогда вводятся дополнительные требования, например несмещённость или инвариантность критерия.

Обобщённый критерий отношения правдоподобия

Для параметрических составных гипотез широко применяется обобщённый критерий отношения правдоподобия. Если нулевая гипотеза задаётся множеством параметров \Theta_0, а полная модель — множеством \Theta, его статистика обычно записывается как

\lambda(x)={\sup_{\theta\in\Theta_0}p_\theta(x)\over\sup_{\theta\in\Theta}p_\theta(x)}.

Нулевая гипотеза отвергается при малых значениях \lambda. Если обе гипотезы простые, это правило сводится к пороговому сравнению обычного отношения правдоподобия. Однако для составных гипотез оптимальность обобщённого критерия не следует из теоремы Неймана — Пирсона. Его обоснование может опираться на специальные свойства модели, инвариантность или асимптотическое распределение статистики.[1]

При наличии мешающих параметров ограничение на ошибку первого рода должно выполняться для всех допустимых значений этих параметров либо в явно заданном усреднённом смысле. Простая подстановка оценок вместо неизвестных величин не сохраняет точный уровень автоматически.

Статистическая интерпретация

Уровень, мощность и наблюдаемое решение

Уровень значимости — характеристика процедуры при многократном повторении эксперимента под нулевой гипотезой, а не вероятность истинности H_0 после получения данных. Теорема не приписывает гипотезам апостериорных вероятностей. Она отвечает на условный вопрос: какая процедура лучше всего обнаруживает конкретную альтернативу при заранее ограниченной частоте ложных срабатываний.

Достигаемый уровень значимости позволяет представить семейство вложенных критериев, но не заменяет альтернативную модель в утверждении теоремы. Два критерия одинакового уровня могут иметь существенно различную мощность; для её сравнения необходимо указать распределение при альтернативе.

Байесовское правило решений

В байесовской постановке оптимальное решение для двух простых моделей также часто имеет вид порогового сравнения отношения правдоподобия. Причина порога иная: он определяется априорными вероятностями гипотез и потерями от различных решений. В постановке Неймана — Пирсона априорные вероятности не требуются, а порог выбирается из ограничения на ошибку первого рода. Совпадение математической формы не означает тождества критериев оптимальности.

Связь с классификацией и машинным обучением

Двоичную классификацию можно представить как различение двух распределений признаков. Пусть p_0(x) и p_1(x) — условные плотности признакового описания для отрицательного и положительного классов. Для решающего правила \delta доля ложноположительных решений и чувствительность в генеральной совокупности равны

{\rm FPR}(\delta)=P_0\{\delta(X)=1\},
{\rm TPR}(\delta)=P_1\{\delta(X)=1\}.

Теорема Неймана — Пирсона утверждает, что пороговое правило по p_1(x)/p_0(x) максимизирует {\rm TPR} среди всех правил с заданным верхним ограничением на {\rm FPR}. При изменении порога такие правила, с возможной рандомизацией на границе, образуют верхнюю границу достижимой ROC-кривой для фиксированной пары распределений.[1] Эта интерпретация применяется в задачах обнаружения сигналов, медицинской диагностики, фильтрации событий и выявления аномалий, где стоимость ложного срабатывания задаёт явное ограничение.

В практическом машинном обучении плотности классов обычно неизвестны. Отношение правдоподобия заменяют оценкой по обучающей выборке либо используют классификатор, оценка которого монотонно связана с этим отношением. Порог затем калибруют по отдельным данным. Теорема описывает оптимальное правило для истинных распределений, но не гарантирует точного контроля частоты ошибок после оценивания модели на конечной выборке. Для статистически обоснованного контроля необходимы независимая проверочная выборка, учёт неопределённости оценивания или специальные методы конечновыборочной калибровки.

Результат также разделяет качество ранжирования и выбор рабочего порога. Обученная оценочная функция может хорошо упорядочивать объекты, однако требуемый уровень ложноположительных решений достигается только после калибровки порога относительно распределения отрицательного класса.

Ограничения и типичные ошибки применения

  • Простота гипотез. Точная оптимальность относится к одной фиксированной нулевой и одной фиксированной альтернативной модели. Максимизация правдоподобия по множествам параметров не превращает составную задачу в прямое следствие теоремы.
  • Зависимость от модели. Неверно заданные плотности могут дать область отклонения, не обладающую ни заявленным уровнем, ни наибольшей мощностью для фактических данных.
  • Смешение размера и мощности. Ограничение вероятности ошибки первого рода не означает одновременной минимизации обеих ошибок. Оптимальность формулируется при фиксированном ограничении и для конкретной альтернативы.
  • Обратное отношение. При статистике p_1/p_0 отклонению соответствуют большие значения, а при p_0/p_1 — малые. Использование неверного направления меняет критическую область.
  • Игнорирование дискретности. В дискретной модели точный заданный уровень может требовать рандомизации. Нерандомизированный критерий следует характеризовать его фактическим размером.
  • Настройка по тем же данным. Выбор модели, статистики или порога после просмотра проверочных данных способен увеличить действительную вероятность ложного отклонения. Уровень сохраняется только для процедуры, случайность которой полностью учтена при калибровке.
  • Множественные проверки. Теорема рассматривает одно решение между двумя гипотезами и сама по себе не контролирует семейную вероятность ошибки или долю ложных открытий при большом числе проверок.

Теорема Неймана — Пирсона служит эталоном оптимальности статистического решения: при полностью заданных моделях она даёт исчерпывающий ответ, но при переходе к оценённым, составным или адаптивно выбранным моделям требуются дополнительные аргументы.

См. также

Примечания

Литература

  • Neyman J., Pearson E. S. IX. On the Problem of the Most Efficient Tests of Statistical Hypotheses // Philosophical Transactions of the Royal Society of London. Series A, Containing Papers of a Mathematical or Physical Character. — 1933. — Т. 231. — С. 289–337.
  • Lehmann E. L., Romano J. P. Testing Statistical Hypotheses. — 3rd ed.. — New York: Springer, 2005. — ISBN 978-0-387-98864-1
  • Casella G., Berger R. L. Statistical Inference. — 2nd ed.. — Pacific Grove: Duxbury Press, 2002. — ISBN 978-0-534-24312-8