Условная независимость

Материал из MachineLearning.

Версия от 13:58, 19 июля 2026; Arina Iarovenko (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Содержание

Условная независимость — отношение между случайными объектами, означающее, что после фиксации некоторой информации знание одного объекта не изменяет условное распределение другого. Это понятие уточняет обычную статистическую независимость и играет центральную роль в математической статистике, байесовских сетях, марковских моделях, причинном анализе и вероятностных методах машинного обучения.[1]

Основная идея состоит в отделении непосредственной статистической связи от связи, объясняемой третьей величиной. Две переменные могут быть зависимы в совокупности, но стать независимыми внутри групп с одинаковым значением управляющей переменной. Возможна и обратная ситуация: обусловливание на общем следствии способно сделать независимые переменные зависимыми.

Определение

События

Пусть A, B и C — события, причём P(C)>0. События A и B называются независимыми при условии C, если

P(A\cap B\mid C)=P(A\mid C)P(B\mid C).

После ограничения вероятностного пространства событием C это равенство совпадает с обычным определением независимости. Оно описывает обусловливание на одном событии, но недостаточно для общего случая, когда доступная информация задаётся случайной величиной или сигма-алгеброй.

Сигма-алгебры и случайные величины

Пусть {\cal A} и {\cal B} — сигма-алгебры событий, а {\cal G} — сигма-алгебра, представляющая известную информацию. Условная независимость {\cal A} и {\cal B} относительно {\cal G} означает, что для всех A\in{\cal A} и B\in{\cal B}

P(A\cap B\mid{\cal G})=P(A\mid{\cal G})P(B\mid{\cal G})

почти наверное. Условные вероятности в этой формуле являются условными математическими ожиданиями индикаторов событий и потому сами представляют собой случайные величины.

Для случайных элементов X, Y и Z используется обозначение

X\perp\!\!\!\perp Y\mid Z.

Оно означает условную независимость сигма-алгебр, порождённых X и Y, относительно сигма-алгебры, порождённой Z. Если обусловливающей информации нет, запись сводится к обычной независимости X\perp\!\!\!\perp Y.

Определение является утверждением почти наверное относительно распределения Z. Условные распределения можно изменять на множестве значений Z нулевой вероятности, не меняя условной независимости. Поэтому равенства условных плотностей не обязаны иметь смысл в каждой отдельной точке.

Эквивалентные формы

Факторизация условного распределения

Для дискретных случайных величин условная независимость эквивалентна равенству

p_{X,Y\mid Z}(x,y\mid z)=p_{X\mid Z}(x\mid z)p_{Y\mid Z}(y\mid z)

для всех значений z положительной вероятности и всех допустимых x и y. Для непрерывных величин то же равенство выполняется для плотностей почти всюду. Совместную плотность при этом можно представить как

p_{X,Y,Z}(x,y,z)=p_Z(z)p_{X\mid Z}(x\mid z)p_{Y\mid Z}(y\mid z).

Таким образом, после задания Z условное совместное распределение X и Y распадается в произведение двух распределений.

При существовании регулярных условных распределений условную независимость можно выразить отсутствием дополнительной информации о X в переменной Y после наблюдения Z:

P(X\in A\mid Y,Z)=P(X\in A\mid Z)

почти наверное для каждого измеримого множества A. Симметричное равенство выполняется для условного распределения Y.

Формулировка через условные ожидания

Для любых ограниченных измеримых функций f и g условная независимость эквивалентна равенству

{\rm E}\bigl(f(X)g(Y)\mid Z\bigr)={\rm E}\bigl(f(X)\mid Z\bigr){\rm E}\bigl(g(Y)\mid Z\bigr)

почти наверное. Эта форма не требует существования плотностей и применима к дискретным, непрерывным и смешанным распределениям. Достаточно проверить равенство для индикаторов измеримых множеств; переход к более общим функциям следует из стандартных свойств интеграла.

При существовании вторых моментов условная независимость влечёт

{\rm Cov}(f(X),g(Y)\mid Z)=0.

Обратное утверждение обычно неверно: отсутствие условной линейной связи не исключает нелинейной зависимости.

Условная взаимная информация

Если соответствующие плотности существуют, мерой остаточной зависимости служит условная взаимная информация

I(X;Y\mid Z)={\rm E}\log {p_{X,Y\mid Z}(X,Y\mid Z)\over p_{X\mid Z}(X\mid Z)p_{Y\mid Z}(Y\mid Z)}.

Эта величина является средним расхождением Кульбака — Лейблера между условным совместным распределением и произведением условных маргинальных распределений, поэтому она неотрицательна. При обычных условиях

I(X;Y\mid Z)=0

тогда и только тогда, когда X\perp\!\!\!\perp Y\mid Z.[1] В отличие от условной ковариации, условная взаимная информация обнаруживает произвольную статистическую зависимость, однако её оценивание по конечной выборке может быть сложным.

Основные свойства

Условная независимость подчиняется системе правил, называемой полуграфоидными аксиомами.[1] Для случайных элементов X, Y, W и Z выполняются следующие свойства.

  • Симметрия:
X\perp\!\!\!\perp Y\mid Z\quad\Longrightarrow\quad Y\perp\!\!\!\perp X\mid Z.
  • Декомпозиция:
X\perp\!\!\!\perp(Y,W)\mid Z\quad\Longrightarrow\quad X\perp\!\!\!\perp Y\mid Z.

То же следствие получается при замене Y на W.

  • Слабое объединение:
X\perp\!\!\!\perp(Y,W)\mid Z\quad\Longrightarrow\quad X\perp\!\!\!\perp Y\mid(Z,W).
  • Сжатие:
X\perp\!\!\!\perp Y\mid Z,\quad X\perp\!\!\!\perp W\mid(Y,Z)\quad\Longrightarrow\quad X\perp\!\!\!\perp(Y,W)\mid Z.

Эти четыре свойства справедливы для произвольных вероятностных распределений. При дополнительных условиях регулярности, в частности для строго положительных плотностей, выполняется также свойство пересечения:

X\perp\!\!\!\perp Y\mid(Z,W),\quad X\perp\!\!\!\perp W\mid(Z,Y)\quad\Longrightarrow\quad X\perp\!\!\!\perp(Y,W)\mid Z.

Положительность существенна: структурные нули или детерминированные связи могут нарушать пересечение. Аксиомы позволяют преобразовывать наборы утверждений об условной независимости и лежат в основе теории вероятностных графических моделей.

Из X\perp\!\!\!\perp Y\mid Z следует условная независимость f(X) и g(Y) для любых измеримых преобразований f и g. Однако условная независимость в общем случае не обладает транзитивностью. Не выполняется без дополнительных предположений и правило композиции

X\perp\!\!\!\perp Y\mid Z,\quad X\perp\!\!\!\perp W\mid Z\quad\Longrightarrow\quad X\perp\!\!\!\perp(Y,W)\mid Z.

Например, случайная величина может быть независима от каждого из двух двоичных аргументов по отдельности, но полностью определяться их сложением по модулю два. Поэтому попарные утверждения не всегда объединяются в совместную независимость.

Отличие от безусловной независимости

Условная и безусловная независимость не следуют одна из другой. Обусловливание изменяет рассматриваемое распределение и может как устранить, так и создать зависимость.

Общая причина

Пусть Z — двоичная переменная, а \varepsilon_X и \varepsilon_Y — независимые ошибки, не зависящие от Z. Положим

X=Z+\varepsilon_X,\qquad Y=Z+\varepsilon_Y.

При фиксированном Z переменные X и Y зависят от разных независимых ошибок, поэтому

X\perp\!\!\!\perp Y\mid Z.

Без обусловливания обе переменные содержат общий случайный компонент Z и обычно зависимы. В статистическом анализе Z может представлять группу, среду, состояние системы или общий фактор, объясняющий наблюдаемую связь.

Общее следствие и эффект отбора

Пусть X и Y — независимые случайные величины Бернулли с одинаковыми вероятностями двух исходов, а

Z=X+Y.

Безусловно X\perp\!\!\!\perp Y. Однако при Z=1 значение одной переменной однозначно определяет другую:

Y=1-X.

Следовательно, X и Y не являются условно независимыми относительно Z. В графических моделях переменная, являющаяся общим следствием двух других, называется коллайдером. Обусловливание на коллайдере или отбор наблюдений по его значению способен создавать статистическую связь; соответствующее явление известно как эффект Берксона.

Эти примеры показывают, почему добавление переменной в условие не обязательно «устраняет влияние» и не обязано сохранять ранее существовавшую независимость. Выбор обусловливающих переменных должен учитывать структуру совместного распределения.

Условная независимость в вероятностных моделях

Марковские процессы

Для марковской цепи будущее условно независимо от прошлого при известном настоящем. Для процесса первого порядка это свойство записывается как

X_{t+1}\perp\!\!\!\perp(X_0,\ldots,X_{t-1})\mid X_t.

Благодаря этому вместо распределения всей траектории достаточно задавать начальное распределение и переходные вероятности. Аналогичные предположения используются в скрытых марковских моделях, фильтрации временных рядов и моделях состояний.

В иерархической модели наблюдения часто предполагаются условно независимыми при заданном скрытом параметре:

p(x_1,\ldots,x_n\mid\theta)=\prod_{i=1}^n p(x_i\mid\theta).

Условная независимость здесь не означает безусловной независимости. После интегрирования по случайному параметру \theta наблюдения обычно становятся зависимыми, поскольку разделяют общий скрытый источник изменчивости.

Многомерное нормальное распределение

Для совместно нормальных случайных величин условная независимость полностью характеризуется условной ковариацией:

X\perp\!\!\!\perp Y\mid Z\quad\Longleftrightarrow\quad{\rm Cov}(X,Y\mid Z)=0.

Это специальное свойство нормального распределения. В ненормальных моделях нулевая условная ковариация обычно является лишь необходимым, но не достаточным условием.

Пусть случайный вектор X=(X_1,\ldots,X_d) имеет невырожденное многомерное нормальное распределение с ковариационной матрицей \Sigma и матрицей точности

\Omega=\Sigma^{-1}.

Тогда для различных индексов i и j

X_i\perp\!\!\!\perp X_j\mid X_{\{1,\ldots,d\}\setminus\{i,j\}}\quad\Longleftrightarrow\quad\Omega_{ij}=0.

Нули матрицы точности кодируют отсутствие рёбер в гауссовской марковской сети. Это соответствие используется при оценивании разреженных графических моделей, в частности при регуляризованном оценивании обратной ковариационной матрицы.[1]

Графические модели

Условная независимость позволяет компактно представлять многомерные распределения графом. В байесовской сети вершины ориентированного ациклического графа соответствуют случайным переменным, а совместное распределение факторизуется по родительским вершинам:

p(x_1,\ldots,x_d)=\prod_{i=1}^d p(x_i\mid x_{{\rm pa}(i)}).

Здесь {\rm pa}(i) обозначает множество родителей вершины i. Из факторизации следует локальное марковское свойство: каждая переменная условно независима от своих не-потомков при заданных родителях. Более общие утверждения выводятся с помощью критерия d-разделимости. Если множества вершин d-разделены третьим множеством, соответствующие переменные условно независимы во всяком распределении, факторизующемся по данному графу.[1]

В неориентированной марковской сети разделение вершин графа также выражает условную независимость: если всякий путь между двумя множествами проходит через третье множество, первые два множества условно независимы при заданном третьем. Для строго положительных распределений марковские свойства связаны с факторизацией плотности по кликам графа.[1]

Верность графу означает, что все условные независимости распределения следуют из графического разделения. Это дополнительное предположение: особые значения параметров могут создавать независимости, не отражённые отсутствием рёбер.

Значение для статистики и машинного обучения

Условная независимость сокращает число параметров и вычислительную сложность модели: вместо полного совместного распределения высокой размерности оценивается набор условных распределений меньшей размерности.

В классификаторе наивного Байеса признаки предполагаются условно независимыми при известном классе:

p(x_1,\ldots,x_d\mid y)=\prod_{j=1}^d p(x_j\mid y).

Предположение позволяет отдельно оценивать распределение каждого признака. При его нарушении вероятностные оценки могут быть плохо откалиброваны, хотя классификационное решение иногда остаётся приемлемым.

При отборе признаков условная независимость отделяет переменные, содержащие новую информацию о цели, от избыточных. Марковское одеяло целевой вершины отделяет её от остальных переменных модели.

В причинном анализе условные независимости используются для проверки совместимости данных с ориентированными графами и обучения структуры. Однако они сами по себе не устанавливают направление причинной связи: несколько графов могут кодировать один набор наблюдаемых независимостей, а скрытые переменные и отбор способны его изменить.

Статистическая проверка условной независимости

По выборке условную независимость формулируют как нулевую гипотезу

H_0:\;X\perp\!\!\!\perp Y\mid Z.

Метод проверки зависит от типа переменных и предполагаемого класса распределений.

  • Для дискретных переменных сравнивают таблицы сопряжённости внутри уровней Z, применяют критерии отношения правдоподобия или критерии хи-квадрат. Разреженные ячейки ухудшают точность асимптотических приближений.
  • В многомерной нормальной модели достаточно проверять нулевую частную корреляцию или соответствующий элемент матрицы точности. За пределами нормального семейства такой тест обнаруживает лишь определённый вид зависимости.
  • Непараметрические методы используют оценки условной взаимной информации, ядровые меры зависимости, локальные перестановки или регрессионные остатки. Их корректность требует предположений о гладкости, размерности, условных распределениях либо качестве оценивания регрессий.

Проверка условной независимости существенно труднее проверки обычной независимости, поскольку необходимо оценить, как совместное распределение меняется с Z. Для широких классов непрерывных распределений не существует нетривиального теста, который одновременно сохранял бы уровень равномерно по всей нулевой гипотезе и имел мощность против всех альтернатив; содержательные гарантии требуют ограничения класса распределений.[1]

При обучении графов ошибки отдельных тестов распространяются на структуру всего графа, поэтому существенны контроль множественных проверок и устойчивость к выбору порогов.

Ограничения и типичные ошибки

  • Обусловливание на событии нулевой вероятности. Формула через отношение вероятностей применима только при положительной вероятности условия. Для непрерывной переменной используются регулярные условные распределения, определённые почти всюду.
  • Смешение с безусловной независимостью. Ни одно из отношений в общем случае не влечёт другое. Маргинализация способна создать зависимость через общий скрытый фактор, а обусловливание — открыть связь через общее следствие.
  • Произвольное расширение условия. Из X\perp\!\!\!\perp Y\mid Z обычно не следует X\perp\!\!\!\perp Y\mid(Z,W). Дополнительная переменная может быть коллайдером или содержать информацию об общем следствии.
  • Подмена нулевой корреляцией. Нулевая частная корреляция эквивалентна условной независимости в совместно нормальной модели, но не для произвольных распределений.
  • Смешение попарной и совместной независимости. Условная независимость каждой пары переменных не обязательно означает взаимную условную независимость всего набора.
  • Причинная интерпретация без предпосылок. Причинные выводы дополнительно требуют структурной модели, учёта скрытого смешения и механизма отбора.
  • Игнорирование ошибки оценивания. Вывод об условной независимости по конечной выборке зависит от мощности теста и выбранного модельного класса. Неотклонение нулевой гипотезы не доказывает точное равенство условных распределений.

См. также

Примечания

Литература

  • Dawid A. P. Conditional Independence in Statistical Theory // Journal of the Royal Statistical Society. Series B (Methodological). — 1979. — Т. 41. — № 1. — С. 1–15.
  • Lauritzen S. L. Graphical Models. — Oxford: Oxford University Press, 1996. — ISBN 978-0-19-852219-5
  • Koller D., Friedman N. Probabilistic Graphical Models: Principles and Techniques. — Cambridge, MA: MIT Press, 2009. — ISBN 978-0-262-01319-2
  • Cover T. M., Thomas J. A. Elements of Information Theory. — 2nd ed.. — Hoboken: Wiley-Interscience, 2006. — ISBN 978-0-471-24195-9
  • Shah R. D., Peters J. The Hardness of Conditional Independence Testing and the Generalised Covariance Measure // The Annals of Statistics. — 2020. — Т. 48. — № 3. — С. 1514–1538.
Личные инструменты