Причинное машинное обучение

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Добавление первой статьи)
 
Строка 1: Строка 1:
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 17:40, 11 июля 2026 (MSD).
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 17:40, 11 июля 2026 (MSD).
-
Промпт приводится полностью в [[Обсуждение:Причинное машинное обучение]].
+
Промпты и описание редакторской проверки приведены в [[Обсуждение:Причинное машинное обучение]].
}}
}}
{{TOCright}}
{{TOCright}}
-
'''Причинное машинное обучение''' (англ. ''causal machine learning'') — направление на стыке [[машинное обучение|машинного обучения]], статистики и теории причинности, изучающее методы оценки последствий [[интервенция|вмешательств]] в сложные системы. В отличие от обычного предиктивного обучения, которое отвечает на вопрос «что, вероятно, произойдёт при наблюдаемых признаках?», причинное машинное обучение рассматривает вопрос «что изменится, если целенаправленно изменить некоторую переменную?».
+
'''Причинное машинное обучение''' (англ. ''causal machine learning'') — направление на стыке [[машинное обучение|машинного обучения]], статистики и теории причинности, изучающее методы оценки последствий вмешательств в сложные системы. В отличие от обычного предиктивного обучения, отвечающего на вопрос «что, вероятно, произойдёт при наблюдаемых признаках?», причинное машинное обучение исследует вопрос «что изменится, если целенаправленно воздействовать на некоторую переменную?».
-
Направление объединяет методы [[причинный вывод|причинного вывода]], [[теория вероятностей|теории вероятностей]], [[статистическая модель|статистического моделирования]] и современные алгоритмы машинного обучения. Его важные применения включают [[A/B тестирование]], персонализацию лечения, оценку эффекта маркетинговых кампаний, анализ государственной политики, выявление дискриминации в алгоритмах и построение моделей, устойчивых к изменению среды.
+
Направление объединяет методы причинного вывода, [[теория вероятностей|теории вероятностей]], статистического моделирования и современные алгоритмы машинного обучения. Его применения включают [[A/B тестирование]], персонализацию лечения, оценку эффекта маркетинговых кампаний и государственных программ, анализ алгоритмической дискриминации и построение моделей, устойчивых к изменению среды.
-
== Мотивировка ==
+
== Мотивация ==
-
Обычная модель машинного обучения оценивает статистическую зависимость между признаками и целевой переменной. Если модель видит, что пользователи с определённым признаком чаще совершают покупку, она может успешно прогнозировать вероятность покупки. Но из этого ещё не следует, что искусственное изменение данного признака повысит вероятность покупки.
+
Обычная модель машинного обучения оценивает статистическую зависимость между признаками и целевой переменной. Если модель обнаружила, что пользователи с определённым признаком чаще совершают покупку, она может успешно прогнозировать вероятность покупки. Но из этого ещё не следует, что искусственное изменение данного признака повысит эту вероятность.
Пусть <tex>X</tex> — факт показа рекомендации, а <tex>Y</tex> — покупка. Предиктивный вопрос записывается как условная вероятность
Пусть <tex>X</tex> — факт показа рекомендации, а <tex>Y</tex> — покупка. Предиктивный вопрос записывается как условная вероятность
-
: <tex>P(Y \mid X=x).</tex>
+
::<tex>P(Y \mid X=x).</tex>
-
Она описывает, как меняется вероятность покупки среди пользователей, для которых наблюдается значение <tex>X=x</tex>. Причинный вопрос имеет иной смысл:
+
Она описывает распределение покупок среди пользователей, для которых наблюдалось значение <tex>X=x</tex>. Причинный вопрос имеет иной смысл:
-
: <tex>P(Y \mid \operatorname{do}(X=x)).</tex>
+
::<tex>P(Y \mid \operatorname{do}(X=x)).</tex>
Оператор <tex>\operatorname{do}</tex> означает, что значение <tex>X</tex> установлено внешним вмешательством, а не просто наблюдалось в данных. Для рекомендательной системы это вопрос: «какой была бы конверсия, если бы мы принудительно показали рекомендацию?»
Оператор <tex>\operatorname{do}</tex> означает, что значение <tex>X</tex> установлено внешним вмешательством, а не просто наблюдалось в данных. Для рекомендательной системы это вопрос: «какой была бы конверсия, если бы мы принудительно показали рекомендацию?»
-
Различие важно потому, что пользователи, которым система уже показала рекомендацию, могут отличаться от остальных. Например, алгоритм мог выбрать более активных пользователей. Тогда наблюдаемая разница в конверсии объединяет эффект рекомендации с эффектом исходных различий между группами. Общая причина, влияющая и на вмешательство, и на результат, называется ''смешивающей переменной'', или ''конфаундером''.<ref name="pearl">{{книга |автор=Pearl J. |заглавие=Causality: Models, Reasoning, and Inference |издание=2nd ed. |место=Cambridge |издательство=Cambridge University Press |год=2009 |isbn=978-0-521-89560-6}}</ref>
+
Различие важно потому, что пользователи, которым система уже показала рекомендацию, могут отличаться от остальных. Например, алгоритм мог выбирать более активных пользователей. Тогда наблюдаемая разница в конверсии объединяет эффект рекомендации с исходными различиями между группами. Общая причина, влияющая и на вмешательство, и на результат, называется ''смешивающей переменной'', или ''конфаундером'' (англ. ''confounder'').<ref name="pearl">{{книга |автор=Pearl J. |заглавие=Causality: Models, Reasoning, and Inference |издание=2nd ed. |место=Cambridge |издательство=Cambridge University Press |год=2009 |isbn=978-0-521-89560-6}}</ref>
== Исторические и концептуальные предпосылки ==
== Исторические и концептуальные предпосылки ==
-
Современный причинный вывод развивался в нескольких научных традициях. В статистике важную роль сыграла модель потенциальных исходов Неймана — Рубина. В ней причинный эффект определяется сравнением результата одного и того же объекта в разных возможных условиях, хотя непосредственно наблюдать можно лишь один из них.<ref name="rubin">{{статья |автор=Rubin D. B. |заглавие=Estimating causal effects of treatments in randomized and nonrandomized studies |издание=Journal of Educational Psychology |год=1974 |том=66 |номер=5 |страницы=688–701 |doi=10.1037/h0037350}}</ref>
+
Современный причинный вывод развивался в нескольких научных традициях. В статистике важную роль сыграла модель потенциальных исходов Неймана — Рубина. Ежи Нейман сформулировал потенциальные исходы для рандомизированных сельскохозяйственных экспериментов, а Дональд Рубин развил эту конструкцию для более широкого класса экспериментальных и наблюдательных исследований.<ref name="neyman">{{статья |автор=Neyman J. |заглавие=On the Application of Probability Theory to Agricultural Experiments. Essay on Principles. Section 9 |издание=Statistical Science |год=1990 |том=5 |номер=4 |страницы=465–472 |doi=10.1214/ss/1177012031}}</ref><ref name="rubin">{{статья |автор=Rubin D. B. |заглавие=Estimating causal effects of treatments in randomized and nonrandomized studies |издание=Journal of Educational Psychology |год=1974 |том=66 |номер=5 |страницы=688–701 |doi=10.1037/h0037350}}</ref>
-
В другой традиции Джуд Перл развил структурные причинные модели, ориентированные графы и исчисление вмешательств. Этот подход позволяет формально отделить наблюдение от действия и исследовать, при каких предположениях причинный эффект можно восстановить из данных.<ref name="pearl"/>
+
В этой традиции причинный эффект определяется сравнением результата одного и того же объекта в разных возможных условиях, хотя непосредственно наблюдать можно лишь один из потенциальных исходов.
-
Термин ''causal machine learning'' обычно применяют к методам, где гибкие алгоритмы обучения используются для оценки причинных эффектов, обнаружения причинной структуры, оценки индивидуальных эффектов или построения представлений, устойчивых к смене распределения данных.
+
В другой традиции Джуд Перл развил структурные причинные модели, причинные графы и исчисление вмешательств. Этот подход позволяет формально отделить наблюдение от действия и исследовать, при каких предположениях причинный эффект можно восстановить из данных.<ref name="pearl"/>
 +
 
 +
Термин ''causal machine learning'' обычно применяют к методам, в которых гибкие алгоритмы обучения используются для оценки причинных эффектов, обнаружения причинной структуры, анализа неоднородности эффектов или построения представлений, устойчивых к смене распределения данных.
== Структурные причинные модели ==
== Структурные причинные модели ==
-
'''Структурная причинная модель''' (structural causal model, SCM) состоит из набора переменных, внешних факторов и структурных уравнений. Для каждой эндогенной переменной <tex>X_i</tex> задаётся уравнение
+
'''Структурная причинная модель''' (англ. ''structural causal model'', SCM) состоит из переменных, внешних факторов и структурных уравнений. Для каждой эндогенной переменной <tex>X_i</tex> задаётся уравнение
-
: <tex>X_i=f_i(\operatorname{pa}_i,U_i),</tex>
+
::<tex>X_i=f_i(\operatorname{pa}_i,U_i),</tex>
где <tex>\operatorname{pa}_i</tex> — непосредственные причины переменной <tex>X_i</tex>, а <tex>U_i</tex> — внешние, в том числе ненаблюдаемые, факторы.
где <tex>\operatorname{pa}_i</tex> — непосредственные причины переменной <tex>X_i</tex>, а <tex>U_i</tex> — внешние, в том числе ненаблюдаемые, факторы.
-
Структуру удобно изображать ориентированным ациклическим графом. Например, граф
+
Структуру модели удобно изображать ориентированным ациклическим графом. Например, граф
-
: <tex>Z \to T,\qquad Z \to Y,\qquad T \to Y</tex>
+
::<tex>Z \to T,\qquad Z \to Y,\qquad T \to Y</tex>
может описывать ситуацию, в которой <tex>T</tex> — лечение, <tex>Y</tex> — исход, а <tex>Z</tex> — возраст пациента. Возраст влияет и на назначение лечения, и на прогноз, поэтому его нельзя игнорировать при оценке эффекта лечения.
может описывать ситуацию, в которой <tex>T</tex> — лечение, <tex>Y</tex> — исход, а <tex>Z</tex> — возраст пациента. Возраст влияет и на назначение лечения, и на прогноз, поэтому его нельзя игнорировать при оценке эффекта лечения.
-
Причинный граф не доказывает причинность автоматически. Он фиксирует содержательную гипотезу исследователя о механизме порождения данных. Правдоподобие этой гипотезы должно обосновываться предметным знанием, дизайном эксперимента, временным порядком событий и анализом альтернативных объяснений.
+
Причинный граф не доказывает причинность автоматически. Он фиксирует содержательную гипотезу исследователя о механизме порождения данных. Правдоподобие этой гипотезы обосновывают предметными знаниями, дизайном исследования, временным порядком событий и анализом альтернативных объяснений.
== Потенциальные исходы и причинные эффекты ==
== Потенциальные исходы и причинные эффекты ==
Строка 55: Строка 57:
* <tex>Y(0)</tex> — исход без вмешательства.
* <tex>Y(0)</tex> — исход без вмешательства.
-
Средний причинный эффект, или ATE (average treatment effect), определяется формулой
+
Средний причинный эффект, или ATE (англ. ''average treatment effect''), определяется формулой
-
: <tex>\operatorname{ATE}=\mathbb{E}[Y(1)-Y(0)].</tex>
+
::<tex>\operatorname{ATE}=\mathbb{E}[Y(1)-Y(0)].</tex>
Для конкретного объекта одновременно наблюдается только один исход: либо <tex>Y(1)</tex>, либо <tex>Y(0)</tex>. Второй исход остаётся контрфактическим. Это называют фундаментальной проблемой причинного вывода.
Для конкретного объекта одновременно наблюдается только один исход: либо <tex>Y(1)</tex>, либо <tex>Y(0)</tex>. Второй исход остаётся контрфактическим. Это называют фундаментальной проблемой причинного вывода.
Строка 63: Строка 65:
Кроме ATE, используют другие целевые величины:
Кроме ATE, используют другие целевые величины:
-
* '''ATT''' (average treatment effect on the treated) — средний эффект для объектов, фактически получивших вмешательство;
+
* '''ATT''' (англ. ''average treatment effect on the treated'') — средний эффект среди объектов, фактически получивших вмешательство:
-
* '''CATE''' (conditional average treatment effect) — условный эффект для объектов с признаками <tex>Z=z</tex>:
+
-
: <tex>\tau(z)=\mathbb{E}[Y(1)-Y(0)\mid Z=z];</tex>
+
::<tex>\operatorname{ATT}=\mathbb{E}[Y(1)-Y(0)\mid T=1];</tex>
-
* '''ITE''' (individual treatment effect) — индивидуальный эффект <tex>Y_i(1)-Y_i(0)</tex>, который, как правило, нельзя наблюдать непосредственно.
+
* '''CATE''' (англ. ''conditional average treatment effect'') — условный средний эффект для объектов с признаками <tex>Z=z</tex>:
-
Оценка CATE особенно важна для персонализированной медицины, кредитного скоринга и рекомендательных систем, поскольку позволяет искать не только средний эффект, но и группы, для которых вмешательство полезно, нейтрально или вредно.
+
::<tex>\tau(z)=\mathbb{E}[Y(1)-Y(0)\mid Z=z];</tex>
 +
 
 +
* '''ITE''' (англ. ''individual treatment effect'') — индивидуальный эффект <tex>Y_i(1)-Y_i(0)</tex>, который без дополнительных предположений нельзя наблюдать непосредственно.
 +
 
 +
Оценка CATE особенно важна для персонализированной медицины, продуктовой аналитики и рекомендательных систем, поскольку позволяет искать группы, для которых вмешательство полезно, нейтрально или вредно. В кредитовании причинные оценки также применимы, но требуют особенно строгого анализа справедливости и правомерности вмешательств.
== Условия идентификации ==
== Условия идентификации ==
-
Причинный эффект нельзя извлечь из наблюдательных данных без предположений. Основные условия идентификации таковы.
+
Причинный эффект нельзя извлечь из наблюдательных данных без содержательных и статистических предположений. В модели потенциальных исходов часто используют следующие условия.
* '''Согласованность.''' Если объект действительно получил вмешательство <tex>T=t</tex>, то наблюдаемый исход равен его потенциальному исходу <tex>Y(t)</tex>.
* '''Согласованность.''' Если объект действительно получил вмешательство <tex>T=t</tex>, то наблюдаемый исход равен его потенциальному исходу <tex>Y(t)</tex>.
-
* '''Отсутствие неучтённого смешения.''' После учёта набора переменных <tex>Z</tex> назначение вмешательства не зависит от потенциальных исходов.
+
* '''Условная независимость назначения.''' После учёта набора переменных <tex>Z</tex> назначение вмешательства не зависит от потенциальных исходов: <tex>(Y(0),Y(1))\perp T\mid Z</tex>. Это условие также называют отсутствием неучтённого смешения.
-
* '''Позитивность.''' Для каждого релевантного значения <tex>Z=z</tex> существует ненулевая вероятность получить каждый вариант вмешательства.
+
* '''Позитивность.''' Для каждого релевантного значения <tex>Z=z</tex> существует ненулевая вероятность получить каждый вариант вмешательства: <tex>0&lt;P(T=1\mid Z=z)&lt;1</tex>.
-
* '''Отсутствие интерференции.''' Вмешательство над одним объектом не меняет исход другого объекта.
+
* '''Отсутствие интерференции.''' Вмешательство над одним объектом не меняет потенциальные исходы другого объекта. Вместе с однозначностью вариантов вмешательства это входит в предположение SUTVA (англ. ''stable unit treatment value assumption'').
-
Если набор <tex>Z</tex> удовлетворяет критерию задней двери, то есть блокирует все пути между <tex>T</tex> и <tex>Y</tex>, начинающиеся стрелкой в <tex>T</tex>, и не содержит потомков <tex>T</tex>, эффект можно оценивать посредством корректировки:
+
В графической модели набор <tex>Z</tex> удовлетворяет '''критерию задней двери''' (англ. ''back-door criterion''), если он не содержит потомков <tex>T</tex> и блокирует каждый путь между <tex>T</tex> и <tex>Y</tex>, начинающийся стрелкой, входящей в <tex>T</tex>. Тогда для дискретного <tex>Z</tex> распределение исхода при вмешательстве выражается формулой корректировки:
-
: <tex>P(y\mid \operatorname{do}(T=t))=\sum_z P(y\mid T=t,Z=z)P(Z=z).</tex>
+
::<tex>P(y\mid \operatorname{do}(T=t))=\sum_z P(y\mid T=t,Z=z)P(Z=z).</tex>
-
Эта формула не верна «по умолчанию». Она применима только тогда, когда причинная схема корректна и набор переменных действительно устраняет смешение. Неправильная корректировка может, наоборот, создать смещение: например, если контролировать коллайдер — общую следствие двух причин.<ref name="peters">{{книга |автор=Peters J., Janzing D., Schölkopf B. |заглавие=Elements of Causal Inference: Foundations and Learning Algorithms |место=Cambridge, MA |издательство=MIT Press |год=2017 |isbn=978-0-262-03731-0 |ссылка=https://library.oapen.org/bitstream/id/056a11be-ce3a-44b9-8987-a6c68fce8d9b/11283.pdf}}</ref>
+
Для непрерывного <tex>Z</tex> сумма заменяется интегралом. Формула неприменима «по умолчанию»: причинная схема и выбранный набор корректировки должны быть обоснованы. Неверная корректировка способна сама создать смещение например, если контролировать коллайдер, то есть общее следствие двух причин.<ref name="peters">{{книга |автор=Peters J., Janzing D., Schölkopf B. |заглавие=Elements of Causal Inference: Foundations and Learning Algorithms |место=Cambridge, MA |издательство=MIT Press |год=2017 |isbn=978-0-262-03731-0 |ссылка=https://library.oapen.org/bitstream/id/056a11be-ce3a-44b9-8987-a6c68fce8d9b/11283.pdf}}</ref>
== Основные методы оценки эффекта ==
== Основные методы оценки эффекта ==
Строка 91: Строка 96:
=== Рандомизированный эксперимент ===
=== Рандомизированный эксперимент ===
-
[[A/B тестирование|Рандомизированный контролируемый эксперимент]] — наиболее надёжный способ оценить причинный эффект. Случайное распределение объектов по группам делает их сопоставимыми в среднем, включая ненаблюдаемые факторы. В простейшем случае эффект оценивают разностью средних:
+
'''Рандомизированный контролируемый эксперимент''' — один из наиболее надёжных способов идентифицировать причинный эффект. В продуктовой аналитике его частным случаем является [[A/B тестирование]]. Случайное распределение объектов по группам делает группы сопоставимыми в среднем, в том числе по ненаблюдаемым факторам. В простейшем случае эффект оценивают разностью средних:
-
: <tex>\widehat{\operatorname{ATE}}=\bar{Y}_{T=1}-\bar{Y}_{T=0}.</tex>
+
::<tex>\widehat{\operatorname{ATE}}=\bar{Y}_{T=1}-\bar{Y}_{T=0}.</tex>
-
Однако эксперименты бывают дорогими, технически невозможными или этически недопустимыми. Кроме того, даже в эксперименте следует контролировать качество рандомизации, пропуски, интерференцию между участниками и корректность измерения результата.
+
Эксперименты могут быть дорогими, технически невозможными или этически недопустимыми. Даже в рандомизированном исследовании следует проверять реализацию рандомизации, пропуски, несоблюдение назначенного вмешательства, интерференцию между участниками и корректность измерения результата.
-
=== Корректировка по наблюдательным данным ===
+
=== Оценивание по наблюдательным данным ===
Если эксперимент невозможен, используют наблюдательные данные и методы, опирающиеся на причинные предположения:
Если эксперимент невозможен, используют наблюдательные данные и методы, опирающиеся на причинные предположения:
* регрессионную корректировку;
* регрессионную корректировку;
-
* стратификацию по значимым признакам;
+
* стратификацию и сопоставление объектов (англ. ''matching'');
-
* сопоставление объектов (matching);
+
* методы инструментальных переменных;
* методы инструментальных переменных;
-
* регрессионный разрыв;
+
* дизайн регрессионного разрыва;
* взвешивание по обратной вероятности назначения вмешательства;
* взвешивание по обратной вероятности назначения вмешательства;
* методы двойной устойчивости.
* методы двойной устойчивости.
-
Важное понятие — propensity score, то есть вероятность получить вмешательство при заданных признаках:
+
'''Мера склонности''' (англ. ''propensity score'') — вероятность получить вмешательство при заданных предшествующих вмешательству признаках:
-
: <tex>e(Z)=P(T=1\mid Z).</tex>
+
::<tex>e(Z)=P(T=1\mid Z).</tex>
-
Оценка посредством обратного взвешивания вероятностей имеет вид
+
Ненормированная оценка ATE Хорвица — Томпсона с обратным взвешиванием вероятностей (англ. ''inverse probability weighting'', IPW) имеет вид
-
: <tex>\widehat{\tau}_{IPW}=\frac1n\sum_{i=1}^n\left(\frac{T_iY_i}{e(Z_i)}-\frac{(1-T_i)Y_i}{1-e(Z_i)}\right).</tex>
+
::<tex>\widehat{\tau}_{\mathrm{HT}}=\frac1n\sum_{i=1}^n\left(\frac{T_iY_i}{e(Z_i)}-\frac{(1-T_i)Y_i}{1-e(Z_i)}\right).</tex>
-
Если значения <tex>e(Z_i)</tex> близки к нулю или единице, веса становятся огромными, а оценка нестабильной. Это практическое следствие нарушения позитивности.
+
Нормированная оценка Хайека делит взвешенные суммы исходов на суммы соответствующих весов. Она часто устойчивее в конечной выборке, хотя обе оценки требуют корректной модели назначения и выполнения позитивности.<ref name="propensity">{{статья |автор=Rosenbaum P. R., Rubin D. B. |заглавие=The central role of the propensity score in observational studies for causal effects |издание=Biometrika |год=1983 |том=70 |номер=1 |страницы=41–55 |doi=10.1093/biomet/70.1.41}}</ref>
 +
 
 +
Если значения <tex>e(Z_i)</tex> близки к нулю или единице, веса становятся большими, а дисперсия оценки возрастает. Это практическое проявление слабого перекрытия групп и возможного нарушения позитивности.
=== Двойная устойчивость и double machine learning ===
=== Двойная устойчивость и double machine learning ===
-
В методах двойной устойчивости одновременно моделируют вероятность назначения вмешательства и ожидаемый исход. При корректности хотя бы одной из этих двух моделей оценка эффекта может сохранять состоятельность.
+
Дважды устойчивые оценки одновременно используют модель назначения вмешательства и модель условного среднего исхода. При выполнении стандартных условий правильно построенная оценка может оставаться состоятельной, если корректно специфицирована хотя бы одна из этих двух вспомогательных моделей.
-
Double machine learning использует алгоритмы машинного обучения для оценки вспомогательных функций — propensity score и условного среднего исхода, но применяет cross-fitting и ортогональные оценочные функции, чтобы уменьшить смещение регуляризации и переобучения. Это важно в задачах с большим числом признаков, где простая линейная регрессия плохо описывает зависимости.<ref name="dml">{{статья |автор=Chernozhukov V., Chetverikov D., Demirer M., Duflo E., Hansen C., Newey W., Robins J. |заглавие=Double/debiased machine learning for treatment and structural parameters |издание=The Econometrics Journal |год=2018 |том=21 |номер=1 |страницы=C1–C68 |doi=10.1111/ectj.12097}}</ref>
+
'''Double machine learning''' (DML) применяет алгоритмы машинного обучения для оценки вспомогательных функций, но использует ортогональные оценочные уравнения и разбиение выборки с перекрёстным обучением (англ. ''cross-fitting''), чтобы ослабить смещение от регуляризации и переобучения.<ref name="dml">{{статья |автор=Chernozhukov V., Chetverikov D., Demirer M., Duflo E., Hansen C., Newey W., Robins J. |заглавие=Double/debiased machine learning for treatment and structural parameters |издание=The Econometrics Journal |год=2018 |том=21 |номер=1 |страницы=C1–C68 |doi=10.1111/ectj.12097}}</ref>
-
Машинное обучение в данном случае не заменяет причинный дизайн. Оно помогает гибко оценить сложные зависимости, но не устраняет неучтённые конфаундеры и не подтверждает истинность причинного графа.
+
Машинное обучение не заменяет причинный дизайн. Оно помогает гибко оценивать сложные зависимости, но не устраняет неучтённые конфаундеры и не подтверждает истинность причинного графа.
== Гетерогенные эффекты и причинные леса ==
== Гетерогенные эффекты и причинные леса ==
-
Средний эффект может скрывать важные различия между группами. Например, лекарство может быть полезно пациентам с одним профилем факторов риска и бесполезно для других. Для поиска таких различий оценивают CATE.
+
Средний эффект может скрывать различия между группами. Например, лекарство может быть полезно пациентам с одним профилем факторов риска и бесполезно для других. Для поиска таких различий оценивают CATE.
-
Одним из подходов являются '''причинные леса''' (causal forests) модификация [[случайный лес|случайного леса]], ориентированная на поиск разбиений, в которых различается причинный эффект, а не просто прогноз целевой переменной. Для причинных лесов разработаны процедуры статистического вывода и приближённые доверительные интервалы.<ref name="forest">{{статья |автор=Wager S., Athey S. |заглавие=Estimation and Inference of Heterogeneous Treatment Effects using Random Forests |издание=Journal of the American Statistical Association |год=2018 |том=113 |номер=523 |страницы=1228–1242 |doi=10.1080/01621459.2017.1319839}}</ref>
+
Один из подходов '''причинный лес''' (англ. ''causal forest''), модификация [[случайный лес|случайного леса]], ориентированная на оценивание неоднородных эффектов. При выполнении регулярностных условий для причинных лесов разработаны асимптотически обоснованные процедуры статистического вывода и доверительные интервалы.<ref name="forest">{{статья |автор=Wager S., Athey S. |заглавие=Estimation and Inference of Heterogeneous Treatment Effects using Random Forests |издание=Journal of the American Statistical Association |год=2018 |том=113 |номер=523 |страницы=1228–1242 |doi=10.1080/01621459.2017.1319839}}</ref>
-
При интерпретации гетерогенных эффектов особенно опасны множественные сравнения и поиск «интересных» подгрупп после просмотра данных. Модель может принять случайный шум за реальную неоднородность.
+
При интерпретации гетерогенных эффектов особенно опасны множественные сравнения и поиск «интересных» подгрупп после просмотра данных. Модель может принять случайный шум за реальную неоднородность, поэтому оценивание и подтверждение гипотез желательно разделять по независимым данным.
== Поиск причинной структуры ==
== Поиск причинной структуры ==
-
'''Причинное открытие''' (causal discovery) пытается восстановить часть структуры причинного графа по данным. Известны алгоритмы PC, FCI и GES. Они используют условные независимости, статистические тесты и критерии качества графа.
+
'''Обнаружение причинной структуры''' (англ. ''causal discovery'') пытается восстановить часть структуры причинного графа по данным и дополнительным предположениям. Алгоритмы PC и FCI используют условные независимости, а GES — оценочную функцию для сравнения графов.
-
По одним наблюдениям направление связи часто неидентифицируемо. Связь между A и B может соответствовать A B, B A либо скрытой общей причине. Для различения нужны дополнительные предположения: временной порядок, отсутствие скрытых причин, данные из разных сред или результаты интервенций.<ref name="spirtes">{{книга |автор=Spirtes P., Glymour C., Scheines R. |заглавие=Causation, Prediction, and Search |издание=2nd ed. |место=Cambridge, MA |издательство=MIT Press |год=2000 |isbn=978-0-262-19440-6}}</ref>
+
По одним наблюдательным данным направление связи часто неидентифицируемо. Наблюдаемая зависимость между <tex>A</tex> и <tex>B</tex> может соответствовать <tex>A\to B</tex>, <tex>B\to A</tex> или влиянию скрытой общей причины. Более того, многие графы образуют один класс марковской эквивалентности и задают одинаковые условные независимости. Для различения направлений нужны дополнительные предположения или данные: временной порядок, ограничения на скрытые причины, негауссовость, неоднородные среды либо интервенции.<ref name="spirtes">{{книга |автор=Spirtes P., Glymour C., Scheines R. |заглавие=Causation, Prediction, and Search |издание=2nd ed. |место=Cambridge, MA |издательство=MIT Press |год=2000 |isbn=978-0-262-19440-6}}</ref>
-
Поэтому causal discovery следует воспринимать как инструмент выдвижения и проверки гипотез, а не как автоматический механизм «нахождения причин» в произвольной таблице данных.
+
Поэтому causal discovery следует воспринимать как средство формализации, выдвижения и проверки гипотез, а не как автоматический механизм «нахождения причин» в произвольной таблице.
== Причинные представления и переносимость ==
== Причинные представления и переносимость ==
-
Современное направление causal representation learning изучает, как выделять причинно значимые скрытые факторы из изображений, текста, аудио и иных высокоразмерных наблюдений. В таких задачах исследователь часто не получает готовые переменные <tex>Z</tex>, <tex>T</tex> и <tex>Y</tex>, а должен построить представление данных, в котором они становятся доступными для анализа.
+
'''Причинное обучение представлений''' (англ. ''causal representation learning'') изучает, при каких условиях из высокоразмерных наблюдений — изображений, текста, аудио — можно выделить скрытые переменные, соответствующие причинным факторам. В отличие от классической табличной постановки, переменные <tex>Z</tex>, <tex>T</tex> и <tex>Y</tex> здесь могут быть не заданы заранее.
-
Интерес к причинным представлениям связан с проблемой обобщения вне исходного распределения. Обычная модель может использовать случайную корреляцию, устойчивую на обучающей выборке, но исчезающую в новой среде. Причинные механизмы потенциально более инвариантны, однако их выделение по данным требует сильных допущений и остаётся активной областью исследований.<ref name="scholkopf">{{статья |автор=Schölkopf B., Locatello F., Bauer S., Ke N. R., Kalchbrenner N., Goyal A., Bengio Y. |заглавие=Toward Causal Representation Learning |издание=Proceedings of the IEEE |год=2021 |том=109 |номер=5 |страницы=612–634 |doi=10.1109/JPROC.2021.3058954 |ссылка=https://arxiv.org/abs/2102.11107}}</ref>
+
Интерес к причинным представлениям связан с обобщением вне исходного распределения. Предиктивная модель может использовать случайную корреляцию, устойчивую на обучающей выборке, но исчезающую в новой среде. Причинные механизмы потенциально более инвариантны, однако выделить их только по наблюдениям в общем случае невозможно без сильных структурных допущений, данных из нескольких сред или вмешательств.<ref name="scholkopf">{{статья |автор=Schölkopf B., Locatello F., Bauer S., Ke N. R., Kalchbrenner N., Goyal A., Bengio Y. |заглавие=Toward Causal Representation Learning |издание=Proceedings of the IEEE |год=2021 |том=109 |номер=5 |страницы=612–634 |doi=10.1109/JPROC.2021.3058954 |ссылка=https://arxiv.org/abs/2102.11107}}</ref>
== Применения ==
== Применения ==
Строка 153: Строка 159:
Причинное машинное обучение применяют в следующих областях:
Причинное машинное обучение применяют в следующих областях:
-
* '''Медицина.''' Оценка эффективности лечения, подбор терапии, анализ побочных эффектов.
+
* '''Медицина.''' Оценка эффективности и безопасности лечения, анализ неоднородности терапевтического эффекта.
* '''Продуктовая аналитика.''' Измерение эффекта изменений интерфейса, рекомендаций и рекламных кампаний.
* '''Продуктовая аналитика.''' Измерение эффекта изменений интерфейса, рекомендаций и рекламных кампаний.
* '''Экономика и государственная политика.''' Оценка последствий программ поддержки, образовательных инициатив и регуляторных мер.
* '''Экономика и государственная политика.''' Оценка последствий программ поддержки, образовательных инициатив и регуляторных мер.
-
* '''Кредитный скоринг и страхование.''' Анализ последствий решений, однако в этих областях особенно высок риск дискриминации.
+
* '''Промышленность.''' Анализ последствий управляющих воздействий, профилактического обслуживания и изменения режимов оборудования.
-
* '''Безопасность ИИ.''' Анализ механизмов, устойчивости моделей и причин ошибок.
+
* '''Алгоритмическая справедливость.''' Анализ допустимых и недопустимых причинных путей влияния чувствительных признаков на решение модели.
-
* '''Алгоритмическая справедливость.''' Различение допустимых и недопустимых путей влияния чувствительных признаков на решение модели.
+
 
 +
Наличие причинной оценки ещё не определяет, какое решение следует принять. Практическое действие зависит также от стоимости, рисков, этических ограничений, неопределённости оценки и возможности переноса результата на целевую популяцию.
== Ограничения и этические вопросы ==
== Ограничения и этические вопросы ==
Строка 165: Строка 172:
* неучтённые конфаундеры;
* неучтённые конфаундеры;
-
* ошибки измерения;
+
* ошибки измерения и неудачно определённое вмешательство;
-
* смещение отбора;
+
* смещение отбора и информативные пропуски;
-
* пропуски в данных;
+
* неверно выбранные переменные для корректировки;
* неверно выбранные переменные для корректировки;
-
* отсутствие сопоставимых групп;
+
* нарушение позитивности и отсутствие сопоставимых групп;
 +
* интерференция между объектами;
* перенос вывода на другую популяцию без проверки;
* перенос вывода на другую популяцию без проверки;
-
* смешение причинных переменных с прокси-признаками.
+
* смешение причинных переменных с их прокси-признаками.
-
Особенно опасно автоматически превращать оценку причинного эффекта в рекомендацию к действию. В медицине, найме, кредитовании и государственном управлении необходимо отдельно анализировать неопределённость, риски для уязвимых групп и ответственность за решение.
+
Особенно опасно автоматически превращать оценку причинного эффекта в рекомендацию к действию. В медицине, найме, кредитовании и государственном управлении необходимо отдельно анализировать статистическую и структурную неопределённость, риски для уязвимых групп и ответственность за решение.
== Связь с философией искусственного интеллекта ==
== Связь с философией искусственного интеллекта ==
-
Причинное машинное обучение важно для философии [[искусственный интеллект|искусственного интеллекта]], поскольку различает обнаружение закономерностей и объяснение механизмов. Предиктивная система отвечает на вопрос «что обычно наблюдается вместе?», а причинная — «что изменится при действии?».
+
Причинное машинное обучение важно для философии [[искусственный интеллект|искусственного интеллекта]], поскольку различает обнаружение закономерностей и объяснение последствий действия. Предиктивная система отвечает на вопрос «что обычно наблюдается вместе?», а причинная модель — «что изменится при определённом вмешательстве?».
-
При этом причинная модель не является нейтральным отражением данных. Выбор переменных, допустимых вмешательств и структуры графа включает теоретические и ценностные предположения разработчика. Поэтому причинный анализ требует не только вычислительных методов, но и открытого обсуждения границ применимости модели.
+
При этом причинная модель не является нейтральным отражением данных. Выбор переменных, единицы анализа, допустимых вмешательств, временного горизонта и структуры графа включает теоретические, практические и ценностные предположения исследователя. Поэтому причинный анализ требует не только вычислительных методов, но и открытого обсуждения границ применимости модели.
== См. также ==
== См. также ==
Строка 187: Строка 194:
* [[Байесовский вывод]]
* [[Байесовский вывод]]
* [[A/B тестирование]]
* [[A/B тестирование]]
 +
* [[Скользящий контроль]]
* [[Объяснимый искусственный интеллект]]
* [[Объяснимый искусственный интеллект]]
* [[Алгоритмическая справедливость]]
* [[Алгоритмическая справедливость]]
-
* [[Графовая нейронная сеть]]
 
== Примечания ==
== Примечания ==
-
{{примечания}}
+
<references />
== Литература ==
== Литература ==
* {{книга |автор=Pearl J. |заглавие=Causality: Models, Reasoning, and Inference |издание=2nd ed. |место=Cambridge |издательство=Cambridge University Press |год=2009 |isbn=978-0-521-89560-6}}
* {{книга |автор=Pearl J. |заглавие=Causality: Models, Reasoning, and Inference |издание=2nd ed. |место=Cambridge |издательство=Cambridge University Press |год=2009 |isbn=978-0-521-89560-6}}
-
* {{книга |автор=Hernán M. A., Robins J. M. |заглавие=Causal Inference: What If |место=Boca Raton |издательство=Chapman & Hall/CRC |год=2024 |ссылка=https://miguelhernan.org/s/hernanrobins_WhatIf_2jan25.pdf}}
+
* {{книга |автор=Hernán M. A., Robins J. M. |заглавие=Causal Inference: What If |место=Boca Raton |издательство=Chapman & Hall/CRC |год=2020 |ссылка=https://miguelhernan.org/whatifbook}}
* {{книга |автор=Peters J., Janzing D., Schölkopf B. |заглавие=Elements of Causal Inference: Foundations and Learning Algorithms |место=Cambridge, MA |издательство=MIT Press |год=2017 |isbn=978-0-262-03731-0}}
* {{книга |автор=Peters J., Janzing D., Schölkopf B. |заглавие=Elements of Causal Inference: Foundations and Learning Algorithms |место=Cambridge, MA |издательство=MIT Press |год=2017 |isbn=978-0-262-03731-0}}
 +
* {{статья |автор=Rubin D. B. |заглавие=Estimating causal effects of treatments in randomized and nonrandomized studies |издание=Journal of Educational Psychology |год=1974 |том=66 |номер=5 |страницы=688–701 |doi=10.1037/h0037350}}
 +
* {{статья |автор=Rosenbaum P. R., Rubin D. B. |заглавие=The central role of the propensity score in observational studies for causal effects |издание=Biometrika |год=1983 |том=70 |номер=1 |страницы=41–55 |doi=10.1093/biomet/70.1.41}}
* {{статья |автор=Chernozhukov V. и др. |заглавие=Double/debiased machine learning for treatment and structural parameters |издание=The Econometrics Journal |год=2018 |том=21 |номер=1 |страницы=C1–C68 |doi=10.1111/ectj.12097}}
* {{статья |автор=Chernozhukov V. и др. |заглавие=Double/debiased machine learning for treatment and structural parameters |издание=The Econometrics Journal |год=2018 |том=21 |номер=1 |страницы=C1–C68 |doi=10.1111/ectj.12097}}
* {{статья |автор=Wager S., Athey S. |заглавие=Estimation and Inference of Heterogeneous Treatment Effects using Random Forests |издание=Journal of the American Statistical Association |год=2018 |том=113 |номер=523 |страницы=1228–1242 |doi=10.1080/01621459.2017.1319839}}
* {{статья |автор=Wager S., Athey S. |заглавие=Estimation and Inference of Heterogeneous Treatment Effects using Random Forests |издание=Journal of the American Statistical Association |год=2018 |том=113 |номер=523 |страницы=1228–1242 |doi=10.1080/01621459.2017.1319839}}
* {{статья |автор=Schölkopf B. и др. |заглавие=Toward Causal Representation Learning |издание=Proceedings of the IEEE |год=2021 |том=109 |номер=5 |страницы=612–634 |doi=10.1109/JPROC.2021.3058954}}
* {{статья |автор=Schölkopf B. и др. |заглавие=Toward Causal Representation Learning |издание=Proceedings of the IEEE |год=2021 |том=109 |номер=5 |страницы=612–634 |doi=10.1109/JPROC.2021.3058954}}
-
[[Категория:Искусственный интеллект]]
+
{{DEFAULTSORT:Причинное машинное обучение}}
 +
[[Категория:Машинное обучение]]
 +
[[Категория:Прикладная статистика]]

Текущая версия

Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 17:40, 11 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Причинное машинное обучение.


Содержание

Причинное машинное обучение (англ. causal machine learning) — направление на стыке машинного обучения, статистики и теории причинности, изучающее методы оценки последствий вмешательств в сложные системы. В отличие от обычного предиктивного обучения, отвечающего на вопрос «что, вероятно, произойдёт при наблюдаемых признаках?», причинное машинное обучение исследует вопрос «что изменится, если целенаправленно воздействовать на некоторую переменную?».

Направление объединяет методы причинного вывода, теории вероятностей, статистического моделирования и современные алгоритмы машинного обучения. Его применения включают A/B тестирование, персонализацию лечения, оценку эффекта маркетинговых кампаний и государственных программ, анализ алгоритмической дискриминации и построение моделей, устойчивых к изменению среды.

Мотивация

Обычная модель машинного обучения оценивает статистическую зависимость между признаками и целевой переменной. Если модель обнаружила, что пользователи с определённым признаком чаще совершают покупку, она может успешно прогнозировать вероятность покупки. Но из этого ещё не следует, что искусственное изменение данного признака повысит эту вероятность.

Пусть X — факт показа рекомендации, а Y — покупка. Предиктивный вопрос записывается как условная вероятность

P(Y \mid X=x).

Она описывает распределение покупок среди пользователей, для которых наблюдалось значение X=x. Причинный вопрос имеет иной смысл:

P(Y \mid \operatorname{do}(X=x)).

Оператор \operatorname{do} означает, что значение X установлено внешним вмешательством, а не просто наблюдалось в данных. Для рекомендательной системы это вопрос: «какой была бы конверсия, если бы мы принудительно показали рекомендацию?»

Различие важно потому, что пользователи, которым система уже показала рекомендацию, могут отличаться от остальных. Например, алгоритм мог выбирать более активных пользователей. Тогда наблюдаемая разница в конверсии объединяет эффект рекомендации с исходными различиями между группами. Общая причина, влияющая и на вмешательство, и на результат, называется смешивающей переменной, или конфаундером (англ. confounder).[1]

Исторические и концептуальные предпосылки

Современный причинный вывод развивался в нескольких научных традициях. В статистике важную роль сыграла модель потенциальных исходов Неймана — Рубина. Ежи Нейман сформулировал потенциальные исходы для рандомизированных сельскохозяйственных экспериментов, а Дональд Рубин развил эту конструкцию для более широкого класса экспериментальных и наблюдательных исследований.[1][1]

В этой традиции причинный эффект определяется сравнением результата одного и того же объекта в разных возможных условиях, хотя непосредственно наблюдать можно лишь один из потенциальных исходов.

В другой традиции Джуд Перл развил структурные причинные модели, причинные графы и исчисление вмешательств. Этот подход позволяет формально отделить наблюдение от действия и исследовать, при каких предположениях причинный эффект можно восстановить из данных.[1]

Термин causal machine learning обычно применяют к методам, в которых гибкие алгоритмы обучения используются для оценки причинных эффектов, обнаружения причинной структуры, анализа неоднородности эффектов или построения представлений, устойчивых к смене распределения данных.

Структурные причинные модели

Структурная причинная модель (англ. structural causal model, SCM) состоит из переменных, внешних факторов и структурных уравнений. Для каждой эндогенной переменной X_i задаётся уравнение

X_i=f_i(\operatorname{pa}_i,U_i),

где \operatorname{pa}_i — непосредственные причины переменной X_i, а U_i — внешние, в том числе ненаблюдаемые, факторы.

Структуру модели удобно изображать ориентированным ациклическим графом. Например, граф

Z \to T,\qquad Z \to Y,\qquad T \to Y

может описывать ситуацию, в которой T — лечение, Y — исход, а Z — возраст пациента. Возраст влияет и на назначение лечения, и на прогноз, поэтому его нельзя игнорировать при оценке эффекта лечения.

Причинный граф не доказывает причинность автоматически. Он фиксирует содержательную гипотезу исследователя о механизме порождения данных. Правдоподобие этой гипотезы обосновывают предметными знаниями, дизайном исследования, временным порядком событий и анализом альтернативных объяснений.

Потенциальные исходы и причинные эффекты

Пусть T\in\{0,1\} обозначает бинарное вмешательство: например, назначение нового лекарства или показ новой версии интерфейса. Для каждого объекта определяют два потенциальных исхода:

  • Y(1) — исход при вмешательстве;
  • Y(0) — исход без вмешательства.

Средний причинный эффект, или ATE (англ. average treatment effect), определяется формулой

\operatorname{ATE}=\mathbb{E}[Y(1)-Y(0)].

Для конкретного объекта одновременно наблюдается только один исход: либо Y(1), либо Y(0). Второй исход остаётся контрфактическим. Это называют фундаментальной проблемой причинного вывода.

Кроме ATE, используют другие целевые величины:

  • ATT (англ. average treatment effect on the treated) — средний эффект среди объектов, фактически получивших вмешательство:
\operatorname{ATT}=\mathbb{E}[Y(1)-Y(0)\mid T=1];
  • CATE (англ. conditional average treatment effect) — условный средний эффект для объектов с признаками Z=z:
\tau(z)=\mathbb{E}[Y(1)-Y(0)\mid Z=z];
  • ITE (англ. individual treatment effect) — индивидуальный эффект Y_i(1)-Y_i(0), который без дополнительных предположений нельзя наблюдать непосредственно.

Оценка CATE особенно важна для персонализированной медицины, продуктовой аналитики и рекомендательных систем, поскольку позволяет искать группы, для которых вмешательство полезно, нейтрально или вредно. В кредитовании причинные оценки также применимы, но требуют особенно строгого анализа справедливости и правомерности вмешательств.

Условия идентификации

Причинный эффект нельзя извлечь из наблюдательных данных без содержательных и статистических предположений. В модели потенциальных исходов часто используют следующие условия.

  • Согласованность. Если объект действительно получил вмешательство T=t, то наблюдаемый исход равен его потенциальному исходу Y(t).
  • Условная независимость назначения. После учёта набора переменных Z назначение вмешательства не зависит от потенциальных исходов: (Y(0),Y(1))\perp T\mid Z. Это условие также называют отсутствием неучтённого смешения.
  • Позитивность. Для каждого релевантного значения Z=z существует ненулевая вероятность получить каждый вариант вмешательства: 0<P(T=1\mid Z=z)<1.
  • Отсутствие интерференции. Вмешательство над одним объектом не меняет потенциальные исходы другого объекта. Вместе с однозначностью вариантов вмешательства это входит в предположение SUTVA (англ. stable unit treatment value assumption).

В графической модели набор Z удовлетворяет критерию задней двери (англ. back-door criterion), если он не содержит потомков T и блокирует каждый путь между T и Y, начинающийся стрелкой, входящей в T. Тогда для дискретного Z распределение исхода при вмешательстве выражается формулой корректировки:

P(y\mid \operatorname{do}(T=t))=\sum_z P(y\mid T=t,Z=z)P(Z=z).

Для непрерывного Z сумма заменяется интегралом. Формула неприменима «по умолчанию»: причинная схема и выбранный набор корректировки должны быть обоснованы. Неверная корректировка способна сама создать смещение — например, если контролировать коллайдер, то есть общее следствие двух причин.[1]

Основные методы оценки эффекта

Рандомизированный эксперимент

Рандомизированный контролируемый эксперимент — один из наиболее надёжных способов идентифицировать причинный эффект. В продуктовой аналитике его частным случаем является A/B тестирование. Случайное распределение объектов по группам делает группы сопоставимыми в среднем, в том числе по ненаблюдаемым факторам. В простейшем случае эффект оценивают разностью средних:

\widehat{\operatorname{ATE}}=\bar{Y}_{T=1}-\bar{Y}_{T=0}.

Эксперименты могут быть дорогими, технически невозможными или этически недопустимыми. Даже в рандомизированном исследовании следует проверять реализацию рандомизации, пропуски, несоблюдение назначенного вмешательства, интерференцию между участниками и корректность измерения результата.

Оценивание по наблюдательным данным

Если эксперимент невозможен, используют наблюдательные данные и методы, опирающиеся на причинные предположения:

  • регрессионную корректировку;
  • стратификацию и сопоставление объектов (англ. matching);
  • методы инструментальных переменных;
  • дизайн регрессионного разрыва;
  • взвешивание по обратной вероятности назначения вмешательства;
  • методы двойной устойчивости.

Мера склонности (англ. propensity score) — вероятность получить вмешательство при заданных предшествующих вмешательству признаках:

e(Z)=P(T=1\mid Z).

Ненормированная оценка ATE Хорвица — Томпсона с обратным взвешиванием вероятностей (англ. inverse probability weighting, IPW) имеет вид

\widehat{\tau}_{\mathrm{HT}}=\frac1n\sum_{i=1}^n\left(\frac{T_iY_i}{e(Z_i)}-\frac{(1-T_i)Y_i}{1-e(Z_i)}\right).

Нормированная оценка Хайека делит взвешенные суммы исходов на суммы соответствующих весов. Она часто устойчивее в конечной выборке, хотя обе оценки требуют корректной модели назначения и выполнения позитивности.[1]

Если значения e(Z_i) близки к нулю или единице, веса становятся большими, а дисперсия оценки возрастает. Это практическое проявление слабого перекрытия групп и возможного нарушения позитивности.

Двойная устойчивость и double machine learning

Дважды устойчивые оценки одновременно используют модель назначения вмешательства и модель условного среднего исхода. При выполнении стандартных условий правильно построенная оценка может оставаться состоятельной, если корректно специфицирована хотя бы одна из этих двух вспомогательных моделей.

Double machine learning (DML) применяет алгоритмы машинного обучения для оценки вспомогательных функций, но использует ортогональные оценочные уравнения и разбиение выборки с перекрёстным обучением (англ. cross-fitting), чтобы ослабить смещение от регуляризации и переобучения.[1]

Машинное обучение не заменяет причинный дизайн. Оно помогает гибко оценивать сложные зависимости, но не устраняет неучтённые конфаундеры и не подтверждает истинность причинного графа.

Гетерогенные эффекты и причинные леса

Средний эффект может скрывать различия между группами. Например, лекарство может быть полезно пациентам с одним профилем факторов риска и бесполезно для других. Для поиска таких различий оценивают CATE.

Один из подходов — причинный лес (англ. causal forest), модификация случайного леса, ориентированная на оценивание неоднородных эффектов. При выполнении регулярностных условий для причинных лесов разработаны асимптотически обоснованные процедуры статистического вывода и доверительные интервалы.[1]

При интерпретации гетерогенных эффектов особенно опасны множественные сравнения и поиск «интересных» подгрупп после просмотра данных. Модель может принять случайный шум за реальную неоднородность, поэтому оценивание и подтверждение гипотез желательно разделять по независимым данным.

Поиск причинной структуры

Обнаружение причинной структуры (англ. causal discovery) пытается восстановить часть структуры причинного графа по данным и дополнительным предположениям. Алгоритмы PC и FCI используют условные независимости, а GES — оценочную функцию для сравнения графов.

По одним наблюдательным данным направление связи часто неидентифицируемо. Наблюдаемая зависимость между A и B может соответствовать A\to B, B\to A или влиянию скрытой общей причины. Более того, многие графы образуют один класс марковской эквивалентности и задают одинаковые условные независимости. Для различения направлений нужны дополнительные предположения или данные: временной порядок, ограничения на скрытые причины, негауссовость, неоднородные среды либо интервенции.[1]

Поэтому causal discovery следует воспринимать как средство формализации, выдвижения и проверки гипотез, а не как автоматический механизм «нахождения причин» в произвольной таблице.

Причинные представления и переносимость

Причинное обучение представлений (англ. causal representation learning) изучает, при каких условиях из высокоразмерных наблюдений — изображений, текста, аудио — можно выделить скрытые переменные, соответствующие причинным факторам. В отличие от классической табличной постановки, переменные Z, T и Y здесь могут быть не заданы заранее.

Интерес к причинным представлениям связан с обобщением вне исходного распределения. Предиктивная модель может использовать случайную корреляцию, устойчивую на обучающей выборке, но исчезающую в новой среде. Причинные механизмы потенциально более инвариантны, однако выделить их только по наблюдениям в общем случае невозможно без сильных структурных допущений, данных из нескольких сред или вмешательств.[1]

Применения

Причинное машинное обучение применяют в следующих областях:

  • Медицина. Оценка эффективности и безопасности лечения, анализ неоднородности терапевтического эффекта.
  • Продуктовая аналитика. Измерение эффекта изменений интерфейса, рекомендаций и рекламных кампаний.
  • Экономика и государственная политика. Оценка последствий программ поддержки, образовательных инициатив и регуляторных мер.
  • Промышленность. Анализ последствий управляющих воздействий, профилактического обслуживания и изменения режимов оборудования.
  • Алгоритмическая справедливость. Анализ допустимых и недопустимых причинных путей влияния чувствительных признаков на решение модели.

Наличие причинной оценки ещё не определяет, какое решение следует принять. Практическое действие зависит также от стоимости, рисков, этических ограничений, неопределённости оценки и возможности переноса результата на целевую популяцию.

Ограничения и этические вопросы

Причинный вывод всегда зависит от предположений. Основные источники ошибок:

  • неучтённые конфаундеры;
  • ошибки измерения и неудачно определённое вмешательство;
  • смещение отбора и информативные пропуски;
  • неверно выбранные переменные для корректировки;
  • нарушение позитивности и отсутствие сопоставимых групп;
  • интерференция между объектами;
  • перенос вывода на другую популяцию без проверки;
  • смешение причинных переменных с их прокси-признаками.

Особенно опасно автоматически превращать оценку причинного эффекта в рекомендацию к действию. В медицине, найме, кредитовании и государственном управлении необходимо отдельно анализировать статистическую и структурную неопределённость, риски для уязвимых групп и ответственность за решение.

Связь с философией искусственного интеллекта

Причинное машинное обучение важно для философии искусственного интеллекта, поскольку различает обнаружение закономерностей и объяснение последствий действия. Предиктивная система отвечает на вопрос «что обычно наблюдается вместе?», а причинная модель — «что изменится при определённом вмешательстве?».

При этом причинная модель не является нейтральным отражением данных. Выбор переменных, единицы анализа, допустимых вмешательств, временного горизонта и структуры графа включает теоретические, практические и ценностные предположения исследователя. Поэтому причинный анализ требует не только вычислительных методов, но и открытого обсуждения границ применимости модели.

См. также

Примечания


Литература

  • Pearl J. Causality: Models, Reasoning, and Inference. — 2nd ed.. — Cambridge: Cambridge University Press, 2009. — ISBN 978-0-521-89560-6
  • Hernán M. A., Robins J. M. Causal Inference: What If. — Boca Raton: Chapman & Hall/CRC, 2020.
  • Peters J., Janzing D., Schölkopf B. Elements of Causal Inference: Foundations and Learning Algorithms. — Cambridge, MA: MIT Press, 2017. — ISBN 978-0-262-03731-0
  • Rubin D. B. Estimating causal effects of treatments in randomized and nonrandomized studies // Journal of Educational Psychology. — 1974. — Т. 66. — № 5. — С. 688–701.
  • Rosenbaum P. R., Rubin D. B. The central role of the propensity score in observational studies for causal effects // Biometrika. — 1983. — Т. 70. — № 1. — С. 41–55.
  • Chernozhukov V. и др. Double/debiased machine learning for treatment and structural parameters // The Econometrics Journal. — 2018. — Т. 21. — № 1. — С. C1–C68.
  • Wager S., Athey S. Estimation and Inference of Heterogeneous Treatment Effects using Random Forests // Journal of the American Statistical Association. — 2018. — Т. 113. — № 523. — С. 1228–1242.
  • Schölkopf B. и др. Toward Causal Representation Learning // Proceedings of the IEEE. — 2021. — Т. 109. — № 5. — С. 612–634.
Личные инструменты