Причинное машинное обучение
Материал из MachineLearning.
| | Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 17:40, 11 июля 2026 (MSD).
Промпты и описание редакторской проверки приведены в Обсуждение:Причинное машинное обучение. |
Причинное машинное обучение (англ. causal machine learning) — направление на стыке машинного обучения, статистики и теории причинности, изучающее методы оценки последствий вмешательств в сложные системы. В отличие от обычного предиктивного обучения, отвечающего на вопрос «что, вероятно, произойдёт при наблюдаемых признаках?», причинное машинное обучение исследует вопрос «что изменится, если целенаправленно воздействовать на некоторую переменную?».
Направление объединяет методы причинного вывода, теории вероятностей, статистического моделирования и современные алгоритмы машинного обучения. Его применения включают A/B тестирование, персонализацию лечения, оценку эффекта маркетинговых кампаний и государственных программ, анализ алгоритмической дискриминации и построение моделей, устойчивых к изменению среды.
Мотивация
Обычная модель машинного обучения оценивает статистическую зависимость между признаками и целевой переменной. Если модель обнаружила, что пользователи с определённым признаком чаще совершают покупку, она может успешно прогнозировать вероятность покупки. Но из этого ещё не следует, что искусственное изменение данного признака повысит эту вероятность.
Пусть — факт показа рекомендации, а
— покупка. Предиктивный вопрос записывается как условная вероятность
Она описывает распределение покупок среди пользователей, для которых наблюдалось значение . Причинный вопрос имеет иной смысл:
Оператор означает, что значение
установлено внешним вмешательством, а не просто наблюдалось в данных. Для рекомендательной системы это вопрос: «какой была бы конверсия, если бы мы принудительно показали рекомендацию?»
Различие важно потому, что пользователи, которым система уже показала рекомендацию, могут отличаться от остальных. Например, алгоритм мог выбирать более активных пользователей. Тогда наблюдаемая разница в конверсии объединяет эффект рекомендации с исходными различиями между группами. Общая причина, влияющая и на вмешательство, и на результат, называется смешивающей переменной, или конфаундером (англ. confounder).[1]
Исторические и концептуальные предпосылки
Современный причинный вывод развивался в нескольких научных традициях. В статистике важную роль сыграла модель потенциальных исходов Неймана — Рубина. Ежи Нейман сформулировал потенциальные исходы для рандомизированных сельскохозяйственных экспериментов, а Дональд Рубин развил эту конструкцию для более широкого класса экспериментальных и наблюдательных исследований.[1][1]
В этой традиции причинный эффект определяется сравнением результата одного и того же объекта в разных возможных условиях, хотя непосредственно наблюдать можно лишь один из потенциальных исходов.
В другой традиции Джуд Перл развил структурные причинные модели, причинные графы и исчисление вмешательств. Этот подход позволяет формально отделить наблюдение от действия и исследовать, при каких предположениях причинный эффект можно восстановить из данных.[1]
Термин causal machine learning обычно применяют к методам, в которых гибкие алгоритмы обучения используются для оценки причинных эффектов, обнаружения причинной структуры, анализа неоднородности эффектов или построения представлений, устойчивых к смене распределения данных.
Структурные причинные модели
Структурная причинная модель (англ. structural causal model, SCM) состоит из переменных, внешних факторов и структурных уравнений. Для каждой эндогенной переменной задаётся уравнение
где — непосредственные причины переменной
, а
— внешние, в том числе ненаблюдаемые, факторы.
Структуру модели удобно изображать ориентированным ациклическим графом. Например, граф
может описывать ситуацию, в которой — лечение,
— исход, а
— возраст пациента. Возраст влияет и на назначение лечения, и на прогноз, поэтому его нельзя игнорировать при оценке эффекта лечения.
Причинный граф не доказывает причинность автоматически. Он фиксирует содержательную гипотезу исследователя о механизме порождения данных. Правдоподобие этой гипотезы обосновывают предметными знаниями, дизайном исследования, временным порядком событий и анализом альтернативных объяснений.
Потенциальные исходы и причинные эффекты
Пусть обозначает бинарное вмешательство: например, назначение нового лекарства или показ новой версии интерфейса. Для каждого объекта определяют два потенциальных исхода:
-
— исход при вмешательстве;
-
— исход без вмешательства.
Средний причинный эффект, или ATE (англ. average treatment effect), определяется формулой
Для конкретного объекта одновременно наблюдается только один исход: либо , либо
. Второй исход остаётся контрфактическим. Это называют фундаментальной проблемой причинного вывода.
Кроме ATE, используют другие целевые величины:
- ATT (англ. average treatment effect on the treated) — средний эффект среди объектов, фактически получивших вмешательство:
- CATE (англ. conditional average treatment effect) — условный средний эффект для объектов с признаками
:
- ITE (англ. individual treatment effect) — индивидуальный эффект
, который без дополнительных предположений нельзя наблюдать непосредственно.
Оценка CATE особенно важна для персонализированной медицины, продуктовой аналитики и рекомендательных систем, поскольку позволяет искать группы, для которых вмешательство полезно, нейтрально или вредно. В кредитовании причинные оценки также применимы, но требуют особенно строгого анализа справедливости и правомерности вмешательств.
Условия идентификации
Причинный эффект нельзя извлечь из наблюдательных данных без содержательных и статистических предположений. В модели потенциальных исходов часто используют следующие условия.
- Согласованность. Если объект действительно получил вмешательство
, то наблюдаемый исход равен его потенциальному исходу
.
- Условная независимость назначения. После учёта набора переменных
назначение вмешательства не зависит от потенциальных исходов:
. Это условие также называют отсутствием неучтённого смешения.
- Позитивность. Для каждого релевантного значения
существует ненулевая вероятность получить каждый вариант вмешательства:
.
- Отсутствие интерференции. Вмешательство над одним объектом не меняет потенциальные исходы другого объекта. Вместе с однозначностью вариантов вмешательства это входит в предположение SUTVA (англ. stable unit treatment value assumption).
В графической модели набор удовлетворяет критерию задней двери (англ. back-door criterion), если он не содержит потомков
и блокирует каждый путь между
и
, начинающийся стрелкой, входящей в
. Тогда для дискретного
распределение исхода при вмешательстве выражается формулой корректировки:
Для непрерывного сумма заменяется интегралом. Формула неприменима «по умолчанию»: причинная схема и выбранный набор корректировки должны быть обоснованы. Неверная корректировка способна сама создать смещение — например, если контролировать коллайдер, то есть общее следствие двух причин.[1]
Основные методы оценки эффекта
Рандомизированный эксперимент
Рандомизированный контролируемый эксперимент — один из наиболее надёжных способов идентифицировать причинный эффект. В продуктовой аналитике его частным случаем является A/B тестирование. Случайное распределение объектов по группам делает группы сопоставимыми в среднем, в том числе по ненаблюдаемым факторам. В простейшем случае эффект оценивают разностью средних:
Эксперименты могут быть дорогими, технически невозможными или этически недопустимыми. Даже в рандомизированном исследовании следует проверять реализацию рандомизации, пропуски, несоблюдение назначенного вмешательства, интерференцию между участниками и корректность измерения результата.
Оценивание по наблюдательным данным
Если эксперимент невозможен, используют наблюдательные данные и методы, опирающиеся на причинные предположения:
- регрессионную корректировку;
- стратификацию и сопоставление объектов (англ. matching);
- методы инструментальных переменных;
- дизайн регрессионного разрыва;
- взвешивание по обратной вероятности назначения вмешательства;
- методы двойной устойчивости.
Мера склонности (англ. propensity score) — вероятность получить вмешательство при заданных предшествующих вмешательству признаках:
Ненормированная оценка ATE Хорвица — Томпсона с обратным взвешиванием вероятностей (англ. inverse probability weighting, IPW) имеет вид
Нормированная оценка Хайека делит взвешенные суммы исходов на суммы соответствующих весов. Она часто устойчивее в конечной выборке, хотя обе оценки требуют корректной модели назначения и выполнения позитивности.[1]
Если значения близки к нулю или единице, веса становятся большими, а дисперсия оценки возрастает. Это практическое проявление слабого перекрытия групп и возможного нарушения позитивности.
Двойная устойчивость и double machine learning
Дважды устойчивые оценки одновременно используют модель назначения вмешательства и модель условного среднего исхода. При выполнении стандартных условий правильно построенная оценка может оставаться состоятельной, если корректно специфицирована хотя бы одна из этих двух вспомогательных моделей.
Double machine learning (DML) применяет алгоритмы машинного обучения для оценки вспомогательных функций, но использует ортогональные оценочные уравнения и разбиение выборки с перекрёстным обучением (англ. cross-fitting), чтобы ослабить смещение от регуляризации и переобучения.[1]
Машинное обучение не заменяет причинный дизайн. Оно помогает гибко оценивать сложные зависимости, но не устраняет неучтённые конфаундеры и не подтверждает истинность причинного графа.
Гетерогенные эффекты и причинные леса
Средний эффект может скрывать различия между группами. Например, лекарство может быть полезно пациентам с одним профилем факторов риска и бесполезно для других. Для поиска таких различий оценивают CATE.
Один из подходов — причинный лес (англ. causal forest), модификация случайного леса, ориентированная на оценивание неоднородных эффектов. При выполнении регулярностных условий для причинных лесов разработаны асимптотически обоснованные процедуры статистического вывода и доверительные интервалы.[1]
При интерпретации гетерогенных эффектов особенно опасны множественные сравнения и поиск «интересных» подгрупп после просмотра данных. Модель может принять случайный шум за реальную неоднородность, поэтому оценивание и подтверждение гипотез желательно разделять по независимым данным.
Поиск причинной структуры
Обнаружение причинной структуры (англ. causal discovery) пытается восстановить часть структуры причинного графа по данным и дополнительным предположениям. Алгоритмы PC и FCI используют условные независимости, а GES — оценочную функцию для сравнения графов.
По одним наблюдательным данным направление связи часто неидентифицируемо. Наблюдаемая зависимость между и
может соответствовать
,
или влиянию скрытой общей причины. Более того, многие графы образуют один класс марковской эквивалентности и задают одинаковые условные независимости. Для различения направлений нужны дополнительные предположения или данные: временной порядок, ограничения на скрытые причины, негауссовость, неоднородные среды либо интервенции.[1]
Поэтому causal discovery следует воспринимать как средство формализации, выдвижения и проверки гипотез, а не как автоматический механизм «нахождения причин» в произвольной таблице.
Причинные представления и переносимость
Причинное обучение представлений (англ. causal representation learning) изучает, при каких условиях из высокоразмерных наблюдений — изображений, текста, аудио — можно выделить скрытые переменные, соответствующие причинным факторам. В отличие от классической табличной постановки, переменные ,
и
здесь могут быть не заданы заранее.
Интерес к причинным представлениям связан с обобщением вне исходного распределения. Предиктивная модель может использовать случайную корреляцию, устойчивую на обучающей выборке, но исчезающую в новой среде. Причинные механизмы потенциально более инвариантны, однако выделить их только по наблюдениям в общем случае невозможно без сильных структурных допущений, данных из нескольких сред или вмешательств.[1]
Применения
Причинное машинное обучение применяют в следующих областях:
- Медицина. Оценка эффективности и безопасности лечения, анализ неоднородности терапевтического эффекта.
- Продуктовая аналитика. Измерение эффекта изменений интерфейса, рекомендаций и рекламных кампаний.
- Экономика и государственная политика. Оценка последствий программ поддержки, образовательных инициатив и регуляторных мер.
- Промышленность. Анализ последствий управляющих воздействий, профилактического обслуживания и изменения режимов оборудования.
- Алгоритмическая справедливость. Анализ допустимых и недопустимых причинных путей влияния чувствительных признаков на решение модели.
Наличие причинной оценки ещё не определяет, какое решение следует принять. Практическое действие зависит также от стоимости, рисков, этических ограничений, неопределённости оценки и возможности переноса результата на целевую популяцию.
Ограничения и этические вопросы
Причинный вывод всегда зависит от предположений. Основные источники ошибок:
- неучтённые конфаундеры;
- ошибки измерения и неудачно определённое вмешательство;
- смещение отбора и информативные пропуски;
- неверно выбранные переменные для корректировки;
- нарушение позитивности и отсутствие сопоставимых групп;
- интерференция между объектами;
- перенос вывода на другую популяцию без проверки;
- смешение причинных переменных с их прокси-признаками.
Особенно опасно автоматически превращать оценку причинного эффекта в рекомендацию к действию. В медицине, найме, кредитовании и государственном управлении необходимо отдельно анализировать статистическую и структурную неопределённость, риски для уязвимых групп и ответственность за решение.
Связь с философией искусственного интеллекта
Причинное машинное обучение важно для философии искусственного интеллекта, поскольку различает обнаружение закономерностей и объяснение последствий действия. Предиктивная система отвечает на вопрос «что обычно наблюдается вместе?», а причинная модель — «что изменится при определённом вмешательстве?».
При этом причинная модель не является нейтральным отражением данных. Выбор переменных, единицы анализа, допустимых вмешательств, временного горизонта и структуры графа включает теоретические, практические и ценностные предположения исследователя. Поэтому причинный анализ требует не только вычислительных методов, но и открытого обсуждения границ применимости модели.
См. также
- Машинное обучение
- Теория вероятностей
- Байесовский вывод
- A/B тестирование
- Скользящий контроль
- Объяснимый искусственный интеллект
- Алгоритмическая справедливость
Примечания
Литература
- Pearl J. Causality: Models, Reasoning, and Inference. — 2nd ed.. — Cambridge: Cambridge University Press, 2009. — ISBN 978-0-521-89560-6
- Hernán M. A., Robins J. M. Causal Inference: What If. — Boca Raton: Chapman & Hall/CRC, 2020.
- Peters J., Janzing D., Schölkopf B. Elements of Causal Inference: Foundations and Learning Algorithms. — Cambridge, MA: MIT Press, 2017. — ISBN 978-0-262-03731-0
- Rubin D. B. Estimating causal effects of treatments in randomized and nonrandomized studies // Journal of Educational Psychology. — 1974. — Т. 66. — № 5. — С. 688–701.
- Rosenbaum P. R., Rubin D. B. The central role of the propensity score in observational studies for causal effects // Biometrika. — 1983. — Т. 70. — № 1. — С. 41–55.
- Chernozhukov V. и др. Double/debiased machine learning for treatment and structural parameters // The Econometrics Journal. — 2018. — Т. 21. — № 1. — С. C1–C68.
- Wager S., Athey S. Estimation and Inference of Heterogeneous Treatment Effects using Random Forests // Journal of the American Statistical Association. — 2018. — Т. 113. — № 523. — С. 1228–1242.
- Schölkopf B. и др. Toward Causal Representation Learning // Proceedings of the IEEE. — 2021. — Т. 109. — № 5. — С. 612–634.

