Механистическая интерпретируемость

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: {{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником ~~~~. Промпт приводится по...)
Строка 1: Строка 1:
-
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18:17, 11 июля 2026 (MSD).
+
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18:21, 11 июля 2026 (MSD).
-
Промпт приводится полностью в [[Обсуждение:Механистическая интерпретируемость]].
+
Промпты и описание редакторской проверки приведены в [[Обсуждение:Байесовская нейронная сеть]].
}}
}}
{{TOCright}}
{{TOCright}}
-
'''Механистическая интерпретируемость''' (англ. ''mechanistic interpretability'') — направление [[интерпретируемость моделей машинного обучения|интерпретируемости моделей машинного обучения]], стремящееся объяснить поведение [[нейронная сеть|нейронной сети]] через её внутренние вычислительные механизмы: признаки, нейроны, головы внимания, связи и вычислительные цепочки (circuits).
+
'''Байесовская нейронная сеть''' (англ. ''Bayesian neural network'', BNN) — вероятностная [[нейронная сеть]], в которой неизвестные параметры или часть параметров снабжают априорным распределением и после наблюдения данных рассматривают их апостериорное распределение. Предсказание получают усреднением по этому распределению, а не только подстановкой одного оценённого набора весов.
-
В отличие от методов, которые объясняют отдельное предсказание внешними признаками, механистическая интерпретируемость ставит более сильный вопрос: какие внутренние части модели реализуют конкретную функцию и как именно изменение этих частей причинно влияет на ответ модели.
+
Байесовская постановка позволяет формально учитывать неопределённость параметров и распространять её в прогноз. Однако она не гарантирует хорошую калибровку, обнаружение произвольных объектов вне обучающего распределения или безопасность решения. Результат зависит от правдоподобия, априорного распределения и качества приближённого вывода.
-
== Мотивация ==
+
== Основная идея ==
-
Современные нейронные сети могут демонстрировать высокое качество, но их внутреннее устройство часто трудно объяснить. Наблюдать веса или активации недостаточно: отдельный нейрон, голова внимания или слой редко имеют один очевидный смысл, а одно и то же поведение может зависеть от множества взаимосвязанных компонентов.
+
Пусть <tex>\mathcal D=\{(x_i,y_i)\}_{i=1}^{n}</tex> — обучающая выборка, а <tex>w</tex> обозначает веса и смещения сети. В обычном обучении получают одну точечную оценку <tex>\hat w</tex>, например оценку максимального правдоподобия:
-
Например, языковая модель может правильно согласовывать число сказуемого с подлежащим. Обычное тестирование покажет, что модель справляется с задачей. Механистическая интерпретируемость пытается установить, какие именно внутренние компоненты находят подлежащее, передают информацию о числе и используют её при выборе следующего токена.
+
::<tex>\hat w_{\mathrm{ML}}=\mathop{\arg\max}_{w}\,p(\mathcal D\mid w).</tex>
-
Главная цель направления — перейти от утверждения «модель ведёт себя так-то» к объяснению вида «эта вычислительная цепочка реализует данную функцию, что подтверждается вмешательствами в её активации».
+
В байесовском подходе сначала задают априорное распределение <tex>p(w)</tex>. После наблюдения выборки оно обновляется по формуле Байеса:
-
== Отличие от других подходов к интерпретируемости ==
+
::<tex>p(w\mid\mathcal D)=\frac{p(\mathcal D\mid w)p(w)}{p(\mathcal D)},</tex>
-
[[Объяснимый искусственный интеллект|Объяснимый искусственный интеллект]] включает широкий набор методов. Некоторые из них строят объяснение после обучения модели: например, оценивают важность входных признаков или приближают сложную модель более простой локальной моделью.
+
где <tex>p(\mathcal D\mid w)</tex> — правдоподобие, а знаменатель
-
Механистическая интерпретируемость отличается тем, что исследует саму вычислительную структуру нейросети. Её интересуют:
+
::<tex>p(\mathcal D)=\int p(\mathcal D\mid w)p(w)\,dw</tex>
-
* представления, возникающие внутри модели;
+
называют маргинальным правдоподобием, или свидетельством модели (model evidence). Ранние практические схемы байесовского обучения нейронных сетей, включая приближение апостериорного распределения и применение свидетельства, были подробно рассмотрены Маккеем.<ref name="mackay1992">{{статья |автор=MacKay D. J. C. |заглавие=A Practical Bayesian Framework for Backpropagation Networks |издание=Neural Computation |год=1992 |том=4 |номер=3 |страницы=448–472 |doi=10.1162/neco.1992.4.3.448}}</ref>
-
* роль отдельных нейронов, признаков и голов внимания;
+
-
* взаимодействие компонентов;
+
-
* причинное влияние внутренних активаций на итоговый ответ;
+
-
* воспроизводимые вычислительные алгоритмы, реализованные сетью.
+
-
Поэтому визуализация внимания или поиск корреляции между нейроном и словом ещё не являются механистическим объяснением. Требуется проверить, что предполагаемый компонент действительно необходим или достаточен для наблюдаемого поведения.
+
Для нового объекта <tex>x_*</tex> интерес представляет апостериорное предиктивное распределение:
-
== Основные единицы анализа ==
+
::<tex>p(y_*\mid x_*,\mathcal D)=\int p(y_*\mid x_*,w)p(w\mid\mathcal D)\,dw.</tex>
-
=== Нейроны и активации ===
+
В классификации <tex>p(y_*\mid x_*,w)</tex> может быть категориальным распределением, параметры которого задаёт softmax-выход сети. В регрессии сеть может задавать среднее и дисперсию нормального правдоподобия. Следовательно, неопределённость прогноза определяется не только распределением весов, но и выбранной моделью наблюдений.
-
Нейрон — отдельная координата внутреннего представления сети. В простых моделях иногда удаётся найти нейроны, чувствительные к определённому признаку: например, к наличию скобки, языка программирования или грамматической конструкции.
+
== Источники неопределённости ==
-
Однако нейрон не обязательно соответствует одному понятию. Он может быть '''полисемантичным''' (polysemantic), то есть активироваться на нескольких слабо связанных паттернах. Это делает интерпретацию на уровне отдельных нейронов ненадёжной.
+
=== Алеаторическая неопределённость ===
-
=== Признаки ===
+
'''Алеаторическая неопределённость''' (англ. ''aleatoric uncertainty'') связана со случайностью наблюдений, шумом измерения или неполнотой доступных признаков. Даже при известных параметрах модели результат <tex>y</tex> может оставаться случайным. Такая неопределённость задаётся прежде всего правдоподобием <tex>p(y\mid x,w)</tex> и не обязана исчезать при увеличении выборки.
-
Под признаком (feature) обычно понимают направление в пространстве активаций, связанное с относительно цельным и интерпретируемым паттерном. Признак не обязан совпадать с одним нейроном: он может быть линейной комбинацией нескольких нейронов.
+
В регрессии различают гомоскедастическую модель с общей дисперсией шума и гетероскедастическую модель, в которой сеть предсказывает зависящую от объекта дисперсию. Если правдоподобие принято детерминированным или его дисперсия задана неверно, одно распределение весов не восстановит корректную алеаторическую неопределённость.
-
Идея '''моносемантичности''' (monosemanticity) состоит в том, что отдельный признак желательно связывать с одним понятным человеку содержанием. Это не означает, что он абсолютно не реагирует ни на что другое; речь идёт о более чистом и устойчивом соответствии между внутренним направлением и наблюдаемым паттерном.
+
=== Эпистемическая неопределённость ===
-
=== Цепочки вычислений ===
+
'''Эпистемическая неопределённость''' (англ. ''epistemic uncertainty'') отражает недостаточную определённость модели по имеющимся данным. Разные значения <tex>w</tex>, правдоподобные после обучения, могут давать разные прогнозы. При поступлении репрезентативных данных эта составляющая в принципе может уменьшаться, но только внутри принятого класса моделей.
-
'''Цепочка''' (circuit) — набор внутренних компонентов и связей, совместно реализующих определённую вычислительную функцию. Для [[трансформер (модель)|трансформеров]] такими компонентами могут быть головы механизма внимания, слои MLP, остаточный поток (residual stream) и их взаимодействия.
+
Для скалярной регрессии закон полной дисперсии даёт модельно-зависимое разложение:
-
Важна не просто активность компонента, а его роль в вычислении. Один компонент может извлекать информацию, второй — передавать её в другую позицию контекста, а третий — преобразовывать её в изменение вероятности следующего токена.
+
::<tex>\operatorname{Var}(y_*\mid x_*,\mathcal D)=
 +
\mathbb E_{p(w\mid\mathcal D)}[\operatorname{Var}(y_*\mid x_*,w)]
 +
+\operatorname{Var}_{p(w\mid\mathcal D)}(\mathbb E[y_*\mid x_*,w]).</tex>
-
== Исследовательский цикл ==
+
Первое слагаемое обычно интерпретируют как алеаторическую, второе — как эпистемическую составляющую. Это разложение не является независимой от модели физической истиной: оно зависит от правдоподобия, априора и того, какие параметры включены в <tex>w</tex>.
-
Механистическая интерпретируемость обычно строится как последовательность гипотез и проверок.
+
=== Вероятность класса, калибровка и неизвестные объекты ===
-
# Выбрать измеримое поведение модели: например, правильное продолжение фразы, распознавание шаблона или выполнение арифметической операции.
+
Высокая вероятность выбранного класса не означает автоматически, что модель хорошо откалибрована или что объект похож на обучающие данные. В классификации предиктивная энтропия смешивает несколько источников неопределённости, а расхождение прогнозов при разных выборках весов характеризует только неопределённость, представленную данным апостериорным приближением.
-
# Найти компоненты, статистически связанные с этим поведением.
+
-
# Сформулировать гипотезу о механизме: что именно вычисляет каждый компонент.
+
-
# Провести причинное вмешательство во внутренние активации.
+
-
# Проверить, изменился ли результат именно так, как предсказывает гипотеза.
+
-
# Повторить проверку на новых примерах и альтернативных формулировках задачи.
+
-
Такой подход ближе к экспериментальному исследованию, чем к простой визуализации весов.
+
Поэтому байесовскую нейронную сеть следует отдельно проверять на калибровку, качество вероятностного прогноза и поведение при сдвиге распределения. Неудачный априор или слишком узкое приближение <tex>q(w)</tex> может дать уверенные ответы и на непривычных объектах.
-
== Причинные вмешательства ==
+
== Априорные распределения ==
-
Один из базовых методов абляция (ablation): исследователь зануляет, заменяет или иным образом изменяет активацию выбранного компонента и измеряет изменение результата.
+
Простой выбор независимый нормальный априор:
-
Пусть <tex>s(M(x))</tex> — числовая оценка интересующего поведения модели <tex>M</tex> на входе <tex>x</tex>. Например, это может быть логит правильного токена. Если внутреннюю активацию <tex>h</tex> заменить значением <tex>h'</tex>, причинный эффект вмешательства можно измерять как:
+
::<tex>p(w)=\prod_j\mathcal N(w_j\mid 0,\sigma_p^2).</tex>
-
::<tex>\Delta=s(M(x);h\leftarrow h')-s(M(x)).</tex>
+
При нормальном априоре и точечной MAP-оценке отрицательный логарифм априора соответствует квадратичному штрафу на веса. Но полное байесовское усреднение не сводится к такой регуляризации: априор влияет на форму всего апостериорного и предиктивного распределений.
-
Если изменение конкретной головы внимания систематически уменьшает вероятность правильного ответа, это является более сильным свидетельством её роли, чем простая корреляция между её активацией и ответом.
+
Независимый одинаковый априор для миллионов параметров удобен, но слабо выражает знания о функциях, реализуемых сетью. Влияние масштаба <tex>\sigma_p</tex> зависит от архитектуры, ширины слоёв и параметризации. Возможны иерархические априоры, разные масштабы для групп параметров и априоры, задаваемые через свойства функций, однако их выбор и вычислительный вывод сложнее.
-
Другой распространённый приём — '''activation patching'''. Активацию из корректного или «чистого» прогона модели переносят в соответствующее место другого, специально испорченного прогона. Если это восстанавливает нужное поведение, возникает свидетельство, что соответствующая часть вычисления проходит через данный компонент.
+
== Почему требуется приближённый вывод ==
-
== Суперпозиция и полисемантичность ==
+
В нейронной сети отображение от весов к выходу нелинейно, а пространство параметров высокоразмерно. Кроме того, перестановки скрытых нейронов и другие симметрии могут создавать несколько эквивалентных областей апостериорного распределения. Поэтому обычно недоступны как нормирующий интеграл <tex>p(\mathcal D)</tex>, так и точное вычисление предиктивного распределения.
-
Нейросети могут представлять больше признаков, чем позволяет число доступных координат. Такое сжатое представление называют '''суперпозицией''' (superposition). Несколько признаков используют перекрывающиеся направления в пространстве активаций, а нелинейности помогают модели различать их в типичных контекстах.
+
Практические методы строят приближение к <tex>p(w\mid\mathcal D)</tex> или непосредственно к предиктивному распределению. Важно различать три уровня ошибки: несовершенство самой вероятностной модели, ошибку аппроксимации апостериорного распределения и ошибку конечного числа выборок при оценивании интеграла.
-
Суперпозиция полезна для эффективного использования ограниченной размерности, но усложняет интерпретацию. Один нейрон может участвовать в нескольких несвязанных функциях, а отдельный признак может быть распределён по многим нейронам.
+
== Вариационный вывод ==
-
Работа ''Toy Models of Superposition'' показала на упрощённых моделях, как разреженные признаки могут размещаться в суперпозиции и почему это создаёт полисемантичность нейронов.<ref name="superposition">{{статья |автор=Elhage N. и др. |заглавие=Toy Models of Superposition |год=2022 |ссылка=https://arxiv.org/abs/2209.10652}}</ref>
+
При '''вариационном выводе''' выбирают вычислимо удобное семейство <tex>q_\theta(w)</tex> и минимизируют
-
== Разреженные автоэнкодеры ==
+
::<tex>\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w\mid\mathcal D)\bigr).</tex>
-
Один из современных методов выделения признаков разреженный автоэнкодер (sparse autoencoder, SAE). Он получает вектор активаций <tex>x</tex>, кодирует его в более широкое, но разреженное скрытое представление <tex>z</tex>, а затем восстанавливает исходные активации:
+
Поскольку истинный апостериор содержит недоступное маргинальное правдоподобие, вместо этого максимизируют нижнюю границу свидетельства ELBO (англ. ''evidence lower bound''):
-
::<tex>z=\operatorname{ReLU}(W_{\mathrm{enc}}(x-b)+b_{\mathrm{enc}}),</tex>
+
::<tex>\mathcal L(\theta)=
 +
\mathbb E_{q_\theta(w)}[\log p(\mathcal D\mid w)]
 +
-\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w)\bigr).</tex>
-
::<tex>\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.</tex>
+
Она связана с логарифмом свидетельства тождеством
-
При обучении одновременно минимизируют ошибку реконструкции и поощряют разреженность скрытого вектора:
+
::<tex>\log p(\mathcal D)=\mathcal L(\theta)+
 +
\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w\mid\mathcal D)\bigr).</tex>
-
::<tex>\mathcal{L}=\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1.</tex>
+
Первое слагаемое ELBO поощряет объяснение данных, а второе штрафует отклонение от априора. Поскольку KL-дивергенция неотрицательна, ELBO действительно является нижней границей <tex>\log p(\mathcal D)</tex>.
-
Разреженность означает, что на конкретном входе активна лишь небольшая доля признаков. Это помогает выделять направления, которые легче связать с конкретными понятиями, фрагментами кода, языковыми конструкциями или тематическими паттернами.
+
В распространённом среднеполевом приближении веса независимы:
-
Работа ''Towards Monosemanticity'' продемонстрировала применение словарного обучения и разреженных автоэнкодеров к небольшим трансформерам, где многие интерпретируемые признаки не видны при анализе отдельных нейронов.<ref name="mono">{{статья |автор=Bricken T. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |год=2023 |ссылка=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}</ref>
+
::<tex>q_\theta(w)=\prod_j\mathcal N(w_j\mid\mu_j,\sigma_j^2).</tex>
-
== Масштабирование метода ==
+
Такое семейство не описывает корреляции и несколько разнесённых мод апостериорного распределения. Минимизация «обратной» дивергенции <tex>\mathrm{KL}(q\|p)</tex> может сосредоточить приближение около одной моды и недооценить некоторые виды неопределённости. При этом увеличение выразительности вариационного семейства повышает вычислительную стоимость. Практический стохастический вариационный метод для разных архитектур нейросетей предложил Грейвс.<ref name="graves2011">{{статья |автор=Graves A. |заглавие=Practical Variational Inference for Neural Networks |издание=Advances in Neural Information Processing Systems |год=2011 |том=24 |ссылка=https://papers.nips.cc/paper_files/paper/2011/hash/7eb3c8be3d411e8ebfab08eba5f49632-Abstract.html}}</ref>
-
Методы словарного обучения были первоначально удобнее применять к небольшим моделям. Однако дальнейшие работы показали, что разреженные автоэнкодеры могут извлекать интерпретируемые признаки и в существенно более крупных языковых моделях.
+
== Bayes by Backprop ==
-
В работе ''Scaling Monosemanticity'' исследователи применили этот подход к Claude 3 Sonnet и описали признаки, связанные с понятиями, языками, кодом и мультимодальными паттернами.<ref name="scaling">{{статья |автор=Anthropic |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |год=2024 |ссылка=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}</ref>
+
'''Bayes by Backprop''' — вариант вариационного обучения распределения весов с помощью обратного распространения ошибки. Для диагонального гауссовского приближения можно положить
-
Масштабирование не означает, что модель стала полностью понятной. Даже если удаётся выделить большое число отдельных признаков, остаются вопросы об их взаимодействиях, полноте покрытия модели и интерпретации длинных цепочек вычислений.
+
::<tex>\sigma_j=\log(1+\exp(\rho_j)),\qquad
 +
w_j=\mu_j+\sigma_j\varepsilon_j,\qquad
 +
\varepsilon_j\sim\mathcal N(0,1).</tex>
-
== Практические задачи ==
+
Репараметризация отделяет источник случайности <tex>\varepsilon_j</tex> от оптимизируемых параметров <tex>\mu_j</tex> и <tex>\rho_j</tex>. Благодаря этому выборочную оценку отрицательной ELBO можно дифференцировать по параметрам вариационного распределения и оптимизировать обычными методами стохастического градиента.<ref name="blundell2015">{{статья |автор=Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D. |заглавие=Weight Uncertainty in Neural Network |издание=Proceedings of the 32nd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=37 |год=2015 |страницы=1613–1622 |ссылка=https://proceedings.mlr.press/v37/blundell15.html}}</ref>
-
Механистическая интерпретируемость применяется или исследуется для следующих задач:
+
Метод не получает точное апостериорное распределение: результат ограничен выбранным семейством <tex>q_\theta</tex>, стохастической оптимизацией и конечным числом выборок. При диагональном гауссовском <tex>q_\theta</tex> число сохраняемых вариационных параметров весов примерно удваивается относительно точечной сети.
-
* поиск внутренних механизмов конкретного поведения модели;
+
== Монте-Карло dropout ==
-
* проверка гипотез о том, как модель использует контекст;
+
-
* диагностика ошибок, нежелательных эвристик и уязвимых паттернов;
+
-
* поиск признаков, связанных с безопасностью, отказами или определёнными типами содержания;
+
-
* разработка более точных способов вмешательства в поведение модели;
+
-
* проверка того, соответствует ли обученная модель ожидаемому алгоритму на контролируемой задаче.
+
-
Особенно важен принцип различения наблюдения и вмешательства. Обнаружить признак, который активируется при нежелательном содержании, ещё не означает доказать, что этот признак вызывает нежелательное поведение. Требуется проверять последствия управляемого изменения активации.
+
'''Монте-Карло dropout''' (MC dropout) сохраняет случайные dropout-маски не только при обучении, но и при предсказании. Для объекта выполняют <tex>S</tex> проходов и усредняют условные прогнозы:
-
== Ограничения ==
+
::<tex>\widehat p(y_*\mid x_*,\mathcal D)=
 +
\frac{1}{S}\sum_{s=1}^{S}p(y_*\mid x_*,w^{(s)}).</tex>
-
Механистическая интерпретируемость пока не даёт полного метода аудита произвольной большой модели. Основные ограничения таковы:
+
Gal и Ghahramani интерпретировали обучение с dropout как вариационное приближение в связанной вероятностной модели глубокого гауссовского процесса.<ref name="gal2016">{{статья |автор=Gal Y., Ghahramani Z. |заглавие=Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning |издание=Proceedings of the 33rd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=48 |год=2016 |страницы=1050–1059 |ссылка=https://proceedings.mlr.press/v48/gal16.html}}</ref>
-
* найденная интерпретация может быть субъективной или неполной;
+
Выборочная дисперсия стохастических выходов измеряет разброс, создаваемый dropout-приближением. Для полной предиктивной дисперсии регрессии к ней необходимо добавить условную дисперсию наблюдений, заданную правдоподобием. Поэтому выражение, содержащее только разброс проходов, нельзя без оговорок называть всей неопределённостью будущего <tex>y_*</tex>.
-
* один и тот же признак может работать по-разному в разных контекстах;
+
-
* разреженный автоэнкодер сам является моделью и может вносить артефакты;
+
-
* реконструкция активаций не гарантирует, что найдены все функционально важные признаки;
+
-
* число потенциальных признаков и цепочек в большой модели огромно;
+
-
* результаты на небольшой модели не всегда переносятся на более крупную;
+
-
* вмешательство в один компонент может нарушать другие связанные функции.
+
-
Поэтому обнаруженный механизм следует рассматривать как проверяемую научную гипотезу. Нужны независимые эксперименты, контрольные примеры и оценка того, какую долю поведения модели действительно объясняет найденная цепочка.
+
MC dropout удобен тем, что может использовать знакомую архитектуру, но остаётся конкретным приближением, зависящим от вероятности dropout, места установки масок, способа обучения и числа проходов. Он не является выборкой из точного апостериорного распределения произвольной сети.
 +
 
 +
== Методы Монте-Карло по марковским цепям ==
 +
 
 +
'''Методы Монте-Карло по марковским цепям''' (MCMC) строят зависимую последовательность значений <tex>w^{(1)},w^{(2)},\ldots</tex>, стационарным распределением которой при выполнении условий метода является апостериорное <tex>p(w\mid\mathcal D)</tex>. После разогрева цепи предиктивный интеграл оценивают усреднением по выборкам.
 +
 
 +
В отличие от фиксированного среднеполевого семейства, MCMC не требует диагонального гауссовского вида апостериора. Однако асимптотическая корректность не означает, что конечная цепь хорошо исследовала многомодальное высокоразмерное распределение. Для глубоких сетей возникают высокая стоимость вычисления градиентов по всей выборке, автокорреляция, медленное смешивание и необходимость диагностики сходимости. Поэтому MCMC полезен как принципиальный и исследовательский подход, но не всегда практичен для крупной сети.
 +
 
 +
== Сравнение с ансамблями ==
 +
 
 +
'''Ансамбль''' обычных нейронных сетей получают, независимо обучая несколько точечных моделей с разными инициализациями, порядком объектов или подвыборками данных. Усреднение и разброс их прогнозов могут улучшать качество и давать практически полезный сигнал несогласия.
 +
 
 +
Различия подходов состоят в следующем:
 +
 
 +
* байесовская сеть начинается с одной вероятностной модели, априора и правила обновления до апостериорного распределения;
 +
* ансамбль задаётся процедурой обучения нескольких моделей и не обязан соответствовать выборкам из какого-либо апостериорного распределения;
 +
* среднеполевой вариационный метод хранит параметры одного распределения, но ограничивает его форму;
 +
* ансамбль может охватывать разные области пространства решений, но требует хранить и запускать несколько сетей;
 +
* оба подхода могут быть некалиброванными и давать чрезмерно уверенные прогнозы при сдвиге распределения.
 +
 
 +
Ни один подход не лучше другого во всех задачах. Сравнивать следует не только точность, но и логарифмическую потерю, калибровку, покрытие предиктивных интервалов, вычислительную стоимость и качество на заранее определённых видах сдвига данных.
 +
 
 +
== Практическая оценка неопределённости ==
 +
 
 +
Качество вероятностной модели нельзя установить по ширине интервала или визуально правдоподобному разбросу. В зависимости от задачи проверяют:
 +
 
 +
* отрицательное логарифмическое правдоподобие и другие собственные функции потерь;
 +
* калибровку вероятностей классификации;
 +
* фактическое покрытие и ширину предиктивных интервалов в регрессии;
 +
* качество ранжирования объектов для [[активное обучение|активного обучения]];
 +
* поведение на заранее выделенных сдвигах распределения и неизвестных классах;
 +
* устойчивость результатов к априору и способу приближённого вывода.
 +
 
 +
Калибровка внутри исходного распределения не доказывает надёжность вне него. Порог отказа от автоматического решения необходимо проверять на данных, соответствующих реальному сценарию применения.
 +
 
 +
== Применения ==
 +
 
 +
* '''Регрессия.''' Построение предиктивного распределения будущего наблюдения, учитывающего условный шум и неопределённость параметров.
 +
* '''Активное обучение.''' Выбор объектов, разметка которых ожидаемо уменьшит неопределённость модели или улучшит целевое качество.
 +
* '''Оптимизация эксперимента.''' Использование предиктивного распределения при выборе следующего измерения или испытания.
 +
* '''Системы с возможностью отказа.''' Передача случая человеку или резервному алгоритму, если заранее проверенный критерий неопределённости превышает порог.
 +
* '''Сравнение гипотез.''' Анализ того, насколько вывод чувствителен к весам, априору и доступным данным.
 +
 
 +
В каждом случае неопределённость является входом для правила принятия решения, а не готовым решением. Необходимо учитывать цену ошибок, изменение распределения, доступность действий и последствия ложного отказа.
 +
 
 +
== Ограничения ==
-
== Связь с безопасностью и философией ИИ ==
+
* Точное апостериорное распределение для практических нейросетей обычно недоступно.
 +
* Вариационные семейства могут не отражать корреляции и многомодальность и недооценивать неопределённость.
 +
* MCMC может плохо смешиваться и быть вычислительно дорогим.
 +
* Априор в пространстве весов не всегда прозрачно задаёт желаемый априор над функциями.
 +
* Несколько выборок или моделей увеличивают время предсказания.
 +
* Ошибочно заданное правдоподобие и смещённые данные делают даже формально корректный вывод неполным.
 +
* Байесовская постановка не заменяет проверку калибровки, качества данных, причинных предположений и последствий решения.
-
Для [[безопасность искусственного интеллекта|безопасности искусственного интеллекта]] механистическая интерпретируемость интересна как возможный путь к более глубокому аудиту моделей. Если разработчик понимает, какие внутренние механизмы приводят к опасному или нежелательному поведению, он может попытаться обнаружить его раньше, проверить гипотезу и оценить последствия вмешательства.
+
== Философский аспект ==
-
Однако интерпретируемость не равна безопасности. Найти часть механизма не означает получить полный контроль над поведением модели, а возможность изменить одну активацию не доказывает, что подобное вмешательство безопасно во всех контекстах.
+
Байесовская нейронная сеть заменяет единственную «лучшую» параметрическую гипотезу распределением гипотез, относительная правдоподобность которых зависит от данных и априора. Это делает явным различие между точечным ответом и степенью обоснованности ответа внутри модели.
-
С философской точки зрения направление возвращает вопрос о том, что считать объяснением интеллектуальной системы. Предсказать ответ модели недостаточно; механистическое объяснение требует показать внутреннюю организацию вычисления и причинную роль её частей.
+
Но апостериорная вероятность условна: она относится к выбранному пространству моделей, правдоподобию и априорному распределению. Если реальные причины не представлены в данных или модель наблюдений неверна, высокая внутренняя уверенность не превращается в знание о мире. Поэтому вероятностная формализация уточняет основания вывода, но не устраняет ответственность за постановку задачи и применение результата.
== См. также ==
== См. также ==
-
* [[Объяснимый искусственный интеллект]]
 
* [[Нейронная сеть]]
* [[Нейронная сеть]]
-
* [[Трансформер (модель)]]
+
* [[Машинное обучение]]
-
* [[Механизм внимания]]
+
* [[Байесовский вывод]]
-
* [[Большая языковая модель]]
+
* [[Регуляризация (математика)]]
-
* [[Атаки на модели машинного обучения]]
+
* [[Dropout]]
-
* [[Безопасность искусственного интеллекта]]
+
* [[Ансамбль методов]]
 +
* [[Активное обучение]]
== Примечания ==
== Примечания ==
-
{{примечания}}
+
<references />
== Литература ==
== Литература ==
-
* {{статья |автор=Olah C. и др. |заглавие=Zoom In: An Introduction to Circuits |издание=Distill |год=2020 |ссылка=https://distill.pub/2020/circuits/zoom-in/}}
+
* {{статья |автор=MacKay D. J. C. |заглавие=A Practical Bayesian Framework for Backpropagation Networks |издание=Neural Computation |год=1992 |том=4 |номер=3 |страницы=448–472 |doi=10.1162/neco.1992.4.3.448}}
-
* {{статья |автор=Elhage N. и др. |заглавие=Toy Models of Superposition |год=2022 |ссылка=https://arxiv.org/abs/2209.10652}}
+
* {{статья |автор=Graves A. |заглавие=Practical Variational Inference for Neural Networks |издание=Advances in Neural Information Processing Systems |год=2011 |том=24 |ссылка=https://papers.nips.cc/paper_files/paper/2011/hash/7eb3c8be3d411e8ebfab08eba5f49632-Abstract.html}}
-
* {{статья |автор=Bricken T. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |год=2023 |ссылка=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}
+
* {{статья |автор=Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D. |заглавие=Weight Uncertainty in Neural Network |издание=Proceedings of the 32nd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=37 |год=2015 |страницы=1613–1622 |ссылка=https://proceedings.mlr.press/v37/blundell15.html}}
-
* {{статья |автор=Anthropic |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |год=2024 |ссылка=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}
+
* {{статья |автор=Gal Y., Ghahramani Z. |заглавие=Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning |издание=Proceedings of the 33rd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=48 |год=2016 |страницы=1050–1059 |ссылка=https://proceedings.mlr.press/v48/gal16.html}}
-
[[Категория:Искусственный интеллект]]
+
{{DEFAULTSORT:Байесовская нейронная сеть}}
 +
[[Категория:Машинное обучение]]
 +
[[Категория:Нейронные сети]]

Версия 12:49, 19 июля 2026

Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 18:21, 11 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Байесовская нейронная сеть.


Содержание

Байесовская нейронная сеть (англ. Bayesian neural network, BNN) — вероятностная нейронная сеть, в которой неизвестные параметры или часть параметров снабжают априорным распределением и после наблюдения данных рассматривают их апостериорное распределение. Предсказание получают усреднением по этому распределению, а не только подстановкой одного оценённого набора весов.

Байесовская постановка позволяет формально учитывать неопределённость параметров и распространять её в прогноз. Однако она не гарантирует хорошую калибровку, обнаружение произвольных объектов вне обучающего распределения или безопасность решения. Результат зависит от правдоподобия, априорного распределения и качества приближённого вывода.

Основная идея

Пусть \mathcal D=\{(x_i,y_i)\}_{i=1}^{n} — обучающая выборка, а w обозначает веса и смещения сети. В обычном обучении получают одну точечную оценку \hat w, например оценку максимального правдоподобия:

\hat w_{\mathrm{ML}}=\mathop{\arg\max}_{w}\,p(\mathcal D\mid w).

В байесовском подходе сначала задают априорное распределение p(w). После наблюдения выборки оно обновляется по формуле Байеса:

p(w\mid\mathcal D)=\frac{p(\mathcal D\mid w)p(w)}{p(\mathcal D)},

где p(\mathcal D\mid w) — правдоподобие, а знаменатель

p(\mathcal D)=\int p(\mathcal D\mid w)p(w)\,dw

называют маргинальным правдоподобием, или свидетельством модели (model evidence). Ранние практические схемы байесовского обучения нейронных сетей, включая приближение апостериорного распределения и применение свидетельства, были подробно рассмотрены Маккеем.[1]

Для нового объекта x_* интерес представляет апостериорное предиктивное распределение:

p(y_*\mid x_*,\mathcal D)=\int p(y_*\mid x_*,w)p(w\mid\mathcal D)\,dw.

В классификации p(y_*\mid x_*,w) может быть категориальным распределением, параметры которого задаёт softmax-выход сети. В регрессии сеть может задавать среднее и дисперсию нормального правдоподобия. Следовательно, неопределённость прогноза определяется не только распределением весов, но и выбранной моделью наблюдений.

Источники неопределённости

Алеаторическая неопределённость

Алеаторическая неопределённость (англ. aleatoric uncertainty) связана со случайностью наблюдений, шумом измерения или неполнотой доступных признаков. Даже при известных параметрах модели результат y может оставаться случайным. Такая неопределённость задаётся прежде всего правдоподобием p(y\mid x,w) и не обязана исчезать при увеличении выборки.

В регрессии различают гомоскедастическую модель с общей дисперсией шума и гетероскедастическую модель, в которой сеть предсказывает зависящую от объекта дисперсию. Если правдоподобие принято детерминированным или его дисперсия задана неверно, одно распределение весов не восстановит корректную алеаторическую неопределённость.

Эпистемическая неопределённость

Эпистемическая неопределённость (англ. epistemic uncertainty) отражает недостаточную определённость модели по имеющимся данным. Разные значения w, правдоподобные после обучения, могут давать разные прогнозы. При поступлении репрезентативных данных эта составляющая в принципе может уменьшаться, но только внутри принятого класса моделей.

Для скалярной регрессии закон полной дисперсии даёт модельно-зависимое разложение:

\operatorname{Var}(y_*\mid x_*,\mathcal D)=
\mathbb E_{p(w\mid\mathcal D)}[\operatorname{Var}(y_*\mid x_*,w)]
+\operatorname{Var}_{p(w\mid\mathcal D)}(\mathbb E[y_*\mid x_*,w]).

Первое слагаемое обычно интерпретируют как алеаторическую, второе — как эпистемическую составляющую. Это разложение не является независимой от модели физической истиной: оно зависит от правдоподобия, априора и того, какие параметры включены в w.

Вероятность класса, калибровка и неизвестные объекты

Высокая вероятность выбранного класса не означает автоматически, что модель хорошо откалибрована или что объект похож на обучающие данные. В классификации предиктивная энтропия смешивает несколько источников неопределённости, а расхождение прогнозов при разных выборках весов характеризует только неопределённость, представленную данным апостериорным приближением.

Поэтому байесовскую нейронную сеть следует отдельно проверять на калибровку, качество вероятностного прогноза и поведение при сдвиге распределения. Неудачный априор или слишком узкое приближение q(w) может дать уверенные ответы и на непривычных объектах.

Априорные распределения

Простой выбор — независимый нормальный априор:

p(w)=\prod_j\mathcal N(w_j\mid 0,\sigma_p^2).

При нормальном априоре и точечной MAP-оценке отрицательный логарифм априора соответствует квадратичному штрафу на веса. Но полное байесовское усреднение не сводится к такой регуляризации: априор влияет на форму всего апостериорного и предиктивного распределений.

Независимый одинаковый априор для миллионов параметров удобен, но слабо выражает знания о функциях, реализуемых сетью. Влияние масштаба \sigma_p зависит от архитектуры, ширины слоёв и параметризации. Возможны иерархические априоры, разные масштабы для групп параметров и априоры, задаваемые через свойства функций, однако их выбор и вычислительный вывод сложнее.

Почему требуется приближённый вывод

В нейронной сети отображение от весов к выходу нелинейно, а пространство параметров высокоразмерно. Кроме того, перестановки скрытых нейронов и другие симметрии могут создавать несколько эквивалентных областей апостериорного распределения. Поэтому обычно недоступны как нормирующий интеграл p(\mathcal D), так и точное вычисление предиктивного распределения.

Практические методы строят приближение к p(w\mid\mathcal D) или непосредственно к предиктивному распределению. Важно различать три уровня ошибки: несовершенство самой вероятностной модели, ошибку аппроксимации апостериорного распределения и ошибку конечного числа выборок при оценивании интеграла.

Вариационный вывод

При вариационном выводе выбирают вычислимо удобное семейство q_\theta(w) и минимизируют

\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w\mid\mathcal D)\bigr).

Поскольку истинный апостериор содержит недоступное маргинальное правдоподобие, вместо этого максимизируют нижнюю границу свидетельства — ELBO (англ. evidence lower bound):

\mathcal L(\theta)=
\mathbb E_{q_\theta(w)}[\log p(\mathcal D\mid w)]
-\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w)\bigr).

Она связана с логарифмом свидетельства тождеством

\log p(\mathcal D)=\mathcal L(\theta)+
\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w\mid\mathcal D)\bigr).

Первое слагаемое ELBO поощряет объяснение данных, а второе штрафует отклонение от априора. Поскольку KL-дивергенция неотрицательна, ELBO действительно является нижней границей \log p(\mathcal D).

В распространённом среднеполевом приближении веса независимы:

q_\theta(w)=\prod_j\mathcal N(w_j\mid\mu_j,\sigma_j^2).

Такое семейство не описывает корреляции и несколько разнесённых мод апостериорного распределения. Минимизация «обратной» дивергенции \mathrm{KL}(q\|p) может сосредоточить приближение около одной моды и недооценить некоторые виды неопределённости. При этом увеличение выразительности вариационного семейства повышает вычислительную стоимость. Практический стохастический вариационный метод для разных архитектур нейросетей предложил Грейвс.[1]

Bayes by Backprop

Bayes by Backprop — вариант вариационного обучения распределения весов с помощью обратного распространения ошибки. Для диагонального гауссовского приближения можно положить

\sigma_j=\log(1+\exp(\rho_j)),\qquad
w_j=\mu_j+\sigma_j\varepsilon_j,\qquad
\varepsilon_j\sim\mathcal N(0,1).

Репараметризация отделяет источник случайности \varepsilon_j от оптимизируемых параметров \mu_j и \rho_j. Благодаря этому выборочную оценку отрицательной ELBO можно дифференцировать по параметрам вариационного распределения и оптимизировать обычными методами стохастического градиента.[1]

Метод не получает точное апостериорное распределение: результат ограничен выбранным семейством q_\theta, стохастической оптимизацией и конечным числом выборок. При диагональном гауссовском q_\theta число сохраняемых вариационных параметров весов примерно удваивается относительно точечной сети.

Монте-Карло dropout

Монте-Карло dropout (MC dropout) сохраняет случайные dropout-маски не только при обучении, но и при предсказании. Для объекта выполняют S проходов и усредняют условные прогнозы:

\widehat p(y_*\mid x_*,\mathcal D)=
\frac{1}{S}\sum_{s=1}^{S}p(y_*\mid x_*,w^{(s)}).

Gal и Ghahramani интерпретировали обучение с dropout как вариационное приближение в связанной вероятностной модели глубокого гауссовского процесса.[1]

Выборочная дисперсия стохастических выходов измеряет разброс, создаваемый dropout-приближением. Для полной предиктивной дисперсии регрессии к ней необходимо добавить условную дисперсию наблюдений, заданную правдоподобием. Поэтому выражение, содержащее только разброс проходов, нельзя без оговорок называть всей неопределённостью будущего y_*.

MC dropout удобен тем, что может использовать знакомую архитектуру, но остаётся конкретным приближением, зависящим от вероятности dropout, места установки масок, способа обучения и числа проходов. Он не является выборкой из точного апостериорного распределения произвольной сети.

Методы Монте-Карло по марковским цепям

Методы Монте-Карло по марковским цепям (MCMC) строят зависимую последовательность значений w^{(1)},w^{(2)},\ldots, стационарным распределением которой при выполнении условий метода является апостериорное p(w\mid\mathcal D). После разогрева цепи предиктивный интеграл оценивают усреднением по выборкам.

В отличие от фиксированного среднеполевого семейства, MCMC не требует диагонального гауссовского вида апостериора. Однако асимптотическая корректность не означает, что конечная цепь хорошо исследовала многомодальное высокоразмерное распределение. Для глубоких сетей возникают высокая стоимость вычисления градиентов по всей выборке, автокорреляция, медленное смешивание и необходимость диагностики сходимости. Поэтому MCMC полезен как принципиальный и исследовательский подход, но не всегда практичен для крупной сети.

Сравнение с ансамблями

Ансамбль обычных нейронных сетей получают, независимо обучая несколько точечных моделей с разными инициализациями, порядком объектов или подвыборками данных. Усреднение и разброс их прогнозов могут улучшать качество и давать практически полезный сигнал несогласия.

Различия подходов состоят в следующем:

  • байесовская сеть начинается с одной вероятностной модели, априора и правила обновления до апостериорного распределения;
  • ансамбль задаётся процедурой обучения нескольких моделей и не обязан соответствовать выборкам из какого-либо апостериорного распределения;
  • среднеполевой вариационный метод хранит параметры одного распределения, но ограничивает его форму;
  • ансамбль может охватывать разные области пространства решений, но требует хранить и запускать несколько сетей;
  • оба подхода могут быть некалиброванными и давать чрезмерно уверенные прогнозы при сдвиге распределения.

Ни один подход не лучше другого во всех задачах. Сравнивать следует не только точность, но и логарифмическую потерю, калибровку, покрытие предиктивных интервалов, вычислительную стоимость и качество на заранее определённых видах сдвига данных.

Практическая оценка неопределённости

Качество вероятностной модели нельзя установить по ширине интервала или визуально правдоподобному разбросу. В зависимости от задачи проверяют:

  • отрицательное логарифмическое правдоподобие и другие собственные функции потерь;
  • калибровку вероятностей классификации;
  • фактическое покрытие и ширину предиктивных интервалов в регрессии;
  • качество ранжирования объектов для активного обучения;
  • поведение на заранее выделенных сдвигах распределения и неизвестных классах;
  • устойчивость результатов к априору и способу приближённого вывода.

Калибровка внутри исходного распределения не доказывает надёжность вне него. Порог отказа от автоматического решения необходимо проверять на данных, соответствующих реальному сценарию применения.

Применения

  • Регрессия. Построение предиктивного распределения будущего наблюдения, учитывающего условный шум и неопределённость параметров.
  • Активное обучение. Выбор объектов, разметка которых ожидаемо уменьшит неопределённость модели или улучшит целевое качество.
  • Оптимизация эксперимента. Использование предиктивного распределения при выборе следующего измерения или испытания.
  • Системы с возможностью отказа. Передача случая человеку или резервному алгоритму, если заранее проверенный критерий неопределённости превышает порог.
  • Сравнение гипотез. Анализ того, насколько вывод чувствителен к весам, априору и доступным данным.

В каждом случае неопределённость является входом для правила принятия решения, а не готовым решением. Необходимо учитывать цену ошибок, изменение распределения, доступность действий и последствия ложного отказа.

Ограничения

  • Точное апостериорное распределение для практических нейросетей обычно недоступно.
  • Вариационные семейства могут не отражать корреляции и многомодальность и недооценивать неопределённость.
  • MCMC может плохо смешиваться и быть вычислительно дорогим.
  • Априор в пространстве весов не всегда прозрачно задаёт желаемый априор над функциями.
  • Несколько выборок или моделей увеличивают время предсказания.
  • Ошибочно заданное правдоподобие и смещённые данные делают даже формально корректный вывод неполным.
  • Байесовская постановка не заменяет проверку калибровки, качества данных, причинных предположений и последствий решения.

Философский аспект

Байесовская нейронная сеть заменяет единственную «лучшую» параметрическую гипотезу распределением гипотез, относительная правдоподобность которых зависит от данных и априора. Это делает явным различие между точечным ответом и степенью обоснованности ответа внутри модели.

Но апостериорная вероятность условна: она относится к выбранному пространству моделей, правдоподобию и априорному распределению. Если реальные причины не представлены в данных или модель наблюдений неверна, высокая внутренняя уверенность не превращается в знание о мире. Поэтому вероятностная формализация уточняет основания вывода, но не устраняет ответственность за постановку задачи и применение результата.

См. также

Примечания


Литература

Личные инструменты