Механистическая интерпретируемость

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
Строка 1: Строка 1:
-
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18:21, 11 июля 2026 (MSD).
+
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 17:07, 19 июля 2026 (MSD).
-
Промпты и описание редакторской проверки приведены в [[Обсуждение:Байесовская нейронная сеть]].
+
Промпты и описание редакторской проверки приведены в [[Обсуждение:Механистическая интерпретируемость]].
}}
}}
{{TOCright}}
{{TOCright}}
-
'''Байесовская нейронная сеть''' (англ. ''Bayesian neural network'', BNN) — вероятностная [[нейронная сеть]], в которой неизвестные параметры или часть параметров снабжают априорным распределением и после наблюдения данных рассматривают их апостериорное распределение. Предсказание получают усреднением по этому распределению, а не только подстановкой одного оценённого набора весов.
+
'''Механистическая интерпретируемость''' (англ. ''mechanistic interpretability'') — направление исследований [[нейронная сеть|нейронных сетей]], в котором их поведение объясняют через внутренние вычисления: представления признаков, операции отдельных компонентов и их причинные взаимодействия. В наиболее сильной формулировке задача состоит в том, чтобы построить понятное человеку описание алгоритма, реализованного параметрами сети, и проверить это описание вмешательствами в работу модели.<ref name="olah">{{статья |автор=Olah C., Cammarata N., Schubert L., Goh G., Petrov M., Carter S. |заглавие=Zoom In: An Introduction to Circuits |издание=Distill |год=2020 |doi=10.23915/distill.00024.001 |ссылка=https://distill.pub/2020/circuits/zoom-in/}}</ref><ref name="causal">{{статья |автор=Geiger A., Ibeling D., Zur A. и др. |заглавие=Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability |издание=Journal of Machine Learning Research |год=2025 |том=26 |номер=83 |страницы=1–64 |ссылка=https://www.jmlr.org/papers/v26/23-0058.html}}</ref>
-
Байесовская постановка позволяет формально учитывать неопределённость параметров и распространять её в прогноз. Однако она не гарантирует хорошую калибровку, обнаружение произвольных объектов вне обучающего распределения или безопасность решения. Результат зависит от правдоподобия, априорного распределения и качества приближённого вывода.
+
Механистическая интерпретируемость не ограничивается визуализацией внимания или поиском активаций, коррелирующих с понятием. Такие наблюдения помогают выдвинуть гипотезу, но для её проверки исследуют, как контролируемое изменение внутренней переменной влияет на последующие вычисления и выход модели. Даже причинное вмешательство само по себе не даёт полного объяснения: результат зависит от выбранного контрфактического примера, способа замены активации и полноты предполагаемой вычислительной цепочки.
-
== Основная идея ==
+
== Предмет и мотивация ==
-
Пусть <tex>\mathcal D=\{(x_i,y_i)\}_{i=1}^{n}</tex> — обучающая выборка, а <tex>w</tex> обозначает веса и смещения сети. В обычном обучении получают одну точечную оценку <tex>\hat w</tex>, например оценку максимального правдоподобия:
+
Современные нейросети обучаются как целостные системы, поэтому назначение отдельных внутренних компонентов обычно не задаётся заранее. Одинаковое внешнее поведение может быть реализовано разными механизмами, а один компонент может участвовать в нескольких функциях. Анализ только входов и выходов показывает, ''что'' делает модель, но не обязательно объясняет, ''как'' она это делает.
-
::<tex>\hat w_{\mathrm{ML}}=\mathop{\arg\max}_{w}\,p(\mathcal D\mid w).</tex>
+
Например, языковая модель может правильно выбирать косвенное дополнение или согласовывать сказуемое с подлежащим. Поведенческий тест измеряет долю правильных ответов. Механистическое исследование дополнительно пытается установить, где представлена информация об именах или грамматическом числе, какие компоненты переносят её между позициями и каким путём она изменяет логиты следующего токена.
-
В байесовском подходе сначала задают априорное распределение <tex>p(w)</tex>. После наблюдения выборки оно обновляется по формуле Байеса:
+
К практическим целям направления относятся:
-
::<tex>p(w\mid\mathcal D)=\frac{p(\mathcal D\mid w)p(w)}{p(\mathcal D)},</tex>
+
* проверка гипотез о внутренних алгоритмах модели;
 +
* поиск причин нежелательного поведения и систематических ошибок;
 +
* обнаружение распределённых представлений, не совпадающих с отдельными нейронами;
 +
* сравнение механизмов между входами, задачами, стадиями обучения и моделями;
 +
* разработка методов аудита и управляемого вмешательства.
-
где <tex>p(\mathcal D\mid w)</tex> — правдоподобие, а знаменатель
+
== Отличие от постфактум-объяснений ==
-
::<tex>p(\mathcal D)=\int p(\mathcal D\mid w)p(w)\,dw</tex>
+
Методы объяснения предсказаний часто оценивают важность входных признаков, строят локальную аппроксимацию модели или создают понятное описание конкретного ответа. Такое объяснение может быть полезным, даже если оно не воспроизводит внутреннее вычисление исходной сети.
-
называют маргинальным правдоподобием, или свидетельством модели (model evidence). Ранние практические схемы байесовского обучения нейронных сетей, включая приближение апостериорного распределения и применение свидетельства, были подробно рассмотрены Маккеем.<ref name="mackay1992">{{статья |автор=MacKay D. J. C. |заглавие=A Practical Bayesian Framework for Backpropagation Networks |издание=Neural Computation |год=1992 |том=4 |номер=3 |страницы=448–472 |doi=10.1162/neco.1992.4.3.448}}</ref>
+
Механистическая интерпретируемость, напротив, стремится связать объяснение с реальными переменными и операциями модели. Объектами анализа могут быть нейроны, направления в пространстве активаций, головы внимания, блоки MLP, остаточный поток трансформера и связи между ними. Различие относится прежде всего к цели и типу доказательства: постфактум-метод может объяснять зависимость выхода от входа, тогда как механистическое исследование пытается восстановить внутренний процесс.
-
Для нового объекта <tex>x_*</tex> интерес представляет апостериорное предиктивное распределение:
+
Граница между направлениями не абсолютна. Зонды, визуализации и методы атрибуции могут использоваться как разведочные инструменты, а найденная ими закономерность — затем проверяться причинным экспериментом.
-
::<tex>p(y_*\mid x_*,\mathcal D)=\int p(y_*\mid x_*,w)p(w\mid\mathcal D)\,dw.</tex>
+
== Уровни описания ==
-
В классификации <tex>p(y_*\mid x_*,w)</tex> может быть категориальным распределением, параметры которого задаёт softmax-выход сети. В регрессии сеть может задавать среднее и дисперсию нормального правдоподобия. Следовательно, неопределённость прогноза определяется не только распределением весов, но и выбранной моделью наблюдений.
+
=== Нейроны и координаты ===
-
== Источники неопределённости ==
+
Нейрон в слое задаёт одну координату активационного вектора. В некоторых случаях эта координата устойчиво реагирует на узнаваемый класс входов. Однако сильная активация на примерах одного типа не означает, что нейрон кодирует только этот тип или причинно отвечает за соответствующее поведение.
-
=== Алеаторическая неопределённость ===
+
Нейрон называют '''полисемантичным''' (''polysemantic''), если он участвует в представлении нескольких содержательно различных признаков. Полисемантичность может возникать, в частности, когда признаки представлены направлениями, не совпадающими с координатными осями слоя.
-
'''Алеаторическая неопределённость''' (англ. ''aleatoric uncertainty'') связана со случайностью наблюдений, шумом измерения или неполнотой доступных признаков. Даже при известных параметрах модели результат <tex>y</tex> может оставаться случайным. Такая неопределённость задаётся прежде всего правдоподобием <tex>p(y\mid x,w)</tex> и не обязана исчезать при увеличении выборки.
+
=== Признаки и представления ===
-
В регрессии различают гомоскедастическую модель с общей дисперсией шума и гетероскедастическую модель, в которой сеть предсказывает зависящую от объекта дисперсию. Если правдоподобие принято детерминированным или его дисперсия задана неверно, одно распределение весов не восстановит корректную алеаторическую неопределённость.
+
В литературе нет единственного операционального определения '''признака''' (''feature''). Часто под ним понимают направление или функцию от активаций, соответствующую некоторой устойчивой для модели закономерности. Один признак может быть распределён по многим координатам, а одна координата — участвовать во многих признаках.
-
=== Эпистемическая неопределённость ===
+
Смысл направления зависит от выбранного базиса. После обратимого преобразования пространства активаций вычисляемая моделью функция может сохраниться, тогда как интерпретация отдельных координат изменится. Поэтому утверждение «этот нейрон означает X» сильнее, чем наблюдение «эта линейная комбинация позволяет предсказывать X», и требует отдельного обоснования.
-
'''Эпистемическая неопределённость''' (англ. ''epistemic uncertainty'') отражает недостаточную определённость модели по имеющимся данным. Разные значения <tex>w</tex>, правдоподобные после обучения, могут давать разные прогнозы. При поступлении репрезентативных данных эта составляющая в принципе может уменьшаться, но только внутри принятого класса моделей.
+
'''Моносемантичным''' называют признак, которому удаётся приписать относительно единое и устойчивое описание. Это практическая характеристика интерпретируемости, а не гарантия однозначной семантики во всех возможных контекстах.
-
Для скалярной регрессии закон полной дисперсии даёт модельно-зависимое разложение:
+
=== Компоненты трансформера ===
-
::<tex>\operatorname{Var}(y_*\mid x_*,\mathcal D)=
+
В [[трансформер (модель)|трансформере]] часто анализируют:
-
\mathbb E_{p(w\mid\mathcal D)}[\operatorname{Var}(y_*\mid x_*,w)]
+
-
+\operatorname{Var}_{p(w\mid\mathcal D)}(\mathbb E[y_*\mid x_*,w]).</tex>
+
-
Первое слагаемое обычно интерпретируют как алеаторическую, второе — как эпистемическую составляющую. Это разложение не является независимой от модели физической истиной: оно зависит от правдоподобия, априора и того, какие параметры включены в <tex>w</tex>.
+
* головы [[механизм внимания|механизма внимания]] и их матрицы запросов, ключей, значений и выхода;
 +
* блоки MLP и их скрытые активации;
 +
* остаточный поток (''residual stream''), через который компоненты читают и записывают информацию;
 +
* логиты токенов и направления, связанные с выходной матрицей модели;
 +
* композиции компонентов между слоями и позициями последовательности.
-
=== Вероятность класса, калибровка и неизвестные объекты ===
+
Рисунок внимания показывает, откуда голова считывает информацию, но не полностью определяет, ''какую'' информацию она переносит и как та используется дальше. Для этого также исследуют преобразования значений и выходов, последующие компоненты и эффект вмешательств.
-
Высокая вероятность выбранного класса не означает автоматически, что модель хорошо откалибрована или что объект похож на обучающие данные. В классификации предиктивная энтропия смешивает несколько источников неопределённости, а расхождение прогнозов при разных выборках весов характеризует только неопределённость, представленную данным апостериорным приближением.
+
=== Вычислительные цепочки ===
-
Поэтому байесовскую нейронную сеть следует отдельно проверять на калибровку, качество вероятностного прогноза и поведение при сдвиге распределения. Неудачный априор или слишком узкое приближение <tex>q(w)</tex> может дать уверенные ответы и на непривычных объектах.
+
'''Вычислительная цепочка''' (''circuit'') — подграф вычислений сети, предложенный как механизм определённого поведения. Его узлами могут быть компоненты или признаки, а рёбрами — их функциональные взаимодействия.<ref name="olah" /> Известный пример — цепочка идентификации косвенного дополнения в GPT-2 small, найденная с использованием причинных вмешательств и описанная через группы голов внимания.<ref name="ioi">{{статья |автор=Wang K., Variengien A., Conmy A., Shlegeris B., Steinhardt J. |заглавие=Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small |издание=International Conference on Learning Representations |год=2023 |ссылка=https://arxiv.org/abs/2211.00593}}</ref>
-
== Априорные распределения ==
+
Качество описания цепочки можно оценивать по нескольким вопросам: воспроизводит ли оставленная цепочка исследуемое поведение модели (точность, или ''faithfulness''), учтены ли важные внешние компоненты (полнота) и действительно ли каждый включённый компонент необходим для заявленного объяснения (минимальность). Эти свойства зависят от набора входов, метрики и способа абляции.
-
Простой выбор — независимый нормальный априор:
+
== Наблюдение и причинная проверка ==
-
::<tex>p(w)=\prod_j\mathcal N(w_j\mid 0,\sigma_p^2).</tex>
+
=== Наблюдательные методы ===
-
При нормальном априоре и точечной MAP-оценке отрицательный логарифм априора соответствует квадратичному штрафу на веса. Но полное байесовское усреднение не сводится к такой регуляризации: априор влияет на форму всего апостериорного и предиктивного распределений.
+
К наблюдательным методам относятся просмотр наиболее активирующих примеров, визуализация паттернов внимания, линейные зонды и корреляция активаций с метками. Они отвечают на вопросы вида «где доступна информация?» или «какие переменные совместно изменяются?».
-
Независимый одинаковый априор для миллионов параметров удобен, но слабо выражает знания о функциях, реализуемых сетью. Влияние масштаба <tex>\sigma_p</tex> зависит от архитектуры, ширины слоёв и параметризации. Возможны иерархические априоры, разные масштабы для групп параметров и априоры, задаваемые через свойства функций, однако их выбор и вычислительный вывод сложнее.
+
Высокая точность зонда не доказывает, что исходная модель использует найденную информацию: зонд может извлекать её из направления, которое не участвует в вычислении ответа. Аналогично компонент может коррелировать с поведением из-за общего предшествующего вычисления, не являясь причиной результата.
-
== Почему требуется приближённый вывод ==
+
=== Абляция ===
-
В нейронной сети отображение от весов к выходу нелинейно, а пространство параметров высокоразмерно. Кроме того, перестановки скрытых нейронов и другие симметрии могут создавать несколько эквивалентных областей апостериорного распределения. Поэтому обычно недоступны как нормирующий интеграл <tex>p(\mathcal D)</tex>, так и точное вычисление предиктивного распределения.
+
При '''абляции''' активацию компонента удаляют или заменяют базовым значением и измеряют изменение выбранной метрики. Пусть <tex>m(M(x))</tex> — метрика поведения модели <tex>M</tex> на входе <tex>x</tex>, а <tex>h_c(x)</tex> — активация компонента <tex>c</tex>. Для значения замены <tex>b</tex> эффект можно записать как
-
Практические методы строят приближение к <tex>p(w\mid\mathcal D)</tex> или непосредственно к предиктивному распределению. Важно различать три уровня ошибки: несовершенство самой вероятностной модели, ошибку аппроксимации апостериорного распределения и ошибку конечного числа выборок при оценивании интеграла.
+
::<tex>\Delta_c(x;b)=m\bigl(M(x;h_c\leftarrow b)\bigr)-m(M(x)).</tex>
-
== Вариационный вывод ==
+
В качестве <tex>b</tex> используют ноль, среднюю активацию, случайное значение из другого примера или значение, подобранное под конкретный контроль. Выбор существенен: зануление может создать нетипичное для модели состояние, а замена средним — скрыть контекстную зависимость.
-
При '''вариационном выводе''' выбирают вычислимо удобное семейство <tex>q_\theta(w)</tex> и минимизируют
+
Сильное падение метрики показывает причинную значимость компонента при данном вмешательстве, но не обязательно подтверждает его предполагаемую семантику. Компонент может передавать несколько видов информации; возможны резервные пути и нелинейные побочные эффекты. Отсутствие эффекта также не доказывает незначимость из-за избыточности вычислений.
-
::<tex>\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w\mid\mathcal D)\bigr).</tex>
+
=== Activation patching ===
-
Поскольку истинный апостериор содержит недоступное маргинальное правдоподобие, вместо этого максимизируют нижнюю границу свидетельства — ELBO (англ. ''evidence lower bound''):
+
В '''activation patching''' сравнивают два согласованных прогона. В «чистом» прогоне вход <tex>x_{\mathrm{clean}}</tex> вызывает требуемое поведение, а в «искажённом» прогоне <tex>x_{\mathrm{corr}}</tex> оно ухудшается. Затем активацию выбранного узла из чистого прогона подставляют в искажённый.
-
::<tex>\mathcal L(\theta)=
+
Пусть <tex>h_c^{\mathrm{clean}}</tex> — чистая активация компонента, а <tex>m_{\mathrm{corr}}=m(M(x_{\mathrm{corr}}))</tex>. Эффект восстановления равен
-
\mathbb E_{q_\theta(w)}[\log p(\mathcal D\mid w)]
+
-
-\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w)\bigr).</tex>
+
-
Она связана с логарифмом свидетельства тождеством
+
::<tex>\Delta_c^{\mathrm{patch}}=m\bigl(M(x_{\mathrm{corr}};h_c\leftarrow h_c^{\mathrm{clean}})\bigr)-m_{\mathrm{corr}}.</tex>
-
::<tex>\log p(\mathcal D)=\mathcal L(\theta)+
+
Положительный эффект означает, что различие, проходящее через выбранный узел, причинно способствует различию выходов в этой паре прогонов. Он не доказывает, что узел самостоятельно вычисляет соответствующую величину: активация может лишь переносить информацию, а патч одновременно менять несколько скрытых факторов. Поэтому чистый и искажённый входы стараются различать контролируемо, а результат проверяют на множестве пар и контрольных заменах.<ref name="rome">{{статья |автор=Meng K., Bau D., Andonian A., Belinkov Y. |заглавие=Locating and Editing Factual Associations in GPT |издание=Advances in Neural Information Processing Systems |год=2022 |том=35 |страницы=17359–17372 |ссылка=https://arxiv.org/abs/2202.05262}}</ref>
-
\mathrm{KL}\bigl(q_\theta(w)\,\|\,p(w\mid\mathcal D)\bigr).</tex>
+
-
Первое слагаемое ELBO поощряет объяснение данных, а второе штрафует отклонение от априора. Поскольку KL-дивергенция неотрицательна, ELBO действительно является нижней границей <tex>\log p(\mathcal D)</tex>.
+
Описанная схема переносит чистую активацию в искажённый прогон и проверяет восстановление поведения (''denoising''). Возможен обратный эксперимент: искажённую активацию переносят в чистый прогон и измеряют разрушение поведения (''noising''). Эти тесты отвечают на разные вопросы и не обязаны давать симметричные результаты.<ref name="patching">{{статья |автор=Heimersheim S., Nanda N. |заглавие=How to use and interpret activation patching |год=2024 |ссылка=https://arxiv.org/abs/2404.15255}}</ref>
-
В распространённом среднеполевом приближении веса независимы:
+
'''Path patching''' ограничивает замену выбранным путём между компонентами, чтобы отделить прямой эффект от других последствий вмешательства. Градиентные методы атрибуции могут приближать массовый перебор патчей, но такие приближения способны пропускать нелинейные эффекты.
-
::<tex>q_\theta(w)=\prod_j\mathcal N(w_j\mid\mu_j,\sigma_j^2).</tex>
+
== Исследовательский цикл ==
-
Такое семейство не описывает корреляции и несколько разнесённых мод апостериорного распределения. Минимизация «обратной» дивергенции <tex>\mathrm{KL}(q\|p)</tex> может сосредоточить приближение около одной моды и недооценить некоторые виды неопределённости. При этом увеличение выразительности вариационного семейства повышает вычислительную стоимость. Практический стохастический вариационный метод для разных архитектур нейросетей предложил Грейвс.<ref name="graves2011">{{статья |автор=Graves A. |заглавие=Practical Variational Inference for Neural Networks |издание=Advances in Neural Information Processing Systems |год=2011 |том=24 |ссылка=https://papers.nips.cc/paper_files/paper/2011/hash/7eb3c8be3d411e8ebfab08eba5f49632-Abstract.html}}</ref>
+
Практическое исследование обычно включает следующие этапы:
-
== Bayes by Backprop ==
+
# Задать узкое измеримое поведение и набор контрастных примеров.
 +
# Выбрать метрику, например разность логитов правильного и альтернативного токенов.
 +
# С помощью наблюдений или атрибуции локализовать кандидатов.
 +
# Сформулировать конкретную гипотезу о представлении, передаваемой информации и последовательности операций.
 +
# Проверить предсказания гипотезы абляцией, patching или более локальным вмешательством.
 +
# Оценить точность, полноту и минимальность предложенной цепочки.
 +
# Повторить эксперименты на новых шаблонах, распределениях данных и случайных начальных условиях анализа.
-
'''Bayes by Backprop''' — вариант вариационного обучения распределения весов с помощью обратного распространения ошибки. Для диагонального гауссовского приближения можно положить
+
Механистическое объяснение тем сильнее, чем больше независимых следствий гипотезы оно заранее предсказывает. Простого сохранения производительности после удаления «неважных» компонентов недостаточно, если способ удаления сам создаёт компенсирующие или внераспределительные эффекты.
-
::<tex>\sigma_j=\log(1+\exp(\rho_j)),\qquad
+
== Суперпозиция ==
-
w_j=\mu_j+\sigma_j\varepsilon_j,\qquad
+
-
\varepsilon_j\sim\mathcal N(0,1).</tex>
+
-
Репараметризация отделяет источник случайности <tex>\varepsilon_j</tex> от оптимизируемых параметров <tex>\mu_j</tex> и <tex>\rho_j</tex>. Благодаря этому выборочную оценку отрицательной ELBO можно дифференцировать по параметрам вариационного распределения и оптимизировать обычными методами стохастического градиента.<ref name="blundell2015">{{статья |автор=Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D. |заглавие=Weight Uncertainty in Neural Network |издание=Proceedings of the 32nd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=37 |год=2015 |страницы=1613–1622 |ссылка=https://proceedings.mlr.press/v37/blundell15.html}}</ref>
+
Пусть слой имеет размерность <tex>d</tex>, а для задачи полезны <tex>n</tex> признаков с коэффициентами <tex>f_i</tex> и направлениями <tex>v_i\in\mathbb{R}^d</tex>. Представление можно схематично записать как
-
Метод не получает точное апостериорное распределение: результат ограничен выбранным семейством <tex>q_\theta</tex>, стохастической оптимизацией и конечным числом выборок. При диагональном гауссовском <tex>q_\theta</tex> число сохраняемых вариационных параметров весов примерно удваивается относительно точечной сети.
+
::<tex>x\approx\sum_{i=1}^{n}f_i v_i.</tex>
-
== Монте-Карло dropout ==
+
Если <tex>n&gt;d</tex>, направления не могут быть линейно независимыми. Тем не менее при разреженной совместной активации признаков модель может хранить их в неортогональном коде и допускать ограниченную интерференцию. Такое размещение называют '''суперпозицией''' (''superposition''). Это не утверждение, что конечномерное пространство содержит лишь <tex>d</tex> возможных направлений; речь идёт о представлении более чем <tex>d</tex> независимо полезных признаков перекрывающимся набором направлений.
-
'''Монте-Карло dropout''' (MC dropout) сохраняет случайные dropout-маски не только при обучении, но и при предсказании. Для объекта выполняют <tex>S</tex> проходов и усредняют условные прогнозы:
+
В ''Toy Models of Superposition'' этот механизм исследован в контролируемых моделях с заранее известными разреженными признаками. Авторы показали режимы, в которых модель предпочитает неортогональное размещение признаков, и связали его с полисемантичностью нейронов.<ref name="superposition">{{статья |автор=Elhage N., Hume T., Olsson C., Schiefer N. и др. |заглавие=Toy Models of Superposition |издание=Transformer Circuits Thread |год=2022 |ссылка=https://transformer-circuits.pub/2022/toy_model/index.html}}</ref> Результат является демонстрацией механизма в игрушечной постановке, а не доказательством того, что вся полисемантичность больших моделей имеет единственную причину.
-
::<tex>\widehat p(y_*\mid x_*,\mathcal D)=
+
Суперпозиция затрудняет анализ по координатам: изменение одного нейрона может одновременно затронуть несколько признаков. Поэтому исследователи пытаются восстановить более широкий словарь разреженно активирующихся направлений.
-
\frac{1}{S}\sum_{s=1}^{S}p(y_*\mid x_*,w^{(s)}).</tex>
+
-
Gal и Ghahramani интерпретировали обучение с dropout как вариационное приближение в связанной вероятностной модели глубокого гауссовского процесса.<ref name="gal2016">{{статья |автор=Gal Y., Ghahramani Z. |заглавие=Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning |издание=Proceedings of the 33rd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=48 |год=2016 |страницы=1050–1059 |ссылка=https://proceedings.mlr.press/v48/gal16.html}}</ref>
+
== Словарное обучение и разреженные автоэнкодеры ==
-
Выборочная дисперсия стохастических выходов измеряет разброс, создаваемый dropout-приближением. Для полной предиктивной дисперсии регрессии к ней необходимо добавить условную дисперсию наблюдений, заданную правдоподобием. Поэтому выражение, содержащее только разброс проходов, нельзя без оговорок называть всей неопределённостью будущего <tex>y_*</tex>.
+
=== Постановка задачи ===
-
MC dropout удобен тем, что может использовать знакомую архитектуру, но остаётся конкретным приближением, зависящим от вероятности dropout, места установки масок, способа обучения и числа проходов. Он не является выборкой из точного апостериорного распределения произвольной сети.
+
'''Словарное обучение''' ищет набор направлений, с помощью которых наблюдаемые активации можно приближённо представить разреженной линейной комбинацией. Один из методов — [[автокодировщик|разреженный автоэнкодер]] (''sparse autoencoder'', SAE).
-
== Методы Монте-Карло по марковским цепям ==
+
Для активации <tex>x\in\mathbb{R}^{d}</tex> кодировщик строит более широкое представление <tex>z\in\mathbb{R}^{p}</tex>, обычно при <tex>p&gt;d</tex>:
-
'''Методы Монте-Карло по марковским цепям''' (MCMC) строят зависимую последовательность значений <tex>w^{(1)},w^{(2)},\ldots</tex>, стационарным распределением которой при выполнении условий метода является апостериорное <tex>p(w\mid\mathcal D)</tex>. После разогрева цепи предиктивный интеграл оценивают усреднением по выборкам.
+
::<tex>z=\operatorname{ReLU}(W_{\mathrm{enc}}x+b_{\mathrm{enc}}),</tex>
-
В отличие от фиксированного среднеполевого семейства, MCMC не требует диагонального гауссовского вида апостериора. Однако асимптотическая корректность не означает, что конечная цепь хорошо исследовала многомодальное высокоразмерное распределение. Для глубоких сетей возникают высокая стоимость вычисления градиентов по всей выборке, автокорреляция, медленное смешивание и необходимость диагностики сходимости. Поэтому MCMC полезен как принципиальный и исследовательский подход, но не всегда практичен для крупной сети.
+
а декодировщик восстанавливает активацию:
-
== Сравнение с ансамблями ==
+
::<tex>\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.</tex>
-
'''Ансамбль''' обычных нейронных сетей получают, независимо обучая несколько точечных моделей с разными инициализациями, порядком объектов или подвыборками данных. Усреднение и разброс их прогнозов могут улучшать качество и давать практически полезный сигнал несогласия.
+
Типичная функция потерь сочетает среднеквадратичную ошибку и штраф за плотный код:
-
Различия подходов состоят в следующем:
+
::<tex>\mathcal{L}=\mathbb{E}_{x}\left[\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1\right].</tex>
-
* байесовская сеть начинается с одной вероятностной модели, априора и правила обновления до апостериорного распределения;
+
Столбцы <tex>W_{\mathrm{dec}}</tex> интерпретируют как направления словаря, а координаты <tex>z</tex> — как активации извлечённых признаков. Чтобы исключить тривиальное уменьшение штрафа <tex>L_1</tex> через уменьшение <tex>z</tex> и компенсирующее увеличение весов декодера, нормы его столбцов ограничивают или нормируют.
-
* ансамбль задаётся процедурой обучения нескольких моделей и не обязан соответствовать выборкам из какого-либо апостериорного распределения;
+
-
* среднеполевой вариационный метод хранит параметры одного распределения, но ограничивает его форму;
+
-
* ансамбль может охватывать разные области пространства решений, но требует хранить и запускать несколько сетей;
+
-
* оба подхода могут быть некалиброванными и давать чрезмерно уверенные прогнозы при сдвиге распределения.
+
-
Ни один подход не лучше другого во всех задачах. Сравнивать следует не только точность, но и логарифмическую потерю, калибровку, покрытие предиктивных интервалов, вычислительную стоимость и качество на заранее определённых видах сдвига данных.
+
=== Интерпретация признаков ===
-
== Практическая оценка неопределённости ==
+
Признак SAE обычно исследуют по примерам с наибольшей активацией, распределению активаций, связанным токенам и влиянию вмешательства в его коэффициент. В ''Towards Monosemanticity'' словарное обучение применено к активациям небольшой однослайной языковой модели; многие полученные признаки оказались интерпретируемее отдельных нейронов, а разложение использовалось для анализа простых взаимодействий.<ref name="mono">{{статья |автор=Bricken T., Templeton A., Batson J., Chen B., Jermyn A. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |издание=Transformer Circuits Thread |год=2023 |ссылка=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}</ref>
-
Качество вероятностной модели нельзя установить по ширине интервала или визуально правдоподобному разбросу. В зависимости от задачи проверяют:
+
В ''Scaling Monosemanticity'' SAE обучались на активациях среднего слоя Claude 3 Sonnet; словари включали до 34 миллионов признаков. Были описаны признаки, связанные с именованными сущностями, языками, кодом, изображениями и более абстрактными темами, а изменение некоторых признаков влияло на генерацию в направлении, согласующемся с их описанием.<ref name="scaling">{{статья |автор=Templeton A., Conerly T., Marcus J., Lindsey J., Bricken T. и др. |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |издание=Transformer Circuits Thread |год=2024 |ссылка=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}</ref>
-
* отрицательное логарифмическое правдоподобие и другие собственные функции потерь;
+
Эти результаты показывают масштабируемость процедуры извлечения большого числа интерпретируемых направлений, но не полную декомпозицию модели. Авторы прямо отмечают неполноту словаря и отсутствие строгой общей меры того, насколько признаки верно отражают вычисления модели.
-
* калибровку вероятностей классификации;
+
-
* фактическое покрытие и ширину предиктивных интервалов в регрессии;
+
-
* качество ранжирования объектов для [[активное обучение|активного обучения]];
+
-
* поведение на заранее выделенных сдвигах распределения и неизвестных классах;
+
-
* устойчивость результатов к априору и способу приближённого вывода.
+
-
Калибровка внутри исходного распределения не доказывает надёжность вне него. Порог отказа от автоматического решения необходимо проверять на данных, соответствующих реальному сценарию применения.
+
=== Ошибки реконструкции и артефакты ===
-
== Применения ==
+
SAE является отдельной обученной моделью. Его признаки зависят от данных, ширины словаря, коэффициента разреженности, оптимизации и точки модели, с которой собраны активации. Возможны:
-
* '''Регрессия.''' Построение предиктивного распределения будущего наблюдения, учитывающего условный шум и неопределённость параметров.
+
* '''потери реконструкции''': часть информации исходной активации не проходит через словарь;
-
* '''Активное обучение.''' Выбор объектов, разметка которых ожидаемо уменьшит неопределённость модели или улучшит целевое качество.
+
* '''мёртвые признаки''', почти никогда не активирующиеся на данных;
-
* '''Оптимизация эксперимента.''' Использование предиктивного распределения при выборе следующего измерения или испытания.
+
* '''расщепление признака''', когда одна закономерность представлена несколькими элементами словаря;
-
* '''Системы с возможностью отказа.''' Передача случая человеку или резервному алгоритму, если заранее проверенный критерий неопределённости превышает порог.
+
* '''слияние признаков''', когда один элемент объединяет несколько закономерностей;
-
* '''Сравнение гипотез.''' Анализ того, насколько вывод чувствителен к весам, априору и доступным данным.
+
* '''неоднозначность словаря''': разные запуски могут давать разные, но сходно реконструирующие разложения;
 +
* '''артефакты распределения данных''': редкие или отсутствующие контексты не получают надёжного представления.
-
В каждом случае неопределённость является входом для правила принятия решения, а не готовым решением. Необходимо учитывать цену ошибок, изменение распределения, доступность действий и последствия ложного отказа.
+
Низкая ошибка реконструкции не гарантирует интерпретируемость, а понятная подпись признака не гарантирует функциональную значимость. Поэтому оценивают одновременно реконструкцию, разреженность, устойчивость, качество человеческой или автоматической интерпретации и причинный эффект вмешательств. Также полезно сравнивать поведение исходной модели с поведением при замене её активаций реконструкциями SAE.
-
== Ограничения ==
+
== Ограничения доказательств ==
-
* Точное апостериорное распределение для практических нейросетей обычно недоступно.
+
Механистическая интерпретируемость пока не является полным методом аудита произвольной большой модели. Основные ограничения включают:
-
* Вариационные семейства могут не отражать корреляции и многомодальность и недооценивать неопределённость.
+
-
* MCMC может плохо смешиваться и быть вычислительно дорогим.
+
-
* Априор в пространстве весов не всегда прозрачно задаёт желаемый априор над функциями.
+
-
* Несколько выборок или моделей увеличивают время предсказания.
+
-
* Ошибочно заданное правдоподобие и смещённые данные делают даже формально корректный вывод неполным.
+
-
* Байесовская постановка не заменяет проверку калибровки, качества данных, причинных предположений и последствий решения.
+
-
== Философский аспект ==
+
* '''субъективность описаний''': человек может выбрать слишком широкую или удобную подпись для набора активирующих примеров;
 +
* '''неполноту покрытия''': понятные признаки и цепочки могут объяснять лишь часть поведения;
 +
* '''зависимость от контрфакта''': результат patching меняется с выбором чистого и искажённого входов;
 +
* '''чувствительность к абляции''': нулевая, средняя и выборочная замены могут приводить к разным выводам;
 +
* '''комбинаторный масштаб''': число возможных компонентов, признаков, путей и их взаимодействий быстро растёт;
 +
* '''распределённость и избыточность''': отсутствие эффекта отдельной абляции не исключает участия компонента;
 +
* '''ограниченный перенос''': механизм, найденный на одном шаблоне или небольшой модели, может не сохраняться на другом распределении или масштабе;
 +
* '''артефакты вспомогательных моделей''': зонды, методы атрибуции и SAE способны вносить собственное смещение;
 +
* '''двойное использование данных''': подбор и проверка гипотез на одних примерах увеличивает риск переобучения исследователя.
-
Байесовская нейронная сеть заменяет единственную «лучшую» параметрическую гипотезу распределением гипотез, относительная правдоподобность которых зависит от данных и априора. Это делает явным различие между точечным ответом и степенью обоснованности ответа внутри модели.
+
Надёжная работа должна заранее определить поведение и метрику, использовать контрольные вмешательства и отложенные примеры, сообщать отрицательные результаты и проверять альтернативные объяснения. Причинная проверка усиливает свидетельство, но не превращает локальный эффект в полную теорию работы модели.
-
Но апостериорная вероятность условна: она относится к выбранному пространству моделей, правдоподобию и априорному распределению. Если реальные причины не представлены в данных или модель наблюдений неверна, высокая внутренняя уверенность не превращается в знание о мире. Поэтому вероятностная формализация уточняет основания вывода, но не устраняет ответственность за постановку задачи и применение результата.
+
== Связь с безопасностью искусственного интеллекта ==
 +
 
 +
Для безопасности ИИ механистическая интерпретируемость рассматривается как возможный инструмент внутреннего аудита. В принципе она может помочь обнаруживать представления и цепочки, связанные с обманом, нежелательными целями, уязвимыми эвристиками или обходом ограничений, даже когда внешние тесты не покрывают все условия.
 +
 
 +
Однако наличие интерпретируемого признака, коррелирующего с опасной темой, не означает обнаружения намерения или полного механизма поведения. И наоборот, отсутствие найденного признака не является доказательством безопасности: словарь или процедура поиска могут быть неполными. Манипулирование признаком также может вызывать побочные эффекты и не заменяет поведенческое тестирование, оценку устойчивости и другие методы обеспечения безопасности.
 +
 
 +
== Эпистемологический статус объяснения ==
 +
 
 +
Механистический подход трактует нейросеть как объект экспериментального исследования. Объяснение здесь представляет собой не только понятный рассказ, но и модель внутреннего вычисления, из которой следуют проверяемые предсказания о результатах вмешательств.
 +
 
 +
Полезно различать несколько уровней утверждений: информация ''декодируется'' из активации; модель ''использует'' её для данного ответа; конкретный компонент ''реализует'' вычислительную операцию; предложенная цепочка ''достаточно полно'' объясняет поведение. Каждый следующий уровень требует более сильных экспериментов. Это различие предотвращает переход от яркой визуализации или понятной подписи признака к необоснованному заявлению о полном понимании модели.
== См. также ==
== См. также ==
* [[Нейронная сеть]]
* [[Нейронная сеть]]
-
* [[Машинное обучение]]
+
* [[Глубокое обучение]]
-
* [[Байесовский вывод]]
+
* [[Трансформер (модель)]]
-
* [[Регуляризация (математика)]]
+
* [[Механизм внимания]]
-
* [[Dropout]]
+
* [[Автокодировщик]]
-
* [[Ансамбль методов]]
+
-
* [[Активное обучение]]
+
== Примечания ==
== Примечания ==
Строка 197: Строка 205:
== Литература ==
== Литература ==
-
* {{статья |автор=MacKay D. J. C. |заглавие=A Practical Bayesian Framework for Backpropagation Networks |издание=Neural Computation |год=1992 |том=4 |номер=3 |страницы=448–472 |doi=10.1162/neco.1992.4.3.448}}
+
* {{статья |автор=Olah C., Cammarata N., Schubert L., Goh G., Petrov M., Carter S. |заглавие=Zoom In: An Introduction to Circuits |издание=Distill |год=2020 |doi=10.23915/distill.00024.001 |ссылка=https://distill.pub/2020/circuits/zoom-in/}}
-
* {{статья |автор=Graves A. |заглавие=Practical Variational Inference for Neural Networks |издание=Advances in Neural Information Processing Systems |год=2011 |том=24 |ссылка=https://papers.nips.cc/paper_files/paper/2011/hash/7eb3c8be3d411e8ebfab08eba5f49632-Abstract.html}}
+
* {{статья |автор=Elhage N., Nanda N., Olsson C. и др. |заглавие=A Mathematical Framework for Transformer Circuits |издание=Transformer Circuits Thread |год=2021 |ссылка=https://transformer-circuits.pub/2021/framework/index.html}}
-
* {{статья |автор=Blundell C., Cornebise J., Kavukcuoglu K., Wierstra D. |заглавие=Weight Uncertainty in Neural Network |издание=Proceedings of the 32nd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=37 |год=2015 |страницы=1613–1622 |ссылка=https://proceedings.mlr.press/v37/blundell15.html}}
+
* {{статья |автор=Elhage N., Hume T., Olsson C., Schiefer N. и др. |заглавие=Toy Models of Superposition |издание=Transformer Circuits Thread |год=2022 |ссылка=https://transformer-circuits.pub/2022/toy_model/index.html}}
-
* {{статья |автор=Gal Y., Ghahramani Z. |заглавие=Dropout as a Bayesian Approximation: Representing Model Uncertainty in Deep Learning |издание=Proceedings of the 33rd International Conference on Machine Learning |серия=Proceedings of Machine Learning Research |том=48 |год=2016 |страницы=1050–1059 |ссылка=https://proceedings.mlr.press/v48/gal16.html}}
+
* {{статья |автор=Meng K., Bau D., Andonian A., Belinkov Y. |заглавие=Locating and Editing Factual Associations in GPT |издание=Advances in Neural Information Processing Systems |год=2022 |том=35 |страницы=17359–17372 |ссылка=https://arxiv.org/abs/2202.05262}}
 +
* {{статья |автор=Wang K., Variengien A., Conmy A., Shlegeris B., Steinhardt J. |заглавие=Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small |издание=International Conference on Learning Representations |год=2023 |ссылка=https://arxiv.org/abs/2211.00593}}
 +
* {{статья |автор=Bricken T., Templeton A., Batson J., Chen B., Jermyn A. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |издание=Transformer Circuits Thread |год=2023 |ссылка=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}
 +
* {{статья |автор=Heimersheim S., Nanda N. |заглавие=How to use and interpret activation patching |год=2024 |ссылка=https://arxiv.org/abs/2404.15255}}
 +
* {{статья |автор=Geiger A., Ibeling D., Zur A. и др. |заглавие=Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability |издание=Journal of Machine Learning Research |год=2025 |том=26 |номер=83 |страницы=1–64 |ссылка=https://www.jmlr.org/papers/v26/23-0058.html}}
 +
* {{статья |автор=Templeton A., Conerly T., Marcus J., Lindsey J., Bricken T. и др. |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |издание=Transformer Circuits Thread |год=2024 |ссылка=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}
-
{{DEFAULTSORT:Байесовская нейронная сеть}}
 
[[Категория:Машинное обучение]]
[[Категория:Машинное обучение]]
[[Категория:Нейронные сети]]
[[Категория:Нейронные сети]]

Версия 13:07, 19 июля 2026

Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 17:07, 19 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Механистическая интерпретируемость.


Содержание

Механистическая интерпретируемость (англ. mechanistic interpretability) — направление исследований нейронных сетей, в котором их поведение объясняют через внутренние вычисления: представления признаков, операции отдельных компонентов и их причинные взаимодействия. В наиболее сильной формулировке задача состоит в том, чтобы построить понятное человеку описание алгоритма, реализованного параметрами сети, и проверить это описание вмешательствами в работу модели.[1][1]

Механистическая интерпретируемость не ограничивается визуализацией внимания или поиском активаций, коррелирующих с понятием. Такие наблюдения помогают выдвинуть гипотезу, но для её проверки исследуют, как контролируемое изменение внутренней переменной влияет на последующие вычисления и выход модели. Даже причинное вмешательство само по себе не даёт полного объяснения: результат зависит от выбранного контрфактического примера, способа замены активации и полноты предполагаемой вычислительной цепочки.

Предмет и мотивация

Современные нейросети обучаются как целостные системы, поэтому назначение отдельных внутренних компонентов обычно не задаётся заранее. Одинаковое внешнее поведение может быть реализовано разными механизмами, а один компонент может участвовать в нескольких функциях. Анализ только входов и выходов показывает, что делает модель, но не обязательно объясняет, как она это делает.

Например, языковая модель может правильно выбирать косвенное дополнение или согласовывать сказуемое с подлежащим. Поведенческий тест измеряет долю правильных ответов. Механистическое исследование дополнительно пытается установить, где представлена информация об именах или грамматическом числе, какие компоненты переносят её между позициями и каким путём она изменяет логиты следующего токена.

К практическим целям направления относятся:

  • проверка гипотез о внутренних алгоритмах модели;
  • поиск причин нежелательного поведения и систематических ошибок;
  • обнаружение распределённых представлений, не совпадающих с отдельными нейронами;
  • сравнение механизмов между входами, задачами, стадиями обучения и моделями;
  • разработка методов аудита и управляемого вмешательства.

Отличие от постфактум-объяснений

Методы объяснения предсказаний часто оценивают важность входных признаков, строят локальную аппроксимацию модели или создают понятное описание конкретного ответа. Такое объяснение может быть полезным, даже если оно не воспроизводит внутреннее вычисление исходной сети.

Механистическая интерпретируемость, напротив, стремится связать объяснение с реальными переменными и операциями модели. Объектами анализа могут быть нейроны, направления в пространстве активаций, головы внимания, блоки MLP, остаточный поток трансформера и связи между ними. Различие относится прежде всего к цели и типу доказательства: постфактум-метод может объяснять зависимость выхода от входа, тогда как механистическое исследование пытается восстановить внутренний процесс.

Граница между направлениями не абсолютна. Зонды, визуализации и методы атрибуции могут использоваться как разведочные инструменты, а найденная ими закономерность — затем проверяться причинным экспериментом.

Уровни описания

Нейроны и координаты

Нейрон в слое задаёт одну координату активационного вектора. В некоторых случаях эта координата устойчиво реагирует на узнаваемый класс входов. Однако сильная активация на примерах одного типа не означает, что нейрон кодирует только этот тип или причинно отвечает за соответствующее поведение.

Нейрон называют полисемантичным (polysemantic), если он участвует в представлении нескольких содержательно различных признаков. Полисемантичность может возникать, в частности, когда признаки представлены направлениями, не совпадающими с координатными осями слоя.

Признаки и представления

В литературе нет единственного операционального определения признака (feature). Часто под ним понимают направление или функцию от активаций, соответствующую некоторой устойчивой для модели закономерности. Один признак может быть распределён по многим координатам, а одна координата — участвовать во многих признаках.

Смысл направления зависит от выбранного базиса. После обратимого преобразования пространства активаций вычисляемая моделью функция может сохраниться, тогда как интерпретация отдельных координат изменится. Поэтому утверждение «этот нейрон означает X» сильнее, чем наблюдение «эта линейная комбинация позволяет предсказывать X», и требует отдельного обоснования.

Моносемантичным называют признак, которому удаётся приписать относительно единое и устойчивое описание. Это практическая характеристика интерпретируемости, а не гарантия однозначной семантики во всех возможных контекстах.

Компоненты трансформера

В трансформере часто анализируют:

  • головы механизма внимания и их матрицы запросов, ключей, значений и выхода;
  • блоки MLP и их скрытые активации;
  • остаточный поток (residual stream), через который компоненты читают и записывают информацию;
  • логиты токенов и направления, связанные с выходной матрицей модели;
  • композиции компонентов между слоями и позициями последовательности.

Рисунок внимания показывает, откуда голова считывает информацию, но не полностью определяет, какую информацию она переносит и как та используется дальше. Для этого также исследуют преобразования значений и выходов, последующие компоненты и эффект вмешательств.

Вычислительные цепочки

Вычислительная цепочка (circuit) — подграф вычислений сети, предложенный как механизм определённого поведения. Его узлами могут быть компоненты или признаки, а рёбрами — их функциональные взаимодействия.[1] Известный пример — цепочка идентификации косвенного дополнения в GPT-2 small, найденная с использованием причинных вмешательств и описанная через группы голов внимания.[1]

Качество описания цепочки можно оценивать по нескольким вопросам: воспроизводит ли оставленная цепочка исследуемое поведение модели (точность, или faithfulness), учтены ли важные внешние компоненты (полнота) и действительно ли каждый включённый компонент необходим для заявленного объяснения (минимальность). Эти свойства зависят от набора входов, метрики и способа абляции.

Наблюдение и причинная проверка

Наблюдательные методы

К наблюдательным методам относятся просмотр наиболее активирующих примеров, визуализация паттернов внимания, линейные зонды и корреляция активаций с метками. Они отвечают на вопросы вида «где доступна информация?» или «какие переменные совместно изменяются?».

Высокая точность зонда не доказывает, что исходная модель использует найденную информацию: зонд может извлекать её из направления, которое не участвует в вычислении ответа. Аналогично компонент может коррелировать с поведением из-за общего предшествующего вычисления, не являясь причиной результата.

Абляция

При абляции активацию компонента удаляют или заменяют базовым значением и измеряют изменение выбранной метрики. Пусть m(M(x)) — метрика поведения модели M на входе x, а h_c(x) — активация компонента c. Для значения замены b эффект можно записать как

\Delta_c(x;b)=m\bigl(M(x;h_c\leftarrow b)\bigr)-m(M(x)).

В качестве b используют ноль, среднюю активацию, случайное значение из другого примера или значение, подобранное под конкретный контроль. Выбор существенен: зануление может создать нетипичное для модели состояние, а замена средним — скрыть контекстную зависимость.

Сильное падение метрики показывает причинную значимость компонента при данном вмешательстве, но не обязательно подтверждает его предполагаемую семантику. Компонент может передавать несколько видов информации; возможны резервные пути и нелинейные побочные эффекты. Отсутствие эффекта также не доказывает незначимость из-за избыточности вычислений.

Activation patching

В activation patching сравнивают два согласованных прогона. В «чистом» прогоне вход x_{\mathrm{clean}} вызывает требуемое поведение, а в «искажённом» прогоне x_{\mathrm{corr}} оно ухудшается. Затем активацию выбранного узла из чистого прогона подставляют в искажённый.

Пусть h_c^{\mathrm{clean}} — чистая активация компонента, а m_{\mathrm{corr}}=m(M(x_{\mathrm{corr}})). Эффект восстановления равен

\Delta_c^{\mathrm{patch}}=m\bigl(M(x_{\mathrm{corr}};h_c\leftarrow h_c^{\mathrm{clean}})\bigr)-m_{\mathrm{corr}}.

Положительный эффект означает, что различие, проходящее через выбранный узел, причинно способствует различию выходов в этой паре прогонов. Он не доказывает, что узел самостоятельно вычисляет соответствующую величину: активация может лишь переносить информацию, а патч одновременно менять несколько скрытых факторов. Поэтому чистый и искажённый входы стараются различать контролируемо, а результат проверяют на множестве пар и контрольных заменах.[1]

Описанная схема переносит чистую активацию в искажённый прогон и проверяет восстановление поведения (denoising). Возможен обратный эксперимент: искажённую активацию переносят в чистый прогон и измеряют разрушение поведения (noising). Эти тесты отвечают на разные вопросы и не обязаны давать симметричные результаты.[1]

Path patching ограничивает замену выбранным путём между компонентами, чтобы отделить прямой эффект от других последствий вмешательства. Градиентные методы атрибуции могут приближать массовый перебор патчей, но такие приближения способны пропускать нелинейные эффекты.

Исследовательский цикл

Практическое исследование обычно включает следующие этапы:

  1. Задать узкое измеримое поведение и набор контрастных примеров.
  2. Выбрать метрику, например разность логитов правильного и альтернативного токенов.
  3. С помощью наблюдений или атрибуции локализовать кандидатов.
  4. Сформулировать конкретную гипотезу о представлении, передаваемой информации и последовательности операций.
  5. Проверить предсказания гипотезы абляцией, patching или более локальным вмешательством.
  6. Оценить точность, полноту и минимальность предложенной цепочки.
  7. Повторить эксперименты на новых шаблонах, распределениях данных и случайных начальных условиях анализа.

Механистическое объяснение тем сильнее, чем больше независимых следствий гипотезы оно заранее предсказывает. Простого сохранения производительности после удаления «неважных» компонентов недостаточно, если способ удаления сам создаёт компенсирующие или внераспределительные эффекты.

Суперпозиция

Пусть слой имеет размерность d, а для задачи полезны n признаков с коэффициентами f_i и направлениями v_i\in\mathbb{R}^d. Представление можно схематично записать как

x\approx\sum_{i=1}^{n}f_i v_i.

Если n>d, направления не могут быть линейно независимыми. Тем не менее при разреженной совместной активации признаков модель может хранить их в неортогональном коде и допускать ограниченную интерференцию. Такое размещение называют суперпозицией (superposition). Это не утверждение, что конечномерное пространство содержит лишь d возможных направлений; речь идёт о представлении более чем d независимо полезных признаков перекрывающимся набором направлений.

В Toy Models of Superposition этот механизм исследован в контролируемых моделях с заранее известными разреженными признаками. Авторы показали режимы, в которых модель предпочитает неортогональное размещение признаков, и связали его с полисемантичностью нейронов.[1] Результат является демонстрацией механизма в игрушечной постановке, а не доказательством того, что вся полисемантичность больших моделей имеет единственную причину.

Суперпозиция затрудняет анализ по координатам: изменение одного нейрона может одновременно затронуть несколько признаков. Поэтому исследователи пытаются восстановить более широкий словарь разреженно активирующихся направлений.

Словарное обучение и разреженные автоэнкодеры

Постановка задачи

Словарное обучение ищет набор направлений, с помощью которых наблюдаемые активации можно приближённо представить разреженной линейной комбинацией. Один из методов — разреженный автоэнкодер (sparse autoencoder, SAE).

Для активации x\in\mathbb{R}^{d} кодировщик строит более широкое представление z\in\mathbb{R}^{p}, обычно при p>d:

z=\operatorname{ReLU}(W_{\mathrm{enc}}x+b_{\mathrm{enc}}),

а декодировщик восстанавливает активацию:

\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.

Типичная функция потерь сочетает среднеквадратичную ошибку и штраф за плотный код:

\mathcal{L}=\mathbb{E}_{x}\left[\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1\right].

Столбцы W_{\mathrm{dec}} интерпретируют как направления словаря, а координаты z — как активации извлечённых признаков. Чтобы исключить тривиальное уменьшение штрафа L_1 через уменьшение z и компенсирующее увеличение весов декодера, нормы его столбцов ограничивают или нормируют.

Интерпретация признаков

Признак SAE обычно исследуют по примерам с наибольшей активацией, распределению активаций, связанным токенам и влиянию вмешательства в его коэффициент. В Towards Monosemanticity словарное обучение применено к активациям небольшой однослайной языковой модели; многие полученные признаки оказались интерпретируемее отдельных нейронов, а разложение использовалось для анализа простых взаимодействий.[1]

В Scaling Monosemanticity SAE обучались на активациях среднего слоя Claude 3 Sonnet; словари включали до 34 миллионов признаков. Были описаны признаки, связанные с именованными сущностями, языками, кодом, изображениями и более абстрактными темами, а изменение некоторых признаков влияло на генерацию в направлении, согласующемся с их описанием.[1]

Эти результаты показывают масштабируемость процедуры извлечения большого числа интерпретируемых направлений, но не полную декомпозицию модели. Авторы прямо отмечают неполноту словаря и отсутствие строгой общей меры того, насколько признаки верно отражают вычисления модели.

Ошибки реконструкции и артефакты

SAE является отдельной обученной моделью. Его признаки зависят от данных, ширины словаря, коэффициента разреженности, оптимизации и точки модели, с которой собраны активации. Возможны:

  • потери реконструкции: часть информации исходной активации не проходит через словарь;
  • мёртвые признаки, почти никогда не активирующиеся на данных;
  • расщепление признака, когда одна закономерность представлена несколькими элементами словаря;
  • слияние признаков, когда один элемент объединяет несколько закономерностей;
  • неоднозначность словаря: разные запуски могут давать разные, но сходно реконструирующие разложения;
  • артефакты распределения данных: редкие или отсутствующие контексты не получают надёжного представления.

Низкая ошибка реконструкции не гарантирует интерпретируемость, а понятная подпись признака не гарантирует функциональную значимость. Поэтому оценивают одновременно реконструкцию, разреженность, устойчивость, качество человеческой или автоматической интерпретации и причинный эффект вмешательств. Также полезно сравнивать поведение исходной модели с поведением при замене её активаций реконструкциями SAE.

Ограничения доказательств

Механистическая интерпретируемость пока не является полным методом аудита произвольной большой модели. Основные ограничения включают:

  • субъективность описаний: человек может выбрать слишком широкую или удобную подпись для набора активирующих примеров;
  • неполноту покрытия: понятные признаки и цепочки могут объяснять лишь часть поведения;
  • зависимость от контрфакта: результат patching меняется с выбором чистого и искажённого входов;
  • чувствительность к абляции: нулевая, средняя и выборочная замены могут приводить к разным выводам;
  • комбинаторный масштаб: число возможных компонентов, признаков, путей и их взаимодействий быстро растёт;
  • распределённость и избыточность: отсутствие эффекта отдельной абляции не исключает участия компонента;
  • ограниченный перенос: механизм, найденный на одном шаблоне или небольшой модели, может не сохраняться на другом распределении или масштабе;
  • артефакты вспомогательных моделей: зонды, методы атрибуции и SAE способны вносить собственное смещение;
  • двойное использование данных: подбор и проверка гипотез на одних примерах увеличивает риск переобучения исследователя.

Надёжная работа должна заранее определить поведение и метрику, использовать контрольные вмешательства и отложенные примеры, сообщать отрицательные результаты и проверять альтернативные объяснения. Причинная проверка усиливает свидетельство, но не превращает локальный эффект в полную теорию работы модели.

Связь с безопасностью искусственного интеллекта

Для безопасности ИИ механистическая интерпретируемость рассматривается как возможный инструмент внутреннего аудита. В принципе она может помочь обнаруживать представления и цепочки, связанные с обманом, нежелательными целями, уязвимыми эвристиками или обходом ограничений, даже когда внешние тесты не покрывают все условия.

Однако наличие интерпретируемого признака, коррелирующего с опасной темой, не означает обнаружения намерения или полного механизма поведения. И наоборот, отсутствие найденного признака не является доказательством безопасности: словарь или процедура поиска могут быть неполными. Манипулирование признаком также может вызывать побочные эффекты и не заменяет поведенческое тестирование, оценку устойчивости и другие методы обеспечения безопасности.

Эпистемологический статус объяснения

Механистический подход трактует нейросеть как объект экспериментального исследования. Объяснение здесь представляет собой не только понятный рассказ, но и модель внутреннего вычисления, из которой следуют проверяемые предсказания о результатах вмешательств.

Полезно различать несколько уровней утверждений: информация декодируется из активации; модель использует её для данного ответа; конкретный компонент реализует вычислительную операцию; предложенная цепочка достаточно полно объясняет поведение. Каждый следующий уровень требует более сильных экспериментов. Это различие предотвращает переход от яркой визуализации или понятной подписи признака к необоснованному заявлению о полном понимании модели.

См. также

Примечания


Литература

  • Olah C., Cammarata N., Schubert L., Goh G., Petrov M., Carter S. Zoom In: An Introduction to Circuits // Distill. — 2020.
  • Elhage N., Nanda N., Olsson C. и др. A Mathematical Framework for Transformer Circuits // Transformer Circuits Thread. — 2021.
  • Elhage N., Hume T., Olsson C., Schiefer N. и др. Toy Models of Superposition // Transformer Circuits Thread. — 2022.
  • Meng K., Bau D., Andonian A., Belinkov Y. Locating and Editing Factual Associations in GPT // Advances in Neural Information Processing Systems. — 2022. — Т. 35. — С. 17359–17372.
  • Wang K., Variengien A., Conmy A., Shlegeris B., Steinhardt J. Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small // International Conference on Learning Representations. — 2023.
  • Bricken T., Templeton A., Batson J., Chen B., Jermyn A. и др. Towards Monosemanticity: Decomposing Language Models With Dictionary Learning // Transformer Circuits Thread. — 2023.
  • Heimersheim S., Nanda N. How to use and interpret activation patching. — 2024.
  • Geiger A., Ibeling D., Zur A. и др. Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability // Journal of Machine Learning Research. — 2025. — Т. 26. — № 83. — С. 1–64.
  • Templeton A., Conerly T., Marcus J., Lindsey J., Bricken T. и др. Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet // Transformer Circuits Thread. — 2024.
Личные инструменты