Механистическая интерпретируемость

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
(Новая: {{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником ~~~~. Промпт приводится по...)
 
(2 промежуточные версии не показаны)
Строка 1: Строка 1:
-
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 18:17, 11 июля 2026 (MSD).
+
{{well|Статья написана с использованием LLM '''GPT-5.6 Terra High''' и проверена участником [[Участник:Oleg Batsiev|Oleg Batsiev]] 17:07, 19 июля 2026 (MSD).
-
Промпт приводится полностью в [[Обсуждение:Механистическая интерпретируемость]].
+
Промпты и описание редакторской проверки приведены в [[Обсуждение:Механистическая интерпретируемость]].
}}
}}
{{TOCright}}
{{TOCright}}
-
'''Механистическая интерпретируемость''' (англ. ''mechanistic interpretability'') — направление [[интерпретируемость моделей машинного обучения|интерпретируемости моделей машинного обучения]], стремящееся объяснить поведение [[нейронная сеть|нейронной сети]] через её внутренние вычислительные механизмы: признаки, нейроны, головы внимания, связи и вычислительные цепочки (circuits).
+
'''Механистическая интерпретируемость''' (англ. ''mechanistic interpretability'') — направление исследований [[нейронная сеть|нейронных сетей]], в котором их поведение объясняют через внутренние вычисления: представления признаков, операции отдельных компонентов и их причинные взаимодействия. В наиболее сильной формулировке задача состоит в том, чтобы построить понятное человеку описание алгоритма, реализованного параметрами сети, и проверить это описание вмешательствами в работу модели.<ref name="olah">{{статья |автор=Olah C., Cammarata N., Schubert L., Goh G., Petrov M., Carter S. |заглавие=Zoom In: An Introduction to Circuits |издание=Distill |год=2020 |ссылка статьи=https://distill.pub/2020/circuits/zoom-in/}}</ref><ref name="causal">{{статья |автор=Geiger A., Ibeling D., Zur A. и др. |заглавие=Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability |издание=Journal of Machine Learning Research |год=2025 |том=26 |номер=83 |страницы=1–64 |ссылка статьи=https://www.jmlr.org/papers/v26/23-0058.html}}</ref>
-
В отличие от методов, которые объясняют отдельное предсказание внешними признаками, механистическая интерпретируемость ставит более сильный вопрос: какие внутренние части модели реализуют конкретную функцию и как именно изменение этих частей причинно влияет на ответ модели.
+
Механистическая интерпретируемость не ограничивается визуализацией внимания или поиском активаций, коррелирующих с понятием. Такие наблюдения помогают выдвинуть гипотезу, но для её проверки исследуют, как контролируемое изменение внутренней переменной влияет на последующие вычисления и выход модели. Даже причинное вмешательство само по себе не даёт полного объяснения: результат зависит от выбранного контрфактического примера, способа замены активации и полноты предполагаемой вычислительной цепочки.
-
== Мотивация ==
+
== Предмет и мотивация ==
-
Современные нейронные сети могут демонстрировать высокое качество, но их внутреннее устройство часто трудно объяснить. Наблюдать веса или активации недостаточно: отдельный нейрон, голова внимания или слой редко имеют один очевидный смысл, а одно и то же поведение может зависеть от множества взаимосвязанных компонентов.
+
Современные нейросети обучаются как целостные системы, поэтому назначение отдельных внутренних компонентов обычно не задаётся заранее. Одинаковое внешнее поведение может быть реализовано разными механизмами, а один компонент может участвовать в нескольких функциях. Анализ только входов и выходов показывает, ''что'' делает модель, но не обязательно объясняет, ''как'' она это делает.
-
Например, языковая модель может правильно согласовывать число сказуемого с подлежащим. Обычное тестирование покажет, что модель справляется с задачей. Механистическая интерпретируемость пытается установить, какие именно внутренние компоненты находят подлежащее, передают информацию о числе и используют её при выборе следующего токена.
+
Например, языковая модель может правильно выбирать косвенное дополнение или согласовывать сказуемое с подлежащим. Поведенческий тест измеряет долю правильных ответов. Механистическое исследование дополнительно пытается установить, где представлена информация об именах или грамматическом числе, какие компоненты переносят её между позициями и каким путём она изменяет логиты следующего токена.
-
Главная цель направления — перейти от утверждения «модель ведёт себя так-то» к объяснению вида «эта вычислительная цепочка реализует данную функцию, что подтверждается вмешательствами в её активации».
+
К практическим целям направления относятся:
-
== Отличие от других подходов к интерпретируемости ==
+
* проверка гипотез о внутренних алгоритмах модели;
 +
* поиск причин нежелательного поведения и систематических ошибок;
 +
* обнаружение распределённых представлений, не совпадающих с отдельными нейронами;
 +
* сравнение механизмов между входами, задачами, стадиями обучения и моделями;
 +
* разработка методов аудита и управляемого вмешательства.
-
[[Объяснимый искусственный интеллект|Объяснимый искусственный интеллект]] включает широкий набор методов. Некоторые из них строят объяснение после обучения модели: например, оценивают важность входных признаков или приближают сложную модель более простой локальной моделью.
+
== Отличие от постфактум-объяснений ==
-
Механистическая интерпретируемость отличается тем, что исследует саму вычислительную структуру нейросети. Её интересуют:
+
Методы объяснения предсказаний часто оценивают важность входных признаков, строят локальную аппроксимацию модели или создают понятное описание конкретного ответа. Такое объяснение может быть полезным, даже если оно не воспроизводит внутреннее вычисление исходной сети.
-
* представления, возникающие внутри модели;
+
Механистическая интерпретируемость, напротив, стремится связать объяснение с реальными переменными и операциями модели. Объектами анализа могут быть нейроны, направления в пространстве активаций, головы внимания, блоки MLP, остаточный поток трансформера и связи между ними. Различие относится прежде всего к цели и типу доказательства: постфактум-метод может объяснять зависимость выхода от входа, тогда как механистическое исследование пытается восстановить внутренний процесс.
-
* роль отдельных нейронов, признаков и голов внимания;
+
-
* взаимодействие компонентов;
+
-
* причинное влияние внутренних активаций на итоговый ответ;
+
-
* воспроизводимые вычислительные алгоритмы, реализованные сетью.
+
-
Поэтому визуализация внимания или поиск корреляции между нейроном и словом ещё не являются механистическим объяснением. Требуется проверить, что предполагаемый компонент действительно необходим или достаточен для наблюдаемого поведения.
+
Граница между направлениями не абсолютна. Зонды, визуализации и методы атрибуции могут использоваться как разведочные инструменты, а найденная ими закономерность — затем проверяться причинным экспериментом.
-
== Основные единицы анализа ==
+
== Уровни описания ==
-
=== Нейроны и активации ===
+
=== Нейроны и координаты ===
-
Нейрон — отдельная координата внутреннего представления сети. В простых моделях иногда удаётся найти нейроны, чувствительные к определённому признаку: например, к наличию скобки, языка программирования или грамматической конструкции.
+
Нейрон в слое задаёт одну координату активационного вектора. В некоторых случаях эта координата устойчиво реагирует на узнаваемый класс входов. Однако сильная активация на примерах одного типа не означает, что нейрон кодирует только этот тип или причинно отвечает за соответствующее поведение.
-
Однако нейрон не обязательно соответствует одному понятию. Он может быть '''полисемантичным''' (polysemantic), то есть активироваться на нескольких слабо связанных паттернах. Это делает интерпретацию на уровне отдельных нейронов ненадёжной.
+
Нейрон называют '''полисемантичным''' (''polysemantic''), если он участвует в представлении нескольких содержательно различных признаков. Полисемантичность может возникать, в частности, когда признаки представлены направлениями, не совпадающими с координатными осями слоя.
-
=== Признаки ===
+
=== Признаки и представления ===
-
Под признаком (feature) обычно понимают направление в пространстве активаций, связанное с относительно цельным и интерпретируемым паттерном. Признак не обязан совпадать с одним нейроном: он может быть линейной комбинацией нескольких нейронов.
+
В литературе нет единственного операционального определения '''признака''' (''feature''). Часто под ним понимают направление или функцию от активаций, соответствующую некоторой устойчивой для модели закономерности. Один признак может быть распределён по многим координатам, а одна координата — участвовать во многих признаках.
-
Идея '''моносемантичности''' (monosemanticity) состоит в том, что отдельный признак желательно связывать с одним понятным человеку содержанием. Это не означает, что он абсолютно не реагирует ни на что другое; речь идёт о более чистом и устойчивом соответствии между внутренним направлением и наблюдаемым паттерном.
+
Смысл направления зависит от выбранного базиса. После обратимого преобразования пространства активаций вычисляемая моделью функция может сохраниться, тогда как интерпретация отдельных координат изменится. Поэтому утверждение «этот нейрон означает X» сильнее, чем наблюдение «эта линейная комбинация позволяет предсказывать X», и требует отдельного обоснования.
-
=== Цепочки вычислений ===
+
'''Моносемантичным''' называют признак, которому удаётся приписать относительно единое и устойчивое описание. Это практическая характеристика интерпретируемости, а не гарантия однозначной семантики во всех возможных контекстах.
-
'''Цепочка''' (circuit) — набор внутренних компонентов и связей, совместно реализующих определённую вычислительную функцию. Для [[трансформер (модель)|трансформеров]] такими компонентами могут быть головы механизма внимания, слои MLP, остаточный поток (residual stream) и их взаимодействия.
+
=== Компоненты трансформера ===
-
Важна не просто активность компонента, а его роль в вычислении. Один компонент может извлекать информацию, второй — передавать её в другую позицию контекста, а третий — преобразовывать её в изменение вероятности следующего токена.
+
В [[трансформер (модель)|трансформере]] часто анализируют:
-
== Исследовательский цикл ==
+
* головы [[механизм внимания|механизма внимания]] и их матрицы запросов, ключей, значений и выхода;
 +
* блоки MLP и их скрытые активации;
 +
* остаточный поток (''residual stream''), через который компоненты читают и записывают информацию;
 +
* логиты токенов и направления, связанные с выходной матрицей модели;
 +
* композиции компонентов между слоями и позициями последовательности.
-
Механистическая интерпретируемость обычно строится как последовательность гипотез и проверок.
+
Рисунок внимания показывает, откуда голова считывает информацию, но не полностью определяет, ''какую'' информацию она переносит и как та используется дальше. Для этого также исследуют преобразования значений и выходов, последующие компоненты и эффект вмешательств.
-
# Выбрать измеримое поведение модели: например, правильное продолжение фразы, распознавание шаблона или выполнение арифметической операции.
+
=== Вычислительные цепочки ===
-
# Найти компоненты, статистически связанные с этим поведением.
+
-
# Сформулировать гипотезу о механизме: что именно вычисляет каждый компонент.
+
-
# Провести причинное вмешательство во внутренние активации.
+
-
# Проверить, изменился ли результат именно так, как предсказывает гипотеза.
+
-
# Повторить проверку на новых примерах и альтернативных формулировках задачи.
+
-
Такой подход ближе к экспериментальному исследованию, чем к простой визуализации весов.
+
'''Вычислительная цепочка''' (''circuit'') — подграф вычислений сети, предложенный как механизм определённого поведения. Его узлами могут быть компоненты или признаки, а рёбрами — их функциональные взаимодействия.<ref name="olah" /> Известный пример — цепочка идентификации косвенного дополнения в GPT-2 small, найденная с использованием причинных вмешательств и описанная через группы голов внимания.<ref name="ioi">{{статья |автор=Wang K., Variengien A., Conmy A., Shlegeris B., Steinhardt J. |заглавие=Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small |издание=International Conference on Learning Representations |год=2023 |ссылка статьи=https://openreview.net/forum?id=NpsVSN6o4ul}}</ref>
-
== Причинные вмешательства ==
+
Качество описания цепочки можно оценивать по нескольким вопросам: насколько верно оставленная цепочка воспроизводит исследуемое поведение полной модели (''faithfulness''), учтены ли важные внешние компоненты (полнота) и действительно ли каждый включённый компонент необходим для заявленного объяснения (минимальность). Эти свойства зависят от набора входов, метрики и способа абляции.
-
Один из базовых методов — абляция (ablation): исследователь зануляет, заменяет или иным образом изменяет активацию выбранного компонента и измеряет изменение результата.
+
== Наблюдение и причинная проверка ==
-
Пусть <tex>s(M(x))</tex> — числовая оценка интересующего поведения модели <tex>M</tex> на входе <tex>x</tex>. Например, это может быть логит правильного токена. Если внутреннюю активацию <tex>h</tex> заменить значением <tex>h'</tex>, причинный эффект вмешательства можно измерять как:
+
=== Наблюдательные методы ===
-
::<tex>\Delta=s(M(x);h\leftarrow h')-s(M(x)).</tex>
+
К наблюдательным методам относятся просмотр наиболее активирующих примеров, визуализация паттернов внимания, линейные зонды и корреляция активаций с метками. Они отвечают на вопросы вида «где доступна информация?» или «какие переменные совместно изменяются?».
-
Если изменение конкретной головы внимания систематически уменьшает вероятность правильного ответа, это является более сильным свидетельством её роли, чем простая корреляция между её активацией и ответом.
+
Высокая точность зонда не доказывает, что исходная модель использует найденную информацию: зонд может извлекать её из направления, которое не участвует в вычислении ответа. Аналогично компонент может коррелировать с поведением из-за общего предшествующего вычисления, не являясь причиной результата.
-
Другой распространённый приём — '''activation patching'''. Активацию из корректного или «чистого» прогона модели переносят в соответствующее место другого, специально испорченного прогона. Если это восстанавливает нужное поведение, возникает свидетельство, что соответствующая часть вычисления проходит через данный компонент.
+
=== Абляция ===
-
== Суперпозиция и полисемантичность ==
+
При '''абляции''' активацию компонента удаляют или заменяют базовым значением и измеряют изменение выбранной метрики. Пусть <tex>m(M(x))</tex> — метрика поведения модели <tex>M</tex> на входе <tex>x</tex>, выбранная так, что большее значение означает более сильное проявление исследуемого поведения, а <tex>h_c(x)</tex> — активация компонента <tex>c</tex>. Для значения замены <tex>b</tex> эффект можно записать как
-
Нейросети могут представлять больше признаков, чем позволяет число доступных координат. Такое сжатое представление называют '''суперпозицией''' (superposition). Несколько признаков используют перекрывающиеся направления в пространстве активаций, а нелинейности помогают модели различать их в типичных контекстах.
+
::<tex>\Delta_c(x;b)=m\bigl(M(x;h_c\leftarrow b)\bigr)-m(M(x)).</tex>
-
Суперпозиция полезна для эффективного использования ограниченной размерности, но усложняет интерпретацию. Один нейрон может участвовать в нескольких несвязанных функциях, а отдельный признак может быть распределён по многим нейронам.
+
В качестве <tex>b</tex> используют ноль, среднюю активацию, случайное значение из другого примера или значение, подобранное под конкретный контроль. Выбор существенен: зануление может создать нетипичное для модели состояние, а замена средним — скрыть контекстную зависимость.
-
Работа ''Toy Models of Superposition'' показала на упрощённых моделях, как разреженные признаки могут размещаться в суперпозиции и почему это создаёт полисемантичность нейронов.<ref name="superposition">{{статья |автор=Elhage N. и др. |заглавие=Toy Models of Superposition |год=2022 |ссылка=https://arxiv.org/abs/2209.10652}}</ref>
+
Сильное падение метрики показывает причинную значимость компонента при данном вмешательстве, но не обязательно подтверждает его предполагаемую семантику. Компонент может передавать несколько видов информации; возможны резервные пути и нелинейные побочные эффекты. Отсутствие эффекта также не доказывает незначимость из-за избыточности вычислений.
-
== Разреженные автоэнкодеры ==
+
=== Activation patching ===
-
Один из современных методов выделения признаков — разреженный автоэнкодер (sparse autoencoder, SAE). Он получает вектор активаций <tex>x</tex>, кодирует его в более широкое, но разреженное скрытое представление <tex>z</tex>, а затем восстанавливает исходные активации:
+
В '''activation patching''' сравнивают два согласованных прогона. В «чистом» прогоне вход <tex>x_{\mathrm{clean}}</tex> вызывает требуемое поведение, а в «искажённом» прогоне <tex>x_{\mathrm{corr}}</tex> оно ухудшается. Затем активацию выбранного узла из чистого прогона подставляют в искажённый.
-
::<tex>z=\operatorname{ReLU}(W_{\mathrm{enc}}(x-b)+b_{\mathrm{enc}}),</tex>
+
Пусть <tex>h_c^{\mathrm{clean}}</tex> — чистая активация компонента, а <tex>m_{\mathrm{corr}}=m(M(x_{\mathrm{corr}}))</tex>. Эффект восстановления равен
 +
 
 +
::<tex>\Delta_c^{\mathrm{patch}}=m\bigl(M(x_{\mathrm{corr}};h_c\leftarrow h_c^{\mathrm{clean}})\bigr)-m_{\mathrm{corr}}.</tex>
 +
 
 +
Положительный эффект означает, что различие, проходящее через выбранный узел, причинно способствует различию выходов в этой паре прогонов. Он не доказывает, что узел самостоятельно вычисляет соответствующую величину: активация может лишь переносить информацию, а патч одновременно менять несколько скрытых факторов. Поэтому чистый и искажённый входы стараются различать контролируемо, а результат проверяют на множестве пар и контрольных заменах.<ref name="rome">{{статья |автор=Meng K., Bau D., Andonian A., Belinkov Y. |заглавие=Locating and Editing Factual Associations in GPT |издание=Advances in Neural Information Processing Systems |год=2022 |том=35 |страницы=17359–17372 |ссылка статьи=https://proceedings.neurips.cc/paper_files/paper/2022/hash/6f1d43d5a82a37e89b0665b33bf3a182-Abstract-Conference.html}}</ref>
 +
 
 +
Описанная схема переносит чистую активацию в искажённый прогон и проверяет восстановление поведения (''denoising''). Возможен обратный эксперимент: искажённую активацию переносят в чистый прогон и измеряют разрушение поведения (''noising''). Эти тесты отвечают на разные вопросы и не обязаны давать симметричные результаты.<ref name="patching">{{статья |автор=Heimersheim S., Nanda N. |заглавие=How to use and interpret activation patching |год=2024 |ссылка статьи=https://arxiv.org/abs/2404.15255}}</ref>
 +
 
 +
'''Path patching''' ограничивает замену выбранным путём между компонентами, чтобы отделить прямой эффект от других последствий вмешательства.<ref name="ioi" /> Градиентные методы атрибуции могут приближать массовый перебор патчей, но такие приближения способны пропускать нелинейные эффекты.<ref name="attribution">{{статья |автор=Syed A., Rager C., Conmy A. |заглавие=Attribution Patching Outperforms Automated Circuit Discovery |год=2023 |ссылка статьи=https://arxiv.org/abs/2310.10348}}</ref>
 +
 
 +
== Исследовательский цикл ==
 +
 
 +
Практическое исследование обычно включает следующие этапы:
 +
 
 +
# Задать узкое измеримое поведение и набор контрастных примеров.
 +
# Выбрать метрику, например разность логитов правильного и альтернативного токенов.
 +
# С помощью наблюдений или атрибуции локализовать кандидатов.
 +
# Сформулировать конкретную гипотезу о представлении, передаваемой информации и последовательности операций.
 +
# Проверить предсказания гипотезы абляцией, patching или более локальным вмешательством.
 +
# Оценить верность воспроизведения поведения полной модели, полноту и минимальность предложенной цепочки.
 +
# Повторить эксперименты на новых шаблонах, распределениях данных и случайных начальных условиях анализа.
 +
 
 +
Механистическое объяснение тем сильнее, чем больше независимых следствий гипотезы оно заранее предсказывает. Простого сохранения производительности после удаления «неважных» компонентов недостаточно, если способ удаления сам создаёт компенсирующие или внераспределительные эффекты.
 +
 
 +
== Суперпозиция ==
 +
 
 +
Пусть слой имеет размерность <tex>d</tex>, а для задачи полезны <tex>n</tex> признаков с коэффициентами <tex>f_i</tex> и направлениями <tex>v_i\in\mathbb{R}^d</tex>. Представление можно схематично записать как
 +
 
 +
::<tex>x\approx\sum_{i=1}^{n}f_i v_i.</tex>
 +
 
 +
Если <tex>n&gt;d</tex>, направления не могут быть линейно независимыми. Тем не менее при разреженной совместной активации признаков модель может хранить их в неортогональном коде и допускать ограниченную интерференцию. Такое размещение называют '''суперпозицией''' (''superposition''). Это не утверждение, что конечномерное пространство содержит лишь <tex>d</tex> возможных направлений; речь идёт о представлении более чем <tex>d</tex> независимо полезных признаков перекрывающимся набором направлений.
 +
 
 +
В ''Toy Models of Superposition'' этот механизм исследован в контролируемых моделях с заранее известными разреженными признаками. Авторы показали режимы, в которых модель предпочитает неортогональное размещение признаков, и связали его с полисемантичностью нейронов.<ref name="superposition">{{статья |автор=Elhage N., Hume T., Olsson C., Schiefer N. и др. |заглавие=Toy Models of Superposition |издание=Transformer Circuits Thread |год=2022 |ссылка статьи=https://transformer-circuits.pub/2022/toy_model/index.html}}</ref> Результат является демонстрацией механизма в игрушечной постановке, а не доказательством того, что вся полисемантичность больших моделей имеет единственную причину.
 +
 
 +
Суперпозиция затрудняет анализ по координатам: изменение одного нейрона может одновременно затронуть несколько признаков. Поэтому исследователи пытаются восстановить более широкий словарь разреженно активирующихся направлений.
 +
 
 +
== Словарное обучение и разреженные автоэнкодеры ==
 +
 
 +
=== Постановка задачи ===
 +
 
 +
'''Словарное обучение''' ищет набор направлений, с помощью которых наблюдаемые активации можно приближённо представить разреженной линейной комбинацией. Один из методов — [[автокодировщик|разреженный автоэнкодер]] (''sparse autoencoder'', SAE).
 +
 
 +
Для активации <tex>x\in\mathbb{R}^{d}</tex> кодировщик строит более широкое представление <tex>z\in\mathbb{R}^{p}</tex>, обычно при <tex>p&gt;d</tex>:
 +
 
 +
::<tex>z=\operatorname{ReLU}(W_{\mathrm{enc}}x+b_{\mathrm{enc}}),</tex>
 +
 
 +
а декодировщик восстанавливает активацию:
::<tex>\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.</tex>
::<tex>\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.</tex>
-
При обучении одновременно минимизируют ошибку реконструкции и поощряют разреженность скрытого вектора:
+
Типичная функция потерь сочетает среднеквадратичную ошибку и штраф за плотный код:
 +
 
 +
::<tex>\mathcal{L}=\mathbb{E}_{x}\left[\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1\right].</tex>
-
::<tex>\mathcal{L}=\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1.</tex>
+
Столбцы <tex>W_{\mathrm{dec}}</tex> интерпретируют как направления словаря, а координаты <tex>z</tex> — как активации извлечённых признаков. Чтобы исключить тривиальное уменьшение штрафа <tex>L_1</tex> через уменьшение <tex>z</tex> и компенсирующее увеличение весов декодера, нормы его столбцов ограничивают или нормируют.
-
Разреженность означает, что на конкретном входе активна лишь небольшая доля признаков. Это помогает выделять направления, которые легче связать с конкретными понятиями, фрагментами кода, языковыми конструкциями или тематическими паттернами.
+
=== Интерпретация признаков ===
-
Работа ''Towards Monosemanticity'' продемонстрировала применение словарного обучения и разреженных автоэнкодеров к небольшим трансформерам, где многие интерпретируемые признаки не видны при анализе отдельных нейронов.<ref name="mono">{{статья |автор=Bricken T. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |год=2023 |ссылка=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}</ref>
+
Признак SAE обычно исследуют по примерам с наибольшей активацией, распределению активаций, связанным токенам и влиянию вмешательства в его коэффициент. В ''Towards Monosemanticity'' словарное обучение применено к активациям небольшой однослайной языковой модели; многие полученные признаки оказались интерпретируемее отдельных нейронов, а разложение использовалось для анализа простых взаимодействий.<ref name="mono">{{статья |автор=Bricken T., Templeton A., Batson J., Chen B., Jermyn A. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |издание=Transformer Circuits Thread |год=2023 |ссылка статьи=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}</ref>
-
== Масштабирование метода ==
+
В ''Scaling Monosemanticity'' SAE обучались на активациях среднего слоя Claude 3 Sonnet; словари включали до 34 миллионов признаков. Были описаны признаки, связанные с именованными сущностями, языками, кодом, изображениями и более абстрактными темами, а изменение некоторых признаков влияло на генерацию в направлении, согласующемся с их описанием.<ref name="scaling">{{статья |автор=Templeton A., Conerly T., Marcus J., Lindsey J., Bricken T. и др. |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |издание=Transformer Circuits Thread |год=2024 |ссылка статьи=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}</ref>
-
Методы словарного обучения были первоначально удобнее применять к небольшим моделям. Однако дальнейшие работы показали, что разреженные автоэнкодеры могут извлекать интерпретируемые признаки и в существенно более крупных языковых моделях.
+
Эти результаты показывают масштабируемость процедуры извлечения большого числа интерпретируемых направлений, но не полную декомпозицию модели. Авторы прямо отмечают неполноту словаря и отсутствие строгой общей меры того, насколько признаки верно отражают вычисления модели.
-
В работе ''Scaling Monosemanticity'' исследователи применили этот подход к Claude 3 Sonnet и описали признаки, связанные с понятиями, языками, кодом и мультимодальными паттернами.<ref name="scaling">{{статья |автор=Anthropic |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |год=2024 |ссылка=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}</ref>
+
=== Ошибки реконструкции и артефакты ===
-
Масштабирование не означает, что модель стала полностью понятной. Даже если удаётся выделить большое число отдельных признаков, остаются вопросы об их взаимодействиях, полноте покрытия модели и интерпретации длинных цепочек вычислений.
+
SAE является отдельной обученной моделью. Его признаки зависят от данных, ширины словаря, коэффициента разреженности, оптимизации и точки модели, с которой собраны активации. Возможны:
-
== Практические задачи ==
+
* '''потери реконструкции''': часть информации исходной активации не проходит через словарь;
 +
* '''мёртвые признаки''', почти никогда не активирующиеся на данных;
 +
* '''расщепление признака''', когда одна закономерность представлена несколькими элементами словаря;
 +
* '''слияние признаков''', когда один элемент объединяет несколько закономерностей;
 +
* '''неоднозначность словаря''': разные запуски могут давать разные, но сходно реконструирующие разложения;
 +
* '''артефакты распределения данных''': редкие или отсутствующие контексты не получают надёжного представления.
-
Механистическая интерпретируемость применяется или исследуется для следующих задач:
+
Низкая ошибка реконструкции не гарантирует интерпретируемость, а понятная подпись признака не гарантирует функциональную значимость. Поэтому оценивают одновременно реконструкцию, разреженность, устойчивость, качество человеческой или автоматической интерпретации и причинный эффект вмешательств. Также полезно сравнивать поведение исходной модели с поведением при замене её активаций реконструкциями SAE.
-
* поиск внутренних механизмов конкретного поведения модели;
+
== Ограничения доказательств ==
-
* проверка гипотез о том, как модель использует контекст;
+
-
* диагностика ошибок, нежелательных эвристик и уязвимых паттернов;
+
-
* поиск признаков, связанных с безопасностью, отказами или определёнными типами содержания;
+
-
* разработка более точных способов вмешательства в поведение модели;
+
-
* проверка того, соответствует ли обученная модель ожидаемому алгоритму на контролируемой задаче.
+
-
Особенно важен принцип различения наблюдения и вмешательства. Обнаружить признак, который активируется при нежелательном содержании, ещё не означает доказать, что этот признак вызывает нежелательное поведение. Требуется проверять последствия управляемого изменения активации.
+
Механистическая интерпретируемость пока не является полным методом аудита произвольной большой модели. Основные ограничения включают:
-
== Ограничения ==
+
* '''субъективность описаний''': человек может выбрать слишком широкую или удобную подпись для набора активирующих примеров;
 +
* '''неполноту покрытия''': понятные признаки и цепочки могут объяснять лишь часть поведения;
 +
* '''зависимость от контрфакта''': результат patching меняется с выбором чистого и искажённого входов;
 +
* '''чувствительность к абляции''': нулевая, средняя и выборочная замены могут приводить к разным выводам;
 +
* '''комбинаторный масштаб''': число возможных компонентов, признаков, путей и их взаимодействий быстро растёт;
 +
* '''распределённость и избыточность''': отсутствие эффекта отдельной абляции не исключает участия компонента;
 +
* '''ограниченный перенос''': механизм, найденный на одном шаблоне или небольшой модели, может не сохраняться на другом распределении или масштабе;
 +
* '''артефакты вспомогательных моделей''': зонды, методы атрибуции и SAE способны вносить собственное смещение;
 +
* '''двойное использование данных''': подбор и проверка гипотез на одних примерах увеличивает риск переобучения исследователя.
-
Механистическая интерпретируемость пока не даёт полного метода аудита произвольной большой модели. Основные ограничения таковы:
+
Надёжная работа должна заранее определить поведение и метрику, использовать контрольные вмешательства и отложенные примеры, сообщать отрицательные результаты и проверять альтернативные объяснения. Причинная проверка усиливает свидетельство, но не превращает локальный эффект в полную теорию работы модели.
-
* найденная интерпретация может быть субъективной или неполной;
+
== Связь с безопасностью искусственного интеллекта ==
-
* один и тот же признак может работать по-разному в разных контекстах;
+
-
* разреженный автоэнкодер сам является моделью и может вносить артефакты;
+
-
* реконструкция активаций не гарантирует, что найдены все функционально важные признаки;
+
-
* число потенциальных признаков и цепочек в большой модели огромно;
+
-
* результаты на небольшой модели не всегда переносятся на более крупную;
+
-
* вмешательство в один компонент может нарушать другие связанные функции.
+
-
Поэтому обнаруженный механизм следует рассматривать как проверяемую научную гипотезу. Нужны независимые эксперименты, контрольные примеры и оценка того, какую долю поведения модели действительно объясняет найденная цепочка.
+
Для безопасности ИИ механистическая интерпретируемость рассматривается как возможный инструмент внутреннего аудита. В принципе она может помочь обнаруживать представления и цепочки, связанные с обманом, нежелательными целями, уязвимыми эвристиками или обходом ограничений, даже когда внешние тесты не покрывают все условия.
-
== Связь с безопасностью и философией ИИ ==
+
Однако наличие интерпретируемого признака, коррелирующего с опасной темой, не означает обнаружения намерения или полного механизма поведения. И наоборот, отсутствие найденного признака не является доказательством безопасности: словарь или процедура поиска могут быть неполными. Манипулирование признаком также может вызывать побочные эффекты и не заменяет поведенческое тестирование, оценку устойчивости и другие методы обеспечения безопасности.
-
Для [[безопасность искусственного интеллекта|безопасности искусственного интеллекта]] механистическая интерпретируемость интересна как возможный путь к более глубокому аудиту моделей. Если разработчик понимает, какие внутренние механизмы приводят к опасному или нежелательному поведению, он может попытаться обнаружить его раньше, проверить гипотезу и оценить последствия вмешательства.
+
== Эпистемологический статус объяснения ==
-
Однако интерпретируемость не равна безопасности. Найти часть механизма не означает получить полный контроль над поведением модели, а возможность изменить одну активацию не доказывает, что подобное вмешательство безопасно во всех контекстах.
+
Механистический подход трактует нейросеть как объект экспериментального исследования. Объяснение здесь представляет собой не только понятный рассказ, но и модель внутреннего вычисления, из которой следуют проверяемые предсказания о результатах вмешательств.
-
С философской точки зрения направление возвращает вопрос о том, что считать объяснением интеллектуальной системы. Предсказать ответ модели недостаточно; механистическое объяснение требует показать внутреннюю организацию вычисления и причинную роль её частей.
+
Полезно различать несколько уровней утверждений: информация ''декодируется'' из активации; модель ''использует'' её для данного ответа; конкретный компонент ''реализует'' вычислительную операцию; предложенная цепочка ''достаточно полно'' объясняет поведение. Каждый следующий уровень требует более сильных экспериментов. Это различие предотвращает переход от яркой визуализации или понятной подписи признака к необоснованному заявлению о полном понимании модели.
== См. также ==
== См. также ==
-
* [[Объяснимый искусственный интеллект]]
 
* [[Нейронная сеть]]
* [[Нейронная сеть]]
 +
* [[Глубокое обучение]]
* [[Трансформер (модель)]]
* [[Трансформер (модель)]]
* [[Механизм внимания]]
* [[Механизм внимания]]
-
* [[Большая языковая модель]]
+
* [[Автокодировщик]]
-
* [[Атаки на модели машинного обучения]]
+
-
* [[Безопасность искусственного интеллекта]]
+
== Примечания ==
== Примечания ==
-
{{примечания}}
+
<references />
== Литература ==
== Литература ==
-
* {{статья |автор=Olah C. и др. |заглавие=Zoom In: An Introduction to Circuits |издание=Distill |год=2020 |ссылка=https://distill.pub/2020/circuits/zoom-in/}}
+
* {{статья |автор=Olah C., Cammarata N., Schubert L., Goh G., Petrov M., Carter S. |заглавие=Zoom In: An Introduction to Circuits |издание=Distill |год=2020 |ссылка статьи=https://distill.pub/2020/circuits/zoom-in/}}
-
* {{статья |автор=Elhage N. и др. |заглавие=Toy Models of Superposition |год=2022 |ссылка=https://arxiv.org/abs/2209.10652}}
+
* {{статья |автор=Elhage N., Nanda N., Olsson C. и др. |заглавие=A Mathematical Framework for Transformer Circuits |издание=Transformer Circuits Thread |год=2021 |ссылка статьи=https://transformer-circuits.pub/2021/framework/index.html}}
-
* {{статья |автор=Bricken T. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |год=2023 |ссылка=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}
+
* {{статья |автор=Elhage N., Hume T., Olsson C., Schiefer N. и др. |заглавие=Toy Models of Superposition |издание=Transformer Circuits Thread |год=2022 |ссылка статьи=https://transformer-circuits.pub/2022/toy_model/index.html}}
-
* {{статья |автор=Anthropic |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |год=2024 |ссылка=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}
+
* {{статья |автор=Meng K., Bau D., Andonian A., Belinkov Y. |заглавие=Locating and Editing Factual Associations in GPT |издание=Advances in Neural Information Processing Systems |год=2022 |том=35 |страницы=17359–17372 |ссылка статьи=https://proceedings.neurips.cc/paper_files/paper/2022/hash/6f1d43d5a82a37e89b0665b33bf3a182-Abstract-Conference.html}}
 +
* {{статья |автор=Wang K., Variengien A., Conmy A., Shlegeris B., Steinhardt J. |заглавие=Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small |издание=International Conference on Learning Representations |год=2023 |ссылка статьи=https://openreview.net/forum?id=NpsVSN6o4ul}}
 +
* {{статья |автор=Bricken T., Templeton A., Batson J., Chen B., Jermyn A. и др. |заглавие=Towards Monosemanticity: Decomposing Language Models With Dictionary Learning |издание=Transformer Circuits Thread |год=2023 |ссылка статьи=https://transformer-circuits.pub/2023/monosemantic-features/index.html}}
 +
* {{статья |автор=Heimersheim S., Nanda N. |заглавие=How to use and interpret activation patching |год=2024 |ссылка статьи=https://arxiv.org/abs/2404.15255}}
 +
* {{статья |автор=Syed A., Rager C., Conmy A. |заглавие=Attribution Patching Outperforms Automated Circuit Discovery |год=2023 |ссылка статьи=https://arxiv.org/abs/2310.10348}}
 +
* {{статья |автор=Templeton A., Conerly T., Marcus J., Lindsey J., Bricken T. и др. |заглавие=Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet |издание=Transformer Circuits Thread |год=2024 |ссылка статьи=https://transformer-circuits.pub/2024/scaling-monosemanticity/index.html}}
 +
* {{статья |автор=Geiger A., Ibeling D., Zur A. и др. |заглавие=Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability |издание=Journal of Machine Learning Research |год=2025 |том=26 |номер=83 |страницы=1–64 |ссылка статьи=https://www.jmlr.org/papers/v26/23-0058.html}}
-
[[Категория:Искусственный интеллект]]
+
[[Категория:Машинное обучение]]
 +
[[Категория:Нейронные сети]]

Текущая версия

Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 17:07, 19 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Механистическая интерпретируемость.


Содержание

Механистическая интерпретируемость (англ. mechanistic interpretability) — направление исследований нейронных сетей, в котором их поведение объясняют через внутренние вычисления: представления признаков, операции отдельных компонентов и их причинные взаимодействия. В наиболее сильной формулировке задача состоит в том, чтобы построить понятное человеку описание алгоритма, реализованного параметрами сети, и проверить это описание вмешательствами в работу модели.[1][1]

Механистическая интерпретируемость не ограничивается визуализацией внимания или поиском активаций, коррелирующих с понятием. Такие наблюдения помогают выдвинуть гипотезу, но для её проверки исследуют, как контролируемое изменение внутренней переменной влияет на последующие вычисления и выход модели. Даже причинное вмешательство само по себе не даёт полного объяснения: результат зависит от выбранного контрфактического примера, способа замены активации и полноты предполагаемой вычислительной цепочки.

Предмет и мотивация

Современные нейросети обучаются как целостные системы, поэтому назначение отдельных внутренних компонентов обычно не задаётся заранее. Одинаковое внешнее поведение может быть реализовано разными механизмами, а один компонент может участвовать в нескольких функциях. Анализ только входов и выходов показывает, что делает модель, но не обязательно объясняет, как она это делает.

Например, языковая модель может правильно выбирать косвенное дополнение или согласовывать сказуемое с подлежащим. Поведенческий тест измеряет долю правильных ответов. Механистическое исследование дополнительно пытается установить, где представлена информация об именах или грамматическом числе, какие компоненты переносят её между позициями и каким путём она изменяет логиты следующего токена.

К практическим целям направления относятся:

  • проверка гипотез о внутренних алгоритмах модели;
  • поиск причин нежелательного поведения и систематических ошибок;
  • обнаружение распределённых представлений, не совпадающих с отдельными нейронами;
  • сравнение механизмов между входами, задачами, стадиями обучения и моделями;
  • разработка методов аудита и управляемого вмешательства.

Отличие от постфактум-объяснений

Методы объяснения предсказаний часто оценивают важность входных признаков, строят локальную аппроксимацию модели или создают понятное описание конкретного ответа. Такое объяснение может быть полезным, даже если оно не воспроизводит внутреннее вычисление исходной сети.

Механистическая интерпретируемость, напротив, стремится связать объяснение с реальными переменными и операциями модели. Объектами анализа могут быть нейроны, направления в пространстве активаций, головы внимания, блоки MLP, остаточный поток трансформера и связи между ними. Различие относится прежде всего к цели и типу доказательства: постфактум-метод может объяснять зависимость выхода от входа, тогда как механистическое исследование пытается восстановить внутренний процесс.

Граница между направлениями не абсолютна. Зонды, визуализации и методы атрибуции могут использоваться как разведочные инструменты, а найденная ими закономерность — затем проверяться причинным экспериментом.

Уровни описания

Нейроны и координаты

Нейрон в слое задаёт одну координату активационного вектора. В некоторых случаях эта координата устойчиво реагирует на узнаваемый класс входов. Однако сильная активация на примерах одного типа не означает, что нейрон кодирует только этот тип или причинно отвечает за соответствующее поведение.

Нейрон называют полисемантичным (polysemantic), если он участвует в представлении нескольких содержательно различных признаков. Полисемантичность может возникать, в частности, когда признаки представлены направлениями, не совпадающими с координатными осями слоя.

Признаки и представления

В литературе нет единственного операционального определения признака (feature). Часто под ним понимают направление или функцию от активаций, соответствующую некоторой устойчивой для модели закономерности. Один признак может быть распределён по многим координатам, а одна координата — участвовать во многих признаках.

Смысл направления зависит от выбранного базиса. После обратимого преобразования пространства активаций вычисляемая моделью функция может сохраниться, тогда как интерпретация отдельных координат изменится. Поэтому утверждение «этот нейрон означает X» сильнее, чем наблюдение «эта линейная комбинация позволяет предсказывать X», и требует отдельного обоснования.

Моносемантичным называют признак, которому удаётся приписать относительно единое и устойчивое описание. Это практическая характеристика интерпретируемости, а не гарантия однозначной семантики во всех возможных контекстах.

Компоненты трансформера

В трансформере часто анализируют:

  • головы механизма внимания и их матрицы запросов, ключей, значений и выхода;
  • блоки MLP и их скрытые активации;
  • остаточный поток (residual stream), через который компоненты читают и записывают информацию;
  • логиты токенов и направления, связанные с выходной матрицей модели;
  • композиции компонентов между слоями и позициями последовательности.

Рисунок внимания показывает, откуда голова считывает информацию, но не полностью определяет, какую информацию она переносит и как та используется дальше. Для этого также исследуют преобразования значений и выходов, последующие компоненты и эффект вмешательств.

Вычислительные цепочки

Вычислительная цепочка (circuit) — подграф вычислений сети, предложенный как механизм определённого поведения. Его узлами могут быть компоненты или признаки, а рёбрами — их функциональные взаимодействия.[1] Известный пример — цепочка идентификации косвенного дополнения в GPT-2 small, найденная с использованием причинных вмешательств и описанная через группы голов внимания.[1]

Качество описания цепочки можно оценивать по нескольким вопросам: насколько верно оставленная цепочка воспроизводит исследуемое поведение полной модели (faithfulness), учтены ли важные внешние компоненты (полнота) и действительно ли каждый включённый компонент необходим для заявленного объяснения (минимальность). Эти свойства зависят от набора входов, метрики и способа абляции.

Наблюдение и причинная проверка

Наблюдательные методы

К наблюдательным методам относятся просмотр наиболее активирующих примеров, визуализация паттернов внимания, линейные зонды и корреляция активаций с метками. Они отвечают на вопросы вида «где доступна информация?» или «какие переменные совместно изменяются?».

Высокая точность зонда не доказывает, что исходная модель использует найденную информацию: зонд может извлекать её из направления, которое не участвует в вычислении ответа. Аналогично компонент может коррелировать с поведением из-за общего предшествующего вычисления, не являясь причиной результата.

Абляция

При абляции активацию компонента удаляют или заменяют базовым значением и измеряют изменение выбранной метрики. Пусть m(M(x)) — метрика поведения модели M на входе x, выбранная так, что большее значение означает более сильное проявление исследуемого поведения, а h_c(x) — активация компонента c. Для значения замены b эффект можно записать как

\Delta_c(x;b)=m\bigl(M(x;h_c\leftarrow b)\bigr)-m(M(x)).

В качестве b используют ноль, среднюю активацию, случайное значение из другого примера или значение, подобранное под конкретный контроль. Выбор существенен: зануление может создать нетипичное для модели состояние, а замена средним — скрыть контекстную зависимость.

Сильное падение метрики показывает причинную значимость компонента при данном вмешательстве, но не обязательно подтверждает его предполагаемую семантику. Компонент может передавать несколько видов информации; возможны резервные пути и нелинейные побочные эффекты. Отсутствие эффекта также не доказывает незначимость из-за избыточности вычислений.

Activation patching

В activation patching сравнивают два согласованных прогона. В «чистом» прогоне вход x_{\mathrm{clean}} вызывает требуемое поведение, а в «искажённом» прогоне x_{\mathrm{corr}} оно ухудшается. Затем активацию выбранного узла из чистого прогона подставляют в искажённый.

Пусть h_c^{\mathrm{clean}} — чистая активация компонента, а m_{\mathrm{corr}}=m(M(x_{\mathrm{corr}})). Эффект восстановления равен

\Delta_c^{\mathrm{patch}}=m\bigl(M(x_{\mathrm{corr}};h_c\leftarrow h_c^{\mathrm{clean}})\bigr)-m_{\mathrm{corr}}.

Положительный эффект означает, что различие, проходящее через выбранный узел, причинно способствует различию выходов в этой паре прогонов. Он не доказывает, что узел самостоятельно вычисляет соответствующую величину: активация может лишь переносить информацию, а патч одновременно менять несколько скрытых факторов. Поэтому чистый и искажённый входы стараются различать контролируемо, а результат проверяют на множестве пар и контрольных заменах.[1]

Описанная схема переносит чистую активацию в искажённый прогон и проверяет восстановление поведения (denoising). Возможен обратный эксперимент: искажённую активацию переносят в чистый прогон и измеряют разрушение поведения (noising). Эти тесты отвечают на разные вопросы и не обязаны давать симметричные результаты.[1]

Path patching ограничивает замену выбранным путём между компонентами, чтобы отделить прямой эффект от других последствий вмешательства.[1] Градиентные методы атрибуции могут приближать массовый перебор патчей, но такие приближения способны пропускать нелинейные эффекты.[1]

Исследовательский цикл

Практическое исследование обычно включает следующие этапы:

  1. Задать узкое измеримое поведение и набор контрастных примеров.
  2. Выбрать метрику, например разность логитов правильного и альтернативного токенов.
  3. С помощью наблюдений или атрибуции локализовать кандидатов.
  4. Сформулировать конкретную гипотезу о представлении, передаваемой информации и последовательности операций.
  5. Проверить предсказания гипотезы абляцией, patching или более локальным вмешательством.
  6. Оценить верность воспроизведения поведения полной модели, полноту и минимальность предложенной цепочки.
  7. Повторить эксперименты на новых шаблонах, распределениях данных и случайных начальных условиях анализа.

Механистическое объяснение тем сильнее, чем больше независимых следствий гипотезы оно заранее предсказывает. Простого сохранения производительности после удаления «неважных» компонентов недостаточно, если способ удаления сам создаёт компенсирующие или внераспределительные эффекты.

Суперпозиция

Пусть слой имеет размерность d, а для задачи полезны n признаков с коэффициентами f_i и направлениями v_i\in\mathbb{R}^d. Представление можно схематично записать как

x\approx\sum_{i=1}^{n}f_i v_i.

Если n>d, направления не могут быть линейно независимыми. Тем не менее при разреженной совместной активации признаков модель может хранить их в неортогональном коде и допускать ограниченную интерференцию. Такое размещение называют суперпозицией (superposition). Это не утверждение, что конечномерное пространство содержит лишь d возможных направлений; речь идёт о представлении более чем d независимо полезных признаков перекрывающимся набором направлений.

В Toy Models of Superposition этот механизм исследован в контролируемых моделях с заранее известными разреженными признаками. Авторы показали режимы, в которых модель предпочитает неортогональное размещение признаков, и связали его с полисемантичностью нейронов.[1] Результат является демонстрацией механизма в игрушечной постановке, а не доказательством того, что вся полисемантичность больших моделей имеет единственную причину.

Суперпозиция затрудняет анализ по координатам: изменение одного нейрона может одновременно затронуть несколько признаков. Поэтому исследователи пытаются восстановить более широкий словарь разреженно активирующихся направлений.

Словарное обучение и разреженные автоэнкодеры

Постановка задачи

Словарное обучение ищет набор направлений, с помощью которых наблюдаемые активации можно приближённо представить разреженной линейной комбинацией. Один из методов — разреженный автоэнкодер (sparse autoencoder, SAE).

Для активации x\in\mathbb{R}^{d} кодировщик строит более широкое представление z\in\mathbb{R}^{p}, обычно при p>d:

z=\operatorname{ReLU}(W_{\mathrm{enc}}x+b_{\mathrm{enc}}),

а декодировщик восстанавливает активацию:

\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.

Типичная функция потерь сочетает среднеквадратичную ошибку и штраф за плотный код:

\mathcal{L}=\mathbb{E}_{x}\left[\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1\right].

Столбцы W_{\mathrm{dec}} интерпретируют как направления словаря, а координаты z — как активации извлечённых признаков. Чтобы исключить тривиальное уменьшение штрафа L_1 через уменьшение z и компенсирующее увеличение весов декодера, нормы его столбцов ограничивают или нормируют.

Интерпретация признаков

Признак SAE обычно исследуют по примерам с наибольшей активацией, распределению активаций, связанным токенам и влиянию вмешательства в его коэффициент. В Towards Monosemanticity словарное обучение применено к активациям небольшой однослайной языковой модели; многие полученные признаки оказались интерпретируемее отдельных нейронов, а разложение использовалось для анализа простых взаимодействий.[1]

В Scaling Monosemanticity SAE обучались на активациях среднего слоя Claude 3 Sonnet; словари включали до 34 миллионов признаков. Были описаны признаки, связанные с именованными сущностями, языками, кодом, изображениями и более абстрактными темами, а изменение некоторых признаков влияло на генерацию в направлении, согласующемся с их описанием.[1]

Эти результаты показывают масштабируемость процедуры извлечения большого числа интерпретируемых направлений, но не полную декомпозицию модели. Авторы прямо отмечают неполноту словаря и отсутствие строгой общей меры того, насколько признаки верно отражают вычисления модели.

Ошибки реконструкции и артефакты

SAE является отдельной обученной моделью. Его признаки зависят от данных, ширины словаря, коэффициента разреженности, оптимизации и точки модели, с которой собраны активации. Возможны:

  • потери реконструкции: часть информации исходной активации не проходит через словарь;
  • мёртвые признаки, почти никогда не активирующиеся на данных;
  • расщепление признака, когда одна закономерность представлена несколькими элементами словаря;
  • слияние признаков, когда один элемент объединяет несколько закономерностей;
  • неоднозначность словаря: разные запуски могут давать разные, но сходно реконструирующие разложения;
  • артефакты распределения данных: редкие или отсутствующие контексты не получают надёжного представления.

Низкая ошибка реконструкции не гарантирует интерпретируемость, а понятная подпись признака не гарантирует функциональную значимость. Поэтому оценивают одновременно реконструкцию, разреженность, устойчивость, качество человеческой или автоматической интерпретации и причинный эффект вмешательств. Также полезно сравнивать поведение исходной модели с поведением при замене её активаций реконструкциями SAE.

Ограничения доказательств

Механистическая интерпретируемость пока не является полным методом аудита произвольной большой модели. Основные ограничения включают:

  • субъективность описаний: человек может выбрать слишком широкую или удобную подпись для набора активирующих примеров;
  • неполноту покрытия: понятные признаки и цепочки могут объяснять лишь часть поведения;
  • зависимость от контрфакта: результат patching меняется с выбором чистого и искажённого входов;
  • чувствительность к абляции: нулевая, средняя и выборочная замены могут приводить к разным выводам;
  • комбинаторный масштаб: число возможных компонентов, признаков, путей и их взаимодействий быстро растёт;
  • распределённость и избыточность: отсутствие эффекта отдельной абляции не исключает участия компонента;
  • ограниченный перенос: механизм, найденный на одном шаблоне или небольшой модели, может не сохраняться на другом распределении или масштабе;
  • артефакты вспомогательных моделей: зонды, методы атрибуции и SAE способны вносить собственное смещение;
  • двойное использование данных: подбор и проверка гипотез на одних примерах увеличивает риск переобучения исследователя.

Надёжная работа должна заранее определить поведение и метрику, использовать контрольные вмешательства и отложенные примеры, сообщать отрицательные результаты и проверять альтернативные объяснения. Причинная проверка усиливает свидетельство, но не превращает локальный эффект в полную теорию работы модели.

Связь с безопасностью искусственного интеллекта

Для безопасности ИИ механистическая интерпретируемость рассматривается как возможный инструмент внутреннего аудита. В принципе она может помочь обнаруживать представления и цепочки, связанные с обманом, нежелательными целями, уязвимыми эвристиками или обходом ограничений, даже когда внешние тесты не покрывают все условия.

Однако наличие интерпретируемого признака, коррелирующего с опасной темой, не означает обнаружения намерения или полного механизма поведения. И наоборот, отсутствие найденного признака не является доказательством безопасности: словарь или процедура поиска могут быть неполными. Манипулирование признаком также может вызывать побочные эффекты и не заменяет поведенческое тестирование, оценку устойчивости и другие методы обеспечения безопасности.

Эпистемологический статус объяснения

Механистический подход трактует нейросеть как объект экспериментального исследования. Объяснение здесь представляет собой не только понятный рассказ, но и модель внутреннего вычисления, из которой следуют проверяемые предсказания о результатах вмешательств.

Полезно различать несколько уровней утверждений: информация декодируется из активации; модель использует её для данного ответа; конкретный компонент реализует вычислительную операцию; предложенная цепочка достаточно полно объясняет поведение. Каждый следующий уровень требует более сильных экспериментов. Это различие предотвращает переход от яркой визуализации или понятной подписи признака к необоснованному заявлению о полном понимании модели.

См. также

Примечания


Литература

Личные инструменты