Механистическая интерпретируемость

Материал из MachineLearning.

Версия от 13:49, 19 июля 2026; Oleg Batsiev (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск
Статья написана с использованием LLM GPT-5.6 Terra High и проверена участником Oleg Batsiev 17:07, 19 июля 2026 (MSD).

Промпты и описание редакторской проверки приведены в Обсуждение:Механистическая интерпретируемость.


Содержание

Механистическая интерпретируемость (англ. mechanistic interpretability) — направление исследований нейронных сетей, в котором их поведение объясняют через внутренние вычисления: представления признаков, операции отдельных компонентов и их причинные взаимодействия. В наиболее сильной формулировке задача состоит в том, чтобы построить понятное человеку описание алгоритма, реализованного параметрами сети, и проверить это описание вмешательствами в работу модели.[1][1]

Механистическая интерпретируемость не ограничивается визуализацией внимания или поиском активаций, коррелирующих с понятием. Такие наблюдения помогают выдвинуть гипотезу, но для её проверки исследуют, как контролируемое изменение внутренней переменной влияет на последующие вычисления и выход модели. Даже причинное вмешательство само по себе не даёт полного объяснения: результат зависит от выбранного контрфактического примера, способа замены активации и полноты предполагаемой вычислительной цепочки.

Предмет и мотивация

Современные нейросети обучаются как целостные системы, поэтому назначение отдельных внутренних компонентов обычно не задаётся заранее. Одинаковое внешнее поведение может быть реализовано разными механизмами, а один компонент может участвовать в нескольких функциях. Анализ только входов и выходов показывает, что делает модель, но не обязательно объясняет, как она это делает.

Например, языковая модель может правильно выбирать косвенное дополнение или согласовывать сказуемое с подлежащим. Поведенческий тест измеряет долю правильных ответов. Механистическое исследование дополнительно пытается установить, где представлена информация об именах или грамматическом числе, какие компоненты переносят её между позициями и каким путём она изменяет логиты следующего токена.

К практическим целям направления относятся:

  • проверка гипотез о внутренних алгоритмах модели;
  • поиск причин нежелательного поведения и систематических ошибок;
  • обнаружение распределённых представлений, не совпадающих с отдельными нейронами;
  • сравнение механизмов между входами, задачами, стадиями обучения и моделями;
  • разработка методов аудита и управляемого вмешательства.

Отличие от постфактум-объяснений

Методы объяснения предсказаний часто оценивают важность входных признаков, строят локальную аппроксимацию модели или создают понятное описание конкретного ответа. Такое объяснение может быть полезным, даже если оно не воспроизводит внутреннее вычисление исходной сети.

Механистическая интерпретируемость, напротив, стремится связать объяснение с реальными переменными и операциями модели. Объектами анализа могут быть нейроны, направления в пространстве активаций, головы внимания, блоки MLP, остаточный поток трансформера и связи между ними. Различие относится прежде всего к цели и типу доказательства: постфактум-метод может объяснять зависимость выхода от входа, тогда как механистическое исследование пытается восстановить внутренний процесс.

Граница между направлениями не абсолютна. Зонды, визуализации и методы атрибуции могут использоваться как разведочные инструменты, а найденная ими закономерность — затем проверяться причинным экспериментом.

Уровни описания

Нейроны и координаты

Нейрон в слое задаёт одну координату активационного вектора. В некоторых случаях эта координата устойчиво реагирует на узнаваемый класс входов. Однако сильная активация на примерах одного типа не означает, что нейрон кодирует только этот тип или причинно отвечает за соответствующее поведение.

Нейрон называют полисемантичным (polysemantic), если он участвует в представлении нескольких содержательно различных признаков. Полисемантичность может возникать, в частности, когда признаки представлены направлениями, не совпадающими с координатными осями слоя.

Признаки и представления

В литературе нет единственного операционального определения признака (feature). Часто под ним понимают направление или функцию от активаций, соответствующую некоторой устойчивой для модели закономерности. Один признак может быть распределён по многим координатам, а одна координата — участвовать во многих признаках.

Смысл направления зависит от выбранного базиса. После обратимого преобразования пространства активаций вычисляемая моделью функция может сохраниться, тогда как интерпретация отдельных координат изменится. Поэтому утверждение «этот нейрон означает X» сильнее, чем наблюдение «эта линейная комбинация позволяет предсказывать X», и требует отдельного обоснования.

Моносемантичным называют признак, которому удаётся приписать относительно единое и устойчивое описание. Это практическая характеристика интерпретируемости, а не гарантия однозначной семантики во всех возможных контекстах.

Компоненты трансформера

В трансформере часто анализируют:

  • головы механизма внимания и их матрицы запросов, ключей, значений и выхода;
  • блоки MLP и их скрытые активации;
  • остаточный поток (residual stream), через который компоненты читают и записывают информацию;
  • логиты токенов и направления, связанные с выходной матрицей модели;
  • композиции компонентов между слоями и позициями последовательности.

Рисунок внимания показывает, откуда голова считывает информацию, но не полностью определяет, какую информацию она переносит и как та используется дальше. Для этого также исследуют преобразования значений и выходов, последующие компоненты и эффект вмешательств.

Вычислительные цепочки

Вычислительная цепочка (circuit) — подграф вычислений сети, предложенный как механизм определённого поведения. Его узлами могут быть компоненты или признаки, а рёбрами — их функциональные взаимодействия.[1] Известный пример — цепочка идентификации косвенного дополнения в GPT-2 small, найденная с использованием причинных вмешательств и описанная через группы голов внимания.[1]

Качество описания цепочки можно оценивать по нескольким вопросам: насколько верно оставленная цепочка воспроизводит исследуемое поведение полной модели (faithfulness), учтены ли важные внешние компоненты (полнота) и действительно ли каждый включённый компонент необходим для заявленного объяснения (минимальность). Эти свойства зависят от набора входов, метрики и способа абляции.

Наблюдение и причинная проверка

Наблюдательные методы

К наблюдательным методам относятся просмотр наиболее активирующих примеров, визуализация паттернов внимания, линейные зонды и корреляция активаций с метками. Они отвечают на вопросы вида «где доступна информация?» или «какие переменные совместно изменяются?».

Высокая точность зонда не доказывает, что исходная модель использует найденную информацию: зонд может извлекать её из направления, которое не участвует в вычислении ответа. Аналогично компонент может коррелировать с поведением из-за общего предшествующего вычисления, не являясь причиной результата.

Абляция

При абляции активацию компонента удаляют или заменяют базовым значением и измеряют изменение выбранной метрики. Пусть m(M(x)) — метрика поведения модели M на входе x, выбранная так, что большее значение означает более сильное проявление исследуемого поведения, а h_c(x) — активация компонента c. Для значения замены b эффект можно записать как

\Delta_c(x;b)=m\bigl(M(x;h_c\leftarrow b)\bigr)-m(M(x)).

В качестве b используют ноль, среднюю активацию, случайное значение из другого примера или значение, подобранное под конкретный контроль. Выбор существенен: зануление может создать нетипичное для модели состояние, а замена средним — скрыть контекстную зависимость.

Сильное падение метрики показывает причинную значимость компонента при данном вмешательстве, но не обязательно подтверждает его предполагаемую семантику. Компонент может передавать несколько видов информации; возможны резервные пути и нелинейные побочные эффекты. Отсутствие эффекта также не доказывает незначимость из-за избыточности вычислений.

Activation patching

В activation patching сравнивают два согласованных прогона. В «чистом» прогоне вход x_{\mathrm{clean}} вызывает требуемое поведение, а в «искажённом» прогоне x_{\mathrm{corr}} оно ухудшается. Затем активацию выбранного узла из чистого прогона подставляют в искажённый.

Пусть h_c^{\mathrm{clean}} — чистая активация компонента, а m_{\mathrm{corr}}=m(M(x_{\mathrm{corr}})). Эффект восстановления равен

\Delta_c^{\mathrm{patch}}=m\bigl(M(x_{\mathrm{corr}};h_c\leftarrow h_c^{\mathrm{clean}})\bigr)-m_{\mathrm{corr}}.

Положительный эффект означает, что различие, проходящее через выбранный узел, причинно способствует различию выходов в этой паре прогонов. Он не доказывает, что узел самостоятельно вычисляет соответствующую величину: активация может лишь переносить информацию, а патч одновременно менять несколько скрытых факторов. Поэтому чистый и искажённый входы стараются различать контролируемо, а результат проверяют на множестве пар и контрольных заменах.[1]

Описанная схема переносит чистую активацию в искажённый прогон и проверяет восстановление поведения (denoising). Возможен обратный эксперимент: искажённую активацию переносят в чистый прогон и измеряют разрушение поведения (noising). Эти тесты отвечают на разные вопросы и не обязаны давать симметричные результаты.[1]

Path patching ограничивает замену выбранным путём между компонентами, чтобы отделить прямой эффект от других последствий вмешательства.[1] Градиентные методы атрибуции могут приближать массовый перебор патчей, но такие приближения способны пропускать нелинейные эффекты.[1]

Исследовательский цикл

Практическое исследование обычно включает следующие этапы:

  1. Задать узкое измеримое поведение и набор контрастных примеров.
  2. Выбрать метрику, например разность логитов правильного и альтернативного токенов.
  3. С помощью наблюдений или атрибуции локализовать кандидатов.
  4. Сформулировать конкретную гипотезу о представлении, передаваемой информации и последовательности операций.
  5. Проверить предсказания гипотезы абляцией, patching или более локальным вмешательством.
  6. Оценить верность воспроизведения поведения полной модели, полноту и минимальность предложенной цепочки.
  7. Повторить эксперименты на новых шаблонах, распределениях данных и случайных начальных условиях анализа.

Механистическое объяснение тем сильнее, чем больше независимых следствий гипотезы оно заранее предсказывает. Простого сохранения производительности после удаления «неважных» компонентов недостаточно, если способ удаления сам создаёт компенсирующие или внераспределительные эффекты.

Суперпозиция

Пусть слой имеет размерность d, а для задачи полезны n признаков с коэффициентами f_i и направлениями v_i\in\mathbb{R}^d. Представление можно схематично записать как

x\approx\sum_{i=1}^{n}f_i v_i.

Если n>d, направления не могут быть линейно независимыми. Тем не менее при разреженной совместной активации признаков модель может хранить их в неортогональном коде и допускать ограниченную интерференцию. Такое размещение называют суперпозицией (superposition). Это не утверждение, что конечномерное пространство содержит лишь d возможных направлений; речь идёт о представлении более чем d независимо полезных признаков перекрывающимся набором направлений.

В Toy Models of Superposition этот механизм исследован в контролируемых моделях с заранее известными разреженными признаками. Авторы показали режимы, в которых модель предпочитает неортогональное размещение признаков, и связали его с полисемантичностью нейронов.[1] Результат является демонстрацией механизма в игрушечной постановке, а не доказательством того, что вся полисемантичность больших моделей имеет единственную причину.

Суперпозиция затрудняет анализ по координатам: изменение одного нейрона может одновременно затронуть несколько признаков. Поэтому исследователи пытаются восстановить более широкий словарь разреженно активирующихся направлений.

Словарное обучение и разреженные автоэнкодеры

Постановка задачи

Словарное обучение ищет набор направлений, с помощью которых наблюдаемые активации можно приближённо представить разреженной линейной комбинацией. Один из методов — разреженный автоэнкодер (sparse autoencoder, SAE).

Для активации x\in\mathbb{R}^{d} кодировщик строит более широкое представление z\in\mathbb{R}^{p}, обычно при p>d:

z=\operatorname{ReLU}(W_{\mathrm{enc}}x+b_{\mathrm{enc}}),

а декодировщик восстанавливает активацию:

\hat{x}=W_{\mathrm{dec}}z+b_{\mathrm{dec}}.

Типичная функция потерь сочетает среднеквадратичную ошибку и штраф за плотный код:

\mathcal{L}=\mathbb{E}_{x}\left[\lVert x-\hat{x}\rVert_2^2+\lambda\lVert z\rVert_1\right].

Столбцы W_{\mathrm{dec}} интерпретируют как направления словаря, а координаты z — как активации извлечённых признаков. Чтобы исключить тривиальное уменьшение штрафа L_1 через уменьшение z и компенсирующее увеличение весов декодера, нормы его столбцов ограничивают или нормируют.

Интерпретация признаков

Признак SAE обычно исследуют по примерам с наибольшей активацией, распределению активаций, связанным токенам и влиянию вмешательства в его коэффициент. В Towards Monosemanticity словарное обучение применено к активациям небольшой однослайной языковой модели; многие полученные признаки оказались интерпретируемее отдельных нейронов, а разложение использовалось для анализа простых взаимодействий.[1]

В Scaling Monosemanticity SAE обучались на активациях среднего слоя Claude 3 Sonnet; словари включали до 34 миллионов признаков. Были описаны признаки, связанные с именованными сущностями, языками, кодом, изображениями и более абстрактными темами, а изменение некоторых признаков влияло на генерацию в направлении, согласующемся с их описанием.[1]

Эти результаты показывают масштабируемость процедуры извлечения большого числа интерпретируемых направлений, но не полную декомпозицию модели. Авторы прямо отмечают неполноту словаря и отсутствие строгой общей меры того, насколько признаки верно отражают вычисления модели.

Ошибки реконструкции и артефакты

SAE является отдельной обученной моделью. Его признаки зависят от данных, ширины словаря, коэффициента разреженности, оптимизации и точки модели, с которой собраны активации. Возможны:

  • потери реконструкции: часть информации исходной активации не проходит через словарь;
  • мёртвые признаки, почти никогда не активирующиеся на данных;
  • расщепление признака, когда одна закономерность представлена несколькими элементами словаря;
  • слияние признаков, когда один элемент объединяет несколько закономерностей;
  • неоднозначность словаря: разные запуски могут давать разные, но сходно реконструирующие разложения;
  • артефакты распределения данных: редкие или отсутствующие контексты не получают надёжного представления.

Низкая ошибка реконструкции не гарантирует интерпретируемость, а понятная подпись признака не гарантирует функциональную значимость. Поэтому оценивают одновременно реконструкцию, разреженность, устойчивость, качество человеческой или автоматической интерпретации и причинный эффект вмешательств. Также полезно сравнивать поведение исходной модели с поведением при замене её активаций реконструкциями SAE.

Ограничения доказательств

Механистическая интерпретируемость пока не является полным методом аудита произвольной большой модели. Основные ограничения включают:

  • субъективность описаний: человек может выбрать слишком широкую или удобную подпись для набора активирующих примеров;
  • неполноту покрытия: понятные признаки и цепочки могут объяснять лишь часть поведения;
  • зависимость от контрфакта: результат patching меняется с выбором чистого и искажённого входов;
  • чувствительность к абляции: нулевая, средняя и выборочная замены могут приводить к разным выводам;
  • комбинаторный масштаб: число возможных компонентов, признаков, путей и их взаимодействий быстро растёт;
  • распределённость и избыточность: отсутствие эффекта отдельной абляции не исключает участия компонента;
  • ограниченный перенос: механизм, найденный на одном шаблоне или небольшой модели, может не сохраняться на другом распределении или масштабе;
  • артефакты вспомогательных моделей: зонды, методы атрибуции и SAE способны вносить собственное смещение;
  • двойное использование данных: подбор и проверка гипотез на одних примерах увеличивает риск переобучения исследователя.

Надёжная работа должна заранее определить поведение и метрику, использовать контрольные вмешательства и отложенные примеры, сообщать отрицательные результаты и проверять альтернативные объяснения. Причинная проверка усиливает свидетельство, но не превращает локальный эффект в полную теорию работы модели.

Связь с безопасностью искусственного интеллекта

Для безопасности ИИ механистическая интерпретируемость рассматривается как возможный инструмент внутреннего аудита. В принципе она может помочь обнаруживать представления и цепочки, связанные с обманом, нежелательными целями, уязвимыми эвристиками или обходом ограничений, даже когда внешние тесты не покрывают все условия.

Однако наличие интерпретируемого признака, коррелирующего с опасной темой, не означает обнаружения намерения или полного механизма поведения. И наоборот, отсутствие найденного признака не является доказательством безопасности: словарь или процедура поиска могут быть неполными. Манипулирование признаком также может вызывать побочные эффекты и не заменяет поведенческое тестирование, оценку устойчивости и другие методы обеспечения безопасности.

Эпистемологический статус объяснения

Механистический подход трактует нейросеть как объект экспериментального исследования. Объяснение здесь представляет собой не только понятный рассказ, но и модель внутреннего вычисления, из которой следуют проверяемые предсказания о результатах вмешательств.

Полезно различать несколько уровней утверждений: информация декодируется из активации; модель использует её для данного ответа; конкретный компонент реализует вычислительную операцию; предложенная цепочка достаточно полно объясняет поведение. Каждый следующий уровень требует более сильных экспериментов. Это различие предотвращает переход от яркой визуализации или понятной подписи признака к необоснованному заявлению о полном понимании модели.

См. также

Примечания


Литература

Личные инструменты