Обсуждение:Механистическая интерпретируемость

Материал из MachineLearning.

Версия от 14:07, 19 июля 2026; Oleg Batsiev (Обсуждение | вклад)
(разн.) ← Предыдущая | Текущая версия (разн.) | Следующая → (разн.)
Перейти к: навигация, поиск

Статью про механистическую интерпретируемость я подготовил с помощью GPT-5.6 Terra High. Первый промпт был такой:


Напиши подробную статью про механистическую интерпретируемость нейросетей. Объясни, чем она отличается от обычных способов объяснения модели после получения ответа.

Расскажи про нейроны, признаки, внутренние представления, головы внимания и вычислительные цепочки. Объясни, почему одной корреляции активаций недостаточно и зачем нужны абляции, activation patching и другие вмешательства во внутреннюю работу модели.

Добавь суперпозицию, полисемантичность нейронов, моносемантичные признаки, sparse autoencoders и словарное обучение. Упомяни Toy Models of Superposition, Towards Monosemanticity и Scaling Monosemanticity.

Пиши понятно для студента, но не упрощай важные технические моменты. Добавь формулы, ограничения, внутренние ссылки и настоящие научные источники. Ничего не выдумывай. Формулы оформляй через <tex> и </tex>, отдельные формулы начинай с двух двоеточий.


Первый текст получился неплохим, но наблюдение за активациями и реальная причинная проверка были разделены недостаточно чётко. Ещё хотелось подробнее объяснить, почему один нейрон не обязан отвечать за одно понятие и почему найденный признак сам по себе не является полным объяснением работы модели.

Второй промпт я написал так:


Доработай статью про механистическую интерпретируемость. Чётко раздели обычное наблюдение за внутренними активациями и причинную проверку механизма.

Подробнее объясни абляцию и activation patching, добавь простую формулу эффекта вмешательства. Расширь часть про суперпозицию и полисемантичность. Напиши, как sparse autoencoders и словарное обучение используются для поиска более понятных признаков.

Не пиши, что найденный признак автоматически объясняет всё поведение модели. Добавь ограничения: субъективность интерпретации, неполное покрытие, большое число возможных цепочек, перенос выводов с маленьких моделей и возможные артефакты автоэнкодеров.

Убери пустые фразы и проверь источники. Все формулы оформи через <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Верни готовую статью целиком.


После второго ответа я вручную проверил статью, формулы и ссылки. Особенно посмотрел на знаки эффектов при вмешательствах и на то, чтобы корреляции, отдельные признаки и результаты маленьких моделей не выдавались за полное причинное объяснение.

Oleg Batsiev

Личные инструменты