Обсуждение:Механистическая интерпретируемость
Материал из MachineLearning.
| Строка 33: | Строка 33: | ||
}} | }} | ||
| - | После второй версии | + | == Что было уточнено после генерации == |
| + | |||
| + | После второй версии я проверил не только связность текста, но и то, соответствуют ли формальные утверждения описанным экспериментам: | ||
| + | |||
| + | * для эффектов абляции и activation patching явно задано направление метрики, чтобы знак эффекта нельзя было истолковать двояко; | ||
| + | * наблюдательная доступность информации отделена от причинного использования этой информации моделью; | ||
| + | * ''faithfulness'' описана как верность воспроизведения поведения полной модели, а не как обычная точность классификации; | ||
| + | * утверждения о path patching и градиентной аппроксимации патчей снабжены отдельными источниками; | ||
| + | * результаты игрушечных моделей и sparse autoencoders не представлены как полное объяснение больших моделей; | ||
| + | * ссылки на работы об IOI и редактировании фактов заменены на страницы рецензируемых публикаций; | ||
| + | * проверены совместимые с MachineLearning.ru параметры библиографического шаблона и однострочная запись вынесенных формул. | ||
| + | |||
| + | Итоговая версия различает обнаружение корреляции, причинное вмешательство и степень полноты полученного объяснения. | ||
| + | |||
| + | — [[Участник:Oleg Batsiev|Oleg Batsiev]] | ||
Версия 13:50, 19 июля 2026
О подготовке статьи
Статья «Механистическая интерпретируемость» была подготовлена с помощью GPT-5.6 Terra High. Мне было важно отличить это направление от обычных постфактум-объяснений модели: здесь речь идёт не о красивой визуализации, а о проверке конкретных внутренних механизмов нейросети через вмешательства.
Первый запрос был таким:
После первого черновика я решил подробнее раскрыть два момента: что именно считается свидетельством механизма и почему отдельный нейрон не обязательно соответствует одному человеческому понятию.
Второй запрос был таким:
Что было уточнено после генерации
После второй версии я проверил не только связность текста, но и то, соответствуют ли формальные утверждения описанным экспериментам:
- для эффектов абляции и activation patching явно задано направление метрики, чтобы знак эффекта нельзя было истолковать двояко;
- наблюдательная доступность информации отделена от причинного использования этой информации моделью;
- faithfulness описана как верность воспроизведения поведения полной модели, а не как обычная точность классификации;
- утверждения о path patching и градиентной аппроксимации патчей снабжены отдельными источниками;
- результаты игрушечных моделей и sparse autoencoders не представлены как полное объяснение больших моделей;
- ссылки на работы об IOI и редактировании фактов заменены на страницы рецензируемых публикаций;
- проверены совместимые с MachineLearning.ru параметры библиографического шаблона и однострочная запись вынесенных формул.
Итоговая версия различает обнаружение корреляции, причинное вмешательство и степень полноты полученного объяснения.

