Материал из MachineLearning.
Статью про механистическую интерпретируемость я подготовил с помощью GPT-5.6 Terra High. Первый промпт был такой:
| Напиши подробную статью про механистическую интерпретируемость нейросетей. Объясни, чем она отличается от обычных способов объяснения модели после получения ответа.
Расскажи про нейроны, признаки, внутренние представления, головы внимания и вычислительные цепочки. Объясни, почему одной корреляции активаций недостаточно и зачем нужны абляции, activation patching и другие вмешательства во внутреннюю работу модели.
Добавь суперпозицию, полисемантичность нейронов, моносемантичные признаки, sparse autoencoders и словарное обучение. Упомяни Toy Models of Superposition, Towards Monosemanticity и Scaling Monosemanticity.
Пиши понятно для студента, но не упрощай важные технические моменты. Добавь формулы, ограничения, внутренние ссылки и настоящие научные источники. Ничего не выдумывай. Формулы оформляй через <tex> и </tex>, отдельные формулы начинай с двух двоеточий.
|
Первый текст получился неплохим, но наблюдение за активациями и реальная причинная проверка были разделены недостаточно чётко. Ещё хотелось подробнее объяснить, почему один нейрон не обязан отвечать за одно понятие и почему найденный признак сам по себе не является полным объяснением работы модели.
Второй промпт я написал так:
| Доработай статью про механистическую интерпретируемость. Чётко раздели обычное наблюдение за внутренними активациями и причинную проверку механизма.
Подробнее объясни абляцию и activation patching, добавь простую формулу эффекта вмешательства. Расширь часть про суперпозицию и полисемантичность. Напиши, как sparse autoencoders и словарное обучение используются для поиска более понятных признаков.
Не пиши, что найденный признак автоматически объясняет всё поведение модели. Добавь ограничения: субъективность интерпретации, неполное покрытие, большое число возможных цепочек, перенос выводов с маленьких моделей и возможные артефакты автоэнкодеров.
Убери пустые фразы и проверь источники. Все формулы оформи через <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Верни готовую статью целиком.
|
После второго ответа я вручную проверил статью, формулы и ссылки. Особенно посмотрел на знаки эффектов при вмешательствах и на то, чтобы корреляции, отдельные признаки и результаты маленьких моделей не выдавались за полное причинное объяснение.
Oleg Batsiev