|
|
| (2 промежуточные версии не показаны) |
| Строка 1: |
Строка 1: |
| - | == Как проверялась неопределённость ==
| + | Статью про механистическую интерпретируемость я подготовил с помощью '''GPT-5.6 Terra High'''. Первый промпт был такой: |
| | | | |
| - | При подготовке этой статьи центральным был не перечень методов, а вопрос: какое именно распределение аппроксимируется и что измеряет полученное число. Поэтому черновик проверялся по цепочке «априор — апостериор — предиктивное распределение — приближённый алгоритм — эмпирическая проверка». Такой порядок помог не смешать вероятность класса, разброс весов, шум наблюдений и способность обнаруживать сдвиг данных.
| + | {{well| |
| | + | Напиши подробную статью про механистическую интерпретируемость нейросетей. Объясни, чем она отличается от обычных способов объяснения модели после получения ответа. |
| | | | |
| - | Статья подготовлена с помощью '''GPT-5.6 Terra High'''. Оба использованных запроса приводятся ниже дословно.
| + | Расскажи про нейроны, признаки, внутренние представления, головы внимания и вычислительные цепочки. Объясни, почему одной корреляции активаций недостаточно и зачем нужны абляции, activation patching и другие вмешательства во внутреннюю работу модели. |
| | | | |
| - | === Первый запрос: вывести вероятностную постановку ===
| + | Добавь суперпозицию, полисемантичность нейронов, моносемантичные признаки, sparse autoencoders и словарное обучение. Упомяни Toy Models of Superposition, Towards Monosemanticity и Scaling Monosemanticity. |
| | | | |
| - | {{well|Помоги написать русскоязычную энциклопедическую статью для MachineLearning.ru под названием «Байесовская нейронная сеть» (Bayesian neural network). Целевая аудитория — студент, знающий основы нейронных сетей и вероятностей.
| + | Пиши понятно для студента, но не упрощай важные технические моменты. Добавь формулы, ограничения, внутренние ссылки и настоящие научные источники. Ничего не выдумывай. Формулы оформляй через <tex> и </tex>, отдельные формулы начинай с двух двоеточий. |
| | + | }} |
| | | | |
| - | Начни с интуитивного различия между обычной сетью с фиксированными весами и байесовской сетью, в которой веса имеют распределение. Затем последовательно выведи формулу апостериорного распределения p(w|D) и предиктивного распределения для нового объекта. Объясни, почему точный интеграл для глубокой сети почти всегда недоступен.
| + | Первый текст получился неплохим, но наблюдение за активациями и реальная причинная проверка были разделены недостаточно чётко. Ещё хотелось подробнее объяснить, почему один нейрон не обязан отвечать за одно понятие и почему найденный признак сам по себе не является полным объяснением работы модели. |
| | | | |
| - | Отдельно и аккуратно раскрой aleatoric и epistemic uncertainty, не обещая, что байесовская сеть автоматически умеет распознавать любой неизвестный объект. Нужны разделы про вариационный вывод, ELBO, Bayes by Backprop, репараметризацию, MC dropout, MCMC и отличие байесовской сети от ансамбля обычных моделей. Добавь применения, ограничения и короткий философский раздел.
| + | Второй промпт я написал так: |
| | | | |
| - | Используй вики-разметку MachineLearning.ru. Все формулы записывай только через <tex>...</tex>, а вынесенные формулы начинай с ::. Добавь внутренние ссылки, категорию «Искусственный интеллект» и только реальные проверяемые источники. Не придумывай DOI, результаты экспериментов и вики-шаблоны.}}
| + | {{well| |
| | + | Доработай статью про механистическую интерпретируемость. Чётко раздели обычное наблюдение за внутренними активациями и причинную проверку механизма. |
| | | | |
| - | Первая версия правильно вводила апостериорное и предиктивное распределения, но практические меры неопределённости были описаны слишком общо. В частности, выборочная дисперсия проходов MC dropout была названа предиктивной дисперсией без добавления шума наблюдений, а различие между aleatoric и epistemic uncertainty не было связано с конкретным правдоподобием.
| + | Подробнее объясни абляцию и activation patching, добавь простую формулу эффекта вмешательства. Расширь часть про суперпозицию и полисемантичность. Напиши, как sparse autoencoders и словарное обучение используются для поиска более понятных признаков. |
| | | | |
| - | === Второй запрос: ограничить утверждения аппроксимациями ===
| + | Не пиши, что найденный признак автоматически объясняет всё поведение модели. Добавь ограничения: субъективность интерпретации, неполное покрытие, большое число возможных цепочек, перенос выводов с маленьких моделей и возможные артефакты автоэнкодеров. |
| | | | |
| - | {{well|Отредактируй и расширь статью «Байесовская нейронная сеть». Сохрани её понятной, но проверь математическую точность. Формально запиши p(w|D), предиктивное распределение p(y*|x*,D), ELBO и репараметризацию w=mu+sigma epsilon. Поясни смысл каждого выражения словами.
| + | Убери пустые фразы и проверь источники. Все формулы оформи через <tex> и </tex>, отдельные формулы начинай с двух двоеточий. Верни готовую статью целиком. |
| | + | }} |
| | | | |
| - | В разделах о вариационном выводе и MC dropout явно укажи, что это приближения, а не точный байесовский вывод. Добавь, что среднеполевое вариационное приближение не отражает корреляции между весами и поэтому может недооценивать неопределённость. В разделе об ансамблях объясни различие без утверждения, что один подход всегда лучше другого.
| + | После второго ответа я вручную проверил статью, формулы и ссылки. Особенно посмотрел на знаки эффектов при вмешательствах и на то, чтобы корреляции, отдельные признаки и результаты маленьких моделей не выдавались за полное причинное объяснение. |
| | | | |
| - | Проверь, что нет сырых тегов <math> и что используются только <tex>...</tex>. Вынесенные формулы должны начинаться с ::. Оставь в литературе только реальные источники: MacKay (1992), Graves (2011), Blundell и соавторы (2015), Gal и Ghahramani (2016). Верни готовую статью целиком в вики-разметке.}}
| + | [[Участник:Oleg Batsiev|Oleg Batsiev]] |
| - | | + | |
| - | === Что было исправлено после генерации ===
| + | |
| - | | + | |
| - | Финальная версия была заново сверена по формулам и первичным публикациям. При ручной редактуре сделано следующее:
| + | |
| - | | + | |
| - | * исправлена грамматическая ошибка «в научных вычисления»;
| + | |
| - | * определение BNN уточнено: байесовским может быть не обязательно каждый параметр сети;
| + | |
| - | * добавлено явное правдоподобие и показано, что распределение весов не задаёт алеаторическую неопределённость без вероятностной модели наблюдений;
| + | |
| - | * aleatoric и epistemic uncertainty связаны с двумя слагаемыми закона полной дисперсии для регрессии;
| + | |
| - | * пояснено, что в классификации предиктивная энтропия не является чистой мерой только одного источника неопределённости;
| + | |
| - | * добавлено тождество между логарифмом свидетельства, ELBO и KL-дивергенцией;
| + | |
| - | * для среднеполевого приближения отмечены невозможность передать корреляции и несколько мод, а также возможное сужение при минимизации <tex>\mathrm{KL}(q\|p)</tex>;
| + | |
| - | * репараметризация Bayes by Backprop дополнена положительной параметризацией масштаба через <tex>\rho</tex>;
| + | |
| - | * выборочная дисперсия MC dropout больше не названа полной предиктивной дисперсией без условного шума наблюдений;
| + | |
| - | * асимптотические свойства MCMC отделены от качества конечной цепи и необходимости диагностики смешивания;
| + | |
| - | * сравнение с ансамблями переписано без заявления о безусловном превосходстве или экономичности одного метода;
| + | |
| - | * добавлен самостоятельный раздел о проверке калибровки, покрытии интервалов и качестве при сдвиге распределения;
| + | |
| - | * конференционные публикации Blundell и Gal—Ghahramani исправлены с шаблона книги на шаблон статьи и параметр <tt>ссылка</tt>;
| + | |
| - | * в литературу возвращены обещанные работы MacKay и Graves; названия, страницы и DOI сверены с издательскими страницами;
| + | |
| - | * примечания и библиография разделены, а несуществующая категория «Искусственный интеллект» заменена существующими категориями «Машинное обучение» и «Нейронные сети».
| + | |
| - | | + | |
| - | Байесовская терминология в финальном тексте везде условна относительно выбранной модели. Фразы о калибровке, неизвестных объектах и безопасном отказе сформулированы как требования к отдельной эмпирической проверке, а не как автоматические свойства BNN.
| + | |
| - | | + | |
| - | — [[Участник:Oleg Batsiev|Oleg Batsiev]]
| + | |
Первый текст получился неплохим, но наблюдение за активациями и реальная причинная проверка были разделены недостаточно чётко. Ещё хотелось подробнее объяснить, почему один нейрон не обязан отвечать за одно понятие и почему найденный признак сам по себе не является полным объяснением работы модели.
После второго ответа я вручную проверил статью, формулы и ссылки. Особенно посмотрел на знаки эффектов при вмешательствах и на то, чтобы корреляции, отдельные признаки и результаты маленьких моделей не выдавались за полное причинное объяснение.