Q-обучение

Материал из MachineLearning.

(Различия между версиями)
Перейти к: навигация, поиск
Строка 1: Строка 1:
{{well|Статья написана с использованием LLM и проверена участником [[Участник:Arina Pakalova|Arina Pakalova]] 10:54, 26 июня 2026 (MSD)}}
{{well|Статья написана с использованием LLM и проверена участником [[Участник:Arina Pakalova|Arina Pakalova]] 10:54, 26 июня 2026 (MSD)}}
-
== Нейробиология и Q-значения ==
+
== Формализация Q-обучения и его нейробиологический аналог ==
-
Формально алгоритм Q-обучения оперирует функцией ценности действия <tex>Q(s, a)</tex>, определяющей ожидаемую совокупную награду при совершении действия <tex>a</tex> в состоянии <tex>s</tex>. С точки зрения вычислительной нейробиологии, нейробиологическим субстратом матрицы <tex>Q</tex> является дорсальный стриатум (хвостатое ядро и скорлупа) [1]. Средние шипиковые нейроны (MSNs) стриатума получают кортикостриарные входы, кодирующие сенсомоторное состояние <tex>s</tex>, и дофаминергические входы от вентральной области покрышки (VTA) и субстанции нигра (SNc). Спайкинг-активность специфических популяций MSNs пропорциональна величине <tex>Q(s, a)</tex> для конкретного моторного акта <tex>a</tex>. Данный механизм формирует конкуренцию между прямым (дофамин-чувствительным D1-рецепторным) и непрямым (D2-рецепторным) путями базальных ганглиев, что математически обеспечивает выбор поведенческого паттерна с максимальной ожидаемой полезностью [2].
+
Q-обучение (Q-learning) — это один из базовых алгоритмов [[Обучение с подкреплением|обучения с подкреплением]] без модели среды (model-free). Его целью является нахождение оптимальной стратегии путем оценки [[Функция ценности действия|функции ценности действия]] <tex>Q(s, a)</tex>. Эта функция определяет ожидаемую совокупную награду (return), которую агент получит, выполнив действие <tex>a</tex> в состоянии <tex>s</tex>, и затем действуя оптимально.
-
== Ошибка предсказания награды и дофамин ==
+
С точки зрения вычислительной нейробиологии, табличная матрица <tex>Q</tex>, которую алгоритм поддерживает в памяти, имеет прямое биологическое воплощение. Нейробиологическим субстратом, кодирующим <tex>Q(s, a)</tex>, является дорсальный стриатум (хвостатое ядро и скорлупа) <ref>Samejima K. et al. Representation of action-specific reward values in the striatum //Science. – 2005. – Т. 310. – №. 5752.</ref>. Спайкинг-активность специфических популяций средних шипиковых нейронов (MSNs) стриатума пропорциональна величине <tex>Q(s, a)</tex> для конкретного моторного акта. Таким образом, алгоритмическая матрица ценностей в [[Машинное обучение|машинном обучении]] концептуально изоморфна карте синаптических весов в базальных ганглиях мозга, где каждое состояние-действие представлено своей ансамблевой активностью <ref>Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism //Journal of cognitive neuroscience. – 2005. – Т. 17. – №. 1.</ref>.
-
Обновление Q-значений управляется сигналом ошибки предсказания награды (Reward Prediction Error, RPE), обозначаемым как <tex>\delta</tex>. В дискретном времени уравнение Беллмана для <tex>\delta</tex> имеет вид:
+
 
 +
== Ошибка временных различий и сигнал дофамина ==
 +
Математическим двигателем Q-обучения является [[Временные различия|ошибка временных различий]] (Temporal Difference error, TD-error), обозначаемая как <tex>\delta</tex>. В дискретном времени [[Уравнение Беллмана|уравнение Беллмана]] для <tex>\delta</tex> записывается как:
<tex>\delta = r + \gamma \max_{a'} Q(s', a') - Q(s, a)</tex>,
<tex>\delta = r + \gamma \max_{a'} Q(s', a') - Q(s, a)</tex>,
-
где <tex>r</tex> — первичная подкрепляющая стимуляция, <tex>\gamma \in [0, 1)</tex> — фактор дисконтирования (отражающий временное обесценивание будущей награды), <tex>s'</tex> — последующее состояние. Данный математический конструкт изоморфен фазическим ответам дофаминовых нейронов, зафиксированным в классических электрофизиологических экспериментах Вольфрама Шульца [3]. Активность дофамина строго соответствует скалярной величине <tex>\delta</tex>: деполяризация (всплеск частоты спайков) наблюдается при <tex>\delta > 0</tex> (непредсказанная награда), отсутствие фазической реакции при <tex>\delta = 0</tex> (полностью предсказанная награда) и угнетение активности (дип) при <tex>\delta < 0</tex> (отсутствие ожидаемой награды). Таким образом, дофамин выступает в роли глобального нейромодулятора, транслирующего ошибку предсказания <tex>\delta</tex> к стриатарным синапсам для индукции пластичности.
+
где <tex>r</tex> — мгновенная награда, <tex>\gamma \in [0, 1)</tex> — [[Фактор дисконтирования|фактор дисконтирования]], <tex>s'</tex> — новое состояние после совершения действия. Суть формулы заключается в [[Бутстрэппинг|бутстрэппинге]] (bootstrap): текущая оценка <tex>Q(s, a)</tex> корректируется на разницу между фактически полученным (или предсказанным на будущий шаг) и ожидаемым результатом.
-
== Алгоритм обновления и стохастический выбор ==
+
В нейробиологии данный математический конструкт получил название [[Ошибка предсказания награды|ошибки предсказания награды]] (Reward Prediction Error, RPE). Классические эксперименты Вольфрама Шульца показали, что фазическая активность дофаминовых нейронов среднего мозга (VTA и SNc) математически эквивалентна сигналу <tex>\delta</tex> <ref>Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward //Science. – 1997. – Т. 275. – №. 5306.</ref>. Дофамин не кодирует саму награду: всплеск его выброса (<tex>\delta > 0</tex>) происходит только при получении награды лучше ожидаемой; предсказуемая награда не вызывает реакции (<tex>\delta = 0</tex>); а отсутствие ожидаемой награды ведет к падению активности ниже базового уровня (<tex>\delta < 0</tex>). В контексте алгоритма дофамин выступает как глобальный множитель ошибки (global error signal), необходимый для обновления весов.
-
Процесс обучения представляет собой итеративную модификацию синаптических весов (Q-значений) в зависимости от кортико-стриарной долговременной потенциации (LTP) и депрессии (LTD), индуцированных сигналом <tex>\delta</tex>. Уравнение обновления весов:
+
 
 +
== Пошаговая логика и стохастическая политика ==
 +
Обновление значений в классическом алгоритме происходит по правилу [[Градиентный спуск|градиентного спуска]]:
<tex>Q(s, a) \leftarrow Q(s, a) + \alpha \delta</tex>,
<tex>Q(s, a) \leftarrow Q(s, a) + \alpha \delta</tex>,
-
где <tex>\alpha \in (0, 1]</tex> — скорость обучения, биологически детерминированная кинетикой NMDA-рецепторов и внутриклеточных каскадов.
+
где <tex>\alpha \in (0, 1]</tex> — [[Скорость обучения|скорость обучения]] (learning rate), определяющая размер шага корректировки оценки.
-
Для моделирования стохастичности биологического выбора вместо <tex>\epsilon</tex>-жадной стратегии применяется распределение Гиббса (политика Больцмана), учитывающее термодинамический шум в нейронных сетях. Вероятность выбора действия <tex>a</tex> в состоянии <tex>s</tex> определяется как:
+
Для баланса между исследованием среды (exploration) и использованием найденного опыта (exploitation) в машинном обучении часто применяют [[Epsilon-жадная стратегия|epsilon-жадную стратегию]]. Однако она подразумевает абсолютно случайные выборы с вероятностью <tex>\epsilon</tex>, что плохо согласуется с биологическим поведением. Более реалистичной и математически обоснованной альтернативой является [[Политика Больцмана|распределение Гиббса (политика Больцмана)]], где вероятность выбора действия вычисляется на основе его текущей ценности с помощью функции [[Softmax|Softmax]]:
<tex>P(a|s) = \frac{\exp(Q(s,a) / \tau)}{\sum_{a' \in A} \exp(Q(s,a') / \tau)}</tex>,
<tex>P(a|s) = \frac{\exp(Q(s,a) / \tau)}{\sum_{a' \in A} \exp(Q(s,a') / \tau)}</tex>,
-
где <tex>\tau > 0</tex> — параметр температуры, отражающий уровень тонической дофаминергической активности и шума в моторных контурах.
+
Здесь параметр <tex>\tau > 0</tex> (температура) контролирует уровень стохастичности: при высоких <tex>\tau</tex> действия выбираются почти равновероятно (чистое исследование), а при <tex>\tau \to 0</tex> алгоритм вырождается в [[Жадная стратегия|жадный выбор]] (чистое использование). Биологически этот параметр интерпретируется как уровень стохастического шума в нейронных сетях моторной коры и базальных ганглиев.
 +
 
 +
Псевдокод цикла Q-обучения с политикой Больцмана:
 +
Инициализация Q(s, a) = 0 для всех s, a
 +
ДЛЯ каждого эпизода:
 +
Инициализация начального состояния s
 +
ПОКА s не является терминальным:
 +
// Выбор действия на основе Softmax
 +
ВЫЧИСЛИТЬ P(a|s) для всех a
 +
ВЫБРАТЬ действие a стохастически согласно P(a|s)
 +
// Взаимодействие со средой
 +
ВЫПОЛНИТЬ a, получить награду r, перейти в состояние s'
 +
// Вычисление ошибки предсказания (TD-error)
 +
ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a)
 +
// Обновление функции ценности
 +
ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta
 +
s = s'
 +
КОНЕЦ ПОКА
 +
КОНЕЦ ДЛЯ
 +
 
 +
 
 +
== Ограничения табличного подхода и архитектура Actor-Critic ==
 +
Базовое табличное Q-обучение сталкивается с серьезными вычислительными ограничениями при решении реальных задач. Главная проблема — [[Проклятие размерности|проклятие размерности]]: алгоритм требует хранения отдельной оценки для каждой пары «состояние-действие». В средах с непрерывным пространством состояний (например, управление роботом-манипулятором) или при асинхронном поступлении стимулов таблица становится бесконечной. Кроме того, оператор максимизации <tex>\max_{a'} Q(s', a')</tex> делает алгоритм [[Off-policy|off-policy]] (целевая политика отличается от поведенческой), что может приводить к [[Смещение переоценки|переоценке ценностей]] (overestimation bias).
-
Псевдокод биологически правдоподобного цикла Q-обучения:
+
В машинном обучении эти проблемы решаются переходом к [[Аппроксимация функций|аппроксимации функций]] (например, с помощью [[Нейронная сеть|нейросетей]]) и декомпозиции архитектуры на [[Actor-Critic|Actor-Critic]]. Вместо одной таблицы <tex>Q</tex> выделяются две структуры:
 +
* '''Critic (критик)''': оценивает ценность самого состояния <tex>V(s)</tex> (см. [[Функция ценности состояния|функцию ценности состояния]]), а не конкретных действий.
 +
* '''Actor (актер)''': формирует [[Вероятностная стратегия|вероятностную политику]] выбора действий <tex>\pi(a|s)</tex>.
-
Инициализация Q(s, a) = 0 для всех состояний s и действий a
+
При этом ошибка обновляется относительно критика: <tex>\delta = r + \gamma V(s') - V(s)</tex>. Эта же ошибка <tex>\delta</tex> используется для настройки параметров Актера.
-
ДЛЯ каждого эпизода:
+
-
Инициализация начального состояния s
+
-
ПОКА s не является терминальным:
+
-
// Фаза выбора действия (Actor)
+
-
ВЫЧИСЛИТЬ вероятности P(a|s) для всех a через Больцмановское распределение
+
-
ВЫБРАТЬ действие a стохастически согласно P(a|s)
+
-
// Фаза взаимодействия со средой
+
-
ВЫПОЛНИТЬ a, получить награду r, наблюдать новое состояние s'
+
-
// Фаза вычисления сигнала подкрепления (Critic)
+
-
ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a)
+
-
// Фаза синаптической пластичности
+
-
ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta
+
-
s = s'
+
-
КОНЕЦ ПОКА
+
-
КОНЕЦ ДЛЯ
+
 +
Интересно, что нервная система эволюционно пришла к точно такой же архитектурной декомпозиции <ref>Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995.</ref>. Биологическим аналогом Критика выступает вентральный стриатум (оценка того, насколько хорошо текущее состояние), а Актера — дорсальный стриатум (выбор конкретного действия). Единый дофаминергический сигнал <tex>\delta</tex> одновременно модулирует синаптическую пластичность в обеих структурах. Такая организация позволяет мозгу и сложным RL-алгоритмам использовать методы временных различий с функциональной аппроксимацией, эффективно решая задачу [[Кредитование награды|кредитования награды]] (credit assignment) в длинных непрерывных последовательностях действий <ref>Sutton R. S. et al. Reinforcement learning: An introduction. – Cambridge : MIT press, 1998. – Т. 1. – №. 1.</ref>.
-
== Вычислительные ограничения и архитектура Actor-Critic ==
+
== См. также ==
-
Базовое табличное Q-обучение обладает фундаментальными ограничениями при моделировании реального сложного поведения. Во-первых, оно требует дискретизации пространства состояний и действий, что противоречит непрерывной природе сенсомоторного континуума и асинхронности прихода стимулов (проблема проклятия размерности). Во-вторых, оператор максимизации <tex>\max_{a'} Q(s', a')</tex> жестко привязывает обновление к детерминированной политике будущего, что снижает эффективность обучения в стохастических средах.
+
* [[Обучение с подкреплением]]
 +
* [[Однорукий бандит]]
 +
* [[Актёр-критик]]
 +
* [[Policy gradient]]
 +
* [[Компромисс обучение-применение]]
-
В нервной системе данная вычислительная проблема разрешается посредством декомпозиции на архитектуры типа Actor-Critic [4]. В этой парадигме функция ценности состояния <tex>V(s)</tex> (Critic) выделяется анатомически в вентральном стриатуме и орбитофронтальной коре, тогда как функция выбора действия (Actor) локализуется в дорсальном стриатуме. Дофаминергический сигнал <tex>\delta</tex> вычисляется Critic-ом относительно состояний:
+
== Примечания ==
-
<tex>\delta = r + \gamma V(s') - V(s)</tex>,
+
{{примечания}}
-
и одновременно используется для обновления весов как Critic-а, так и Actor-а. Такая декомпозиция позволяет нервной системе обрабатывать непрерывные временные ряды через методы временных различий (TD-learning) с функциональной аппроксимацией (например, с использованием элигибилити-трейсов — следов памяти), обеспечивая асинхронное кредитование награды (credit assignment) для длинных последовательностей иерархических поведенческих актов [5].
+
== Литература ==
== Литература ==
-
# Samejima K., Ueda Y., Doya K., Kimura M. Representation of action-specific reward values in the striatum // The Journal of Neuroscience. — 2005. — Vol. 25(17). — P. 4342-4348.
+
* {{статья | автор = Samejima K. et al. | заглавие = Representation of action-specific reward values in the striatum | издание = Science | год = 2005 | том = 310 | номер = 5752 }}
-
# Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism // Journal of Cognitive Neuroscience. — 2005. — Vol. 17(1). — P. 51-72.
+
* {{статья | автор = Frank M. J. | заглавие = Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism | издание = Journal of cognitive neuroscience | год = 2005 | том = 17 | номер = 1 }}
-
# Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward // Science. — 1997. — Vol. 275(5306). — P. 1593-1599.
+
* {{статья | автор = Schultz W., Dayan P., Montague P. R. | заглавие = A neural substrate of prediction and reward | издание = Science | год = 1997 | том = 275 | номер = 5306 }}
-
# Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995. — P. 215-232.
+
* {{статья | автор = Barto A. G. | заглавие = Adaptive critics and the basal ganglia | издание = Models of information processing in the basal ganglia | издательство = MIT Press | год = 1995 }}
-
# Sutton R. S., Barto A. G. Reinforcement learning: An introduction. — MIT press, 2018.
+
* {{статья | actor = Sutton R. S. et al. | заглавие = Reinforcement learning: An introduction | место = Cambridge | издательство = MIT press | год = 1998 | том = 1 | номер = 1 }}

Версия 22:25, 18 июля 2026

Статья написана с использованием LLM и проверена участником Arina Pakalova 10:54, 26 июня 2026 (MSD)


Содержание

Формализация Q-обучения и его нейробиологический аналог

Q-обучение (Q-learning) — это один из базовых алгоритмов обучения с подкреплением без модели среды (model-free). Его целью является нахождение оптимальной стратегии путем оценки функции ценности действия Q(s, a). Эта функция определяет ожидаемую совокупную награду (return), которую агент получит, выполнив действие a в состоянии s, и затем действуя оптимально.

С точки зрения вычислительной нейробиологии, табличная матрица Q, которую алгоритм поддерживает в памяти, имеет прямое биологическое воплощение. Нейробиологическим субстратом, кодирующим Q(s, a), является дорсальный стриатум (хвостатое ядро и скорлупа) [1]. Спайкинг-активность специфических популяций средних шипиковых нейронов (MSNs) стриатума пропорциональна величине Q(s, a) для конкретного моторного акта. Таким образом, алгоритмическая матрица ценностей в машинном обучении концептуально изоморфна карте синаптических весов в базальных ганглиях мозга, где каждое состояние-действие представлено своей ансамблевой активностью [1].

Ошибка временных различий и сигнал дофамина

Математическим двигателем Q-обучения является ошибка временных различий (Temporal Difference error, TD-error), обозначаемая как \delta. В дискретном времени уравнение Беллмана для \delta записывается как: \delta = r + \gamma \max_{a'} Q(s', a') - Q(s, a), где r — мгновенная награда, \gamma \in [0, 1)фактор дисконтирования, s' — новое состояние после совершения действия. Суть формулы заключается в бутстрэппинге (bootstrap): текущая оценка Q(s, a) корректируется на разницу между фактически полученным (или предсказанным на будущий шаг) и ожидаемым результатом.

В нейробиологии данный математический конструкт получил название ошибки предсказания награды (Reward Prediction Error, RPE). Классические эксперименты Вольфрама Шульца показали, что фазическая активность дофаминовых нейронов среднего мозга (VTA и SNc) математически эквивалентна сигналу \delta [1]. Дофамин не кодирует саму награду: всплеск его выброса (\delta > 0) происходит только при получении награды лучше ожидаемой; предсказуемая награда не вызывает реакции (\delta = 0); а отсутствие ожидаемой награды ведет к падению активности ниже базового уровня (\delta < 0). В контексте алгоритма дофамин выступает как глобальный множитель ошибки (global error signal), необходимый для обновления весов.

Пошаговая логика и стохастическая политика

Обновление значений в классическом алгоритме происходит по правилу градиентного спуска: Q(s, a) \leftarrow Q(s, a) + \alpha \delta, где \alpha \in (0, 1]скорость обучения (learning rate), определяющая размер шага корректировки оценки.

Для баланса между исследованием среды (exploration) и использованием найденного опыта (exploitation) в машинном обучении часто применяют epsilon-жадную стратегию. Однако она подразумевает абсолютно случайные выборы с вероятностью \epsilon, что плохо согласуется с биологическим поведением. Более реалистичной и математически обоснованной альтернативой является распределение Гиббса (политика Больцмана), где вероятность выбора действия вычисляется на основе его текущей ценности с помощью функции Softmax: P(a|s) = \frac{\exp(Q(s,a) / \tau)}{\sum_{a' \in A} \exp(Q(s,a') / \tau)}, Здесь параметр \tau > 0 (температура) контролирует уровень стохастичности: при высоких \tau действия выбираются почти равновероятно (чистое исследование), а при \tau \to 0 алгоритм вырождается в жадный выбор (чистое использование). Биологически этот параметр интерпретируется как уровень стохастического шума в нейронных сетях моторной коры и базальных ганглиев.

Псевдокод цикла Q-обучения с политикой Больцмана:

Инициализация Q(s, a) = 0 для всех s, a
ДЛЯ каждого эпизода:
    Инициализация начального состояния s
    ПОКА s не является терминальным:
        // Выбор действия на основе Softmax
        ВЫЧИСЛИТЬ P(a|s) для всех a
        ВЫБРАТЬ действие a стохастически согласно P(a|s)
        // Взаимодействие со средой
        ВЫПОЛНИТЬ a, получить награду r, перейти в состояние s'
        // Вычисление ошибки предсказания (TD-error)
        ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a)
        // Обновление функции ценности
        ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta
        s = s'
    КОНЕЦ ПОКА
КОНЕЦ ДЛЯ


Ограничения табличного подхода и архитектура Actor-Critic

Базовое табличное Q-обучение сталкивается с серьезными вычислительными ограничениями при решении реальных задач. Главная проблема — проклятие размерности: алгоритм требует хранения отдельной оценки для каждой пары «состояние-действие». В средах с непрерывным пространством состояний (например, управление роботом-манипулятором) или при асинхронном поступлении стимулов таблица становится бесконечной. Кроме того, оператор максимизации \max_{a'} Q(s', a') делает алгоритм off-policy (целевая политика отличается от поведенческой), что может приводить к переоценке ценностей (overestimation bias).

В машинном обучении эти проблемы решаются переходом к аппроксимации функций (например, с помощью нейросетей) и декомпозиции архитектуры на Actor-Critic. Вместо одной таблицы Q выделяются две структуры:

При этом ошибка обновляется относительно критика: \delta = r + \gamma V(s') - V(s). Эта же ошибка \delta используется для настройки параметров Актера.

Интересно, что нервная система эволюционно пришла к точно такой же архитектурной декомпозиции [1]. Биологическим аналогом Критика выступает вентральный стриатум (оценка того, насколько хорошо текущее состояние), а Актера — дорсальный стриатум (выбор конкретного действия). Единый дофаминергический сигнал \delta одновременно модулирует синаптическую пластичность в обеих структурах. Такая организация позволяет мозгу и сложным RL-алгоритмам использовать методы временных различий с функциональной аппроксимацией, эффективно решая задачу кредитования награды (credit assignment) в длинных непрерывных последовательностях действий [1].

См. также

Примечания

Литература

  • Samejima K. et al. Representation of action-specific reward values in the striatum // Science. — 2005. — Т. 310. — № 5752.
  • Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism // Journal of cognitive neuroscience. — 2005. — Т. 17. — № 1.
  • Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward // Science. — 1997. — Т. 275. — № 5306.
  • Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995.
  • Reinforcement learning: An introduction. — Cambridge: MIT press, 1998. — Т. 1. — № 1.
Личные инструменты