Q-обучение
Материал из MachineLearning.
| Строка 1: | Строка 1: | ||
{{well|Статья написана с использованием LLM и проверена участником [[Участник:Arina Pakalova|Arina Pakalova]] 10:54, 26 июня 2026 (MSD)}} | {{well|Статья написана с использованием LLM и проверена участником [[Участник:Arina Pakalova|Arina Pakalova]] 10:54, 26 июня 2026 (MSD)}} | ||
| - | == | + | == Формализация Q-обучения и его нейробиологический аналог == |
| - | + | Q-обучение (Q-learning) — это один из базовых алгоритмов [[Обучение с подкреплением|обучения с подкреплением]] без модели среды (model-free). Его целью является нахождение оптимальной стратегии путем оценки [[Функция ценности действия|функции ценности действия]] <tex>Q(s, a)</tex>. Эта функция определяет ожидаемую совокупную награду (return), которую агент получит, выполнив действие <tex>a</tex> в состоянии <tex>s</tex>, и затем действуя оптимально. | |
| - | == Ошибка | + | С точки зрения вычислительной нейробиологии, табличная матрица <tex>Q</tex>, которую алгоритм поддерживает в памяти, имеет прямое биологическое воплощение. Нейробиологическим субстратом, кодирующим <tex>Q(s, a)</tex>, является дорсальный стриатум (хвостатое ядро и скорлупа) <ref>Samejima K. et al. Representation of action-specific reward values in the striatum //Science. – 2005. – Т. 310. – №. 5752.</ref>. Спайкинг-активность специфических популяций средних шипиковых нейронов (MSNs) стриатума пропорциональна величине <tex>Q(s, a)</tex> для конкретного моторного акта. Таким образом, алгоритмическая матрица ценностей в [[Машинное обучение|машинном обучении]] концептуально изоморфна карте синаптических весов в базальных ганглиях мозга, где каждое состояние-действие представлено своей ансамблевой активностью <ref>Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism //Journal of cognitive neuroscience. – 2005. – Т. 17. – №. 1.</ref>. |
| - | + | ||
| + | == Ошибка временных различий и сигнал дофамина == | ||
| + | Математическим двигателем Q-обучения является [[Временные различия|ошибка временных различий]] (Temporal Difference error, TD-error), обозначаемая как <tex>\delta</tex>. В дискретном времени [[Уравнение Беллмана|уравнение Беллмана]] для <tex>\delta</tex> записывается как: | ||
<tex>\delta = r + \gamma \max_{a'} Q(s', a') - Q(s, a)</tex>, | <tex>\delta = r + \gamma \max_{a'} Q(s', a') - Q(s, a)</tex>, | ||
| - | где <tex>r</tex> — | + | где <tex>r</tex> — мгновенная награда, <tex>\gamma \in [0, 1)</tex> — [[Фактор дисконтирования|фактор дисконтирования]], <tex>s'</tex> — новое состояние после совершения действия. Суть формулы заключается в [[Бутстрэппинг|бутстрэппинге]] (bootstrap): текущая оценка <tex>Q(s, a)</tex> корректируется на разницу между фактически полученным (или предсказанным на будущий шаг) и ожидаемым результатом. |
| - | + | В нейробиологии данный математический конструкт получил название [[Ошибка предсказания награды|ошибки предсказания награды]] (Reward Prediction Error, RPE). Классические эксперименты Вольфрама Шульца показали, что фазическая активность дофаминовых нейронов среднего мозга (VTA и SNc) математически эквивалентна сигналу <tex>\delta</tex> <ref>Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward //Science. – 1997. – Т. 275. – №. 5306.</ref>. Дофамин не кодирует саму награду: всплеск его выброса (<tex>\delta > 0</tex>) происходит только при получении награды лучше ожидаемой; предсказуемая награда не вызывает реакции (<tex>\delta = 0</tex>); а отсутствие ожидаемой награды ведет к падению активности ниже базового уровня (<tex>\delta < 0</tex>). В контексте алгоритма дофамин выступает как глобальный множитель ошибки (global error signal), необходимый для обновления весов. | |
| - | + | ||
| + | == Пошаговая логика и стохастическая политика == | ||
| + | Обновление значений в классическом алгоритме происходит по правилу [[Градиентный спуск|градиентного спуска]]: | ||
<tex>Q(s, a) \leftarrow Q(s, a) + \alpha \delta</tex>, | <tex>Q(s, a) \leftarrow Q(s, a) + \alpha \delta</tex>, | ||
| - | где <tex>\alpha \in (0, 1]</tex> — скорость обучения, | + | где <tex>\alpha \in (0, 1]</tex> — [[Скорость обучения|скорость обучения]] (learning rate), определяющая размер шага корректировки оценки. |
| - | Для | + | Для баланса между исследованием среды (exploration) и использованием найденного опыта (exploitation) в машинном обучении часто применяют [[Epsilon-жадная стратегия|epsilon-жадную стратегию]]. Однако она подразумевает абсолютно случайные выборы с вероятностью <tex>\epsilon</tex>, что плохо согласуется с биологическим поведением. Более реалистичной и математически обоснованной альтернативой является [[Политика Больцмана|распределение Гиббса (политика Больцмана)]], где вероятность выбора действия вычисляется на основе его текущей ценности с помощью функции [[Softmax|Softmax]]: |
<tex>P(a|s) = \frac{\exp(Q(s,a) / \tau)}{\sum_{a' \in A} \exp(Q(s,a') / \tau)}</tex>, | <tex>P(a|s) = \frac{\exp(Q(s,a) / \tau)}{\sum_{a' \in A} \exp(Q(s,a') / \tau)}</tex>, | ||
| - | + | Здесь параметр <tex>\tau > 0</tex> (температура) контролирует уровень стохастичности: при высоких <tex>\tau</tex> действия выбираются почти равновероятно (чистое исследование), а при <tex>\tau \to 0</tex> алгоритм вырождается в [[Жадная стратегия|жадный выбор]] (чистое использование). Биологически этот параметр интерпретируется как уровень стохастического шума в нейронных сетях моторной коры и базальных ганглиев. | |
| + | |||
| + | Псевдокод цикла Q-обучения с политикой Больцмана: | ||
| + | Инициализация Q(s, a) = 0 для всех s, a | ||
| + | ДЛЯ каждого эпизода: | ||
| + | Инициализация начального состояния s | ||
| + | ПОКА s не является терминальным: | ||
| + | // Выбор действия на основе Softmax | ||
| + | ВЫЧИСЛИТЬ P(a|s) для всех a | ||
| + | ВЫБРАТЬ действие a стохастически согласно P(a|s) | ||
| + | // Взаимодействие со средой | ||
| + | ВЫПОЛНИТЬ a, получить награду r, перейти в состояние s' | ||
| + | // Вычисление ошибки предсказания (TD-error) | ||
| + | ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a) | ||
| + | // Обновление функции ценности | ||
| + | ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta | ||
| + | s = s' | ||
| + | КОНЕЦ ПОКА | ||
| + | КОНЕЦ ДЛЯ | ||
| + | |||
| + | |||
| + | == Ограничения табличного подхода и архитектура Actor-Critic == | ||
| + | Базовое табличное Q-обучение сталкивается с серьезными вычислительными ограничениями при решении реальных задач. Главная проблема — [[Проклятие размерности|проклятие размерности]]: алгоритм требует хранения отдельной оценки для каждой пары «состояние-действие». В средах с непрерывным пространством состояний (например, управление роботом-манипулятором) или при асинхронном поступлении стимулов таблица становится бесконечной. Кроме того, оператор максимизации <tex>\max_{a'} Q(s', a')</tex> делает алгоритм [[Off-policy|off-policy]] (целевая политика отличается от поведенческой), что может приводить к [[Смещение переоценки|переоценке ценностей]] (overestimation bias). | ||
| - | + | В машинном обучении эти проблемы решаются переходом к [[Аппроксимация функций|аппроксимации функций]] (например, с помощью [[Нейронная сеть|нейросетей]]) и декомпозиции архитектуры на [[Actor-Critic|Actor-Critic]]. Вместо одной таблицы <tex>Q</tex> выделяются две структуры: | |
| + | * '''Critic (критик)''': оценивает ценность самого состояния <tex>V(s)</tex> (см. [[Функция ценности состояния|функцию ценности состояния]]), а не конкретных действий. | ||
| + | * '''Actor (актер)''': формирует [[Вероятностная стратегия|вероятностную политику]] выбора действий <tex>\pi(a|s)</tex>. | ||
| - | + | При этом ошибка обновляется относительно критика: <tex>\delta = r + \gamma V(s') - V(s)</tex>. Эта же ошибка <tex>\delta</tex> используется для настройки параметров Актера. | |
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| - | + | ||
| + | Интересно, что нервная система эволюционно пришла к точно такой же архитектурной декомпозиции <ref>Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995.</ref>. Биологическим аналогом Критика выступает вентральный стриатум (оценка того, насколько хорошо текущее состояние), а Актера — дорсальный стриатум (выбор конкретного действия). Единый дофаминергический сигнал <tex>\delta</tex> одновременно модулирует синаптическую пластичность в обеих структурах. Такая организация позволяет мозгу и сложным RL-алгоритмам использовать методы временных различий с функциональной аппроксимацией, эффективно решая задачу [[Кредитование награды|кредитования награды]] (credit assignment) в длинных непрерывных последовательностях действий <ref>Sutton R. S. et al. Reinforcement learning: An introduction. – Cambridge : MIT press, 1998. – Т. 1. – №. 1.</ref>. | ||
| - | == | + | == См. также == |
| - | + | * [[Обучение с подкреплением]] | |
| + | * [[Однорукий бандит]] | ||
| + | * [[Актёр-критик]] | ||
| + | * [[Policy gradient]] | ||
| + | * [[Компромисс обучение-применение]] | ||
| - | + | == Примечания == | |
| - | + | {{примечания}} | |
| - | + | ||
== Литература == | == Литература == | ||
| - | + | * {{статья | автор = Samejima K. et al. | заглавие = Representation of action-specific reward values in the striatum | издание = Science | год = 2005 | том = 310 | номер = 5752 }} | |
| - | + | * {{статья | автор = Frank M. J. | заглавие = Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism | издание = Journal of cognitive neuroscience | год = 2005 | том = 17 | номер = 1 }} | |
| - | + | * {{статья | автор = Schultz W., Dayan P., Montague P. R. | заглавие = A neural substrate of prediction and reward | издание = Science | год = 1997 | том = 275 | номер = 5306 }} | |
| - | + | * {{статья | автор = Barto A. G. | заглавие = Adaptive critics and the basal ganglia | издание = Models of information processing in the basal ganglia | издательство = MIT Press | год = 1995 }} | |
| - | + | * {{статья | actor = Sutton R. S. et al. | заглавие = Reinforcement learning: An introduction | место = Cambridge | издательство = MIT press | год = 1998 | том = 1 | номер = 1 }} | |
Версия 22:25, 18 июля 2026
| | Статья написана с использованием LLM и проверена участником Arina Pakalova 10:54, 26 июня 2026 (MSD) |
Содержание |
Формализация Q-обучения и его нейробиологический аналог
Q-обучение (Q-learning) — это один из базовых алгоритмов обучения с подкреплением без модели среды (model-free). Его целью является нахождение оптимальной стратегии путем оценки функции ценности действия . Эта функция определяет ожидаемую совокупную награду (return), которую агент получит, выполнив действие
в состоянии
, и затем действуя оптимально.
С точки зрения вычислительной нейробиологии, табличная матрица , которую алгоритм поддерживает в памяти, имеет прямое биологическое воплощение. Нейробиологическим субстратом, кодирующим
, является дорсальный стриатум (хвостатое ядро и скорлупа) [1]. Спайкинг-активность специфических популяций средних шипиковых нейронов (MSNs) стриатума пропорциональна величине
для конкретного моторного акта. Таким образом, алгоритмическая матрица ценностей в машинном обучении концептуально изоморфна карте синаптических весов в базальных ганглиях мозга, где каждое состояние-действие представлено своей ансамблевой активностью [1].
Ошибка временных различий и сигнал дофамина
Математическим двигателем Q-обучения является ошибка временных различий (Temporal Difference error, TD-error), обозначаемая как . В дискретном времени уравнение Беллмана для
записывается как:
,
где
— мгновенная награда,
— фактор дисконтирования,
— новое состояние после совершения действия. Суть формулы заключается в бутстрэппинге (bootstrap): текущая оценка
корректируется на разницу между фактически полученным (или предсказанным на будущий шаг) и ожидаемым результатом.
В нейробиологии данный математический конструкт получил название ошибки предсказания награды (Reward Prediction Error, RPE). Классические эксперименты Вольфрама Шульца показали, что фазическая активность дофаминовых нейронов среднего мозга (VTA и SNc) математически эквивалентна сигналу [1]. Дофамин не кодирует саму награду: всплеск его выброса (
) происходит только при получении награды лучше ожидаемой; предсказуемая награда не вызывает реакции (
); а отсутствие ожидаемой награды ведет к падению активности ниже базового уровня (
). В контексте алгоритма дофамин выступает как глобальный множитель ошибки (global error signal), необходимый для обновления весов.
Пошаговая логика и стохастическая политика
Обновление значений в классическом алгоритме происходит по правилу градиентного спуска:
,
где
— скорость обучения (learning rate), определяющая размер шага корректировки оценки.
Для баланса между исследованием среды (exploration) и использованием найденного опыта (exploitation) в машинном обучении часто применяют epsilon-жадную стратегию. Однако она подразумевает абсолютно случайные выборы с вероятностью , что плохо согласуется с биологическим поведением. Более реалистичной и математически обоснованной альтернативой является распределение Гиббса (политика Больцмана), где вероятность выбора действия вычисляется на основе его текущей ценности с помощью функции Softmax:
,
Здесь параметр
(температура) контролирует уровень стохастичности: при высоких
действия выбираются почти равновероятно (чистое исследование), а при
алгоритм вырождается в жадный выбор (чистое использование). Биологически этот параметр интерпретируется как уровень стохастического шума в нейронных сетях моторной коры и базальных ганглиев.
Псевдокод цикла Q-обучения с политикой Больцмана:
Инициализация Q(s, a) = 0 для всех s, a
ДЛЯ каждого эпизода:
Инициализация начального состояния s
ПОКА s не является терминальным:
// Выбор действия на основе Softmax
ВЫЧИСЛИТЬ P(a|s) для всех a
ВЫБРАТЬ действие a стохастически согласно P(a|s)
// Взаимодействие со средой
ВЫПОЛНИТЬ a, получить награду r, перейти в состояние s'
// Вычисление ошибки предсказания (TD-error)
ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a)
// Обновление функции ценности
ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta
s = s'
КОНЕЦ ПОКА
КОНЕЦ ДЛЯ
Ограничения табличного подхода и архитектура Actor-Critic
Базовое табличное Q-обучение сталкивается с серьезными вычислительными ограничениями при решении реальных задач. Главная проблема — проклятие размерности: алгоритм требует хранения отдельной оценки для каждой пары «состояние-действие». В средах с непрерывным пространством состояний (например, управление роботом-манипулятором) или при асинхронном поступлении стимулов таблица становится бесконечной. Кроме того, оператор максимизации делает алгоритм off-policy (целевая политика отличается от поведенческой), что может приводить к переоценке ценностей (overestimation bias).
В машинном обучении эти проблемы решаются переходом к аппроксимации функций (например, с помощью нейросетей) и декомпозиции архитектуры на Actor-Critic. Вместо одной таблицы выделяются две структуры:
- Critic (критик): оценивает ценность самого состояния
(см. функцию ценности состояния), а не конкретных действий.
- Actor (актер): формирует вероятностную политику выбора действий
.
При этом ошибка обновляется относительно критика: . Эта же ошибка
используется для настройки параметров Актера.
Интересно, что нервная система эволюционно пришла к точно такой же архитектурной декомпозиции [1]. Биологическим аналогом Критика выступает вентральный стриатум (оценка того, насколько хорошо текущее состояние), а Актера — дорсальный стриатум (выбор конкретного действия). Единый дофаминергический сигнал одновременно модулирует синаптическую пластичность в обеих структурах. Такая организация позволяет мозгу и сложным RL-алгоритмам использовать методы временных различий с функциональной аппроксимацией, эффективно решая задачу кредитования награды (credit assignment) в длинных непрерывных последовательностях действий [1].
См. также
- Обучение с подкреплением
- Однорукий бандит
- Актёр-критик
- Policy gradient
- Компромисс обучение-применение
Примечания
Литература
- Samejima K. et al. Representation of action-specific reward values in the striatum // Science. — 2005. — Т. 310. — № 5752.
- Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism // Journal of cognitive neuroscience. — 2005. — Т. 17. — № 1.
- Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward // Science. — 1997. — Т. 275. — № 5306.
- Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995.
- Reinforcement learning: An introduction. — Cambridge: MIT press, 1998. — Т. 1. — № 1.

