Q-обучение
Материал из MachineLearning.
| Строка 1: | Строка 1: | ||
| - | {{well|Статья написана с использованием LLM и проверена участником [[Участник:Arina Pakalova|Arina Pakalova]] 10:54, 26 июня 2026 (MSD)}} | + | {{well|Статья написана с использованием LLM '''GLM-5-Turbo''' и проверена участником [[Участник:Arina Pakalova|Arina Pakalova]] 10:54, 26 июня 2026 (MSD)}} |
== Формализация Q-обучения и его нейробиологический аналог == | == Формализация Q-обучения и его нейробиологический аналог == | ||
Текущая версия
| | Статья написана с использованием LLM GLM-5-Turbo и проверена участником Arina Pakalova 10:54, 26 июня 2026 (MSD) |
Содержание |
Формализация Q-обучения и его нейробиологический аналог
Q-обучение (Q-learning) — это один из базовых алгоритмов обучения с подкреплением без модели среды (model-free). Его целью является нахождение оптимальной стратегии путем оценки функции ценности действия . Эта функция определяет ожидаемую совокупную награду (return), которую агент получит, выполнив действие
в состоянии
, и затем действуя оптимально.
С точки зрения вычислительной нейробиологии, табличная матрица , которую алгоритм поддерживает в памяти, имеет прямое биологическое воплощение. Нейробиологическим субстратом, кодирующим
, является дорсальный стриатум (хвостатое ядро и скорлупа) [1]. Спайкинг-активность специфических популяций средних шипиковых нейронов (MSNs) стриатума пропорциональна величине
для конкретного моторного акта. Таким образом, алгоритмическая матрица ценностей в машинном обучении концептуально изоморфна карте синаптических весов в базальных ганглиях мозга, где каждое состояние-действие представлено своей ансамблевой активностью [1].
Ошибка временных различий и сигнал дофамина
Математическим двигателем Q-обучения является ошибка временных различий (Temporal Difference error, TD-error), обозначаемая как . В дискретном времени уравнение Беллмана для
записывается как:
,
где
— мгновенная награда,
— фактор дисконтирования,
— новое состояние после совершения действия. Суть формулы заключается в бутстрэппинге (bootstrap): текущая оценка
корректируется на разницу между фактически полученным (или предсказанным на будущий шаг) и ожидаемым результатом.
В нейробиологии данный математический конструкт получил название ошибки предсказания награды (Reward Prediction Error, RPE). Классические эксперименты Вольфрама Шульца показали, что фазическая активность дофаминовых нейронов среднего мозга (VTA и SNc) математически эквивалентна сигналу [1]. Дофамин не кодирует саму награду: всплеск его выброса (
) происходит только при получении награды лучше ожидаемой; предсказуемая награда не вызывает реакции (
); а отсутствие ожидаемой награды ведет к падению активности ниже базового уровня (
). В контексте алгоритма дофамин выступает как глобальный множитель ошибки (global error signal), необходимый для обновления весов.
Пошаговая логика и стохастическая политика
Обновление значений в классическом алгоритме происходит по правилу градиентного спуска:
,
где
— скорость обучения (learning rate), определяющая размер шага корректировки оценки.
Для баланса между исследованием среды (exploration) и использованием найденного опыта (exploitation) в машинном обучении часто применяют epsilon-жадную стратегию. Однако она подразумевает абсолютно случайные выборы с вероятностью , что плохо согласуется с биологическим поведением. Более реалистичной и математически обоснованной альтернативой является распределение Гиббса (политика Больцмана), где вероятность выбора действия вычисляется на основе его текущей ценности с помощью функции Softmax:
,
Здесь параметр
(температура) контролирует уровень стохастичности: при высоких
действия выбираются почти равновероятно (чистое исследование), а при
алгоритм вырождается в жадный выбор (чистое использование). Биологически этот параметр интерпретируется как уровень стохастического шума в нейронных сетях моторной коры и базальных ганглиев.
Псевдокод цикла Q-обучения с политикой Больцмана:
Инициализация Q(s, a) = 0 для всех s, a
ДЛЯ каждого эпизода:
Инициализация начального состояния s
ПОКА s не является терминальным:
// Выбор действия на основе Softmax
ВЫЧИСЛИТЬ P(a|s) для всех a
ВЫБРАТЬ действие a стохастически согласно P(a|s)
// Взаимодействие со средой
ВЫПОЛНИТЬ a, получить награду r, перейти в состояние s'
// Вычисление ошибки предсказания (TD-error)
ВЫЧИСЛИТЬ delta = r + gamma * max_a'(Q(s', a')) - Q(s, a)
// Обновление функции ценности
ОБНОВИТЬ Q(s, a) = Q(s, a) + alpha * delta
s = s'
КОНЕЦ ПОКА
КОНЕЦ ДЛЯ
Ограничения табличного подхода и архитектура Actor-Critic
Базовое табличное Q-обучение сталкивается с серьезными вычислительными ограничениями при решении реальных задач. Главная проблема — проклятие размерности: алгоритм требует хранения отдельной оценки для каждой пары «состояние-действие». В средах с непрерывным пространством состояний (например, управление роботом-манипулятором) или при асинхронном поступлении стимулов таблица становится бесконечной. Кроме того, оператор максимизации делает алгоритм off-policy (целевая политика отличается от поведенческой), что может приводить к переоценке ценностей (overestimation bias).
В машинном обучении эти проблемы решаются переходом к аппроксимации функций (например, с помощью нейросетей) и декомпозиции архитектуры на Actor-Critic. Вместо одной таблицы выделяются две структуры:
- Critic (критик): оценивает ценность самого состояния
(см. функцию ценности состояния), а не конкретных действий.
- Actor (актер): формирует вероятностную политику выбора действий
.
При этом ошибка обновляется относительно критика: . Эта же ошибка
используется для настройки параметров Актера.
Интересно, что нервная система эволюционно пришла к точно такой же архитектурной декомпозиции [1]. Биологическим аналогом Критика выступает вентральный стриатум (оценка того, насколько хорошо текущее состояние), а Актера — дорсальный стриатум (выбор конкретного действия). Единый дофаминергический сигнал одновременно модулирует синаптическую пластичность в обеих структурах. Такая организация позволяет мозгу и сложным RL-алгоритмам использовать методы временных различий с функциональной аппроксимацией, эффективно решая задачу кредитования награды (credit assignment) в длинных непрерывных последовательностях действий [1].
См. также
- Обучение с подкреплением
- Однорукий бандит
- Актёр-критик
- Policy gradient
- Компромисс обучение-применение
Примечания
Литература
- Samejima K. et al. Representation of action-specific reward values in the striatum // Science. — 2005. — Т. 310. — № 5752.
- Frank M. J. Dynamic dopamine modulation in the basal ganglia: a neurocomputational account of cognitive deficits in medicated and nonmedicated Parkinsonism // Journal of cognitive neuroscience. — 2005. — Т. 17. — № 1.
- Schultz W., Dayan P., Montague P. R. A neural substrate of prediction and reward // Science. — 1997. — Т. 275. — № 5306.
- Barto A. G. Adaptive critics and the basal ganglia // Models of information processing in the basal ganglia. — MIT Press, 1995.
- Reinforcement learning: An introduction. — Cambridge: MIT press, 1998. — Т. 1. — № 1.

