Policy gradient
Материал из MachineLearning.
(Новая: {{well|Статья написана с использованием LLM и проверена участником ~~~ 10:54, 26 июня 2026 (MSD)}} == Общее описание Po...) |
|||
| Строка 3: | Строка 3: | ||
== Общее описание Policy Gradient == | == Общее описание Policy Gradient == | ||
| - | Методы Policy Gradient (PG) представляют собой класс алгоритмов обучения с подкреплением, в которых оптимизация производится напрямую по параметрам стратегии <tex>\pi_\theta(a|s)</tex>, задающей вероятность или плотность распределения действия <tex>a</tex> в состоянии <tex>s</tex>. В отличие от value-based методов, требующих дискретизации пространства действий или сложной архитектуры для непрерывных доменов, PG естественным образом работает с многомерными непрерывными пространствами, что делает их базовым инструментом для управления робототехническими манипуляторами, где действие — это вектор суставных моментов или скоростей <ref name="sutton">Sutton | + | Методы Policy Gradient (PG) представляют собой класс алгоритмов обучения с подкреплением, в которых оптимизация производится напрямую по параметрам стратегии <tex>\pi_\theta(a|s)</tex>, задающей вероятность или плотность распределения действия <tex>a</tex> в состоянии <tex>s</tex>. В отличие от value-based методов, требующих дискретизации пространства действий или сложной архитектуры для непрерывных доменов, PG естественным образом работает с многомерными непрерывными пространствами, что делает их базовым инструментом для управления робототехническими манипуляторами, где действие — это вектор суставных моментов или скоростей <ref name="sutton">Sutton R. S. et al. Reinforcement learning: An introduction. – Cambridge : MIT press, 1998. – Т. 1. – №. 1.</ref>. |
Целью оптимизации является максимизация математического ожидания совокупной награды (objective function): | Целью оптимизации является максимизация математического ожидания совокупной награды (objective function): | ||
| Строка 19: | Строка 19: | ||
Использование полного возврата траектории <tex>R(\tau)</tex> в качестве оценки качества каждого шага порождает критическую проблему высокой дисперсии градиентной оценки. В контактной динамике (например, при захвате объекта роботом-манипулятором) финальная награда может быть получена только в конце эпизода. При этом стохастичность начальных условий, трения и задержек контроллеров приводит к тому, что идентичные действия в одном и том же состоянии в разных траекториях могут получить кардинально разные оценки <tex>R(\tau)</tex>. | Использование полного возврата траектории <tex>R(\tau)</tex> в качестве оценки качества каждого шага порождает критическую проблему высокой дисперсии градиентной оценки. В контактной динамике (например, при захвате объекта роботом-манипулятором) финальная награда может быть получена только в конце эпизода. При этом стохастичность начальных условий, трения и задержек контроллеров приводит к тому, что идентичные действия в одном и том же состоянии в разных траекториях могут получить кардинально разные оценки <tex>R(\tau)</tex>. | ||
| - | Высокая дисперсия градиента на реальном оборудовании означает разброс обновлений параметров: одно удачное столкновение с инерцией объекта может заставить алгоритм считать угловую скорость безопасной, в то время как в 99% случаев она ведет к разрушению механики. Для сведения дисперсии к приемлемому для физики уровню применяются два фундаментальных приема <ref name="greensmith">Greensmith | + | Высокая дисперсия градиента на реальном оборудовании означает разброс обновлений параметров: одно удачное столкновение с инерцией объекта может заставить алгоритм считать угловую скорость безопасной, в то время как в 99% случаев она ведет к разрушению механики. Для сведения дисперсии к приемлемому для физики уровню применяются два фундаментальных приема <ref name="greensmith">Greensmith E., Bartlett P. L., Baxter J. Variance reduction techniques for gradient estimates in reinforcement learning //Journal of Machine Learning Research. – 2004. – Т. 5. – №. Nov.</ref>: |
| - | + | # '''Введение базовой оценки (baseline) <tex>b(s_t)</tex>''': Вычитание константы или функции состояния из возврата не смещает градиент, но радикально снижает дисперсию. В качестве <tex>b(s_t)</tex> используется функция ценности <tex>V(s_t)</tex>. | |
| - | + | # '''Учет причинности (Causality)''': Действие в момент <tex>t</tex> не может повлиять на награду, полученную до этого момента. Поэтому вместо <tex>R(\tau)</tex> используется возврат с текущего шага (reward-to-go): <tex>\hat{R}_t = \sum_{k=t}^T \gamma^{k-t} r_k</tex>. | |
Модифицированная оценка градиента принимает вид: | Модифицированная оценка градиента принимает вид: | ||
| Строка 30: | Строка 30: | ||
== Пошаговая логика вычислений == | == Пошаговая логика вычислений == | ||
| - | В современной практике чистый PG (алгоритм REINFORCE <ref name="williams">Williams | + | В современной практике чистый PG (алгоритм REINFORCE <ref name="williams">Williams R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning //Machine learning. – 1992. – Т. 8. – №. 3.</ref>) практически не применяется из-за неэффективности использования данных. Стандартом вычислений является вариация с обобщенной оценкой преимущества (Generalized Advantage Estimation, GAE) <ref name="gae">Kochenderfer M. J., Wheeler T. A., Wray K. H. Algorithms for decision making. – MIT press, 2022.</ref>. Логика вычислений в рамках одного эпохального обновления: |
| - | + | # '''Сбор данных'''. В симуляторе параллельно генерируется <tex>N</tex> траекторий с помощью текущей политики <tex>\pi_\theta</tex>. Фиксируется последовательность <tex>(s_t, a_t, r_t, s_{t+1})</tex>. | |
| - | + | # '''Вычисление TD-ошибок (Temporal Difference)'''. На каждом шаге вычисляется <tex>\delta_t = r_t + \gamma V_\phi(s_{t+1}) - V_\phi(s_t)</tex>, где <tex>V_\phi</tex> — функция ценности (критик), обучаемая параллельно методом градиентного спуска по среднеквадратичной ошибке. | |
| - | + | # '''Расчет преимущества (Advantage)'''. Вычисляется экспоненциально взвешенная сумма TD-ошибок: | |
<tex>\hat{A}_t^{\text{GAE}(\gamma, \lambda)} = \sum_{l=0}^{T-t} (\gamma \lambda)^l \delta_{t+l}</tex>. | <tex>\hat{A}_t^{\text{GAE}(\gamma, \lambda)} = \sum_{l=0}^{T-t} (\gamma \lambda)^l \delta_{t+l}</tex>. | ||
| - | Параметр <tex>\lambda \in [0, 1]</tex> управляет компромиссом между смещением (bias) и дисперсией. При <tex>\lambda=0</tex> оценка зависит только от одного шага (низкая дисперсия, высокое смещение), при <tex>\lambda=1</tex> вырождается в | + | Параметр <tex>\lambda \in [0, 1]</tex> управляет компромиссом между смещением (bias) и дисперсией. При <tex>\lambda=0</tex> оценка зависит только от одного шага (низкая дисперсия, высокое смещение), при <tex>\lambda=1</tex> вырождается в оценку Монте-Карло (нулевой bias, высокая дисперсия). В робототехнике типичное значение <tex>\lambda = 0.95</tex>. |
| - | + | # '''Формирование loss-функции'''. Поскольку оптимизаторы в фреймворках глубокого обучения минимизируют функцию потерь, градиентный подъем заменяется на спуск: | |
<tex>L_{\text{PG}}(\theta) = -\frac{1}{N \cdot T} \sum_{i=1}^N \sum_{t=0}^T \log \pi_\theta(a_{i,t}|s_{i,t}) \hat{A}_{i,t}</tex>. | <tex>L_{\text{PG}}(\theta) = -\frac{1}{N \cdot T} \sum_{i=1}^N \sum_{t=0}^T \log \pi_\theta(a_{i,t}|s_{i,t}) \hat{A}_{i,t}</tex>. | ||
| - | + | # '''Обновление весов'''. Вычисляется <tex>\nabla_\theta L_{\text{PG}}</tex> и делается шаг оптимизатора (например, Adam). | |
== Ограничения и практика == | == Ограничения и практика == | ||
| Строка 45: | Строка 45: | ||
Фундаментальное ограничение базового Policy Gradient — неспособность гарантировать монотонное улучшение политики при нетривиальном размере шага обучения. В задачах с жесткими физическими ограничениями (ограничения на тяговые моменты, рабочие области) произвольное изменение <tex>\theta</tex> может вывести распределение <tex>\pi_\theta</tex> за пределы устойчивого многообразия. В симуляторе это приводит к расхождению контактного решателя, на реальном оборудовании — к аварийному останову (E-stop) из-за превышения пороговых значений токов. | Фундаментальное ограничение базового Policy Gradient — неспособность гарантировать монотонное улучшение политики при нетривиальном размере шага обучения. В задачах с жесткими физическими ограничениями (ограничения на тяговые моменты, рабочие области) произвольное изменение <tex>\theta</tex> может вывести распределение <tex>\pi_\theta</tex> за пределы устойчивого многообразия. В симуляторе это приводит к расхождению контактного решателя, на реальном оборудовании — к аварийному останову (E-stop) из-за превышения пороговых значений токов. | ||
| - | По этой причине наивный PG заменяется алгоритмами с доверительными областями (Trust Region Policy Optimization, TRPO) или клиппированием вероятностей (Proximal Policy Optimization, PPO) <ref name=" | + | По этой причине наивный PG заменяется алгоритмами с доверительными областями (Trust Region Policy Optimization, TRPO) или клиппированием вероятностей (Proximal Policy Optimization, PPO) <ref name="ppo">Jin R., Li S., Wang B. On stationary point convergence of PPO-Clip //International Conference on Learning Representations. – 2024. – Т. 2024. </ref>. В PPO целевая функция модифицируется ограничителем: |
<tex>L^{\text{CLIP}}(\theta) = \mathbb{E}_t \left[ \min\left( \rho_t(\theta) \hat{A}_t, \, \text{clip}(\rho_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t \right) \right]</tex>, | <tex>L^{\text{CLIP}}(\theta) = \mathbb{E}_t \left[ \min\left( \rho_t(\theta) \hat{A}_t, \, \text{clip}(\rho_t(\theta), 1-\epsilon, 1+\epsilon) \hat{A}_t \right) \right]</tex>, | ||
где <tex>\rho_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)}</tex>, а <tex>\epsilon</tex> (обычно 0.1 или 0.2) жестко ограничивает отношение новых вероятностей к старым. Это предотвращает разрушительные обновления весов. | где <tex>\rho_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)}</tex>, а <tex>\epsilon</tex> (обычно 0.1 или 0.2) жестко ограничивает отношение новых вероятностей к старым. Это предотвращает разрушительные обновления весов. | ||
| - | С инженерной точки зрения PG-методы (в лице PPO) обладают критически низкой выборочной эффективностью (sample efficiency). Обучение контроллера пошагового перемещения манипулятора требует десятков миллионов кадров симуляции. Проблема усугубляется разрывом симуляции и реальности (sim-to-real gap): неточности моделирования трения скольжения и упругих деформаций приводят к тому, что политика, оптимизированная в градиенте симулятора, на реальном объекте теряет устойчивость. Практическим решением является инъекция доменного шума (Domain Randomization) в параметры физического движка на этапе сбора траекторий для PG, что делает градиент робастным к вариациям физических констант <ref name="tobin">Tobin | + | С инженерной точки зрения PG-методы (в лице PPO) обладают критически низкой выборочной эффективностью (sample efficiency). Обучение контроллера пошагового перемещения манипулятора требует десятков миллионов кадров симуляции. Проблема усугубляется разрывом симуляции и реальности (sim-to-real gap): неточности моделирования трения скольжения и упругих деформаций приводят к тому, что политика, оптимизированная в градиенте симулятора, на реальном объекте теряет устойчивость. Практическим решением является инъекция доменного шума (Domain Randomization) в параметры физического движка на этапе сбора траекторий для PG, что делает градиент робастным к вариациям физических констант <ref name="tobin">Tobin J. et al. Domain randomization for transferring deep neural networks from simulation to the real world //2017 IEEE/RSJ international conference on intelligent robots and systems (IROS). – IEEE, 2017.</ref>. |
| + | |||
| + | == Примечания == | ||
| + | {{примечания}} | ||
== Литература == | == Литература == | ||
| - | + | * {{статья | автор = Sutton R. S. et al. | заглавие = Reinforcement learning: An introduction | место = Cambridge | издательство = MIT press | год = 1998 | том = 1 | номер = 1 }} | |
| + | * {{статья | автор = Greensmith E., Bartlett P. L., Baxter J. | заглавие = Variance reduction techniques for gradient estimates in reinforcement learning | издание = Journal of Machine Learning Research | год = 2004 | том = 5 | номер = Nov. }} | ||
| + | * {{статья | автор = Williams R. J. | заглавие = Simple statistical gradient-following algorithms for connectionist reinforcement learning | издание = Machine learning | год = 1992 | том = 8 | номер = 3 }} | ||
| + | * {{статья | автор = Kochenderfer M. J., Wheeler T. A., Wray K. H. | заглавие = Algorithms for decision making | издательство = MIT press | год = 2022 }} | ||
| + | * {{статья | автор = Jin R., Li S., Wang B. | заглавие = On stationary point convergence of PPO-Clip | издание = International Conference on Learning Representations | год = 2024 | том = 2024 }} | ||
| + | * {{статья | автор = Tobin J. et al. | заглавие = Domain randomization for transferring deep neural networks from simulation to the real world | издание = 2017 IEEE/RSJ international conference on intelligent robots and systems (IROS) | издательство = IEEE | год = 2017 }} | ||
Версия 21:13, 18 июля 2026
| | Статья написана с использованием LLM и проверена участником Arina Pakalova 10:54, 26 июня 2026 (MSD) |
Содержание |
Общее описание Policy Gradient
Методы Policy Gradient (PG) представляют собой класс алгоритмов обучения с подкреплением, в которых оптимизация производится напрямую по параметрам стратегии , задающей вероятность или плотность распределения действия
в состоянии
. В отличие от value-based методов, требующих дискретизации пространства действий или сложной архитектуры для непрерывных доменов, PG естественным образом работает с многомерными непрерывными пространствами, что делает их базовым инструментом для управления робототехническими манипуляторами, где действие — это вектор суставных моментов или скоростей [1].
Целью оптимизации является максимизация математического ожидания совокупной награды (objective function):
,
где
— траектория,
— совместное распределение траекторий, зависящее от параметров
,
— коэффициент дисконтирования.
Базовая теорема политики градиента (Policy Gradient Theorem) позволяет выразить градиент целевой функции через градиент логарифма вероятности действия (log-likelihood ratio trick) [1]:
,
где
— возврат (return) всей траектории.
На практике в физическом симуляторе (например, MuJoCo) это означает, что мы запускаем эпизод, собираем временны́е ряды состояний и действий, а затем сдвигаем параметры сети в направлении, которое увеличивает вероятность действий, приведших к высокой суммарной награде.
Проблема высокой дисперсии
Использование полного возврата траектории в качестве оценки качества каждого шага порождает критическую проблему высокой дисперсии градиентной оценки. В контактной динамике (например, при захвате объекта роботом-манипулятором) финальная награда может быть получена только в конце эпизода. При этом стохастичность начальных условий, трения и задержек контроллеров приводит к тому, что идентичные действия в одном и том же состоянии в разных траекториях могут получить кардинально разные оценки
.
Высокая дисперсия градиента на реальном оборудовании означает разброс обновлений параметров: одно удачное столкновение с инерцией объекта может заставить алгоритм считать угловую скорость безопасной, в то время как в 99% случаев она ведет к разрушению механики. Для сведения дисперсии к приемлемому для физики уровню применяются два фундаментальных приема [1]:
- Введение базовой оценки (baseline)
: Вычитание константы или функции состояния из возврата не смещает градиент, но радикально снижает дисперсию. В качестве
используется функция ценности
.
- Учет причинности (Causality): Действие в момент
не может повлиять на награду, полученную до этого момента. Поэтому вместо
используется возврат с текущего шага (reward-to-go):
.
Модифицированная оценка градиента принимает вид:
,
где
— размер батча траекторий.
Пошаговая логика вычислений
В современной практике чистый PG (алгоритм REINFORCE [1]) практически не применяется из-за неэффективности использования данных. Стандартом вычислений является вариация с обобщенной оценкой преимущества (Generalized Advantage Estimation, GAE) [1]. Логика вычислений в рамках одного эпохального обновления:
- Сбор данных. В симуляторе параллельно генерируется
траекторий с помощью текущей политики
. Фиксируется последовательность
.
- Вычисление TD-ошибок (Temporal Difference). На каждом шаге вычисляется
, где
— функция ценности (критик), обучаемая параллельно методом градиентного спуска по среднеквадратичной ошибке.
- Расчет преимущества (Advantage). Вычисляется экспоненциально взвешенная сумма TD-ошибок:
.
Параметр
управляет компромиссом между смещением (bias) и дисперсией. При
оценка зависит только от одного шага (низкая дисперсия, высокое смещение), при
вырождается в оценку Монте-Карло (нулевой bias, высокая дисперсия). В робототехнике типичное значение
.
- Формирование loss-функции. Поскольку оптимизаторы в фреймворках глубокого обучения минимизируют функцию потерь, градиентный подъем заменяется на спуск:
.
- Обновление весов. Вычисляется
и делается шаг оптимизатора (например, Adam).
Ограничения и практика
Фундаментальное ограничение базового Policy Gradient — неспособность гарантировать монотонное улучшение политики при нетривиальном размере шага обучения. В задачах с жесткими физическими ограничениями (ограничения на тяговые моменты, рабочие области) произвольное изменение может вывести распределение
за пределы устойчивого многообразия. В симуляторе это приводит к расхождению контактного решателя, на реальном оборудовании — к аварийному останову (E-stop) из-за превышения пороговых значений токов.
По этой причине наивный PG заменяется алгоритмами с доверительными областями (Trust Region Policy Optimization, TRPO) или клиппированием вероятностей (Proximal Policy Optimization, PPO) [1]. В PPO целевая функция модифицируется ограничителем:
,
где
, а
(обычно 0.1 или 0.2) жестко ограничивает отношение новых вероятностей к старым. Это предотвращает разрушительные обновления весов.
С инженерной точки зрения PG-методы (в лице PPO) обладают критически низкой выборочной эффективностью (sample efficiency). Обучение контроллера пошагового перемещения манипулятора требует десятков миллионов кадров симуляции. Проблема усугубляется разрывом симуляции и реальности (sim-to-real gap): неточности моделирования трения скольжения и упругих деформаций приводят к тому, что политика, оптимизированная в градиенте симулятора, на реальном объекте теряет устойчивость. Практическим решением является инъекция доменного шума (Domain Randomization) в параметры физического движка на этапе сбора траекторий для PG, что делает градиент робастным к вариациям физических констант [1].
Примечания
Литература
- Sutton R. S. et al. Reinforcement learning: An introduction. — Cambridge: MIT press, 1998. — Т. 1. — № 1.
- Greensmith E., Bartlett P. L., Baxter J. Variance reduction techniques for gradient estimates in reinforcement learning // Journal of Machine Learning Research. — 2004. — Т. 5. — № Nov..
- Williams R. J. Simple statistical gradient-following algorithms for connectionist reinforcement learning // Machine learning. — 1992. — Т. 8. — № 3.
- Kochenderfer M. J., Wheeler T. A., Wray K. H. Algorithms for decision making. — MIT press, 2022.
- Jin R., Li S., Wang B. On stationary point convergence of PPO-Clip // International Conference on Learning Representations. — 2024. — Т. 2024.
- Tobin J. et al. Domain randomization for transferring deep neural networks from simulation to the real world // 2017 IEEE/RSJ international conference on intelligent robots and systems (IROS). — IEEE, 2017.

