Страницы, ссылающиеся на Group Relative Policy Optimization
Материал из MachineLearning.
(Список ссылок)
> Group Relative Policy OptimizationСледующие страницы ссылаются на Group Relative Policy Optimization:
Просмотреть (предыдущие 50) (следующие 50) (20 | 50 | 100 | 250 | 500)- Методы обучения с подкреплением (← ссылки)
- Direct Preference Optimization (← ссылки)
- RubricRL (← ссылки)
- Chain-of-thoughts (← ссылки)
- Coconut (implicit reasoning) (← ссылки)
- Self-Distillation Policy Optimization (← ссылки)
- Прямая оптимизация предпочтений (← ссылки)

