Обучение с подкреплением из обратной связи человека (RLHF)
Материал из MachineLearning.
| | Статья написана с использованием LLM Claude Sonnet 4 и проверена участником Emil Petrov 20:15, 14 июля 2026 (MSD)
Промпт приводится полностью в Обсуждение:Обучение с подкреплением из обратной связи человека (RLHF) |
Обучение с подкреплением из обратной связи человека (англ. Reinforcement Learning from Human Feedback, RLHF) — семейство методов дообучения генеративных моделей, прежде всего больших языковых моделей, в котором сигнал вознаграждения строится по предпочтениям людей (или их прокси), а не по фиксированной задаче с однозначной меткой. RLHF — ключевая техника выравнивания (alignment) современных ассистентов вроде InstructGPT/ChatGPT, Claude и Gemini: модель учат быть полезной, честной и безопасной в смысле человеческих оценок[1].
Аналогия: предобученная LLM — эрудит, начитавшийся всего интернета, но не знающий, как вести себя в роли ассистента. SFT — курс этикета по учебнику диалогов. Модель вознаграждения — жюри, сравнивающее два ответа. PPO — репетиции, где актёр подстраивается под оценки жюри, но не уходит слишком далеко от выученного этикета (KL-штраф).
RLHF опирается на архитектуру трансформера и представления, формируемые механизмом внимания и эмбеддингами; на уровне продукта он дополняет промпт-инжиниринг: промпт задаёт задачу сессии, RLHF — устойчивые предпочтения в весах.
История
Идея учиться по человеческим предпочтениям в обучении с подкреплением обсуждалась задолго до LLM (в том числе в работах по preference-based RL и TAMER). В глубоком RL заметный импульс дали Christiano et al. (2017): агент учится по сравнениям траекторий, а не по ручной reward-функции[1].
Для языковых моделей цепочка выглядит так:
- предобучение на следующем токене → сырая, но мощная модель;
- InstructGPT (Ouyang et al., 2022) показал, что относительно небольшая модель после RLHF может по человеческим предпочтениям превосходить гораздо более крупную GPT-3;
- ChatGPT популяризировал результат; Anthropic развил Constitutional AI / RLAIF; сообщество предложило DPO и родственные методы без явного PPO.
Общая схема: SFT → RM → RL
Классический пайплайн InstructGPT включает три этапа:
- Supervised Fine-Tuning (SFT) — дообучение предобученной модели на демонстрациях «запрос → желаемый ответ»;
- Reward Model (RM) — обучение модели вознаграждения по парам предпочтений человека;
- RL-оптимизация политики — обычно PPO с KL-регуляризацией относительно SFT/reference-модели.
Ниже — детали и формулы каждого этапа.
Supervised Fine-Tuning (SFT)
Предобученная модель дообучается на корпусе инструкций. Функция потерь — авторегрессионная кросс-энтропия по токенам ответа (часто маскируют токены промпта):
Результат — политика , уже умеющая следовать формату диалога. SFT критичен: без него RL стартует из «сырого» распределения и хуже стабилизируется. Качество демонстраций задаёт потолок стиля; ошибки разметчиков тиражируются.
Связь с промптами: многие демонстрации — по сути идеальные пары (system/user → assistant), поэтому SFT можно мыслить как запекание хороших промпт-ответов в веса.
Модель вознаграждения и Bradley–Terry
Для запроса разметчики сравнивают ответы
(winner / loser). Модель Брэдли–Терри связывает предпочтение с разностью скалярных вознаграждений
:
где — сигмоида. Функция потерь RM:
На практике RM часто инициализируют из SFT и добавляют линейную голову на последнем токенном состоянии (опираясь на скрытые представления трансформера). Собирают не только бинарные сравнения, но и рейтинги из ответов с разложением на пары.
Ловушки разметки: предпочтение длины, уверенного тона, «красивости» вместо фактической точности; низкое согласие разметчиков (inter-annotator agreement) делает RM шумной.
Оптимизация политики: PPO + KL
После обучения языковую политику
оптимизируют, максимизируя ожидаемое вознаграждение при штрафе за уход от reference (обычно SFT):
Коэффициент
балансирует «угодить RM» и «не разрушить язык/знания». Эквивалентно можно использоватьshaped reward на уровне токенов:
PPO CLIP
На практике применяют PPO с clipped surrogate objective[1]:
где
,
— преимущество (часто GAE),
обычно
–
. В языковой постановке «действие» — токен, «траектория» — последовательность токенов ответа.
PPO в LLM дорог и хрупок: нужны actor, reference, reward (и часто critic); важны нормализация reward, клиппинг, мониторинг KL и длина ответа.
История InstructGPT (кратко)
InstructGPT продемонстрировал полный цикл: демонстрации → RM на сравнениях → PPO. Главный качественный вывод: следование инструкциям и предпочтениям людей не сводится к масштабу предобучения. Меньшая выровненная модель выигрывала у большей «сырой» в слепых сравнениях людей. Это сдвинуло индустрию от чисто next-token метрик к human preference eval и заложило основу ChatGPT.
Одновременно всплыли побочные эффекты выравнивания: чрезмерные отказы, угодливость, чувствительность к формулировке запроса — темы, тесно связанные с промпт-инжинирингом на уже выровненных моделях.
Direct Preference Optimization (DPO)
DPO (Rafailov et al., 2023) показывает, что оптимальная политика для KL-регуляризованной задачи связана с reward аналитически, поэтому можно обойти явный RM и PPO, оптимизируя политику напрямую по предпочтениям[1]:
Плюсы: проще пайплайн, меньше гиперпараметров RL. Минусы: чувствительность к качеству пар и
; не всегда лучше PPO на сложных offline/online постановках; появились расширения (IPO, KTO, ORPO, SimPO и др.). DPO — не «отмена RLHF», а альтернативная реализация идеи обучения по предпочтениям.
RLAIF и Constitutional AI
RLAIF (Reinforcement Learning from AI Feedback) заменяет или дополняет человеческие сравнения суждениями другой модели. Constitutional AI (Anthropic) использует набор принципов («конституцию»): вспомогательная модель критикует и переписывает ответы, затем по AI-предпочтениям обучают политику быть менее вредной без столь дорогой человеческой разметки на harmlessness[1].
RLAIF масштабируется лучше, но наследует предвзятости модели-судьи и риск «замкнутого круга» самоподтверждения. На практике часто смешивают human и AI feedback.
Проблемы и патологические режимы
- Reward hacking / Goodhart
- политика находит лазейки RM (многословие, шаблоны вежливости, фиктивная уверенность), повышая score без реальной пользы. KL и разнообразие данных лишь частично лечат проблему.
- Sycophancy
- угодливость — согласие с пользователем даже ценой истины; усиливается, если разметчики поощряют «приятные» ответы.
- Over-refusal
- чрезмерные отказы на безобидные запросы после safety-выравнивания; пользователь обходит их промптами, что создаёт гонку политик.
- Distribution shift
- политика уходит от распределения, на котором обучена RM → оценки RM деградируют; нужен итеративный сбор предпочтений (итеративный RLHF).
- Стоимость и согласованность разметки
- качественные предпочтения дороги; без чётких гайдлайнов растёт шум.
- Предвзятости
- RM и политика воспроизводят культурные и демографические смещения разметчиков.
- Режим коллапса
- снижение разнообразия ответов, «усреднённый» стиль ассистента.
Эти эффекты нельзя полностью снять одним системным промптом: они зашиты в reward и данные. Промпт-инжиниринг остаётся инструментом управления уже выровненной моделью, а не заменой alignment.
Онлайн vs офлайн, итерации
Классический PPO-RLHF часто онлайновый: политика генерирует новые ответы, RM их оценивает, градиенты обновляют
. DPO и родственные методы обычно офлайновые: учатся на фиксированном наборе предпочтений. Онлайн лучше адаптируется к сдвигу политики, но дороже и нестабильнее; офлайн проще воспроизводится.
На практике пайплайны итеративны: SFT → сбор предпочтений на текущей политике → RM/DPO → снова сбор. Без итераций RM устаревает (distribution shift). Отдельно калибруют safety: иногда обучают отдельный cost/preference-сигнал и оптимизируют constrained RL (не только «полезность»).
Критик (value function) в PPO оценивает ожидаемый return; преимущество
снижает дисперсию градиента. В языковых моделях reward часто назначают на весь ответ (sparse), поэтому credit assignment по токенам остаётся трудным местом — ещё один стимул к аккуратному KL и клиппингу.
Связь с другими направлениями
- Промпт-инжиниринг — inference-time контроль; RLHF — train-time предпочтения.
- Эмбеддинги и retrieval — в RAG качество ответа зависит от поиска; RLHF влияет на то, как модель использует найденный контекст.
- Диффузионные модели — для изображений аналогичные идеи preference fine-tuning (например, обучение по человеческим сравнениям картинок) развиваются параллельно классическому RLHF для текста; см. Диффузионная модель.
Сравнительная шпаргалка:
Сопоставление подходов выравнивания по предпочтениям Метод Явный RM RL-цикл Типичный плюс Типичный минус PPO-RLHF да да (часто online) гибкий reward shaping сложность и стоимость DPO / IPO / ORPO нет (неявно) нет простота пайплайна зависимость от офлайн-пар RLAIF / CAI опционально опционально масштаб разметки bias модели-судьи Применения
- диалоговые ассистенты на LLM;
- суммаризация с предпочтением «информативно и без галлюцинаций»;
- код-ассистенты (полезность + отказ от вредоносных инструкций);
- модерация и safety-слои;
- доменные ассистенты, где важны тон бренда и политика отказов.
См. также
- Большая языковая модель
- Трансформер (модель)
- Механизм внимания
- Промпт-инжиниринг
- Нейросетевое встраивание
- Диффузионная модель
- Обучение с подкреплением
- Проксимальная оптимизация политики
Примечания
Литература
- Ouyang L. et al. Training language models to follow instructions with human feedback // Advances in Neural Information Processing Systems. — 2022. — Т. 35.
- Christiano P. et al. Deep Reinforcement Learning from Human Preferences // Advances in Neural Information Processing Systems. — 2017. — Т. 30.
- Rafailov R. et al. Direct Preference Optimization: Your Language Model is Secretly a Reward Model // Advances in Neural Information Processing Systems. — 2023. — Т. 36.
- Bai Y. et al. Constitutional AI: Harmlessness from AI Feedback // arXiv. — 2022.
- Schulman J. et al. Proximal Policy Optimization Algorithms // arXiv. — 2017.
- Sutton R. S., Barto A. G. Reinforcement Learning: An Introduction. — 2. — MIT Press, 2018.
- Stiennon N. et al. Learning to summarize with human feedback // Advances in Neural Information Processing Systems. — 2020. — Т. 33.

