Instruction tuning и RLHF: как базовая модель становится ассистентом
Автор: Казачкин Даниил Михайлович · Обновлено
Базовая модель продолжает текст согласно предобученному распределению. Чтобы получить ассистента, который отвечает на запрос, соблюдает формат и отказывается от части опасных…
Базовая модель продолжает текст согласно предобученному распределению. Чтобы получить ассистента, который отвечает на запрос, соблюдает формат и отказывается от части опасных действий, применяют постобучение. Оно меняет поведение, но не превращает модель в безошибочный источник истины.
Supervised fine-tuning на демонстрациях
На этапе SFT модель обучают на парах «инструкция — желаемый ответ». Loss остаётся токенным, но распределение данных теперь показывает диалоговое поведение: отвечать прямо, уточнять неоднозначность, следовать формату. Качество примеров важнее простой массы: противоречивые демонстрации создают конфликтующие сигналы.
SFT может научить стилю и процедуре, но не даёт полной спецификации человеческих предпочтений. Для одного запроса существует много допустимых ответов, а демонстрация показывает лишь один.
Обучение предпочтениям
В классическом RLHF люди сравнивают несколько ответов. По сравнениям обучают reward model, которая приближает предпочтение разметчиков. Затем policy оптимизируют на высокий reward, обычно с ограничением отклонения от SFT-модели. В InstructGPT использовалась схема SFT, reward model и reinforcement learning.
Reward model — тоже статистическая модель с ошибками. Оптимизация способна находить способы получить высокий балл, не соответствуя истинной цели, — это называют reward hacking. Ограничения, разнообразие данных и независимая оценка нужны, чтобы не оптимизировать узкий прокси-показатель.
Чьи предпочтения изучаются
Разметчики работают по инструкциям, подготовленным организацией. Итог отражает выбор авторов политики, состав разметчиков, культуру и формулировку задачи. «Человеческая обратная связь» не является единой объективной волей человечества.
Согласие между разметчиками измеряют, спорные случаи разбирают отдельно, а высокорисковые области требуют экспертов. Если разметчики оценивают медицинскую точность без компетенции, приятный стиль может ошибочно победить корректный ответ.
Alignment не равен истинности
Постобучение повышает следование инструкциям и может улучшить правдивость на выбранных тестах. Но услужливая модель иногда пытается ответить там, где должна признать неопределённость. Она также может соглашаться с предпосылкой пользователя или выбирать убедительный тон.
Нужно отдельно оценивать factuality, калибровку, устойчивость к перефразированию и безопасность. Из того, что ответ предпочли люди, не следует, что каждое утверждение проверено.
Упражнение: построение preference dataset
Возьмите запрос: «Объясни школьнику, почему нельзя делить на ноль». Напишите три ответа: точный и понятный; точный, но перегруженный; уверенный, но с ошибкой. Составьте рубрику из точности, понятности, соответствия возрасту и признания границ.
Попросите двух людей ранжировать ответы независимо. Сравните результаты и обсудите конфликт критериев. Затем представьте reward model, обученную только на «приятности»: какой опасный shortcut она может выучить?
Что важно запомнить
- SFT показывает примеры желаемого следования инструкциям.
- RLHF приближает человеческие сравнения через reward model и оптимизацию policy.
- Предпочтения зависят от рубрики, разметчиков и организационной политики.
- Alignment улучшает поведение на выбранных критериях, но не гарантирует истинность и безопасность.
Частые вопросы
RLHF обязательно использует reinforcement learning?
Термин исторически связан с RL-оптимизацией по reward model. Существуют прямые методы оптимизации предпочтений без отдельного RL-цикла, но их также нужно отличать от обычного SFT.
Постобучение добавляет модели новые факты?
Оно может адаптировать знания и привнести информацию из примеров, но его основная цель обычно — поведение. Для регулярно обновляемых фактов надёжнее управляемый внешний источник и проверка.
Почему более маленькая instruct-модель иногда приятнее большой базовой?
Размер улучшает способность моделировать данные, но базовая цель не требует отвечать полезно. Специализированное постобучение может сильнее влиять на пользовательское предпочтение, чем дополнительные параметры без настройки.