Instruction tuning и RLHF: как базовая модель становится ассистентом
Базовая модель продолжает текст согласно предобученному распределению. Чтобы получить ассистента, который отвечает на запрос, соблюдает формат и отказывается от части опасных…
Краткий ответ
Базовая модель продолжает текст согласно предобученному распределению. Чтобы получить ассистента, который отвечает на запрос, соблюдает формат и отказывается от части опасных действий, применяют постобучение.
Базовая модель продолжает текст согласно предобученному распределению. Чтобы получить ассистента, который отвечает на запрос, соблюдает формат и отказывается от части опасных действий, применяют постобучение. Оно меняет поведение, но не превращает модель в безошибочный источник истины.
Supervised fine-tuning на демонстрациях
На этапе SFT модель обучают на парах «инструкция — желаемый ответ». Loss остаётся токенным, но распределение данных теперь показывает диалоговое поведение: отвечать прямо, уточнять неоднозначность, следовать формату. Качество примеров важнее простой массы: противоречивые демонстрации создают конфликтующие сигналы.
SFT может научить стилю и процедуре, но не даёт полной спецификации человеческих предпочтений. Для одного запроса существует много допустимых ответов, а демонстрация показывает лишь один.
Обучение предпочтениям
В классическом RLHF люди сравнивают несколько ответов. По сравнениям обучают reward model, которая приближает предпочтение разметчиков. Затем policy оптимизируют на высокий reward, обычно с ограничением отклонения от SFT-модели. В InstructGPT использовалась схема SFT, reward model и reinforcement learning.
Reward model — тоже статистическая модель с ошибками. Оптимизация способна находить способы получить высокий балл, не соответствуя истинной цели, — это называют reward hacking. Ограничения, разнообразие данных и независимая оценка нужны, чтобы не оптимизировать узкий прокси-показатель.
Чьи предпочтения изучаются
Разметчики работают по инструкциям, подготовленным организацией. Итог отражает выбор авторов политики, состав разметчиков, культуру и формулировку задачи. «Человеческая обратная связь» не является единой объективной волей человечества.
Согласие между разметчиками измеряют, спорные случаи разбирают отдельно, а высокорисковые области требуют экспертов. Если разметчики оценивают медицинскую точность без компетенции, приятный стиль может ошибочно победить корректный ответ.
Alignment не равен истинности
Постобучение повышает следование инструкциям и может улучшить правдивость на выбранных тестах. Но услужливая модель иногда пытается ответить там, где должна признать неопределённость. Она также может соглашаться с предпосылкой пользователя или выбирать убедительный тон.
Нужно отдельно оценивать factuality, калибровку, устойчивость к перефразированию и безопасность. Из того, что ответ предпочли люди, не следует, что каждое утверждение проверено.
Упражнение: построение preference dataset
Возьмите запрос: «Объясни школьнику, почему нельзя делить на ноль». Напишите три ответа: точный и понятный; точный, но перегруженный; уверенный, но с ошибкой. Составьте рубрику из точности, понятности, соответствия возрасту и признания границ.
Попросите двух людей ранжировать ответы независимо. Сравните результаты и обсудите конфликт критериев. Затем представьте reward model, обученную только на «приятности»: какой опасный shortcut она может выучить?
Частые вопросы
RLHF обязательно использует reinforcement learning?
Термин исторически связан с RL-оптимизацией по reward model. Существуют прямые методы оптимизации предпочтений без отдельного RL-цикла, но их также нужно отличать от обычного SFT.
Постобучение добавляет модели новые факты?
Оно может адаптировать знания и привнести информацию из примеров, но его основная цель обычно — поведение. Для регулярно обновляемых фактов надёжнее управляемый внешний источник и проверка.
Почему более маленькая instruct-модель иногда приятнее большой базовой?
Размер улучшает способность моделировать данные, но базовая цель не требует отвечать полезно. Специализированное постобучение может сильнее влиять на пользовательское предпочтение, чем дополнительные параметры без настройки.
Что важно запомнить
- SFT показывает примеры желаемого следования инструкциям.
- RLHF приближает человеческие сравнения через reward model и оптимизацию policy.
- Предпочтения зависят от рубрики, разметчиков и организационной политики.
- Alignment улучшает поведение на выбранных критериях, но не гарантирует истинность и безопасность.
https://yadro-code.ru/lessons/without-university/generative-ai-foundations/generative-ai-07