Предобучение и предсказание следующего токена

Авторегрессионная языковая модель предобучается предсказывать следующий токен по предыдущему контексту. Простая формулировка цели не означает простого поведения: чтобы уменьшать…

Краткий ответ

Авторегрессионная языковая модель предобучается предсказывать следующий токен по предыдущему контексту. Простая формулировка цели не означает простого поведения: чтобы уменьшать ошибку на разнообразном тексте, сеть вынуждена приближать множество языковых, предметных и структурных закономерностей.

Авторегрессионная языковая модель предобучается предсказывать следующий токен по предыдущему контексту. Простая формулировка цели не означает простого поведения: чтобы уменьшать ошибку на разнообразном тексте, сеть вынуждена приближать множество языковых, предметных и структурных закономерностей.

Как устроен обучающий пример

Из последовательности «модель читает текст» получаются несколько пар контекст–цель: после «модель» нужно предсказывать «читает», после «модель читает» — «текст». На практике обучение идёт большими пакетами токенов, а loss усредняется по позициям.

Модель выдаёт logits для всего словаря. Softmax превращает их в распределение, а cross-entropy штрафует низкую вероятность фактического следующего токена. Backpropagation вычисляет градиенты параметров, оптимизатор делает небольшой шаг. Один документ не записывается в одну ячейку: обновления распределены по огромному числу весов.

Teacher forcing и отличие от генерации

Во время предобучения в контексте обычно находятся реальные предыдущие токены из данных. Это называют teacher forcing. Во время генерации модель видит уже собственные выбранные токены. Ошибка на раннем шаге меняет дальнейший контекст, поэтому длинное продолжение может постепенно отклоняться.

Обучающая вероятность также не задаёт единственный текст. При выводе нужен алгоритм декодирования: greedy selection, sampling, top-p или другой способ. Одна и та же модель с теми же весами может писать по-разному из-за параметров семплирования.

Что появляется при масштабировании

Исследования scaling laws показывают эмпирические степенные зависимости loss от числа параметров, данных и вычислений в определённых диапазонах. Это закономерности измеренных семейств моделей, а не физический закон и не обещание, что любой benchmark будет улучшаться одинаково.

Работа Chinchilla показала важность баланса: при фиксированном compute слишком большая модель на слишком малом числе токенов может быть хуже меньшей, но лучше обученной. Поэтому «больше параметров» без данных, качества и бюджета не является полноценной стратегией.

Некоторые способности проявляются заметнее на масштабе или в few-shot режиме, однако измерение «возникновения» зависит от метрики и порога. Из следующего токена не следует автоматически надёжная логика, истинность или следование намерению — для них нужны данные, постобучение и отдельные проверки.

Параметрическая память не равна поисковому индексу

Факты могут влиять на вероятности через параметры, но нельзя надёжно запросить «строку», в которой они хранятся, или узнать дату источника. Похожие сведения интерферируют, редкие факты усваиваются хуже, а новые события после среза данных неизвестны без внешнего контекста.

Предобученная модель хорошо продолжает правдоподобный текст. Правдоподобие и истинность коррелируют в качественном корпусе, но не совпадают. Именно поэтому уверенный стиль нельзя использовать как оценку достоверности.

Упражнение: мини-модель на частотах

Запишите десять коротких предложений о погоде. Для каждого слова посчитайте, какие слова следуют за ним. Сгенерируйте фразу, каждый раз случайно выбирая продолжение пропорционально частоте.

Затем добавьте контекст из двух предыдущих слов и повторите. Текст станет связнее, но редкие сочетания будут плохо оценены, а модель не узнает погоду за окном. Это упрощённая n-граммная система, не Transformer, однако она показывает различие между статистикой продолжений и проверкой мира.

Частые вопросы

Предсказание следующего токена — это автозаполнение?

Цель похожа, но масштаб данных, контекста и параметров позволяет строить гораздо более сложные условные распределения. Сходство цели не означает тождество обычной клавиатурной подсказке.

Модель видит правильный ответ во время обучения?

Она получает фактический следующий токен как целевую метку после вычисления предсказания. Causal mask не позволяет позиции использовать будущий токен как входной признак.

Низкий loss гарантирует полезного ассистента?

Нет. Loss измеряет предсказание данных выбранного распределения. Полезность, безопасность, правдивость и следование инструкциям требуют отдельных данных, настройки и оценивания.

Что важно запомнить

https://yadro-code.ru/lessons/without-university/generative-ai-foundations/generative-ai-04