Генеративные и дискриминативные модели: в чём разница

Генеративная модель учится описывать распределение данных так, чтобы оценивать или создавать правдоподобные новые примеры.

Краткий ответ

Генеративная модель учится описывать распределение данных так, чтобы оценивать или создавать правдоподобные новые примеры. Дискриминативная модель обычно учится проводить границу между классами либо напрямую предсказывать целевую переменную по входу.

Генеративная модель учится описывать распределение данных так, чтобы оценивать или создавать правдоподобные новые примеры. Дискриминативная модель обычно учится проводить границу между классами либо напрямую предсказывать целевую переменную по входу. Это разные постановки задачи, а не шкала от «простого» к «умному».

Два разных вопроса к данным

Пусть у нас есть фотографии кошек и собак. Дискриминативная постановка спрашивает: «Какова вероятность класса при данном изображении?» Её удобно записать как P(класс | изображение). Для классификатора достаточно найти признаки, которые помогают отличить один класс от другого.

Генеративная постановка пытается моделировать сами наблюдения: например, P(изображение | класс) или совместное распределение P(изображение, класс). Если такое распределение приближено достаточно хорошо, из него можно получать новые образцы. При этом генеративная модель тоже может помогать классификации, а дискриминативная часть может входить в обучение генератора, как в GAN.

Что именно означает «сгенерировать»

Модель не достаёт готовый объект из скрытого каталога. Она запускает вычислительный процесс, который преобразует случайность и условия пользователя в новый набор значений: последовательность токенов, пиксели, аудиосигнал или другую структуру. Результат похож на обучающие данные статистически, но не обязан совпадать с конкретным примером.

Слово «новый» тоже требует осторожности. Модель способна комбинировать закономерности, однако иногда воспроизводит фрагменты обучающих данных, особенно редкие или многократно повторённые. Поэтому новизну, права на использование и отсутствие утечки нельзя выводить только из факта генерации.

Основные семейства генеративных моделей

Эти семейства используют разные цели и процедуры вывода. Нельзя утверждать, что одна архитектура всегда лучше: выбор зависит от типа данных, необходимой управляемости, скорости и требований к качеству.

Мысленный эксперимент

Представьте таблицу с координатами точек двух цветов. Классификатору нужна граница между цветами. Генератору нужно понять, где вообще располагаются плотные области точек каждого цвета.

Нарисуйте два пересекающихся облака. Проведите возможную границу классификатора, а затем отметьте области, из которых генератор должен выбирать новые точки. Заметьте: хорошая граница ещё не задаёт плотность внутри облаков, а хорошая модель плотности позволяет получить границу через сравнение вероятностей.

Частые вопросы

Любая нейросеть, которая пишет текст, является генеративной?

Если система создаёт последовательность, моделируя возможные продолжения или другое распределение выходов, её генеративная часть действительно является генеративной моделью. Но продукт вокруг неё может включать поиск, классификаторы, фильтры и правила, которые сами по себе не генеративны.

Генеративная модель хранит все обучающие примеры?

Параметры обычно не являются адресной базой документов. Они кодируют распределённые статистические зависимости. Однако нейросети способны запоминать и иногда воспроизводить отдельные последовательности, поэтому отсутствие обычной базы не гарантирует конфиденциальность.

GAN и дискриминативная модель противоречат друг другу?

Нет. В GAN дискриминатор предоставляет обучающий сигнал генератору. После обучения его могут отбросить, но во время оптимизации дискриминативная задача является частью генеративного метода.

Что важно запомнить

https://yadro-code.ru/lessons/without-university/generative-ai-foundations/generative-ai-01