Обучение с учителем и без учителя: как выбрать постановку
Автор: Казачкин Даниил Михайлович · Обновлено
Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная,…
Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная, качество которой можно проверить, или структуру ещё предстоит обнаружить.
Обучение с учителем
В размеченном наборе каждой строке соответствует известный ответ. Для писем это может быть отметка спама, для квартиры — цена сделки, для оборудования — число часов до отказа. Алгоритм сопоставляет признаки с ответами и минимизирует ошибку на обучающих примерах.
Классификация нужна для конечного набора категорий, а регрессия — для числовой величины. Граница не всегда определяется типом поля: прогноз рейтинга от одной до пяти можно трактовать как классы с порядком или как число. Решение зависит от того, какие ошибки допустимы и как результат используется.
Обучение без учителя
Если готового столбца с ответом нет, алгоритм может группировать похожие объекты, находить аномалии или сокращать размерность. Кластеризация клиентов, например, не сообщает «истинный сегмент» — она предлагает разбиение согласно выбранным признакам и мере расстояния.
Отсутствие разметки не делает результат объективным. Масштаб признаков, число кластеров и способ кодирования категорий влияют на найденную структуру. Поэтому группы нужно интерпретировать и проверять на практическую полезность.
Что не помещается в две категории
В частично размеченных данных применяют semi-supervised подходы. Обучение с подкреплением строит стратегию действий по наградам и взаимодействию со средой. Self-supervised задачи получают учебный сигнал из самих данных, например скрывают часть текста и предлагают её восстановить.
Для первого проекта эти направления не обязательны. Важнее научиться отличать доступный ответ от желаемого и не подменять отсутствие разметки выдуманной целью.
Дерево выбора постановки
Задайте вопросы по порядку:
- Какое решение должен поддержать результат?
- Есть ли исторический ответ, известный независимо от модели?
- Ответ является числом, категорией или последовательностью?
- Доступны ли все признаки до момента прогноза?
- Можно ли измерить пользу на новых объектах?
Если ответа нет, но бизнес ожидает конкретный класс, кластеризация не заменит разметку. Можно сначала собрать примеры, определить правила аннотации и проверить согласие экспертов.
Минимальный код двух подходов
from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split
# Для демонстрации создаём признаки и известные классы.
X, y = make_blobs(n_samples=300, centers=3, cluster_std=2.2, random_state=42)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42, stratify=y
)
classifier = LogisticRegression(max_iter=1_000).fit(X_train, y_train)
predicted_classes = classifier.predict(X_test)
clusterer = KMeans(n_clusters=3, random_state=42, n_init=10).fit(X)
discovered_groups = clusterer.labels_Первый результат можно сравнить с y_test. Для второго нет правильных номеров кластеров: номера условны, а оценка требует анализа устойчивости и смысла групп.
Практика: классифицируйте идеи
Разберите четыре сценария: прогноз цены ноутбука, группировка новостей, распознавание породы растения и сжатие 100 признаков до двух координат. Для каждого укажите наличие целевого ответа, тип постановки и способ проверки пользы. Отдельно запишите, где потребуется новая разметка.
Что важно запомнить
- Наличие независимого целевого ответа определяет обучение с учителем.
- Классификация и регрессия решают разные типы прогнозов.
- Кластеры — найденная структура, а не готовая предметная истина.
- Проверку результата нужно определить до выбора библиотеки и алгоритма.
Частые вопросы
Кластеризация является классификацией без разметки?
Нет. Классификация воспроизводит заранее определённые классы, а кластеризация создаёт группы по структуре признаков. Найденный кластер не обязан совпадать с категорией, которую использует предметная область.
Можно ли превратить кластер в целевой класс?
Можно исследовать связь, но нельзя объявлять её истинной без проверки. Сначала эксперт интерпретирует группу, затем при необходимости создаётся независимая разметка и задача классификации.
Какой подход нужен для рекомендации товаров?
Зависит от данных. Можно предсказывать вероятность действия по размеченной истории, искать похожих пользователей без явной цели или оптимизировать последовательность рекомендаций. Слово «рекомендация» ещё не определяет вид обучения.
Связанные исследования
- Обнаружение сигнала и оценка фазы: почему это разные квантовые задачи — Две известные гипотезы, непрерывная оценка и неопределённый исход: как выбрать метрику и не перенести узкое преимущество на все измерения.