Обучение с учителем и без учителя: как выбрать постановку

Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная,…

Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная, качество которой можно проверить, или структуру ещё предстоит обнаружить.

Обучение с учителем

В размеченном наборе каждой строке соответствует известный ответ. Для писем это может быть отметка спама, для квартиры — цена сделки, для оборудования — число часов до отказа. Алгоритм сопоставляет признаки с ответами и минимизирует ошибку на обучающих примерах.

Классификация нужна для конечного набора категорий, а регрессия — для числовой величины. Граница не всегда определяется типом поля: прогноз рейтинга от одной до пяти можно трактовать как классы с порядком или как число. Решение зависит от того, какие ошибки допустимы и как результат используется.

Обучение без учителя

Если готового столбца с ответом нет, алгоритм может группировать похожие объекты, находить аномалии или сокращать размерность. Кластеризация клиентов, например, не сообщает «истинный сегмент» — она предлагает разбиение согласно выбранным признакам и мере расстояния.

Отсутствие разметки не делает результат объективным. Масштаб признаков, число кластеров и способ кодирования категорий влияют на найденную структуру. Поэтому группы нужно интерпретировать и проверять на практическую полезность.

Что не помещается в две категории

В частично размеченных данных применяют semi-supervised подходы. Обучение с подкреплением строит стратегию действий по наградам и взаимодействию со средой. Self-supervised задачи получают учебный сигнал из самих данных, например скрывают часть текста и предлагают её восстановить.

Для первого проекта эти направления не обязательны. Важнее научиться отличать доступный ответ от желаемого и не подменять отсутствие разметки выдуманной целью.

Дерево выбора постановки

Задайте вопросы по порядку:

  1. Какое решение должен поддержать результат?
  2. Есть ли исторический ответ, известный независимо от модели?
  3. Ответ является числом, категорией или последовательностью?
  4. Доступны ли все признаки до момента прогноза?
  5. Можно ли измерить пользу на новых объектах?

Если ответа нет, но бизнес ожидает конкретный класс, кластеризация не заменит разметку. Можно сначала собрать примеры, определить правила аннотации и проверить согласие экспертов.

Минимальный код двух подходов

from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split

# Для демонстрации создаём признаки и известные классы.
X, y = make_blobs(n_samples=300, centers=3, cluster_std=2.2, random_state=42)
X_train, X_test, y_train, y_test = train_test_split(
    X, y, test_size=0.2, random_state=42, stratify=y
)

classifier = LogisticRegression(max_iter=1_000).fit(X_train, y_train)
predicted_classes = classifier.predict(X_test)

clusterer = KMeans(n_clusters=3, random_state=42, n_init=10).fit(X)
discovered_groups = clusterer.labels_

Первый результат можно сравнить с y_test. Для второго нет правильных номеров кластеров: номера условны, а оценка требует анализа устойчивости и смысла групп.

Практика: классифицируйте идеи

Разберите четыре сценария: прогноз цены ноутбука, группировка новостей, распознавание породы растения и сжатие 100 признаков до двух координат. Для каждого укажите наличие целевого ответа, тип постановки и способ проверки пользы. Отдельно запишите, где потребуется новая разметка.

Что важно запомнить

Источники