Обучение с учителем и без учителя: как выбрать постановку
Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная,…
Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная, качество которой можно проверить, или структуру ещё предстоит обнаружить.
Обучение с учителем
В размеченном наборе каждой строке соответствует известный ответ. Для писем это может быть отметка спама, для квартиры — цена сделки, для оборудования — число часов до отказа. Алгоритм сопоставляет признаки с ответами и минимизирует ошибку на обучающих примерах.
Классификация нужна для конечного набора категорий, а регрессия — для числовой величины. Граница не всегда определяется типом поля: прогноз рейтинга от одной до пяти можно трактовать как классы с порядком или как число. Решение зависит от того, какие ошибки допустимы и как результат используется.
Обучение без учителя
Если готового столбца с ответом нет, алгоритм может группировать похожие объекты, находить аномалии или сокращать размерность. Кластеризация клиентов, например, не сообщает «истинный сегмент» — она предлагает разбиение согласно выбранным признакам и мере расстояния.
Отсутствие разметки не делает результат объективным. Масштаб признаков, число кластеров и способ кодирования категорий влияют на найденную структуру. Поэтому группы нужно интерпретировать и проверять на практическую полезность.
Что не помещается в две категории
В частично размеченных данных применяют semi-supervised подходы. Обучение с подкреплением строит стратегию действий по наградам и взаимодействию со средой. Self-supervised задачи получают учебный сигнал из самих данных, например скрывают часть текста и предлагают её восстановить.
Для первого проекта эти направления не обязательны. Важнее научиться отличать доступный ответ от желаемого и не подменять отсутствие разметки выдуманной целью.
Дерево выбора постановки
Задайте вопросы по порядку:
- Какое решение должен поддержать результат?
- Есть ли исторический ответ, известный независимо от модели?
- Ответ является числом, категорией или последовательностью?
- Доступны ли все признаки до момента прогноза?
- Можно ли измерить пользу на новых объектах?
Если ответа нет, но бизнес ожидает конкретный класс, кластеризация не заменит разметку. Можно сначала собрать примеры, определить правила аннотации и проверить согласие экспертов.
Минимальный код двух подходов
from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs
from sklearn.linear_model import LogisticRegression
from sklearn.model_selection import train_test_split
# Для демонстрации создаём признаки и известные классы.
X, y = make_blobs(n_samples=300, centers=3, cluster_std=2.2, random_state=42)
X_train, X_test, y_train, y_test = train_test_split(
X, y, test_size=0.2, random_state=42, stratify=y
)
classifier = LogisticRegression(max_iter=1_000).fit(X_train, y_train)
predicted_classes = classifier.predict(X_test)
clusterer = KMeans(n_clusters=3, random_state=42, n_init=10).fit(X)
discovered_groups = clusterer.labels_Первый результат можно сравнить с y_test. Для второго нет правильных номеров кластеров: номера условны, а оценка требует анализа устойчивости и смысла групп.
Практика: классифицируйте идеи
Разберите четыре сценария: прогноз цены ноутбука, группировка новостей, распознавание породы растения и сжатие 100 признаков до двух координат. Для каждого укажите наличие целевого ответа, тип постановки и способ проверки пользы. Отдельно запишите, где потребуется новая разметка.
Что важно запомнить
- Наличие независимого целевого ответа определяет обучение с учителем.
- Классификация и регрессия решают разные типы прогнозов.
- Кластеры — найденная структура, а не готовая предметная истина.
- Проверку результата нужно определить до выбора библиотеки и алгоритма.