Машинное обучение с нуля
Машинное обучение с нуля на Python: постановка задач, подготовка данных, метрики, классические модели, кросс-валидация и пайплайны scikit-learn.
Материалы раздела
- Что такое машинное обучение: задачи, признаки и ответы — Машинное обучение — это способ строить правила по примерам, когда все условия трудно или дорого записать вручную.
- Обучение с учителем и без учителя: как выбрать постановку — Способ обучения выбирают по тому, какие данные и ответы доступны, а не по модности алгоритма. Главная развилка проста: существует ли для исторических объектов целевая переменная,…
- Датасет для машинного обучения: объекты, признаки и целевая переменная — Датасет — не просто таблица, которую удалось выгрузить. Это зафиксированное представление объектов в определённый момент времени.
- Обучающая, валидационная и тестовая выборки без утечки данных — Модель оценивают на примерах, которые не влияли на её настройку. Для этого данные разделяют на обучающую, валидационную и тестовую части.
- Подготовка данных в scikit-learn: пропуски, категории и масштабирование — Большинство моделей принимает числовую матрицу без неоднозначных пропусков. Подготовка данных превращает исходные столбцы в такое представление, сохраняя одинаковые правила для…
- Линейная регрессия на Python: первый прогноз числовой величины — Линейная регрессия предсказывает число как взвешенную сумму признаков. Она служит понятной отправной точкой для оценки цены, спроса или длительности: модель быстро обучается,…
- Метрики регрессии: MAE, MSE, RMSE и R² — Метрика регрессии превращает набор ошибок в одно число, но разные формулы отвечают на разные вопросы. Выбор между MAE, MSE, RMSE и R² должен учитывать единицы измерения, цену…
- Логистическая регрессия: классификация и вероятность класса — Логистическая регрессия решает задачу классификации, несмотря на слово «регрессия» в названии. Она вычисляет линейную комбинацию признаков, преобразует её в значение от нуля до…
- Метрики классификации: accuracy, precision, recall, F1 и ROC-AUC — Одна доля правильных ответов редко описывает классификатор полностью. Accuracy, precision, recall, F1 и ROC-AUC по-разному учитывают ошибки и пороги.
- Переобучение и недообучение модели: как увидеть и исправить — Хорошая модель должна переносить найденную закономерность на новые данные. Переобученная модель запоминает детали и шум train-выборки, а недообученная не описывает даже основные…
- Дерево решений: разбиения, глубина и интерпретация — Дерево решений строит последовательность вопросов о признаках и приходит к прогнозу в листе. Такой алгоритм умеет описывать пороги и взаимодействия без ручного создания формул,…
- Случайный лес и бэггинг: зачем объединять деревья — Случайный лес обучает много различающихся деревьев и объединяет их прогнозы. Отдельное дерево нестабильно: небольшая замена строк способна перестроить верхние ветви.
- Градиентный бустинг: как ансамбль исправляет ошибки — Градиентный бустинг строит ансамбль последовательно: каждое новое небольшое дерево помогает исправить ошибки уже собранной модели.
- Метод k-ближайших соседей: классификация по сходству — Метод k-ближайших соседей, или k-NN, откладывает основную работу до момента прогноза. Для нового объекта он находит похожие обучающие примеры и голосует по их классам либо…
- Кластеризация K-means: как находить группы без ответов — K-means делит числовые объекты на заданное число кластеров, минимизируя расстояния до центров групп. Алгоритм работает без целевой переменной, поэтому результат не является…
- Метод главных компонент PCA: сокращение числа признаков — Метод главных компонент, или PCA, заменяет связанные числовые признаки новыми осями так, чтобы первые компоненты сохраняли как можно больше дисперсии данных.
- Инженерия и отбор признаков: как улучшать представление данных — Модель видит не реальный объект, а выбранное числовое представление. Инженерия признаков создаёт полезные величины из исходных данных, а отбор удаляет лишние столбцы.
- Кросс-валидация и подбор гиперпараметров в scikit-learn — Один train-validation split может случайно оказаться удобным или трудным. Кросс-валидация повторяет обучение на нескольких фолдах и показывает не только среднее качество, но и…
- Дисбаланс классов: веса, порог и правильные метрики — При дисбалансе один класс встречается намного реже другого: дефекты, мошеннические операции или аварии могут составлять доли процента.
- Pipeline и первый ML-проект: от данных до сохранённой модели — Итоговый ML-проект — это воспроизводимый путь от исходной таблицы до проверенного прогноза, а не один вызов fit.