Курс представляет собой комплексную дисциплину по машинному обучению, охватывающую полный путь от математических основ обучения моделей до построения прогностических систем на временных данных. Программа структурирована в четыре модуля.
Первый модуль закладывает фундамент: жизненный цикл модели и стандарт CRISP-DM, обучение с учителем на примере линейной регрессии, работа с признаковым пространством, регуляризация (LASSO, Ridge), а также строгая постановка задачи через сингулярное разложение матрицы признаков и решение некорректных задач при помощи псевдообратной матрицы. Второй модуль посвящён методам обучения моделей: безусловной минимизации функционала ошибки методами спуска, стохастическому градиентному спуску и его сходимости, нелинейным моделям, логистической регрессии и методу опорных векторов с ядровым обобщением. Третий модуль охватывает снижение размерности (линейный и нелинейный метод главных компонент), обучение без учителя и кластеризацию (k-means, агломеративные методы, DBSCAN, частичное обучение), настройку моделей безградиентными методами и средствами AutoML (Optuna), а также ансамблевые методы — от случайного леса и AdaBoost до промышленных бустингов XGBoost, LightGBM и CatBoost. Четвёртый модуль переносит освоенный аппарат на временные ряды: статистический анализ и модели семейства ARIMA/SARIMA, машинное обучение для рядов со специфическим Feature Engineering, корректная валидация без «заглядывания в будущее», нейросетевые архитектуры для последовательностей (LSTM, GRU, Transformers) и современные библиотеки автоматического прогнозирования (Prophet, NeuralProphet).
Все темы подкрепляются практической работой на открытых и реальных индустриальных наборах данных. По итогам курса слушатель владеет полным циклом построения моделей машинного обучения: от подготовки данных и обучения базовых алгоритмов до ансамблирования, интерпретации результатов и прогнозирования временных последовательностей с выбором адекватных метрик качества.
Цель освоения дисциплины
Знает основные термины и классические задачи машинного обучения, жизненный цикл модели и стандарт CRISP-DM, различие между обучением с учителем и без учителя.
Владеет аппаратом линейных моделей: умеет ставить и решать задачу восстановления регрессии, применять регуляризацию (LASSO, Ridge) и диагностировать переобучение, понимает связь спектра матрицы признаков с переобучением через сингулярное разложение.
Умеет обучать модели методами безусловной минимизации (градиентный и стохастический градиентный спуск), понимает условия их сходимости и обучает нелинейные модели, включая логистическую регрессию и метод опорных векторов с ядровым обобщением.
Владеет методами снижения размерности (линейный и нелинейный метод главных компонент) и алгоритмами кластеризации (k-means, агломеративные методы, DBSCAN), понимает некорректность задачи обучения без учителя.
Умеет настраивать гиперпараметры моделей безградиентными методами оптимизации и средствами AutoML (Optuna), строить ансамблевые модели и применять промышленные градиентные бустинги (XGBoost, LightGBM, CatBoost).
Знает специфику временных данных и отличия задач прогнозирования от классической регрессии, владеет методами статистического тестирования на стационарность, тренды и сезонность.
Умеет проектировать признаки для рядов (лаги, скользящие окна, календарные признаки), применять модели ARIMA/SARIMA, градиентный бустинг и нейронные сети для прогнозирования, корректно оценивать точность долгосрочных прогнозов схемами Time Series Split / Forward Chaining.
Планируемые результаты обучения
Студент знает ключевые понятия, цели и задачи использования машинного обучения; методологические основы применения алгоритмов машинного обучения
Студент имеет навыки чтения и анализа академической литературы по применению методов машинного обучения, построения и оценки качества моделей
Студент умеет визуализировать результаты работы алгоритмов машинного обучения, выбирать метод машинного обучения, соответствующий исследовательской задаче, интерпретировать полученные результаты
Murphy, K. P. (2012). Machine Learning : A Probabilistic Perspective. Cambridge, Mass: The MIT Press. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=480968
Флах, П. Машинное обучение. Наука и искусство построения алгоритмов, которые извлекают знания из данных / П. Флах. — Москва : ДМК Пресс, 2015. — 400 с. — ISBN 978-5-97060-273-7. — Текст : электронный // Лань : электронно-библиотечная система. — URL: https://e.lanbook.com/book/69955 (дата обращения: 00.00.0000). — Режим доступа: для авториз. пользователей.
Рекомендуемая дополнительная литература
Gareth James, Daniela Witten, Trevor Hastie, Rob Tibshirani, & Maintainer Trevor Hastie. (2013). Type Package Title Data for An Introduction to Statistical Learning with Applications in R Version 1.0. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsbas&AN=edsbas.28D80286
Spiliopoulou, M., Gesellschaft für Klassifikation, Schmidt-Thieme, L., & Janning, R. (2014). Data Analysis, Machine Learning and Knowledge Discovery. Cham: Springer. Retrieved from http://search.ebscohost.com/login.aspx?direct=true&site=eds-live&db=edsebk&AN=669270
Программа дисциплины
Аннотация
Цель освоения дисциплины
Планируемые результаты обучения
Содержание учебной дисциплины
Элементы контроля
Промежуточная аттестация
Список литературы
Рекомендуемая основная литература
Рекомендуемая дополнительная литература
Авторы