Теоретические основы машинного обучения
Минимизация риска
От интуиции к формулам
Когда мы обучаем модель, мы интуитивно хотим, чтобы она делала как можно меньше ошибок. Но как измерить «ошибку»? В машинном обучении для этого существует формальный инструмент — функция потерь.
Функция потерь
other
Математическая функция, которая определяет, насколько «плох» прогноз модели для одного конкретного примера. Она принимает на вход истинное значение и предсказанное значение, а на выходе даёт число, которое и является «потерей» или ошибкой.
Выбор функции потерь зависит от задачи. Для регрессии, где нужно предсказать числовое значение (например, цену дома), популярна квадратичная ошибка. Она вычисляет квадрат разницы между истинным значением и прогнозом .
Для классификации, где нужно предсказать категорию (например, «спам» или «не спам»), часто используется потеря 0-1. Она очень проста: 0, если модель угадала, и 1, если ошиблась.
Идеальный сценарий: Ожидаемый риск
Функция потерь оценивает ошибку на одном примере. Но наша цель — создать модель, которая будет хорошо работать на любых новых данных, а не только на тех, что мы ей показали. В идеальном мире мы бы хотели минимизировать среднюю ошибку по всем возможным данным, которые только могут существовать. Это и есть концепция ожидаемого риска.
Представим, что существует некое совместное распределение вероятностей , которое описывает все возможные пары «объект-ответ». Тогда ожидаемый риск — это математическое ожидание функции потерь по этому распределению. Это и есть «истинная» ошибка модели.
Проблема в том, что в реальности мы никогда не знаем истинного распределения . У нас есть только ограниченный набор данных — обучающая выборка. Поэтому напрямую вычислить и минимизировать ожидаемый риск невозможно.
Прагматичный подход: Эмпирический риск
Раз мы не можем работать со всей генеральной совокупностью, мы будем работать с тем, что у нас есть: с обучающей выборкой. Вместо того чтобы вычислять «истинную» среднюю ошибку, мы посчитаем среднюю ошибку на наших данных. Эта величина называется эмпирическим риском.
Идея проста: мы используем эмпирический риск как замену (аппроксимацию) недоступного нам ожидаемого риска. Принцип, согласно которому мы выбираем модель, минимизирующую среднюю ошибку на обучающей выборке, называется принципом минимизации эмпирического риска (Empirical Risk Minimization, ERM). Это основа большинства методов машинного обучения.
Насколько это хорошая замена? Здесь нам на помощь приходит , который гласит, что при достаточно большом размере выборки среднее значение по выборке сходится к математическому ожиданию. В нашем случае это означает, что эмпирический риск стремится к ожидаемому риску. Этот принцип — теоретическое обоснование того, почему обучение на данных вообще работает.
Ловушка переобучения
Итак, мы минимизируем эмпирический риск. Что может пойти не так? Главная опасность — (overfitting). Это ситуация, когда модель становится слишком сложной и вместо того, чтобы улавливать общие закономерности в данных, она просто «запоминает» обучающую выборку, включая случайный шум и выбросы.
В результате эмпирический риск становится очень низким (модель почти не ошибается на знакомых данных), но ожидаемый риск, наоборот, растет. На новых, невиданных ранее данных такая модель будет работать плохо. Она теряет способность к обобщению.
Слепая минимизация эмпирического риска без контроля сложности модели — это прямой путь к созданию бесполезного алгоритма. Вся суть статистической теории обучения заключается в поиске компромисса: мы хотим минимизировать эмпирический риск, но при этом сохранить модель достаточно простой, чтобы она могла обобщать полученные знания на новые данные.
Какова основная цель функции потерь в машинном обучении?
В чем заключается принцип минимизации эмпирического риска (ERM)?
Теперь вы понимаете, как математически формализуется задача обучения и каковы её главные подводные камни. Это основа для понимания более сложных концепций, таких как регуляризация и структурная минимизация риска.