Тяжёлые хвосты
Средняя зарплата в баре — 60 тысяч. Заходит Илон Маск — и «средняя» подскакивает до миллиарда. Изменилось ли что-то для остальных? Нет. Это и есть тяжёлый хвост: одно редкое огромное значение перевешивает тысячу обычных, и привычное «среднее» перестаёт что-либо значить. Хуже того — у некоторых распределений среднего нет вообще, и выборочное среднее не сходится, сколько данных ни собирай.
Распределение, у которого нет среднего
Возьмём распределение Стьюдента t_\nu с \nu степенями свободы. При больших \nu оно почти неотличимо от гауссова — лёгкие хвосты, всё «прилично». Но чем меньше \nu, тем тяжелее хвосты: экстремальные значения становятся не такими уж редкими. Ключевые границы:
- \nu > 2 — дисперсия конечна, работает центральная предельная теорема;
- 1 < \nu \le 2 — дисперсия бесконечна, но среднее ещё существует;
- \nu = 1 — это распределение Коши, у которого нет даже среднего.
Последнее звучит абсурдно: как у симметричного относительно нуля распределения может не быть среднего? Формально интеграл \int x\, p(x)\,dx расходится — хвост p(x)\sim 1/x^2 спадает так медленно, что далёкие значения вносят слишком большой вклад и интеграл не сходится. На практике это значит: сколько бы выборок Коши вы ни усредняли, выборочное среднее не успокаивается — каждый новый гигантский выброс отбрасывает его в сторону. Закон больших чисел не работает.
Эксперимент
Меняйте \nu. Сверху — выборочное среднее по мере роста числа выборок. У гауссова (серое) оно за сотню-другую точек садится на ноль. У тяжёлого хвоста (красное) при малых \nu оно скачет и не сходится. Снизу — сами выборки: видно редкие гигантские выбросы (красные вертикальные линии), каждый из которых в одиночку дёргает среднее. При \nu=1 один выброс легко превышает все остальные данные вместе взятые.
Обратите внимание на max|x| в сводке виджета: при \nu=1 он бывает в тысячи раз больше типичной выборки. Такие редкие гиганты — «чёрные лебеди» — и определяют поведение тяжёлохвостых величин: важно не типичное значение, а экстремальное.
Где это встречается
Тяжёлые хвосты — обычное дело для реальных данных:
- Доходы и богатство — закон Парето («80/20»), хвост по степенному закону.
- Размеры городов, частоты слов — закон Ципфа.
- Финансовые потери — доходности активов имеют хвосты тяжелее гауссовых; поэтому риск-модели на нормальном распределении недооценивают риск обвала.
- Задержки в сети, размеры файлов, время до отказа — здесь тяжёлые хвосты сплошь и рядом.
Во всех этих случаях фраза «в среднем» вводит в заблуждение, а доверительный интервал по формуле, которая предполагает конечную дисперсию, — неверен.
Что делать
- Смотрите на медиану, а не среднее. Медиана устойчива к выбросам и существует всегда.
- Изучайте сам хвост. Постройте распределение в логарифмических осях: степенной хвост превращается в прямую, и по её наклону оценивают индекс хвоста — показатель степени, с которым хвост спадает.
- Не доверяйте ЦПТ вслепую. Прежде чем строить доверительный интервал, проверьте, конечна ли дисперсия — иначе 1/\sqrt{n}-сходимость не наступит.
- Смотрите на максимум. В тяжёлохвостом мире рекорд — не шум, а часто и есть главный сигнал.
Стьюдентово t_\nu \to \mathcal N(0,1) при \nu\to\infty. Тяжёлые хвосты — это не «другой мир», а непрерывная шкала: параметр \nu плавно ведёт от дикого Коши к ручному гауссу. Большинство классических методов статистики живут на конце с большими \nu — и молча предполагают, что ваши данные тоже там.
Связи
- Максимум правдоподобия и ЦПТ — почему при лёгких хвостах суммы сходятся к гауссу
- Линейная регрессия и МНК — квадрат ошибки штрафует выброс квадратично, поэтому МНК ломается на тяжёлых хвостах; ответ — робастные потери Хьюбера
- Закон Кеплера — как выглядит МНК, когда данные, наоборот, идеально послушные