Линейная vs монотонная, выбросы, ranks, ties. Симуляция exp/outlier — Pearson vs Spearman/Kendall разнятся. Confounder в реальных данных. 2 интерактива.
Меры центра, разброса, перцентили, корреляция. Доверительные интервалы.
Ключевые темы: mean, median, std, percentile, CI, bootstrap, корреляция.
Корреляция измеряет силу и направление связи между двумя переменными. Коэффициент Пирсона улавливает линейную связь, чувствителен к выбросам и предполагает примерно нормальные данные. Спирмена и Кендалла работают с рангами, то есть с порядком значений, поэтому ловят любую монотонную связь и устойчивы к выбросам и ненормальности. Выбор коэффициента зависит от типа данных и формы зависимости, а не подбирается ради красивой цифры.
Где применяется в аналитике: Применяется при разведочном анализе, отборе признаков, проверке связей между метриками. Ранговые коэффициенты предпочитают для порядковых шкал, скошенных распределений и при наличии выбросов; Пирсона — для числовых данных с линейной зависимостью.
На собеседовании: Спрашивают, чтобы проверить, понимает ли кандидат разницу между линейной и монотонной связью и когда Пирсон вводит в заблуждение. Смотрят на осознание чувствительности к выбросам и предположений каждого коэффициента.
В Pro-подписке по этому конспекту получите: