Spills: главный источник тормозов

PySpark для аналитикаТема 4. Spills и Data Skew (главное)

Что такое spill и почему диск в 1000× медленнее RAM. Диагностика в Spark UI. 6 способов лечения: AQE, shuffle.partitions, memory, колонки, approx, алгоритмы.

О разделе «Тема 4. Spills и Data Skew (главное)»

Почему job тормозит: spill и skew. Как диагностировать, как лечить через AQE, salting, two-phase aggregation.

Ключевые темы: spill, skew, shuffle, salting, AQE skew join, two-phase aggregation.

Все темы в разделе «Тема 4. Spills и Data Skew (главное)»

Обновлено:

Полный разбор темы «Spills: главный источник тормозов» — в Pro

В Pro-подписке по этому конспекту получите:

Открыть все 390+ конспектов →