PySpark для аналитикаТема 4. Spills и Data Skew (главное)
Что такое spill и почему диск в 1000× медленнее RAM. Диагностика в Spark UI. 6 способов лечения: AQE, shuffle.partitions, memory, колонки, approx, алгоритмы.
О разделе «Тема 4. Spills и Data Skew (главное)»
Почему job тормозит: spill и skew. Как диагностировать, как лечить через AQE, salting, two-phase aggregation.