Aggregations: продвинутые техники
PySpark для аналитикаТема 2. Форматы данных и запросы
approx_count_distinct, pivot, rollup/cube/grouping sets, условные агрегации, two-phase aggregation от skew, multiple distinct.
О разделе «Тема 2. Форматы данных и запросы»
Parquet, Delta Lake, партиционирование. Joins, broadcast, оптимизация запросов.
Ключевые темы: Parquet, Delta Lake, Iceberg, broadcast join, sort-merge, partition pruning.
Все темы в разделе «Тема 2. Форматы данных и запросы»
Обновлено:
Полный разбор темы «Aggregations: продвинутые техники» — в Pro
В Pro-подписке по этому конспекту получите:
- Формулы с пошаговым разбором (LaTeX)
- Примеры Python-кода с выводом и комментариями
- Интерактивные визуализации для понимания теории
- Частые вопросы с реальных собеседований по теме «Тема 2. Форматы данных и запросы»
- Чеклист: что точно спросят на собесе аналитика
Открыть все 390+ конспектов →