UDFs vs Pandas UDF: когда что

PySpark для аналитикаТема 2. Форматы данных и запросы

Plain UDF в 100× медленнее. Pandas UDF (Arrow + векторизация). 4 типа: scalar, aggregate, iterator, applyInPandas.

О разделе «Тема 2. Форматы данных и запросы»

Parquet, Delta Lake, партиционирование. Joins, broadcast, оптимизация запросов.

Ключевые темы: Parquet, Delta Lake, Iceberg, broadcast join, sort-merge, partition pruning.

Все темы в разделе «Тема 2. Форматы данных и запросы»

Обновлено:

Полный разбор темы «UDFs vs Pandas UDF: когда что» — в Pro

В Pro-подписке по этому конспекту получите:

Открыть все 390+ конспектов →