Ночной ETL на pandas: 30 ГБ parquet, 40 минут, периодически падает по памяти. Думаешь перевести на polars. Что это даст и где останутся минусы?
Pythonmediummiddle
Проверяет знание Python и pandas для анализа данных.
pythonpolarspandasperformance
Варианты ответа
pandas быстрее polars всегда — за счёт mature C-расширений NumPy и проверенного годами движка groupby/merge с inline-оптимизациями LLVM
polars: Rust + Arrow, lazy-оптимизатор и все ядра CPU из коробки — быстрее на больших данных; минус — экосистема и интеграции у pandas шире
polars — это новая мажорная версия pandas API с тем же синтаксисом, выпущенная командой pandas-dev в 2023 для замены legacy-pandas без breaking changes
polars ускорит только чтение файлов: groupby и join у него всё равно однопоточные поверх numpy, поэтому пиковая память не изменится
Как разобрать этот вопрос на собеседовании
Подумай, какая структура данных и какой инструмент pandas решают задачу с наименьшей сложностью: векторизация вместо циклов, groupby/merge вместо ручных склеек, корректная работа с NaN и типами. Интервьюер смотрит на читаемость кода и на то, понимаешь ли ты, что происходит «под капотом» — копия или вью, сложность операции, утечки памяти на больших данных.
На собеседовании по такому вопросу важно не только назвать ответ, но и кратко объяснить, почему он верный.
Тема вопроса — «Python». Чтобы подготовиться к похожим задачам, отрабатывай их на практике: python-тренажёр помогает довести навык до автоматизма, а раздел вопросов — увидеть формулировки, которые реально встречаются на интервью аналитика данных.
Разбор ответа
Подробный разбор с объяснением «почему правильный ответ верный» и почему остальные неверны — после регистрации.
3000+ вопросов с разбором, quiz-режим с проверкой, AI-собес и подготовка к интервью аналитика.