5-минутный sanity-check: shape/dtypes/isna/duplicates. Стратегии для NaN: dropna/fillna/ffill. Парсинг типов с errors='coerce'. Дедупликация по бизнес-ключу. Обрезка whitespace и lowercase разом. Outliers через IQR — flag, не drop.
Реальные задачи аналитика: чистка грязных данных, pivot/melt, cohort/funnel в чистом pandas (без SQL), str/dt-аксессоры, парсинг логов и CRM. Что спрашивают на собесе под «вот данные — что сделаешь?».
Ключевые темы: data cleaning, pivot, melt, cohort, funnel, regex, str, dt, fuzzy match, parsing.
В Pro-подписке по этому конспекту получите: