Чистка грязных данных

Python для аналитикаТема 5. Pandas практические паттерны

5-минутный sanity-check: shape/dtypes/isna/duplicates. Стратегии для NaN: dropna/fillna/ffill. Парсинг типов с errors='coerce'. Дедупликация по бизнес-ключу. Обрезка whitespace и lowercase разом. Outliers через IQR — flag, не drop.

О разделе «Тема 5. Pandas практические паттерны»

Реальные задачи аналитика: чистка грязных данных, pivot/melt, cohort/funnel в чистом pandas (без SQL), str/dt-аксессоры, парсинг логов и CRM. Что спрашивают на собесе под «вот данные — что сделаешь?».

Ключевые темы: data cleaning, pivot, melt, cohort, funnel, regex, str, dt, fuzzy match, parsing.

Все темы в разделе «Тема 5. Pandas практические паттерны»

Обновлено:

Полный разбор темы «Чистка грязных данных» — в Pro

В Pro-подписке по этому конспекту получите:

Открыть все 390+ конспектов →