K-Means кластеризация клиентов

Medium scikit-learn ML Авито

Условие задачи

Дано: DataFrame `customers` с колонками frequency, monetary -- 50 клиентов. Кластеризуйте клиентов на 3 группы методом K-Means по стандартизованным признакам (random_state=42). Для каждого кластера получите центр (в стандартизованных координатах), размер и итоговую инерцию модели. Сохраните dict {"cluster_centers": list of lists (round 2), "cluster_sizes": list(int), "inertia": round(2)} в `result`.

Темы

kmeans clustering standardscaler

Подсказки

Что проверяет эта задача

Задача «K-Means кластеризация клиентов» учит решать задачи на scikit-learn так, как это спрашивают на собеседовании аналитика данных. Такие задачи дают на собеседованиях в Авито и других IT-компаниях. Уровень средний — типичная боевая задача на уверенный Python.

Как подступиться к решению

Сначала разбери условие и формат входа-выхода, прикинь крайние случаи (пустой ввод, дубли, NaN). Затем выбери структуру данных и собери решение по шагам — начни с простого рабочего варианта, потом оптимизируй сложность. Код пишешь и запускаешь прямо в браузере: Python-тренажёр исполняет его через Pyodide (pandas, numpy, scipy) и проверяет результат автоматически.

На собеседовании по Python для аналитика ценят чистый читаемый код, корректную обработку крайних случаев (пустой ввод, дубли, None) и умение вслух оценить сложность по времени и памяти. Часто просят не просто решить, а разобрать альтернативные подходы и показать, где наивное решение сломается на большом объёме данных.

Прокачать Python для аналитики — бесплатный курс «Pandas с нуля» и Python-тренажёр.

Открыть задачу в тренажёре → ← Все Python-задачи