Дерево решений на трейне даёт accuracy 0.99, на тесте 0.71; лог-регрессия — 0.80 и 0.79 соответственно. Продакт спрашивает, что делать с деревом. Что вы диагностируете и предлагаете?
MLeasyjunior
Проверяет основы машинного обучения и оценку моделей.
bias-varianceпереобучениедеревья
Варианты ответа
Лог-регрессия переобучена, потому что её train и test почти равны — это признак заучивания шаблона
Разница объясняется случайностью сплита, при другом random_state дерево и лог-регрессия поменяются местами
Дерево переобучено (высокий variance): большой разрыв train-test — признак переобучения, нужно ограничить глубину/min_samples_leaf или перейти к ансамблю (random forest, бустинг)
Дерево недообучено (высокий bias): низкий тест означает нехватку сложности, нужно увеличить глубину дерева и убрать регуляризацию
Как разобрать этот вопрос на собеседовании
Определи тип задачи (регрессия/классификация), как ты разобьёшь данные и какой метрикой будешь мерить качество с учётом дисбаланса классов. Ценят понимание переобучения, утечки данных и того, почему выбрана именно эта метрика, а не accuracy по умолчанию.
Это базовый вопрос — на собеседовании его задают как разминку и фильтр, поэтому важно ответить уверенно и без заминок.
Тема вопроса — «ML». Чтобы подготовиться к похожим задачам, отрабатывай их на практике: раздел практики помогает довести навык до автоматизма, а раздел вопросов — увидеть формулировки, которые реально встречаются на интервью аналитика данных.
Разбор ответа
Подробный разбор с объяснением «почему правильный ответ верный» и почему остальные неверны — после регистрации.
3000+ вопросов с разбором, quiz-режим с проверкой, AI-собес и подготовка к интервью аналитика.