Чем XGBoost/LightGBM лучше Random Forest для табличных данных?
MLmediummiddle
Проверяет основы машинного обучения и оценку моделей.
quiz-bankmlxgboostrandom-forest
Варианты ответа
XGBoost всегда обучается быстрее любого другого алгоритма — благодаря оптимизированной имплементации на C++ и hardware-ускорению через GPU для любого типа данных
Gradient boosting строит деревья последовательно, каждое исправляет ошибки предыдущих. Обычно точнее Random Forest, поддерживает missing values, имеет встроенную регуляризацию
XGBoost всегда строго точнее Random Forest на любых табличных задачах по определению — это следует из того, что boosting по своей природе превосходит bagging
Random Forest разработан для работы только с изображениями и текстом через sklearn pipelines, а для классических табличных данных требуется использовать XGBoost или LightGBM
Как разобрать этот вопрос на собеседовании
Определи тип задачи (регрессия/классификация), как ты разобьёшь данные и какой метрикой будешь мерить качество с учётом дисбаланса классов. Ценят понимание переобучения, утечки данных и того, почему выбрана именно эта метрика, а не accuracy по умолчанию.
На собеседовании по такому вопросу важно не только назвать ответ, но и кратко объяснить, почему он верный.
Тема вопроса — «ML». Чтобы подготовиться к похожим задачам, отрабатывай их на практике: раздел практики помогает довести навык до автоматизма, а раздел вопросов — увидеть формулировки, которые реально встречаются на интервью аналитика данных.
Разбор ответа
Подробный разбор с объяснением «почему правильный ответ верный» и почему остальные неверны — после регистрации.
3000+ вопросов с разбором, quiz-режим с проверкой, AI-собес и подготовка к интервью аналитика.