dbt: чем `ref()` отличается от `source()` и зачем нужны оба?
SQLmediummiddle
Проверяет владение SQL: выборки, агрегации, JOIN-ы и оконные функции.
dbtrefsourcedata-engineering
Варианты ответа
`source()` нужна только когда raw-данные лежат в другой базе; в одной базе dbt сам резолвит сырые таблицы обычным `ref()` по имени схемы и алиасу
`ref()` работает только в production-окружении, в dev/staging она возвращает заглушки — поэтому для тестирования всегда используют `source()` или прямые имена таблиц
`ref()` нужен только для порядка запуска DAG, а `source()` подставляет имя raw-таблицы как есть — без lineage и без подмены схем между окружениями
`ref()` — ссылка на другой dbt-model (даёт lineage + правильный schema); `source()` — ссылка на raw таблицу извне dbt (тоже даёт lineage, плюс позволяет freshness check)
Как разобрать этот вопрос на собеседовании
Начни с разбора схемы: какие таблицы и ключи участвуют, где могут быть NULL и дубли строк. Затем реши, что важнее — JOIN, агрегация с GROUP BY/HAVING, оконная функция или подзапрос. На собеседовании ценят не только правильный результат, но и умение проговорить план запроса и крайние случаи (пустые группы, деление на ноль, фан-аут при JOIN).
На собеседовании по такому вопросу важно не только назвать ответ, но и кратко объяснить, почему он верный.
Тема вопроса — «SQL». Чтобы подготовиться к похожим задачам, отрабатывай их на практике: sql-тренажёр помогает довести навык до автоматизма, а раздел вопросов — увидеть формулировки, которые реально встречаются на интервью аналитика данных.
Разбор ответа
Подробный разбор с объяснением «почему правильный ответ верный» и почему остальные неверны — после регистрации.
3000+ вопросов с разбором, quiz-режим с проверкой, AI-собес и подготовка к интервью аналитика.