**Контекст.** Маркетинг хочет понять вклад каналов (google, yandex, email, direct) в покупки. У вас есть журнал касаний (touchpoints) — каждый визит пользователя с каналом — и журнал покупок. Нужно распределить выручку каждой покупки по каналам тремя моделями атрибуции и сравнить, какой канал сколько «зарабатывает» в каждой модели.
**Что дано.** Две таблицы.
`touches`:
| колонка | тип | описание |
|---|---|---|
| `user_id` | int | id пользователя |
| `touch_ts` | datetime | время касания |
| `channel` | str | канал: google / yandex / email / direct |
`purchases`:
| колонка | тип | описание |
|---|---|---|
| `user_id` | int | id пользователя |
| `purchase_ts` | datetime | время покупки |
| `revenue` | float | сумма покупки, руб |
**Задание.**
1. Для каждой покупки сформируйте цепочку касаний пользователя, произошедших **до** момента покупки в окне 7 дней (`purchase_ts - 7 дней <= touch_ts <= purchase_ts`).
2. Реализуйте три модели атрибуции выручки покупки:
- **last-touch**: вся выручка последнему касанию в цепочке;
- **first-touch**: вся выручка первому касанию;
- **linear**: выручка делится поровну между всеми касаниями цепочки.
3. Покупки без касаний в окне относите к каналу `direct` во всех трёх моделях.
4. Формат ответа: DataFrame `channel`, `last_touch`, `first_touch`, `linear` — суммарная приписанная выручка каждого канала по каждой модели.
**Пример входа:**
[см. код в задании]
Структура для ориентира — реальные значения из эталонного решения.
touches = pd.DataFrame({
'user_id':[1,1,1,2],
'touch_ts':pd.to_datetime(['2024-06-01','2024-06-02','2024-06-03','2024-06-01']),
'channel':['google','email','yandex','direct'],
})
purchases = pd.DataFrame({
'user_id':[1,2],
'purchase_ts':pd.to_datetime(['2024-06-04','2024-06-20']),
'revenue':[3000.0, 500.0],
})
pandas атрибуция merge_asof маркетинг воронка
Это задание для уровня hard. Senior-уровень — глубокое понимание темы, опыт решения нестандартных задач, обсуждение trade-off на собеседовании.
Подобные задания в категории «Python» регулярно дают на собеседованиях аналитика данных в Яндекс, Сбер, Ozon, Авито, Тинькофф, Wildberries, T-Bank, X5, ВТБ и других крупных IT-компаниях. Тематика: pandas, атрибуция, merge_asof, маркетинг, воронка.
На реальном собеседовании на подобную задачу отводится 30-60 минут с обсуждением подходов, оптимизаций и trade-off. Для тренировки рекомендуем сначала решить самостоятельно, потом сверить с эталонным решением и подсказками.
На zasqlpython.ru есть 530+ Python задачи с проверкой через Pyodide, конспекты Python и pandas, AI мок-собеседование с разбором ваших ответов.
← Все задания