- Страна
- Россия
- Зарплата
- 250 000 ₽ – 360 000 ₽
Data Engineer
Привлекательная вакансия для опытных инженеров данных благодаря работе с действительно большими данными (Big Data) и современным стеком. Гибридный формат в Москве и конкурентная вилка делают предложение сильным на рынке.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена требованием глубокой экспертизы в ClickHouse для работы с терабайтными таблицами и необходимостью владения Python на уровне бэкенд-разработки.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Указанный в описании диапазон 250 000 – 360 000 ₽ полностью соответствует текущим рыночным ожиданиям для Middle+/Senior Data Engineer в Москве. Верхняя граница в 360к является конкурентной для продуктовых компаний.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Data Engineer в RWB
*💰*По итогам собеседования (ср. рын. зп 250 000 ₽ – 360 000 ₽)
*📌*Условия и бонусы:
Фултайм, офис/гибрид (МСК).
*📌*Наши ожидания:
– Опыт работы с ClickHouse (это ключевой навык для данной позиции. Необходимо уметь идентифицировать проблемы на кластере, понимать как работать с распределенной БД, как оптимально собрать пайплайны, чтобы не убить кластер).
– Уверенный SQL, работа с большими объёмами (у нас есть таблицы 50+ Tb).
– Владеете Python для разработки пайплайнов, а иногда даже бекенда на FastAPI.
*✍🏼*Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- ClickHouse
- SQL
- Python
- FastAPI
- ETL
- Big Data
Возможные вопросы на собеседовании
Вакансия делает упор на ClickHouse как ключевой навык. Важно понимать, как кандидат предотвращает перегрузку кластера при вставке данных.
Как вы организуете процесс вставки данных в ClickHouse, чтобы минимизировать нагрузку на ZooKeeper и избежать проблем с большим количеством мелких партов?
Работа с таблицами 50+ Тб требует понимания механизмов хранения.
Какие стратегии секционирования (partitioning) и выбора ключа сортировки (sorting key) вы бы использовали для таблицы объемом 50 Тб для оптимизации аналитических запросов?
В описании указано использование Python для пайплайнов и бэкенда.
В каких случаях при разработке ETL-пайплайна на Python вы бы отдали предпочтение асинхронности (FastAPI/httpx), а в каких — многопроцессорности?
Проверка навыков работы с распределенными БД.
В чем разница между Distributed таблицей и Replicated таблицей в ClickHouse, и как правильно выполнять JOIN на больших распределенных данных?
Проверка SQL навыков на больших объемах.
Расскажите о самом сложном SQL-запросе, который вы оптимизировали. Какие инструменты профилирования в ClickHouse вы использовали?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

