- Страна
- Россия
Откликайтесь
на вакансии с ИИ

Data Engineer (Python + Spark)
X5 Tech — это сильный бренд с огромными массивами данных, что гарантирует интересные задачи. Четкий стек технологий и понятный продукт (ML для ритейла) делают вакансию привлекательной для Middle-специалиста, несмотря на офисный формат.
Сложность вакансии
Роль требует уверенного владения PySpark и опытом работы с Big Data инструментами в масштабах крупного ритейла. Основная сложность заключается в необходимости обработки огромных объемов данных (200+ млн строк) в режиме near-real-time.
Анализ зарплаты
Зарплата в объявлении не указана, но для позиции Middle Data Engineer в Москве рыночный диапазон составляет от 200 000 до 350 000 рублей после вычета налогов. Крупные тех-компании вроде X5 обычно предлагают конкурентные условия, соответствующие верхней границе рынка, включая расширенный соцпакет.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь в X5 Tech уже сейчас
Присоединяйтесь к команде X5 Tech и создавайте ML-решения, влияющие на миллионы покупателей ежедневно!
Описание вакансии
X5 Tech
Data Engineer (Python + Spark)
Формат работы: офис (Москва)
В команде разрабатывается ML-система, детектирующая Out-of-stock ситуации и аномалии в продажах, которая в near-real-time выявляет потенциальные проблемы с наличием товара и отправляет предупреждения сотрудникам магазинов.
*☑️* Чем предстоит заниматься
-Разрабатывать и оптимизировать Spark-пайплайны для обработки данных в масштабе (200+ млн строк ежедневно)
-Настраивать хранение и доступность данных в DWH
-Автоматизировать интеграцию данных: продажи, акции, цены, остатки, погода, календари
-Работать в связке с Data Science-командой, обеспечивая стабильный и качественный поток данных для моделей
-Участвовать в развитии платформы прогнозирования спроса
*☑️* Наши пожелания к кандидатам
-Стек: PySpark 2/3, Spark SQL
-Hadoop / Hive / Trino / S3 / ClickHouse / Postgres / Greenplum
-Airflow, Python3, Docker, YARN/k8s, pytest
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- Kubernetes
- PostgreSQL
- Docker
- PySpark
- Airflow
- Hadoop
- PyTest
- S3
- Hive
- ClickHouse
- Trino
- YARN
- Spark SQL
- Greenplum
Возможные вопросы на собеседовании
Проверка навыков оптимизации производительности при работе с большими данными.
Как бы вы оптимизировали Spark-пайплайн, если столкнулись с проблемой перекоса данных (data skew)?
Важно понимать опыт кандидата в обеспечении надежности данных для ML-моделей.
Какие методы проверки качества данных (Data Quality) вы внедряли в свои Airflow DAGи?
Вакансия предполагает работу с различными хранилищами.
В каких случаях вы выберете ClickHouse, а в каких Greenplum для хранения результатов обработки?
Проверка понимания архитектуры Hadoop.
Расскажите о различиях в управлении ресурсами при запуске Spark-приложений на YARN и Kubernetes.
Проверка навыков написания чистого и тестируемого кода.
Как вы организуете тестирование Spark-трансформаций с использованием pytest?
Похожие вакансии
Data-аналитик в проект банка (Middle+)
Аналитик DWH
Продуктовый аналитик AI Middle
Аналитик данных BI
Аналитик данных (DWH)
Игровой (продуктовый) аналитик
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!