Откликайтесь
на вакансии с ИИ

Data инженер (Middle/Senior)
Интересный проект в крупном ритейле с современным технологическим стеком. Однако проект ограничен по времени (3 месяца), что может быть минусом для тех, кто ищет долгосрочную стабильность.
Сложность вакансии
Высокая сложность обусловлена широким стеком технологий (Lakehouse, Spark, Trino, Flink) и необходимостью опыта работы с миллиардами записей для Senior-позиции. Проект предполагает высокую нагрузку и знание специфических инструментов вроде Iceberg и Cosmos.
Анализ зарплаты
Указанный стек технологий (Spark, Trino, Flink) является высокооплачиваемым на рынке РФ. Для Middle-специалиста медиана составляет около 250-300 тысяч рублей, для Senior — от 400 тысяч рублей и выше. Проектная занятость часто предполагает ставку выше рыночной из-за краткосрочности.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь уже сейчас
Присоединяйтесь к масштабному проекту в ритейле и реализуйте свой потенциал в работе с Big Data и Lakehouse стеком!
Описание вакансии
ID 3190
#Data инженер
"Middle
Senior"
Ритейл
Кол-во специалистов
1
Длительность проекта
3 месяца
Объем участия в проекте
Высокая нагрузка
~160 ч/мес
Формат взаимодействия
Удаленно
Требуемая локация специалиста
Любая
Доступность специалиста
по мск
Требуемое гражданство специалиста
любое
Обязательные требования
Требования для уровня Middle:
- Общее представление о стеке технологий Lakehouse;
- Понимание различия работы между BigData/Lakehouse и с данными обычного размера;
- Знание SQL (индексы, функции, оптимизация, профилирование производительности);
- Знание языков программирования (JAVA, Python);
- Опыт работы c реляционными БД (Oracle, Postgres, MySQL, MsSQL,т.п.);
- Умение работать с Git (знание команд git pull/commit/push);
- Опыт работы с DBT, Cosmos, Ni-Fi;
- Опыт разработки на Spark;
- Понимание особенностей Trino;
- Понимание форматов данных Iceberg, Parquet, Avro;
- Понимание работы с minio или любого другого хранилища на основе S3;
- Опыт использования системами ведения проектов и документации.
Требования для уровня Senior:
- Общее представление о стеке технологий Lakehouse;
- Понимание различия работы между BigData/Lakehouse и с данными обычного размера;
- Знание SQL (индексы, функции, оптимизация, профилирование производительности);
- Знание языков программирования (JAVA, Python);
- Опыт работы c реляционными БД (Oracle, Postgres, MySQL, MsSQL,т.п.);
- Умение работать с Git (знание команд git pull/commit/push);
- Опыт работы с DBT, Cosmos, Ni-Fi;
- Опыт разработки на Spark;
- Навыки использования компонентов экосистемы Hadoop: Yarn, Ranger, Zookeeper, Hive metastore;
- Понимание особенностей Trino;
- Понимание форматов данных Iceberg, Parquet, Avro;
- Понимание работы с minio или любого другого хранилища на основе S3;
- Опыт использования системами ведения проектов и документации;
- Опыт разработки нетиповых интеграций (включая SAP-системы);
- Опыт разработки near-realtime потоков (Flink, Debezium);
- Опыт оптимизации высоконагруженных потоков (миллиарды записей инкремента) с использованием инструментов Observability (grafana, victoria metrics, zabbix).
Задачи на проекте
Задачи для уровня Middle:
- Сбор требований с бизнес-заказчиков и анализ источников данных;
- Разработка, реализация и поддержка интеграционных потоков, а также потоков сборки витрин-данных на стеке технологий, принятых в команде: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink;
- Оперативное реагирование на информацию о проблемах в зоне ответственности, выполнение типовых задач в установленный срок;
- Поддержание в актуальном состоянии документации типовых интеграционных решений платформы больших данных;
- Предоставление отчетности о своей деятельности руководителю.
Задачи для уровня Senior:
- Разработка, реализация и поддержка интеграционных потоков, а также потоков сборки витрин-данных на стеке технологий, принятых в команде: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink;
- Разработка нетиповых интеграций (в тч SAP);
- Системная разработка инструментов (переиспользуемых шаблонов) обработки данных;
- Разработка системного дизайна сложных решений (C2/DD);
- Оперативное реагирование на информацию о проблемах в зоне ответственности, выполнение типовых задач в установленный срок;
- Поддержание в актуальном состоянии документации типовых интеграционных решений платформы больших данных;
- Предоставление отчетности о своей деятельности руководителю.
Этапы отбора
- Техническое интервью
- Интервью с ПО
Описание проекта и команды
Крупная ритейл компания.
Стек проекта: Greenplum, Trino, Apache Airflow, ClickHouse, Python, Spark, SQL (dbt), S3, Hadoop.
Обязательные условия выхода на проект
При отклике на вакансию просьба указывать полностью ФИО кандидата.
*📩 Телеграм для связи:* Откликнуться
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- SQL
- Python
- Java
- Spark
- Trino
- Apache Airflow
- Kafka
- Flink
- PostgreSQL
- Oracle
- MySQL
- Microsoft SQL Server
- Git
- dbt
- Apache NiFi
- Hadoop
- S3
- MinIO
- Greenplum
- ClickHouse
- Debezium
- Grafana
Возможные вопросы на собеседовании
Вакансия требует понимания архитектуры Lakehouse и форматов данных нового поколения.
В чем заключаются ключевые преимущества формата Iceberg перед традиционным Parquet в контексте архитектуры Lakehouse?
Проект связан с ритейлом и большими объемами данных.
Расскажите о вашем опыте оптимизации Spark-джобов при работе с перекосом данных (data skew). Какие стратегии вы использовали?
Для Senior-уровня важен опыт с near-realtime потоками.
Как бы вы спроектировали отказоустойчивый пайплайн доставки данных из SAP в S3 с использованием Debezium и Kafka?
Стек включает Trino, который имеет свои особенности выполнения запросов.
Каковы основные отличия в архитектуре выполнения запросов между Trino и Hive? В каких случаях Trino будет менее эффективен?
Упоминается использование DBT и Cosmos.
Как вы организуете тестирование качества данных (data quality) внутри DBT пайплайнов?
Похожие вакансии
Data инженер (Middle+)
Data инженер
Data Engineer Middle
Главный инженер Контроль качества данных
Junior Python Data Engineer
Tech Lead Data Engineer / Руководитель сопровождения и развития СККД
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!