Data инженер (Middle/Senior)
Интересный проект в крупном ритейле с современным технологическим стеком. Однако проект ограничен по времени (3 месяца), что может быть минусом для тех, кто ищет долгосрочную стабильность.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена широким стеком технологий (Lakehouse, Spark, Trino, Flink) и необходимостью опыта работы с миллиардами записей для Senior-позиции. Проект предполагает высокую нагрузку и знание специфических инструментов вроде Iceberg и Cosmos.
Анализ зарплаты
Указанный стек технологий (Spark, Trino, Flink) является высокооплачиваемым на рынке РФ. Для Middle-специалиста медиана составляет около 250-300 тысяч рублей, для Senior — от 400 тысяч рублей и выше. Проектная занятость часто предполагает ставку выше рыночной из-за краткосрочности.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь уже сейчас
Присоединяйтесь к масштабному проекту в ритейле и реализуйте свой потенциал в работе с Big Data и Lakehouse стеком!
Описание вакансии
ID 3190
#Data инженер
"Middle
Senior"
Ритейл
Кол-во специалистов
1
Длительность проекта
3 месяца
Объем участия в проекте
Высокая нагрузка
~160 ч/мес
Формат взаимодействия
Удаленно
Требуемая локация специалиста
Любая
Доступность специалиста
по мск
Требуемое гражданство специалиста
любое
Обязательные требования
Требования для уровня Middle:
- Общее представление о стеке технологий Lakehouse;
- Понимание различия работы между BigData/Lakehouse и с данными обычного размера;
- Знание SQL (индексы, функции, оптимизация, профилирование производительности);
- Знание языков программирования (JAVA, Python);
- Опыт работы c реляционными БД (Oracle, Postgres, MySQL, MsSQL,т.п.);
- Умение работать с Git (знание команд git pull/commit/push);
- Опыт работы с DBT, Cosmos, Ni-Fi;
- Опыт разработки на Spark;
- Понимание особенностей Trino;
- Понимание форматов данных Iceberg, Parquet, Avro;
- Понимание работы с minio или любого другого хранилища на основе S3;
- Опыт использования системами ведения проектов и документации.
Требования для уровня Senior:
- Общее представление о стеке технологий Lakehouse;
- Понимание различия работы между BigData/Lakehouse и с данными обычного размера;
- Знание SQL (индексы, функции, оптимизация, профилирование производительности);
- Знание языков программирования (JAVA, Python);
- Опыт работы c реляционными БД (Oracle, Postgres, MySQL, MsSQL,т.п.);
- Умение работать с Git (знание команд git pull/commit/push);
- Опыт работы с DBT, Cosmos, Ni-Fi;
- Опыт разработки на Spark;
- Навыки использования компонентов экосистемы Hadoop: Yarn, Ranger, Zookeeper, Hive metastore;
- Понимание особенностей Trino;
- Понимание форматов данных Iceberg, Parquet, Avro;
- Понимание работы с minio или любого другого хранилища на основе S3;
- Опыт использования системами ведения проектов и документации;
- Опыт разработки нетиповых интеграций (включая SAP-системы);
- Опыт разработки near-realtime потоков (Flink, Debezium);
- Опыт оптимизации высоконагруженных потоков (миллиарды записей инкремента) с использованием инструментов Observability (grafana, victoria metrics, zabbix).
Задачи на проекте
Задачи для уровня Middle:
- Сбор требований с бизнес-заказчиков и анализ источников данных;
- Разработка, реализация и поддержка интеграционных потоков, а также потоков сборки витрин-данных на стеке технологий, принятых в команде: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink;
- Оперативное реагирование на информацию о проблемах в зоне ответственности, выполнение типовых задач в установленный срок;
- Поддержание в актуальном состоянии документации типовых интеграционных решений платформы больших данных;
- Предоставление отчетности о своей деятельности руководителю.
Задачи для уровня Senior:
- Разработка, реализация и поддержка интеграционных потоков, а также потоков сборки витрин-данных на стеке технологий, принятых в команде: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink;
- Разработка нетиповых интеграций (в тч SAP);
- Системная разработка инструментов (переиспользуемых шаблонов) обработки данных;
- Разработка системного дизайна сложных решений (C2/DD);
- Оперативное реагирование на информацию о проблемах в зоне ответственности, выполнение типовых задач в установленный срок;
- Поддержание в актуальном состоянии документации типовых интеграционных решений платформы больших данных;
- Предоставление отчетности о своей деятельности руководителю.
Этапы отбора
- Техническое интервью
- Интервью с ПО
Описание проекта и команды
Крупная ритейл компания.
Стек проекта: Greenplum, Trino, Apache Airflow, ClickHouse, Python, Spark, SQL (dbt), S3, Hadoop.
Обязательные условия выхода на проект
При отклике на вакансию просьба указывать полностью ФИО кандидата.
*📩 Телеграм для связи:* Откликнуться
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- SQL
- Python
- Java
- Spark
- Trino
- Apache Airflow
- Kafka
- Flink
- PostgreSQL
- Oracle
- MySQL
- Microsoft SQL Server
- Git
- dbt
- Apache NiFi
- Hadoop
- S3
- MinIO
- Greenplum
- ClickHouse
- Debezium
- Grafana
Возможные вопросы на собеседовании
Вакансия требует понимания архитектуры Lakehouse и форматов данных нового поколения.
В чем заключаются ключевые преимущества формата Iceberg перед традиционным Parquet в контексте архитектуры Lakehouse?
Проект связан с ритейлом и большими объемами данных.
Расскажите о вашем опыте оптимизации Spark-джобов при работе с перекосом данных (data skew). Какие стратегии вы использовали?
Для Senior-уровня важен опыт с near-realtime потоками.
Как бы вы спроектировали отказоустойчивый пайплайн доставки данных из SAP в S3 с использованием Debezium и Kafka?
Стек включает Trino, который имеет свои особенности выполнения запросов.
Каковы основные отличия в архитектуре выполнения запросов между Trino и Hive? В каких случаях Trino будет менее эффективен?
Упоминается использование DBT и Cosmos.