- Страна
- Россия
Data Engineer (Middle+/TeamLead)
Интересный проект в производственном секторе с современным стеком (Lakehouse, Flink). Однако отсутствие информации о зарплате и конкретном названии компании снижает прозрачность предложения.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена широким стеком технологий (Iceberg, Flink, StarRocks) и требованием к опыту от 4 лет, включая навыки архитектурного проектирования и оптимизации.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Позиция Middle+/TeamLead Data Engineer с таким широким стеком (Flink, Iceberg, CDC) на российском рынке обычно оценивается выше среднего. Указанные требования соответствуют верхнему эшелону зарплатных предложений для опытных инженеров данных.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Data Engineer
*▫️*Грейд: Middle+/TeamLead
*▫️*Домен: Производство
*▫️*Локация: РФ/РБ
*▫️*Длительность: 6+ мес.
Требования:
Обязательные:
- Опыт работы на позиции Data Engineer от 4 лет в сфере разработки ПО
- DBMS & Warehouses: уверенная работа с Postgres и MSSQL; опыт настройки и оптимизации OLAP-движков (Trino, StarRocks) и современных хранилищ (Cassandra, Redis)
- Data Flow Tools: практический опыт работы с Apache Airflow (написание DAG, кастомные операторы); опыт использования Apache Kafka (producer/consumer) и Apache Flink (разработка стриминговых джоб, состояние, чекпоинты)
- Data Lake / Lakehouse: опыт работы с Apache Iceberg, понимание архитектуры lakehouse, использование Lakekeeper для управления метаданными, работа с объектным хранилищем S3
- CDC: опыт реализации Change Data Capture паттернов для синхронизации данных между системами
- Глубокие знания в области архитектуры данных и баз данных: понимание принципов нормализации и денормализации, проектирование relational и columnar моделей, стратегии управления данными (lifecycle, retention, versioning)
- Уверенное владение Python: написание скриптов, модулей, работа с асинхронностью при необходимости; опыт написания DAG в Apache Airflow, включая кастомные операторы, hooks, sensors
- Навыки оптимизации: умение профилировать процессы, находить bottlenecks, оптимизировать SQL-запросы и настраивать ресурсы кластеров под нагрузку
- Владение Jira и Confluence на уровне confident user (структура страниц, шаблоны, макросы, связки задач и документации)
- Опыт организации хранения данных для последующих задач OLAP / OLTP с учетом требований (consistency / integrity)
- Опыт организации обработки данных в рамках задач OLAP / OLTP с применением различных паттернов (batch processing, CDC)
- Понимание ключевых особенностей и сценариев применения различных паттернов организации интеграционных потоков (batch processing, CDC) с учетом их характеристик (3V+)
- Опыт заведения и сопровождения заявок в сервис-деске
- Умение структурировать информацию, работать с требованиями, документировать технические решения
- Английский язык — на уровне чтения и написания технической документации
Будет плюсом:
- Опыт работы с Timeseries базами данных (InfluxDB, TimescaleDB, TDengine и др.)
- Глубокий опыт эксплуатации кластеров (Hadoop, YARN, Kubernetes) в production-среде
- Знание SQL на продвинутом уровне (оптимизация сложных запросов, window functions, CTE)
- Опыт работы с CI/CD для data-пайплайнов
- Понимание принципов DDD, event-driven архитектуры
- Опыт работы с Apache NiFi
Откликнуться на запрос: Откликнуться
По вопросам партнерского сотрудничества: Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- PostgreSQL
- Microsoft SQL Server
- Trino
- StarRocks
- Cassandra
- Redis
- Apache Airflow
- Apache Kafka
- Apache Flink
- Apache Iceberg
- Amazon S3
- Python
- Jira
- Confluence
- InfluxDB
- TimescaleDB
- Hadoop
- Kubernetes
- CI/CD
- Apache NiFi
Возможные вопросы на собеседовании
Проверка понимания архитектуры Lakehouse и практического опыта с Iceberg.
Расскажите о вашем опыте работы с Apache Iceberg: какие преимущества он дает по сравнению с классическими Hive-таблицами и как вы решали вопросы эволюции схем?
Оценка навыков работы со стриминговыми данными.
С какими основными сложностями вы сталкивались при разработке стриминговых джоб на Apache Flink, особенно в контексте управления состоянием (state) и чекпоинтами?
Проверка архитектурного мышления.
Как бы вы спроектировали систему CDC для синхронизации данных между MSSQL и аналитическим хранилищем в реальном времени? Какие инструменты и паттерны вы бы выбрали?
Оценка навыков оптимизации производительности.
Опишите ваш подход к поиску bottlenecks в медленно работающем DAG в Airflow. Какие методы оптимизации ресурсов кластера вы применяли?
Проверка знаний в области моделирования данных.
В каких случаях вы отдадите предпочтение нормализованной реляционной модели, а в каких — денормализованной columnar модели для задач OLAP?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

