- Страна
- Россия
Data Engineer (Телеметрия автономного транспорта)
Это социально значимый и технологически сложный проект в сфере Smart City с уникальными данными. Использование современного стека (Spark, Trino, Airflow) и работа с автономным транспортом делают вакансию крайне привлекательной для профессионального роста.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена работой с петабайтными объемами данных и необходимостью глубоких знаний Spark и архитектуры DWH/Data Lake. Дополнительную сложность добавляет специфика телеметрии автономного транспорта и возможная работа с Data Vault 2.0.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Зарплата в объявлении не указана, однако для позиции Data Engineer уровня Senior/Middle+ в Москве, работающего с Big Data (Spark, DWH), рыночный диапазон составляет от 250 000 до 450 000 рублей. Проекты, связанные с госсектором или крупной транспортной инфраструктурой, обычно предлагают конкурентные условия в рамках этого диапазона.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Всем привет!
Мы ищем талантливого Data Engineer, который готов столкнуться с непростыми задачами в области хранения и обработки больших данных в масштабах петабайт!
У вас будет уникальная возможность поучаствовать в развитии платформы данных для работы с телеметрией автономного транспорта Москвы - трамваев и метро, в том числе: в разработке архитектуры DWH, подключении новых сервисов, повышении производительности и стабильности работы платфонмы.
Что предстоит делать:
- Превращать телеметрию автономного транспорта в данные, удобные для анализа: разрабатывать и запускать Spark-пайплайны, продумывать преобразования и проверки качества
- Подключать новые источники данных: разрабатывать интеграции с различными системами и обеспечивать надёжную загрузку данных в хранилище
- Развивать архитектуру Data Lake / DWH
- Вместе с командой формировать общие подходы к разработке, мониторингу и сопровождению пайплайнов
Что ожидаем:
- Практический опыт разработки и сопровождения пайплайнов данных
- Опыт работы с PySpark, Python и SQL
- Опыт работы с Data Lake / DWH и понимание принципов построения ETL/ELT-процессов
- Понимание принципов распределённой обработки данных
Будет плюсом:
- Опыт работы с Trino+S3
- Опыт оркестрации пайплайнов с помощью Airflow
- Знакомство с Data Vault 2.0
- Знание Scala и опыт её использования для обработки данных
- Опыт развития платформы данных на ранних этапах: от выбора решений до их внедрения и сопровождения
Контакт для связи:
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Spark
- PySpark
- Python
- SQL
- DWH
- Data Lake
- ETL
- ELT
- Trino
- S3
- Airflow
- Data Vault 2.0
- Scala
Возможные вопросы на собеседовании
Важно понимать, как кандидат справляется с перекосом данных (data skew) и оптимизацией ресурсов при работе с петабайтами.
Расскажите о самом сложном Spark-пайплайне, который вы оптимизировали. С какими узкими местами вы столкнулись?
Вакансия предполагает развитие архитектуры DWH/Data Lake. Знание Data Vault 2.0 является плюсом.
В каких случаях вы бы предпочли архитектуру Data Vault 2.0 классической схеме 'звезда' или Snowflake?
Работа с телеметрией требует высокого качества данных для последующего анализа автономного транспорта.
Как вы организуете проверки качества данных (Data Quality) в реальном времени или при пакетной загрузке телеметрии?
В стеке упоминается Trino+S3. Важно знать, как кандидат работает с объектными хранилищами.
Какие особенности хранения данных в S3 нужно учитывать при работе через Trino для обеспечения высокой скорости запросов?
Оркестрация — ключевой элемент стабильности платформы.
Как вы подходите к обработке сбоев в Airflow, если один из этапов загрузки петабайтных данных завершился ошибкой?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

