yandex
N
NDA
Страна
Россия
УдалённоПолная занятость

Data Engineer (Телеметрия автономного транспорта)

ИИОценка ИИ

Это социально значимый и технологически сложный проект в сфере Smart City с уникальными данными. Использование современного стека (Spark, Trino, Airflow) и работа с автономным транспортом делают вакансию крайне привлекательной для профессионального роста.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.


Вакансия из открытого источника
Пожаловаться
+400% приглашений от HR

Улучшите резюме под эту вакансию

Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Высокая сложность обусловлена работой с петабайтными объемами данных и необходимостью глубоких знаний Spark и архитектуры DWH/Data Lake. Дополнительную сложность добавляет специфика телеметрии автономного транспорта и возможная работа с Data Vault 2.0.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Анализ зарплаты

Медиана350 000 ₽
Рынок250 000 ₽ – 450 000 ₽
ИИОценка ИИ

Зарплата в объявлении не указана, однако для позиции Data Engineer уровня Senior/Middle+ в Москве, работающего с Big Data (Spark, DWH), рыночный диапазон составляет от 250 000 до 450 000 рублей. Проекты, связанные с госсектором или крупной транспортной инфраструктурой, обычно предлагают конкурентные условия в рамках этого диапазона.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Сопроводительное письмо

Составьте сопроводительное письмо под эту вакансию с вашим резюме

Иллюстрация сопроводительного письмаИллюстрация сопроводительного письма

Описание вакансии

Всем привет!

Мы ищем талантливого Data Engineer, который готов столкнуться с непростыми задачами в области хранения и обработки больших данных в масштабах петабайт!

У вас будет уникальная возможность поучаствовать в развитии платформы данных для работы с телеметрией автономного транспорта Москвы - трамваев и метро, в том числе: в разработке архитектуры DWH, подключении новых сервисов, повышении производительности и стабильности работы платфонмы.

Что предстоит делать:

- Превращать телеметрию автономного транспорта в данные, удобные для анализа: разрабатывать и запускать Spark-пайплайны, продумывать преобразования и проверки качества

- Подключать новые источники данных: разрабатывать интеграции с различными системами и обеспечивать надёжную загрузку данных в хранилище

- Развивать архитектуру Data Lake / DWH

- Вместе с командой формировать общие подходы к разработке, мониторингу и сопровождению пайплайнов

Что ожидаем:

- Практический опыт разработки и сопровождения пайплайнов данных

- Опыт работы с PySpark, Python и SQL

- Опыт работы с Data Lake / DWH и понимание принципов построения ETL/ELT-процессов

- Понимание принципов распределённой обработки данных

Будет плюсом:

- Опыт работы с Trino+S3

- Опыт оркестрации пайплайнов с помощью Airflow

- Знакомство с Data Vault 2.0

- Знание Scala и опыт её использования для обработки данных

- Опыт развития платформы данных на ранних этапах: от выбора решений до их внедрения и сопровождения

Контакт для связи:

Откликнуться

Больше похожих вакансий + автоотклики с ИИ

Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Больше похожих вакансий + автоотклики с ИИ

Навыки

  • Spark
  • PySpark
  • Python
  • SQL
  • DWH
  • Data Lake
  • ETL
  • ELT
  • Trino
  • S3
  • Airflow
  • Data Vault 2.0
  • Scala

Возможные вопросы на собеседовании

Важно понимать, как кандидат справляется с перекосом данных (data skew) и оптимизацией ресурсов при работе с петабайтами.

Расскажите о самом сложном Spark-пайплайне, который вы оптимизировали. С какими узкими местами вы столкнулись?

Вакансия предполагает развитие архитектуры DWH/Data Lake. Знание Data Vault 2.0 является плюсом.

В каких случаях вы бы предпочли архитектуру Data Vault 2.0 классической схеме 'звезда' или Snowflake?

Работа с телеметрией требует высокого качества данных для последующего анализа автономного транспорта.

Как вы организуете проверки качества данных (Data Quality) в реальном времени или при пакетной загрузке телеметрии?

В стеке упоминается Trino+S3. Важно знать, как кандидат работает с объектными хранилищами.

Какие особенности хранения данных в S3 нужно учитывать при работе через Trino для обеспечения высокой скорости запросов?

Оркестрация — ключевой элемент стабильности платформы.

Как вы подходите к обработке сбоев в Airflow, если один из этапов загрузки петабайтных данных завершился ошибкой?

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Похожие вакансии

N
NDA
Россия
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!