yandex
N
NDA
Страна
Россия
+500% приглашений

Откликайтесь
на вакансии с ИИ

Ускорим процесс поиска работы
MiddleУдалённоПолная занятость

Data Engineer+ML

ИИОценка ИИ

Интересная роль на стыке Data Engineering и ML с современным стеком (RAG, LLM). Однако наличие жестких возрастных рамок и отсутствие указания компании/зарплаты снижают общую привлекательность.


Вакансия из Quick Offer Global, списка международных компаний
Пожаловаться

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Высокая сложность обусловлена широким стеком технологий: от классического Data Engineering (Spark, Airflow, Hadoop) до современных ML-задач (RAG, векторные БД, LLM). Также присутствуют строгие возрастные ограничения и проверка на дублирование в базе заказчика.

Анализ зарплаты

Медиана300 000 ₽
Рынок220 000 ₽ – 380 000 ₽
ИИОценка ИИ

Предлагаемая роль Middle Data Engineer с ML-уклоном на российском рынке обычно оплачивается в диапазоне 250-350 тысяч рублей. Учитывая требования к Spark и RAG, позиция находится в верхнем сегменте для уровня Middle.

Сопроводительное письмо

Меня крайне заинтересовала вакансия Data Engineer+ML, особенно в части работы с векторными хранилищами OpenSearch и Qdrant для реализации RAG-архитектур. Мой опыт разработки отказоустойчивых ETL-сервисов на Python под управлением Apache Airflow и глубокое понимание Apache Spark позволяют мне эффективно решать задачи по обработке больших данных и подготовке эмбеддингов для LLM.

Я обладаю продвинутыми навыками работы с SQL и реляционными базами данных, такими как PostgreSQL и Oracle, а также имею опыт работы с Hadoop и форматами Iceberg. Уверен, что мой проактивный подход и технический стек помогут вашей команде в создании высокопроизводительных аналитических решений и внедрении современных ML-практик.

+250% к просмотрам

Составьте идеальное письмо к вакансии с ИИ-агентом

Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь уже сейчас

Отправьте свое резюме с указанием возраста и локации, чтобы присоединиться к разработке передовых RAG-систем!

Описание вакансии

ID 3436

Data Engineer+ML

Middle Возраст: от 25до 45 летПривлечение 12 мес

Технические знания и опыт:

• Высокий уровень знаний языка программирования Python – структуры данных, итераторы и декораторы, параллельное и асинхронное программирование, объектно-ориентированное и функциональное программирование.

• Отличные знания SQL – создание сложных запросов с использованием табличных выражений (CTE) и оконных функций.

• Опыт работы с векторными хранилищами данных OpenSearch, Qdrant

• Опыт разработки сервисов пакетной и потоковой обработки данных для вычисления их векторного представления (embedding) и сохранения в векторном хранилище для обогащения больших языковых моделей (LLM) релевантными контекстными данными (RAG).

• Опыт работы в среде JupyterLab/JupyterHub.

• Опыт реализации промышленных отказоустойчивых сервисов ETL на Python для пакетной загрузки и трансформации данных под управлением Apache Airflow, Argo Workflows;

• Хорошие знания платформы Apache Spark – опыт использования библиотеки pyspark, влияние конфигурации приложения pyspark на производительность и эффективность обработки данных, отладка и анализ эффективности приложений pyspark с помощью Spark History Server.

• Опыт асинхронного программного взаимодействия с веб-сервисами по REST API с использованием библиотек – aiohttp, httpx.

• Хорошие знания и опыт использования реляционных баз данных Oracle, PostgreSQL

• Понимание особенностей обработки и хранения аналитических данных (OLAP), понимание отличий колоночных баз данных от строковых, знание колоночных форматов хранения данных – parquet, orc.

• Хорошие знания и опыт использования хранилищ больших данных – Hadoop/HDFS, S3, форматы таблиц Hive, Iceberg.

Будет дополнительным преимуществом:

• Знание и опыт использования платформ потоковой обработки данных Apache Kafka, Apache Flink – чтение и запись потока данных Apache Kafka с помощью библиотек aiokafka, confluent-kafka, kafka-python, разработка потоковых приложений Apache Flink.

Личностные и коммуникативные навыки:

• Проактивный подход к работе – способность и желание искать и предлагать методы и варианты решения задач.

• Общий позитивный настрой и активная жизненная позиция.

• Умение и желание работать в команде, делиться опытом с коллегами и учиться новым практикам.

• Открытость в коммуникации трудностей, препятствующих решению задач.

Если кандидат в течении года подавался напрямую или через вендора к заказчику - таких кандидатов заказчик не рассмотрит

Обязательный чек-лист перед отправкой кандидата:

  1. Кандидату от 23-45 лет?
  2. Подавался ли кандидат в течении года к клиенту?
  3. Работал ли кандидат у клиента?

*❗️**❗️**❗️Писать {{apply_contact}}⚡️**⚡️**⚡️**⚡️ С РЕЗЮМЕ В КОТОРОМ УКАЗАН ВОЗРАСТ И ЛОКАЦИЯ НАХОЖДЕНИЯ. Укажите 🆔 вакансии❗️ Без этой информации отклики не рассматриваются ❗️**❗️*

+400% к собеседованиям

Создайте идеальное резюме с помощью ИИ-агента

Создайте идеальное резюме с помощью ИИ-агента

Навыки

  • Python
  • LLM
  • SQL
  • PostgreSQL
  • RAG
  • PySpark
  • Apache Spark
  • Hadoop
  • Apache Iceberg
  • Apache Flink
  • ETL
  • REST API
  • Apache Airflow
  • Apache Kafka
  • Oracle
  • S3
  • HDFS
  • OpenSearch
  • Argo Workflows
  • Apache Hive
  • Qdrant
  • aiohttp
  • httpx
  • JupyterLab

Возможные вопросы на собеседовании

Проверка глубоких знаний Python и понимания асинхронности, критичной для взаимодействия с API.

В чем разница между использованием aiohttp и httpx при реализации асинхронных запросов к REST API?

Оценка опыта работы с векторными данными, что является ключевым требованием.

Какие стратегии индексации в Qdrant или OpenSearch вы использовали для оптимизации поиска по сходству в RAG-системах?

Проверка навыков оптимизации Spark-приложений.

Как вы используете Spark History Server для выявления перекоса данных (data skew) и оптимизации джойнов?

Оценка понимания современных форматов хранения данных.

В чем преимущества использования формата Apache Iceberg по сравнению с обычными Hive-таблицами для аналитических задач?

Проверка навыков проектирования ETL-процессов.

Как обеспечить отказоустойчивость и идемпотентность ETL-пайплайна при работе с Apache Airflow и большими объемами данных в S3?

Похожие вакансии

более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!

N
NDA
Россия