- Страна
- Россия
Откликайтесь
на вакансии с ИИ

Data Engineer+ML
Интересная роль на стыке Data Engineering и ML с современным стеком (RAG, LLM). Однако наличие жестких возрастных рамок и отсутствие указания компании/зарплаты снижают общую привлекательность.
Сложность вакансии
Высокая сложность обусловлена широким стеком технологий: от классического Data Engineering (Spark, Airflow, Hadoop) до современных ML-задач (RAG, векторные БД, LLM). Также присутствуют строгие возрастные ограничения и проверка на дублирование в базе заказчика.
Анализ зарплаты
Предлагаемая роль Middle Data Engineer с ML-уклоном на российском рынке обычно оплачивается в диапазоне 250-350 тысяч рублей. Учитывая требования к Spark и RAG, позиция находится в верхнем сегменте для уровня Middle.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь уже сейчас
Отправьте свое резюме с указанием возраста и локации, чтобы присоединиться к разработке передовых RAG-систем!
Описание вакансии
ID 3436
Data Engineer+ML
Middle Возраст: от 25до 45 летПривлечение 12 мес
Технические знания и опыт:
• Высокий уровень знаний языка программирования Python – структуры данных, итераторы и декораторы, параллельное и асинхронное программирование, объектно-ориентированное и функциональное программирование.
• Отличные знания SQL – создание сложных запросов с использованием табличных выражений (CTE) и оконных функций.
• Опыт работы с векторными хранилищами данных OpenSearch, Qdrant
• Опыт разработки сервисов пакетной и потоковой обработки данных для вычисления их векторного представления (embedding) и сохранения в векторном хранилище для обогащения больших языковых моделей (LLM) релевантными контекстными данными (RAG).
• Опыт работы в среде JupyterLab/JupyterHub.
• Опыт реализации промышленных отказоустойчивых сервисов ETL на Python для пакетной загрузки и трансформации данных под управлением Apache Airflow, Argo Workflows;
• Хорошие знания платформы Apache Spark – опыт использования библиотеки pyspark, влияние конфигурации приложения pyspark на производительность и эффективность обработки данных, отладка и анализ эффективности приложений pyspark с помощью Spark History Server.
• Опыт асинхронного программного взаимодействия с веб-сервисами по REST API с использованием библиотек – aiohttp, httpx.
• Хорошие знания и опыт использования реляционных баз данных Oracle, PostgreSQL
• Понимание особенностей обработки и хранения аналитических данных (OLAP), понимание отличий колоночных баз данных от строковых, знание колоночных форматов хранения данных – parquet, orc.
• Хорошие знания и опыт использования хранилищ больших данных – Hadoop/HDFS, S3, форматы таблиц Hive, Iceberg.
Будет дополнительным преимуществом:
• Знание и опыт использования платформ потоковой обработки данных Apache Kafka, Apache Flink – чтение и запись потока данных Apache Kafka с помощью библиотек aiokafka, confluent-kafka, kafka-python, разработка потоковых приложений Apache Flink.
Личностные и коммуникативные навыки:
• Проактивный подход к работе – способность и желание искать и предлагать методы и варианты решения задач.
• Общий позитивный настрой и активная жизненная позиция.
• Умение и желание работать в команде, делиться опытом с коллегами и учиться новым практикам.
• Открытость в коммуникации трудностей, препятствующих решению задач.
Если кандидат в течении года подавался напрямую или через вендора к заказчику - таких кандидатов заказчик не рассмотрит
Обязательный чек-лист перед отправкой кандидата:
- Кандидату от 23-45 лет?
- Подавался ли кандидат в течении года к клиенту?
- Работал ли кандидат у клиента?
*❗️**❗️**❗️Писать {{apply_contact}}⚡️**⚡️**⚡️**⚡️ С РЕЗЮМЕ В КОТОРОМ УКАЗАН ВОЗРАСТ И ЛОКАЦИЯ НАХОЖДЕНИЯ. Укажите 🆔 вакансии❗️ Без этой информации отклики не рассматриваются ❗️**❗️*
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- LLM
- SQL
- PostgreSQL
- RAG
- PySpark
- Apache Spark
- Hadoop
- Apache Iceberg
- Apache Flink
- ETL
- REST API
- Apache Airflow
- Apache Kafka
- Oracle
- S3
- HDFS
- OpenSearch
- Argo Workflows
- Apache Hive
- Qdrant
- aiohttp
- httpx
- JupyterLab
Возможные вопросы на собеседовании
Проверка глубоких знаний Python и понимания асинхронности, критичной для взаимодействия с API.
В чем разница между использованием aiohttp и httpx при реализации асинхронных запросов к REST API?
Оценка опыта работы с векторными данными, что является ключевым требованием.
Какие стратегии индексации в Qdrant или OpenSearch вы использовали для оптимизации поиска по сходству в RAG-системах?
Проверка навыков оптимизации Spark-приложений.
Как вы используете Spark History Server для выявления перекоса данных (data skew) и оптимизации джойнов?
Оценка понимания современных форматов хранения данных.
В чем преимущества использования формата Apache Iceberg по сравнению с обычными Hive-таблицами для аналитических задач?
Проверка навыков проектирования ETL-процессов.
Как обеспечить отказоустойчивость и идемпотентность ETL-пайплайна при работе с Apache Airflow и большими объемами данных в S3?
Похожие вакансии
MLE (Machine Learning Engineer)
Data Engineer, Ozon fresh
Data Scientist (MLOps)
Data engineer
Data инженер (Middle+)
ML-инженер
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!