- Страна
- Россия
Data Scientist (Middle+/Senior)
Интересный проект на стыке Data Science и Operations Research с использованием современного стека. Однако проект ограничен по времени (5 месяцев), что может быть минусом для тех, кто ищет долгосрочную стабильность.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена сочетанием глубоких знаний ML (особенно временных рядов) и методов математической оптимизации (MILP, решатели Gurobi/CPLEX), что встречается редко. Также требуются навыки инженерии данных и DevOps.
Анализ зарплаты
В объявлении не указана зарплата, но для уровня Middle+/Senior Data Scientist с навыками оптимизации на российском рынке медиана составляет около 350,000 - 450,000 рублей в месяц. Учитывая проектный характер и высокую нагрузку, ставка может быть выше рыночной.
Откликнитесь уже сейчас
Отправьте свое резюме в Telegram, чтобы принять участие в разработке сложных ML-решений для оптимизации цепей поставок!
Описание вакансии
ID 3193
"Middle+
Senior"
Кол-во специалистов
1
Длительность проекта
5 мес.
Объем участия в проекте
Высокая нагрузка
~160 ч/мес
Формат взаимодействия
Удаленно
Требуемая локация специалиста
*❗️**❗️*Россия
Доступность специалиста
по МСК
Требуемое гражданство специалиста
РФ
Обязательные требования
- Отличное знание Python, опыт работы с Spark, Pyspark, SQL, работа с S3;
-Знание современных алгоритмов машинного обучения и оптимизации;
- Математическая статистика и основы машинного обучения: линейные модели, Random Forest, LSTM;
- Библиотеки градиентного бустинга: XGBoost, LightGBM, CatBoost;
- Глубокое обучение для временных рядов: LSTM, Prophet, DeepAR;
- Работа с временными рядами: очистка, прогнозирование, кросс-валидация;
- Методы дискретной оптимизации, математическое программирование (LP, MILP, MIP);
- Инструменты оптимизации (Pyomo/OR-Tools/PuLP/COIN-OR), решатели (Gurobi/CPLEX/SCIP/COPT/GLPK);
-Уверенное владение Git;
-Опыт разработки продуктового ML решения, начиная от анализа данных и заканчивая созданием прототипа: понимание архитектуры ML проектов, настройка пайплайнов данных, умение обернуть модель в базовый backend (FastAPI, Hug и другое), базовые навыки DevOps (умение работать с Docker, KubeFlow);
- Базовое понимание архитектуры web-приложений, backend-сервисов;
- Опыт работы с жизненными циклами разработки вычислительной и программной инфраструктуры;
- Высокие навыки коммуникации и решения проблем, стремление к обучению;
- Уровень английского языка - Intermediate.
Дополнительные требования
- Опыт работы с жизненными циклами разработки вычислительной и программной инфраструктуры;
- Юнит- и интеграционное тестирование, владение методологией тестирования;
- Понимание принципов CI/CD;
- ООП и принципы проектирования вычислительных систем;
- Опыт в FMCG в Supply Chain, Demand Planning, Forecasting, ERP, APS;
- Опыт работы в продуктовых командах (Agile, Scrum).
Этапы отбора
- Техническое интервью с клиентом
- Техническое интервью с заказчиком
Описание проекта и команды
Требуется Data Scientist.
Data Scientist cоздает методологии, эвристики, строит пайплайны машинного обучения для цифровых продуктов компании, а также проверяет гипотезы и находит скрытые закономерности с помощью статистики и машинного обучения. Роль предполагает разработку алгоритма машинного обучения, его продуктивизации и настройку поддержки, включая мониторинг качества данных и модели, дообучение модели в случае необходимости, написание документации по продукту.
*📩 Телеграм для связи:* Откликнуться
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- Apache Spark
- PySpark
- SQL
- S3
- Machine Learning
- Random Forest
- LSTM
- XGBoost
- LightGBM
- CatBoost
- Prophet
- DeepAR
- Mathematical Programming
- Pyomo
- OR-Tools
- PuLP
- Gurobi
- CPLEX
- Git
- FastAPI
- Docker
- Kubeflow
- CI/CD
- Unit Testing
Возможные вопросы на собеседовании
Вакансия требует работы с MILP и решателями. Важно понять практический опыт кандидата в этой узкой области.
Расскажите о самом сложном кейсе дискретной оптимизации, который вы решали: какую библиотеку (Pyomo/OR-Tools) использовали и как боролись со временем сходимости модели?
Проект связан с прогнозированием временных рядов. Нужно проверить понимание специфики валидации таких данных.
Какие стратегии кросс-валидации вы применяете для временных рядов, чтобы избежать заглядывания в будущее (data leakage)?
Требуется опыт работы с большими данными.
В каких случаях вы предпочтете использовать Spark/PySpark вместо обычного Pandas, и с какими проблемами производительности в Spark вы сталкивались?
Вакансия подразумевает создание прототипов и базовый бэкенд.
Как вы организуете мониторинг качества модели (model drift) после того, как она была обернута в FastAPI и запущена в Docker?
Упоминается опыт в Supply Chain.

