- Страна
- Россия
- Зарплата
- 280 000 ₽ – 400 000 ₽
Data / ML Platform Engineer (Middle+ / Senior)
Сильная вакансия в социально значимом HealthTech проекте с современным стеком (LLM, RAG, MLOps). Предлагается конкурентная зарплата, гибкий формат работы и возможность влиять на архитектуру продукта с ранних этапов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует глубоких знаний на стыке Data Engineering и MLOps, включая работу с LLM и RAG. Высокая ответственность из-за работы с чувствительными медицинскими данными и необходимости строить платформу с нуля.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предложенная вилка 280 000 – 400 000 ₽ гросс полностью соответствует рыночным ожиданиям для позиций Middle+/Senior в области Data/ML Engineering в Москве. Верхняя граница в 400к является привлекательной для Senior-специалистов с опытом в LLM.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
#вакансия#mlops#dataengineering#healthtech#fulltime#москва
Вакансия: Data / ML Platform Engineer (Middle+ / Senior)
Компания: AstraTech
Формат: гибридный / удаленный по РФ
Локация: Москва
Занятость: full-time
Вилка: 280 000 - 400 000 ₽ гросс
HealthTech стартап создает продукт поддержки врачебных решений, который делает процессы в здравоохранении эффективнее и помогает врачам принимать более точные решения *🕊*
Сейчас команда строит Data Platform и ML / LLM Platform. Это единый путь данных: от загрузки из разных источников до измеренного результата модели. Команда ищет инженера, который возьмет на себя подготовку данных и инструменты для ML-команды и сможет сам проводить эксперименты с моделями.
Вам предстоит:
— Разрабатывать Python / SQL-пайплайны загрузки и обработки данных из файлов, API и информационных систем.
— Проектировать таблицы хранилища: сущности, связи, правила преобразования.
— Встраивать псевдоанонимизацию и проверки качества в потоки данных.
— Готовить признаки и версионируемые train/validation/test-выборки.
— Обеспечивать прослеживаемость и воспроизводимость ML / LLM-экспериментов.
— Вместе с ML-командой развивать оценку моделей, подготовку данных для RAG и дообучения.
Ожидаем от вас:
— Уверенные Python и SQL, поддерживаемый код за пределами ноутбуков.
— Практический опыт ETL / ELT: оркестрация, инкрементальная обработка, повторные запуски.
— Опыт с S3, Parquet, pandas / Polars / PyArrow.
— Понимание жизненного цикла ML: выборки, baseline, метрики, проверка утечек.
— Опыт с MLflow, ClearML или аналогами; Linux, Git, Docker, CI/CD.
— Умение работать с чувствительными данными.
Будет плюсом:
— Опыт с медицинскими данными, МИС и клиническими справочниками.
— Практический NLP / LLM: извлечение данных из текста, embeddings, RAG.
— PyTorch / Hugging Face, дообучение и inference на GPU.
— Опыт превращения исследовательского прототипа в регулярный пайплайн.
Почему интересно:
— Проект, который действительно приносит пользу людям.
— Возможность строить платформу с нуля и влиять на архитектуру.
— Работа на стыке Data Engineering, MLOps и LLM с современным стеком.
Направляйте ваши отклики с резюме - Откликнуться *📩*
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- SQL
- ETL
- ELT
- S3
- Parquet
- Pandas
- Polars
- PyArrow
- MLflow
- ClearML
- Linux
- Git
- Docker
- CI/CD
- NLP
- LLM
- RAG
- PyTorch
- Hugging Face
- GPU
Возможные вопросы на собеседовании
Проверка навыков проектирования архитектуры данных и понимания специфики ETL.
Расскажите, как бы вы спроектировали пайплайн обработки медицинских данных с учетом требований псевдоанонимизации и контроля качества?
Оценка опыта работы с инструментами отслеживания экспериментов, заявленными в вакансии.
Каким образом вы обеспечиваете воспроизводимость ML-экспериментов при использовании MLflow или ClearML в командной разработке?
Проверка понимания современных подходов к работе с LLM.
С какими основными сложностями вы сталкивались при подготовке данных для RAG-систем и как их решали?
Оценка навыков оптимизации и работы с большими объемами данных.
В каких случаях вы предпочтете Polars или PyArrow вместо стандартного Pandas, и как это повлияет на производительность пайплайна?
Проверка умения переводить исследования в продакшен-решения.
Опишите ваш процесс превращения исследовательского ноутбука с моделью в стабильный, версионируемый и поддерживаемый продакшен-пайплайн.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

