- Страна
- Россия
- Зарплата
- 5 000 $ – 10 000 $
Senior DevOps / MLOps
Исключительная вакансия для Senior-специалистов: очень высокая зарплата в долларах, амбициозный проект мирового уровня (LLM, 1000+ машин) и возможность влиять на архитектуру с самого начала. Минус только в гибридном формате, что ограничивает географию кандидатов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена необходимостью строить инфраструктуру с нуля для огромного кластера (1000 машин) и специфическими требованиями к знаниям MLOps, GPU-вычислений и Ray. От кандидата требуется не просто поддержка, а глубокое архитектурное проектирование распределенных систем.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предлагаемая зарплата ($5000–10000) находится на верхней границе и даже выше среднего рыночного уровня для Senior DevOps/MLOps в России и СНГ, особенно учитывая текущий курс. Это соответствует уровню топовых технологических компаний и стартапов с серьезным финансированием.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Контакты для отклика
Откройте контакты, указанные в вакансии.
Описание вакансии
#вакансия #работа
VICTORY IT, Senior DevOps / MLOps, 5 000-10 000$ на руки
Екатеринбург, гибрид, полная занятость
Ищем Senior DevOps / MLOps в команду больших языковых моделей и машинного обучения в VICTORY IT. Будем строить платформу распределённых вычислений, которая объединит CPU/GPU и другие вычислительные ресурсы в единую инфраструктуру для ML-задач.
Над чем предстоит работать:
• проектировать и с нуля строить распределённую вычислительную платформу на ~1000 машин;
• развивать инфраструктуру на Kubernetes / Nomad для запуска и управления ML workload'ами;
• работать с GPU-кластерами и вычислительными ресурсами разных типов — GPU, CPU, MPS;
• развивать распределённые вычисления на Ray и инфраструктуру для distributed training;
• автоматизировать размещение и запуск задач, управление ресурсами и их загрузкой;
• заниматься масштабированием, производительностью, отказоустойчивостью, CI/CD и мониторингом;
• тесно работать с ML-командой над инфраструктурой для обучения и запуска нейросетей.
Что ожидаеv от кандидата:
• 3–5+ лет опыта в DevOps / MLOps / Platform Engineering;
• уверенный Kubernetes и/или Nomad;
• опыт работы с большими production-кластерами и распределёнными системами;
• практический опыт с GPU-инфраструктурой;
• понимание обучения нейросетей и distributed training;
• опыт с Docker / Docker Registry, CI/CD, Linux, мониторингом;
• опыт проектирования и создания инфраструктуры с нуля.
• будет большим плюсом опыт с HPC, суперкомпьютерами, GPU-фермами, Ray и крупными вычислительными кластерами.
Писать: Откликнуться
PS: это не классический DevOps про поддержку готовой инфраструктуры. Здесь предстоит строить распределённую платформу практически с нуля и работать с GPU/ ML на большом масштабе.
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Kubernetes
- Nomad
- GPU
- Ray
- Docker
- CI/CD
- Linux
- MLOps
- Platform Engineering
- HPC
Возможные вопросы на собеседовании
Проверка опыта работы с масштабируемыми системами, заявленными в вакансии.
Расскажите о вашем опыте проектирования инфраструктуры для кластеров более чем на 100 узлов: с какими основными проблемами масштабируемости вы сталкивались?
Вакансия подразумевает работу с GPU-ресурсами для ML.
Как вы организуете мониторинг и эффективное распределение GPU-ресурсов в Kubernetes или Nomad для задач обучения нейросетей?
В описании упоминается Ray как важный инструмент.
Был ли у вас опыт работы с Ray или другими фреймворками для распределенных вычислений? Как вы решали вопросы сетевой связности и задержек?
ML-нагрузки отличаются от обычных микросервисов.
В чем, по вашему мнению, ключевые отличия в настройке CI/CD пайплайнов для классических веб-приложений и для моделей машинного обучения?
Проверка навыков обеспечения надежности.
Как бы вы подошли к обеспечению отказоустойчивости распределенной платформы, если часть узлов в кластере внезапно выйдет из строя во время процесса distributed training?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

