- Страна
- Россия
- Зарплата
- 250 000 ₽ – 340 000 ₽
Откликайтесь
на вакансии с ИИ

MLOps (банк)
Интересный стек технологий (GenOps, LLM), работа в аккредитованной IT-компании с полным соцпакетом и ДМС. Зарплата соответствует рынку для Middle+/Senior уровня, а работа над ИИ-агентами является одним из самых перспективных направлений.
Сложность вакансии
Роль требует редкого сочетания навыков классического DevOps (K8s, CI/CD) и глубокой экспертизы в ML-инференсе (vLLM, квантизация, RAG). Высокая планка входа обусловлена необходимостью работы с современными LLM-стеками в банковском секторе.
Анализ зарплаты
Предлагаемая вилка 250-340к гросс соответствует рыночным ожиданиям для MLOps-инженеров уровня Middle+ в России, однако для Senior-специалистов с глубоким опытом в LLM верхняя граница может быть выше.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь в Selecty уже сейчас
Присоединяйтесь к Selecty и создавайте будущее GenOps-фабрик для крупнейших банковских проектов!
Описание вакансии
#вакансия #MLOps #DevOps #Python #LLM #AI #MachineLearning
#Kubernetes #Docker #CI_CD #PostgreSQL
Мы создаем экосистему цифровых сотрудников на базе передовых открытых LLM/VLM-моделей. Наши ИИ-агенты автоматизируют ключевые операционные процессы, напрямую влияя на эффективность и конкурентное преимущество бизнеса наших заказчиков.
Компания: Selecty
Позиция: MLOps (банк)
Уровень дохода: 250-340 к гросс
Формат: оформление по ТК РФ
Удаленка РФ‼️
✅чем предстоит заниматься:
Ты станешь ключевым инженером, который превращает исследовательские прототипы в отказоустойчивую GenOps-фабрику цифровых агентов.
Твои задачи: DevOps для AI:
Проектирование и развитие самообслуживания CI/CD пайплайнов для внутреннего деплоя AI-агентов и мультиагентных систем.
Инференс под управление: Развертывание и оптимизация LLM/VLM в процессе разработки (оптимизация памяти, формирование скорости) с использованием vLLM, Triton Inference Server, SGLang.
Надёжность: Обеспечение высокой доступности сервисов, работа с масштабированием горизонтальных подов и управление состоянием агентов.
Мониторинг 360°: Внедрение комплексного наблюдения: от стандартных метрик (CPU/GPU, задержка) до конкретных ML-метрик (качество генерации, дрейф данных, оценка тональности ответов).
✅Обязательные требования
Опыт вывода LLM-решений в прод.
\* Уверенное владение Python и асинхронным программированием (asyncio).
\* Уверенное владение Kubernetes (Helm, управление кластерами).
\* Знание Gitlab CI, Jenkins и пр
\* Понимание архитектуры RAG-систем, работы embedding-моделей и ранжирования.
\* Умение оптимизировать инференс: квантизация, continuous batching, PagedAttention.
\* Будет плюсом: опыт с графовыми БД и построением мультиагентных систем
⚙️ Технологический стек:
Python, FastAPI, langchain/llamaindex/haystack k8s, docker, S3, postgres
Опыт работы с векторными и графическими БД.
🔥Условия
Оформление по ТК РФв в IT-аккредитованную компанию
ДМС (включая стоматологию)
Компенсация фитнеса
Скидки на обучение английскому (Skyeng)
Индексация заработной платы
Современная техника
IT-аккредитация компании
Место для откликов: Откликнуться 📩
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- Kubernetes
- Docker
- CI/CD
- PostgreSQL
- LLM
- Machine Learning
- FastAPI
- LangChain
- LlamaIndex
- Haystack
- S3
- Helm
- GitLab CI/CD
- Jenkins
- vLLM
- Triton Inference Server
- asyncio
- RAG
Возможные вопросы на собеседовании
Проверка практического опыта оптимизации работы больших языковых моделей.
Какие методы оптимизации инференса LLM вы применяли на практике (квантизация, PagedAttention, continuous batching) и каких результатов удалось достичь?
Оценка навыков проектирования инфраструктуры для специфических ML-задач.
Как бы вы спроектировали CI/CD пайплайн для деплоя мультиагентной системы, учитывая необходимость тестирования качества генерации?
Проверка умения работать с ресурсоемкими вычислениями в Kubernetes.
Как вы организуете мониторинг и управление GPU-ресурсами в кластере Kubernetes для обеспечения стабильного инференса?
Оценка понимания архитектуры современных AI-приложений.
С какими сложностями вы сталкивались при масштабировании RAG-систем и как решали проблему дрейфа данных в ответах моделей?
Проверка навыков работы с асинхронностью в Python.
В каких случаях при разработке API для LLM-агентов использование asyncio является критически важным и как это влияет на пропускную способность системы?
Похожие вакансии
Data инженер (Middle+)
Data Scientist
Data Scientist Middle+, Senior
Data Engineer Middle
Главный инженер Контроль качества данных
Junior Python Data Engineer
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!