- Страна
- Россия
SRE-инженер по OpenStack + AIOps
Интересный проект на стыке классического SRE и современных AI-технологий в крупном телекоме. Удаленный формат работы и возможность влиять на развитие платформы делают вакансию привлекательной для опытных инженеров.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует редкого сочетания глубокой экспертизы в OpenStack (от 3 лет в проде) и практических навыков работы с AI/LLM инструментами. Высокая сложность обусловлена масштабом телеком-проекта (10k+ VM) и необходимостью участия в on-call дежурствах.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Компания не указывает конкретную вилку, предлагая обсудить ставку кандидата. Для Senior SRE с глубоким знанием OpenStack и навыками AIOps на российском рынке медиана составляет около 350 000 - 450 000 рублей после налогов. Предложение 'рассмотрим вашу' позволяет претендовать на верхнюю границу рынка при наличии релевантного опыта в телекоме.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
#вакансия #удаленноРФ #senior #SREинженер
Роль: SRE-инженер по OpenStack + AIOpsГрейд: Senior
Компания: IT People group
Ставка: рассмотрим Вашу
Локация: РФ
Гражданство: РФ
Формат работы: удаленный по РФ, часовой пояс: не более чем ±3 часа от московского времени (UTC+3)
Срок привлечения: 6+ месяцев
Описание проекта:
Крупный оператор сотовой связи. Телеком-проект по развитию и эксплуатации платформы OpenStack.
Обязанности:
- Эксплуатация и развитие production-кластеров OpenStack
- Диагностика и решение сложных проблем OpenStack/Linux
- Работа с сетями и виртуализацией
- Мониторинг и observability
- Автоматизация и написание скриптов
- Работа с Ceph/SAN/storage
- Участие в миграциях, обновлениях и развитии платформы
- On-call и incident management
- Использование AI-инструментов в ежедневной работе: анализ логов, генерация кода, RCA и т.д.
Требования:
- OpenStack от 3 лет именно в production
- Уверенный Linux: Ubuntu/Debian, systemd, sysctl, kernel params, диагностика через top/vmstat/iostat/sar/tcpdump/strace
- Сильная база по сетям и виртуализации: OVS/OVN, VLAN/VXLAN/Geneve, L2/L3
- Опыт с Prometheus + Grafana + Zabbix
- Python и Bash для автоматизации и написания утилит
- Понимание эксплуатации production-инфраструктуры и готовность к on-call
- Практический опыт использования LLM/AI-инструментов в работе (реальные примеры и понимание необходимости проверять результат AI)
Будет плюсом:
- Опыт с AIOps, AI-агентами, RAG, системами анализа логов и обнаружения аномалий
- Глубокое знание OpenStack: Ironic, Zun, Terraform Provider, опыт миграций между версиями
- Опыт интеграции OpenStack и Kubernetes
- Знание Ceph-CSI, Cinder CSI, Multus, SR-IOV
- Опыт работы с Huawei Dorado/OceanStor и глубокая экспертиза в Ceph
- Опыт с InfoSec, DevOps/GitOps, Chaos Engineering
- Опыт работы в крупных инфраструктурах, особенно телеком, billing, CRM, 10k+ VM
Для резюме Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- OpenStack
- AIOps
- Linux
- Ubuntu
- Debian
- Prometheus
- Grafana
- Zabbix
- Python
- Bash
- Ceph
- OVS
- OVN
- Terraform
- Kubernetes
- GitOps
- Chaos Engineering
- LLM
Возможные вопросы на собеседовании
Проверка глубины понимания сетевой подсистемы OpenStack, критичной для телекома.
Расскажите о вашем опыте отладки проблем связности в OVN/OVS. С какими наиболее сложными кейсами вы сталкивались при использовании VXLAN/Geneve?
Оценка практического опыта использования AI в SRE-задачах.
Приведите конкретный пример, когда использование LLM или AI-агентов помогло вам ускорить RCA (Root Cause Analysis) или автоматизировать рутинную задачу. Как вы проверяли корректность вывода AI?
Проверка навыков работы с хранилищами данных в высоконагруженных системах.
Опишите ваш опыт траблшутинга производительности Ceph. Какие метрики в Grafana для вас являются приоритетными при анализе задержек ввода-вывода?
Оценка готовности к работе в режиме инцидент-менеджмента.
Как вы организуете процесс передачи знаний и документирования после решения критического инцидента во время on-call смены?
Проверка навыков автоматизации и владения инструментарием.
Какие библиотеки Python вы чаще всего используете для написания утилит диагностики OpenStack API и взаимодействия с системными компонентами Linux?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

