Senior DevOps / SRE Engineer
Интересные инженерные задачи по трансформации инфраструктуры и высокий уровень влияния на процессы. Однако требование on-call 24/7 и отсутствие указанной вилки зарплаты могут быть стоп-факторами для многих кандидатов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена требованием on-call 24/7 и необходимостью полной автономности в принятии решений. Задачи по миграции production и внедрению IaC с нуля требуют глубокой экспертизы и высокого уровня ответственности.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Для позиции Senior DevOps/SRE с требованием on-call 24/7 и полной автономностью, рыночные предложения обычно начинаются от 350 000 рублей. В международном сегменте (учитывая использование Hetzner/DigitalOcean) компенсация может быть значительно выше.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
❤️ Ищем Senior DevOps / SRE Engineer ❤️
Ищем автономного инженера, который возьмёт ответственность за стабильность и развитие production-инфраструктуры.
Текущая инфраструктура:
~50 серверов (Hetzner dedicated + VPS, DigitalOcean).
Staging: Docker Swarm.
Production: Docker Compose.
БД: MariaDB с Master-Slave репликацией.
CI/CD: GitLab, Harbor registry.
IaC: начальная стадия внедрения, Ansible для конфигурации серверов.
Задачи:
- Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер.
- Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager.
- Внедрение централизованного логирования.
- Развитие Infrastructure as Code с использованием Ansible и Terraform.
- Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа.
- Выстраивание on-call-процессов, runbook-документации и работы с инцидентами.
- Security hardening инфраструктуры.
- Внедрение SLI/SLO и подготовка к работе по SLA.
Требования:
- Опыт работы с Docker Swarm и/или Kubernetes в production-среде.
- Уверенное владение Ansible.
- Опыт построения monitoring stack (Prometheus + Grafana).
- Глубокие знания Linux (Debian/Ubuntu) на уровне траблшутинга.
- Опыт с GitLab CI/CD.
- Администрирование MariaDB/MySQL (репликация, backup, восстановление).
- Опыт построения централизованного логирования (ELK/Loki).
- Опыт работы SRE: диагностика и устранение инцидентов в production.
- Умение самостоятельно принимать технические решения и нести ответственность за их результат.
Обязательно:
- On-call 24/7 (инциденты требуют быстрой реакции, включая выходные).
- Автономность в принятии решений.
- Ответственность за стабильность инфраструктуры.
📩 За подробностями — в ЛС Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Docker Swarm
- Kubernetes
- Ansible
- Prometheus
- Grafana
- Linux
- Debian
- Ubuntu
- GitLab CI/CD
- MariaDB
- MySQL
- ELK
- Loki
- Terraform
- Alertmanager
- Docker Compose
Возможные вопросы на собеседовании
Проверка опыта миграции и понимания рисков при переходе на новые оркестраторы.
Расскажите о вашем опыте миграции с Docker Compose на Swarm или Kubernetes: с какими основными сложностями вы сталкивались и как обеспечивали zero-downtime?
Оценка навыков работы с БД в критических ситуациях, что важно для обеспечения RTO < 1 часа.
Опишите ваш алгоритм действий при сбое репликации MariaDB. Как вы организуете процесс бэкапов, чтобы гарантировать восстановление системы менее чем за час?
Проверка умения выстраивать процессы мониторинга с нуля.
Какие ключевые метрики (SLI) вы бы внедрили в первую очередь для мониторинга текущей инфраструктуры на Hetzner и DigitalOcean?
Оценка опыта в Infrastructure as Code.
Как вы структурируете роли в Ansible для управления парком из 50+ серверов, чтобы обеспечить масштабируемость и безопасность?
Проверка психологической готовности к SRE-роли и on-call.
Как вы организуете свою работу в режиме on-call 24/7 и какие инструменты используете для оперативного реагирования на инциденты в нерабочее время?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

