yandex
N
NDA
SeniorУдалённоПолная занятость

Senior DevOps / SRE Engineer

ИИОценка ИИ

Интересные инженерные задачи по трансформации инфраструктуры и высокий уровень влияния на процессы. Однако требование on-call 24/7 и отсутствие указанной вилки зарплаты могут быть стоп-факторами для многих кандидатов.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.


Вакансия из открытого источника
Пожаловаться
+400% приглашений от HR

Улучшите резюме под эту вакансию

Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Высокая сложность обусловлена требованием on-call 24/7 и необходимостью полной автономности в принятии решений. Задачи по миграции production и внедрению IaC с нуля требуют глубокой экспертизы и высокого уровня ответственности.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Анализ зарплаты

Медиана400 000 ₽
Рынок300 000 ₽ – 550 000 ₽
ИИОценка ИИ

Для позиции Senior DevOps/SRE с требованием on-call 24/7 и полной автономностью, рыночные предложения обычно начинаются от 350 000 рублей. В международном сегменте (учитывая использование Hetzner/DigitalOcean) компенсация может быть значительно выше.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Сопроводительное письмо

Составьте сопроводительное письмо под эту вакансию с вашим резюме

Иллюстрация сопроводительного письмаИллюстрация сопроводительного письма

Описание вакансии

❤️ Ищем Senior DevOps / SRE Engineer ❤️

Ищем автономного инженера, который возьмёт ответственность за стабильность и развитие production-инфраструктуры.

Текущая инфраструктура:

~50 серверов (Hetzner dedicated + VPS, DigitalOcean).

Staging: Docker Swarm.

Production: Docker Compose.

БД: MariaDB с Master-Slave репликацией.

CI/CD: GitLab, Harbor registry.

IaC: начальная стадия внедрения, Ansible для конфигурации серверов.

Задачи:

  • Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер.
  • Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager.
  • Внедрение централизованного логирования.
  • Развитие Infrastructure as Code с использованием Ansible и Terraform.
  • Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа.
  • Выстраивание on-call-процессов, runbook-документации и работы с инцидентами.
  • Security hardening инфраструктуры.
  • Внедрение SLI/SLO и подготовка к работе по SLA.

Требования:

  • Опыт работы с Docker Swarm и/или Kubernetes в production-среде.
  • Уверенное владение Ansible.
  • Опыт построения monitoring stack (Prometheus + Grafana).
  • Глубокие знания Linux (Debian/Ubuntu) на уровне траблшутинга.
  • Опыт с GitLab CI/CD.
  • Администрирование MariaDB/MySQL (репликация, backup, восстановление).
  • Опыт построения централизованного логирования (ELK/Loki).
  • Опыт работы SRE: диагностика и устранение инцидентов в production.
  • Умение самостоятельно принимать технические решения и нести ответственность за их результат.

Обязательно:

  • On-call 24/7 (инциденты требуют быстрой реакции, включая выходные).
  • Автономность в принятии решений.
  • Ответственность за стабильность инфраструктуры.

📩 За подробностями — в ЛС Откликнуться

Больше похожих вакансий + автоотклики с ИИ

Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Больше похожих вакансий + автоотклики с ИИ

Навыки

  • Docker Swarm
  • Kubernetes
  • Ansible
  • Prometheus
  • Grafana
  • Linux
  • Debian
  • Ubuntu
  • GitLab CI/CD
  • MariaDB
  • MySQL
  • ELK
  • Loki
  • Terraform
  • Alertmanager
  • Docker Compose

Возможные вопросы на собеседовании

Проверка опыта миграции и понимания рисков при переходе на новые оркестраторы.

Расскажите о вашем опыте миграции с Docker Compose на Swarm или Kubernetes: с какими основными сложностями вы сталкивались и как обеспечивали zero-downtime?

Оценка навыков работы с БД в критических ситуациях, что важно для обеспечения RTO < 1 часа.

Опишите ваш алгоритм действий при сбое репликации MariaDB. Как вы организуете процесс бэкапов, чтобы гарантировать восстановление системы менее чем за час?

Проверка умения выстраивать процессы мониторинга с нуля.

Какие ключевые метрики (SLI) вы бы внедрили в первую очередь для мониторинга текущей инфраструктуры на Hetzner и DigitalOcean?

Оценка опыта в Infrastructure as Code.

Как вы структурируете роли в Ansible для управления парком из 50+ серверов, чтобы обеспечить масштабируемость и безопасность?

Проверка психологической готовности к SRE-роли и on-call.

Как вы организуете свою работу в режиме on-call 24/7 и какие инструменты используете для оперативного реагирования на инциденты в нерабочее время?

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Похожие вакансии

N
NDA
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!