- Страна
- Россия
Откликайтесь
на вакансии с ИИ

DevOps/SRE Engineer (Kubernetes + Ceph)
Интересная вакансия для опытных инженеров с фокусом на SRE и работу с данными. Удаленный формат и современный стек делают предложение привлекательным, хотя отсутствие названия компании и вилки зарплаты снижает прозрачность.
Сложность вакансии
Высокая сложность обусловлена требованием глубоких знаний Ceph и Kubernetes на уровне диагностики нестандартных ситуаций, а также опытом работы с тяжелыми кластерными базами данных в проде.
Анализ зарплаты
Для позиции уровня Senior SRE с глубоким знанием Ceph и Kubernetes на российском рынке предлагаемая вилка обычно выше среднего, так как специалисты с таким набором навыков дефицитны.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь уже сейчас
Отправьте резюме Ольге прямо сейчас, чтобы стать ключевым SRE-инженером в команде, работающей с высоконагруженными кластерами!
Описание вакансии
DevOps/SRE Engineer (Kubernetes + Ceph)
#SREEngineer #DevOpsEngineer #Удаленно #РФ
Требования:
Ближе к SRE, чем к классическому DevOps - акцент на стабильности и мониторинге, не на построении CI/CD с нуля. Опыт эксплуатации и восстановления Ceph. Понимание Kubernetes (control plane, планирование, диагностика нестандартных ситуаций). Опыт с кластерными PostgreSQL / ClickHouse / Kafka в проде. Prometheus/Grafana - построение мониторинга и алертинга, не только просмотр готовых дашбордов. Ansible. Сильные навыки диагностики инцидентов. Плюсом: LDAP/AD, Keycloak, OpenSearch, K8s-операторы (CNPG, Strimzi, Rook Ceph, Altinity Operator), Python/Golang.
Локация:*📍*Удалённо. По РФ возможна.
Контакт для отклика: Откликнуться
*👉*Откликнуться
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- Kubernetes
- Prometheus
- Grafana
- PostgreSQL
- Kafka
- Keycloak
- Go
- Active Directory
- Ansible
- LDAP
- ClickHouse
- Ceph
- OpenSearch
- Rook
- Strimzi
Возможные вопросы на собеседовании
Ceph является критической частью стека, и умение восстанавливать его после сбоев — ключевое требование.
Расскажите о вашем самом сложном кейсе восстановления кластера Ceph: с какими проблемами столкнулись и как их решили?
Вакансия делает акцент на SRE и глубоком понимании K8s control plane.
Как вы будете диагностировать ситуацию, когда API-сервер Kubernetes перестает отвечать, и какие шаги предпримете для восстановления работоспособности?
Работа с Kafka и ClickHouse в проде требует понимания специфики их масштабирования и отказоустойчивости.
С какими типичными проблемами производительности Kafka вы сталкивались и как настраивали мониторинг для их раннего обнаружения?
Требуется навык построения мониторинга с нуля, а не просто использование готовых решений.
Опишите ваш подход к созданию системы алертинга: как вы определяете пороги срабатывания и боретесь с 'alert fatigue'?
Упоминание операторов (Strimzi, Rook) предполагает знание современных паттернов управления инфраструктурой.