- Страна
- Россия
- Зарплата
- 320 000 ₽ – 350 000 ₽
Инженер сопровождения Big Data Platform
Привлекательная вакансия с конкурентной зарплатой для уровня Middle+, четким стеком технологий и возможностью удаленной работы. Компания предлагает работу над сложными инфраструктурными проектами с современным стеком Big Data.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует глубоких знаний в специфической области Big Data и Object Storage, а также опыта работы с высоконагруженными системами в Kubernetes. Сложность обусловлена необходимостью оперативного устранения инцидентов в распределенной среде.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предложенная зарплата в 320 000–350 000 рублей на руки соответствует верхней границе рыночного диапазона для Middle+ DevOps/SRE инженеров в России, специализирующихся на Big Data.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Контакты для отклика
Откройте контакты, указанные в вакансии.
Описание вакансии
Публикатор: Даниэлла Котовская*🖤*
Обсуждение: @devops_jobs
Компания Centicore находится в поисках инженера сопровождения Big Data Platform. Наша компания занимается продуктовой разработкой проектов наших Заказчиков под ключ.
Формат работы: удалённо по РФ
Зарплата: 320 000–350 000 рублей на руки
Уровень: middle+
Проект связан с сопровождением Data Lake-платформы и S3/Object Storage инфраструктуры. Специалист будет работать с Kubernetes, компонентами Big Data, мониторингом и разбором production-инцидентов.
Что важно:
Экспертный опыт администрирования Linux
Опыт сопровождения высоконагруженных распределённых систем
Понимание S3/Object Storage и архитектуры распределённых хранилищ
Опыт сопровождения Kubernetes-платформ
Практический опыт работы с MinIO или другими Object Storage решениями
Опыт эксплуатации компонентов Data Lake: Apache Spark, Airflow, Flink, Kafka, Apache Iceberg
Понимание replication, erasure coding, consistency и fault tolerance
Навыки troubleshooting CPU, RAM, network, disk I/O, latency и throughput
Опыт работы с Prometheus, Grafana, алертингом и анализом логов
Ansible, Terraform, Bash или Python
Понимание incident/problem management, RCA и postmortem
Не обязательно знать весь перечисленный стек. Если есть хороший опыт с S3/Object Storage, Kubernetes и частью компонентов Data Lake, остальному готовы обучить.
Чем предстоит заниматься:
Сопровождать и развивать Data Lake-платформу
Поддерживать S3/Object Storage инфраструктуру
Работать с Kubernetes, Apache Spark, Airflow, Flink, Kafka и Apache Iceberg
Следить за состоянием платформы, настраивать мониторинг и алертинг
Диагностировать и устранять production-инциденты
Разбирать проблемы с производительностью платформы и storage-систем
Проводить RCA и разборы после инцидентов
Автоматизировать эксплуатационные задачи
Взаимодействовать с командами Data Engineering и инфраструктуры
Для вопросов и резюме - просьба обращаться в личные сообщения: Откликнуться
Буду рада познакомиться!
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Linux
- Kubernetes
- S3
- Object Storage
- MinIO
- Apache Spark
- Airflow
- Flink
- Kafka
- Apache Iceberg
- Prometheus
- Grafana
- Ansible
- Terraform
- Bash
- Python
Возможные вопросы на собеседовании
Проверка понимания фундаментальных принципов работы распределенных хранилищ, указанных в вакансии.
Расскажите, как работает Erasure Coding и в каких случаях его использование предпочтительнее репликации в S3-хранилищах?
Оценка навыков траблшутинга в Kubernetes, что является ключевой обязанностью.
С какими наиболее сложными инцидентами в Kubernetes вы сталкивались и как проводили их диагностику (RCA)?
Проверка опыта работы с конкретным стеком Data Lake.
Как вы организуете мониторинг производительности Apache Spark и на какие метрики обращаете внимание в первую очередь?
Оценка навыков автоматизации инфраструктуры.
Опишите ваш подход к автоматизации развертывания и обновления компонентов Big Data с помощью Terraform и Ansible.
Проверка понимания процессов Incident Management.
Как вы выстраиваете процесс коммуникации и устранения аварии, если инцидент затрагивает критически важные данные в Kafka или S3?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

