- Страна
- Россия
- Зарплата
- 320 000 ₽ – 350 000 ₽
Инженер сопровождения Big Data Platform (Middle+)
Centicore предлагает конкурентную зарплату для уровня Middle+ и работу с современным технологическим стеком Big Data. Удаленный формат работы по РФ и фокус на продуктовой разработке делают вакансию привлекательной для опытных инженеров.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует глубоких знаний на стыке DevOps и Big Data Ops, включая специфику S3-хранилищ и сложных распределенных систем. Высокая ответственность за production-инциденты и необходимость владения широким стеком технологий (K8s, Spark, Kafka) делают позицию сложной, но интересной.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предлагаемая зарплата 320 000–350 000 рублей на руки соответствует верхней границе рыночного диапазона для Middle+ DevOps/Big Data инженеров в России. Это очень достойное предложение, учитывая полностью удаленный формат.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Контакты для отклика
Откройте контакты, указанные в вакансии.
Описание вакансии
#вакансия #fulltime #remote
Компания Centicore 💙 находится в поисках инженера сопровождения Big Data Platform. Наша компания занимается продуктовой разработкой проектов наших Заказчиков под ключ.
Формат работы: удалённо по РФ
Зарплата: 320 000–350 000 рублей на руки
Уровень: middle+
Проект связан с сопровождением Data Lake-платформы и S3/Object Storage инфраструктуры. Специалист будет работать с Kubernetes, компонентами Big Data, мониторингом и разбором production-инцидентов.
🔷 Что важно:
Экспертный опыт администрирования Linux
Опыт сопровождения высоконагруженных распределённых систем
Понимание S3/Object Storage и архитектуры распределённых хранилищ
Опыт сопровождения Kubernetes-платформ
Практический опыт работы с MinIO или другими Object Storage решениями
Опыт эксплуатации компонентов Data Lake: Apache Spark, Airflow, Flink, Kafka, Apache Iceberg
Понимание replication, erasure coding, consistency и fault tolerance
Навыки troubleshooting CPU, RAM, network, disk I/O, latency и throughput
Опыт работы с Prometheus, Grafana, алертингом и анализом логов
Ansible, Terraform, Bash или Python
Понимание incident/problem management, RCA и postmortem
Не обязательно знать весь перечисленный стек. Если есть хороший опыт с S3/Object Storage, Kubernetes и частью компонентов Data Lake, остальному готовы обучить.
🔷 Чем предстоит заниматься:
Сопровождать и развивать Data Lake-платформу
Поддерживать S3/Object Storage инфраструктуру
Работать с Kubernetes, Apache Spark, Airflow, Flink, Kafka и Apache Iceberg
Следить за состоянием платформы, настраивать мониторинг и алертинг
Диагностировать и устранять production-инциденты
Разбирать проблемы с производительностью платформы и storage-систем
Проводить RCA и разборы после инцидентов
Автоматизировать эксплуатационные задачи
Взаимодействовать с командами Data Engineering и инфраструктуры
💌 Для вопросов и резюме - просьба обращаться в личные сообщения: Откликнуться
Буду рада познакомиться! 💙
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Linux
- Kubernetes
- S3
- MinIO
- Apache Spark
- Airflow
- Apache Flink
- Apache Kafka
- Apache Iceberg
- Prometheus
- Grafana
- Ansible
- Terraform
- Bash
- Python
Возможные вопросы на собеседовании
Проверка понимания фундаментальных принципов работы распределенных хранилищ, указанных в вакансии.
Расскажите, как работает Erasure Coding в контексте S3/Object Storage и в чем его преимущество перед обычной репликацией?
Вакансия предполагает работу с высоконагруженными системами и разбор инцидентов.
Опишите ваш алгоритм действий при резком росте Latency в распределенной системе хранения данных. Какие метрики вы проверите в первую очередь?
Работа с Kubernetes является ключевым требованием.
С какими сложностями вы сталкивались при запуске stateful-сервисов (например, Kafka или MinIO) в Kubernetes?
Проверка навыков автоматизации и владения инструментами IaC.
Как вы организуете процесс обновления конфигураций в кластере Big Data с помощью Ansible или Terraform, чтобы минимизировать downtime?
Оценка опыта в Incident Management.
Приведите пример самого сложного production-инцидента из вашей практики: как проводился RCA и какие меры были приняты для предотвращения повторения?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

