- Зарплата
- 120 000 $ – 131 000 $
Откликайтесь
на вакансии с ИИ

Site Reliability Engineer — Telemetry
Отличная вакансия в топовой криптокомпании с прозрачным стеком технологий и конкурентной зарплатой. Удаленный формат и работа с передовыми инструментами мониторинга делают ее крайне привлекательной для SRE-специалистов.
Сложность вакансии
Высокая сложность обусловлена необходимостью глубоких знаний в области Observability (VictoriaMetrics, OpenTelemetry, Grafana Alloy) и опытом работы с распределенными системами в высоконагруженном финтехе.
Анализ зарплаты
Предложенная зарплата в $120k - $131k находится в пределах рыночной нормы для Senior SRE ролей в глобальных технологических компаниях, хотя для топовых специалистов в США или Tier-1 крипто-проектах верхняя планка может быть выше.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь в kraken уже сейчас
Присоединяйтесь к команде Kraken и создавайте будущее глобальной финансовой инфраструктуры — откликайтесь прямо сейчас!
Описание вакансии
Site Reliability Engineer — Telemetry
Company: Payward (Kraken)
Payward, the parent company of Kraken, builds modern, globally accessible financial infrastructure to advance an open financial system. Kraken is a long-standing crypto platform trusted by over 10 million individuals and institutions, offering spot trading, margin, futures, staking, and OTC services.
Responsibilities:
- Operate and improve the shared telemetry platform for metrics, logs, traces, alerting, dashboards, and profiling.
- Maintain metrics collection, long-term storage, querying, dashboards, and alerting using Prometheus-compatible systems and VictoriaMetrics/Grafana.
- Operate log pipelines (Vector, Splunk, Loki) and distributed tracing/profiling (Grafana Alloy, Tempo, OpenTelemetry, Pyroscope).
- Deploy and manage telemetry services with Terraform, Terragrunt, and container orchestration across environments.
- Troubleshoot missing data, slow queries, broken alerts, pipeline backpressure, and capacity issues.
- Build reusable configuration and automation for dashboards, alerts, and telemetry integrations.
- Participate in incident response and on-call, write runbooks, and iterate on platform reliability.
Requirements:
- 3+ years as an SRE, Platform/Infrastructure Engineer, Observability Engineer, or similar.
- Experience managing production systems that collect, process, store, and serve telemetry (metrics, logs, traces, profiles).
- Experience with Prometheus or a Prometheus-compatible monitoring stack (collection, querying, alerting).
- Experience troubleshooting distributed production systems (availability, latency, data flow, capacity).
- Experience with Infrastructure as Code (Terraform) and CI/CD.
- Experience operating containerised workloads with Nomad, Kubernetes, or similar.
- Solid scripting/programming skills and comfort using AI tools/agents to accelerate delivery.
Nice to have:
- Experience with VictoriaMetrics, Grafana, Tempo, Loki, Vector, Splunk, Alertmanager, or OpenTelemetry.
- PromQL or LogQL, dashboards/alerts as code, and maintaining operators/CRDs in Kubernetes.
- Experience with Consul, Vault, AWS, on-prem/datacentre infrastructure, or high-volume logging/streaming pipelines.
- Background in regulated/financial services environments (change management, audit trails).
Stack:
Prometheus, VictoriaMetrics, Grafana, Grafana Alloy, Tempo, Loki, Vector, Splunk, OpenTelemetry, Pyroscope, Terraform, Terragrunt, Nomad, Kubernetes, PromQL, LogQL, Consul, Vault, AWS
Benefits:
- Compensation: $120k - $131k (estimated)
*📩* Откликнуться
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- AWS
- Terraform
- Kubernetes
- Prometheus
- Grafana
- OpenTelemetry
- Splunk
- VictoriaMetrics
- Consul
- Nomad
- Vault
- Terragrunt
- Loki
- Vector
- PromQL
- LogQL
Возможные вопросы на собеседовании
Проверка практического опыта работы с основным инструментом хранения метрик, указанным в вакансии.
Как вы подходите к масштабированию VictoriaMetrics при резком росте объема входящих метрик и возникновении backpressure в пайплайнах?
Оценка навыков работы с современными стандартами сбора данных.
В чем, по вашему мнению, основные преимущества и сложности перехода на OpenTelemetry в крупной микросервисной архитектуре?
Проверка умения автоматизировать инфраструктуру мониторинга.
Расскажите о вашем опыте реализации концепции 'Dashboards and Alerts as Code'. Какие инструменты вы использовали для валидации алертов до их деплоя?
Оценка навыков траблшутинга в распределенных системах.
Опишите случай, когда вам пришлось расследовать потерю данных в лог-пайплайне (например, в Vector или Splunk). Как вы нашли узкое место?
Проверка понимания специфики работы с Nomad в сравнении с Kubernetes.
Какие особенности эксплуатации телеметрии в среде Nomad вы можете выделить по сравнению с Kubernetes?
Похожие вакансии
DevOps инженер (middle)
Senior / Lead DevOps (Platform / SRE)
Senior DevOps
DevOps (Middle+)
DevOps
Devops-инженер
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!