Описание
❤️ Ищем Senior DevOps / SRE Engineer ❤️
Ищем автономного инженера, который возьмёт ответственность за стабильность и развитие production-инфраструктуры.
Текущая инфраструктура:
~50 серверов (Hetzner dedicated + VPS, DigitalOcean).
Staging: Docker Swarm.
Production: Docker Compose.
БД: MariaDB с Master-Slave репликацией.
CI/CD: GitLab, Harbor registry.
IaC: начальная стадия внедрения, Ansible для конфигурации серверов.
Задачи:
- Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер.
- Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager.
- Внедрение централизованного логирования.
- Развитие Infrastructure as Code с использованием Ansible и Terraform.
- Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа.
- Выстраивание on-call-процессов, runbook-документации и работы с инцидентами.
- Security hardening инфраструктуры.
- Внедрение SLI/SLO и подготовка к работе по SLA.
Требования:
- Опыт работы с Docker Swarm и/или Kubernetes в production-среде.
- Уверенное владение Ansible.
- Опыт построения monitoring stack (Prometheus + Grafana).
- Глубокие знания Linux (Debian/Ubuntu) на уровне траблшутинга.
- Опыт с GitLab CI/CD.
- Администрирование MariaDB/MySQL (репликация, backup, восстановление).
- Опыт построения централизованного логирования (ELK/Loki).
- Опыт работы SRE: диагностика и устранение инцидентов в production.
- Умение самостоятельно принимать технические решения и нести ответственность за их результат.
Обязательно:
- On-call 24/7 (инциденты требуют быстрой реакции, включая выходные).
- Автономность в принятии решений.
- Ответственность за стабильность инфраструктуры.
📩 За подробностями — в ЛС [handle]
Контакты работодателя (email/phone/telegram) скрыты из публичного превью —
отправьте резюме, чтобы мы связали вас напрямую.