Твоя работа мечты здесь
Написать в TG @help_find_dream_offer_bot support@dreamoffer.app
При обращении в поддержку мы обрабатываем данные Вашего сообщения только для ответа на обращение.

Вакансия №1430500

Не указано
Не указано
Сеньор
Полная занятость
25 августа 2026 г.

Описание

❤️ **Ищем Senior DevOps / SRE Engineer** ❤️

Ищем автономного инженера, который возьмёт ответственность за стабильность и развитие production-инфраструктуры.

**Текущая инфраструктура:**
~50 серверов (Hetzner dedicated + VPS, DigitalOcean).
Staging: Docker Swarm.
Production: Docker Compose.
БД: MariaDB с Master-Slave репликацией.
CI/CD: GitLab, Harbor registry.
IaC: начальная стадия внедрения, Ansible для конфигурации серверов.

**Задачи:**
- Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер.
- Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager.
- Внедрение централизованного логирования.
- Развитие Infrastructure as Code с использованием Ansible и Terraform.
- Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа.
- Выстраивание on-call-процессов, runbook-документации и работы с инцидентами.
- Security hardening инфраструктуры.
- Внедрение SLI/SLO и подготовка к работе по SLA.

**Требования:**
- Опыт работы с Docker Swarm и/или Kubernetes в production-среде.
- Уверенное владение Ansible.
- Опыт построения monitoring stack (Prometheus + Grafana).
- Глубокие знания Linux (Debian/Ubuntu) на уровне траблшутинга.
- Опыт с GitLab CI/CD.
- Администрирование MariaDB/MySQL (репликация, backup, восстановление).
- Опыт построения централизованного логирования (ELK/Loki).
- Опыт работы SRE: диагностика и устранение инцидентов в production.
- Умение самостоятельно принимать технические решения и нести ответственность за их результат.

**Обязательно:**
- On-call 24/7 (инциденты требуют быстрой реакции, включая выходные).
- Автономность в принятии решений.
- Ответственность за стабильность инфраструктуры.

📩 За подробностями — в ЛС Доступно в источнике