Zorky CRMZorky CRM
EN|RU
@ekaterinovikova
Все вакансии

Platform / Infrastructure Engineer (Middle)

middleremoteRUСкор undefined/1002нед назад
Аналитика рынка
📊 DevOps / SRE: зарплаты и спрос на рынке
Стек
ansibleargocdawsci/cdclickhousedevopsfastapigitlabgitopsgrafanahelmk8skubernetesmongodbpostgresqlprometheuspythonqdrantterraform
Откликнуться
Загрузите резюме — мы свяжем вас с работодателем напрямую через нашу базу.
Отправить резюме →
Описание
Публикатор: Petruha Обсуждение: [handle] #резюме #devops #sre #baremetal #llm Позиция: Platform / Infrastructure Engineer (Middle) Формат: удалённо (нахожусь в Грузии, готов к релокации) Занятость: полная Оформление: обсуждаемо, спокойно принимаю оплату криптой (USDT и др.) Ожидания: обсуждаемо Обо мне: Основной инженер production-инфраструктуры enterprise-платформы для 5 клиентов (образование, производство, транспорт): 12 Kubernetes-кластеров, 45 нод, ~10K RPS, uptime 99.85%. Работаю в связке с тимлидом: архитектурные решения принимаем вместе, реализация и эксплуатация на мне, от сборки железа и установки сервера в ЦОДе клиента до GitOps-пайплайнов, бэкапов и on-call. Ключевое: - Построил внутреннюю LLM-систему аналитики инфраструктуры с нуля: CPU-only inference (llama.cpp + Ray), корреляция событий K8s, метрик Prometheus и алертов, отчёты в Telegram. Используется ежедневно. - Собрал и запустил on-prem кластер у security-sensitive клиента: сам собрал Supermicro-сервер, смонтировал в ЦОДе клиента, вывел в его закрытую сеть через WireGuard. - Построил внутреннюю систему трекинга полевых работ для 2 enterprise-клиентов (100+ зданий): FastAPI-бэкенд, Grafana-дашборды с картой и автоматической маршрутизацией заявок. Срок решения проблем на объектах сократился с месяцев до недели. - Развил CI/CD от "одна джоба: build" до полного цикла: линт и тесты до сборки, сборка, интеграционные тесты, деплой через ArgoCD, откат при необходимости. Релизы с еженедельных до ежедневных, ручных деплоев в прод: ноль - Забрал 25 микросервисов из зоопарка ручных деплоев на VMware-виртуалках и перевёз их на самостоятельно построенные k3s-кластеры: управляемые окружения вместо "у каждого разработчика своя ВМ". - Владею бэкапами и disaster recovery всех кластеров: PostgreSQL с point-in-time recovery (WAL), репликация в multi-region S3. Восстановление отработано на реальных production-инцидентах. - После ухода MinIO из open-source мигрировал хранилище на Rook/Ceph: прототип на k3s в AWS (Terraform), после проверки решения раскатил на все продовые bare-metal кластеры. Стек: Kubernetes (bare-metal, k3s) · Helm · Kustomize · ArgoCD · GitLab CI · Terraform · Ansible · AWS · Selectel · Rook/Ceph · Cilium · MetalLB · WireGuard · Prometheus · Grafana · Loki · VictoriaMetrics · PostgreSQL · MongoDB · ClickHouse · Python · Bash · FastAPI · llama.cpp · Ray · Qdrant Английский: C1 Контакт: [handle]
Контакты работодателя (email/phone/telegram) скрыты из публичного превью — отправьте резюме, чтобы мы связали вас напрямую.
Срочный вопрос? Напишите @ekaterinovikova