Zorky CRMZorky CRM
EN|RU
@ekaterinovikova
All jobs

MLOps / ML Infrastructure Engineer

middleremoteМосква, RUScore undefined/1001w ago
Market insights
📊 DevOps / SRE: salaries and demand on the market
Stack
ci/cdgrafanakuberneteslinuxmlflowmlopsprometheustriton
Apply
Upload your CV — we will connect you with the employer directly through our pool.
Send your CV →
Description
Мы ищем инженера, который будет отвечать за стабильную работу ML-инфраструктуры и сервисов инференса в production. В этой роли предстоит настраивать и поддерживать Triton Inference Server, работать с Kubernetes и CI/CD, следить за стабильностью ML-сервисов и пайплайнов, разбирать инциденты и постепенно улучшать инфраструктуру. В нашей команде тебе предстоит: Настраивать и поддерживать NVIDIA Triton Inference Server для production-нагрузки; Загружать и обновлять модели в Triton, настраивать model repository, версии моделей и параметры инференса; Поддерживать и развивать CI/CD для моделей и ML-сервисов; Настраивать Kubernetes-ресурсы: CPU, GPU, memory, requests/limits, autoscaling и deployment'ы; Поддерживать DAG'и и пайплайны, разбирать и устранять возникающие проблемы; Диагностировать инциденты: миграция базы, проблемы с сервисами, нехватка памяти/CPU/GPU, падения pod'ов и другие production-проблемы; Следить за состоянием сервисов по дашбордам, метрикам и логам; Анализировать логи и метрики: определять, что именно сломалось, когда началась проблема и где находится её первопричина; Участвовать в устранении технического долга и развитии инфраструктуры; Переводить существующие процессы на более современные инструменты, в том числе участвовать в миграции на MLflow; Автоматизировать повторяющиеся операции и снижать количество ручных действий при эксплуатации ML-сервисов. Что мы ожидаем от кандидата: Уверенное знание Linux и понимание принципов эксплуатации production-сервисов; Практический опыт работы с Kubernetes: deployments, pods, requests/limits, probes, ConfigMap/Secret, volumes, ресурсы и troubleshooting; Опыт настройки и эксплуатации CI/CD; Понимание принципов работы ML-инференса и жизненного цикла ML-модели в production; Опыт работы с Triton Inference Server или близкими системами model serving; Умение читать и анализировать логи и метрики, находить причину проблем, а не только перезапускать сервис; Базовое понимание мониторинга: Prometheus/Grafana ил
Employer contacts (email/phone/telegram) are hidden from the public preview — send your CV, and we will connect you directly.
Urgent question? Message @ekaterinovikova