Zorky CRMZorky CRM
EN|RU
@ekaterinovikova
Все вакансии

Data Engineer в направление «Интеллектуальные решения»

middleofficeАстана, KZСкор undefined/1001нед назад
Аналитика рынка
📊 Data Engineer: зарплаты и спрос на рынке
Стек
airflowclickhouseclouddagsterdbtdockergrafanagreenplumkafkakubernetesoraclepostgresqlprefectprometheuspythonsparksql
Откликнуться
Загрузите резюме — мы свяжем вас с работодателем напрямую через нашу базу.
Отправить резюме →
Описание
Ключевые задачи: Строить пайплайны выгрузки данных из систем заказчика: PostgreSQL, Oracle, Hive-таблицы, Kafka-топики, файлы, API; Разрабатывать и сопровождать DAG'и в Airflow - инкрементальная загрузка, ретраи, алертинг, восстановление после сбоев; Собирать витрины для аналитики и датасеты для AI-сервисов; Отвечать за качество данных: проверки на входе, контроль расхождений, понятная диагностика при инцидентах; Оптимизировать запросы и модели данных, когда витрина перестаёт укладываться в SLA; Мы строим корпоративную AI-платформу: интеллектуальный поиск по внутренним документам, аналитику операционных процессов, выявление аномалий в данных. Всё это работает ровно настолько хорошо, насколько хорош слой данных под ним. Ландшафт неоднородный, и мы говорим об этом сразу. Источники живут в унаследованном контуре заказчика на Huawei Cloud Stack - Hive, Spark, объектное хранилище, базы на Oracle и PostgreSQL. Наш собственный контур современный: Kubernetes, Airflow, аналитическая СУБД, GPU-сегмент под инференс. Ваша задача - аккуратно вытащить данные из первого и качественно уложить во второй. Навыки, которые нам необходимы: 3 + года в роли Data Engineer или близкой - ETL, DWH, backend с дата-уклоном; Уверенный SQL: оконные функции, планы выполнения, умение объяснить, почему запрос тормозит; PostgreSQL на практике - индексы, блокировки, партиционирование; Python на уровне промышленной разработки пайплайнов, а не разовых скриптов; Airflow или другой оркестратор - Dagster, Prefect, аналог; Опыт хотя бы с одной аналитической СУБД: ClickHouse, Greenplum, GaussDB(DWS), Vertica; Понимание распределённого хранения: HDFS, Hive-таблицы, движок вроде Spark. Конкретный дистрибутив не важен; Docker: собрать образ, разобраться, почему контейнер падает; Будет плюсом знание: Huawei Cloud Stack (MRS, GaussDB, OBS); Kafka и CDC (Debezium); Orac как источник; dbt; Kubernetes; Spark; Prometheus и Grafana; Data Quality и Data Contracts; подготовка данных для ML: обработка документов, век
Контакты работодателя (email/phone/telegram) скрыты из публичного превью — отправьте резюме, чтобы мы связали вас напрямую.
Срочный вопрос? Напишите @ekaterinovikova