О роли:
Analytics Engineer - это позиция для того, кто хочет не просто тянуть и раскладывать сырые данные, но и заниматься непосредственно анализом данных и построением дашбордов. По сути, нужно будет:
- взять сырые данные, очистить их (DQ - 30%),
- смоделировать витрины в DWH (40%)
- и отдать бизнесу в виде готового BI-слоя (30%).
Мы ищем опытного специалиста на стыке аналитики, инженерии и QA, который станет главным гарантом качества наших данных. Вам предстоит развивать хранилище данных, выстраивать систему автоматизированного контроля качества, внедрять подходы MDM и разрабатывать надежные дашборды. Мы активно поощряем использование AI-инструментов для автоматизации проверок, нечеткого поиска, ускорения рутины.
Управление мастер-данными (MDM / НСИ) и Контроль качества:
- Разработка алгоритмов сопоставления (мэтчинга) и дедупликации справочников из разрозненных систем (1С, веб-сервисы, Excel).
- Централизованное ведение маппингов (карт соответствия) справочников и обеспечение консистентности нормативно-справочной информации (НСИ).
- Внедрение автоматизированных скриптов на Python и SQL для проверки целостности, полноты и консистентности данных на всех этапах загрузки.
- Настройка систем алертинга (уведомлений) о появлении дубликатов, нераспознанных сущностей или бизнес-аномалий.
Работа с базами данных и Инженерия (ETL/ELT):
- Интеграция шагов валидации данных и MDM-проверок (DQ-гейтов) в пайплайны Apache Airflow.
- Написание SQL-запросов (PostgreSQL / MySQL) для поиска логических ошибок, расхождений и профилирования данных.
- Проектирование сущностей в хранилищах данных; внедрение изменений.
BI и Аналитика (Apache Superset):
- Построение дашбордов в Apache Superset для визуального мониторинга «здоровья» данных (метрики качества, процент дубликатов, статус обогащения справочников).
- Разработка бизнес-дашбордов на основе уже очищенных, связанных и проверенных витрин данных.
- Взаимодействие с заказчиками: разбор инцидентов расхождения цифр, поиск корневых причин (Root Cause Analysis).
Использование искусственного интеллекта (AI):
- Применение AI-ассистентов для разного рода задач, например:
- Реализации алгоритмов нечеткого поиска (Fuzzy Matching) и NLP-методов для сопоставления текстовых справочников.
- Генерации SQL-скриптов для покрытия данных edge-кейсами и тестами.
- Написания сложных регулярных выражений (RegEx) для очистки сырых текстовых данных.
Важно: глубокое понимание ограничений LLM, обязательное ревью, тестирование и валидация сгенерированного кода перед внедрением.
Hard Skills:
- SQL: продвинутый уровень (оконные функции, CTE, сложные джойны, понимание планов выполнения).
- Python: уверенное владение.
- Понимание принципов Master Data Management (MDM): подходы к дедупликации, слиянию записей (merge/survivorship rules), ведению НСИ.
- Опыт профилирования и поиска аномалий в реляционных БД (PostgreSQL / MySQL).
- Понимание метрик качества данных (полнота, точность, уникальность, согласованность).
- Опыт работы с Apache Superset (включая использование Jinja).
Soft Skills:
- Здоровый педантизм, любовь к порядку в данных.
- Насмотренность в части создания дашбордов.
- Умение выстраивать процессы «с нуля» и брать на себя ответственность за архитектурные решения в рамках MDM.
Будет плюсом:
- Глубокое понимание архитектуры 1С (Справочники, Регистры).
- Опыт работы со специализированными фреймворками для тестирования данных.
- Навыки работы с Linux (bash) и Git/Docker.
Условия:
- География проектов: Москва, МО, Санкт-Петербург, регионы РФ
- Конкурентоспособная заработная плата
- Официальное трудоустройство согласно ТК РФ
- График работы: 5/2 с 9:00 до 18:00
- Дружный коллектив и комфортная рабочая атмосфера
- Возможности для профессионального роста и развития
Если вы ищете стабильную работу в дружном коллективе и готовы развиваться вместе с нами, отправляйте свое резюме!