Data Engineer в команду Spark
О команде: Мы — кросс-функциональная команда, которая развивает аналитическую платформу на базе экосистемы Hadoop и Spark для пакетной обработки данных:выполняем продуктовые задачи: реализуем сервисы для доступа к данным, выстраиваем процессы аналитики, фокусируемся на сборе статистики взаимодействий с поисковой и рекомендательной выдачей;тесно взаимодействуем с другими командами по вопросам аналитики с помощью наших инструментов, улучшаем практики использования Spark в других командах, принимаем данные из разных источников: Trino, ClickHouse, Kafka;развиваем платформу: поддерживаем и оптимизируем ETL-пайплайны, DQ-процессы и сбор метрик.Серверная инфраструктура, поддержка оборудования и обновление ОС — зона ответственности отдельной команды инфраструктуры, с которой мы тесно взаимодействуем.
Какие задачи вас ждут: разрабатывать новые и поддерживать существующие продукты в составе кросс-функциональной команды;развивать существующую Big Data-платформу с учётом растущей нагрузки от новых задач и данных: 90% задач связаны со Spark;создавать новые сервисы на Python и улучшать существующие;внедрять инженерные практики и делиться с командой своим опытом;предлагать новые подходы и быстро проверять их в продакшене на реальных данных.
Мы ждем, что вы: пишете на Python или Java/Scala и готовы перейти на Python;глубоко понимаете экосистему Hadoop/Spark/Hive и связанные продукты;работали с данными и решали аналитические задачи;умеете администрировать Linux-системы на базовом уровне;готовы искать нестандартные решения.
Будет здорово, если вы: имеете опыт работы с Apache Airflow, знаете принципы построения пайплайнов;разрабатывали бэкенд-приложения на FastAPI, Zero, Flask, Asyncio, Django, другом Python-фреймворке или Go;разбираетесь в инфраструктуре Apache Kafka;писали стриминговые приложения на Apache Flink/Spark;использовали оркестраторы кластеров для администрирования: Ansible, SaltStack, Puppet и другие;умеете писать тесты, знаете и применяете подходы TDD, BDD, собирали CI/CD-решения, умеете работать с Docker;работали с кластерными СУБД: Vertica, ClickHouse, Sphinx, Trino и другими.
Работа у нас — это: возможность реализовать свои идеи в проекте с многомиллионной аудиторией;команда, которая поддерживает инициативы;оборудование, дополнительные мониторы и всё, что нужно для продуктивной работы;система премий и зарплата, размер которой обсудим на собеседовании;личный бюджет на обучение, который можно тратить на книги, курсы и конференции;забота о здоровье: с первого дня у вас будет ДМС со стоматологией, в офисе принимают терапевт и массажист;удалённый формат работы и комфортный офис в двух минутах от метро «Белорусская»: панорамный вид на центр города, места для уединённой работы и зоны отдыха.