Data Engineer в команду Spark

В работе мы ставим амбициозные цели и не останавливаемся на достигнутом. Поэтому для нас так важно, чтобы каждый участник большой команды Авито разделял культуру компании. Погрузиться в неё помогает Манифест, в котором собраны наши основные ориентиры — миссия, ценности, принципы работы manifesto.avito.com

О команде

Мы — кросс-функциональная команда, которая развивает аналитическую платформу на базе экосистемы Hadoop и Spark для пакетной обработки данных:

  • выполняем продуктовые задачи: реализуем сервисы для доступа к данным, выстраиваем процессы аналитики, фокусируемся на сборе статистики взаимодействий с поисковой и рекомендательной выдачей;
  • тесно взаимодействуем с другими командами по вопросам аналитики с помощью наших инструментов, улучшаем практики использования Spark в других командах, принимаем данные из разных источников: Trino, ClickHouse, Kafka;
  • развиваем платформу: поддерживаем и оптимизируем ETL-пайплайны, DQ-процессы и сбор метрик.

Серверная инфраструктура, поддержка оборудования и обновление ОС — зона ответственности отдельной команды инфраструктуры, с которой мы тесно взаимодействуем.

Какие задачи вас ждут:

  • разрабатывать новые и поддерживать существующие продукты в составе кросс-функциональной команды;
  • развивать существующую Big Data-платформу с учётом растущей нагрузки от новых задач и данных: 90% задач связаны со Spark;
  • создавать новые сервисы на Python и улучшать существующие;
  • внедрять инженерные практики и делиться с командой своим опытом;
  • предлагать новые подходы и быстро проверять их в продакшене на реальных данных.

Мы ждем, что вы:

  • пишете на Python или Java/Scala и готовы перейти на Python;
  • глубоко понимаете экосистему Hadoop/Spark/Hive и связанные продукты;
  • работали с данными и решали аналитические задачи;
  • умеете администрировать Linux-системы на базовом уровне;
  • готовы искать нестандартные решения.

Будет здорово, если вы:

  • имеете опыт работы с Apache Airflow, знаете принципы построения пайплайнов;
  • разрабатывали бэкенд-приложения на FastAPI, Zero, Flask, Asyncio, Django, другом Python-фреймворке или Go;
  • разбираетесь в инфраструктуре Apache Kafka;
  • писали стриминговые приложения на Apache Flink/Spark;
  • использовали оркестраторы кластеров для администрирования: Ansible, SaltStack, Puppet и другие;
  • умеете писать тесты, знаете и применяете подходы TDD, BDD, собирали CI/CD-решения, умеете работать с Docker;
  • работали с кластерными СУБД: Vertica, ClickHouse, Sphinx, Trino и другими.

Работа у нас — это:

  • возможность реализовать свои идеи в проекте с многомиллионной аудиторией;
  • команда, которая поддерживает инициативы;
  • оборудование, дополнительные мониторы и всё, что нужно для продуктивной работы;
  • система премий и зарплата, размер которой обсудим на собеседовании;
  • личный бюджет на обучение, который можно тратить на книги, курсы и конференции;
  • забота о здоровье: с первого дня у вас будет ДМС со стоматологией, в офисе принимают терапевт и массажист;
  • удалённый формат работы и комфортный офис в двух минутах от метро «Белорусская»: панорамный вид на центр города, места для уединённой работы и зоны отдыха.
Поделиться
Скопировать ссылку Вконтакте Telegram WhatsApp