Data Scientist в команду Horizontal ML Technologies

В работе мы ставим амбициозные цели и не останавливаемся на достигнутом. Поэтому для нас так важно, чтобы каждый участник большой команды Авито разделял культуру компании. Погрузиться в неё помогает Манифест, в котором собраны наши основные ориентиры — миссия, ценности, принципы работы manifesto.avito.com

О команде

Команда Horizontal ML Technologies создаёт и развивает горизонтальные ML-технологии для Авито. Одно из направлений — OCR: распознавание текста с изображений. Также команда решает задачи, связанные с визуальным качеством фотографий.

OCR-модели помогают решать задачи модерации и антифрода, а также извлекать полезную информацию из текста на фотографиях. Отдельное направление — развитие OCR-платформы для распознавания документов: команда создаёт классические пайплайны с детектором и распознавателем, а также решения на базе VLM.

В каждом проекте команда проводит полный цикл ML-разработки: от сбора и разметки данных до обучения моделей и выкатки в прод высоконагруженных сервисов.

Мы ищем CV-инженера с опытом решения разных задач компьютерного зрения

Примеры будущих задач:

— развивать OCR-платформу: улучшать качество распознавания текущих типов документов и разрабатывать решения для новых;

— строить CV- и классические OCR-пайплайны: обучать детектор и распознаватель, работать с классификацией типа текста, качеством изображения, пре- и постпроцессингом;

— разрабатывать VLM-решения: дообучать модели с помощью LoRA, работать с промптингом, проектировать архитектуру решения, оценивать и контролировать качество;

— собирать и размечать данные вручную и автоматически, генерировать синтетические датасеты;

— оптимизировать инференс моделей и внедрять их в прод высоконагруженных сервисов.

Мы ждём, что вы:

— имеете от 3 лет практического опыта работы с ML-моделями в области компьютерного зрения, опыт в OCR будет преимуществом;

— умеете самостоятельно вести CV-проекты от идеи до продакшена;

— глубоко понимаете устройство CV-моделей: особенности CNN и трансформерных архитектур для классификации, детекции и сегментации;

— понимаете, как устроены современные VLM, и решали с их помощью прикладные задачи;

— обладаете широким кругозором в Data Science: классический ML, NLP, CV, LLM;

— уверенно владеете Python и PyTorch, а также знакомы с методами классического компьютерного зрения в OpenCV;

— имеете опыт оптимизации и вывода моделей в прод;

— умеете общаться с бизнесом простым языком, объяснять метрики и результаты.

Будет здорово, если вы:

— имеете опыт написания и чтения кода на Go;

— участвовали в соревнованиях или хакатонах по ML, занимали призовые места;

— окончили Академию Авито, ШАД или AI Masters.

Работа у нас — это:

— возможность влиять на продукт: ваши решения будут улучшать опыт миллионов пользователей;
— сложные технологические задачи на большом масштабе;
— мощное железо: доступ к производительным GPU-кластерам для экспериментов;
— сильное комьюнити: команда экспертов, с которой можно обсуждать идеи и подходы;
— развитие: бюджет на обучение, курсы, конференции и профессиональную литературу;
— забота о здоровье: ДМС со стоматологией с первого дня, в офисе принимают терапевт и массажист;
— гибкость: возможность работать удалённо или из офисов в 4 городах России.

Поделиться
Скопировать ссылку Вконтакте Telegram WhatsApp