Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда разрабатывает и поддерживает инфраструктуру данных для большого проекта озера данных со сложными сценариями приёма и обработки данных из разных источников.
задачи
Разрабатывать и поддерживать парсеры;
Автоматизировать обработку и преобразование данных;
Отлаживать и мониторить конвейеры данных.
требования
Знать основные библиотеки Python для работы с данными;
Иметь опыт обработки и парсинга сложных слабоструктурированных документов в форматах PDF, DOC, DOCX, XLS и XLSX;
Иметь опыт автоматизации конвейеров данных и знать соответствующие программные инструменты;
Понимать управление качеством данных;
Понимать возможности отладки и мониторинга;
Понимать специфику форматов данных JSON Lines, Parquet, XML и CSV;
Понимать методы получения и поставки данных, включая S3, REST API, SOAP и RPC;
Знать английский язык на уровне, достаточном для чтения технической документации;
Знать Git;
Быть готовым осваивать новые технологии и разрабатывать индивидуальные технические решения под поставленные задачи;
Будет плюсом опыт работы с данными из открытых источников, понимание их специфики, опыт долгосрочной поддержки парсеров, опыт работы с библиотеками Python для компьютерного зрения.
условия
Оформление по ТК РФ;
Проект только стартовал: мало легаси и много свободы для экспериментов;
Можно влиять на выбор технологий и архитектурных решений.