Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда платформы инференса Ozon строит ML-инфраструктуру для работы моделей в реальных продуктах. Платформа обслуживает ранжирование, рекомендации, компьютерное зрение и другие ML-сценарии, влияющие на миллионы пользователей, выдерживает пиковую нагрузку 200K+ RPS и управляет кластерами GPU-серверов.
задачи
Проектировать и разрабатывать высоконагруженные сервисы для инференса ML-моделей в облачной среде;
Оптимизировать выполнение моделей на GPU: batching, управление GPU-памятью, настройку GPU sharing (MIG), снижение latency;
Интегрировать ML-рантаймы TensorRT и ONNX Runtime в платформенную инфраструктуру на Java и Go;
Разрабатывать механизмы автоскейлинга и эффективно распределять нагрузку между инференс-сервисами;
Обеспечивать SLA платформы, участвовать в разборе инцидентов, выявлять узкие места и внедрять системные решения для повышения стабильности и производительности;
Разрабатывать унифицированный API инференса, абстрагирующий команды Data Science от особенностей GPU и рантаймов;
Автоматизировать оптимизацию и конвертацию моделей под различные типы GPU;
Реализовывать асинхронный инференс с автоскейлингом в Kubernetes;
Повышать утилизацию GPU-кластера без деградации latency.
требования
Коммерческий опыт разработки на Go или Java/Kotlin от 4 лет;
Опыт проектирования микросервисной архитектуры и работы с распределёнными системами;
Понимание многопоточности и конкурентного программирования;
Умение писать чистый, тестируемый и поддерживаемый код;
Опыт работы с облачной инфраструктурой;
Будет плюсом опыт работы с ML-инфраструктурой и GPU (CUDA, Triton, KServe), понимание MLOps-практик, опыт работы с Kafka или другими системами очередей, опыт оптимизации высоконагруженных систем.