Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда разрабатывает платформу надёжности сервиса Такси: технологии для повышения аптайма и устойчивости бизнеса, включая балансировку трафика, SRE GPT, chaos engineering, инструменты observability, anomaly detection, graceful degradation и автовосстановление. Платформа помогает предотвращать инциденты и ускорять восстановление сервиса с сотнями микросервисов и миллионами пользователей.
задачи
Улучшать работу системы оперативной балансировки;
Развивать SRE GPT для интеллектуального анализа и автоматического восстановления инцидентов;
Создавать гибкий эмулятор клиентских действий;
Автоматизировать хаос-сценарии и анализировать их влияние;
Разрабатывать инструменты для анализа деградации latency;
Проектировать и развивать сервисы платформы надёжности;
Выбирать оптимальные решения и проводить технические эксперименты;
Оценивать влияние решений на устойчивость и надёжность ключевых компонентов Такси;
Изучать систему и искать направления для повышения отказоустойчивости;
Масштабировать успешные практики на десятки команд и сотни микросервисов.
требования
Писать или быть готовым писать на Go или Python;
Понимать архитектуру распределённых систем;
Уметь анализировать сложные технические задачи и предлагать решения;
Интересоваться отказоустойчивостью, observability и AI-инструментами в SRE;
Будет плюсом уверенное владение навыками траблшутинга — от сбора симптомов до устранения корневой причины и профилактики повторных сбоев, желание повышать надёжность продукта, которым ежедневно пользуются миллионы людей.
условия
От 5 лет опыта;
Расширенная медицинская страховка с первого месяца работы;