Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда развивает ML-инфраструктуру для вывода ML- и LLM-решений в production, включая inference-сервисы, мониторинг и инструменты эксплуатации.
задачи
Разворачивать и поддерживать ML-инфраструктуру в Kubernetes: ML-модели, inference-сервисы, прикладные сервисы и необходимые инфраструктурные компоненты;
Проектировать, настраивать и оптимизировать инфраструктуру для ML/LLM inference, обеспечивать масштабирование, отказоустойчивость и эффективное использование вычислительных ресурсов;
Автоматизировать развёртывание ML-сервисов и моделей с использованием Helm, ArgoCD и CI/CD, развивать GitOps-подходы;
Управлять инфраструктурой и облачными ресурсами через Terraform, разрабатывать и поддерживать Terraform-модули;
Развивать мониторинг и observability ML-систем: метрики, логирование, алертинг, контроль доступности и производительности inference-сервисов;
Улучшать совместно с ML- и бэкенд-разработчиками процесс вывода решений из эксперимента в production и инструменты для разработки, тестирования и эксплуатации ML-систем.
требования
Опыт от 3 лет в DevOps, MLOps или ML-разработке;
Владение Kubernetes и облачными технологиями;
Навыки работы с Helm и ArgoCD;
Навыки написания Terraform-модулей;
Практический опыт работы с мониторингом, логированием и ML-инференс-серверами.