Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда развивает GigaChat и направления online RL, доводя исследовательские идеи до работающих решений, надёжных пайплайнов обучения и повышения качества модели.
задачи
Разрабатывать и улучшать методы online RL;
Реализовывать и дорабатывать подходы post-training и online RL;
Проектировать и проводить эксперименты, формулировать гипотезы, подбирать конфигурации и анализировать результаты;
Определять причины улучшения или ухудшения модели, устойчивость результатов и возможность масштабирования на другие домены и типы задач;
Следить за state-of-the-art, читать статьи, воспроизводить результаты и адаптировать подходы под задачи и инфраструктуру;
Строить и развивать инфраструктуру обучения;
Разрабатывать и поддерживать пайплайны online RL от генерации rollout'ов и сбора reward-сигналов до обновления весов модели;
Обеспечивать воспроизводимость экспериментов с помощью версионирования данных, конфигураций и чекпоинтов, а также контроля деградаций;
Оптимизировать throughput и эффективность использования GPU с помощью distributed training, параллелизма и профилирования узких мест;
Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями для быстрой проверки новых идей;
Работать с данными и системой оценки качества;
Участвовать в проектировании и реализации reward-сигналов, включая rule-based верификаторы, reward-модели, LLM-as-a-judge и execution-based проверки;
Строить и улучшать пайплайны подготовки данных: фильтрацию, дедупликацию, балансировку и контроль утечек;
Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения;
Взаимодействовать с исследователями, инженерами, командами данных и инфраструктуры;
Нести ответственность за целые части системы от идеи до результата в продакшене;
Делиться знаниями, участвовать в код-ревью и помогать повышать общий уровень качества.
требования
Отлично владеть Python и PyTorch;
Иметь практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях;
Иметь опыт проведения ML-экспериментов от постановки гипотезы до анализа и выводов;
Понимать distributed training: Data Parallel, FSDP, DeepSpeed или аналоги;
Уметь писать чистый, надёжный код для продакшена;
Уметь разбираться в сложных системах и самостоятельно находить и устранять узкие места.
условия
Возможность выбрать гибридный или офисный формат работы;
Ежегодный пересмотр зарплаты;
Годовая премия;
Корпоративный спортзал и зоны отдыха;
Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития;
Расширенный ДМС;
Льготное страхование для семьи;
Корпоративная пенсионная программа;
Ипотека выгоднее до 7% для каждого сотрудника;
Бесплатная подписка СберПрайм+;
Скидки на продукты компаний-партнёров;
Вознаграждение за рекомендацию друзей в команду Сбера.