7 сен

ml инженер для GigaChat

ориентир по рынку
вакансия зп не указана
в среднем 356 058 ₽
Загрузи резюме, чтобы видеть мэтчи с вакансией

подготовьтесь к отклику

ai-инструменты

Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме

описание

Команда развивает GigaChat и направления online RL, доводя исследовательские идеи до работающих решений, надёжных пайплайнов обучения и повышения качества модели.

задачи

  • Разрабатывать и улучшать методы online RL;
  • Реализовывать и дорабатывать подходы post-training и online RL;
  • Проектировать и проводить эксперименты, формулировать гипотезы, подбирать конфигурации и анализировать результаты;
  • Определять причины улучшения или ухудшения модели, устойчивость результатов и возможность масштабирования на другие домены и типы задач;
  • Следить за state-of-the-art, читать статьи, воспроизводить результаты и адаптировать подходы под задачи и инфраструктуру;
  • Строить и развивать инфраструктуру обучения;
  • Разрабатывать и поддерживать пайплайны online RL от генерации rollout'ов и сбора reward-сигналов до обновления весов модели;
  • Обеспечивать воспроизводимость экспериментов с помощью версионирования данных, конфигураций и чекпоинтов, а также контроля деградаций;
  • Оптимизировать throughput и эффективность использования GPU с помощью distributed training, параллелизма и профилирования узких мест;
  • Выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями для быстрой проверки новых идей;
  • Работать с данными и системой оценки качества;
  • Участвовать в проектировании и реализации reward-сигналов, включая rule-based верификаторы, reward-модели, LLM-as-a-judge и execution-based проверки;
  • Строить и улучшать пайплайны подготовки данных: фильтрацию, дедупликацию, балансировку и контроль утечек;
  • Анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения;
  • Взаимодействовать с исследователями, инженерами, командами данных и инфраструктуры;
  • Нести ответственность за целые части системы от идеи до результата в продакшене;
  • Делиться знаниями, участвовать в код-ревью и помогать повышать общий уровень качества.

требования

  • Отлично владеть Python и PyTorch;
  • Иметь практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях;
  • Иметь опыт проведения ML-экспериментов от постановки гипотезы до анализа и выводов;
  • Понимать distributed training: Data Parallel, FSDP, DeepSpeed или аналоги;
  • Уметь писать чистый, надёжный код для продакшена;
  • Уметь разбираться в сложных системах и самостоятельно находить и устранять узкие места.

условия

  • Возможность выбрать гибридный или офисный формат работы;
  • Ежегодный пересмотр зарплаты;
  • Годовая премия;
  • Корпоративный спортзал и зоны отдыха;
  • Более 400 образовательных программ СберУниверситета для профессионального и карьерного развития;
  • Расширенный ДМС;
  • Льготное страхование для семьи;
  • Корпоративная пенсионная программа;
  • Ипотека выгоднее до 7% для каждого сотрудника;
  • Бесплатная подписка СберПрайм+;
  • Скидки на продукты компаний-партнёров;
  • Вознаграждение за рекомендацию друзей в команду Сбера.

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.

Про зарплаты

Анонимные данные по зарплатам и грейдам.
Можно сверить вилку с рынком.

Посмотреть зарплаты

Если просят выйти из iCloud, прислать код из SMS, запустить или установить что-то, перевести деньги — не соглашайтесь: это мошенничество.