Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда GigaChat Pretrain Data готовит данные для предварительного обучения моделей GigaChat и GigaChat Vision. Сырые данные объёмом более 40 ПБ преобразуются в датасет для обучения LLM.
задачи
Генерировать синтетические данные для математики, кода и произвольной синтетики с сидами из документов Web;
Исследовать токенизацию и её влияние на качество модели, включая возможное написание статей;
Решать задачи кластеризации миллиардов документов;
Исследовать различные факторы, которыми обладают текстовые данные;
Генерировать Vision-данные для улучшения VLM;
Разрабатывать новые алгоритмы парсинга HTML и исследовать их влияние на качество модели;
Исследовать зависимости между данными предварительного обучения и возможностями итоговой модели для работы с агентами;
Разрабатывать стабильную инфраструктуру для проведения сотен и тысяч экспериментов над данными.
требования
Коммерческий релевантный опыт в NLP или построении инфраструктуры для данных от двух лет;
Будет плюсом навыки работы с генеративными AI-моделями, опыт создания и использования AI-агентов, опыт использования GigaChat, Kandinsky и аналогов в продуктах, инструментальное владение AI для анализа, генерации и автоматизации, опыт с MapReduce-системами.
условия
Гибридный формат работы: два дня в офисе и три дня на удалёнке;
Комфортный современный офис рядом с метро «Кутузовская»;
Ежегодный пересмотр зарплаты;
Годовая премия;
Корпоративный спортзал и зоны отдыха;
Система обучения для профессионального и карьерного развития;
Расширенный полис ДМС с первого дня работы и страхование для семьи;
Льготная программа ипотеки для сотрудников;
Бесплатная подписка СберПрайм+ и скидки на продукты компаний-партнёров;
Вознаграждение за рекомендацию друзей в команду Сбера.