Чтобы адаптировать резюме под вакансию или составить сопроводительное письмо, загрузите резюме
описание
Команда с нуля разрабатывает собственный FPGA-ускоритель для запуска LLM и речевых моделей. Уже создан первый PoC, в ближайшие 6–8 месяцев команда планирует разработать MVP; у продукта есть первый клиент.
задачи
Понимать устройство LLM inference на математическом и архитектурном уровне;
Оптимизировать kernels с использованием tiling, fusion, buffering и scheduling;
Влиять на архитектуру продукта с самого начала.
требования
Понимание LLM inference, attention, KV-cache и prefill/decode;
Понимание compute pipelines, memory hierarchy и data movement;
Опыт в AI inference, accelerators или low-level performance optimization;
Будет плюсом опыт с FPGA, GPU, CUDA, Triton, TVM, MLIR, XLA и другими архитектурами ускорителей.
условия
Работа из любой страны;
Возможна частичная занятость;
Очень ранняя стадия продукта с возможностью влиять на его архитектуру с самого начала.