Team Lead Of CUDA Inference In Autonomous Transport (AI)
Описание
Локация: Гибридный формат, офисы в Санкт-Петербурге и МосквеКомпанияYandex (подразделение Автономного транспорта), занимающееся созданием систем беспилотного вождения.Что делатьРуководить командой CUDA-оптимизации: управлять людьми, формировать техпланы и отвечать за latency, throughput и эффективность памяти.Проектировать и оптимизировать вычислительные ядра (CUDA-kernels) и fusion-операции для блоков matmul, conv, attention.Оптимизировать использование архитектуры GPU: работать с memory hierarchy, layout данных, tiling-подходами и tensor cores.Проводить системный анализ bottleneck с помощью профилировщиков (Nsight) и внедрять решения с учетом ограничений железа.ТребованияСильный опыт в CUDA performance engineering.Опыт разработки kernel для matmul, conv и attention.Уверенное владение C++.Глубокое понимание memory hierarchy GPU и cost model вычислительных операций.Навыки профилирования и доведения оптимизаций до измеримого ускорения.Опыт технического лидерства или управления командой.Хорошо, если естьОпыт работы с CUTLASS, Triton или кастомными inference-движками.Опыт оптимизации моделей под конкретные GPU-архитектуры.Знания в области quantization и mixed precision.Навыки построения roofline-моделей или оценки latency/bandwidth.Знание fusion-подходов и graph-level оптимизаций.