- Страна
- Россия
CUDA-разработчик (инфраструктура и ускорение вычислений) в Автономный транспорт
Яндекс — топовый работодатель с сильной инженерной культурой и уникальными задачами в области Self-Driving. Вакансия предлагает работу с передовым стеком технологий и отличный социальный пакет, хотя и предполагает высокий порог входа.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует исключительных знаний низкоуровневого программирования, архитектуры GPU и математической подготовки. Задачи по оптимизации инференса ML-моделей и управлению инфраструктурой вычислений на бортовых ускорителях относятся к категории высокой сложности.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Зарплата в объявлении не указана, но для Senior CUDA-разработчиков в Москве рыночный диапазон составляет от 400 000 до 650 000 рублей и выше, включая бонусы и опционы. Яндекс обычно предлагает конкурентоспособные условия, соответствующие верхней границе рынка для ключевых специалистов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
*🚕* CUDA-разработчик (инфраструктура и ускорение вычислений) в Автономный транспорт
Наша команда разрабатывает вычислительное ядро для направления автономного транспорта. В рамках проекта требуется эффективная реализация сложных математических алгоритмов и моделей машинного обучения на GPU, поэтому мы в поиске сильного разработчика с глубоким пониманием архитектуры вычислительных систем.
Какие задачи вас ждут:
• Повышение эффективности алгоритмов
Вам предстоит оптимизировать алгоритмы, учитывая аппаратные особенности платформ, автоматизировать тестирование алгоритмов и их адаптацию к платформе.
• Оптимизация инференса ML-моделей
Совместно с МL-командой вы будете ускорять вывод моделей машинного обучения через ONNX за счёт комплексного применения методов квантизации моделей, анализа и оптимизации структуры вычислительных графов и учётом аппаратных возможностей бортовых ускорителей.
• Управление загрузкой GPU и инфраструктурой вычислений
Вам предстоит обеспечивать эффективное использование GPU: разрабатывать механизмы планирования вычислений, создавать инфраструктуру для запуска нагрузок и настраивать мониторинг распределения ресурсов.
Мы ждём, что вы:
• Профессионально пишете на CUDA и C++
• Глубоко понимаете модель исполнения GPU и иерархию памяти
• Умеете измерять и объяснять, где теряется производительность
Будет плюсом, если вы:
• Работали с TensorRT, Triton, cuDNN или собственными kernel
• Оптимизировали пайплайны обработки облаков точек или изображений
• Знакомы с Python и ML-фреймворками (PyTorch)
Почему у нас классно:
Сотрудники Яндекса бесплатно участвуют в профильных конференциях. А для тех, кто на них выступает, у нас есть школа подготовки спикеров. Это не все бонусы — полный список тут.
*📩*{{apply_contact}}на нашем сайте
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- CUDA
- C++
- ONNX
- TensorRT
- Triton
- cuDNN
- Python
- PyTorch
- GPU Computing
- Quantization
Возможные вопросы на собеседовании
Проверка фундаментальных знаний архитектуры GPU и умения оптимизировать доступ к данным.
Расскажите о различиях между Shared Memory и Global Memory в CUDA. В каких случаях использование Shared Memory может не дать прироста производительности?
Оценка опыта работы с ML-инфраструктурой, указанной в вакансии.
Какие техники оптимизации вычислительного графа в ONNX вы применяли для ускорения инференса на GPU?
Проверка навыков отладки и профилирования.
Какими инструментами вы пользуетесь для поиска узких мест (bottlenecks) в CUDA-кернелах и как интерпретируете показатели occupancy?
Важно для понимания работы с бортовыми компьютерами беспилотников.
Как бы вы реализовали эффективный планировщик задач для GPU, если несколько процессов одновременно запрашивают ресурсы для инференса моделей разного приоритета?
Проверка знаний современных методов сжатия моделей.
В чем заключаются основные сложности при переходе от FP32 к INT8 квантизации для моделей компьютерного зрения и как это влияет на точность и скорость?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

