- Страна
- Россия
Инженер по производительности GPU
Работа в топовой технологической компании над критически важной инфраструктурой с доступом к огромным вычислительным мощностям. Отличный соцпакет и сильное инженерное сообщество.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует редкого сочетания навыков системного программирования, глубокого знания архитектуры GPU и опыта работы с ML-фреймворками. Высокая планка Яндекса к оптимизации производительности делает эту позицию технически сложной.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Яндекс предлагает конкурентную зарплату, которая обычно находится на уровне или выше медианы рынка для Senior/Lead специалистов в области системного программирования и ML-инфраструктуры. Итоговый доход сильно зависит от грейда и включает значительную бонусную часть и опционы.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Контакты для отклика
Откройте контакты, указанные в вакансии.
Описание вакансии
*❤️ Инженер по производительности GPU*
Мы управляем одним из самых дефицитных и самых дорогих ресурсов компании — графическими процессорами (GPU). Их эффективное использование ĸритичесĸи важно для работы ключевых сервисов Яндекса. Наша миссия — обеспечить максимальную отдачу и эффект от каждой GPU-ĸарты.
Какие задачи вас ждут:
• Повышение эффективности утилизации GPUФормировать гипотезы и исследовать способы повышения эффективности утилизации GPU, участвовать в реализации и внедрении наиболее профитных решений. Формировать рекомендации и лучшие практики по повышению производительности.
• Оптимизация и профилированиеНаходить узкие места в производительности и устранять их с помощью профилировщиков, оптимизировать доступ к памяти, время ожидания и пропускную способность.
• Развитие инструментов диагностикиСоздавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на эффективность утилизации, стабильность и скорость GPU-вычислений.
• Исследование и внедрение современных решенийИзучать новейшие подходы ĸ организации инфраструктуры для обучения и инференса, оценивать их эффективность и внедрять в проекты.
• Анализ архитектуры, тестирование, интеграцияВзаимодействовать с разработчиками, ML-инженерами и системными архитекторами. Участвовать в оценке аппаратных решений и предлагать улучшения для будущих поколений GPU.
Мы ждём, что вы:• Знаете Python и занимались системным программированием
• Работали с фреймворĸом PyTorch
• Оптимизировали производительность GPU-приложений и повышали эффективность утилизации GPU
• Работали с GPU (NVIDIA) и CUDA
• Применяете подходы параллелизации для распределённого инференса или обучения
Будет плюсом, если вы:• Уверенно владеете C/C++ или аналогичными низкоуровневыми языками
• Работали с библиотеками RL-обучения для LLM
Наши бонусы:Яндекс — это комьюнити. Тут есть и спортивные клубы, и книжный клуб, и киберспортивное сообщество. Это не все бонусы — полный список тут.
*📩* Откликнуться на нашем сайте
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- PyTorch
- CUDA
- NVIDIA GPU
- C++
- LLM
- Reinforcement Learning
- Performance Optimization
- Distributed Training
Возможные вопросы на собеседовании
Проверка понимания аппаратных ограничений и навыков оптимизации памяти.
Расскажите о наиболее сложном кейсе оптимизации GPU-приложения: как вы идентифицировали узкое место (memory bound vs compute bound) и какие техники использовали?
Важно для задач распределенного обучения и инференса, упомянутых в вакансии.
Какие стратегии параллелизма (Data, Pipeline, Tensor Parallelism) вы бы выбрали для оптимизации инференса LLM на кластере из нескольких узлов?
Проверка навыков системного программирования и работы с низкоуровневым API.
Как бы вы реализовали кастомный CUDA-кернел для специфической операции, которой нет в стандартном PyTorch, и на что обратили бы внимание при работе с shared memory?
Оценка умения работать с инструментарием, указанным в задачах.
Какие инструменты профилирования (например, Nsight Systems/Compute) вы используете для анализа задержек в межпроцессном взаимодействии (NCCL)?
Проверка понимания инфраструктурных аспектов утилизации.
Как вы оцениваете эффективность утилизации GPU в продакшене и какие метрики, помимо волатильности GPU-Util, считаете критически важными?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

