yandex
Страна
Россия
SeniorГибридПолная занятость

GPU Performance Engineer

ИИОценка ИИ

Яндекс предлагает работу над масштабными задачами с передовым стеком (LLM, vLLM, CUDA). Высокий престиж компании, возможность удаленной работы и работа с топовым оборудованием делают вакансию очень привлекательной для Senior-специалистов.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.


Вакансия из открытого источника
Пожаловаться
+400% приглашений от HR

Улучшите резюме под эту вакансию

Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Роль требует редкого сочетания навыков: глубокого понимания архитектуры GPU/CUDA, опыта распределенного обучения LLM и уверенного владения системным программированием. Высокая планка Яндекса к алгоритмической подготовке и оптимизации низкоуровневого кода делает эту позицию крайне сложной.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Анализ зарплаты

Медиана550 000 ₽
Рынок450 000 ₽ – 800 000 ₽
ИИОценка ИИ

Зарплата для Senior GPU Engineer в России в крупных тех-гигантах обычно начинается от 450-500 тысяч рублей net. Учитывая уникальность экспертизы (LLM + CUDA), итоговое предложение может значительно превышать рыночные медианы за счет бонусов и акций (RSU).

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Сопроводительное письмо

Составьте сопроводительное письмо под эту вакансию с вашим резюме

Иллюстрация сопроводительного письмаИллюстрация сопроводительного письма

Описание вакансии

#senior #удаленка #гибрид #офис

Яндекс

GPU Performance Engineer

Формат работы: удалённо или гибрид

*☑️* Чем предстоит заниматься

-Повышение эффективности утилизации GPU

-Вы будете формировать гипотезы и исследовать способы повышения эффективности утилизации GPU, участвовать в реализации и внедрении наиболее профитных решений. Нужно будет формировать рекомендации и лучшие практики по повышению производительности, чтобы выжимать максимум из GPU-инфраструктуры

-Оптимизация и профилирование

-В ваши обязанности войдёт поиск узких мест (bottlenecks) в производительности и их устранение с помощью профилировщиков, а также оптимизация доступа к памяти (memory access), ядер (kernels), времени ожидания (latency) и пропускной способности (throughput)

-Развитие инструментов диагностики

-Вы будете создавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на эффективность утилизации, стабильность и сĸорость GPU-вычислений (ĸаĸ для обучения, так и для инференса)

-Исследование и внедрение современных решений

-Вам предстоит изучать новейшие подходы ĸ организации инфраструктуры для обучения и инференса, оценивать их эффективность и внедрять в реальные проекты

-Анализ архитектуры, тестирование, интеграция

-Вы будете тесно взаимодействовать с разработчиками, ML-инженерами и системными архитекторами. Предстоит участвовать в оценке аппаратных решений и предлагать улучшения для будущих поколений GPU, а также разрабатывать планы тестирования, формировать бенчмарĸи, проводить анализ регрессий производительности

*☑️* Наши пожелания к кандидатам

-Знаете Python и занимались системным программированием, разрабатывали библиотеки или фреймворĸи

-Работали с фреймворĸом PyTorch и распределённым обучением через torch.distributed

-Применяете подходы параллелизации, включая data parallelism, tensor parallelism, pipeline parallelism, expert parallelism, для распределённого инференса или обучения

-Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене

-Работали с GPU (NVIDIA) и CUDA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы под CUDA, использовали Nsight, nvprof или их аналоги

-Умеете оптимизировать производительность GPU-приложений и повышать эффективность утилизации GPU

-Способны анализировать профили и метрики производительности

-Можете читать и оптимизировать сложный ĸод

-Умеете эффективно работать в команде и готовы делиться знаниями

Будет плюсом:

-Уверенно владеете C/C++ или аналогичными низкоуровневыми языками

-Работали с библиотеками RL-обучения для LLM: veRL, slime, NeMo-RL, SkyRL и другими

-Работали с библиотеками инференса: vLLM, SGLang и TRTLLM

-Имеете опыт оптимизации под реальные продаĸшен-нагрузĸи, работали с low-latency- или real-time-системами

Откликнуться

Python Job в Telegram | в VK | в Max

Больше похожих вакансий + автоотклики с ИИ

Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Больше похожих вакансий + автоотклики с ИИ

Навыки

  • Python
  • PyTorch
  • CUDA
  • C++
  • C
  • LLM
  • MLOps
  • Nvidia Nsight
  • vLLM
  • TensorRT-LLM
  • Distributed Training
  • Parallel Computing

Возможные вопросы на собеседовании

Проверка понимания архитектуры памяти GPU и умения бороться с типичными проблемами производительности.

Расскажите, как вы диагностируете и устраняете memory bound проблемы в CUDA-ядрах? Какие метрики в Nsight Compute для вас приоритетны?

Важно для работы с распределенным обучением, указанным в требованиях.

В чем разница между Tensor Parallelism и Pipeline Parallelism? В каких случаях стоит отдавать предпочтение одному из методов при обучении LLM?

Проверка практического опыта оптимизации инференса.

Какие техники оптимизации инференса в vLLM или TRT-LLM вы считаете наиболее эффективными для снижения latency?

Оценка навыков системного программирования.

Как бы вы реализовали кастомный аллокатор памяти для GPU, чтобы минимизировать фрагментацию при частых операциях выделения/освобождения в PyTorch?

Проверка умения работать с инфраструктурными проблемами.

Как вы будете выявлять причины деградации производительности (regression) в кластере из нескольких сотен GPU?

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Похожие вакансии

Россия
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!