Откликайтесь
на вакансии с ИИ

Senior Kernel Generation Engineer
Высокотехнологичная и актуальная роль в сфере AI-инфраструктуры с возможностью удаленной работы по всему миру. Вакансия предлагает работу над сложными инженерными задачами на острие технологий, что гарантирует профессиональный рост.
Сложность вакансии
Роль требует редкого сочетания глубоких знаний в области архитектуры нейросетей (LLM) и низкоуровневого программирования под специализированное железо (GPU/FPGA). Кандидат должен свободно владеть техниками оптимизации памяти и вычислительных конвейеров.
Анализ зарплаты
Зарплата в объявлении не указана, но для специалистов уровня Senior в области Kernel Engineering и AI-оптимизации рыночные ставки значительно выше средних по IT-рынку из-за дефицита кадров. В международном сегменте такие позиции оцениваются в диапазоне $120,000–$200,000 в год.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь уже сейчас
Отправьте свое резюме эксперту через LinkedIn, чтобы занять ключевую позицию в разработке высокопроизводительных AI-решений.
Описание вакансии
Senior Kernel Generation Engineer
#SeniorKernelGenerationEngineer #Удаленно
Требования:
Сильного инженера на стыке AI и hardware, который понимает, как устроен LLM inference на математическом и архитектурном уровне. LLM inference, attention, KV-cache, prefill/decode. Compute pipelines, memory hierarchy и data movement. Оптимизация kernels: tiling, fusion, buffering, scheduling. Большим плюсом будет опыт с FPGA / GPU / CUDA / Triton / TVM / MLIR / XLA и другими accelerator architectures.
Локация:*📍*Удалённо из любой точки мира.
Контакт для отклика: Откликнуться +CV
*👉*Откликнуться
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- LLM
- FPGA
- CUDA
- GPU Architecture
- Triton
- XLA
- MLIR
- TVM
- Kernel Optimization
- Attention Mechanism
- KV-cache
Возможные вопросы на собеседовании
Проверка понимания специфики работы LLM на низком уровне.
Как вы оптимизируете использование KV-cache для длинных последовательностей, чтобы минимизировать нагрузку на память?
Оценка навыков написания эффективных ядер.
В каких случаях kernel fusion может привести к деградации производительности вместо ожидаемого ускорения?
Проверка знаний архитектуры GPU.
Объясните разницу между стадиями prefill и decode в инференсе LLM с точки зрения использования пропускной способности памяти (memory bandwidth).
Оценка опыта работы с современными компиляторами.
Каков ваш опыт работы с MLIR или Triton для генерации кастомных ядер? Какие преимущества они дают по сравнению с чистым CUDA?
Проверка навыков оптимизации данных.
Как tiling помогает в борьбе с bank conflicts и как правильно рассчитать размер тайла для конкретной архитектуры?
Похожие вакансии
GenAI-разработчик / бизнес-аналитик
AI Engineer (Multi-Agent Systems & RAG) (Senior)
Python AI Engineer (Senior)
Senior ML-инженер
AI-разработчик (Senior)
Senior / Middle AI Engineer (Computer Vision)
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!