Tech Lead NLP Engineer
Высокий балл обусловлен работой с самым современным стеком (H200, SGLang) и амбициозными задачами (модели 1T). Удаленный формат работы по всему миру делает вакансию крайне привлекательной для топовых специалистов, несмотря на отсутствие указанной зарплаты.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует исключительной технической экспертизы в области LLM inference и распределенных вычислений, а также опыта работы с редким и дорогостоящим оборудованием (H200). Уровень Tech Lead подразумевает не только глубокие знания SGLang/vLLM, но и способность принимать архитектурные решения для моделей объемом до 1T параметров.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Для позиции Tech Lead NLP такого уровня на мировом рынке зарплаты значительно превышают средние показатели по отрасли, особенно в компаниях, работающих с собственным GPU-парком. Учитывая сложность задач, ожидаемое вознаграждение должно находиться в верхнем дециле рынка AI-инженеров.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Tech Lead NLP Engineer
Местоположение: Весь мир
Формат работы: Удаленно
Опубликована: 05.10.2026
Требования:
• Глубокий опыт с SGLang / vLLM / TensorRT-LLM
• Опыт distributed inference, MoE, KV cache, quantization, RLHF/DPO
• Фокус на LLM inference, distributed GPU, training и post-training
О компании:
AI-продукт, где команда сама дообучает open-source модели (до 1T параметров) и развивает собственную ML-инфраструктуру: 32×H200 + AWS, SGLang в production.
Контакт: Откликнуться
Откликнуться опубликована в LinkedIn у Olga Novikova
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- NLP
- LLM
- SGLang
- vLLM
- TensorRT-LLM
- Distributed Inference
- MOE
- KV cache
- Quantization
- RLHF
- DPO
- GPU
- AWS
Возможные вопросы на собеседовании
Проверка практического опыта оптимизации инференса для сверхбольших моделей.
Какие стратегии оптимизации KV cache вы применяли для моделей с длинным контекстом в SGLang или vLLM?
Оценка навыков работы с распределенными системами и понимания архитектуры GPU.
Как бы вы организовали distributed inference для модели 1T параметров на кластере из 32xH200, чтобы минимизировать latency?
Проверка знаний в области дообучения и выравнивания моделей.
В каких случаях вы бы предпочли DPO вместо классического PPO при работе с вашими текущими задачами post-training?
Оценка опыта работы с квантованием.
Какие компромиссы между точностью и скоростью вы наблюдали при использовании различных методов квантования (например, AWQ vs FP8) на архитектуре Hopper?
Проверка понимания архитектуры MoE.
С какими специфическими проблемами при балансировке нагрузки экспертов (expert load balancing) вы сталкивались в MoE моделях?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

