ML Engineer / LLM Engineer
Высокотехнологичная роль с фокусом на самые актуальные технологии (LLM, RL, RAG). Отсутствие названия компании и вилки зарплаты немного снижает прозрачность, но стек технологий крайне привлекателен для профессионального роста.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Вакансия требует глубокой специализации в узкой нише LLM (RL, SFT, vLLM), что значительно сложнее стандартных задач Data Science. Кандидат должен обладать навыками как исследователя, так и инженера по внедрению.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Указанные требования соответствуют уровню Senior ML Engineer. На российском рынке для таких специалистов с глубоким знанием LLM и RL зарплаты существенно выше средних по IT-сектору.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
ML Engineer / LLM Engineer
Ищем ML-инженера с сильным практическим опытом работы с LLM: fine-tuning, post-training, evaluation и inference.
Важно: это не позиция классического ML Engineer / Data Scientist. Нужен кандидат, который самостоятельно обучал и адаптировал LLM и понимает полный цикл — от данных и обучения до evaluation и deployment.
Задачи:
- Разработка и улучшение пайплайна LLM post-training: SFT, preference optimization, Offline / Online RL;
- Улучшение instruction following и построение системы benchmarking / evaluation;
- Обучение LoRA / QLoRA-адаптеров под различные домены и задачи;
- Работа с reward models / verifiers и reward functions для RL;
- Разработка RAG-систем: retrieval, reranking, context construction и evaluation;
- Обучение и интеграция tool use / function calling / structured outputs;
- Оптимизация inference и serving моделей с использованием vLLM / SGLang;
Обязательные требования:
- Практический опыт fine-tuning / post-training LLM;
- Опыт с SFT и preference optimization: DPO / IPO / ORPO / SimPO или аналогами;
- Опыт или хорошее практическое понимание Online RL для LLM: GRPO / GSPO или аналогичных методов;
- Понимание reward models, preference data и LLM evaluation;
- Уверенное владение Python, PyTorch, Hugging Face Transformers;
- Опыт с TRL и/или verl;
- Опыт с LoRA / QLoRA / PEFT;
- Опыт inference / serving через vLLM и/или SGLang;
- Опыт разработки RAG, tool use или structured generation;
- Понимание архитектуры современных LLM и особенностей их обучения и inference;
- Опыт работы с GPU, distributed training и Linux / Docker / Git;
- Умение самостоятельно ставить эксперименты, выбирать метрики и анализировать результаты.
Будет плюсом:
- Continual / domain pre-training;
- Reasoning RL;
- Multilingual LLM или code generation;
- FSDP / DeepSpeed / Megatron-LM;
- Quantization и оптимизация inference.
Чтобы откликнуться, отправляйте резюме рекрутеру Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- LLM
- Machine Learning
- Python
- PyTorch
- Hugging Face Transformers
- SFT
- Reinforcement Learning
- DPO
- RAG
- vLLM
- Docker
- Git
- Linux
- DeepSpeed
- FSDP
- LoRA
Возможные вопросы на собеседовании
Проверка понимания современных методов выравнивания моделей.
В чем ключевое различие между DPO и традиционным PPO в контексте обучения LLM, и в каких случаях вы бы предпочли один метод другому?
Оценка практического опыта работы с эффективным инференсом.
Какие стратегии оптимизации в vLLM или SGLang вы использовали для снижения задержки (latency) при высоком параллелизме запросов?
Проверка навыков работы с данными для обучения.
Как вы подходите к фильтрации и подготовке данных для этапа SFT, чтобы избежать деградации модели или 'забывания' базовых знаний?
Оценка понимания архитектуры RAG.
Как вы оцениваете качество RAG-системы? Какие метрики используете для оценки этапа retrieval и этапа генерации отдельно?
Проверка опыта работы с RL и функциями вознаграждения.
С какими трудностями вы сталкивались при проектировании reward functions для Online RL (например, GRPO), и как боролись с reward hacking?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

