yandex
N
NDA
Удалённо

ML Engineer / LLM Engineer

ИИОценка ИИ

Высокотехнологичная роль с фокусом на самые актуальные технологии (LLM, RL, RAG). Отсутствие названия компании и вилки зарплаты немного снижает прозрачность, но стек технологий крайне привлекателен для профессионального роста.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.


Вакансия из открытого источника
Пожаловаться
+400% приглашений от HR

Улучшите резюме под эту вакансию

Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Вакансия требует глубокой специализации в узкой нише LLM (RL, SFT, vLLM), что значительно сложнее стандартных задач Data Science. Кандидат должен обладать навыками как исследователя, так и инженера по внедрению.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Анализ зарплаты

Медиана450 000 ₽
Рынок350 000 ₽ – 600 000 ₽
ИИОценка ИИ

Указанные требования соответствуют уровню Senior ML Engineer. На российском рынке для таких специалистов с глубоким знанием LLM и RL зарплаты существенно выше средних по IT-сектору.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Сопроводительное письмо

Составьте сопроводительное письмо под эту вакансию с вашим резюме

Иллюстрация сопроводительного письмаИллюстрация сопроводительного письма

Описание вакансии

ML Engineer / LLM Engineer

Ищем ML-инженера с сильным практическим опытом работы с LLM: fine-tuning, post-training, evaluation и inference.

Важно: это не позиция классического ML Engineer / Data Scientist. Нужен кандидат, который самостоятельно обучал и адаптировал LLM и понимает полный цикл — от данных и обучения до evaluation и deployment.

Задачи:

  • Разработка и улучшение пайплайна LLM post-training: SFT, preference optimization, Offline / Online RL;
  • Улучшение instruction following и построение системы benchmarking / evaluation;
  • Обучение LoRA / QLoRA-адаптеров под различные домены и задачи;
  • Работа с reward models / verifiers и reward functions для RL;
  • Разработка RAG-систем: retrieval, reranking, context construction и evaluation;
  • Обучение и интеграция tool use / function calling / structured outputs;
  • Оптимизация inference и serving моделей с использованием vLLM / SGLang;

Обязательные требования:

  • Практический опыт fine-tuning / post-training LLM;
  • Опыт с SFT и preference optimization: DPO / IPO / ORPO / SimPO или аналогами;
  • Опыт или хорошее практическое понимание Online RL для LLM: GRPO / GSPO или аналогичных методов;
  • Понимание reward models, preference data и LLM evaluation;
  • Уверенное владение Python, PyTorch, Hugging Face Transformers;
  • Опыт с TRL и/или verl;
  • Опыт с LoRA / QLoRA / PEFT;
  • Опыт inference / serving через vLLM и/или SGLang;
  • Опыт разработки RAG, tool use или structured generation;
  • Понимание архитектуры современных LLM и особенностей их обучения и inference;
  • Опыт работы с GPU, distributed training и Linux / Docker / Git;
  • Умение самостоятельно ставить эксперименты, выбирать метрики и анализировать результаты.

Будет плюсом:

  • Continual / domain pre-training;
  • Reasoning RL;
  • Multilingual LLM или code generation;
  • FSDP / DeepSpeed / Megatron-LM;
  • Quantization и оптимизация inference.

Чтобы откликнуться, отправляйте резюме рекрутеру Откликнуться

Больше похожих вакансий + автоотклики с ИИ

Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Больше похожих вакансий + автоотклики с ИИ

Навыки

  • LLM
  • Machine Learning
  • Python
  • PyTorch
  • Hugging Face Transformers
  • SFT
  • Reinforcement Learning
  • DPO
  • RAG
  • vLLM
  • Docker
  • Git
  • Linux
  • DeepSpeed
  • FSDP
  • LoRA

Возможные вопросы на собеседовании

Проверка понимания современных методов выравнивания моделей.

В чем ключевое различие между DPO и традиционным PPO в контексте обучения LLM, и в каких случаях вы бы предпочли один метод другому?

Оценка практического опыта работы с эффективным инференсом.

Какие стратегии оптимизации в vLLM или SGLang вы использовали для снижения задержки (latency) при высоком параллелизме запросов?

Проверка навыков работы с данными для обучения.

Как вы подходите к фильтрации и подготовке данных для этапа SFT, чтобы избежать деградации модели или 'забывания' базовых знаний?

Оценка понимания архитектуры RAG.

Как вы оцениваете качество RAG-системы? Какие метрики используете для оценки этапа retrieval и этапа генерации отдельно?

Проверка опыта работы с RL и функциями вознаграждения.

С какими трудностями вы сталкивались при проектировании reward functions для Online RL (например, GRPO), и как боролись с reward hacking?

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Похожие вакансии

N
NDA
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!