yandex
Страна
Россия
ГибридПолная занятость

Middle / Senior Data Scientist (команда LLM Core)

ИИОценка ИИ

Авито — один из лучших работодателей в РФ с сильной инженерной культурой. Вакансия предлагает работу над передовыми LLM-технологиями, доступ к мощному железу и отличный соцпакет, включая ДМС и бюджет на обучение.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.


Вакансия из открытого источника
Пожаловаться
+400% приглашений от HR

Улучшите резюме под эту вакансию

Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Высокая сложность обусловлена требованиями к глубоким знаниям архитектуры Transformer, опыта работы с LLM (SFT, RLHF, квантование) и навыками оптимизации инференса на больших масштабах. Требуется не только исследовательский, но и сильный инженерный бэкграунд.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Анализ зарплаты

Медиана450 000 ₽
Рынок350 000 ₽ – 650 000 ₽
ИИОценка ИИ

Зарплата в объявлении не указана, однако для позиций Middle+/Senior Data Scientist в области LLM в Москве рыночный диапазон составляет от 350 000 до 600 000 рублей и выше, в зависимости от квалификации и бонусов. Авито обычно предлагает конкурентоспособные условия, соответствующие верхней границе рынка.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Сопроводительное письмо

Составьте сопроводительное письмо под эту вакансию с вашим резюме

Иллюстрация сопроводительного письмаИллюстрация сопроводительного письма

Описание вакансии

Middle / Senior Data Scientist (команда LLM Core)

*🏢* Компания: Авито

*🌍* Формат: Удалённая работа или офис/гибрид (Москва)

О компании:

Авито — крупная российская платформа объявлений: более 230 млн активных объявлений и месячная аудитория свыше 72 млн пользователей. Платформа охватывает товары, авто, недвижимость и услуги; в компании работает более 10 000 сотрудников.

Задачи:

• Формулировать и проверять гипотезы по pre-training, continual pre-training, post-training, RL и синтетическим данным.

• Вести сложные исследовательские и инженерные задачи — от метрик и дизайна экспериментов до реализации и внедрения.

• Масштабировать обучение и инференс: профилировать узкие места, оптимизировать квантованием и speculative decoding.

• Строить надёжные процедуры оценки качества, анализ ошибок, проектировать датасеты и метрики.

• Писать production-код на Python и PyTorch, проводить code review и улучшать воспроизводимость экспериментов.

• Менторить коллег и участвовать в архитектурных обсуждениях и внутренних LLM-семинарах.

Требования:

• Не менее 3 лет опыта реализации и эксплуатации ML-решений.

• Глубокое понимание современных ML-алгоритмов, Transformer и принципов обучения LLM.

• Практический опыт обучения, адаптации или внедрения NLP‑моделей и умение превращать идеи в проверяемые эксперименты.

• Уверенное владение Python и PyTorch, хорошее знание инженерных практик разработки.

• Умение работать с неопределённостью: декомпозировать проблему, выбирать метрики и анализировать результаты.

• Понимание компромиссов между качеством, latency, throughput и стоимостью.

Будет плюсом:

• Опыт с continual pre-training, заменой или расширением токенизатора, SFT, LoRA или RL-подходами.

• Опыт распределённого обучения или оптимизации инференса (DeepSpeed, vLLM, SGLang, TensorRT-LLM).

• Построение пайплайнов оценки качества, синтетических датасетов и систем автоматического анализа ошибок.

• Работа с MLOps-инструментами: Weights & Biases, MLflow, DVC.

• Публикации, участие в open source или достижения в соревнованиях по ML.

Стек:

Python, PyTorch, LLM, Transformer, RL, LoRA, SFT, tokenizers, DeepSpeed, vLLM, SGLang, TensorRT-LLM, speculative decoding, Weights & Biases, MLflow, DVC

Условия:

• Влияние на продукт и решения, которые увидят миллионы пользователей.

• Сложные технологические задачи на большом масштабе и доступ к производительным GPU-кластерам.

• Сильное профессиональное комьюнити и регулярные LLM‑семинары.

• Бюджет на обучение, курсы, конференции и профессиональную литературу.

• ДМС со стоматологией с первого дня; в офисе принимают терапевт и массажист.

• Гибкость: удалённо или из офисов в нескольких городах России.

*📩* Откликнуться

Больше похожих вакансий + автоотклики с ИИ

Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Больше похожих вакансий + автоотклики с ИИ

Навыки

  • Python
  • PyTorch
  • LLM
  • Transformer
  • Reinforcement Learning
  • LoRA
  • SFT
  • DeepSpeed
  • vLLM
  • SGLang
  • TensorRT-LLM
  • Weights & Biases
  • MLflow
  • DVC
  • NLP
  • MLOps

Возможные вопросы на собеседовании

Проверка понимания механизмов внимания и их влияния на производительность.

Расскажите о различиях между Multi-Head Attention, Grouped-Query Attention и Multi-Query Attention. В каких случаях стоит использовать каждый из них?

Оценка опыта оптимизации моделей для продакшена.

Какие методы оптимизации инференса LLM вы применяли на практике (например, Speculative Decoding, KV-caching, квантование)? Какого прироста throughput удалось достичь?

Проверка навыков работы с данными для обучения.

Как вы подходите к генерации и фильтрации синтетических данных для этапа SFT или Continual Pre-training? Какие метрики качества данных вы используете?

Оценка опыта распределенного обучения.

С какими проблемами вы сталкивались при использовании DeepSpeed или FSDP для обучения моделей с миллиардами параметров и как их решали?

Проверка понимания процессов дообучения.

В чем заключаются основные сложности при расширении токенизатора для специфического домена или языка в уже обученной модели?

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Похожие вакансии

Россия
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!