- Страна
- Россия
Откликайтесь
на вакансии с ИИ

ML-инженер в команду аудиоязыковых моделей
Это позиция в топовой технологической компании с возможностью работать над передовыми R&D задачами. Отличный соцпакет и работа над продуктом (Алиса), которым пользуются миллионы людей, делают вакансию крайне привлекательной.
Сложность вакансии
Вакансия требует глубокой экспертизы в области LLM и мультимодальных моделей, а также навыков работы с аудио-данными. Высокий порог входа обусловлен необходимостью проводить сложные исследования и работать с масштабной инфраструктурой обучения.
Анализ зарплаты
Яндекс обычно предлагает зарплаты на уровне или выше верхнего дециля рынка для ML-специалистов такого уровня, дополняя их значительным пакетом бонусов и опционов. Указанные рыночные оценки соответствуют уровню Senior ML Engineer в России.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь в Яндекс уже сейчас
Присоединяйтесь к команде Яндекса и создавайте аудиоязыковые модели нового поколения для Алисы!
Описание вакансии
*🔎 ML-инженер в команду аудиоязыковых моделей*
Наша команда обучает аудиоязыковые модели нового поколения. Мы хотим, чтобы одна модель могла понимать звучащий вокруг мир: речь, интонацию, настроение собеседника, фоновые события, музыку, шумы и другие сигналы. Ищем ML-инженера, который сможет влиять на архитектуру, обучение и качество моделей: от исследовательских гипотез до работающих пайплайнов.
Какие задачи вас ждут:
• Обучение аудиоязыковых моделейУчаствовать в полном цикле обучения моделей: претрейне, SFT и GRPO. Проектировать эксперименты, анализировать качество, находить слабые места моделей и улучшать их на сложных срезах данных.
• Исследование архитектур и рецептов обученияРазбираться в современных подходах к LLM, audio encoders, speech/audio understanding, multimodal alignment и обучению моделей по reward-сигналам. Следить за развитием области, обсуждать идеи с командой и проверять гипотезы.
• Работа с данными и метриками качестваУчаствовать в построении датасетов, формулировать задачи для обучения и оценки, выбирать метрики для разных сценариев.
• Развитие исследовательской и инженерной инфраструктурыСледить за качеством реализации: воспроизводимые эксперименты, эффективные пайплайны, стабильное обучение, анализ логов, оптимизация узких мест и аккуратная работа с большими вычислениями.
Мы ждём, что вы:• Обучали LLM или мультимодальные модели
• Понимаете полный цикл ML-разработки
• Умеете разбираться в ML-статьях, формулировать на их основе гипотезы, проводить эксперименты и делать выводы
• Готовы отвечать за направление, архитектурные решения или крупный исследовательский трек
Будет плюсом, если вы:• Работали с аудио, речевыми технологиями, ASR, TTS, speaker/audio understanding или audio representation learning
• Обучали мультимодальные модели или применяли SFT, RLHF, DPO, GRPO и другие методы посттрейна
Наши бонусы:Мы заботимся о детях яндексоидов и устраиваем детские дни в офисе. Это не все бонусы — полный список тут.
*📩* Откликнуться на нашем сайте
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- LLM
- Multimodal Models
- SFT
- GRPO
- Audio Encoders
- Speech Understanding
- Multimodal Alignment
- ASR
- TTS
- RLHF
- DPO
- Python
- PyTorch
Возможные вопросы на собеседовании
Проверка понимания специфики аудио-данных в контексте LLM.
Какие основные подходы к мультимодальному выравниванию (alignment) аудио и текстовых эмбеддингов вы считаете наиболее эффективными?
Оценка опыта работы с современными методами оптимизации моделей.
В чем заключаются ключевые отличия и преимущества использования GRPO по сравнению с традиционным PPO при обучении моделей по reward-сигналам?
Проверка инженерных навыков и работы с инфраструктурой.
Как вы обеспечиваете стабильность и воспроизводимость при обучении моделей на очень больших кластерах GPU?
Оценка навыков анализа качества.
Какие метрики, помимо стандартных WER/CER, вы бы предложили для оценки качества понимания настроения и фоновых событий в аудиоязыковой модели?
Проверка способности к исследовательской деятельности.
Расскажите о последней прочитанной вами ML-статье по теме аудио или мультимодальности: какую гипотезу вы бы проверили на её основе?
Похожие вакансии
Senior / Middle AI Engineer (Computer Vision)
AI-product engineer
Head of AI
AI/ML-разработчик (Computer Vision + LLM)
Специалист по генерации изображений с ИИ
AI-ИНЖЕНЕР (MIDDLE+)
1000+ офферов получено
Устали искать работу? Мы найдём её за вас
Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!