- Страна
- Россия
ML-инженер в команду данных синтеза речи
Работа в топовой технологической компании над флагманским продуктом (Алиса). Отличный соцпакет, работа с передовыми технологиями синтеза речи и огромными масштабами данных.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена необходимостью работы с петабайтами данных и спецификой аудио-домена. Требуется не только знание Python и ML, но и опыт построения высоконагруженных пайплайнов обработки данных.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Зарплаты в Яндексе для ML-инженеров обычно соответствуют верхнему децилю рынка РФ. Учитывая сложность задач и масштаб данных, компенсация будет конкурентной даже для опытных Senior-специалистов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
*🤍* ML-инженер в команду данных синтеза речи
Мы строим основу для следующего поколения технологий синтеза речи. Здесь петабайты аудио становятся голосом Алисы, переводом видео и аудиокнигами для миллионов людей. Ищем инженера, который поможет нам создать масштабную платформу данных для обучения речевых моделей и напрямую повлияет на их качество.
Леонид Курахтенков, руководитель группы данных синтеза речи
В синтезе наступила эпоха перехода от low resource к большим данным и претрейнам. Новые модели позволяют спеть песню или произнести любую фразу всего по нескольким секундам вашего голоса. Основа этих моделей — сотни тысяч часов качественных аудиоданных и текстов для них, которые нам предстоит собрать.
Какие задачи вас ждут:
• Работа с данными
Создавать систему эффективного хранения больших данных и доступа к ним для ML-разработчиков.
• Майнинг данных
Улучшать пропускную способность пайплайнов сбора данных, работать с разнородными источниками и строить процессы майнинга аудиоданных.
• Оценивание качества
Работать с процессами оценивания параметров данных, разрабатывать ML-модели детекции шума, музыки, языка, синтетической речи, несовпадения текста и аудио.
Мы ждём, что вы:
• Пишете на Python
• Строили пайплайны сбора данных для ML
• Понимаете, как работать с большими объёмами данных
• Применяли на практике, а лучше — обучали ML-модели
Почему у нас хорошо:
Мы предоставляем полный набор, который поможет уберечься от тревожности и выгорания: ежегодные медицинские чекапы, йога и психотерапия. Это не все бонусы — полный список тут.
*📩* Откликнуться на нашем сайте
#алиса_и_умные_устройства #бэкенд #python #удалённо #гибрид #офис
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- Machine Learning
- Data Pipelines
- Big Data
- Audio Processing
- ETL
Возможные вопросы на собеседовании
Проверка навыков проектирования систем обработки данных.
Как бы вы спроектировали систему хранения и быстрого доступа к петабайтам аудиоданных для обучения ML-моделей?
Оценка опыта работы с качеством данных в аудио-домене.
Какие признаки и методы вы бы использовали для автоматической детекции синтетической речи или несовпадения текста и аудио?
Проверка владения инструментами обработки больших данных.
С какими инструментами для построения ETL-пайплайнов вы работали и как обеспечивали их масштабируемость?
Оценка понимания специфики Deep Learning в аудио.
В чем основные сложности перехода от low-resource моделей к обучению на больших данных в задачах TTS (Text-to-Speech)?
Проверка навыков оптимизации.
Как оптимизировать пропускную способность пайплайна майнинга данных из разнородных источников?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

