- Страна
- Россия
Аналитик-разработчик в команду разметки и анализа данных Фантеха
Вакансия в топовой технологической компании с сильной инженерной культурой и интересными задачами на стыке аналитики и разработки. Отличный соцпакет и работа с продуктами, которыми пользуются миллионы людей.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует глубоких знаний математической статистики и теории вероятностей, а также уверенного владения Python и SQL. Дополнительную сложность придает необходимость работы с распределенными системами (MapReduce) и специфическими инструментами разметки.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Зарплата в Яндексе для данной роли обычно соответствует верхнему сегменту рынка для Middle/Senior специалистов. Учитывая сложность задач и требования к стеку, компенсация будет конкурентной, дополненной годовыми бонусами и опционами.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
*🖤* Аналитик-разработчик в команду разметки и анализа данных Фантеха
Привет! Меня зовут Лёша Царёв, и я руковожу командой разметки и анализа данных в Фантехе Яндекса. Наша команда занимается самыми разными задачами в области дата-майнинга для контентных сервисов, а именно Яндекс Музыки, Кинопоиска, Яндекс Книг и т. д. Я ищу аналитика-разработчика, который поможет нам сделать рекомендации и поиск в наших сервисах лучше за счёт осмысленной работы с данными.
*Алексей Царёв
Руководитель команды разметки и анализа данных*
Какие задачи вас ждут
• Строить и улучшать автоматические процессы разметки данных
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Можно ли включить этот сериал ребёнку? На эти и другие вопросы будет отвечать разметка, за которой будете стоять вы.
• Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше?
Мы ждём, что вы
• Хорошо владеете теорией вероятностей и математической статистикой
• Можете делать выводы на основе данных
• Умеете программировать на Python и SQL
• Понимаете, как работает интернет
Будет плюсом, если вы
• Работали с распределёнными системами хранения и обработки данных MapReduce
• Имеете опыт работы с ML
• Писали парсеры
• Работали с платформами для краудсорсинга: Label Studio, Toloka, Amazon Mechanical Turk и т. д.
Почему у нас хорошо:
Мы предоставляем полный набор, который поможет уберечься от тревожности и выгорания: ежегодные медицинские чекапы, йога и психотерапия. Это не все бонусы — полный список тут.
*📩* Откликнутьсяна нашем сайте
фантех #аналитика #python #SQL
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- SQL
- Mathematical Statistics
- Probability Theory
- MapReduce
- Machine Learning
- Label Studio
- Toloka
- Amazon Mechanical Turk
Возможные вопросы на собеседовании
Проверка фундаментальных знаний, необходимых для оценки качества данных.
Как бы вы оценили точность (precision) и полноту (recall) разметки, если у вас есть только небольшая эталонная выборка и миллионы неразмеченных объектов?
Оценка навыков работы с SQL в контексте больших данных.
Опишите ваш опыт оптимизации сложных SQL-запросов при работе с таблицами объемом в сотни миллионов строк.
Проверка понимания специфики работы с краудсорсингом.
С какими основными проблемами качества данных вы сталкивались при использовании Toloka или аналогичных платформ, и как вы их решали?
Оценка навыков автоматизации.
Расскажите, как бы вы спроектировали пайплайн для автоматической проверки контента на соответствие возрастному цензу (детский/взрослый)?
Проверка владения инструментами Big Data.
В каких случаях использование MapReduce предпочтительнее обычных скриптов обработки данных, и какие ограничения у этого подхода вы знаете?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

