yandex
С
Сбер
Страна
Россия
+500% приглашений

Откликайтесь
на вакансии с ИИ

Ускорим процесс поиска работы
В офисеПолная занятость

Data Engineer for VLM Training Data (GigaChat Vision)

ИИОценка ИИ

Это позиция в одном из самых передовых AI-проектов России (GigaChat). Работа с уникальными масштабами данных и современным стеком (VLM, YTsaurus) обеспечивает колоссальный профессиональный рост, а бренд Сбера гарантирует стабильность и конкурентный соцпакет.


Вакансия из Quick Offer Global, списка международных компаний
Пожаловаться

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Высокая сложность обусловлена необходимостью работы с колоссальными объемами данных (десятки миллиардов объектов) и специфическим стеком технологий, включая YTsaurus. Требуется глубокое понимание как классического Data Engineering, так и специфики подготовки данных для мультимодальных моделей (VLM).

Анализ зарплаты

Медиана400 000 ₽
Рынок300 000 ₽ – 550 000 ₽
ИИОценка ИИ

Зарплата в объявлении не указана, однако для позиций уровня Senior Data Engineer в BigTech компаниях Москвы (таких как Сбер, Яндекс, VK) рыночные предложения обычно находятся в диапазоне 300 000 – 500 000 рублей. Учитывая уникальность домена VLM, компенсация может быть выше среднего.

Сопроводительное письмо

Меня крайне заинтересовала вакансия Data Engineer в команду GigaChat Vision. Мой опыт построения отказоустойчивых пайплайнов обработки данных и работы с распределенными системами хранения, такими как S3 и YTsaurus, идеально соответствует вашим задачам по подготовке данных для обучения VLM. Я обладаю глубокими знаниями Python и имею практический опыт работы с инструментами версионирования данных (DVC), что критически важно для воспроизводимости ML-экспериментов.

Особенно меня привлекает масштаб задач — работа с десятками миллиардов изображений требует не только инженерной точности, но и инновационного подхода к фильтрации и генерации синтетических данных. Я готов применять свои навыки для оптимизации процессов очистки и дедупликации, чтобы обеспечить ML-команду данными высочайшего качества. Уверен, что мой опыт на стыке Data Engineering и ML Research принесет значительную пользу развитию GigaChat.

+250% к просмотрам

Составьте идеальное письмо к вакансии с ИИ-агентом

Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь в Сбер уже сейчас

Присоединяйтесь к команде GigaChat Vision и создавайте будущее мультимодальных моделей в Сбере!

Описание вакансии

Data Engineer for VLM Training Data (GigaChat Vision)

#офис

Москва

Компания: Сбер

*🔹*Обязанности

-Собирать и структурировать потребности ML-команды в данных: какие данные нужны для обучения, дообучения, оценки и улучшения VLM.

-Предлагать и реализовывать идеи пайплайнов очистки, фильтрации, дедупликации, категоризации и генерации данных.

-Ориентироваться в современных практиках построения датасетов для Vision-Language Models: image-text pairs, synthetic data, filtering, quality scoring, data mixture design, dataset versioning.

-Отвечать за инфраструктуру хранения и подготовки данных, включая:

импорт данных из различных источников: production, Common Crawl, open-source datasets, generated data;

валидацию и контроль качества данных;

хранение и версионирование датасетов;

экспорт данных в форматы, пригодные для обучения моделей.

-Проектировать и реализовывать пайплайны обработки данных на большом масштабе, включая десятки миллиардов изображений.

-Разрабатывать пайплайны генерации синтетических данных для обучения и улучшения VLM.

-Собирать статистику по данным, строить отчёты и визуализации для анализа состава, качества и покрытия датасетов.

-Обеспечивать воспроизводимость, наблюдаемость и надёжность data-процессов.

-Работать в тесной связке с ML-инженерами, исследователями и инфраструктурной командой.

*🔹*Требования

-Сильный опыт в data engineering и построении production-grade data pipelines.

-Уверенное владение Python, включая multiprocessing, multithreading и async-подходы.

-Опыт работы с большими объёмами данных и распределённой обработкой.

-Практический опыт с объектными хранилищами, в частности S3 или аналогами.

-Опыт работы с YTsaurus или похожими системами для распределённого хранения и обработки данных.

-Понимание принципов валидации, очистки, дедупликации и версионирования датасетов.

-Опыт работы с DVC, Git, Docker.

-Опыт работы с PostgreSQL или другими реляционными базами данных.

-Умение проектировать устойчивые пайплайны: от импорта данных до финального экспорта в training-ready формат.

-Способность самостоятельно разбираться в нечетко сформулированных задачах и доводить их до работающего решения.

-Готовность работать на стыке engineering и ML research.

Откликнуться

IT Jobs в Telegram | в VK | в Max

+400% к собеседованиям

Создайте идеальное резюме с помощью ИИ-агента

Создайте идеальное резюме с помощью ИИ-агента

Навыки

  • Git
  • Python
  • PostgreSQL
  • Data Engineering
  • Docker
  • Data Pipelines
  • DVC
  • S3
  • asyncio
  • YTsaurus
  • Vision Language Models
  • Multiprocessing

Возможные вопросы на собеседовании

Проверка опыта работы с масштабируемыми системами, критически важными для Сбера.

Расскажите о вашем опыте работы с YTsaurus или аналогичными системами распределенной обработки данных. С какими основными трудностями вы сталкивались при масштабировании?

Важно понять, как кандидат обеспечивает качество данных для обучения моделей.

Какие стратегии дедупликации и фильтрации изображений и текстов вы бы предложили для датасета объемом в несколько миллиардов пар?

Проверка навыков работы с инструментами воспроизводимости в ML.

Как вы организовывали версионирование данных в своих прошлых проектах? В чем, по-вашему, основные преимущества и недостатки DVC в связке с S3?

Оценка инженерной грамотности в Python.

В каких случаях при обработке данных вы предпочтете multiprocessing вместо asyncio, и как вы будете бороться с накладными расходами на сериализацию данных?

Проверка понимания специфики VLM.

Как бы вы спроектировали пайплайн генерации синтетических данных для улучшения понимания моделью пространственных отношений на изображениях?

Похожие вакансии

T
TopSelection
210 000 ₽ – 250 000 ₽

Senior Data Scientist

SeniorУдалённо
Python · PySpark · Pandas · SQL · LightGBM · CatBoost · XGBoost · TensorFlow · PyTorch · Scikit-learn · Optuna · MLflow · Docker · Time Series · MLOps
+15 навыков
NDA
300 000 ₽ – 320 000 ₽

Data Scientist (Senior)

SeniorУдалённо
Python · SQL · PySpark · ETL · CI/CD · Machine Learning · Statistics · A/B Testing · Airflow · Docker · Kubernetes · Git
+12 навыков
O
Ozon
Не указана

Руководитель Data Science команды (Анализ спроса в маркетплейсе)

LeadУдалённо
Python · PySpark · SQL · Pandas · PyTorch · Transformers · Machine Learning · Deep Learning · Gradient Boosting · Time Series Forecasting
+10 навыков
TS
Top Selection
300 000 ₽ – 320 000 ₽

Data Scientist

SeniorУдалённо
Python · Data Science · Machine Learning
+3 навыков
TS
Top Selection
250 000 ₽ – 270 000 ₽

Data engineer

MiddleУдалённо
Hadoop · Spark · Hive · Azure · Yandex Cloud · ETL · Airflow · Azure Data Factory · PostgreSQL · ClickHouse · SQL · Python · Great Expectations · DWH · Data Lake
+15 навыков
T
TopSelection
210 000 ₽ – 250 000 ₽

Сеньор-датасаентист в команду ML-разработки

SeniorУдалённо
Python · PySpark · Pandas · SQL · LightGBM · CatBoost · XGBoost · TensorFlow · PyTorch · Scikit-learn · Optuna · MLflow · Docker · Time Series · OOP
+15 навыков
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!

С
Сбер
Россия