- Страна
- Россия
ML-инженер (проект по обезличиванию данных)
Интересный проект в актуальной нише защиты данных с использованием современных библиотек (SDV, Transformers). Формат ИП и удаленная работа — это плюс, но отсутствие указанной вилки зарплаты снижает прозрачность.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Вакансия требует специфического опыта работы с генеративными моделями для табличных данных (CTGAN, TVAE) и глубоких знаний в NLP (NER). Также необходимы навыки MLOps для вывода моделей в продакшен.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Для ML-инженера с опытом от 3 лет и навыками в области синтетических данных и NLP рыночная вилка в России составляет от 250 000 до 400 000 рублей. Данная позиция соответствует уровню Senior или крепкого Middle+.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
#ML #инженер #DataScience #remote #удаленно #Москва #РФ
По сотрудничеству в формате ИП ищем на проект ML-инженера (проект по обезличиванию данных), проект долгосрочный
-Опыт работы от 3 лет в роли ML-инженера / Data Scientist
- Опыт разработки и внедрения ML-моделей в продакшен.
- Python, pandas, numpy, scikit-learn.
- Опыт работы с NLP-инструментами: SpaCy, Hugging Face Transformers
- Практический опыт построения пайплайнов обработки неструктурированных данных.
- Очистка, нормализация, feature engineering
- Извлечение сущностей (NER).
- Понимание и опыт применения деревьев решений и ансамблей (Random Forest).
- Умение интерпретировать результаты, подбирать гиперпараметры, оценивать риски переобучения.
- Опыт работы с CTGAN и TVAE (библиотека SDV или аналоги): обучение, подбор гиперпараметров.
- Privacy-проверки
- Контейнеризация (Docker)
- Развертывание моделей через API (FastAPI/Flask).
-Версионирование моделей и данных (MLflow/DVC)
- Понимание CI/CD-процессов
Писать в ТГ Откликнуться
Спасибо!
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- Pandas
- NumPy
- Scikit-learn
- NLP
- spaCy
- Hugging Face
- Transformers
- NER
- Random Forest
- CTGAN
- TVAE
- SDV
- Docker
- FastAPI
- Flask
- MLflow
- DVC
- CI/CD
Возможные вопросы на собеседовании
Проект посвящен обезличиванию данных, поэтому важно понимать, как кандидат оценивает качество синтетики.
Какие метрики вы используете для оценки качества синтетических данных, сгенерированных с помощью CTGAN или TVAE?
NER является ключевым этапом в задачах деидентификации.
Как вы подходите к задаче извлечения персональных данных (PII) в неструктурированных текстах с использованием SpaCy или Transformers?
Вакансия предполагает работу с конфиденциальными данными.
Какие методы Privacy-проверок (например, Differential Privacy) вы применяли на практике?
Требуется опыт внедрения в продакшен.
Расскажите о вашем опыте построения CI/CD пайплайнов для ML-моделей с использованием DVC и MLflow.
Проект долгосрочный и требует стабильных решений.
С какими основными проблемами вы сталкивались при обучении GAN-моделей на табличных данных и как их решали?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

