Senior ML Engineer | Kimchi (LLM Inference Optimization)
Высокий балл обусловлен работой в передовой области (LLM Optimization), известным брендом CAST AI и возможностью удаленной работы с оплатой в валюте. Это отличная возможность для профессионального роста в AI-инфраструктуре.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует глубокой экспертизы в узкой области оптимизации LLM и инференса. Кандидат должен обладать не только навыками ML, но и пониманием системного программирования и облачной инфраструктуры.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предлагаемая позиция Senior уровня в международной компании предполагает зарплату выше среднего по рынку РФ, соответствующую глобальным стандартам для ML-инженеров. Указанный диапазон отражает текущие реалии для специалистов по оптимизации инференса в Европе и США.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Senior ML Engineer | Kimchi (LLM Inference Optimization) в CAST AI: Откликнуться
Можно работать удалённо. Зарплата в валюте.
При отклике укажите, что нашли вакансию на Remocate.
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- LLM
- Machine Learning
- Deep Learning
- PyTorch
- TensorFlow
- Inference Optimization
- Cloud Computing
Возможные вопросы на собеседовании
Проверка понимания фундаментальных методов ускорения моделей.
Какие методы квантования LLM вы считаете наиболее эффективными для продакшена и почему?
Оценка опыта работы с конкретными инструментами оптимизации.
Расскажите о вашем опыте работы с TensorRT-LLM или vLLM: с какими узкими местами вы сталкивались?
Проверка навыков оптимизации ресурсов, что критично для CAST AI.
Как бы вы подошли к задаче минимизации задержки (latency) при сохранении высокой пропускной способности (throughput) для LLM?
Оценка архитектурного мышления.
В чем заключаются основные сложности при реализации спекулятивного декодирования (speculative decoding) в распределенной среде?
Проверка навыков работы с облачной инфраструктурой.
Как вы оцениваете влияние выбора типа GPU инстанса на стоимость и производительность инференса конкретной модели?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

