- Страна
- Россия
ML-инженер (LLM / Python)
Привлекательное предложение благодаря очень мощному железу и оплате 'выше рынка'. Однако формат работы (офис/гибрид) и необходимость очного теста могут подойти не всем.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Высокая сложность обусловлена работой в закрытом контуре (Air-Gapped), что требует автономности, а также необходимостью прохождения очного тестового задания в офисе. Требуются глубокие знания специфических инструментов квантования и инференса LLM.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Работодатель заявляет оплату 'выше рынка' в кэше или криптовалюте. Для Senior ML-специалиста в Москве с фокусом на LLM рыночный диапазон составляет 400-600 тысяч рублей, что соответствует заявленным ожиданиям.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Вакансия: ML-инженер (LLM / Python)
Мы в поиске Senior / Middle+ ML-инженера на аналитический проект.
Работа в офисе (Москва), оффлайн-контур (Air-Gapped). Мощнейшее железо: Mac Studio 512GB + Ubuntu (NVIDIA RTX PRO 6000 96GB).
Обязательные требования:• Python, vLLM, Ollama, llama.cpp.
• Опыт локального развертывания LLM-моделей (Llama-3, Qwen) и работы с форматами GGUF / FP8 / AWQ.
Будет плюсом:• Опыт дообучения (Fine-Tuning, LoRA, QLoRA) и построения RAG-систем (ChromaDB / Qdrant).
• Умение писать парсеры (Selenium, Playwright).
**Формат работы: офис / гибрид (Москва)
Есть тестовое задание, для его выполнения необходимо подъехать в офис.**
Оплата: кэш/крипта, выше рынка.
Узнать подробности и отправить резюме: Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- vLLM
- Ollama
- llama.cpp
- Llama-3
- Qwen
- GGUF
- FP8
- AWQ
- Fine-tuning
- LoRA
- QLoRA
- RAG
- ChromaDB
- Qdrant
- Selenium
- Playwright
Возможные вопросы на собеседовании
Важно понять, как кандидат справляется с ограничениями изолированной среды без доступа к внешним репозиториям.
Как вы организуете процесс разработки и управления зависимостями в Air-Gapped окружении?
Проверка практического опыта оптимизации моделей для работы на конкретном железе.
В каких случаях вы выберете формат GGUF вместо AWQ для инференса на NVIDIA RTX PRO 6000?
RAG — ключевая часть аналитических систем на базе LLM.
Как вы оцениваете качество работы RAG-системы и какие стратегии чанкинга данных предпочитаете для технических текстов?
Проверка навыков оптимизации ресурсов при дообучении.
В чем принципиальная разница между LoRA и QLoRA с точки зрения потребления видеопамяти и качества итоговой модели?
vLLM — основной инструмент в стеке вакансии.
Как настроить vLLM для обеспечения максимальной пропускной способности (throughput) при одновременной обработке нескольких запросов?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

