- Страна
- Россия
Senior LLM Inference Backend Engineer
YADRO — сильный технологический бренд. Вакансия предлагает работу с передовым стеком (LLM, GPU кластеры) и создание востребованных продуктов (Co-Pilot), что гарантирует профессиональный рост и интересные задачи.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует редкого сочетания глубокого бэкенд-опыта (5+ лет) и специфических знаний в области LLM-инференса (vLLM, SGLang, GPU-оптимизация). Высокая планка ответственности за инфраструктуру для десятков тысяч пользователей повышает сложность позиции.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Зарплата в объявлении не указана, однако для позиции Senior Backend Engineer с узкой специализацией в LLM Inference на российском рынке медиана составляет около 400,000 - 500,000 рублей. YADRO обычно предлагает конкурентоспособные условия, соответствующие верхним границам рынка для опытных инженеров.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
YADRO
Senior LLM Inference Backend Engineer
Опыт работы: 3–6 лет
Полная занятость
График: 5/2
Формат работы: удалённо или гибрид
*☑️* Чем предстоит заниматься
-Инфраструктура и высоконагруженный инференс (Platform Engineering):
-Проектирование и поддержка GPU-кластера инференса (Nvidia) для десятков тысяч пользователей: скалирование, балансировка и приоритизация запросов, пользовательские лимиты
-Оптимизация производительности: кэширование, батчинг, etc.
-Надежность и observability: обеспечение SLA и предотвращение регрессий
-Оценка и внедрение новых LLM
-Продуктовая разработка (LLM Application):
-Разработка AI-сервисов: AI Code Assistant (Co-Pilot), AI Chat, AI Code Review
-Проектирование пайплайнов автоматизаций: tool/function calling, обработка ошибок, управление контекстом/состоянием
-Интеграции: встраивание AI-сервисов в корпоративную среду (API, БД, legacy-системы)
-Исследования и прототипирование (R&D):
-Проведение экспериментов, создание MVP и выстраивание пути доведения до продакшена
-Исследование новых технологий и подходов для улучшения продуктов
*☑️* Наши пожелания к кандидатам
-Экспертиза в Python & Backend:
-Опыт разработки на Python (5+ лет), знание стандартов: typing, асинхронность, паттерны проектирования
-Опыт создания высоконагруженных API (FastAPI или аналоги), работа с очередями, воркерами и фоновыми задачами
-Архитектура и надежность (Production):
-Опыт построения gateway/router, управление ключами, маршрутизация, пользовательские лимиты
-Опыт поддержки высоконагруженных сервисов в продакшене: стабильность контрактов, обработка ошибок
-Глубокие знания LLM & Inference:
-Опыт работы с инструментами инференса (vLLM, SGLang, OpenAI API), понимание их внутренней работы
-Опыт настройки инференса под highload: latency/throughput, управление GPU-ресурсами
-Опыт построения решений с tool/function calling: MCP, guardrails, борьба с галлюцинациями
Контакты: Откликнуться
*🔥* Подписаться на наши каналы / Откликнуться / Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Python
- FastAPI
- LLM
- vLLM
- SGLang
- GPU
- NVIDIA
- API
- R&D
- Asynchronous Programming
Возможные вопросы на собеседовании
Проверка понимания механизмов оптимизации пропускной способности и задержек при работе с LLM.
Расскажите о вашем опыте оптимизации vLLM или SGLang для высоконагруженных систем. Какие параметры батчинга и кэширования KV-кэша вы использовали?
Важно понять, как кандидат обеспечивает стабильность системы при резких скачках нагрузки.
Как бы вы спроектировали систему приоритизации запросов и пользовательских лимитов в GPU-кластере для предотвращения отказа всей системы?
Оценка практического опыта работы с агентами и надежностью ответов моделей.
С какими проблемами вы сталкивались при реализации tool/function calling и как боролись с галлюцинациями модели в продакшене?
Проверка навыков проектирования масштабируемых API.
Опишите архитектуру API-шлюза для LLM, который должен поддерживать десятки тысяч пользователей. Какие паттерны асинхронности здесь наиболее критичны?
Оценка R&D навыков и умения доводить MVP до стабильного продукта.
Каков ваш процесс перевода экспериментального LLM-пайплайна в стадию продакшена с соблюдением SLA?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

