yandex
Y
YADRO
Страна
Россия
SeniorУдалённоПолная занятость

Senior LLM Inference Backend Engineer

ИИОценка ИИ

YADRO — сильный технологический бренд. Вакансия предлагает работу с передовым стеком (LLM, GPU кластеры) и создание востребованных продуктов (Co-Pilot), что гарантирует профессиональный рост и интересные задачи.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.


Вакансия из открытого источника
Пожаловаться
+400% приглашений от HR

Улучшите резюме под эту вакансию

Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт

Сложность вакансии

ЛегкоСложно
ИИОценка ИИ

Роль требует редкого сочетания глубокого бэкенд-опыта (5+ лет) и специфических знаний в области LLM-инференса (vLLM, SGLang, GPU-оптимизация). Высокая планка ответственности за инфраструктуру для десятков тысяч пользователей повышает сложность позиции.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Анализ зарплаты

Медиана450 000 ₽
Рынок350 000 ₽ – 600 000 ₽
ИИОценка ИИ

Зарплата в объявлении не указана, однако для позиции Senior Backend Engineer с узкой специализацией в LLM Inference на российском рынке медиана составляет около 400,000 - 500,000 рублей. YADRO обычно предлагает конкурентоспособные условия, соответствующие верхним границам рынка для опытных инженеров.

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Сопроводительное письмо

Составьте сопроводительное письмо под эту вакансию с вашим резюме

Иллюстрация сопроводительного письмаИллюстрация сопроводительного письма

Описание вакансии

#senior #удаленка #гибрид

YADRO

Senior LLM Inference Backend Engineer

Опыт работы: 3–6 лет

Полная занятость

График: 5/2

Формат работы: удалённо или гибрид

*☑️* Чем предстоит заниматься

-Инфраструктура и высоконагруженный инференс (Platform Engineering):

-Проектирование и поддержка GPU-кластера инференса (Nvidia) для десятков тысяч пользователей: скалирование, балансировка и приоритизация запросов, пользовательские лимиты

-Оптимизация производительности: кэширование, батчинг, etc.

-Надежность и observability: обеспечение SLA и предотвращение регрессий

-Оценка и внедрение новых LLM

-Продуктовая разработка (LLM Application):

-Разработка AI-сервисов: AI Code Assistant (Co-Pilot), AI Chat, AI Code Review

-Проектирование пайплайнов автоматизаций: tool/function calling, обработка ошибок, управление контекстом/состоянием

-Интеграции: встраивание AI-сервисов в корпоративную среду (API, БД, legacy-системы)

-Исследования и прототипирование (R&D):

-Проведение экспериментов, создание MVP и выстраивание пути доведения до продакшена

-Исследование новых технологий и подходов для улучшения продуктов

*☑️* Наши пожелания к кандидатам

-Экспертиза в Python & Backend:

-Опыт разработки на Python (5+ лет), знание стандартов: typing, асинхронность, паттерны проектирования

-Опыт создания высоконагруженных API (FastAPI или аналоги), работа с очередями, воркерами и фоновыми задачами

-Архитектура и надежность (Production):

-Опыт построения gateway/router, управление ключами, маршрутизация, пользовательские лимиты

-Опыт поддержки высоконагруженных сервисов в продакшене: стабильность контрактов, обработка ошибок

-Глубокие знания LLM & Inference:

-Опыт работы с инструментами инференса (vLLM, SGLang, OpenAI API), понимание их внутренней работы

-Опыт настройки инференса под highload: latency/throughput, управление GPU-ресурсами

-Опыт построения решений с tool/function calling: MCP, guardrails, борьба с галлюцинациями

Контакты: Откликнуться

*🔥* Подписаться на наши каналы / Откликнуться / Откликнуться

Больше похожих вакансий + автоотклики с ИИ

Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Больше похожих вакансий + автоотклики с ИИ

Навыки

  • Python
  • FastAPI
  • LLM
  • vLLM
  • SGLang
  • GPU
  • NVIDIA
  • API
  • R&D
  • Asynchronous Programming

Возможные вопросы на собеседовании

Проверка понимания механизмов оптимизации пропускной способности и задержек при работе с LLM.

Расскажите о вашем опыте оптимизации vLLM или SGLang для высоконагруженных систем. Какие параметры батчинга и кэширования KV-кэша вы использовали?

Важно понять, как кандидат обеспечивает стабильность системы при резких скачках нагрузки.

Как бы вы спроектировали систему приоритизации запросов и пользовательских лимитов в GPU-кластере для предотвращения отказа всей системы?

Оценка практического опыта работы с агентами и надежностью ответов моделей.

С какими проблемами вы сталкивались при реализации tool/function calling и как боролись с галлюцинациями модели в продакшене?

Проверка навыков проектирования масштабируемых API.

Опишите архитектуру API-шлюза для LLM, который должен поддерживать десятки тысяч пользователей. Какие паттерны асинхронности здесь наиболее критичны?

Оценка R&D навыков и умения доводить MVP до стабильного продукта.

Каков ваш процесс перевода экспериментального LLM-пайплайна в стадию продакшена с соблюдением SLA?

Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

Похожие вакансии

Y
YADRO
Россия
более 1000 офферов получено
4.9

1000+ офферов получено

Устали искать работу? Мы найдём её за вас

Quick Offer улучшит ваше резюме, подберёт лучшие вакансии и откликнется за вас. Результат — в 3 раза больше приглашений на собеседования и никакой рутины!