- Страна
- Великобритания
Откликайтесь
на вакансии с ИИ

Research Engineer - Inference
ElevenLabs — один из самых ярких и быстрорастущих ИИ-единорогов в мире. Работа над передовыми моделями с огромной аудиторией и возможность удаленной работы в ключевых хабах делают эту вакансию крайне привлекательной для топовых инженеров.
Сложность вакансии
Высокая сложность обусловлена необходимостью глубоких знаний как в области машинного обучения, так и в системном программировании для оптимизации инференса на продакшн-уровне. Требуется опыт работы с высоконагруженными системами и специфическими стеками для LLM.
Анализ зарплаты
Указанная роль в ElevenLabs предполагает компенсацию выше среднего по рынку, особенно для локаций в США и Великобритании. Для Senior Research Engineer в сфере AI/ML рыночные вилки часто начинаются от $150k и могут достигать $250k+ без учета опционов.
Сопроводительное письмо
Составьте идеальное письмо к вакансии с ИИ-агентом

Откликнитесь в elevenlabs уже сейчас
Присоединяйтесь к лидерам в области генеративного ИИ и оптимизируйте модели, которыми пользуются миллионы — откликайтесь прямо сейчас!
Описание вакансии
Published time: 2026-08-29
Company name: ElevenLabs
Title: Research Engineer - Inference
Grades: middle, middle+, senior
Job description: Join ElevenLabs' research team to deploy and optimize frontier AI models in production. You will own the systems that carry a research checkpoint through to serving infrastructure used by millions, and optimize inference latency, throughput and cost across the stack.
Location: UK, Bulgaria, Poland, USA
Anywhere: No
Remote: Yes
Forbidden locations: Outside UK, Bulgaria, Poland and USA
Tags:
#ai #machine_learning #inference #llm #python #research_engineer #remote #full_time #middle #uk #poland #bulgaria #usa
Создайте идеальное резюме с помощью ИИ-агента

Навыки
- Python
- PyTorch
- Machine Learning
- LLM
- Distributed Systems
- CUDA
- Inference Optimization
Возможные вопросы на собеседовании
Проверка понимания архитектурных решений для ускорения работы моделей.
Какие методы оптимизации инференса LLM (например, квантование, дистилляция, спекулятивное декодирование) вы бы применили для снижения задержки в реальном времени?
Оценка навыков работы с инфраструктурой и железом.
Как вы подходите к профилированию узких мест в производительности при работе с GPU-кластерами?
Проверка опыта работы с конкретными фреймворками для обслуживания моделей.
Был ли у вас опыт работы с vLLM, TensorRT-LLM или Triton Inference Server? Какие плюсы и минусы вы выделили для ваших задач?
Важно для ElevenLabs, так как они работают с аудио.
В чем заключаются основные сложности оптимизации инференса для авторегрессионных моделей по сравнению с классическими CNN?
Оценка умения балансировать между качеством и стоимостью.