- Страна
- Россия
- Зарплата
- 2 100 ₽ – 2 200 ₽
Инженер ML со знанием Go, Middle+, Senior
Интересный долгосрочный проект на острие технологий (LLM-агенты, GigaAMv2) с конкурентной ставкой. Требует уникального стека, что делает позицию привлекательной для высококвалифицированных специалистов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Вакансия требует редкого сочетания глубоких знаний в ML (LLM, ASR, TTS) и уверенного владения языком Go для разработки высоконагруженных сервисов. Высокая сложность обусловлена необходимостью оптимизации инференса под low-latency и работы с потоковым аудио в реальном времени.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предложенная ставка (около 350 000 - 450 000 руб. в месяц при полной занятости) соответствует верхнему сегменту рынка для Senior ML-инженеров в России, особенно учитывая требование по Go.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Инженер ML со знанием Go, Middle+, Senior
Срок - до 31.12.2026г. с возможной пролонгацией
Ставка до 2100 - 2200, с НДС
Локация - РФ
Часовой пояс: МСК +/- 3 часа
Требования
- Уверенный опыт работы с LLM/SLM (Few-shot learning, prompt engineering) и BERT (классификация сценариев и интентов);
- Практический опыт finetuning LLM (PEFT, LoRA/QLoRA) под узкие прикладные задачи;
- Уверенный дебаг LLM: умение быстро понять, почему модель ответила не так, и исправить это промптом, гиперпараметром или файнтюном;
- Опыт дообучения и оптимизации TTS-моделей;
- Опыт работы и интеграции современных ASR-систем (в частности, GigaAMv2);
- Опыт работы как с графовыми/сценарийными диалоговыми движками, так и с LLM-агентами;
- Высокая скорость диагностики проблем в инференсе, локализации багов и принятия инженерных решений;
- Уверенное владение Python (PyTorch, huggingface, фреймворки инференса) и Go;
- Опыт работы с оптимизацией инференса под low-latency (vLLM, TensorRT-LLM, Triton Inference Server, ONNX Runtime);
- Практика работы со потоковым аудио в реальном времени (streaming ASR/TTS, gRPC-контракты);
GoLang:
- Базовое понимание по дизайну сервисов;
- Понимание SOLID, DRY и KISS паттернов;
- Знание типизации в Go, хотя бы базовые типы (строки, числа, слайсы и мапы);
- Знание примитивов синхронизации и конкуренции (как синхронизировать горутины, как работать с каналами);
- Знание указателей и работы с ними;
- Observability;
- Будет плюсом: опыт работы с GRPC;
- Будет плюсом: умение настроить инфраструктуру, k8s/inventory, знания работы TCP.
Задачи
- Поэтапный перевод системы с графа сценариев и скиллов на управляемый LLM-based диалог;
- Дебаг голосового пайплайна (поиск причин high latency, галлюцинаций LLM, проблем с передачей аудио, графовых ошибок и т.п.);
- Оперативное принятие архитектурных решений и их самостоятельная реализация в коде;
- Поддержка и быстрая отладка few-shot классификации сценариев на базе Qwen и классификаторов на BERT;
- Учёт краевых случаев, исправление ошибочных срабатываний интентов;
- При необходимости — finetuning локальных LLM (извлечение сущностей, удерживание инструкций);
- Интеграция и поддержка ASR на базе GigaAMv2 (отладка качества распознавания, работы VAD и передачи текста дальше по пайплайну);
- Дообучение и настройка инференса собственных и опенсорсных TTS и систем клонирования голоса для достижения нужного качества звучания и скорости работы.
Откликнуться на запрос: Откликнуться
По вопросам партнерского сотрудничества: Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- LLM
- Go
- Python
- PyTorch
- Hugging Face
- BERT
- NLP
- ASR
- TTS
- gRPC
- Kubernetes
- ONNX Runtime
- TensorRT-LLM
- vLLM
- Triton Inference Server
- Docker
Возможные вопросы на собеседовании
Проверка опыта оптимизации производительности, критически важного для голосовых интерфейсов.
Какие методы оптимизации инференса LLM вы использовали для достижения low-latency в реальном времени?
Оценка навыков отладки и понимания работы языковых моделей.
Как вы будете диагностировать причину галлюцинаций или неверного следования инструкции в few-shot промптинге?
Проверка владения Go в контексте ML-инфраструктуры.
Как эффективно организовать передачу потокового аудио через gRPC на Go, минимизируя задержки и нагрузку на GC?
Оценка опыта в специфической области ASR.
С какими проблемами вы сталкивались при интеграции GigaAMv2 и как настраивали VAD для работы в шумной среде?
Проверка навыков дообучения моделей под конкретные задачи.
В каких случаях вы выберете PEFT/LoRA вместо обычного промпт-инжиниринга для извлечения сущностей?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

