- Зарплата
- 600 $ – 800 $
Middle Data Engineer — Databricks / Python / LLM / Neo4j
Интересный стек технологий (LLM, Neo4j, Databricks) и удаленный формат работы. Однако заявленный уровень зарплаты ($600–$800) значительно ниже среднерыночного для Middle/Senior специалиста с таким набором навыков.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Улучшите резюме под эту вакансию
Возьмём требования и создадим новую версию резюме с акцентом на нужный опыт
Сложность вакансии
Роль требует не только классических навыков Data Engineering (Databricks, Azure, Python), но и специфического опыта работы с LLM и графовыми БД. Сложность заключается в необходимости обработки огромных массивов неструктурированных PDF-данных.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Анализ зарплаты
Предложенная зарплата ($600–$800) находится существенно ниже рыночных показателей для Middle Data Engineer с опытом в Databricks и LLM, где медиана обычно начинается от $3000. Вакансия может быть интересна для получения опыта в передовом стеке, но не соответствует финансовым ожиданиям опытных специалистов.
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.
Описание вакансии
Middle Data Engineer — Databricks / Python / LLM / Neo4j
We are looking for a Senior Data Engineer with strong Databricks, Python, and LLM pipeline experience to join a team turning large volumes of clinical-research documents into reliable, AI-ready data on Azure.
Company: Data Smart Solutions LLC
Role: Middle Data Engineer
Salary: $600 – $800 (Net) + performance-based bonus
Format: Remote
Core Requirements
- Strong hands-on experience with Databricks, especially Databricks Jobs
- Advanced Python skills, writing notebooks daily from ingestion to the gold layer
- Solid understanding of medallion architecture and how to define bronze / silver / gold boundaries
- Experience working with Delta tables
- Experience processing large volumes of PDF documents (100K+ files)
- Experience calling LLM endpoints from notebooks and tracking token usage and cost
- Experience with Azure cloud
- Ability to design and consolidate job orchestration pipelines
Nice to Have
- Experience with Neo4j or other graph databases
- Experience with healthcare or clinical-research data
- Experience building data layers consumed by AI agents
What You'll Work On
- Extracting and structuring data from large collections of clinical-research PDFs
- Building bronze, silver, and gold layers in Databricks with Python notebooks and Delta tables
- Integrating LLM endpoints into data pipelines and monitoring token spend
- Building a Neo4j graph alongside Delta tables for agents to query
- Preparing gold-layer data for an agentic layer used as an API tool
- Consolidating scattered and redundant Databricks job pipelines
For questions/inquiries: Откликнуться
Больше похожих вакансий + автоотклики с ИИ
Умный подбор, сопроводительные письма, советы по отказам — больше приглашений.

Навыки
- Databricks
- Python
- LLM
- Neo4j
- Azure
- Delta Lake
- ETL
- Orchestration
Возможные вопросы на собеседовании
Проверка понимания архитектурных принципов работы с данными в Databricks.
Расскажите о вашем опыте реализации медальонной архитектуры: как вы определяете границы между слоями Bronze, Silver и Gold?
Важная часть работы связана с интеграцией нейросетей в пайплайны.
Как вы организуете мониторинг потребления токенов и затрат при вызове LLM-эндпоинтов из ноутбуков Databricks?
Вакансия предполагает работу с Neo4j.
В каких сценариях, по вашему мнению, использование графовой БД Neo4j дает преимущество перед классическими Delta-таблицами для AI-агентов?
Работа с PDF-файлами в больших масштабах требует оптимизации.
Какие библиотеки и подходы вы используете для эффективного извлечения текста и структуры из 100к+ PDF-документов?
Оптимизация инфраструктуры — одна из задач.
Как вы подходите к консолидации разрозненных и избыточных пайплайнов в Databricks Jobs?
Сформировано ИИ автоматически. Не является проверкой вакансии или работодателя.

