ML-инженер — RAG, LLM / VLM

Моделирование и цифровые двойники
Москва Опубликовано 5 августа 2026
Зарплата не указана
Полная занятость3–6 летАналитик
Зарплата не указана

Описание

ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»

Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.

О проекте

«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.

Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.

Чем предстоит заниматься

Свой RAG:

- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.

- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.

- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.

Развитие VLM:

- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.

- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.

- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.

Инференс и on-prem-развертывание:

- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.

- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.

- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.

Общее:

- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.

- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.

Что мы ждём

- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.

- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.

- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).

- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.

- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».

- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.

Будет плюсом

- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.

- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.

- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).

- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.

- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.

- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).

Мы предлагаем:

• Работу в высококомпетентной компании в команде профессионалов;

• Интересные масштабные проекты в промышленности;

• Трудоустройство в строгом соответствии с ТК РФ;

• Стабильную достойную официальную заработную плату + систему мотивации;

• Обучение и сертификацию сотрудников;

• Перспективы профессионального и карьерного роста;

• Современный комфортный офис класса А.

Описание

ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»

Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.

О проекте

«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.

Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.

Чем предстоит заниматься

Свой RAG:

- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.

- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.

- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.

Развитие VLM:

- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.

- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.

- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.

Инференс и on-prem-развертывание:

- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.

- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.

- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.

Общее:

- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.

- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.

Что мы ждём

- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.

- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.

- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).

- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.

- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».

- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.

Будет плюсом

- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.

- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.

- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).

- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.

- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.

- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).

Мы предлагаем:

• Работу в высококомпетентной компании в команде профессионалов;

• Интересные масштабные проекты в промышленности;

• Трудоустройство в строгом соответствии с ТК РФ;

• Стабильную достойную официальную заработную плату + систему мотивации;

• Обучение и сертификацию сотрудников;

• Перспективы профессионального и карьерного роста;

• Современный комфортный офис класса А.

Похожие вакансии

Бухгалтер участок заработная плата
Смирнов Кирилл Геннадиевич
69000 – 80500 руб.
Полная занятостьОпыт 1–3 года
Редактор-райтер в Рег.облако
Рунити
Зарплата не указана
Полная занятостьОпыт 3–6 лет
Full Stack TypeScript Developer / AI Integration
Кучера Александр Оскарович
150000 – 250000 руб.
Полная занятостьОпыт 3–6 лет
Финансовый менеджер
ЖАКЛИН
90000 – 120000 руб.
Полная занятостьОпыт 1–3 года
Go developer
Enjoypro
180000 – 330000 руб.
Полная занятостьОпыт 3–6 лет
Менеджер по документообороту и счетам
Онлайн-школа №1
от 53000 руб.
Полная занятостьОпыт 1–3 года