ML-инженер — RAG, LLM / VLM

Моделирование и цифровые двойники
Москва •Опубликовано 5 августа 2026
Зарплата не указана
Полная занятость3–6 летАналитик
Зарплата не указана

Описание

ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»

Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.

О проекте

«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.

Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.

Чем предстоит заниматься

Свой RAG:

- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.

- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.

- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.

Развитие VLM:

- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.

- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.

- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.

Инференс и on-prem-развертывание:

- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.

- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.

- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.

Общее:

- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.

- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.

Что мы ждём

- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.

- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.

- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).

- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.

- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».

- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.

Будет плюсом

- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.

- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.

- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).

- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.

- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.

- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).

Мы предлагаем:

• Работу в высококомпетентной компании в команде профессионалов;

• Интересные масштабные проекты в промышленности;

• Трудоустройство в строгом соответствии с ТК РФ;

• Стабильную достойную официальную заработную плату + систему мотивации;

• Обучение и сертификацию сотрудников;

• Перспективы профессионального и карьерного роста;

• Современный комфортный офис класса А.

Описание

ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»

Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.

О проекте

«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.

Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.

Чем предстоит заниматься

Свой RAG:

- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.

- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.

- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.

Развитие VLM:

- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.

- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.

- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.

Инференс и on-prem-развертывание:

- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.

- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.

- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.

Общее:

- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.

- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.

Что мы ждём

- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.

- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.

- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).

- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.

- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».

- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.

Будет плюсом

- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.

- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.

- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).

- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.

- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.

- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).

Мы предлагаем:

• Работу в высококомпетентной компании в команде профессионалов;

• Интересные масштабные проекты в промышленности;

• Трудоустройство в строгом соответствии с ТК РФ;

• Стабильную достойную официальную заработную плату + систему мотивации;

• Обучение и сертификацию сотрудников;

• Перспективы профессионального и карьерного роста;

• Современный комфортный офис класса А.

Похожие вакансии

Менеджер по продажам в онлайн-школу
Егорова Дарья Ивановна
от 130000 руб.
Полная занятостьОпыт 1–3 года
Менеджер по продажам
Семенов Антон Петрович
80000 – 150000 руб.
Полная занятостьОпыт 1–3 года
Менеджер по продукту (координатор команды)
Оптимакрос
Зарплата не указана
Полная занятостьОпыт 1–3 года
Дизайнер рекламных креативов
ПЕРСОНАЛ
Зарплата не указана
Полная занятостьОпыт 1–3 года
Дизайнер по обработке фотографий
Гасанов Руслан Абидипович
от 50000 руб.
Полная занятостьОпыт 1–3 года
Оператор исходящих B2B-продаж (холодная база)
Т-Банк
от 70000 руб.
Полная занятостьОпыт 1–3 года