ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер» Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem. О проекте «Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков. Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR. Чем предстоит заниматься Свой RAG: - Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация. - Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами. - Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна. Развитие VLM: - Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание. - Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения. - Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы. Инференс и on-prem-развертывание: - Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков. - Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку. - Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика. Общее: - Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности. - Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез. Что мы ждём - Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки. - Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации. - Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem). - Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс. - Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз». - Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения. Будет плюсом - Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна. - Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами. - Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder). - Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей. - Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA. - Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД). Мы предлагаем: • Работу в высококомпетентной компании в команде профессионалов; • Интересные масштабные проекты в промышленности; • Трудоустройство в строгом соответствии с ТК РФ; • Стабильную достойную официальную заработную плату + систему мотивации; • Обучение и сертификацию сотрудников; • Перспективы профессионального и карьерного роста; • Современный комфортный офис класса А.