Описание
ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»
Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.
О проекте
«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.
Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.
Чем предстоит заниматься
Свой RAG:
- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.
- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.
- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.
Развитие VLM:
- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.
- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.
- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.
Инференс и on-prem-развертывание:
- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.
- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.
- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.
Общее:
- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.
- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.
Что мы ждём
- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.
- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.
- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).
- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.
- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».
- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.
Будет плюсом
- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.
- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.
- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).
- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.
- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.
- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).
Мы предлагаем:
• Работу в высококомпетентной компании в команде профессионалов;
• Интересные масштабные проекты в промышленности;
• Трудоустройство в строгом соответствии с ТК РФ;
• Стабильную достойную официальную заработную плату + систему мотивации;
• Обучение и сертификацию сотрудников;
• Перспективы профессионального и карьерного роста;
• Современный комфортный офис класса А.
ML-инженер — RAG, VLM и on-prem инференс для «Нейроинженер»
Ищем самостоятельного ML-инженера с реальным опытом в RAG, LLM/VLM и разворачивании моделей, который будет строить собственный retrieval-пайплайн, развивать визуальную модель под инженерную документацию и готовить систему к работе on-prem.
О проекте
«Нейроинженер» — платформа для инженеров: чат с анализом технической документации (ГОСТ, ISO, ПНАЭ и др.) на базе RAG и LLM. Система индексирует документы, читает чертежи и сканы визуальной моделью (VLM), отвечает на инженерные вопросы со ссылками на источники, выполняет расчёты. Сейчас в приоритете — уход от «коробочного» RAG к собственному пайплайну, развитие VLM и подготовка к on-prem-развертыванию у корпоративных заказчиков.
Стек: Python 3.12, FastAPI; Yandex Cloud (LLM/Embeddings/Vector Stores), OpenAI SDK; ChromaDB (локально); PostgreSQL, Redis, Docker. Модели: YandexGPT, OS, Qwen-VL (VLM), эмбеддинги, OCR.
Чем предстоит заниматься
Свой RAG:
- Разработка собственного пайплайна retrieval: чанкинг под техдокументацию (таблицы, спецификации, ГОСТ-структура), эмбеддинги, векторный поиск, реранкинг, дедупликация.
- Улучшение качества поиска: кросс-язычный retrieval (RU/EN), обработка таблиц (линеаризация), гибридный поиск, работа с длинными и неструктурированными документами.
- Построение eval-контура: gold-set, метрики релевантности/точности цитат/полноты, борьба с галлюцинациями, A/B прогоны на изменениях пайплайна.
Развитие VLM:
- Прикладная работа с VLM: чтение чертежей (КМД/КМ), извлечение атрибутов из сканов, оптимизация и развертывание.
- Тюнинг пайплайна распознавания: рендер-параметры (dpi/zoom/лимиты по мегапикселям), промптинг, стабильность на пограничных случаях, оценка точности извлечения.
- Поиск и внедрение более сильных VL-моделей и подходов под инженерные документы.
Инференс и on-prem-развертывание:
- Подготовка продукта к работе в закрытом контуре заказчика: локальный self-hosted инференс LLM/VLM/эмбеддингов без внешних облаков.
- Развертывание и оптимизация моделей на оборудовании клиента: подбор моделей под доступные GPU/ресурсы, квантизация, батчинг, оптимизация latency и throughput под целевую нагрузку.
- Настройка серверов инференса (vLLM/TGI/ Ollama и аналоги), упаковка в контейнеры, воспроизводимое развертывание, оценка требований к оборудованию под заказчика.
Общее:
- Интеграция моделей в прод-сервис (async FastAPI), метрики и мониторинг качества и производительности.
- Эксперименты → воспроизводимые замеры → выкатка. Самостоятельная приоритезация гипотез.
Что мы ждём
- Опыт ML/NLP от 3 лет, из них практический опыт с RAG (retrieval, эмбеддинги, векторные БД, реранкинг) — с пониманием, что внутри, а не только через готовые фреймворки.
- Опыт работы с LLM и/или VLM в проде: промптинг, ограничения контекста, оценка качества генерации.
- Опыт разворачивания и оптимизации моделей: self-hosted инференс, квантизация, ускорение, оценка ресурсов — в идеале на стороне заказчика / в закрытом контуре (on-prem).
- Уверенный Python, умение писать прод-код (а не только вайбкодинг), async — плюс.
- Культура измерения качества и производительности: eval retrieval и генерации, профилирование latency/throughput, интерпретация результатов, а не «на глаз».
- Самостоятельность: взять размытую задачу, декомпозировать, поставить эксперимент, довести до внедрения.
Будет плюсом
- Дообучение моделей: LoRA/QLoRA, PEFT, подготовка датасетов, оценка после файнтюна.
- Опыт с серверами инференса (vLLM/TGI/ Ollama), оптимизацией под GPU, квантизацией (GPTQ/AWQ/GGUF), работой с ограниченными ресурсами.
- Опыт с векторными БД (ChromaDB, pgvector, Yandex Vector Stores) и реранкерами (cross-encoder).
- Работа с VL-моделями (Qwen-VL, LLaVA и аналоги), OCR, обработкой PDF/сканов/чертежей.
- Знание экосистемы: PyTorch, Hugging Face (transformers, sentence-transformers), CUDA.
- Технический бэкграунд или интерес к инженерной документации (ГОСТ, ЕСКД).
Мы предлагаем:
• Работу в высококомпетентной компании в команде профессионалов;
• Интересные масштабные проекты в промышленности;
• Трудоустройство в строгом соответствии с ТК РФ;
• Стабильную достойную официальную заработную плату + систему мотивации;
• Обучение и сертификацию сотрудников;
• Перспективы профессионального и карьерного роста;
• Современный комфортный офис класса А.