Axis делает ИИ-продукты для управления себестоимостью строительства. «Проверка РД» работает с PDF и Excel: проводит нормоконтроль, проверяет спецификации и расчёты, сравнивает стадии и редакции документов. По каждому замечанию показывает лист-источник, цитату и логику проверки. Продукт уже работает у платящих клиентов и на пилотах. Команда — выходцы из Самолет, Autodesk, McKinsey, Сбера и МТС. Ищем AI-инженера, который будет отвечать за агентный контур продукта. Цель — дать методологу возможность описать новую проверку без разработки, а пользователю — получить проверяемый результат на своём комплекте документов. Агент должен сам найти нужные фрагменты, вызвать расчёты и справочники, запросить недостающие данные и вернуть таблицу или текст со ссылками на источники. Главный технический вызов — сделать агентов частью надёжной производственной системы, где ошибка влияет на решения по стройке. Модель работает с неоднородными документами, сохраняет состояние длительной проверки, отличает нехватку данных от расхождения и не подменяет код в расчётах. Роль находится на стыке агентной инженерии и backend-разработки. Вы будете выбирать модели и способ оркестрации, проектировать инструменты агента, строить оценку качества и разбирать ошибки на реальных запусках. Мы задаём продуктовую цель и ограничения; технические решения и путь к результату находятся в вашей зоне ответственности. За что отвечать - Качество агентных проверок в продукте: точность выводов, полноту, время выполнения и стоимость. - Цикл улучшения качества: собирать ошибки и исправления пользователей, превращать их в тесты, сравнивать модели и проверять изменения перед выпуском. - Надёжность выполнения: проверка не теряет состояние при сбое, умеет ждать недостающие данные и пересчитывает только то, что от них зависит. - Агентный движок: работа с контекстом, выбор следующего действия, вызов инструментов, типизированный результат и ограничения модели. - Развитие архитектуры без зависимости от одного фреймворка или поставщика модели. PydanticAI, LangGraph и другие компоненты оцениваем по качеству работы в продукте. Что мы ожидаем - Хороший Python и опыт эксплуатации backend-сервисов: API, асинхронные задачи, очереди, тесты, обработка ошибок. - Опыт с LLM и агентами в продакшене: вызов инструментов, управление контекстом, структурированный ответ, ограничения действий модели. - Умение получать и валидировать результат по JSON Schema, Pydantic или аналогичной схеме. - Опыт поиска по документам или RAG с обязательной привязкой ответа к источнику. - Опыт оценки качества LLM-систем: тестовые наборы, разбор ошибок, сравнение моделей и промптов. Будет плюсом - PydanticAI, LangGraph или другой фреймворк для LLM-агентов. - Temporal или другой движок долговременных процессов. - MCP, OpenTelemetry, Langfuse. - Локальные модели и развёртывание AI-сервисов в закрытом контуре. - Document AI: OCR, структура PDF, таблицы и координаты областей на листе.