AI / LLM Inference Engineer

Ключевые ИТ Решения
Москва •Опубликовано 9 августа 2026
Зарплата не указана
Полная занятостьболее 6 летАналитик
Зарплата не указана

Описание

ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры.

Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков.

Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов.

Что предстоит делать:

  • запускать LLM и другие модели на GPU-инфраструктуре;
  • подбирать конфигурацию под модель, оборудование и профиль нагрузки;
  • работать с vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогичными решениями;
  • проводить бенчмарки и нагрузочное тестирование;
  • анализировать latency, throughput, TTFT, потребление GPU-памяти и загрузку ускорителей;
  • разбираться с OOM, низкой производительностью и нестабильной работой моделей;
  • настраивать batching, длину контекста, KV-cache, precision, quantization и parallelism;
  • участвовать в проработке продукта: определять необходимые параметры запуска, метрики и сценарии управления AI-нагрузками;
  • вместе с командами разработки и инфраструктуры запускать решение в контуре заказчика.

Что для нас важно:

  • практический опыт запуска и оптимизации моделей на GPU;
  • опыт работы хотя бы с одним inference engine: vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогом;
  • понимание влияния настроек инференса на latency, throughput и потребление GPU-памяти;
  • опыт проведения бенчмарков и анализа производительности;
  • умение диагностировать OOM, низкую загрузку GPU и деградацию производительности;
  • уверенная работа с Linux, Docker и Python;
  • понимание архитектуры современных LLM;
  • умение анализировать проблему по логам, метрикам и результатам тестов.

Будет плюсом:

  • опыт запуска Qwen, Llama, Mistral или других открытых моделей;
  • знание CUDA и инструментов профилирования GPU;
  • опыт работы с Kubernetes и GPU-операторами;
  • понимание MIG, MPS и других механизмов распределения GPU-ресурсов;
  • опыт построения ML- или AI-платформ;
  • опыт работы с OpenStack;
  • опыт в MLOps: model serving, CI/CD, мониторинг и autoscaling;
  • знание Prometheus, Grafana, GitLab CI, Terraform или Ansible.

Технологический контур:

OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible.

Условия:

— график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар)

— бессрочный трудовой договор.

— бонусная система, включая проектные премии.

— ДМС, программы психологической поддержки.

— компания оплачивает обучение и сертификацию.

— преимущества работы в IT-компании.

Описание

ITKey разрабатывает инфраструктурные решения для крупных корпоративных заказчиков. Основной технологический контур компании: OpenStack, Kubernetes, Linux и инструменты автоматизации инфраструктуры.

Сейчас мы создаём новый продукт для запуска и эксплуатации AI-моделей на GPU-инфраструктуре заказчиков.

Ищем инженера с практическим опытом запуска готовых моделей на GPU. Основной фокус роли: подобрать конфигурацию, проверить её под нагрузкой, найти ограничения и настроить инференс под требования к скорости, стабильности и потреблению ресурсов.

Что предстоит делать:

  • запускать LLM и другие модели на GPU-инфраструктуре;
  • подбирать конфигурацию под модель, оборудование и профиль нагрузки;
  • работать с vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогичными решениями;
  • проводить бенчмарки и нагрузочное тестирование;
  • анализировать latency, throughput, TTFT, потребление GPU-памяти и загрузку ускорителей;
  • разбираться с OOM, низкой производительностью и нестабильной работой моделей;
  • настраивать batching, длину контекста, KV-cache, precision, quantization и parallelism;
  • участвовать в проработке продукта: определять необходимые параметры запуска, метрики и сценарии управления AI-нагрузками;
  • вместе с командами разработки и инфраструктуры запускать решение в контуре заказчика.

Что для нас важно:

  • практический опыт запуска и оптимизации моделей на GPU;
  • опыт работы хотя бы с одним inference engine: vLLM, Triton Inference Server, TensorRT-LLM, TGI или аналогом;
  • понимание влияния настроек инференса на latency, throughput и потребление GPU-памяти;
  • опыт проведения бенчмарков и анализа производительности;
  • умение диагностировать OOM, низкую загрузку GPU и деградацию производительности;
  • уверенная работа с Linux, Docker и Python;
  • понимание архитектуры современных LLM;
  • умение анализировать проблему по логам, метрикам и результатам тестов.

Будет плюсом:

  • опыт запуска Qwen, Llama, Mistral или других открытых моделей;
  • знание CUDA и инструментов профилирования GPU;
  • опыт работы с Kubernetes и GPU-операторами;
  • понимание MIG, MPS и других механизмов распределения GPU-ресурсов;
  • опыт построения ML- или AI-платформ;
  • опыт работы с OpenStack;
  • опыт в MLOps: model serving, CI/CD, мониторинг и autoscaling;
  • знание Prometheus, Grafana, GitLab CI, Terraform или Ansible.

Технологический контур:

OpenStack, Kubernetes, Docker, Linux, NVIDIA GPU, Python, Prometheus, Grafana, GitLab CI, Terraform, Ansible.

Условия:

— график работы 5/2 с возможностью удалённого участия( офис у м. Цветной бульвар)

— бессрочный трудовой договор.

— бонусная система, включая проектные премии.

— ДМС, программы психологической поддержки.

— компания оплачивает обучение и сертификацию.

— преимущества работы в IT-компании.

Похожие вакансии

МЕНЕДЖЕР ПО ЛОГИСТИКЕ | УДАЛЁННО | СИБИРЬ
Зелёная миля
от 200000 руб.
Полная занятостьОпыт 1–3 года
Специалист по публикации объявлений на онлайн-площадках
Богатырев Иван Иванович
60000 – 80000 руб.
Полная занятостьОпыт не требуется
Менеджер по продажам в онлайн-школу
Егорова Дарья Ивановна
от 130000 руб.
Полная занятостьОпыт 1–3 года
AI-тренер для обучения нейросетей
Яндекс Крауд
до 133000 руб.
Полная занятостьОпыт 1–3 года
Руководитель отдела маркетинга и рекламы
Staffberry
от 200000 руб.
Полная занятостьОпыт 3–6 лет
Дизайнер по обработке фотографий
Гасанов Руслан Абидипович
от 50000 руб.
Полная занятостьОпыт 1–3 года