Что за роль
В компании YADRO открыта вакансия Senior LLM Inference Backend Engineer. Вы будете заниматься проектированием и поддержкой высоконагруженного GPU-кластера инференса для десятков тысяч пользователей.
Чем вы будете заниматься
- Проектирование и поддержка GPU-кластера инференса (Nvidia): скалирование, балансировка и приоритизация запросов.
- Оптимизация производительности: кэширование, батчинг и другие методы.
- Обеспечение надежности и observability: SLA и предотвращение регрессий.
- Разработка AI-сервисов: AI Code Assistant, AI Chat, AI Code Review.
- Интеграция AI-сервисов в корпоративную среду.
- Проведение экспериментов и создание MVP для новых технологий.
Требования
- Опыт разработки на Python (5+ лет), знание стандартов: typing, асинхронность.
- Опыт создания высоконагруженных API (FastAPI или аналоги).
- Опыт работы с инструментами инференса (vLLM, SGLang, OpenAI API).
- Глубокие знания в области LLM и инференса.
Вакансия предлагает интересные задачи в области AI и высоконагруженных систем. Однако, отсутствие информации о зарплате может быть минусом.
Кто здесь добьётся успеха
Глубокие знания Python и FastAPI для разработки высокопроизводительных RESTful API, а также опыт работы с библиотеками для оптимизации работы GPU, такими как PyTorch или TensorFlow.
Способность к самостоятельной работе и самоорганизации в удаленном или гибридном формате, что включает в себя умение эффективно управлять своим временем и приоритетами для достижения результатов.
Опыт проектирования и поддержки масштабируемых GPU-кластеров, включая навыки работы с Nvidia и оптимизации через методы кэширования и батчинга для повышения производительности.
Понимание архитектуры LLM и vLLM, а также навыки работы с SGLang для разработки и интеграции моделей в кластер, что позволяет эффективно обрабатывать запросы от множества пользователей.
Ресурсы для обучения
Карьерный путь
Обзор рынка
Навыки и требования
Тренды отрасли
Новости AI
Загружаем новости отрасли...
Ищем релевантные статьи за последние 6 месяцев