Team Lead в команде ML-инфраструктуры

180K ₽–320K ₽/мес
оценка на руки
Опубликовано 06.09.2026
Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снижать риски сбоев. Всё более востребованным становится обучение с подкреплением (Reinforcement Learning, RL) — появляется необходимость создания специализированной инфраструктуры. ### Задачи: - Оптимизация инфраструктуры RL-обучения. Вы будете оптимизировать доставку и сохранение данных, коммуникации между блоками обучения; повышать эффективность работы внутри блоков. - Развитие инструментов диагностики. Вам предстоит создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы. - Обеспечение отказоустойчивости инфраструктуры. Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к ошибкам и сбоям. - Исследование решений. Вам предстоит изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность, внедрять в реальные проекты. ### Требования: - Знание Python и опыт работы в системном программировании, разработке библиотек или фреймворков. - Умение работать с PyTorch и распределённым обучением через torch.distributed. - Владение подходами параллелизации. - Интерес к LLM и MLOps. - Способность эффективно работать в команде. ### Будет плюсом: - Участие в создании инфраструктуры обучения ML-моделей. - Опыт внедрения и оптимизации RL-решений. - Использование библиотек RL-обучения для LLM и библиотек инференса. - Опыт работы с GPU NVIDIA: понимание архитектуры GPU, разработка или оптимизация алгоритмов с использованием CUDA или Triton. - Владение C++ и опыт работы с низкоуровневым программированием и оптимизацией. ### Почему у нас хорошо: Нам важно здоровье сотрудников, поэтому в крупных офисах у нас есть спортзалы — с тренажёрами, инвентарём и душевыми. Это не все бонусы — полный список тут.
Обязательные
0/1
Желательные
0/1
Бонус
0/1
Почему эта вакансия
8.5
8.5 из 10
оценка совпадения

Кто здесь добьётся успеха

Глубокие знания и опыт работы с Python и PyTorch для разработки и оптимизации ML-моделей.

Способность к самостоятельной работе и управлению проектами в удалённом режиме, включая планирование задач и распределение ресурсов.

Опыт в MLOps и оптимизации инфраструктуры, включая использование технологий CUDA для повышения производительности вычислений.

Навыки в области обучения с подкреплением (Reinforcement Learning) и понимание специфики создания и поддержки специализированной инфраструктуры.

Ресурсы для обучения

Карьерный путь

ML-разработчик (Сейчас)Старший ML-инженер (1–2 года)Руководитель группы ML-инфраструктуры (3–5 лет)

Обзор рынка

Объём рынка 2026
$3.5B
Годовой рост
15.2%
Внедрение AI
75%
Инвестиции
+120%

Навыки и требования

Обязательные
PythonPyTorchMLOps
Растущий спрос
TensorFlowData EngineeringKubernetes
Снижающийся спрос
TheanoMapReduce

Тренды отрасли

Увеличение использования MLOps
Согласно исследованию, 65% компаний внедряют MLOps для оптимизации процессов разработки и развертывания моделей.
Рост популярности Reinforcement Learning
Ожидается, что использование методов обучения с подкреплением вырастет на 30% в 2025 году, особенно в играх и робототехнике.

Новости AI/Big Data

Загружаем новости отрасли...

Ищем релевантные статьи за последние 6 месяцев