Старший инженер инфраструктуры — GPU платформа
О позиции
Вам предстоит работа в качестве старшего инженера инфраструктуры на платформе GPU. Вы будете заниматься разработкой и поддержкой многонодовой инфраструктуры для обучения с использованием графических процессоров (GPU).
Чем вы будете заниматься
- Работа с многонодовой инфраструктурой для обучения на GPU.
- Использование и настройка Linux, контейнеров, CUDA и стека NVIDIA GPU.
- Устранение неполадок с использованием NCCL и InfiniBand или RoCE/RDMA.
- Глубокая работа с Kubernetes или Slurm.
- Автоматизация инфраструктуры и обеспечение её наблюдаемости.
- Диагностика проблем в рабочих нагрузках обучения, сетях, хранилищах и GPU-хостах.
- Лидерство в инцидентах и взаимодействие с поставщиками.
Требования
- Опыт работы с многонодовой инфраструктурой для обучения на GPU.
- Знание Linux, контейнеров, CUDA и стека NVIDIA GPU.
- Практический опыт работы с NCCL и InfiniBand или RoCE/RDMA.
- Глубокие знания Kubernetes или Slurm.
- Опыт автоматизации инфраструктуры и обеспечения её наблюдаемости.
- Способность диагностировать проблемы в рабочих нагрузках, сетях, хранилищах и GPU-хостах.
- Коммуникационные навыки на уровне Upper-Intermediate или выше.
Будет плюсом
- Опыт работы в AI-лаборатории, HPC-среде или специализированном облаке GPU.
- Знание PyTorch, Megatron, DeepSpeed или других фреймворков для распределенного обучения.
- Опыт работы с параллельным хранилищем и оптимизацией контрольных точек.
- Опыт работы с многопровайдерными платформами GPU.
Что мы предлагаем
- Конкурентоспособная заработная плата.
- Гибкий график работы.
- Удалённая работа.
- Возможности для профессионального роста и развития.
Кто здесь добьётся успеха
Глубокие знания Linux и опыт работы с системами на базе CUDA для оптимизации производительности GPU, включая настройку и поддержку многонодовых кластеров.
Способность эффективно работать в удалённой команде, демонстрируя проактивность и самодисциплину, что особенно важно при удалённой работе в условиях гибридной инфраструктуры.
Опыт в использовании инструментов управления контейнерами, таких как Kubernetes, для развертывания и управления приложениями, основанными на GPU, с акцентом на автоматизацию и масштабируемость.
Знание технологий передачи данных, таких как InfiniBand и RoCE, для обеспечения высокой пропускной способности и низкой задержки в многонодовых системах, что критично для задач машинного обучения.
Ресурсы для обучения
Карьерный путь
Обзор рынка
Навыки и требования
Тренды отрасли
Новости AI/Big Data
Загружаем новости отрасли...
Ищем релевантные статьи за последние 6 месяцев