О позиции
Мы ищем ML-разработчика (Inference) для работы в команде Yandex Cloud. Ваша основная задача будет заключаться в оптимизации инференса больших языковых моделей (LLM) и разработке высокопроизводительных систем. Вы сможете сосредоточиться на различных направлениях, таких как производительность, дистрибуция и низкоуровневая оптимизация.
Чем вы будете заниматься
- Оптимизация throughput и latency при генерации LLM, внедрение техник, таких как speculative decoding и KV-cache.
- Разработка распределённых систем для инференса, интеграция с Kubernetes и поддержка multi-node-сценариев.
- Работа с CUDA/Triton-kernels, профилирование и оптимизация памяти.
- Разработка API и SDK для автоматизации развёртывания моделей.
- Поддержка on-prem-сценариев у клиентов и интеграция с облачной инфраструктурой.
Требования
- Понимание устройства трансформеров и LLM-инференса.
- Опыт оптимизации под GPU: CUDA/Triton, профилирование.
- Знание PyTorch, JAX, TensorRT, HuggingFace TGI или vLLM.
- Навыки разработки на Python и одном из системных языков (C++ или Go).
- Опыт работы с высоконагруженными сервисами (Kubernetes, gRPC).
Будет плюсом
- Опыт работы с балансировщиками и автоматическим масштабированием.
- Знание технологий NVLink и RDMA.
Что мы предлагаем
- Конкурентная зарплата и возможность работать в гибридном формате.
- Доступ к современным технологиям и инструментам.
- Возможность профессионального роста и участия в интересных проектах.
- Дружелюбная команда и поддержка коллег.
Вакансия предлагает интересные задачи в области ML и возможность работать с современными технологиями. Однако, описание вакансии могло бы быть более детализированным.
Кто здесь добьётся успеха
Глубокие знания CUDA и PyTorch, позволяющие оптимизировать производительность инференса больших языковых моделей.
Способность работать в гибридном режиме, эффективно управляя своим временем и задачами как в офисе, так и удаленно.
Опыт в низкоуровневой оптимизации и использовании TensorRT для повышения скорости обработки данных, что критично для работы с LLM.
Творческий подход к решению проблем, проявляющийся в нахождении нестандартных решений для повышения throughput и снижения latency.
Ресурсы для обучения
Карьерный путь
Обзор рынка
Навыки и требования
Тренды отрасли
Новости Cloud Services
Загружаем новости отрасли...
Ищем релевантные статьи за последние 6 месяцев