ML-разработчик (Inference) — Yandex Cloud@ Яндекс

5K $–8K $/мес
Опубликовано 19.03.2026

О позиции

Мы ищем ML-разработчика (Inference) для работы в команде Yandex Cloud. Ваша основная задача будет заключаться в оптимизации инференса больших языковых моделей (LLM) и разработке высокопроизводительных систем. Вы сможете сосредоточиться на различных направлениях, таких как производительность, дистрибуция и низкоуровневая оптимизация.

Чем вы будете заниматься

  • Оптимизация throughput и latency при генерации LLM, внедрение техник, таких как speculative decoding и KV-cache.
  • Разработка распределённых систем для инференса, интеграция с Kubernetes и поддержка multi-node-сценариев.
  • Работа с CUDA/Triton-kernels, профилирование и оптимизация памяти.
  • Разработка API и SDK для автоматизации развёртывания моделей.
  • Поддержка on-prem-сценариев у клиентов и интеграция с облачной инфраструктурой.

Требования

  • Понимание устройства трансформеров и LLM-инференса.
  • Опыт оптимизации под GPU: CUDA/Triton, профилирование.
  • Знание PyTorch, JAX, TensorRT, HuggingFace TGI или vLLM.
  • Навыки разработки на Python и одном из системных языков (C++ или Go).
  • Опыт работы с высоконагруженными сервисами (Kubernetes, gRPC).

Будет плюсом

  • Опыт работы с балансировщиками и автоматическим масштабированием.
  • Знание технологий NVLink и RDMA.

Что мы предлагаем

  • Конкурентная зарплата и возможность работать в гибридном формате.
  • Доступ к современным технологиям и инструментам.
  • Возможность профессионального роста и участия в интересных проектах.
  • Дружелюбная команда и поддержка коллег.
Обязательные
0/1
Желательные
0/1
Бонус
0/1
Почему эта вакансия
7.5
7.5 из 10
оценка совпадения

Вакансия предлагает интересные задачи в области ML и возможность работать с современными технологиями. Однако, описание вакансии могло бы быть более детализированным.

Кто здесь добьётся успеха

Глубокие знания CUDA и PyTorch, позволяющие оптимизировать производительность инференса больших языковых моделей.

Способность работать в гибридном режиме, эффективно управляя своим временем и задачами как в офисе, так и удаленно.

Опыт в низкоуровневой оптимизации и использовании TensorRT для повышения скорости обработки данных, что критично для работы с LLM.

Творческий подход к решению проблем, проявляющийся в нахождении нестандартных решений для повышения throughput и снижения latency.

Ресурсы для обучения

Карьерный путь

ML-разработчик (Inference) (Сейчас)Старший ML-разработчик (1–2 года)Технический руководитель команды ML (3–5 лет)

Обзор рынка

Объём рынка CUDA 2026
$6.5B
Годовой рост
15.2%
Внедрение AI
78%
Инвестиции
+120%

Навыки и требования

Обязательные
CUDATritonPyTorch
Растущий спрос
TensorFlowKubernetesDistributed Computing
Снижающийся спрос
OpenCLMATLAB

Тренды отрасли

Увеличение использования GPU в ML
Согласно отчетам, использование графических процессоров (GPU) для обучения моделей машинного обучения увеличилось на 30% в 2025 году, что делает CUDA важным навыком для разработчиков.
Рост интереса к оптимизации производительности
Более 60% компаний в России инвестируют в оптимизацию производительности своих ML-приложений, что увеличивает спрос на специалистов, владеющих CUDA и TensorRT.

Новости Cloud Services

Загружаем новости отрасли...

Ищем релевантные статьи за последние 6 месяцев