О позиции
Компания YADRO формирует большую команду SRE и DevOps для работы над крупной аналитической платформой, которая включает в себя множество источников данных, пользователей и микросервисов. Система быстро масштабируется, и уже имеется круглосуточная техническая поддержка с участием около 15 DevOps специалистов. В настоящее время компания планирует создать SRE-команду из 6–8 человек для обеспечения полноценной работы 24/7 и дополнительно нанять еще столько же DevOps специалистов.
Чем вы будете заниматься
- Обеспечение доступности production-сервисов по SLA/SLO/SLI.
- Развитие и масштабирование Kubernetes-инфраструктуры.
- Настройка observability с использованием VictoriaMetrics, Prometheus, Grafana, Alertmanager и OpenSearch.
- Автоматизация процессов CI/CD с помощью Jenkins/Groovy, GitLab CI и ArgoCD.
- Управление конфигурацией и IaC с использованием Ansible и Helm.
- Работа с Linux, сетями и troubleshooting TCP/IP.
- Работа с базами данных PostgreSQL, ClickHouse, MongoDB и OpenSearch.
- Интеграция с Kafka, Zookeeper и Consul.
- Настройка HAProxy и Nginx.
- Работа с OpenStack.
- Взаимодействие с разработчиками, Data Engineering и L1/L2.
Требования
- Опыт эксплуатации production-систем.
- Знания в области построения систем с нуля.
- Опыт работы с observability.
- Глубокие знания сетевых технологий и обеспечения надежности 24/7.
- Опыт работы с Linux и Kubernetes.
- Знания в области CI/CD и автоматизации полного цикла доставки.
Что мы предлагаем
- Конкурентоспособная зарплата, ориентированная на рынок.
- Готовность обсуждать индивидуальные условия для сильных специалистов.
- Возможность работы в удаленном формате.
- Работа в команде профессионалов с возможностью роста и развития.
Кто здесь добьётся успеха
Глубокие знания в области SRE и DevOps, включая опыт работы с Kubernetes и Ansible для автоматизации процессов развертывания и управления инфраструктурой.
Способность работать в удаленном режиме, проявляя высокую степень самодисциплины и самостоятельности при решении задач и взаимодействии с командой.
Опыт настройки и использования инструментов для наблюдаемости и мониторинга, таких как Prometheus и Grafana, для обеспечения надежности системы и быстрого реагирования на инциденты.
Сильные навыки в CI/CD, особенно с использованием GitLab CI, для оптимизации процессов разработки и развертывания в крупномасштабных распределенных системах.
Ресурсы для обучения
Карьерный путь
Обзор рынка
Навыки и требования
Тренды отрасли
Новости AI/Big Data
Загружаем новости отрасли...
Ищем релевантные статьи за последние 6 месяцев