DevOps/SRE Engineer
Мы в поиске SRE/DevOps Engineer в международную компанию к нашим партнерам.Обязанности:Поддерживать и развивать production-инфраструктуры AI-платформы (voice AI, conversational-системы, real-time нагрузка)Эксплуатировать Kubernetes-кластера: деплой, scaling, troubleshooting, работа в kubectl, ресурсами, health checksУпаковывать и выкатывать сервисы через Helm-чарты, поддерживать и рефакторить чарты и конфиги окруженийНастраивать и поддерживать CI/CD в GitLab: пайплайны со сборками, тестами и выкатами, blue-green деплой и откат сбойных релизовЭксплуатировать stateful-сервисы: PostgreSQL, MongoDB, Redis, RabbitMQ, Kafka — конфигурация, отказоустойчивость, бэкапы и проверка восстановленияПоддерживать инфраструктуру ML/LLM-инференса: развёртывание и обслуживание vLLM и Triton Inference Server в k8s, autoscaling инференс-сервисов, контроль latency и утилизации GPUМониторинг, логирование и алертинг: метрики (Prometheus/VictoriaMetrics), дашборды, алерты с уровнями severityУчаствовать в on-call дежурствах, разбор инцидентов до корневой причины и внедрение мер, исключающих повторАвтоматизировать рутинные операции, IaC-подход, сокращать ручные действияПовышать надёжность, отказоустойчивость и observability системыВести техническую документации и runbook'овТребования:От 5 лет коммерческого опыта эксплуатации production-инфраструктуры под реальной нагрузкойОт 5 лет релевантного опыта на позициях SRE/DevOpsУверенное владение Linux: понимание процессов, сети, дисков, диагностики «под капотом»Практический опыт с Kubernetes: kubectl, деплой, логи, scaling, namespace, перезапуск и диагностика приложений, особенности хранения данных в контейнерахDocker, Helm, конфиги окружений, health checks, observabilityНастройка и поддержка CI/CD в GitLab: репозитории, раннеры/агенты, пайплайны со сборками, тестами и выкатами, откат релизаМониторинг и алертинг: Prometheus / VictoriaMetrics / Alertmanager (или Zabbix, Icinga, Nagios): создание и поддержка алертов, понимание уровней severity и реакции на них.Работа с централизованными системами логирования.Понимание роли и базовая эксплуатация PostgreSQL и Redis, понимание необходимости бэкапов.Понимание принципов работы KafkaИметь опыт работы с Vault, Nginx/Ingress, VoIP/Asterisk, ML-инфраструктурой (vLLM, Triton, Kubeflow, Ray) , MongoDB, отказоустойчивыми конфигурацями RabbitMQСклонность к автоматизации рутины, навык написания технической документацииГотовность к on-call и разбору инцидентов до корневой причиныАнглийский от B1 (Intermediate)Будет плюсом:Сборка контейнеров через werfОпыт security-сканирования (SAST / DAST), работы с уязвимостями образовУсловия: Заработная плата по результатам интервьюОтпуск: 21 рабочий день в год4 дополнительных day off в годуКомпенсация 50% стоимости изучения английскогоВозможность профильного обучения и повышения квалификации