практикум

SRE - Production Reliability

Комплексный трек по тюнингу Linux, нагрузочному тестированию и построению отказоустойчивого мониторинга и логирования (Prometheus, Grafana, Loki, ELK/Graylog) со скидкой.

темы, которые вы освоите

Linux (Kernel tuning)
Prometheus
Grafana
Kube-Prometheus-Stack
Loki
Graylog
Fluentd
k6
JMeter
PromQL
LogQL
Системный подход
Пакет выстроен как единый логический трек — от поиска узких мест в ОС до автоматизации мониторинга в K8s.
Экономия бюджета
Покупка программ в одном пакете значительно выгоднее, чем приобретение каждого курса и тренажера по отдельности.
Экономия времени
Готовая траектория обучения избавляет от необходимости самостоятельно искать и стыковать учебные материалы.
Единая экосистема
Все практические задания выполняются на реальных стендах с единым сквозным подходом к качеству инфраструктуры.
Rebrain
— большое сообщество IT-специалистов, создаём
практикумы по инфраструктуре с 2018 года
Почему выбирают наши программы
  • Автоматические проверки — мгновенная обратная связь по заданиям
  • Проверки менторами — DevOps-инжерами с опытом в индустрии от 5+ лет
  • Возможность общаться с опытными практикующими специалистами
  • Свободный темп — проходите без жёстких дедлайнов
  • Прикладные задачи — кейсы, приближенные к реальной работе DevOps-инженера
phone

Кому подойдёт

DevOps-инженеры

Специалисты, желающие систематизировать знания по Observability и Performance Tuning, получив готовый трек без необходимости собирать его по частям.

Системные администраторы

Инженеры, стремящиеся перейти в SRE/HighLoad, освоить современный стек мониторинга и логирования и научиться работать с инфраструктурой под нагрузкой.

SRE и Performance-инженеры

Профессионалы, которым нужен глубокий практический опыт настройки сложных связок (Kube-Prometheus-Stack, Loki multi-tenancy, k6) на реальных стендах.

Как проходит
практикум

Команда Rebrain изучает, какие из компетенций требуются на разных уровнях профессий.

программа практикума

Пакет

  • Введение

Prometheus

  • Введение
  • Обзор и установка Prometheus
  • Подключение системного экспортера
  • Подключение экспортеров для сервисов
  • Получение метрик из приложений
  • Прием метрик по push модели
  • Автоматическое обнаружение целей для мониторинга
  • Использование PromQL для анализа метрик
  • Визуализация метрик в Grafana
  • Создание и настройка алертов
  • Настройка нотификаций (alertmanager)
  • Prometheus Federation
  • Long Term Storage
  • Prometheus Security
  • Prometheus Useful cases
  • Итоговый проект
  • Заключение

Интенсив

  • Введение
  • Введение в Prometheus и основы сбора метрик
  • Язык запросов PromQL и работа с метриками
  • Мониторинг приложений и Service Discovery
  • Масштабирование Prometheus и долгосрочное хранение метрик с Thanos
  • Заключение

KPS

  • Введение
  • Введение в Kube-Prometheus-Stack (KPS)
  • Установка и базовый обзор
  • Prometheus Operator и CRD Prometheus
  • Безопасность и доступ к интерфейсам (Ingress)
  • Мониторинг приложений с помощью ServiceMonitor
  • Мониторинг приложений с помощью PodMonitor
  • Интеграция с Grafana: дашборды из коробки
  • Мониторинг Control Plane и Etcd
  • Добавление внешних таргетов (static_configs)
  • Декларативное управление алертами (PrometheusRule)
  • Базовая настройка Alertmanager в KPS
  • Продвинутая настройка Alertmanager: HA и маршрутизация
  • Мониторинг доступности с Blackbox Exporter
  • Обновление KPS и управление ресурсами
  • Итоговый проект
  • Заключение

Grafana

  • Введение
  • Установка Grafana
  • Команды и доступы
  • Архитектура и источники данных
  • Вкладка Explore
  • Строим первый дашборд
  • Продвинутые панели и переменные
  • Интеграция с Loki
  • Интеграция с Elasticsearch
  • Готовые дашборды
  • Аннотации на графиках
  • Мир плагинов
  • Алертинг
  • Provisioning
  • Итоговый проект
  • Заключение

Интенсив

  • Введение
  • Введение в Grafana и создание первого дашборда
  • Продвинутые дашборды и шаблонизация
  • Оповещения в Grafana и управление доступом
  • Лучшие практики и расширенные возможности Grafana
  • Заключение

Terraform

  • Введение
  • Введение в Terraform и декларативный IaC
  • Основы HCL и создание первого ресурса
  • Переменные (Variables) и Выводы (Outputs)
  • Управление состоянием (State) — ядро Terraform
  • Провайдеры, Data Sources и depends_on
  • Выражения, циклы и динамические блоки
  • Модули: Основы и структура
  • Модули: Registry и Git
  • Provisioners и null_resource
  • Управление окружениями: Workspaces
  • Продвинутая работа со State
  • Terraform в CI/CD и Best Practices
  • Итоговый проект
  • Заключение

Тренажёры

  • Инфраструктура для staging-prod окружений
  • Веб-сервис с балансировкой нагрузки
  • Переиспользуемый модуль virtual-machine
  • Безопасная сеть - public private subnet и bastion
  • Terraform quality gate

Linux: Анализ производительности и тюнинг

  • Введение
  • Архитектура производительности Linux и файловая система /proc
  • CPU: анализ нагрузки и состояний процессов
  • CPU: планировщик, приоритеты и Affinity
  • RAM: виртуальная память и аллокация
  • RAM: тюнинг подсистемы памяти и Swap
  • Storage: анализ дисковой подсистемы
  • Storage: планировщики ввода-вывода и тюнинг
  • Network: мониторинг сетевой активности
  • Network: тюнинг стека TCP/IP
  • Исторический анализ: atop
  • Deep Dive: трассировка системных вызовов (strace)
  • Итоговый проект
  • Заключение

Logs

  • Введение
  • Введение в централизованное логирование и обзор экосистемы
  • Основы логирования на уровне приложений
  • Работа с Systemd Journal (journald)
  • Rsyslog: Базовая архитектура и настройка
  • Rsyslog: Продвинутая маршрутизация и сетевое взаимодействие
  • Fluentd: Архитектура и базовые пайплайны
  • Fluentd: Трансформация и обогащение данных
  • Fluentd: Буферизация, доставка и Fluent Bit
  • Обзор современных хранилищ логов
  • Graylog: Установка и архитектура
  • Graylog: Обработка данных (Streams и Pipelines)
  • Graylog: Алерты и оповещения
  • Graylog: Обслуживание, ротация и политики хранения
  • Итоговый проект
  • Заключение

Linux Performance & HighLoad Fundamentals

  • Введение
  • Basics. Введение в HighLoad
  • Общее понимание ресурсозатрат
  • Метрики. CPU
  • Анализ нагрузки и управление RAM
  • Диски: анализ и управление вводом-выводом
  • Сеть: анализ и управление вводом-выводом
  • Анализ нагрузки. Исторические данные
  • Индексы производительности Apdex
  • HTTP/2 и HTTP/3 (QUIC)
  • TLS RSA vs ECC. Теория и производительность
  • Alpine Linux: сборка собственного образа для highload
  • Финальное задание
  • Заключение

Тренажёры

  • Защита критического сервиса от OOM Killer через cgroup v2
  • Сглаживание latency spikes при дисковой записи
  • Устранение потерь соединений при 10 000+ параллельных клиентов
  • Поиск и устранение «болтливых» системных вызовов через eBPF
  • Сборка лёгкого безопасного образа на Alpine с решением musl-совместимости

Load Testing & Benchmarking

  • Введение
  • Виды нагрузочного тестирования
  • Подготовка тестовых профилей нагрузки
  • Мониторинг. Установка тестового приложения
  • Мониторинг. Время ответа
  • JMeter. Первое знакомство
  • JMeter. Запись сценария. Поиск сложных запросов
  • JMeter. Assertions, Variables, Processors, Logic Controllers
  • JMeter. Plugins и мониторинг ресурсов
  • JMeter. Стресс-тестирование и тестирование стабильности
  • Distributed load testing
  • k6: современный нагрузочный фреймворк
  • Итоговый проект
  • Заключение

Тренажёры

  • Автоматизация запуска JMeter в CLI и генерация отчетов
  • Настройка дашборда Grafana для мониторинга перцентилей времени ответа
  • Корреляция динамических параметров в JMeter с помощью JSON Extractor
  • Разработка сценария k6 с контролем SLA через Thresholds
  • Развёртывание распределённого стенда JMeter в Docker Compose

Grafana Loki

  • Введение
  • Установка и первые шаги
  • Архитектура
  • LogQL: основы
  • LogQL: парсеры
  • LogQL: метрики из логов
  • Отправка логов
  • Метки и кардинальность
  • Хранилище и индексация
  • Retention и Compaction
  • Мультитенантность и безопасность
  • Масштабирование
  • Alerting и Recording Rules
  • Мониторинг Loki
  • Итоговый проект
  • Заключение

Тренажёры

  • Динамический парсинг JSON-логов и извлечение метрик в LogQL
  • Сбор многострочных логов Java-приложения через Grafana Alloy
  • Оптимизация высокой кардинальности меток с помощью LogCLI
  • Миграция Loki на MinIO S3 и кэширование через Memcached
  • Реализация мультитенантности Loki через Nginx Basic Auth
Эксперт практикума
Роман Чуприков
Роман Чуприков

В IT уже лет 20, начинал anykey-ем, погружался в инфраструктуру. Люблю всё автоматизировать, так и оказался в devops. Начинал с винды, AD, exchange и прочие радости от microsoft. Потом открыл для себя мир linux. Сейчас для работы достаточно браузера, терминала и стабильного интернета. Облака или bare-metal, значения не имеет, привык выбирать инструменты под требования бизнеса, а не на волне хайпа.

Давно знаком с площадкой. Сам проходил несколько курсов. Нравится формат, удобно заниматься в любое время. Особенно нравятся практические задания, помогают сразу же проверить на практике изученный материал.

DevOps в SimpleWine
Юрий Береговой
Юрий Береговой

Разрабатываю backend на Java/Spring и параллельно держу инфраструктуру: Kubernetes, Terraform и Ansible для IaC, CI/CD на Jenkins, облака AWS/GCP. Последние несколько лет всё глубже ухожу в DevOps - начинал с собственных pet-проектов в облаке, сейчас занимаюсь оркестрацией и пайплайнами всерьёз. Больше всего ценю нестандартные задачи, на которых реально прокачиваешься.

Senior Software Engineer eQ3
Дмитрий Куликов
Дмитрий Куликов
  • DevOps-инженер с 7+ лет опыта в IT.
  • Специализируюсь на построении и автоматизации IT-инфраструктуры.

Ключевые навыки для резюме:

Диагностировать и устранять узкие места в производительности CPU, RAM, Storage и Network в Linux.
Проектировать и развертывать отказоустойчивые системы мониторинга на базе Prometheus, Grafana и Kube-Prometheus-Stack.
Разрабатывать сценарии нагрузочного тестирования с использованием k6 и JMeter, интегрировать их в CI/CD.
Строить масштабируемые пайплайны логирования с использованием Graylog, Fluentd и Grafana Loki.
Писать сложные оптимизированные запросы на PromQL и LogQL для точечного алертинга и визуализации.

Пример задания

Итоговый проект объединяет все модули пакета: тебе предстоит провести нагрузочное тестирование высоконагруженного веб-приложения, выявить и устранить узкие места в ОС Linux. Затем ты развернешь комплексную систему Observability (Prometheus, Grafana, Loki, Graylog) в Kubernetes, настроишь отказоустойчивое хранение данных и алертинг на критические инциденты.

Остались вопросы?
Приходите на бесплатную консультацию с экспертом.

практикум

SRE - Production Reliability

В стоимость входит:

  • Выполнение задач на настоящей инфраструктуре
  • Сопровождение — менторы, координатор
  • Бессрочный доступ к теоретической части практикума
стоимость
SRE - Production Reliability — v1.0
13 667 руб.
12 500 руб.

в месяц или сразу 150 000 руб.

Перейти к оплате >>>
FAQ

Да, ты можешь проходить курсы в любом удобном темпе, но мы рекомендуем придерживаться предложенной во Введении последовательности для лучшего усвоения материала.

Обратись в нашу поддержку — мы сделаем персональный перерасчет стоимости пакета с учетом уже приобретенных курсов.

Суммарный объем программ составляет 280 академических часов. При обучении по 6-8 часов в неделю прохождение всего трека займет около 6-8 месяцев.

Да, весь трек построен на выполнении практических задач на реальных стендах Rebrain с автоматической проверкой.

Файлы куки

При использовании данного сайта, вы подтверждаете свое согласие на использование файлов cookie и других похожих технологий в соответствии с настоящим Уведомлением.