За 7 учебных дней соберёте SRE-пакет по знакомому сервису: SLI/SLO, error budget, сигналы мониторинга, план первых 15 минут инцидента, mini-postmortem и roadmap на 3 месяца. Без кода, Kubernetes и настройки окружения
Разберётесь, как связаны SLI, SLO, SLA, error budget, golden signals, toil и postmortem — и сможете объяснить, зачем всё это нужно сервису.
Посмотрите на сервис через надёжность
Сможете начать не с «какие метрики поставить», а с вопроса: что для пользователя значит «сервис работает»? От этого — перейти к показателям, целям и сигналам мониторинга.
Поймёте логику работы с инцидентом
Будете понимать, что важно определить в первые минуты сбоя, как распределить действия и почему работа с инцидентом не заканчивается на service restored
Поймёте свой следующий шаг
Увидите, какие SRE-навыки у вас уже есть, чего не хватает и что имеет смысл развивать дальше
Что останется у вас после интенсива?
SRE-пакет по выбранному сервису
Все задания интенсива собираются в один рабочий артефакт: SLO и error budget, сигналы мониторинга, план реакции на инцидент, mini-postmortem, работа с toil и ваш следующий roadmap
Что изменится за 7 дней
За неделю вы не станете SRE — зато разберётесь, как SRE смотрит на сервис, и попробуете этот подход на знакомом вам продукте
Автор и спикер курса
Руководитель команды SRE в RWB
Максим Гусев
Строит отказоустойчивые системы в IT более 11 лет
Активно проповедует искоренение тойла и построение правильного инцидент-менеджмента
Прошел путь от инженера по замене бумаги в принтере до техлида SRE в финтехе и Lead Observability Team в Dodo Engineering
Программа
Разбираем SRE как профессию и инженерный подход: чем отличается от DevOps и админа, почему надёжность — это продуктовая характеристика, и что значит «сервис работает» с точки зрения пользователя.
Результат: Описание сервиса и пользовательское обещание
Переводим надёжность в цифры: учимся формулировать показатели, ставить цели и понимать, почему 100% доступности — плохая идея.
Результат: SLI, SLO и error budget
Разбираем четыре golden signals, отличаем метрики от логов и трейсов, учимся отличать полезный алерт от шумного.
Результат: Таблица golden signals с условиями алертинга
Изучаем структуру реакции на инцидент: impact, severity, mitigation, роли, коммуникация и первые 15 минут.
Результат: План первых 15 минут инцидента
Разбираем blameless culture, учимся составлять таймлайн и формулировать action items, которые реально улучшают систему.
Результат: Мини-postmortem с таймлайном и action items
Находим ручную повторяемую работу, разбираемся, когда runbook — временное решение, а когда нужна автоматизация.
Результат: Toil и кандидаты на автоматизацию
Собираем финальный SRE-пакет из 11 блоков, разбираем карту навыков SRE и карьерные точки входа из смежных ролей, строим личный roadmap на 3 месяца
Результат: Личный roadmap на 3 месяца
Как проходит обучение
Практика без кода и инструментов
Вся практика проходит без технического стенда. Вы выберете знакомый сервис и на его примере составите SLI и SLO, рассчитаете error budget, определите сигналы мониторинга, продумаете первые действия во время инцидента, подготовите mini-postmortem и карьерный план.
Формат:
Онлайн-интенсив в Telegram-чате
Расписание
7 учебных дней в течение двух недель 21.09 по 2.10, с перерывом на выходные
Авторское видео, подкаст или скринкаст по теме дня
10 – 15 мин
Задание на мышление
20 – 40 мин
Тест
5–7 вопросов
Обсуждение в чате
открытый вопрос для дискуссии
Специальных требований нет. Интенсив рассчитан на тех, кто работает или учится в ИТ. Достаточно общего понимания, что такое сервер, запрос и сервис.
Опыт в SRE, DevOps и работе с production не требуется. Все специальные термины и практики разберем с нуля на понятных примерах.
Минимальные требования
Не потребуется
Устанавливать инструменты
Писать код
Настраивать окружение
Работать с командной строкой
Знать Kubernetes, Prometheus или Grafana
Иметь доступ к production-системам
Для участия понадобятся
Telegram и браузер
Любое приложение для заметок
До четырех часов в день
Расписание: 21 сентября — старт потока и открытие чата, знакомство 22 сентября — День ноль — рассказываем как будет проходить поток 23 сентября — материалы День 1 24 сентября — материалы День 2 25 сентября — материалы День 3 26−27 сентября — выходные, отстающие студенты догоняют материал 28 сентября — материалы День 4 29 сентября — материалы День 5 30 сентября — материалы День 6 01 октября — материалы День 7 02 октября — завершаем поток, собираем ОС и отдаём доп материалы курса
Нет. Курс рассчитан на тех, кто только знакомится с SRE. Достаточно общего понимания, что такое сервер, запрос и сервис.
Нет. Все задания — на мышление и анализ. Код и настройка окружения не требуются.
~100–120 минут: 35 мин материалы + 10–15 мин видео + 20–40 мин задание + тест и обсуждение.
SRE-пакет из 11 блоков по выбранному сервису — первый портфолио-артефакт. По запросу — свидетельство о прохождении.
Интенсив — вводная ступень. Следующий шаг — практический курс SRE: data-driven подход к управлению надежностью систем, где вы глубоко прокачаете навыки.