старт 26 октября
практический онлайн-курс для инженеров
Управление надёжностью систем на основе данных (SRE)
Три недели работы SRE-командой. На учебном production-сервисе зададите SLO, настроите мониторинг и алертинг, разберёте инциденты, восстановите сервис и проведёте postmortem
Не уверены, готовы ли к полному курсу?
Попробуйте 7-дневный SRE-интенсив за 5 000 ₽ →
Курс в деле
01
20 часов
часов практики на стендах
02
Работа SRE-командой
поделим на группы, распределим роли и научим работать в коллективе
03
Имитация реальной работы
решайте задачи и кейсы, которые возникают на вашем сервисе
04
Прямое общение со спикерами
разборы кейсов, Q&A и отдельный чат
Кому подойдёт курс
DevOps / SRE / системный инженер
Работаете с production и хотите собрать разрозненные SRE-практики в систему: понять, какие метрики действительно нужны, как задавать SLO, настраивать алертинг и выстраивать работу с инцидентами
Разработчик с infra-ответственностью
Отвечаете уже не только за код, но и за то, как сервис живёт после релиза. Хотите лучше понимать мониторинг, надёжность и причины сбоев — и учитывать это ещё при разработке.
Тимлид / техлид
Хотите выстроить в команде понятный подход к надёжности: договориться о метриках, наладить работу с инцидентами и postmortem, чтобы каждый новый сбой не приходилось разбирать с нуля.
Хотите обучить команду?
Для компаний есть отдельные условия на обучение нескольких сотрудников. А если курс нужен вам для текущей работы, его не обязательно оплачивать самостоятельно — можно запросить обучение у работодателя.
Метрики и SLO
Поймёте, что действительно измерять: SLI/SLO, error budget и алертинг — без набора метрик ради метрик
Инциденты
Отработаете incident response: распределите роли, восстановите сервис и проведёте postmortem
SRE как система
Свяжете monitoring, SLO, отказоустойчивость и incident management в одну рабочую картину
В свой production
Поймёте, какие практики можно адаптировать под свою команду и сервис
Вы получите не гугловскую теорию, а рабочий опыт инженеров из российских компаний
SRE-практики, которые вы освоите
Начни учиться бесплатно
Познакомьтесь с материалами и спикерами курса. Даем демодоступ на 3 дня
Формат обучения
Обучение проходит в условиях имитации реальной работы — в специально разработанном приложении кинотеатра, в котором у каждого будет своя роль
Учебное приложение состоит из нескольких микросервисов. Он агрегирует данные о сеансах, ценах и свободных местах со всех кинотеатров, показывает анонсы фильмов, дает выбрать кинотеатр, сеанс, зал и место, забронировать и оплатить билеты.

Мы сформулируем показатели SLO, SLI, SLA для сервиса, настроим мониторинг и алертинг.
Ошибки разработчиков, отказы инфраструктуры, наплыв посетителей, DoS-атаки приводят к тому, что SLO ухудшаются.

Мы разберем устойчивость, error budget, практику тестирования, управление прерываниями и операционной нагрузкой.
Ломаем
Чиним
Произошла авария. Сервис обработки платежей лег. Как действовать, чтобы восстановить работоспособность в минимальные сроки?

Мы организуем работу группы по ликвидации аварии: подключение коллег, оповещение интересантов (stakeholders), выстраивание приоритетов. Будем тренироваться под давлением в условиях предельно ограниченного времени.
Разберем подход к приложению с точки зрения SRE. Проанализируем инциденты (причины возникновения, ход устранения).

Примем решение по их дальнейшему предотвращению: улучшим мониторинг, автоматизируем процессы.
Изучаем
Строим
Внутренние и внешние факторы начинают «портить» SLO
Incident response
Cмотрим на сайт и инциденты с точки зрения SRE
С чем предстоит работать
Вы будете поддерживать приложение, написанное на python, которое взаимодействует с базой данных MySQL для хранения информации. Оно будет развернуто микросервисной архитектурой на наших кластерах Kubernetes, к которым у вас будет доступ для решения проблем, возникших на инцидентах.
Это один из самых распространенных, простых и доступных языков программирования. Вы легко сможете разобраться в его коде и внести изменения, если это потребуются.
7 видеоуроков
5 командных кейсов
20
6
ч практики
встреч со спикерами
3 Q&A-сессии
45
ч итого
На изучение теории, работу в командах и общение со спикерами
15
ч теории
Видеокурс «Мониторинг в Grafana»
+ работа с дашбордами
3 практикума с кейсами
Шаг 1
Шаг 2
Встречаемся со спикерами и делимся на команды
Шаг 3
Шаг 4
Шаг 5
Шаг 6
Делаем домашние задания, получаем фидбек от эксперта
Изучаем видеоуроки и читаем теорию
Выполняем практические задания и решаем кейсы в командах, имитируем работу SRE
Разбираем практические задания и кейсы со спикерами +задаем вопросы
Сдаем все практические задания и получаем сертификат
Что мы ожидаем от вас
Без этих знаний обучаться будет трудно!
Будет большим плюсом, если вы:
  • Работали в кластере Kubernetes или просто знаете принципы работы
  • знаете, как работать в Grafana и Prometheus
  • умеете писать код на Python
  • Вы умеете читать код на Python
  • Знаете Linux на уровне администратора
  • Знание принципов работы Баз данных (любые: SQL, NoSQL, KeyVal)
SRE-каналов на русском  по пальцам пересчитать. Поэтому мы ведём свой
В «Путь SRE» — инциденты, SLO, observability и инженерные разборы. Никакого общего IT-дайджеста — только SRE.
Если пока не уверены в базе в целом, то начните с 7-дневного SRE-интенсива за 5 000 ₽
Спикер курса Максим Гусев
Руководитель команды SRE в RWB
  • Строит отказоустойчивые системы в IT более 11 лет
  • Активно проповедует искоренение тойла и построение правильного инцидент-менеджмента
  • Прошел путь от инженера по замене бумаги в принтере до техлида SRE в финтехе и Lead Observability Team в Dodo Engineering
Программа
Вы познакомитесь с основами архитектуры Kubernetes и её ключевыми компонентами. Вы узнаете, для чего нужны и как взаимодействуют основные объекты, такие как поды, репликасеты, деплойменты и сервисы.
26 октября, пн – старт обучения. Открываем доступ к Telegram-чату потока
  • Подходы к мониторингу. Blackbox & Whitebox, 4 golden signals, RED, USE
  • Grafana, Prometheus & Alertmanager. Установка и настройка
  • Prometheus. Модель данных и типы метрик. Особенности мониторинга latency
  • Prometheus. PromQL
  • Grafana. Первый dashboard
  • Grafana. Tips & tricks
  • Alerting. Grafana vs Prometheus
  • Alerting. Тестирование
  • Обсудим цели и задачи курса
  • Расскажем, что такое SRE
  • Распределим студентов на команды
  • Monitoring и Observability
  • SLO, SLI, SLA
  • Error budget
  • Добавляем на дашборды SLO, SLI и Error budget (Первичная нагрузка)
  • Работаем с k8s, исправляем ошибки в коде, разбираем архитектуру приложения
  • SRE в других компаниях: как устроена работа с метриками
  • Ответы на вопросы по предыдущим темам
  • Обратная связь по домашнему заданию
  • Resiliencе Engineering и устройство команды
  • Инструменты варрума
  • Postmortem
  • Работаем в команде и устраняем проблемы в приложении, развернутом в Kubernetes кластере, на основе метрик
  • По окончании практики вы получите комплект шаблонов постмортемов
  • Работа с инцидентами, продом и прочие практики SRE
  • Ответы на вопросы по предыдущим темам
  • Health Check в Kubernetes
  • Exec probes
  • InitialDelaySeconds
  • Secondary Health Port
  • Sidecar Health Server
  • Headless Probe
  • Hardware Probe
  • Реализация Fail-fast подхода: учимся быстро выявлять проблемы и минимизировать их последствия
  • Реализация канареечных деплоев: работаем с Argo Rollouts и учимся деплоить с минимальным аффектом пользователей
  • Тренды и технологии, карьера и развитие в SRE
  • Ответы на вопросы по предыдущим темам
  • Подведение итогов и завершение обучения
Cвидетельство
Именное свидетельство о прохождении курса получает студент, если:
  • изучил 80% курса
  • принимал участие в решении практик, которые входят в курс.
Зачем компании внедрять SRE-подход?
Повышение
надежности сервисов
Автоматизация и стандартизация
Снижение
количества инцидентов
Снижение затрат
SRE обеспечивает высокую доступность и стабильность сервисов. Это критически важно для удовлетворенности пользователей.
SRE внедряет автоматизированные процессы, что снижает количество рутинных задач и повышает эффективность работы команд.
Внедрение превентивного мониторинга и автоматизации процессов минимизирует количество инцидентов и время их решения.
Оптимизация процессов и автоматизация помогают сократить операционные расходы.
Улучшение производительности
Кросс-функциональное взаимодействие команд
Обратная связь и улучшения
Эффективное
управление нагрузкой
Использование SRE-практик позволяет оптимизировать производительность систем. Задержки снижаются, скорость отклика повышается.
SRE способствует более тесному сотрудничеству между разработчиками и операционными командами. Это улучшает коммуникацию и общий процесс разработки.
SRE-практики включают анализ инцидентов и создание постмортемов, что помогает выявлять слабые места и улучшать процессы.
SRE позволяет анализировать и прогнозировать нагрузку на системы, что помогает лучше справляться с пиковыми периодами.
Этот курс может оплатить ваша компания
Если вы считаете, что знания, полученные на курсе, могут быть полезными на вашем текущем месте работы, оставляйте заявку с контактами компании в форме ниже или обсудите покупку курса с вашим руководителем. Как это организовать, что говорить и куда идти — написали здесь.
Как купить курс
Перейти
Перейти
Подарите своему сотруднику скидку или курс целиком. А мы упакуем ;)
Подарочный сертификат
В 75% случаев обучение готова оплатить компания. Напишите нам, и мы поможем.
Курс за счёт работодателя
Написать нам
Написать нам
старт 26 октября
Поток
Видеоуроки
Командные практикумы и кейсы
Q&A-сессии со спикерами
Виртуальные стенды для практики
Чат-группы Телеграм со спикерами
Поддержка от куратора группы
Подготовительный модуль по Kubernetes
Видеокурс «Мониторинг в Grafana»
Проверка домашних заданий экспертом
в рассрочку на 4 месяца или 60 000 ₽ единовременно
15 000 ₽/мес
Рассрочка
только для физических лиц
Условия рассрочки:
Процесс оформления:
Командное предложение
от 10 человек
специальные условия
от 5 человек
-10%
от 3 человек
-7%
Перейти
Перейти
Подарите своему сотруднику скидку или курс целиком. А мы упакуем ;)
Подарочный сертификат
Выгодно и быстро обучим целые команды. Единоразовое оформление и быстрый доступ к курсам.
Универсальные доступы
Перейти
Перейти
старт 26 октября
Поток
Видеоуроки
Командные практикумы и кейсы
Q&A-сессии со спикерами
Виртуальные стенды для практики
Чат-группы Телеграм со спикерами
Поддержка от куратора группы
Подготовительный модуль по Kubernetes
Видеокурс «Мониторинг в Grafana»
Проверка домашних заданий экспертом
100 000 ₽

Часто задаваемые вопросы

Кастомизируем курс для вашей компании
Если ваша задача — обучить больше 30 сотрудников, мы готовы предложить вашей компании корпоративный формат обучения или адаптировать обучение под вас
Пример корпоративного обучения по Kubernetes для сотрудников Т-банка →
Нужна консультация?
задайте нам свой вопрос