Теория: платформа как базовый сервис, SLO/SLI, наблюдаемость, дежурства, совместное использование платформы, политики как код, управление версиями.
Практика: зададите SLO для своего готового пути, создадите панель мониторинга SLI с помощью готовых Prometheus/Grafana, затем проведете проверку отказоустойчивости (отключит компонент, от которого зависят все команды). Диагностика по панели мониторинга и восстановление под таймер — на рабочем стенде, а не по бумажным журналам.