SRE и наблюдаемость
Надёжность как измеримая величина: SLO и бюджеты ошибок, multi-burn-rate алерты, четыре золотых сигнала, severity инцидентов и внятное определение «восстановились». Плюс наблюдаемость на eBPF и OpenTelemetry — и грабли вроде HTTP/2 во внутреннем трафике, которые видны только под нагрузкой.
-
HTTP/2 во внутреннем трафике: известный класс граблей
Одно соединение на все запросы, общее окно flow control и пул, который не выбрасывает мёртвое: почему сервисы на HTTP/2 зависают «без ошибок» и что с этим сделали Go и gRPC.
-
Observability 2.0: eBPF, OpenTelemetry и AI, который ищет причину
Инструментация ушла в ядро, телеметрия — в стандарт OTel, поиск причины — к машине. Три сдвига observability 2.0 и порядок, в котором они окупаются.
-
Инцидент, закрытый дважды: severity, роли ICS и три гейта перед recovered
Почему «восстановлено» — самое дорогое слово в инциденте и какие три проверки обязаны пройти до него.
-
Четыре золотых сигнала: что они правда ловят и почему стек — VictoriaMetrics + Loki
Что каждый из четырёх сигналов реально ловит, и три ловушки, при которых «у нас мониторинг есть» оказывается дашбордом с зелёными галочками над сломанным сервисом.
-
Error budget как кнопка «стоп»: SLO без паники и multi-burn-rate
Error budget превращает надёжность в ресурс, который можно тратить, а multi-burn-rate — в алерт, который будит дежурного по делу.