SRE и наблюдаемость

Надёжность как измеримая величина: SLO и бюджеты ошибок, multi-burn-rate алерты, четыре золотых сигнала, severity инцидентов и внятное определение «восстановились». Плюс наблюдаемость на eBPF и OpenTelemetry — и грабли вроде HTTP/2 во внутреннем трафике, которые видны только под нагрузкой.