SRE & Observability
Zuverlässigkeit als messbare Größe: SLOs und Error Budgets, Multi-Burn-Rate-Alerts, die vier goldenen Signale, Incident-Severity und eine belastbare Definition von „wiederhergestellt“. Dazu Observability mit eBPF und OpenTelemetry — und Fallen wie HTTP/2 im internen Traffic.
-
HTTP/2 im internen Traffic: eine bekannte Klasse von Fallstricken
Eine Verbindung für alle Requests, ein geteiltes Flow-Control-Fenster und ein Pool, der Totes nie aussortiert: warum HTTP/2-Services „ohne Fehler“ hängen — und was Go und gRPC dagegen taten.
-
Observability 2.0: eBPF, OpenTelemetry und KI, die die Ursache findet
Die Instrumentierung wanderte in den Kernel, die Telemetrie in den OTel-Standard, die Ursachensuche zur Maschine. Drei Verschiebungen — und ihre richtige Reihenfolge.
-
Ein zweimal geschlossener Incident: Severity, ICS, drei Gates
Warum «recovered» das teuerste Wort in einem Incident ist — und die drei Prüfungen, die davor bestehen müssen.
-
Vier goldene Signale: was sie wirklich erfassen und warum der Stack VictoriaMetrics + Loki heißt
Was jedes der vier Signale tatsächlich erfasst und drei Fallen, bei denen „wir haben Monitoring“ zu grünen Häkchen über einem kaputten Service wird.
-
Error Budget als Stopp-Knopf: SLOs ohne Panik
Das Error Budget verwandelt Zuverlässigkeit in eine Ressource, die man ausgeben kann — und Multi-Burn-Rate-Alerts in einen Page, der das Wecken wirklich wert ist.