Incidents
Artikel mit dem Tag „Incidents“ — Notizen und Analysen zu diesem Thema.
-
Drift Detection 2026: vom Alert zu Remediation as Code
Plan meldet „no changes“, während eine Security Group offen im Internet steht. Die vier blinden Flecken einstufiger Detektion und die Grenze automatischer Korrektur.
-
HTTP/2 im internen Traffic: eine bekannte Klasse von Fallstricken
Eine Verbindung für alle Requests, ein geteiltes Flow-Control-Fenster und ein Pool, der Totes nie aussortiert: warum HTTP/2-Services „ohne Fehler“ hängen — und was Go und gRPC dagegen taten.
-
Ein zweimal geschlossener Incident: Severity, ICS, drei Gates
Warum «recovered» das teuerste Wort in einem Incident ist — und die drei Prüfungen, die davor bestehen müssen.
-
OOMKilled-Forensik: von pmap bis cgroups memory.stat
Exit-Code 137 hinterlässt weder Stack Trace noch eine letzte Logzeile, während das Dashboard schwört, der Speicher hätte gereicht. Die Werkzeuge, die «wohin ging der Speicher» beantworten — solange der Pod noch lebt.