Observability
Artikel mit dem Tag „Observability“ — Notizen und Analysen zu diesem Thema.
-
Argo Rollouts: Canary und Blue-Green mit metrikbasiertem Auto-Rollback
Ein Standard-RollingUpdate meldet Erfolg, sobald die Pods die Readiness-Probe bestehen. Argo Rollouts macht das Release zur überprüfbaren Hypothese: Canary in Stufen, Blue-Green mit Preview, AnalysisTemplates mit PromQL und SLO-Burn-Rate als automatisches Rollback.
-
Observability 2.0: eBPF, OpenTelemetry und KI, die die Ursache findet
Die Instrumentierung wanderte in den Kernel, die Telemetrie in den OTel-Standard, die Ursachensuche zur Maschine. Drei Verschiebungen — und ihre richtige Reihenfolge.
-
OOMKilled-Forensik: von pmap bis cgroups memory.stat
Exit-Code 137 hinterlässt weder Stack Trace noch eine letzte Logzeile, während das Dashboard schwört, der Speicher hätte gereicht. Die Werkzeuge, die «wohin ging der Speicher» beantworten — solange der Pod noch lebt.
-
Vier goldene Signale: was sie wirklich erfassen und warum der Stack VictoriaMetrics + Loki heißt
Was jedes der vier Signale tatsächlich erfasst und drei Fallen, bei denen „wir haben Monitoring“ zu grünen Häkchen über einem kaputten Service wird.
-
Error Budget als Stopp-Knopf: SLOs ohne Panik
Das Error Budget verwandelt Zuverlässigkeit in eine Ressource, die man ausgeben kann — und Multi-Burn-Rate-Alerts in einen Page, der das Wecken wirklich wert ist.
-
Ein Kubernetes-Debugging-Agent: Abfragevorlagen oder Skripte?
Zinchenko gibt dem LLM MetricsQL-Vorlagen; mein VM-Skill füttert den Agenten mit einem fertigen Aggregat. Ich seziere die Achse Flexibilität gegen Reproduzierbarkeit und warum read-only per Blacklist schwächer ist.