SRE y observabilidad
Fiabilidad como algo medible: SLO y presupuestos de error, alertas multi-burn-rate, las cuatro señales doradas, severidad de incidentes y una definición sólida de «recuperado». Además observabilidad con eBPF y OpenTelemetry, y trampas como HTTP/2 en el tráfico interno.
-
HTTP/2 en el tráfico interno: una clase conocida de trampas
Una conexión para todas las peticiones, una ventana de flow control compartida y un pool que nunca expulsa lo muerto: por qué los servicios HTTP/2 se cuelgan «sin errores» y qué hicieron Go y gRPC.
-
Observability 2.0: eBPF, OpenTelemetry e IA que encuentra la causa raíz
La instrumentación bajó al kernel, la telemetría al estándar OTel y la causa raíz migra hacia la máquina. Tres desplazamientos y el orden en que se amortizan.
-
Un incidente cerrado dos veces: severity, ICS y tres gates
Por qué «recovered» es la palabra más cara de un incidente y las tres comprobaciones que deben pasar antes.
-
Cuatro señales doradas: qué capturan de verdad y por qué el stack es VictoriaMetrics + Loki
Qué captura cada una de las cuatro señales y tres trampas donde «tenemos monitoring» acaba siendo marcas verdes sobre un servicio roto.
-
Error budget como botón de parada: SLO sin pánico
El error budget convierte la fiabilidad en un recurso que puedes gastar — y las alertas multi-burn-rate en un aviso que de verdad merece despertarte.