Incidentes
Artículos etiquetados Incidentes: notas y análisis agrupados por este tema.
-
Drift detection en 2026: de la alerta al remediation as code
Plan dice «no changes» mientras un security group sigue abierto a internet. Los cuatro puntos ciegos de la detección de una sola capa y dónde parar la corrección automática.
-
HTTP/2 en el tráfico interno: una clase conocida de trampas
Una conexión para todas las peticiones, una ventana de flow control compartida y un pool que nunca expulsa lo muerto: por qué los servicios HTTP/2 se cuelgan «sin errores» y qué hicieron Go y gRPC.
-
Un incidente cerrado dos veces: severity, ICS y tres gates
Por qué «recovered» es la palabra más cara de un incidente y las tres comprobaciones que deben pasar antes.
-
OOMKilled: análisis forense de pmap a cgroups memory.stat
El exit code 137 no deja ni stack trace ni última línea de log, mientras el dashboard jura que la memoria sobraba. Las herramientas que responden «adónde se fue la memoria» — mientras el pod sigue vivo.