Наблюдаемость
Материалы с тегом «Наблюдаемость» — разборы и заметки, сгруппированные по этой теме.
-
Argo Rollouts: canary и blue-green с авто-rollback по метрикам
Стандартный RollingUpdate объявляет успех, когда поды прошли readiness probe. Argo Rollouts делает выкатку проверяемой гипотезой: canary по шагам, blue-green с preview, AnalysisTemplate с PromQL и burn rate SLO как авто-rollback без участия человека.
-
Observability 2.0: eBPF, OpenTelemetry и AI, который ищет причину
Инструментация ушла в ядро, телеметрия — в стандарт OTel, поиск причины — к машине. Три сдвига observability 2.0 и порядок, в котором они окупаются.
-
OOMKilled-форензика: от pmap до cgroups memory.stat
Exit code 137 не оставляет ни stack trace, ни финальной строки в логах, а дашборд клянётся, что памяти хватало. Инструменты, которые отвечают на вопрос «куда ушла память», — пока под ещё жив.
-
Четыре золотых сигнала: что они правда ловят и почему стек — VictoriaMetrics + Loki
Что каждый из четырёх сигналов реально ловит, и три ловушки, при которых «у нас мониторинг есть» оказывается дашбордом с зелёными галочками над сломанным сервисом.
-
Error budget как кнопка «стоп»: SLO без паники и multi-burn-rate
Error budget превращает надёжность в ресурс, который можно тратить, а multi-burn-rate — в алерт, который будит дежурного по делу.
-
Отладочный агент для Kubernetes: шаблоны запросов или скрипты?
Агент Зинченко даёт LLM шаблоны MetricsQL; мой VM-навык кормит агента готовым агрегатом. Разбираю ось гибкость против воспроизводимости и почему read-only по блэклисту слабее allowlist.