Engineering-Notizen
Platform Engineering · Notizen
Originale Analysen zu Plattformen, Kubernetes, Cloud, SRE, Sicherheit und FinOps.
-
Atomares Deployment einer statischen Website ohne git und ohne Transaktionen
Atomares Deployment einer statischen Website ohne git auf dem Server: die Gegenseite bietet nur scp und ssh. Eine Transaktion lässt sich daraus nicht bauen, ein Deploy, der Abbrüche übersteht und folgenlos wiederholbar ist, schon.
-
Crossplane gegen Terraform: Control Plane statt State-Datei
Terraform hält einen Snapshot des Zustands in einer Datei und gleicht ihn auf Zuruf ab, Crossplane macht die Kubernetes-API zur Control Plane und gleicht permanent ab. Was Version zwei geändert hat, wo der permanente Abgleich gewinnt und was er kostet.
-
Argo Rollouts: Canary und Blue-Green mit metrikbasiertem Auto-Rollback
Ein Standard-RollingUpdate meldet Erfolg, sobald die Pods die Readiness-Probe bestehen. Argo Rollouts macht das Release zur überprüfbaren Hypothese: Canary in Stufen, Blue-Green mit Preview, AnalysisTemplates mit PromQL und SLO-Burn-Rate als automatisches Rollback.
-
Multi-Cluster-ArgoCD: Hub-and-Spoke gegen Per-Cluster und wo beide Pull-Mode brauchen
Hub-and-Spoke ist der Default, bricht aber an Blast Radius, Inbound-Netzwerk und Compliance. Wann Per-Cluster local, wann Pull-Mode, und wie ein Hybrid ohne Ideologie aussieht.
-
Policy as Code in der AI-Code-Ära: das Paradox aus Geschwindigkeit und Kontrolle
Das Tempo von Production-Code überholt das Human Review. Ohne deterministic Guardrails in CI und Admission wird ein AI-Agent zum Verstärker von Fehlern — nicht von Durchsatz.
-
Der Golden Path als Produkt: warum die schlankste tragfähige Plattform den Fünf-Jahres-Bau schlägt
Bauen Sie die Plattform schmal — einen Pfad nach dem anderen — und standardisieren Sie den Prozess, bevor Sie ihn automatisieren. Sonst liefern Sie ein Monument, das niemand nutzt.
-
Internal Developer Platform: Sechs Schichten und drei Treiber der Einführung
Eine IDP ist nicht „noch ein Portal“, sondern ein Produkt für Entwickler. Warum Platform Engineering gerade jetzt durchstartet, aus welchen sechs Schichten eine funktionierende Kubernetes-Plattform besteht und welche vier Fehler ein Portal in einem halben Jahr töten.
-
Production-Dockerfile: distroless, Build-Cache und Secrets
Eine Checkliste von rund zehn Zeilen: Was in die Produktion fährt und was in der Builder-Stage bleibt. Gemessene Basis-Images, BuildKit-Cache-Mounts, Secrets ohne Spur in den Schichten und Attestierungen, die von selbst kommen.
-
Istio Ambient Mesh: sidecarless und das Ende des doppelten Hops
Ambient hat Envoy aus jedem Pod genommen. Wo das den doppelten Hop und den Overhead beseitigt — und wo der Sidecar noch gerechtfertigt ist.
-
Cilium und eBPF: kube-proxy ersetzen und iptables aus dem Kubernetes-Netzwerk entfernen
Alle sehen eBPF als Tempogewinn, doch der eigentliche Wert ist eine Entscheidungsregel: wo sich der Ersatz von kube-proxy lohnt und wo iptables noch gewinnt.
-
Ingress NGINX am EOL: Migration zu Gateway API ohne Panik
Warum das Ende von kubernetes/ingress-nginx eine Risikofrage ist, kein Roadmap-Thema, und wie man schrittweise zu Gateway API wechselt.
-
OOMKilled-Forensik: von pmap bis cgroups memory.stat
Exit-Code 137 hinterlässt weder Stack Trace noch eine letzte Logzeile, während das Dashboard schwört, der Speicher hätte gereicht. Die Werkzeuge, die «wohin ging der Speicher» beantworten — solange der Pod noch lebt.
-
Kubernetes 1.36 (Haru): Was sich in der Produktion wirklich ändert
Mutating Webhooks fangen an zu sterben, Ingress NGINX ist retired, HPA Scale-to-Zero bleibt Alpha. Pragmatische 1.36-Triage für das Plattform-Team — ohne Blog-Hype.
-
Ein Kubernetes-Debugging-Agent: Abfragevorlagen oder Skripte?
Zinchenko gibt dem LLM MetricsQL-Vorlagen; mein VM-Skill füttert den Agenten mit einem fertigen Aggregat. Ich seziere die Achse Flexibilität gegen Reproduzierbarkeit und warum read-only per Blacklist schwächer ist.
-
Drift Detection 2026: vom Alert zu Remediation as Code
Plan meldet „no changes“, während eine Security Group offen im Internet steht. Die vier blinden Flecken einstufiger Detektion und die Grenze automatischer Korrektur.
-
OpenTofu vs Terraform 2026: wann sich der Fork schon lohnt
Die Frage ist nicht mehr, ob der Fork sicher ist, sondern wann er das Original schlägt. Funktionen, Lock-in und Migrationskosten 2026.
-
OIDC → AWS STS: CI/CD ohne langlebige Schlüssel
Föderierte Identität ersetzt AWS_ACCESS_KEY_ID im CI/CD: ein Muster für GitHub, GitLab und Atlantis — ohne Rotation, mit echter CloudTrail-Attribution.
-
HTTP/2 im internen Traffic: eine bekannte Klasse von Fallstricken
Eine Verbindung für alle Requests, ein geteiltes Flow-Control-Fenster und ein Pool, der Totes nie aussortiert: warum HTTP/2-Services „ohne Fehler“ hängen — und was Go und gRPC dagegen taten.
-
Observability 2.0: eBPF, OpenTelemetry und KI, die die Ursache findet
Die Instrumentierung wanderte in den Kernel, die Telemetrie in den OTel-Standard, die Ursachensuche zur Maschine. Drei Verschiebungen — und ihre richtige Reihenfolge.
-
Ein zweimal geschlossener Incident: Severity, ICS, drei Gates
Warum «recovered» das teuerste Wort in einem Incident ist — und die drei Prüfungen, die davor bestehen müssen.
-
Vier goldene Signale: was sie wirklich erfassen und warum der Stack VictoriaMetrics + Loki heißt
Was jedes der vier Signale tatsächlich erfasst und drei Fallen, bei denen „wir haben Monitoring“ zu grünen Häkchen über einem kaputten Service wird.
-
Error Budget als Stopp-Knopf: SLOs ohne Panik
Das Error Budget verwandelt Zuverlässigkeit in eine Ressource, die man ausgeben kann — und Multi-Burn-Rate-Alerts in einen Page, der das Wecken wirklich wert ist.
-
CSP hinter dem Consent-Gate: Warum ein grüner Header nichts beweist
Der Evaluator meldete zwei Fehler, beide erwiesen sich als tote Einträge. Der eigentliche Defekt kam erst zum Vorschein, als die Prüfung am Verhalten des Browsers ansetzte.
-
External Secrets Operator + Workload Identity: Zugriff auf Secrets ohne einen einzigen langlebigen Schlüssel
Ein externer Secret Store klärt, wo Secrets leben — und erzeugt ein neues Secret: die Zugangsdaten zum Store selbst. Wie ESO und Workload Identity die Schleife ohne langlebige Schlüssel schließen.
-
Cyber Resilience Act: warum die SBOM bis September 2026 nötig ist, nicht erst 2027
Alle blicken auf Dezember 2027, doch die Meldung ausgenutzter Schwachstellen beginnt ein Jahr früher — und ohne Komponenten-Inventar lässt sie sich nicht erfüllen.
-
SLSA L0–L3 und Provenance: eine Vertrauenskette vom Commit bis zur Admission
Ein SBOM sagt «was drin ist», eine Signatur «wer signiert hat». Dazwischen liegt Provenance — «wie gebaut wurde». Seit SolarWinds muss Admission genau das fragen.
-
DevSecOps in fünf Stages: vom Secret-Scan bis zur Admission Policy
Fünf CI-Stages mit exit-code 1 plus ein Admission-Gate im Cluster — das einzige Muster, in dem DevSecOps Production tatsächlich blockiert statt als Ritual grüner Häkchen zu laufen.
-
OpenCost: Kubernetes-Kostenallokation nach Namespace und Pod
Die Cloud-Rechnung kennt den Preis der Instanz, nicht den des Service. OpenCost (CNCF Incubating) verteilt die Cluster-Kosten auf Namespaces und Pods: der Engine und seine Fallen, der Vergleich mit Kubecost und AWS SCAD, Idle Cost und der Weg zur Unit Economics.
-
Drei Hebel gegen Kubernetes-Mehrkosten: Idle, Scale-to-Zero, Right-Sizing
Ein durchschnittlicher Cluster läuft bei 20–30% Auslastung. Den Rest zahlen Sie umsonst. Drei Hebel, die das Geld zurückholen — ohne Re-Architektur.
-
FinOps ist Rationalität, kein Kostensenken
Cloud-Mehrausgaben sind keine Nachlässigkeit, sondern die Summe lokal rationaler Entscheidungen. Ändern Sie die Informationsumgebung, nicht die Menschen.
-
Native gegen normalisierte Tokens: warum die eigene Kostenformel von der OpenRouter-Rechnung abweicht
Drei Systeme zeigten drei Summen für dasselbe Fenster. Nur eine davon war eine unabhängige Messung, und die Tokens in der Antwort waren nicht die Tokens auf der Rechnung.
-
Die Agentenschleife unter einem Durable-Orchestrator: wo die Grenze verläuft
Agentengraph und Durable-Execution-Engine sind beide Orchestratoren. Ein Monat auf dem Prüfstand zeigte, wo die Grenze verläuft und was sie kostet.
-
Ein Staff Engineer aus Subagenten: Was ich übernehme und was nicht
Das Senior-Staff-Engineer-Muster für Claude Code, gelesen von einem Ingenieur mit eigenen Vier-Rollen-Subagenten-Teams: Kontextisolation und Verification-Gate — ja; 1%-Regel und Delete-Regel — nein.
-
MCP für DevOps: mit einem Read-only-Agenten im Cluster beginnen
Anfang 2026 gibt es über 10.000 MCP-Server. Der erste, den ein Agent im Cluster bekommen sollte, ist read-only — was er bringt und wie man Zugriff vergibt.
-
KI schreibt DevOps neu: von der Syntax zum Urteil
Was KI heute besser kann als ein Ingenieur, wo der menschliche Mehrwert bleibt und wie sich die Senior-DevOps-Rolle bis 2026 verschiebt.
-
Eine lokale LLM fürs Coden: nicht «welche», sondern «wo»
Eine Besprechung der praktischen Methode, ein lokales Coding-Modell nach Hardware zu wählen — und wo lokale Modelle eine echte Nische haben, während nur die Cloud die Präzision hält.
-
Der Terminal-Stack 2026 mit Linux-Augen: Was portabel ist und was MacBook-Optik
Der Leitfaden zum „ultimativen Stack 2026" ist für macOS geschrieben. Ich bespreche ihn aus dem Linux/Wayland-Stuhl: Ghostty gegen Konsole, starkes Backend, offene Lücken.
-
Agenten-Sicherheit: Enterprise-Muster in einen Solo-Harness portiert
Biswas' Architektur deckt die Identitätsebene per OAuth und Token Exchange gut ab — doch die echte Gefahr lebt auf der Absichtsebene, die der Artikel nie erreicht.
-
Tokens sparen in Agenten: Was der Überblick richtig macht und was überverkauft ist
Eine Karte von vier Token-Kosten-Techniken — Caching, Lazy-Tools, Routing, Kompaktion. Die eigentliche Folge des Cache versteckt sie in einer Fußnote, während zwei kontraintuitive Fakten die ganze Karte wert sind.
-
Die kurze Memory-Datei bricht im großen Maßstab zusammen: Token gegen Regel-Vorrang
Die Memory-Datei winzig zu halten stimmt für ein Solo-Repository. Doch Compliance-Regeln mehrerer Organisationen lassen sich nicht an Pfade binden — sie müssen geroutet werden.
-
Ein Obsidian-Zweitgehirn ist eine Schicht, nicht das ganze Agenten-Gedächtnis
Monteiros zoniertes Wiki ist der richtige Mechanismus, doch Agenten-Gedächtnis ist eine Taxonomie von Schichten; jede Schicht, die die Außenwelt ingestiert, muss vor der Synthese auf Injektion gescannt werden.
-
CLAUDE.md: Vertrag oder Schichten? Wo die virale Datei recht hat und wo nicht
Die virale CLAUDE.md hat recht für den Median: flach beginnen. Doch Compliance lässt sich nicht erbitten — sie muss mechanisiert werden. Was in die Datei gehört und was in die Harness.
-
Das Harness ist der billige Teil: Notizen zum Nachbau von Claude Code
Ein Kommentar zu Fareed Khans Nachbau von Claude Code von Grund auf — und warum man seine zentrale Schlussfolgerung umdrehen sollte.
-
Claude Code ist eine Fertigkeit: Anmerkungen zu Leo Godins These
Zustimmung zur These „LLMs sind eine Fertigkeit“ und Ergänzung um die Erfahrung, die das Original auslässt.
-
Sollte man 2026 noch Programmieren lernen — Anmerkungen zu Marina Wyss
Ein Kommentar zu ihrem Medium-Text: wo sie recht hat, wo sie vereinfacht und was ich ergänzen würde.