Kubernetes verrät endlich, welche PVCs überflüssig sind
7 min read · 12 sources
- Kubernetes v1.37 macht PersistentVolumeClaimUnusedSinceTime standardmäßig zu Beta und fügt eine Unused-Bedingung hinzu, um PVCs zu kennzeichnen, auf die kein laufender Pod verweist.
- Cloudflare Python Workers sind allgemein verfügbar und laufen nativ mit FastAPI, Django und Flask sowie Bindings zu R2, D1 und Queues.
- Die Interoperabilitätsumfrage zu Prometheus/OpenTelemetry zeigt, dass der Anteil der „schwer zusammen zu nutzen"-Antworten seit 2024 von 29 % auf 10 % gefallen ist.
- Ein Plattform-Team verkürzte die CI-Pipeline-Zeit um 64 % (von 60 auf 22 Minuten) und vergrößerte die Testsuite um 90 %, hauptsächlich durch Upgrades der Compute-Instanzen.
- Microsoft hat TauGrid als Open Source veröffentlicht und vereinheitlicht Kueue, KubeRay und GPU-Health-Monitoring in einer einzigen Helm-Installation für KI-Workloads.
Jeder Kubernetes-Administrator hat ein Skript, das PVCs mit laufenden Pods abgleicht, um verwaisten Speicher zu finden, der stillschweigend Cloud-Kosten verursacht. Mit v1.37 ist dieses Skript überflüssig. Das PersistentVolumeClaimUnusedSinceTime-Feature-Gate ist jetzt Beta und standardmäßig aktiviert, und der PVC-Protection-Controller stempelt eine Unused-Bedingung auf jeden Claim, auf den kein laufender oder anstehender Pod verweist. Beendete Pods zählen nicht als Nutzer. Sie erhalten einen Zeitstempel dafür, wann der Claim inaktiv wurde, was bedeutet, dass Sie endlich einen Einzeiler schreiben können, um jeden PVC zu finden, der seit 30 Tagen kalt ist, und ihn mit Zuversicht zu löschen.
Das ist der leise Gewinn des Tages. Der laute ist, dass Cloudflare endlich Python als erstklassigen Workers-Bürger ausliefert, und das ist eine größere Sache, als die Release-Notes vermuten lassen.
Der Anteil der Ingenieure, die Prometheus und OpenTelemetry als schwer zusammen nutzbar empfinden, ist in zwei Jahren von 29 % auf 10 % gesunken.
Kubernetes v1.37: Die Control Plane verfolgt jetzt Ihren verwaisten Speicher
Die Unused-Bedingung landet auf jedem PersistentVolumeClaim, gesetzt vom PVC-Protection-Controller basierend darauf, ob ein laufender oder anstehender Pod darauf verweist. Der an der Bedingung hängende Zeitstempel sagt Ihnen genau, wann der Claim nicht mehr genutzt wurde, sodass Cleanup-Richtlinien PVCs ansprechen können, die über bestimmte Zeiträume inaktiv waren, statt zu raten.
Für große Cluster tötet das eine ganze Kategorie von Sonderanfertigungen. Teams, die Hunderte von Namespaces betreiben, pflegen typischerweise Cron-Jobs oder Admission-Webhooks, um nach Claims zu suchen, die bereitgestellt, aber nie gemountet wurden. Das sind stille Kosten - bereitgestellter Speicher, für den Sie bezahlen, ob etwas darauf zugreift oder nicht. Die neue Bedingung macht die Daten nativ für den API-Server, abfragbar mit einem Standard-kubectl get pvc -o jsonpath-Ausdruck. Keine neuen Komponenten, keine CRDs, nur eine Bedingung auf einer Ressource, die Sie bereits überwachen.
Python Workers erreichen GA, und die TypeScript-Brücke ist weg
Cloudflare hat Python Workers allgemein verfügbar gemacht, und die wichtigste Änderung ist, dass Python jetzt eine erstklassige Sprache auf der Workers-Runtime ist. Bindings zu Workers AI, R2, D1, Queues und dem Rest der Plattform funktionieren nativ. Frameworks wie FastAPI, Django und Flask laufen ohne Klebercode.
Das bisherige Modell zwang Python-Entwickler, Objekte an der RPC-Grenze in TypeScript zu konvertieren - ein Serialisierungs-Tanz, der jeder Edge-Funktion Latenz und kognitive Belastung hinzufügte. Das ist weg. Wenn Sie Workers aufgeschoben haben, weil Ihre Logik in Python liegt und die Interop-Schicht fragil wirkte, ist der Grund zu warten gerade verdampft. Die praktische Konsequenz: Teams können jetzt bestehende Python-Dienste an die Edge portieren, ohne sie in einer zweiten Sprache neu zu schreiben, was die Kosten-Nutzen-Rechnung für Edge-Deployments für viele Läden verändert.
Prometheus und OpenTelemetry lernen, sich zu vertragen
Die Interoperabilitätsumfrage 2026 vom Prometheus-Projekt hat eine Zahl, die man auf sich wirken lassen sollte: Der Anteil der Befragten, die die beiden als schwer zusammen nutzbar empfinden, ist von 29 % im Jahr 2024 auf jetzt 10 % gefallen. Die Bewertungen zur Benutzerfreundlichkeit stiegen von 3,1 auf 3,6. Die Stichprobe ist klein - 186 Befragte, 81 qualifiziert - aber die Richtung ist eindeutig.
Die Instrumentierungs-Aufteilung ist aufschlussreich. Für Infrastruktur führen Prometheus-Exporter (72 %) und OTel-Receiver (57 %). Für Anwendungscode dominieren OTel-SDKs mit 65 %. Fast die Hälfte der Befragten betreibt beide Stacks gleichzeitig. Die praktische Erkenntnis: Die Ökosysteme haben sich in eine Arbeitsteilung eingefunden statt in einen Kampf. Prometheus besitzt den Infrastruktur-Scrape-Pfad; OpenTelemetry besitzt den Anwendungsinstrumentierungspfad. Die Interop-Arbeit zahlt sich aus, und die „sehr schwierig"-Fraktion ist praktisch verschwunden.
CI-Zeit um 64 % kürzen: Der langweilige Hardware-Upgrade gewinnt wieder
Source: platformengineering.org ↗
Ein Plattform-Engineering-Team verkürzte seine Merge-Train-Pipeline von ~60 Minuten auf 22 Minuten - eine Reduzierung um 64 % - während die Testsuite um 90 % wuchs und die CI-Gesundheit von ~82 % auf über 90 % stieg. Der größte Hebel war kein raffinierter Cache oder Test-Parallelisierung. Es war die Migration der Compute von einer C5-Flotte auf neuere Hardware-Generationen. AMD sah zunächst am besten aus, aber das Team entschied sich nach Benchmarks für Intel.
Die Methodik zählt so viel wie das Ergebnis. Das Team änderte jeweils eine Variable, um die Auswirkung zu verfolgen, und isolierte so den Hardware-Gewinn von den Test-Splitting-Änderungen. Die monatlichen Infrastrukturkosten stiegen trotz der schnelleren Flotte und der größeren Suite nur um ~10 % - ein Handel, den die meisten Teams ohne Zögern annehmen würden. Die geschätzte Auszahlung: über 1.300 Ingenieursstunden zurückgewonnen, die zuvor durch Verzögerungen und Wiederholungen verloren gingen.
Was Sun falsch machte: Betriebliche Langeweile
Source: bcantrill.dtrace.org ↗
Bryan Cantrills Post-Mortem über Sun Microsystems destilliert das Scheitern des Unternehmens zu einer Langeweile mit den Mechanismen des Geschäftsbetriebs. Die Anekdote, die es trifft: 2005 wollte ein Startup, das OpenSolaris betrieb, Sun-Hardware kaufen und konnte Sun nicht dazu bringen zu reagieren. Dells lokaler Account-Executive rief am nächsten Morgen zurück und schloss den Deal in unter zwei Wochen ab.
Die Lektion für jeden, der heute Infrastruktur betreibt, ist unbequem. Technische Überlegenheit verdampft schnell, wenn Vertrieb, Support und Reaktionsfähigkeit ein Nachgedanke sind. Sun paarte großartige Technologie mit betrieblichem Desinteresse und verlor das Geschäft an einen reaktionsschnelleren Konkurrenten, der minderwertige Hardware verkaufte. Es ist eine Erinnerung daran, dass die langweiligen Teile - der Account-Executive, der zurückruft, das Ticket, das beantwortet wird - der Burggraben sind.
Markdown in /src: Die Quelle der Wahrheit für agentengenerierten Code
Carson Gross argumentiert in Markdown in /src, dass Markdown Quellcode wird, nicht Dokumentation. Agentische Codierungs-Workflows definieren Anwendungslogik zunehmend in Prompt-Sessions, und diese Sessions sind flüchtig. Wenn die Session endet, wird der generierte Code zur einzigen Grundlage der Wahrheit - und das ist ein fehlerhaftes Modell.
Die Lösung: Das Markdown, das die Absicht definiert, in /src persistieren, eingecheckt zusammen mit dem Code. Das macht es diffbar, überprüfbar und sowohl für Menschen als auch für Agenten verfügbar. Tests können daraus abgeleitet werden, um zu verifizieren, dass die Implementierung der Absicht entspricht. Das Argument dreht sich wirklich um Reproduzierbarkeit - Compiler behalten Quellcode, also sollten LLM-Workflows das auch tun. Wenn Sie auf agentengeneriertem Code aufbauen, ist die Frage nicht, ob Sie das übernehmen; es ist, ob Sie möchten, dass Ihr Prompt-Verlauf die einzige Aufzeichnung dafür ist, warum der Code existiert.
Ax: Googles Orchestrator für Milliarden von Agenten auf Kubernetes
Googles Ax ist ein deklarativer Orchestrator für den Betrieb autonomer Agent-Workloads in massivem Maßstab auf Kubernetes. Es verwendet Agent Substrate für sandboxierte Ausführung und stellt vier Primitive - Task, Workspace, Gateway und Model - als ax.io/v1alpha1-Manifeste bereit. Befehle wie ax apply, ax watch, ax ssh und ax suspend/resume verwalten den Lebenszyklus.
Die Designziele sind Isolation, Netzwerk-Abgrenzung und Kostenkontrolle - die drei Dinge, die schiefgehen, wenn Sie Agenten frei laufen lassen. Es ist vor-stabil mit erwarteten größeren Breaking Changes, und es erfordert einen Kubernetes-Cluster, ko und ein Container-Registry zum Deployment. Noch nicht für die Produktion, aber der deklarative Manifest-Ansatz ist die richtige Form für die Verwaltung von Flotten autonomer Workloads.
Treg: OpenRouter für Agent-Tools
Treg ist ein Open-Source-Proxy, der sich als „OpenRouter, aber für Agent-Tools" positioniert. Es katalogisiert über 3.000 Endpunkte von über 60 Anbietern - SEO, Social, Enrichment, Scraping - abgerechnet pro Aufruf ab einem Cent, ohne Anbieter-Registrierung. Anmeldedaten werden serverseitig injiziert, sodass Aufrufer nie Schlüssel halten. Es unterstützt sowohl Tregs eigene Schlüssel als auch teamregistrierte Tools (APIs, OAuth, CLIs, SKILL.md).
Der Pitch ist unkompliziert: Statt monatlicher Abonnements für Semrush oder Moz zu pflegen, zahlen Sie pro Aufruf über einen gemeinsamen Pool. Neue verifizierte Konten erhalten $1,00 kostenlos. Gehostet bei treg.to oder selbst hostbar. Für Agent-Builder entfernt das den Kopfschmerz der Anmeldedatenverwaltung, der normalerweise mit dem Verdrahten von Tool-Aufrufen einhergeht.
Microsoft veröffentlicht TauGrid als Open Source für GPU-Workloads
Microsoft hat TauGrid als Open Source veröffentlicht, eine cloud-native Plattform zur Verwaltung, Planung und Überwachung von KI-Workloads auf GPU-fähigen Kubernetes-Clustern. Es vereinheitlicht Kueue (Queueing), KubeRay (Orchestrierung), GPU-Node-Health-Monitoring und Observability in einer einzigen Helm-Installation. Workloads werden über eine tau.yaml-Konfiguration definiert und mit tau run eingereicht. Es unterstützt checkpoint-basierte Wiederaufnahme bei Fehlern, und die Roadmap umfasst Multi-Tenant-Workspaces, RBAC und PyTorch-DDP/FSDP-Unterstützung.
Der Wert ist Konsolidierung. Teams, die GPU-Workloads betreiben, setzen typischerweise Kueue für das Queueing, KubeRay für Ray-Cluster und benutzerdefinierte Health-Checks für unzuverlässige GPUs zusammen. TauGrid verpackt das in eine Installation. Noch früh, aber der vereinheitlichte Ansatz ist eine direkte Antwort auf die operative Ausuferung der KI-Infrastruktur.
Der Rest: Forrester, TanStack und die Weisheitsfrage
Google wurde als Leader im Forrester Wave für Externe Threat Intelligence benannt und erzielte 5,0 in neun Kriterien. Der Bericht stellt fest, dass Google der einzige Anbieter ist, der auch ein Frontier-KI-Modellentwickler ist, was Agenten ermöglicht, die sich aktiv weiterentwickeln statt zusammenzufassen.
TanStack Charts erreichte Alpha als framework-unabhängige Grammatik der Grafik für TypeScript mit ~160.000 wöchentlichen Downloads. Es wurde „fast vollständig" mit KI-Codierungsagenten unter Aufsicht produziert. Ein kommerzieller Konkurrent merkt an, dass es besser für einfachere Diagramme geeignet ist als für schwere Echtzeit-Workloads.
Schließlich argumentiert KI hat keine Weisheit und Sie auch nicht, dass Code-Wartbarkeit keine unmittelbaren Messungen hat, sodass KI, die auf Anfänger-Regelwerken trainiert ist, nicht lernen kann, was Code wartbar macht - das braucht Monate oder Jahre der Beobachtung. Die Warnung: Entwickler, die aufhören, Code zu lesen und zu schreiben, werden vibe-codierte Projekte produzieren, die mit der Zeit degenerieren.
Das könnte Sie auch interessieren
Salesforce strauchelt, Kubernetes bekommt Ressourcenkontrolle auf Pod-Ebene, und was das Geschirr Ihres Coding-Agents kostet
Salesforce verbrachte Stunden mit einem globalen Ausfall, der Anfragen an einen internen Login-Dienst blockierte und Serverressourcen über Hunderte von …
K8s Memory QoS erreicht Beta, Cilium 1.20 ist da, und Cloudflare zieht eine Linie bei KI-Crawlern
Kubernetes v1.37 bringt Memory QoS in die Beta-Phase, sodass Cluster-Betreiber endlich aufhören können, cgroup-Knöpfe für latenzsensitive Workloads manuell zu …
OpenAI Agents API in öffentlicher Beta, Cloudflare beseitigt TLS-Handshake-Verzögerung
OpenAI hat die Agents API in die öffentliche Beta gebracht und ermöglicht Entwicklern, Cloud-Agenten auf derselben Plattform zu bauen, die auch Codex antreibt, …




