OpenAI bringt o5: zehnmal billiger als o3
6 min read
- OpenAIs o5-mini kostet 90 Prozent weniger als o3 und erreicht bei mehreren Benchmarks dessen Reasoning-Niveau.
- Claude 5 Opus übertrifft o5 bei SWE-bench Verified mit 82,4 Prozent.
- Google hat Gemini 2.5 Pro für alle Nutzer freigeschaltet und die Bezahlschranke komplett entfernt.
- Die neue Serverless-GPU-Stufe von AWS startet bei 0,04 Dollar pro Stunde für eine A10 und unterbietet dedizierte Instanzen.
- Eine lokale Schwachstelle zur Privilegienausweitung im Linux-Kernel, CVE-2026-2841, wurde in 6.14.5 gepatcht.
o5-mini liefert Reasoning auf o3-Niveau zu einem Zehntel der Kosten - ein Preisverfall, der die Ökonomie von Modell-Inference im großen Maßstab neu definiert.
OpenAIs o5 ist da, und der Preiskampf wird ernst
OpenAI hat heute Morgen o5 und o5-mini veröffentlicht, und die Schlagzahl ist der Preis: o5-mini kostet grob ein Zehntel des o3-Preises pro Token und erreicht oder übertrifft bei mehreren Reasoning-Benchmarks dessen Niveau. Das volle o5-Modell erzielt derweil eine um 9 Prozent höhere Erfolgsquote beim ARC-AGI-Benchmark als o3 - mit weniger Compute-Tokens. Für alle, die Batch-Inference betreiben oder Agenten-Schleifen bauen, ist das keine marginale Verbesserung, sondern eine 10-fache Senkung der Input-Kosten für Reasoning.
Die Modellfamilie ist in der API und in ChatGPT verfügbar, wobei die Mini-Variante auf Standard-Hardware eine Time-to-First-Token von 200 ms erreicht. OpenAI liefert außerdem einen neuen Parameter „reasoning effort“, mit dem man zwischen schnellem und tiefem Modus umschalten kann - effektiv ein Trade-off zwischen Latenz und Genauigkeit im laufenden Betrieb. Für Teams, die für anspruchsvolles Reasoning bisher o3-Preise gezahlt haben, ist das die erste echte Chance, diese Workloads ohne Qualitätsabsturz auf eine günstigere Stufe zu verlagern.
Anthropic kontert mit Claude 5 Opus
Anthropic ließ nicht lange auf sich warten. Claude 5 Opus ist heute erschienen und belegt mit einer Erfolgsquote von 82,4 Prozent den Spitzenplatz bei SWE-bench Verified, knapp vor o5 mit 81,1 Prozent. Wichtiger für Produktionsnutzer: Opus 5 hat ein Kontextfenster von 1 Million Token, und Anthropic gibt an, die Kohärenz über die gesamte Spanne zu halten - kein Verlieren des Fadens mehr bei Token 200.000. Der Preis liegt bei 15 Dollar pro Million Input-Tokens, teurer als o5 mit 12 Dollar, aber der Coding-Score und die Kontextlänge sind die Unterscheidungsmerkmale.
Für Teams, die lange Refactorings oder Multi-Datei-Analysen durchführen, ist das Kontextfenster die entscheidende Spezifikation. Claude 5 Opus ist das erste Modell, das ein großes Repository komplett im Speicher halten kann und trotzdem Fragen zu Zeile 3.000 einer Datei beantwortet, die es am Anfang gesehen hat. Die API ist jetzt live, und Anthropic sagt, dass das Modell ab nächster Woche das Standardmodell in Claude Code sein wird.
Google macht Gemini 2.5 Pro kostenlos
Google hat heute die Bezahlschranke für Gemini 2.5 Pro entfernt. Das Modell, das zuvor ein Abo für 20 Dollar pro Monat erforderte, ist jetzt für jeden mit einem Google-Konto verfügbar, inklusive Kontextfenster von 1 Million Token und Datei-Uploads. Die Pro-Stufe mit höheren Rate Limits kostet weiterhin Geld, aber das Basismodell ist jetzt für alle kostenlos.
Das ist eine direkte Reaktion auf den Preisdruck von OpenAI und Anthropic. Googles Schritt geht weniger um die Modellqualität - Gemini 2.5 Pro ist konkurrenzfähig, aber bei den meisten Benchmarks nicht führend - , sondern um die Kontrolle der kostenlosen Stufe. Für Entwickler bedeutet das einen zuverlässigen, kostenlosen Fallback für Langkontext-Aufgaben, die keinen bezahlten API-Aufruf rechtfertigen. Es bedeutet auch, dass die Kosten für das Entwickeln auf Basis von Googles Modellen für Prototypen auf null sinken.
AWS startet eine Serverless-GPU-Stufe für 0,04 Dollar pro Stunde
AWS hat leise ein neues Serverless-GPU-Angebot eingeführt, das bei 0,04 Dollar pro Stunde für eine A10 beginnt, mit A100 für 0,24 Dollar pro Stunde. Die Abrechnung erfolgt pro Sekunde, man zahlt also nur für die tatsächlich genutzte Rechenleistung, und die Instanzen starten in unter 10 Sekunden. Das zielt direkt auf stoßweise Inference-Workloads, die bisher auf dedizierten Instanzen hängen, die rund um die Uhr bezahlt werden.
Der Haken ist das VRAM-Limit von 4 GB auf der Basisstufe, das das Serving großer Modelle ausschließt. Aber für das Feintuning kleiner Modelle, das Ausführen von Embeddings oder das Testen von Inference-Pipelines ist die Rechnung kaum zu schlagen. Ein Monat kontinuierlicher A10-Nutzung zu diesem Satz kostet etwa 29 Dollar, verglichen mit rund 200 Dollar für eine dedizierte Instanz mit ähnlicher Ausstattung. Für Teams, die nur wenige Stunden am Tag GPU-Compute brauchen, ändert das das Kostenmodell komplett.
Kritischer Linux-Kernel-Bug in 6.14.5 gepatcht
Eine lokale Schwachstelle zur Privilegienausweitung im netfilter-Modul des Linux-Kernels, geführt als CVE-2026-2841, wurde im Release 6.14.5 gepatcht. Der Fehler erlaubt es einem unprivilegierten Nutzer, durch Auslösen eines use-after-free im Paketfilter-Code Root-Zugriff zu erlangen. Betroffen sind alle Kernel von 6.12 bis 6.14.4, und der Patch ist eine Ein-Zeilen-Fix, der eine Race Condition im Löschpfad der Regeln entfernt.
Das ist die Art von Bug, die innerhalb von Tagen in freier Wildbahn ausgenutzt wird, daher sollte jeder mit einem Kernel in diesem Bereich sofort aktualisieren. Der Patch ist im Stable-Release 6.14.5 enthalten, und Backports für 6.12 LTS sind in Arbeit. Für Produktionssysteme ist das ein Update mit Priorität - der Exploit erfordert nur lokalen Zugriff, aber eine Root-Shell aus einem kompromittierten Container oder Nutzerkonto ist genau der Ansatzpunkt, den Angreifer wollen.
Rust 1.86 mit neuem Async-Runtime
Rust 1.86 ist heute erschienen und bringt eine bemerkenswerte Neuerung: Die Crate async-std ist jetzt Teil der Standardbibliothek und bietet eine eingebaute Async-Runtime, die kein Einbinden von tokio oder async-std erfordert. Die Runtime nutzt einen Work-Stealing-Scheduler und unterstützt strukturierte Nebenläufigkeit, sodass man async fn ohne die üblichen Ökosystem-Abhängigkeiten schreiben kann. Sie ist noch als instabil markiert, aber es ist ein klares Signal, dass das Rust-Team Async zu einem Bürger erster Klasse machen will und nicht zu einem Add-on.
Für die Tausenden Projekte, die tokio derzeit als Abhängigkeit einbinden, ist das eine langfristige Vereinfachung. Die Leistung ist in frühen Benchmarks konkurrenzfähig mit tokio - innerhalb von 5 Prozent beim Durchsatz - , aber der eigentliche Gewinn ist der reduzierte Abhängigkeitsbaum. Der Stabilisierungszeitplan ist für Rust 1.90 gesetzt, das Ökosystem hat also ein Jahr Zeit für die Migration.
PostgreSQL 18 Beta mit Spaltenverschlüsselung
PostgreSQL 18 ist heute in die Beta gegangen, und das Hauptfeature ist Spaltenverschlüsselung über einen neuen Spaltentyp ENCRYPTED. Die Verschlüsselung ist für die Anwendung transparent - Abfragen funktionieren weiterhin normal, aber die Daten sind im Ruhezustand mit Schlüsseln verschlüsselt, die der Server verwaltet. Die Implementierung nutzt AEAD mit AES-256-GCM, und Schlüssel können ohne Tabellen-Rewrite rotiert werden - das ist das Feature, das es für den Produktionseinsatz praktikabel macht.
Das ersetzt weder Full-Disk-Verschlüsselung noch TLS, aber es adressiert den spezifischen Fall des Schutzes sensibler Spalten - PII, Tokens, Zugangsdaten - vor Diebstahl von Datenbankdateien. Die Beta ist jetzt verfügbar, der Release Candidate wird für November erwartet, das finale Release ist für Dezember geplant. Für Teams, die Spaltenverschlüsselung wegen des operativen Aufwands bisher gemieden haben, beseitigt diese Version den Haupteinwand.
Der Rest: Hardware-Refresh und Protokoll-Update
NVIDIA hat einen Mid-Cycle-Refresh der H200-Reihe angekündigt und fügt eine Variante mit 141 GB und einer um 12 Prozent erhöhten Speicherbandbreite hinzu, zum Preis von 31.000 Dollar. Das Upgrade ist vor allem für Inference-Workloads gedacht, die eher speichergebunden als rechnen-gebunden sind. Separately hat die HTTP/3-Arbeitsgruppe einen aktualisierten Entwurf des QUIC-Protokolls veröffentlicht, der Verbesserungen bei der Verbindungsmigration für Mobilfunknetze hinzufügt. Der Entwurf befindet sich in der Last-Call-Überprüfung, und die Änderungen sind abwärtskompatibel mit bestehenden Deployments. Beides ist inkrementell, aber es lohnt sich, sie zu verfolgen, wenn man an der Hardware- oder Netzwerkkante arbeitet.
Das könnte Sie auch interessieren
OpenAI testet Pay-per-Result-Pricing, während die EU ChatGPT mit DSA-Regeln belegt
OpenAI testet ein ergebnisbasiertes Preismodell für ausgewählte Unternehmenskunden, die nur zahlen, wenn eine KI eine Aufgabe abschließt. EU-Regulierer stuften …
GPT-6 wird billiger, Opus 5.5 wird billiger, und ein Benchmark ertappt Modelle beim Schummeln
OpenAI hat leise GPT-6 Sol und Luna veröffentlicht, schnellere und günstigere Geschwister des Flaggschiff-Modells Astra, während Anthropics neues Claude Opus …
GPT-6 Luna halbiert KI-Preise, während die Agenten-Ökonomie hässlich wird
OpenAI und Anthropic haben innerhalb einer Stunde jeweils Flaggschiff-Modelle veröffentlicht, und OpenAIs GPT-6 Luna unterbietet seinen Vorgänger um 50 % pro …




