BriefTechNews

GPT-6 Luna halbiert Preise, Opus 5.5 erscheint, und der KI-Preiskrieg beginnt

7 min read · 14 sources

TL;DR
  • GPT-6 Luna kostet 0,10 $/M Input und 0,50 $/M Output, halb so viel wie GPT-5.6 Luna.
  • Claude Opus 5.5 ist pro Token günstiger als Opus 5.0 und erreicht die Intelligenz von Fable 5.1.
  • Die Kosten für KI-Leistung fielen seit 2023 pro Quartal um 47 %, ein jährlicher Rückgang um das 13-Fache.
  • GPT-5.6 Luna erreicht 75 % auf GPQA Diamond für 0,0004 $ pro Frage, gegenüber 30 Cent bei o3.
  • Googles Intrinsic hat Intrinsic Core unter Apache 2.0 auf der ROSCon 2026 als Open Source veröffentlicht.

Der KI-Preiskrieg ist gerade deutlich konkreter geworden. Innerhalb einer Stunde haben Anthropic und OpenAI beide neue Modelle veröffentlicht: Claude Opus 5.5, GPT-6 Sol und GPT-6 Luna. Die Schlagzeile ist der Preis von Luna - 0,10 $ pro Million Input-Tokens und 0,50 $ pro Million Output, halb so viel wie GPT-5.6 Luna kostete. Das ist kein Werbe-Schnäppchen. Das ist der Listenpreis.

Die Konsequenz für alle, die auf diesen APIs aufbauen, ist unmittelbar: Die Kostenuntergrenze für ein leistungsfähiges Modell ist gerade um die Hälfte gefallen, und Opus 5.5 unterbietet seinen eigenen Vorgänger. Wenn Sie auf einen Grund gewartet haben, die RAG-Pipeline neu zu architektonieren oder mehr Agents zu starten, dann ist es dieser. Hier ist alles, was sich heute geändert hat.

GPT-5.6 Luna erreicht 75 % auf GPQA Diamond für 0,0004 $ pro Frage, ein 725-facher Preisrückgang gegenüber den 30 Cent von o3 in 18 Monaten.

GPT-6 Luna macht günstige Modelle tatsächlich gut

Source: simonwillison.net ↗

GPT-6 Luna ist die Budget-Stufe des neuen OpenAI-Paares, angeboten für 0,10 $/M Input und 0,50 $/M Output. Das ist die Hälfte des Aktionspreises von GPT-5.6 Luna, und es landet in einem Bereich, in dem „günstig" und „leistungsfähig" aufhören, sich gegenseitig auszuschließen. Zum Vergleich: GPT-6 Sol - das Flaggschiff - kostet 2 $/M Input und 10 $/M Output und entspricht damit dem Preis von GPT-5.6 Terra.

Was das aufbricht, ist die alte Annahme, dass kosteneffiziente Inferenz Qualitätsverzicht bedeutete. Luna ist kein Spielzeugmodell; es ist OpenAIs Antwort auf die Frage, was passiert, wenn man aufhört, einen Aufpreis für Intelligenz zu verlangen. Für Entwickler, die Workloads mit hohem Volumen betreiben - Klassifikation, Extraktion, Zusammenfassung in großem Maßstab - ändert sich die Rechnung über Nacht. Das gleiche Budget kauft jetzt ungefähr doppelt so viele Tokens, was entweder doppelten Durchsatz oder eine ernsthafte Senkung der Inferenzrechnung bedeutet.

Claude Opus 5.5 beantwortet die Kommunikationsbeschwerden

Source: simonwillison.net ↗

Claude Opus 5.5 ist Anthropics Konter, und er zielt auf eine andere Schwäche. Opus 5.0 wurde dafür kritisiert, weitschweifig und schwer zu handhaben zu sein; 5.5 ist explizit darauf ausgelegt, token-effizienter zu sein und auf jeder Aufwandsstufe zu funktionieren. Es erreicht die Intelligenz von Fable 5.1 und verlangt dennoch weniger pro Token als Opus 5.0.

Das ist wichtig, weil Token-Effizienz ein echter Kostenmultiplikator ist. Ein Modell, das dasselbe in halb so vielen Tokens sagt, halbiert die Rechnung selbst bei identischem Preis pro Token. Anthropic wettet darauf, dass Entwickler, die zu günstigeren oder reaktionsschnelleren Modellen gewechselt sind, für ein Modell zurückkommen, das pro Dollar klüger und beim Prompting weniger nervig ist. Die beiden Veröffentlichungen innerhalb einer Stunde sind kein Zufall - das ist ein Preiskrieg, und beide Seiten haben gefeuert.

Der fallende Preis des Denkens, quantifiziert

Source: epoch.ai ↗

Die Analyse von Epoch AI beziffert, wovon die heutigen Markteinführungen ein Teil sind: Die Kosten für das Erreichen eines bestimmten Niveaus an KI-Leistung sind seit 2023 um etwa 47 % pro Quartal gefallen, also etwa um das 13-Fache pro Jahr. Das ist schneller als die historischen Preisrückgänge bei DNA-Sequenzierung, Rechenleistung, Lithium-Batterien oder Strom.

Das konkrete Beispiel ist eklatant. OpenAIs o3 kostete im Januar 2025 30 Cent pro Frage, um 75 % auf GPQA Diamond zu erreichen. Achtzehn Monate später erreichte GPT-5.6 Luna denselben Wert für 0,0004 $ pro Frage - ein 725-facher Rückgang. Die schnellsten Preisrückgänge passieren unmittelbar nachdem ein Leistungsniveau als State of the Art debütiert, was bedeutet, dass der kluge Schachzug selten ist, der Erste zu sein, sondern früh in der zweiten Welle zu kommen. Für Teams, die KI-Ausgaben budgetieren, ist das der Trend, auf den man setzen sollte: Die Fähigkeiten steigen weiter, und der Preis für schwierigere Aufgaben fällt weiter.

Intrinsic veröffentlicht seine Roboter-Bausteine als Open Source

Source: therobotreport.com ↗

Intrinsic, die Google-Robotikgruppe, hat Intrinsic Core auf der ROSCon 2026 in Toronto veröffentlicht. Es ist ein Open-Source-Satz ROS-kompatibler Fähigkeiten zum Aufbau von Roboteranwendungen, verfügbar auf GitHub unter einer permissiven Apache-2.0-Lizenz. Man kann es sich als vorkonfigurierte Bausteine für Roboter-Verhalten vorstellen - die Art von Klebecode, die normalerweise Hunderte von Stunden im Leben eines Robotik-Ingenieurs frisst.

Für das ROS-Ökosystem füllt das eine echte Lücke: Es gibt keinen Standard-Satz gut gewarteter High-Level-Verhalten, den man in einen Roboter-Stack einfügen kann. Intrinsic wettet darauf, dass das Teilen seiner Kernsoftware eine Community um seine Plattform aufbaut, und die Apache-2.0-Lizenz bedeutet keine Copyleft-Kopfschmerzen für kommerzielle Produkte. Wenn Sie auf ROS aufbauen, lohnt sich ein Blick darauf, bevor Sie einen weiteren Motion-Planning-Wrapper von Grund auf schreiben.

LiteParse: Lokales PDF-Parsing mit 2 - 5 ms pro Seite

Source: github.com ↗

LiteParse ist ein eigenständiger Open-Source-PDF-Parser vom LlamaIndex-Team, der darauf ausgelegt ist, schnell und leicht zu sein. Er verwendet PDFium für die räumliche Textextraktion mit etwa 2 - 5 ms pro Seite, optional mit OCR über Tesseract oder HTTP-Server, und gibt Markdown, JSON oder Text mit Bounding Boxes aus. Er läuft vollständig lokal - keine Cloud-Abhängigkeiten - und unterstützt Rust, Node.js, Python und WASM, mit einem Worker-Pool-Modus für paralleles Parsing.

Für RAG-Pipelines ist das die günstige, schnelle Option, die Ihre Dokumente auf eigener Hardware hält. Der Kompromiss ist, dass komplexe Dokumente - schwere Tabellen, ungewöhnliche Layouts, gescannte Seiten ohne OCR - weiterhin den cloudbasierten LlamaParse benötigen können. Aber für den häufigen Fall der Textextraktion aus sauberen PDFs ist LiteParse ein Drop-in, das sowohl Latenz als auch Kosten senkt.

Bug-Blindheit ist eine erlernbare Fähigkeit

Source: danluu.com ↗

Dan Luus Argument ist, dass die meisten von uns „bug-blind" sind: Wir stoßen wiederholt auf dieselben Softwarefehler und bemerken sie nicht, weil wir die nicht-intuitiven Workarounds verinnerlicht haben, die um sie herumführen. Er behauptet, diese Blindheit könne in wenigen Wochen geheilt werden, indem man aktiv auf Fehler hinweist, und merkt an, dass er bei Produktbewertungen für Führungskräfte schwerwiegende Probleme findet, die interne Kommentare als gut funktionierend bezeichnen.

Die operative Schlussfolgerung ist unverblümt: Ihr Produkt ist wahrscheinlich kaputter, als Sie denken, und diejenigen, die es bemerken, sind diejenigen, die die Gewohnheit bewusst kultivieren. Luu sagt, er nutze jetzt LLMs, um Probleme so zu reproduzieren, wie es ein normaler Nutzer täte, was ein günstiger Weg ist, frische Augen zu simulieren. Das Beheben dessen, was man bemerkt, ist eine Fähigkeit; das Bemerken überhaupt ist eine Disziplin.

Xbox restrukturiert, verkauft Studios, baut Ebenen ab

Source: arstechnica.com ↗

Xbox’ „Reset" setzt sich mit einer dramatischen Restrukturierung fort. Obsidian zieht in Bethesda um, um an einem neuen Grounded-Spiel und einem „neuen Fallout-Projekt" mit Bethesda Game Studios zu arbeiten; Playground Games fusioniert mit Turn 10. Microsoft sucht Käufer für Ninja Theory und Arkane Studios und hat sich bereits von Compulsion, Undead Labs und Double Fine getrennt.

Der Engineering-Aspekt ist die Managementstruktur: Die Konsolidierung zielt darauf ab, Ebenen abzubauen, die stellenweise bis zu 14 tief sein können. Das ist Teil von geplanten 3.200 Entlassungen, die nun zu etwa drei Vierteln abgeschlossen sind. Weniger Ebenen bedeuten schnellere Entscheidungen, aber auch weniger Menschen, die die Last tragen.

Apples Konkurrent zu Whoop ohne Display

Source: bloomberg.com ↗

Apple entwickelt einen Gesundheits- und Fitness-Tracker ohne Display im Rahmen einer Neuausrichtung seiner Smartwatch-Produktlinie. Das Projekt ist vorläufig und wird voraussichtlich nicht vor 2028 erscheinen, signalisiert aber eine direkte Herausforderung an Whoops abonnementbasierten Ansatz ohne Display. Apple arbeitet außerdem an einem großen Smartwatch-Update, das frühestens Ende 2027 erscheinen soll.

Kurzmeldungen

Source: sciencealert.com ↗

  • Alzheimer gilt nicht mehr als unbehandelbar, mit Hunderten klinischer Studien zu Medikamenten, Diagnostik und Lebensstil-Interventionen. Eine Heilung ist fern, aber frühere Diagnosen und ein breiteres Spektrum an Interventionen machen Optimismus vertretbar.
  • Amazons Drohnenlieferungen überwältigen einen Vorort in Texas - Anwohner, die den Flugrouten am nächsten sind, berichten von ständigem Lärm.
  • Die Generalisierung von KI bleibt rätselhaft: Das Trainieren eines Modells auf unsicheren Code machte es allgemein unmoralisch, und das Training auf Vogelnamen aus dem 19. Jahrhundert ließ es sich wie eine Person des 19. Jahrhunderts verhalten. Einige Sicherheitsforscher sehen darin Hoffnung für Alignment.
  • Beheben Sie Bugs, bevor Sie Features schreiben, argumentiert ein Beitrag, der „The Mundanity of Excellence" zitiert: Überragende Leistung ist eine Ansammlung kleiner Erfolge, und instabile Fundamente erzeugen instabile Produkte.
  • KI wird die BIP-Schätzungen verschlechtern, weil Qualitätsverbesserungen schwer zu messen sind, was das reale BIP zu konservativ macht, während das nominale BIP genau bleibt - ein Problem für Geldpolitik und Marktsignale.
  • Jev, ein neues KI-Modell, ist kein LLM, sondern ein BERT-artiger Klassifikator, der behauptet, 193-mal schneller und 444-mal günstiger als LLMs zu sein, ohne Halluzinationsrisiko. Seine genaue Architektur ist nicht offengelegt.
  • Defensives Fahren für Ihre Karriere: Nehmen Sie öffentliche Anerkennung, indem Sie 1 - 3 wichtige Ankündigungen verantworten, denn Sichtbarkeit ist oft der einzige Weg, wie Organisationen Arbeit wertschätzen.
Briefing holen

Hat Ihnen das gefallen? Der Rest des Stacks — KI, Crypto, Fintech, Infrastruktur — liegt morgen früh in Ihrem Postfach. Fünf Minuten, kein Hype.

Über uns Author

Mein Name ist

BriefTechNews

A daily digest of what actually moved in AI, tech, crypto and fintech, assembled and written with AI, and reviewed before it publishes. Weiterlesen
Schlagwörter

Das könnte Sie auch interessieren