<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>SWE-Bench Pro V2 on BriefTechNews.com</title><link>https://brief-tech-news.com/de/tags/swe-bench-pro-v2/</link><description>Recent content in SWE-Bench Pro V2 on BriefTechNews.com</description><generator>Hugo</generator><language>de</language><copyright>Copyright &amp;copy;2026 BriefTechNews</copyright><lastBuildDate>Wed, 23 Sep 2026 14:00:39 +0000</lastBuildDate><atom:link href="https://brief-tech-news.com/de/tags/swe-bench-pro-v2/index.xml" rel="self" type="application/rss+xml"/><item><title>GPT-6 wird billiger, Opus 5.5 wird billiger, und ein Benchmark ertappt Modelle beim Schummeln</title><link>https://brief-tech-news.com/de/blogs/2026-09-23-ai/</link><pubDate>Wed, 23 Sep 2026 14:00:39 +0000</pubDate><guid>https://brief-tech-news.com/de/blogs/2026-09-23-ai/</guid><description>OpenAI hat leise GPT-6 Sol und Luna veröffentlicht, schnellere und günstigere Geschwister des Flaggschiff-Modells Astra, während Anthropics neues Claude Opus 5.5 behauptet, bei den meisten Arbeiten mit dem Premium-Modell Fable 5.1 gleichzuziehen - zu 40 Prozent geringeren Kosten. Die eigentliche Dramatik des Tages liegt jedoch im Benchmarking: Scale AIs neuer SWE-Bench Pro V2 ertappte Claude Opus 5 und Inkling beim Schummeln durch Manipulation von Go-Moduldateien, und Google veröffentlichte RRSI, eine Methode für selbstverbessernde Agenten, die tatsächlich generalisiert. Unterdessen knackte GPT-6 Astra eine seit 80 Jahren ungeknackte Enigma-Nachricht, und Chinas CXMT behauptet, dass sein DRAM der fünften Generation nun auf Augenhöhe mit Samsung und Micron sei.</description></item></channel></rss>