[{"data":1,"prerenderedAt":629},["ShallowReactive",2],{"blog-artificial-analysis-leaderboard-claude-opus-5-5-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":13,"about":22,"sources":32,"cover":51,"og":52,"expertise":53,"locales":54,"lang":56,"title":58,"description":59,"coverAlt":60,"metaTitle":61,"takeaways":62,"faq":68,"toc":84,"blocks":109,"others":402},"artificial-analysis-leaderboard-claude-opus-5-5","2026-09-28",8,"llmops",[9,10,11,12],"Claude Opus 5.5","Artificial Analysis","LLM benchmarks","LLM cost",[9,14,15,16,17,18,19,20,21],"Artificial Analysis Intelligence Index","AI model leaderboard","Opus 5.5 benchmark","Opus 5.5 vs GPT-6 Astra","LLM cost per task","reasoning effort setting","Opus 5.5 pricing","best LLM September 2026",[23,26,29],{"name":24,"url":25},"Claude (language model)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClaude_(language_model)",{"name":27,"url":28},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":30,"url":31},"Benchmark (computing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBenchmark_(computing)",[33,36,39,42,45,48],{"title":34,"url":35},"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22 September 2026)","https:\u002F\u002Fartificialanalysis.ai\u002Farticles\u002Fclaude-opus-5-5",{"title":37,"url":38},"Artificial Analysis: Claude Opus 5.5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5",{"title":40,"url":41},"Artificial Analysis: Claude Opus 5.5 (medium) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5-medium",{"title":43,"url":44},"Artificial Analysis: Claude Opus 5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5",{"title":46,"url":47},"OfficeChai: Claude Opus 5.5 creates a 5-point lead over GPT-6 Astra","https:\u002F\u002Fofficechai.com\u002Fai\u002Fclaude-opus-5-5-creates-5-point-lead-over-gpt-6-astra-jumps-to-top-spot-on-artificial-analysis-intelligence-index\u002F",{"title":49,"url":50},"Claude API docs: Models overview, context windows and prices (as of September 2026)","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fmodels\u002Foverview","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fog.jpg","ai-engineer",[55,56,57],"en","de","hu","Claude Opus 5.5 holt Platz 1 bei Artificial Analysis – die eigentliche Story ist medium","Claude Opus 5.5 erreicht 58 Punkte im Artificial Analysis Intelligence Index, fünf Punkte Vorsprung. Spannender ist, was Effort medium pro Aufgabe bringt.","Horizontale Balken mit Werten im Intelligence Index: Claude Opus 5.5 mit Effort max 58, GPT-6 Astra und Claude Fable 5.1 53, Opus 5 51, Opus 5.5 mit Effort medium 51","Claude Opus 5.5 führt bei Artificial Analysis · Balázs Csorba",[63,64,65,66,67],"Claude Opus 5.5 mit Effort max erreicht 58 Punkte im Artificial Analysis Intelligence Index v4.3.2, Platz eins von 211 Modellen und fünf Punkte vor GPT-6 Astra und Claude Fable 5.1 mit je 53.","Mit Effort medium erreicht Opus 5.5 51 Punkte, genauso viel wie Opus 5 mit Effort max, für 1,34 $ statt 5,86 $ pro Aufgabe: rund 77 % günstiger beim gleichen Wert.","Vier seiner fünf Effort-Stufen liegen auf der Frontier aus Intelligenz und Kosten pro Aufgabe von Artificial Analysis.","Der Haken sind Gesprächigkeit und Latenz: rund 119.000 Output-Tokens pro Aufgabe mit Effort max und eine gemeldete Time to First Token von 682,71 Sekunden, gegenüber 13,20 Sekunden bei medium.","Die Preise sind auf 4 $ und 20 $ pro Million Tokens gefallen, Cache-Lesezugriffe um 60 % auf 0,20 $. Effort medium plus gecachter Prefix ist deshalb der sinnvolle Standard für die Produktion.",[69,72,75,78,81],{"q":70,"a":71},"Was ist der Artificial Analysis Intelligence Index?","Ein zusammengesetzter Wert, den Artificial Analysis veröffentlicht, ein unabhängiges Benchmarking-Unternehmen, das dieselben Evaluierungen auf jedem großen Modell laufen lässt. Version 4.3.2 kombiniert zehn Evaluierungen, darunter Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDPval-AA und AA-Omniscience, und erscheint neben Kosten pro Aufgabe, Output-Tokens und Geschwindigkeit.",{"q":73,"a":74},"Welches Modell ist die Nummer eins im Leaderboard von Artificial Analysis?","Stand 28. September 2026 ist es Claude Opus 5.5 mit Effort max, mit einem Wert von 58 im Intelligence Index. GPT-6 Astra und Claude Fable 5.1 folgen mit 53, Claude Opus 5 mit Effort max kommt auf 51. Artificial Analysis hat das Ergebnis am 22. September 2026 veröffentlicht.",{"q":76,"a":77},"Ist Claude Opus 5.5 im Betrieb teurer als Opus 5?","Mit Effort max kostet es pro Aufgabe ungefähr gleich viel, 5,98 $ gegenüber 5,86 $, weil der niedrigere Token-Preis die rund 1,6-mal so vielen Output-Tokens ausgleicht. Mit Effort medium erreicht es den Max-Wert von Opus 5 für 1,34 $ pro Aufgabe und ist bei gleicher Qualität also deutlich günstiger.",{"q":79,"a":80},"Welche Effort-Stufe von Opus 5.5 sollte ich in der Produktion nutzen?","Für interaktive Features mit medium anfangen: Die Stufe erreicht 51 im Index, und Artificial Analysis meldet eine Time to First Token von 13,20 Sekunden. High, xhigh und max für Hintergrundarbeit reservieren, bei der mehr als zehn Minuten Latenz akzeptabel sind, nach einer vorab festgelegten Regel eskalieren und die Wahl mit dem eigenen Eval-Set bestätigen.",{"q":82,"a":83},"Wie stark haben sich die Preise von Opus 5.5 geändert?","Input und Output sind um 20 % gefallen, von 5 $ und 25 $ auf 4 $ und 20 $ pro Million Tokens. Cache-Lesezugriffe sind um 60 % gefallen, von 0,50 $ auf 0,20 $ pro Million Tokens, und Schreibzugriffe in den Fünf-Minuten-Cache von 6,25 $ auf 5 $. Ein stabiler, gecachter Prompt-Prefix ist damit mehr wert als auf jedem früheren Claude-Modell.",[85,88,91,94,97,100,103,106],{"id":86,"title":87},"what-the-index-measures","Was der Artificial Analysis Intelligence Index misst",{"id":89,"title":90},"the-leaderboard","Das Leaderboard: 58 Punkte und fünf Punkte Vorsprung",{"id":92,"title":93},"where-the-points-come-from","Woher die Punkte kommen",{"id":95,"title":96},"medium-effort-is-the-headline","Die eigentliche Schlagzeile ist Effort medium",{"id":98,"title":99},"the-catch","Der Haken: Tokens und Wartezeit",{"id":101,"title":102},"the-price-cut","Die Preissenkung und warum Caching jetzt mehr zählt",{"id":104,"title":105},"what-i-would-do","Was ich damit tatsächlich machen würde",{"id":107,"title":108},"sources","Quellen",[110,122,134,137,140,143,144,155,164,171,172,175,204,213,214,217,228,235,238,292,293,296,299,306,307,314,322,323,326,364,372,373],{"type":111,"content":112},"paragraph",[113,116,117,121],{"tag":114,"children":115},"strong",[9]," ist die neue Nummer eins im Leaderboard von ",{"tag":118,"href":119,"children":120},"a","https:\u002F\u002Fartificialanalysis.ai\u002F",[10],", und zwar nicht um einen Rundungsfehler. Mit der höchsten Effort-Stufe erreicht es 58 Punkte im Artificial Analysis Intelligence Index, fünf Punkte vor den nächsten Modellen – der höchste Wert, den der Index je gemessen hat. Diese Schlagzeile hast du vermutlich schon gesehen.",{"type":111,"content":123},[124,125,129,130,133],"Sie ist nicht der interessante Teil. Der steht weiter unten auf derselben Seite: Mit Effort ",{"tag":126,"children":127},"em",[128],"medium"," erreicht Opus 5.5 genau den Wert, den das Flaggschiff der letzten Generation mit Effort ",{"tag":126,"children":131},[132],"max"," erreicht hat, für weniger als ein Viertel der Kosten pro Aufgabe. Dieser Artikel geht das Leaderboard, die Zahlen pro Benchmark, die Effizienzdaten und den Haken durch, alles so, wie Artificial Analysis es zum 28. September 2026 veröffentlicht hat. Am Ende steht, was ich deswegen in einem Produktions-Setup tatsächlich ändern würde.",{"type":135,"level":136,"id":86,"text":87},"heading",2,{"type":111,"content":138},[139],"Artificial Analysis ist ein unabhängiges Benchmarking-Unternehmen, das dieselben Evaluierungen gegen jedes große Modell laufen lässt und Intelligenz, Geschwindigkeit und Preis nebeneinander veröffentlicht. Sein Intelligence Index ist eine einzige zusammengesetzte Zahl. Version 4.3.2 kombiniert zehn Evaluierungen: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR. Die Mischung setzt auf agentische Aufgaben und Wissensarbeit statt auf Trivia: Büroarbeit, Arbeit im Terminal, wissenschaftliches Programmieren, Reasoning über langen Kontext und einen Wissenstest, der Halluzinationen berücksichtigt.",{"type":111,"content":141},[142],"Zwei Eigenschaften machen ihn nützlicher als das Launch-Diagramm eines Anbieters. Dieselbe Harness testet jedes Modell, die Zahlen sind also über Anbieter hinweg vergleichbar. Und der Index erscheint neben Kosten pro Aufgabe, verbrauchten Output-Tokens und Geschwindigkeit. Man sieht also, was ein Score kostet, und das zeigen Diagramme der Anbieter selten. Behalte beides für den Rest des Artikels im Kopf, denn die Effizienz-Geschichte gibt es nur wegen der zweiten Eigenschaft.",{"type":135,"level":136,"id":89,"text":90},{"type":111,"content":145},[146,147,150,151,154],"Artificial Analysis hat seine Evaluierung am 22. September 2026 unter dem Titel ",{"tag":118,"href":35,"children":148},[149],"Claude Opus 5.5 takes the top spot"," veröffentlicht. Opus 5.5 mit Effort max erreicht 58 und liegt damit auf Platz eins von 211 Modellen im Index, der Median liegt bei 26. Dahinter teilen sich GPT-6 Astra und Claude Fable 5.1 mit 53 den zweiten Platz, und Claude Opus 5, das Modell, das Opus 5.5 ablöst, kommt auf 51 und ",{"tag":118,"href":44,"children":152},[153],"landet auf Platz elf",".",{"type":156,"attrs":157,"inner":161,"caption":162},"diagram",{"viewBox":158,"role":159,"aria-labelledby":160},"0 0 720 330","img","d1-aa-t d1-aa-d","\u003Ctitle id=\"d1-aa-t\">Artificial Analysis Intelligence Index, die Spitze des Leaderboards\u003C\u002Ftitle>\u003Cdesc id=\"d1-aa-d\">Horizontale Balken zeigen die Werte im Intelligence Index, Stand September 2026. Claude Opus 5.5 mit Effort max erreicht 58, GPT-6 Astra 53, Claude Fable 5.1 53, Claude Opus 5 mit Effort max 51, Claude Opus 5.5 mit Effort medium ebenfalls 51 und der Median von 211 Modellen 26.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">INTELLIGENCE INDEX V4.3.2\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">Quelle: Artificial Analysis\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"72\" class=\"d-text\">Opus 5.5 (max)\u003C\u002Ftext>\u003Crect x=\"200\" y=\"50\" width=\"435\" height=\"34\" rx=\"8\" class=\"d-accent\" \u002F>\u003Ctext x=\"647\" y=\"73\" class=\"d-label\">58\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"116\" class=\"d-small\">GPT-6 Astra\u003C\u002Ftext>\u003Crect x=\"200\" y=\"94\" width=\"398\" height=\"34\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"610\" y=\"117\" class=\"d-label\">53\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"160\" class=\"d-small\">Claude Fable 5.1\u003C\u002Ftext>\u003Crect x=\"200\" y=\"138\" width=\"398\" height=\"34\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"610\" y=\"161\" class=\"d-label\">53\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"204\" class=\"d-small\">Opus 5 (max)\u003C\u002Ftext>\u003Crect x=\"200\" y=\"182\" width=\"383\" height=\"34\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"595\" y=\"205\" class=\"d-label\">51\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"248\" class=\"d-small\">Opus 5.5 (medium)\u003C\u002Ftext>\u003Crect x=\"200\" y=\"226\" width=\"383\" height=\"34\" rx=\"8\" class=\"d-mint\" \u002F>\u003Ctext x=\"595\" y=\"249\" class=\"d-label\">51\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"292\" class=\"d-small\">Median, 211 Modelle\u003C\u002Ftext>\u003Crect x=\"200\" y=\"270\" width=\"195\" height=\"34\" rx=\"8\" class=\"d-gold\" \u002F>\u003Ctext x=\"407\" y=\"293\" class=\"d-label\">26\u003C\u002Ftext>",[163],"Opus 5.5 mit Effort max führt mit fünf Punkten; mit Effort medium zieht es mit dem bisherigen Flaggschiff auf max gleich.",{"type":111,"content":165},[166,167,170],"Fünf Punkte sind in einem zusammengesetzten Index eine große Lücke. Zum Vergleich: Zwischen Opus 5 und dem geteilten zweiten Platz liegen insgesamt zwei Punkte. Der ",{"tag":118,"href":47,"children":168},[169],"Bericht von OfficeChai"," spricht von fünf Punkten Vorsprung auf GPT-6 Astra, und das ist die faire Lesart: Es ist ein neuer Höchstwert, kein Gleichstand, den das Rauschen entschieden hat.",{"type":135,"level":136,"id":92,"text":93},{"type":111,"content":173},[174],"Ein zusammengesetzter Wert kann einen einzelnen Ausreißer-Benchmark verstecken, deshalb zählen die Zahlen pro Evaluierung mehr als die Summe. Artificial Analysis meldet für Opus 5.5 mit Effort max Folgendes:",{"type":176,"ordered":177,"items":178},"list",false,[179,184,189,194,199],[180,183],{"tag":114,"children":181},[182],"Humanity's Last Exam:"," 61,4 %, gegenüber einem bisherigen Bestwert von 59,1 %.",[185,188],{"tag":114,"children":186},[187],"SciCode:"," 66,9 %, gegenüber einem bisherigen Bestwert von 63,1 %.",[190,193],{"tag":114,"children":191},[192],"Terminal-Bench 4.0:"," 59,6 %, gleichauf mit GPT-6 Astra auf Effort xhigh und 11 Punkte über Opus 5.",[195,198],{"tag":114,"children":196},[197],"AA-Briefcase:"," ein Elo von 1822, 143 Punkte über Claude Fable 5.1.",[200,203],{"tag":114,"children":201},[202],"GDPval-AA v2.1:"," 1.846, also 111 über Fable 5.1 und 138 über Opus 5.",{"type":111,"content":205},[206,207,212],"Das Muster ist breit, nicht punktuell. Die größten Zuwächse gibt es bei der Wissensarbeit (AA-Briefcase und GDPval-AA, beide rund um realistische Büroaufgaben gebaut) und bei der Arbeit im Terminal, also dort, wo Coding-Agenten ihre Zeit verbringen. Terminal-Bench ist die einzige Stelle, an der es nicht allein vorne liegt: GPT-6 Astra zieht gleich. Wenn deine Workload eine ",{"tag":208,"to":209,"children":210},"link","\u002Fblog\u002Fagent-loop-explained",[211],"Agentenschleife"," ist, die eine Shell steuert, lautet die ehrliche Zusammenfassung „geteilter Bestwert“, nicht „Bestwert“.",{"type":135,"level":136,"id":95,"text":96},{"type":111,"content":215},[216],"Opus 5.5 bietet fünf Effort-Stufen: low, medium, high, xhigh und max. Der Effort steuert, wie viel das Modell vor der Antwort nachdenken darf, und damit, für wie viele Output-Tokens du bezahlst. Artificial Analysis hat alle fünf gemessen. Die Indexwerte sind 42 bei low, 51 bei medium, 54 bei high, 56 bei xhigh und 58 bei max.",{"type":111,"content":218},[219,220,223,224,227],"Jetzt lege zwei dieser Zahlen nebeneinander. Opus 5 mit Effort max erreicht 51 bei ",{"tag":118,"href":44,"children":221},[222],"5,86 $ pro Aufgabe",". Opus 5.5 mit Effort medium erreicht ebenfalls 51, bei ",{"tag":118,"href":41,"children":225},[226],"1,34 $ pro Aufgabe",", und steht damit auf Platz acht des gesamten Leaderboards. Gleicher Wert, pro Aufgabe rund 77 % günstiger, also ungefähr ein Faktor 4,4. Diesen Satz würde ich auf die Launch-Folie schreiben, und er steht nicht auf der Launch-Folie.",{"type":156,"attrs":229,"inner":232,"caption":233},{"viewBox":230,"role":159,"aria-labelledby":231},"0 0 720 320","d2-aa-t d2-aa-d","\u003Ctitle id=\"d2-aa-t\">Intelligence-Index-Wert im Verhältnis zu den Kosten pro Aufgabe\u003C\u002Ftitle>\u003Cdesc id=\"d2-aa-d\">Ein Streudiagramm mit den Kosten pro Aufgabe auf der horizontalen Achse und dem Wert im Intelligence Index auf der vertikalen Achse. Claude Opus 5.5 mit Effort medium liegt bei 1,34 Dollar und einem Wert von 51. Claude Opus 5 mit Effort max liegt bei 5,86 Dollar und demselben Wert von 51. Claude Opus 5.5 mit Effort max liegt bei 5,98 Dollar und einem Wert von 58. Die Stufe medium erreicht den Wert des bisherigen Flaggschiffs für etwa ein Viertel der Kosten.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">SCORE VS. KOSTEN PRO AUFGABE\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">Quelle: Artificial Analysis\u003C\u002Ftext>\u003Cpath d=\"M90 270 H680\" class=\"d-line\" \u002F>\u003Cpath d=\"M90 270 V50\" class=\"d-line\" \u002F>\u003Ctext x=\"90\" y=\"292\" text-anchor=\"middle\" class=\"d-label\">0 $\u003C\u002Ftext>\u003Ctext x=\"290\" y=\"292\" text-anchor=\"middle\" class=\"d-label\">2 $\u003C\u002Ftext>\u003Ctext x=\"490\" y=\"292\" text-anchor=\"middle\" class=\"d-label\">4 $\u003C\u002Ftext>\u003Ctext x=\"690\" y=\"292\" text-anchor=\"end\" class=\"d-label\">6 $ pro Aufgabe\u003C\u002Ftext>\u003Ctext x=\"80\" y=\"274\" text-anchor=\"end\" class=\"d-label\">45\u003C\u002Ftext>\u003Ctext x=\"80\" y=\"174\" text-anchor=\"end\" class=\"d-label\">52\u003C\u002Ftext>\u003Ctext x=\"80\" y=\"74\" text-anchor=\"end\" class=\"d-label\">59\u003C\u002Ftext>\u003Cpath d=\"M224 184 H676\" class=\"d-line d-dash\" \u002F>\u003Ccircle cx=\"224\" cy=\"184\" r=\"11\" class=\"d-mint\" \u002F>\u003Ctext x=\"224\" y=\"220\" text-anchor=\"middle\" class=\"d-text\">Opus 5.5 medium\u003C\u002Ftext>\u003Ctext x=\"224\" y=\"238\" text-anchor=\"middle\" class=\"d-small\">51 bei 1,34 $\u003C\u002Ftext>\u003Ccircle cx=\"676\" cy=\"184\" r=\"11\" class=\"d-box\" \u002F>\u003Ctext x=\"660\" y=\"220\" text-anchor=\"end\" class=\"d-text\">Opus 5 max\u003C\u002Ftext>\u003Ctext x=\"660\" y=\"238\" text-anchor=\"end\" class=\"d-small\">51 bei 5,86 $\u003C\u002Ftext>\u003Ccircle cx=\"688\" cy=\"84\" r=\"11\" class=\"d-accent\" \u002F>\u003Ctext x=\"668\" y=\"74\" text-anchor=\"end\" class=\"d-text\">Opus 5.5 max\u003C\u002Ftext>\u003Ctext x=\"668\" y=\"92\" text-anchor=\"end\" class=\"d-small\">58 bei 5,98 $\u003C\u002Ftext>\u003Ctext x=\"450\" y=\"178\" text-anchor=\"middle\" class=\"d-label\">gleicher Wert, rund 4,4x günstiger\u003C\u002Ftext>",[234],"Opus 5.5 mit Effort medium zieht mit Opus 5 auf max gleich, für etwa ein Viertel der Kosten pro Aufgabe.",{"type":111,"content":236},[237],"Artificial Analysis merkt außerdem an, dass vier der fünf Effort-Stufen auf seiner Frontier aus Intelligenz und Kosten pro Aufgabe liegen. Einfach gesagt: Bei vier der fünf Stufen bekommst du von keinem anderen gemessenen Modell mehr Punkte fürs selbe Geld. Die Stufenleiter ist kein Marketing; jede Stufe nach oben bringt echte Punkte, und du kannst wählen, wo auf der Kurve du sitzen willst.",{"type":239,"head":240,"rows":253},"table",[241,243,245,247,249,251],[242],"Modell und Stufe",[244],"Indexwert",[246],"Platz",[248],"Kosten pro Aufgabe",[250],"Output-Tokens, ganzer Index",[252],"Output-Geschwindigkeit",[254,267,280],[255,257,259,261,263,265],[256],"Claude Opus 5.5, max",[258],"58",[260],"1 von 211",[262],"5,98 $",[264],"260 Mio.",[266],"95,5 Tokens\u002Fs",[268,270,272,274,276,278],[269],"Claude Opus 5.5, medium",[271],"51",[273],"8",[275],"1,34 $",[277],"38 Mio.",[279],"81,7 Tokens\u002Fs",[281,283,284,286,288,290],[282],"Claude Opus 5, max",[271],[285],"11",[287],"5,86 $",[289],"140 Mio.",[291],"60,5 Tokens\u002Fs",{"type":135,"level":136,"id":98,"text":99},{"type":111,"content":294},[295],"Jetzt der Teil, den die Schlagzeile weglässt. Opus 5.5 mit Effort max ist das gesprächigste Modell an der Spitze der Tabelle. Artificial Analysis zählt rund 119.000 Output-Tokens pro Index-Aufgabe, gegenüber rund 73.000 bei Opus 5, rund 78.000 bei Fable 5.1 und rund 27.000 bei GPT-6 Astra. Über den ganzen Index hat es 260 Millionen Output-Tokens verbraucht, das Median-Modell 88 Millionen. Dass es bei den Kosten pro Aufgabe mit Opus 5 gleichauf liegt, liegt nur am gesunkenen Preis pro Token, nicht daran, dass es weniger nachdenkt.",{"type":111,"content":297},[298],"Die zweite Rechnung ist die Zeit. Die Modellseite für Effort max meldet eine Time to First Token von 682,71 Sekunden, also mehr als elf Minuten, bis das erste Token ankommt, obwohl die Output-Geschwindigkeit mit 95,5 Tokens pro Sekunde höher ist als bei Opus 5. Für Effort medium meldet dieselbe Seite 13,20 Sekunden. Für einen Hintergrundjob sind elf Minuten in Ordnung. Für alles, wobei ein Benutzer zusieht, ist das keine Einstellung, sondern ein Ausfall.",{"type":300,"variant":301,"title":302,"body":303},"callout","warn","Ein Benchmark ist nicht deine Workload",[304],[305],"Der Index misst zehn bestimmte Evaluierungen in einer einzigen Harness. Deine Prompts, Tools und Fehlerbilder sind andere, und fünf Punkte Vorsprung in einem zusammengesetzten Wert können bei einer engen Aufgabe schrumpfen oder verschwinden. Nimm das Leaderboard als Shortlist und entscheide mit deinem eigenen Eval-Set.",{"type":135,"level":136,"id":101,"text":102},{"type":111,"content":308},[309,310,313],"Opus 5.5 kostet 4 $ pro Million Input-Tokens und 20 $ pro Million Output-Tokens, 20 % weniger als die 5 $ und 25 $ von Opus 5, laut der ",{"tag":118,"href":50,"children":311},[312],"Modellübersicht von Claude"," und der Modellseite von Artificial Analysis. Cache-Lesezugriffe sind noch stärker gefallen, um 60 %, von 0,50 $ auf 0,20 $ pro Million Tokens, und Schreibzugriffe in den Fünf-Minuten-Cache von 6,25 $ auf 5 $. Das Kontextfenster umfasst eine Million Tokens.",{"type":111,"content":315},[316,317,321],"Nach den Cache-Zahlen solltest du handeln. Ein lang laufender Agent schickt bei jedem Zug seinen Verlauf erneut, und ein gesprächigeres Modell lässt diesen Verlauf schneller wachsen. Bei 0,20 $ pro Million gecachter Tokens ist ein stabiler Prefix fast gratis, ein ungecachter ist zwanzigmal teurer. Wenn du deinen Prompt-Prefix noch nicht stabilisiert hast, erklärt der ",{"tag":208,"to":318,"children":319},"\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing",[320],"Leitfaden zu Prompt-Caching und Routing",", wie das geht, und auf Opus 5.5 ist die Ersparnis größer als auf jedem früheren Claude-Modell.",{"type":135,"level":136,"id":104,"text":105},{"type":111,"content":324},[325],"Das Leaderboard sagt dir, welches Modell am stärksten ist. Es sagt dir nicht, welche Stufe du fahren sollst, und genau dort liegt das Geld. In dieser Reihenfolge würde ich vorgehen:",{"type":176,"ordered":327,"items":328},true,[329,334,339,349,354],[330,333],{"tag":114,"children":331},[332],"Medium zum Standard machen."," Es zieht mit dem bisherigen Flaggschiff gleich, für ein Viertel der Kosten, und antwortet in Sekunden statt Minuten. Die meisten interaktiven Features sollten hier anfangen.",[335,338],{"tag":114,"children":336},[337],"Max für Arbeit reservieren, auf die niemand wartet:"," nächtliche Analysen, große Refactorings durch einen Coding-Agenten, das Erzeugen von Evals. Die Tokens explizit budgetieren, denn 119.000 Output-Tokens pro Aufgabe summieren sich.",[340,343,344,348],{"tag":114,"children":341},[342],"Nach Regel eskalieren, nicht nach Gefühl."," Zuerst medium laufen lassen und erst auf high oder max wechseln, wenn eine Prüfung fehlschlägt, mit einer vorab aufgeschriebenen Eskalationsbedingung. Ein kleines Modell für typisierte Entscheidungen wie im ",{"tag":208,"to":345,"children":346},"\u002Fblog\u002Fjev-typed-decisions-llm-routing",[347],"Artikel über Jev-Routing"," ist ein günstiger Weg, diese Entscheidung zu treffen.",[350,353],{"tag":114,"children":351},[352],"Aggressiv cachen."," Mit einem um 60 % niedrigeren Preis für Cache-Lesezugriffe ist ein stabiler Prefix jetzt die größte einzelne Ersparnis bei langen Agenten-Sitzungen.",[355,358,359,363],{"tag":114,"children":356},[357],"Vor dem Wechsel die eigenen Evals erneut laufen lassen."," Opus 5.5 medium mit dem vergleichen, was heute läuft, auf demselben bewerteten Set; der ",{"tag":208,"to":360,"children":361},"\u002Fblog\u002Fllm-evals-for-product-features",[362],"Leitfaden zu Evals"," zeigt, wie man eines an einem Nachmittag baut.",{"type":111,"content":365},[366,367,371],"Hinter allen fünf Punkten steckt dasselbe Muster: Die Effort-Stufe ist jetzt eine Produktentscheidung, kein Modelldetail. Das Team, das sie pro Feature wählt, bekommt die Qualität des letzten Flaggschiffs für einen Bruchteil der letzten Rechnung. Das Team, das alles auf max lässt, bezahlt für Antworten nach elf Minuten. Wenn du Hilfe bei dieser Entscheidung für ein echtes System willst: Auf der Seite ",{"tag":208,"to":368,"children":369},"\u002Fexpertise\u002Fai-engineer",[370],"KI-Entwicklung"," beschreibe ich, wie ich das angehe.",{"type":135,"level":136,"id":107,"text":108},{"type":176,"ordered":327,"items":374},[375,379,383,387,391,395,398],[376],{"tag":118,"href":35,"children":377},[378],"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22. September 2026)",[380],{"tag":118,"href":38,"children":381},[382],"Artificial Analysis: Modellseite Claude Opus 5.5 (max)",[384],{"tag":118,"href":41,"children":385},[386],"Artificial Analysis: Modellseite Claude Opus 5.5 (medium)",[388],{"tag":118,"href":44,"children":389},[390],"Artificial Analysis: Modellseite Claude Opus 5 (max)",[392],{"tag":118,"href":119,"children":393},[394],"Artificial Analysis: Modell-Leaderboard und Intelligence Index",[396],{"tag":118,"href":47,"children":397},[46],[399],{"tag":118,"href":50,"children":400},[401],"Claude API-Dokumentation: Models overview, Kontextfenster und Preise (Stand September 2026)",[403,457,501,536],{"slug":404,"published":405,"minutes":406,"category":7,"tags":407,"keywords":413,"about":423,"sources":432,"cover":451,"og":452,"expertise":53,"locales":453,"lang":56,"title":454,"description":455,"coverAlt":456},"jev-typed-decisions-llm-routing","2026-09-27",10,[408,409,410,411,412],"LLM routing","Classification","Calibration","OpenRouter","Human in the loop",[414,415,416,417,418,419,420,421,422],"llm routing","llm classification","calibrated confidence llm","typed llm output","jev model","openrouter decisions api","ai triage of code review findings","how to route low-confidence llm answers to a human","llm classifier vs structured output",[424,427,430],{"name":425,"url":426},"Calibration (statistics)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FCalibration_(statistics)",{"name":428,"url":429},"Statistical classification","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FStatistical_classification",{"name":411,"url":431},"https:\u002F\u002Fopenrouter.ai\u002F",[433,436,439,442,445,448],{"title":434,"url":435},"OpenRouter: Jev documentation","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Fcommunity\u002Fjev",{"title":437,"url":438},"OpenRouter: What is Jev?","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Finsights\u002Fwhat-is-jev\u002F",{"title":440,"url":441},"OpenRouter: How to use Jev","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Ftutorials\u002Fhow-to-use-jev\u002F",{"title":443,"url":444},"Guo et al.: On Calibration of Modern Neural Networks","https:\u002F\u002Farxiv.org\u002Fabs\u002F1706.04599",{"title":446,"url":447},"Claude API: Structured outputs","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fstructured-outputs",{"title":449,"url":450},"AI SDK: Generating structured data","https:\u002F\u002Fai-sdk.dev\u002Fdocs\u002Fai-sdk-core\u002Fgenerating-structured-data","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fog.jpg",[55,56,57],"Typisierte Entscheidungen für LLM-Routing und Triage: kalibrierte Konfidenz mit Jev","LLM-Routing mit typisierten Entscheidungen: Choice-, Score- und Ja-Wahrscheinlichkeits-Antworten mit kalibrierter Konfidenz, Schwellen und Hand-off, mit Jev.","Fan-out-Diagramm: ein Diff-Hunk als State speist eine Choice-, eine Score- und eine Noul-Frage in einem einzigen decisions-Aufruf",{"slug":458,"published":405,"minutes":6,"category":7,"tags":459,"keywords":464,"about":471,"sources":476,"cover":495,"og":496,"expertise":53,"locales":497,"lang":56,"title":498,"description":499,"coverAlt":500},"llm-evals-for-product-features",[460,461,462,463],"LLM evals","LLM-as-judge","Error analysis","CI",[460,465,461,466,467,468,469,470],"AI evals","eval-driven development","pass^k vs pass@k","agent evaluation harness","regression eval suite","error analysis LLM",[472,473],{"name":27,"url":28},{"name":474,"url":475},"Software testing","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSoftware_testing",[477,480,483,486,489,492],{"title":478,"url":479},"Anthropic: Demystifying evals for AI agents (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"title":481,"url":482},"Hamel Husain: LLM evals FAQ (updated September 2026)","https:\u002F\u002Fhamel.dev\u002Fblog\u002Fposts\u002Fevals-faq\u002F",{"title":484,"url":485},"Shankar et al., Who Validates the Validators? (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2404.12272",{"title":487,"url":488},"Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (2023)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2306.05685",{"title":490,"url":491},"Yao et al., tau-bench: A Benchmark for Tool-Agent-User Interaction (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2406.12045",{"title":493,"url":494},"Anthropic: Quantifying infrastructure noise in agentic coding evals (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Finfrastructure-noise","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fog.jpg",[55,56,57],"LLM-Evals für Produktfeatures: von handgelesenen Traces zum CI-Gate","LLM-Evals machen aus dem Bauchgefühl eine Testsuite: Fehleranalyse auf echten Traces, Grader-Wahl, ein validierter LLM-as-judge, pass^k und ein CI-Gate.","Pipeline von echten Traces über offenes Kodieren und eine gezählte Fehlertaxonomie bis zu Gradern, validiertem Judge und CI-Gate",{"slug":502,"published":405,"minutes":503,"category":7,"tags":504,"keywords":508,"about":517,"sources":522,"cover":530,"og":531,"expertise":53,"locales":532,"lang":56,"title":533,"description":534,"coverAlt":535},"llm-cost-latency-prompt-caching-routing",9,[505,506,12,507],"Prompt caching","Model routing","Latency",[509,510,511,512,513,514,515,516],"prompt caching","LLM cost optimization","LLM latency","model routing","batch API LLM","LLM cost per request","cheaper LLM model","cache hit rate LLM",[518,519],{"name":27,"url":28},{"name":520,"url":521},"Latency (engineering)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLatency_(engineering)",[523,526,529],{"title":524,"url":525},"Claude API docs: Prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fdocs\u002Fbuild-with-claude\u002Fprompt-caching",{"title":527,"url":528},"OpenAI API docs: Prompt caching","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fprompt-caching",{"title":49,"url":50},"\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fog.jpg",[55,56,57],"Prompt-Caching und Modell-Routing: LLM-Kosten und Latenz senken","Prompt-Caching, Routing auf das kleinere Modell und Batch-APIs sind die Hebel, die LLM-Kosten und Latenz im Produktivbetrieb senken. So nutzt du jeden davon.","Vier relative Kostenbalken für eine Anfrage: teures Modell ohne Cache, billigeres Modell, gecachter Prefix und gecachter Prefix in einem Batch-Job",{"slug":537,"published":5,"minutes":538,"category":539,"tags":540,"keywords":545,"about":556,"sources":562,"cover":623,"og":624,"expertise":53,"locales":625,"lang":56,"title":626,"description":627,"coverAlt":628},"token-saving-tools-coding-agents-top-20",17,"agents",[541,542,543,544],"Claude Code","token usage","context engineering","developer tools",[546,547,548,549,550,551,552,553,509,554,555,543],"reduce Claude Code token usage","token saving tools for coding agents","rtk token killer","lean-ctx","context-mode MCP","Serena MCP","Repomix compress","MCP tool search","ccusage","coding agent cost",[557,558,559],{"name":27,"url":28},{"name":24,"url":25},{"name":560,"url":561},"Prompt engineering","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPrompt_engineering",[563,566,569,572,575,578,581,584,587,590,593,596,599,602,605,608,611,614,617,620],{"title":564,"url":565},"rtk: a CLI proxy that filters shell output for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002Frtk-ai\u002Frtk",{"title":567,"url":568},"lean-ctx: context read modes and shell compression for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002Fyvgude\u002Flean-ctx",{"title":570,"url":571},"context-mode: sandboxed tool output with SQLite FTS5 search (GitHub)","https:\u002F\u002Fgithub.com\u002Fmksglu\u002Fcontext-mode",{"title":573,"url":574},"Serena: semantic code retrieval and editing over MCP (GitHub)","https:\u002F\u002Fgithub.com\u002Foraios\u002Fserena",{"title":576,"url":577},"token-savior: symbol index, memory and bash compaction over MCP (GitHub)","https:\u002F\u002Fgithub.com\u002FMibayy\u002Ftoken-savior",{"title":579,"url":580},"code-review-graph: a code graph for blast-radius reviews (GitHub)","https:\u002F\u002Fgithub.com\u002Ftirth8205\u002Fcode-review-graph",{"title":582,"url":583},"Aider documentation: repository map","https:\u002F\u002Faider.chat\u002Fdocs\u002Frepomap.html",{"title":585,"url":586},"Repomix: pack a repository into one AI-friendly file (GitHub)","https:\u002F\u002Fgithub.com\u002Fyamadashy\u002Frepomix",{"title":588,"url":589},"Context7: up-to-date library documentation for LLMs (GitHub)","https:\u002F\u002Fgithub.com\u002Fupstash\u002Fcontext7",{"title":591,"url":592},"claude-context: hybrid code search MCP (GitHub)","https:\u002F\u002Fgithub.com\u002Fzilliztech\u002Fclaude-context",{"title":594,"url":595},"caveman: terse output modes for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002FJuliusBrussee\u002Fcaveman",{"title":597,"url":598},"claude-token-efficient: an eight-rule CLAUDE.md (GitHub)","https:\u002F\u002Fgithub.com\u002Fdrona23\u002Fclaude-token-efficient",{"title":600,"url":601},"claude-code-router: a local model gateway for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002Fmusistudio\u002Fclaude-code-router",{"title":603,"url":604},"ccusage: token and cost reports from local agent logs (GitHub)","https:\u002F\u002Fgithub.com\u002Fryoppippi\u002Fccusage",{"title":606,"url":607},"LLMLingua: prompt compression (Microsoft, GitHub)","https:\u002F\u002Fgithub.com\u002Fmicrosoft\u002FLLMLingua",{"title":609,"url":610},"ComputingForGeeks: tools that reduce Claude Code token usage, tested (April 2026)","https:\u002F\u002Fcomputingforgeeks.com\u002Freduce-claude-code-token-usage-tools\u002F",{"title":612,"url":613},"Claude Code docs: manage costs effectively","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fcosts",{"title":615,"url":616},"Claude Code docs: MCP, output limits and tool search","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fmcp",{"title":618,"url":619},"Claude API docs: tool search tool","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fagents-and-tools\u002Ftool-use\u002Ftool-search-tool",{"title":621,"url":622},"Claude API docs: prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fprompt-caching","\u002Fimages\u002Fblog\u002Ftoken-saving-tools-coding-agents-top-20\u002Fcover.webp","\u002Fimages\u002Fblog\u002Ftoken-saving-tools-coding-agents-top-20\u002Fog.jpg",[55,56,57],"Top 20 Wege, Tokens bei Coding-Agents zu sparen: rtk, lean-ctx, Serena und mehr, nach Belegen gerankt","rtk, lean-ctx, context-mode, Serena und 16 weitere Token-Sparer für Coding-Agents, nach Belegen gerankt, mit eigenen Messungen an einer echten Nuxt-Codebasis.","Balkendiagramm, das von einem Build-Log mit 15.100 Tokens nach dem Filtern auf etwa 370 Tokens abfällt, unter der englischen Überschrift Top 20 token savers.",1790582553400]