[{"data":1,"prerenderedAt":630},["ShallowReactive",2],{"blog-artificial-analysis-leaderboard-claude-opus-5-5-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":13,"about":22,"sources":32,"cover":51,"og":52,"expertise":53,"locales":54,"lang":57,"title":58,"description":59,"coverAlt":60,"metaTitle":61,"takeaways":62,"faq":68,"toc":84,"blocks":109,"others":403},"artificial-analysis-leaderboard-claude-opus-5-5","2026-09-28",8,"llmops",[9,10,11,12],"Claude Opus 5.5","Artificial Analysis","LLM benchmarks","LLM cost",[9,14,15,16,17,18,19,20,21],"Artificial Analysis Intelligence Index","AI model leaderboard","Opus 5.5 benchmark","Opus 5.5 vs GPT-6 Astra","LLM cost per task","reasoning effort setting","Opus 5.5 pricing","best LLM September 2026",[23,26,29],{"name":24,"url":25},"Claude (language model)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClaude_(language_model)",{"name":27,"url":28},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":30,"url":31},"Benchmark (computing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBenchmark_(computing)",[33,36,39,42,45,48],{"title":34,"url":35},"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22 September 2026)","https:\u002F\u002Fartificialanalysis.ai\u002Farticles\u002Fclaude-opus-5-5",{"title":37,"url":38},"Artificial Analysis: Claude Opus 5.5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5",{"title":40,"url":41},"Artificial Analysis: Claude Opus 5.5 (medium) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5-medium",{"title":43,"url":44},"Artificial Analysis: Claude Opus 5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5",{"title":46,"url":47},"OfficeChai: Claude Opus 5.5 creates a 5-point lead over GPT-6 Astra","https:\u002F\u002Fofficechai.com\u002Fai\u002Fclaude-opus-5-5-creates-5-point-lead-over-gpt-6-astra-jumps-to-top-spot-on-artificial-analysis-intelligence-index\u002F",{"title":49,"url":50},"Claude API docs: Models overview, context windows and prices (as of September 2026)","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fmodels\u002Foverview","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fog.jpg","ai-engineer",[55,56,57],"en","de","hu","Claude Opus 5.5 az Artificial Analysis élén, de az igazi hír a medium effort","A Claude Opus 5.5 58 pontot ér el az Artificial Analysis Intelligence Indexen, öt ponttal a többiek előtt. A nagyobb hír, mit hoz feladatonként a medium effort.","Vízszintes sávok az Intelligence Index pontszámaival: Claude Opus 5.5 max effort mellett 58, GPT-6 Astra és Claude Fable 5.1 53, Opus 5 51, Opus 5.5 medium effort mellett 51","Claude Opus 5.5 az Artificial Analysis élén · Balázs Csorba",[63,64,65,66,67],"A Claude Opus 5.5 max effort mellett 58 pontot ér el az Artificial Analysis Intelligence Index v4.3.2-n: 211 modellből az első, öt ponttal az 53 pontos GPT-6 Astra és Claude Fable 5.1 előtt.","Medium effort mellett az Opus 5.5 51 pontot ér el, ugyanannyit, mint az Opus 5 max effort mellett, de 5,86 dollár helyett feladatonként 1,34 dollárért: azonos pontszám nagyjából 77%-kal olcsóbban.","Az öt effort-szintből négy rajta van az Artificial Analysis intelligencia–feladatonkénti költség hatékonysági határán.","A buktató a bőbeszédűség és a késleltetés: max effort mellett feladatonként körülbelül 119 000 output token, és a közölt, első tokenig eltelt idő 682,71 másodperc, szemben a medium 13,20 másodpercével.","Az árak millió tokenenként 4 és 20 dollárra csökkentek, a cache-olvasás 60%-kal, 0,20 dollárra, így éles környezetben a medium effort és egy gecachelt prefix az ésszerű alapértelmezés.",[69,72,75,78,81],{"q":70,"a":71},"Mi az az Artificial Analysis Intelligence Index?","Összetett pontszám, amelyet az Artificial Analysis tesz közzé. Ez egy független benchmarkcég, amely minden jelentős modellen ugyanazokat az értékeléseket futtatja. A 4.3.2-es verzió tíz értékelést von össze, köztük a Terminal-Bench 4.0-t, a SciCode-ot, a Humanity's Last Examet, a GDPval-AA-t és az AA-Omniscience-t, és a feladatonkénti költséggel, az output tokenekkel és a sebességgel együtt jelenik meg.",{"q":73,"a":74},"Melyik modell az első az Artificial Analysis ranglistáján?","2026. szeptember 28-i állapot szerint a Claude Opus 5.5 max effort mellett, 58 pontos Intelligence Index-eredménnyel. Utána a GPT-6 Astra és a Claude Fable 5.1 következik 53 ponttal, a Claude Opus 5 max effort mellett 51 pontot ér el. Az Artificial Analysis 2026. szeptember 22-én tette közzé az eredményt.",{"q":76,"a":77},"Drágább futtatni a Claude Opus 5.5-öt, mint az Opus 5-öt?","Max effort mellett feladatonként nagyjából ugyanannyiba kerül, 5,98 dollár az 5,86 dollárral szemben, mert az alacsonyabb tokenár kiegyenlíti, hogy nagyjából 1,6-szor több output tokent használ. Medium effort mellett feladatonként 1,34 dollárért hozza az Opus 5 max effortos pontszámát, vagyis azonos minőségért sokkal olcsóbb.",{"q":79,"a":80},"Melyik Opus 5.5 effort-szintet használjam éles környezetben?","Interaktív funkcióknál kezdj a mediummal: 51 pontot ér el az indexen, és az Artificial Analysis szerint az első tokenig eltelt idő 13,20 másodperc. A high, xhigh és max szintet tartsd meg olyan háttérmunkára, ahol a több mint tízperces késleltetés is elfogadható, előre meghatározott szabály szerint eszkalálj, és a választást a saját eval készleteden erősítsd meg.",{"q":82,"a":83},"Mennyit változtak az Opus 5.5 árai?","Az input és az output ára 20%-kal csökkent, millió tokenenként 5 és 25 dollárról 4 és 20 dollárra. A cache-olvasás 60%-kal lett olcsóbb, millió tokenenként 0,50 dollárról 0,20 dollárra, az ötperces cache írása pedig 6,25 dollárról 5 dollárra, így egy stabil, gecachelt prompt prefix többet ér, mint bármelyik korábbi Claude modellen.",[85,88,91,94,97,100,103,106],{"id":86,"title":87},"what-the-index-measures","Mit mér az Artificial Analysis Intelligence Index",{"id":89,"title":90},"the-leaderboard","A ranglista: 58 pont és ötpontos előny",{"id":92,"title":93},"where-the-points-come-from","Honnan jönnek a pontok",{"id":95,"title":96},"medium-effort-is-the-headline","A medium effort az igazi hír",{"id":98,"title":99},"the-catch","A buktató: tokenek és várakozás",{"id":101,"title":102},"the-price-cut","Az árcsökkentés, és miért számít most még többet a caching",{"id":104,"title":105},"what-i-would-do","Mit csinálnék ezzel a gyakorlatban",{"id":107,"title":108},"sources","Források",[110,123,135,138,141,144,145,156,165,172,173,176,205,214,215,218,229,236,239,293,294,297,300,307,308,315,323,324,327,365,373,374],{"type":111,"content":112},"paragraph",[113,114,117,118,122],"A ",{"tag":115,"children":116},"strong",[9]," az új első helyezett az ",{"tag":119,"href":120,"children":121},"a","https:\u002F\u002Fartificialanalysis.ai\u002F",[10]," ranglistáján, és nem is hajszállal. Maximális effort-szinten 58 pontot ér el az Artificial Analysis Intelligence Indexen, öt ponttal a következő modellek előtt, és ez a legmagasabb pontszám, amit az index valaha mért. Ezt a főcímet valószínűleg már láttad.",{"type":111,"content":124},[125,126,130,131,134],"Nem ez az érdekes rész. Az érdekes rész ugyanazon az oldalon, lejjebb van: ",{"tag":127,"children":128},"em",[129],"medium"," effort mellett az Opus 5.5 pontosan annyi pontot szerez, amennyit az előző generáció zászlóshajója ",{"tag":127,"children":132},[133],"maximális"," effort mellett, a feladatonkénti költség kevesebb mint negyedéért. Ez a cikk végigmegy a ranglistán, a benchmarkonkénti számokon, a hatékonysági adatokon és a buktatón, mindezt az Artificial Analysis 2026. szeptember 28-i adatai szerint, és azzal zárul, mit változtatnék ezek alapján egy éles rendszerben.",{"type":136,"level":137,"id":86,"text":87},"heading",2,{"type":111,"content":139},[140],"Az Artificial Analysis független benchmarkcég: ugyanazokat az értékeléseket futtatja minden jelentős modellen, és egymás mellett közli az intelligenciát, a sebességet és az árat. Az Intelligence Index egyetlen összetett szám. A 4.3.2-es verzió tíz értékelést von össze: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience és AA-LCR. A súlypont az ügynöki feladatokon és a tudásmunkán van, nem a lexikális kvízkérdéseken: irodai munka, terminálos munka, tudományos kódolás, hosszú kontextusú következtetés és egy tudásteszt, amely a hallucinációt is bünteti.",{"type":111,"content":142},[143],"Két tulajdonsága miatt hasznosabb, mint egy gyártó saját bejelentési grafikonja. Minden modellt ugyanaz a harness futtat, így a számok szolgáltatók között is összevethetők. Az index mellett pedig ott van a feladatonkénti költség, a felhasznált output tokenek száma és a sebesség, vagyis látod, mibe kerül egy pontszám, amit a gyártói grafikonok ritkán mutatnak meg. Mindkettőt tartsd észben a cikk további részében, mert a hatékonysági történet csak a második miatt létezik.",{"type":136,"level":137,"id":89,"text":90},{"type":111,"content":146},[147,148,151,152,155],"Az Artificial Analysis 2026. szeptember 22-én tette közzé az értékelését ",{"tag":119,"href":35,"children":149},[150],"Claude Opus 5.5 takes the top spot"," címmel. Az Opus 5.5 max effort mellett 58 pontot ér el, és 211 modellből az első az indexen, ahol a medián modell 26 pontos. Mögötte a GPT-6 Astra és a Claude Fable 5.1 holtversenyben áll 53 ponttal, a Claude Opus 5 pedig, amelyet az Opus 5.5 lecserél, 51 ponttal ",{"tag":119,"href":44,"children":153},[154],"a tizenegyedik",".",{"type":157,"attrs":158,"inner":162,"caption":163},"diagram",{"viewBox":159,"role":160,"aria-labelledby":161},"0 0 720 330","img","d1-aa-t d1-aa-d","\u003Ctitle id=\"d1-aa-t\">Artificial Analysis Intelligence Index, a ranglista eleje\u003C\u002Ftitle>\u003Cdesc id=\"d1-aa-d\">Vízszintes sávok mutatják az Intelligence Index pontszámait 2026 szeptemberében. A Claude Opus 5.5 max effort mellett 58 pontot ér el, a GPT-6 Astra 53-at, a Claude Fable 5.1 53-at, a Claude Opus 5 max effort mellett 51-et, a Claude Opus 5.5 medium effort mellett szintén 51-et, a 211 modell mediánja pedig 26-ot.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">INTELLIGENCE INDEX V4.3.2\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">forrás: Artificial Analysis\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"72\" class=\"d-text\">Opus 5.5 (max)\u003C\u002Ftext>\u003Crect x=\"200\" y=\"50\" width=\"435\" height=\"34\" rx=\"8\" class=\"d-accent\" \u002F>\u003Ctext x=\"647\" y=\"73\" class=\"d-label\">58\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"116\" class=\"d-small\">GPT-6 Astra\u003C\u002Ftext>\u003Crect x=\"200\" y=\"94\" width=\"398\" height=\"34\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"610\" y=\"117\" class=\"d-label\">53\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"160\" class=\"d-small\">Claude Fable 5.1\u003C\u002Ftext>\u003Crect x=\"200\" y=\"138\" width=\"398\" height=\"34\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"610\" y=\"161\" class=\"d-label\">53\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"204\" class=\"d-small\">Opus 5 (max)\u003C\u002Ftext>\u003Crect x=\"200\" y=\"182\" width=\"383\" height=\"34\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"595\" y=\"205\" class=\"d-label\">51\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"248\" class=\"d-small\">Opus 5.5 (medium)\u003C\u002Ftext>\u003Crect x=\"200\" y=\"226\" width=\"383\" height=\"34\" rx=\"8\" class=\"d-mint\" \u002F>\u003Ctext x=\"595\" y=\"249\" class=\"d-label\">51\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"292\" class=\"d-small\">medián, 211 modell\u003C\u002Ftext>\u003Crect x=\"200\" y=\"270\" width=\"195\" height=\"34\" rx=\"8\" class=\"d-gold\" \u002F>\u003Ctext x=\"407\" y=\"293\" class=\"d-label\">26\u003C\u002Ftext>",[164],"Max effort mellett az Opus 5.5 öt ponttal vezet, medium effort mellett pedig hozza az előző zászlóshajó max effortos eredményét.",{"type":111,"content":166},[167,168,171],"Egy összetett indexen öt pont nagy különbség. Összehasonlításképp: az Opus 5 és a holtversenyes második hely között mindössze két pont van. Az ",{"tag":119,"href":47,"children":169},[170],"OfficeChai beszámolója"," ötpontos előnyként írta le a GPT-6 Astrával szemben, és ez a korrekt olvasat: ez új csúcspontszám, nem egy holtverseny, amelyet a mérési zaj döntött el.",{"type":136,"level":137,"id":92,"text":93},{"type":111,"content":174},[175],"Egy összetett szám elrejthet egyetlen kiugró benchmarkot, ezért az értékelésenkénti számok többet mondanak az összegnél. Az Artificial Analysis a következőket közli az Opus 5.5-ről max effort mellett:",{"type":177,"ordered":178,"items":179},"list",false,[180,185,190,195,200],[181,184],{"tag":115,"children":182},[183],"Humanity's Last Exam:"," 61,4%, a korábbi legjobb 59,1% volt.",[186,189],{"tag":115,"children":187},[188],"SciCode:"," 66,9%, a korábbi legjobb 63,1% volt.",[191,194],{"tag":115,"children":192},[193],"Terminal-Bench 4.0:"," 59,6%, ugyanannyi, mint a GPT-6 Astráé xhigh effort mellett, és 11 ponttal több az Opus 5-énél.",[196,199],{"tag":115,"children":197},[198],"AA-Briefcase:"," 1822-es Elo, 143 ponttal a Claude Fable 5.1 előtt.",[201,204],{"tag":115,"children":202},[203],"GDPval-AA v2.1:"," 1846, ez 111-gyel több a Fable 5.1-nél és 138-cal több az Opus 5-nél.",{"type":111,"content":206},[207,208,213],"A javulás széles, nem egy-két kiugrásból áll. A legnagyobb előrelépés a tudásmunkában van (az AA-Briefcase és a GDPval-AA is valósághű irodai feladatokra épül), valamint a terminálos munkában, ahol a kódoló ügynökök az idejüket töltik. A Terminal-Bench az egyetlen terület, ahol nem vezet egyedül: a GPT-6 Astra ugyanannyit ér el. Ha nálad egy shellt vezérlő ",{"tag":209,"to":210,"children":211},"link","\u002Fblog\u002Fagent-loop-explained",[212],"ügynökhurok"," a munkaterhelés, az őszinte összefoglaló „holtversenyben a legjobb”, nem „a legjobb”.",{"type":136,"level":137,"id":95,"text":96},{"type":111,"content":216},[217],"Az Opus 5.5 öt effort-szintet kínál: low, medium, high, xhigh és max. Az effort azt szabályozza, mennyit gondolkodhat a modell a válasz előtt, és ezzel azt is, hány output tokenért fizetsz. Az Artificial Analysis mind az ötöt lemérte. Az indexpontszámok: low mellett 42, medium mellett 51, high mellett 54, xhigh mellett 56, max mellett 58.",{"type":111,"content":219},[220,221,224,225,228],"Most tegyünk egymás mellé kettőt ezek közül. Az Opus 5 max effort mellett 51 pontot ér el, ",{"tag":119,"href":44,"children":222},[223],"feladatonként 5,86 dollárért",". Az Opus 5.5 medium effort mellett szintén 51 pontot ér el, ",{"tag":119,"href":41,"children":226},[227],"feladatonként 1,34 dollárért",", és ezzel a nyolcadik a teljes ranglistán. Ugyanaz a pontszám, feladatonként nagyjából 77%-kal olcsóbban, ez körülbelül 4,4-szeres különbség. Ezt a mondatot tenném a bejelentő diára, és nincs rajta a bejelentő dián.",{"type":157,"attrs":230,"inner":233,"caption":234},{"viewBox":231,"role":160,"aria-labelledby":232},"0 0 720 320","d2-aa-t d2-aa-d","\u003Ctitle id=\"d2-aa-t\">Az Intelligence Index pontszáma a feladatonkénti költség függvényében\u003C\u002Ftitle>\u003Cdesc id=\"d2-aa-d\">Pontdiagram, a vízszintes tengelyen a feladatonkénti költség, a függőlegesen az Intelligence Index pontszáma. A Claude Opus 5.5 medium effort mellett 1,34 dollárnál és 51 pontnál áll. A Claude Opus 5 max effort mellett 5,86 dollárnál és ugyanúgy 51 pontnál. A Claude Opus 5.5 max effort mellett 5,98 dollárnál és 58 pontnál. A medium szint az előző zászlóshajó pontszámát a költség nagyjából negyedéért éri el.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">PONTSZÁM ÉS KÖLTSÉG FELADATONKÉNT\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">forrás: Artificial Analysis\u003C\u002Ftext>\u003Cpath d=\"M90 270 H680\" class=\"d-line\" \u002F>\u003Cpath d=\"M90 270 V50\" class=\"d-line\" \u002F>\u003Ctext x=\"90\" y=\"292\" text-anchor=\"middle\" class=\"d-label\">0 $\u003C\u002Ftext>\u003Ctext x=\"290\" y=\"292\" text-anchor=\"middle\" class=\"d-label\">2 $\u003C\u002Ftext>\u003Ctext x=\"490\" y=\"292\" text-anchor=\"middle\" class=\"d-label\">4 $\u003C\u002Ftext>\u003Ctext x=\"690\" y=\"292\" text-anchor=\"end\" class=\"d-label\">6 $ \u002F feladat\u003C\u002Ftext>\u003Ctext x=\"80\" y=\"274\" text-anchor=\"end\" class=\"d-label\">45\u003C\u002Ftext>\u003Ctext x=\"80\" y=\"174\" text-anchor=\"end\" class=\"d-label\">52\u003C\u002Ftext>\u003Ctext x=\"80\" y=\"74\" text-anchor=\"end\" class=\"d-label\">59\u003C\u002Ftext>\u003Cpath d=\"M224 184 H676\" class=\"d-line d-dash\" \u002F>\u003Ccircle cx=\"224\" cy=\"184\" r=\"11\" class=\"d-mint\" \u002F>\u003Ctext x=\"224\" y=\"220\" text-anchor=\"middle\" class=\"d-text\">Opus 5.5 medium\u003C\u002Ftext>\u003Ctext x=\"224\" y=\"238\" text-anchor=\"middle\" class=\"d-small\">51 pont, 1,34 $\u003C\u002Ftext>\u003Ccircle cx=\"676\" cy=\"184\" r=\"11\" class=\"d-box\" \u002F>\u003Ctext x=\"660\" y=\"220\" text-anchor=\"end\" class=\"d-text\">Opus 5 max\u003C\u002Ftext>\u003Ctext x=\"660\" y=\"238\" text-anchor=\"end\" class=\"d-small\">51 pont, 5,86 $\u003C\u002Ftext>\u003Ccircle cx=\"688\" cy=\"84\" r=\"11\" class=\"d-accent\" \u002F>\u003Ctext x=\"668\" y=\"74\" text-anchor=\"end\" class=\"d-text\">Opus 5.5 max\u003C\u002Ftext>\u003Ctext x=\"668\" y=\"92\" text-anchor=\"end\" class=\"d-small\">58 pont, 5,98 $\u003C\u002Ftext>\u003Ctext x=\"450\" y=\"178\" text-anchor=\"middle\" class=\"d-label\">azonos pontszám, kb. 4,4x olcsóbb\u003C\u002Ftext>",[235],"Medium effort mellett az Opus 5.5 hozza az Opus 5 max effortos pontszámát, a feladatonkénti költség nagyjából negyedéért.",{"type":111,"content":237},[238],"Az Artificial Analysis azt is megjegyzi, hogy az öt effort-szintből négy rajta van az intelligencia és a feladatonkénti költség közötti hatékonysági határon (frontier). Egyszerűbben: ennél a négy szintnél egyetlen más mért modell sem ad magasabb pontszámot ugyanannyi pénzért. A szintek lépcsője nem marketing: minden lépés felfelé valódi pontokat hoz, és te döntöd el, hol állsz meg a görbén.",{"type":240,"head":241,"rows":254},"table",[242,244,246,248,250,252],[243],"Modell és szint",[245],"Indexpontszám",[247],"Helyezés",[249],"Költség feladatonként",[251],"Output tokenek, teljes index",[253],"Kimeneti sebesség",[255,268,281],[256,258,260,262,264,266],[257],"Claude Opus 5.5, max",[259],"58",[261],"1. a 211-ből",[263],"5,98 $",[265],"260 millió",[267],"95,5 token\u002Fs",[269,271,273,275,277,279],[270],"Claude Opus 5.5, medium",[272],"51",[274],"8.",[276],"1,34 $",[278],"38 millió",[280],"81,7 token\u002Fs",[282,284,285,287,289,291],[283],"Claude Opus 5, max",[272],[286],"11.",[288],"5,86 $",[290],"140 millió",[292],"60,5 token\u002Fs",{"type":136,"level":137,"id":98,"text":99},{"type":111,"content":295},[296],"Most jön az, amit a főcím elhallgat. Max effort mellett az Opus 5.5 a legbőbeszédűbb modell a táblázat élén. Az Artificial Analysis indexfeladatonként körülbelül 119 000 output tokent számol, szemben az Opus 5 nagyjából 73 000, a Fable 5.1 nagyjából 78 000 és a GPT-6 Astra nagyjából 27 000 tokenjével. A teljes indexen 260 millió output tokent használt el, a medián modell 88 milliót. Feladatonkénti költségben csak azért van egy szinten az Opus 5-tel, mert csökkent a tokenár, nem azért, mert kevesebbet gondolkodik.",{"type":111,"content":298},[299],"A második költség az idő. A max effortos modelloldal szerint az első tokenig eltelt idő (time to first token) 682,71 másodperc, vagyis több mint tizenegy percet vársz az első tokenre, holott a 95,5 token\u002Fs-os kimeneti sebesség gyorsabb az Opus 5-énél. Medium effort mellett ugyanez az oldal 13,20 másodpercet mutat. Egy háttérfeladatnál a tizenegy perc rendben van. Mindennél, amit közben egy felhasználó néz, ez már nem beállítás, hanem üzemzavar.",{"type":301,"variant":302,"title":303,"body":304},"callout","warn","A benchmark nem a te munkaterhelésed",[305],[306],"Az index tíz konkrét értékelést mér, egyetlen harness alatt. A te promptjaid, eszközeid és hibamódjaid mások, és egy összetett indexen mért ötpontos előny egy szűk feladaton összezsugorodhat vagy el is tűnhet. Kezeld a ranglistát előszűrésként, és a saját eval készleteddel dönts.",{"type":136,"level":137,"id":101,"text":102},{"type":111,"content":309},[310,311,314],"Az Opus 5.5 ára millió input tokenenként 4 dollár, millió output tokenenként 20 dollár, ami 20%-kal kevesebb az Opus 5 árainál (5, illetve 25 dollár), a ",{"tag":119,"href":50,"children":312},[313],"Claude models overview"," és az Artificial Analysis modelloldala szerint. A cache-olvasás ennél is nagyobbat esett, 60%-kal, millió tokenenként 0,50 dollárról 0,20 dollárra, az ötperces cache írása pedig 6,25 dollárról 5 dollárra. A kontextusablak egymillió token.",{"type":111,"content":316},[317,318,322],"A cache-számok miatt érdemes lépni. Egy hosszan futó ügynök minden körben újraküldi az előzményeit, és egy bőbeszédűbb modellnél ez az előzmény gyorsabban nő. Millió gecachelt tokenenként 0,20 dollárnál egy stabil prefix szinte ingyen van, egy nem gecachelt pedig hússzor drágább. Ha még nem stabilizáltad a prompt prefixedet, a ",{"tag":209,"to":319,"children":320},"\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing",[321],"prompt cachingről és routingról szóló útmutató"," elmagyarázza, hogyan, és Opus 5.5-ön nagyobb a megtakarítás, mint bármelyik korábbi Claude modellen.",{"type":136,"level":137,"id":104,"text":105},{"type":111,"content":325},[326],"A ranglista megmondja, melyik modell a legerősebb. Azt viszont nem, hogy melyik szinten futtasd, pedig a pénz ott van. Ebben a sorrendben haladnék:",{"type":177,"ordered":328,"items":329},true,[330,335,340,350,355],[331,334],{"tag":115,"children":332},[333],"Legyen a medium az alapértelmezés."," Hozza az előző zászlóshajót a költség negyedéért, és másodpercek alatt válaszol, nem percek alatt. A legtöbb interaktív funkciónak innen kell indulnia.",[336,339],{"tag":115,"children":337},[338],"A max maradjon azokra a munkákra, amelyekre senki sem vár:"," éjszakai elemzések, kódoló ügynökkel futtatott nagy refaktorálások, eval-generálás. A tokenekre szabj explicit keretet, mert feladatonként 119 000 output token gyorsan összeadódik.",[341,344,345,349],{"tag":115,"children":342},[343],"Szabály szerint eszkalálj, ne érzésből."," Először medium szinten futtass, és csak akkor lépj high-ra vagy maxra, ha egy ellenőrzés elbukik, az eszkalálás feltételét pedig előre írd le. Egy kis, tipizált döntési modell, mint a ",{"tag":209,"to":346,"children":347},"\u002Fblog\u002Fjev-typed-decisions-llm-routing",[348],"Jev routingról szóló cikkben",", olcsón meghozza ezt a döntést.",[351,354],{"tag":115,"children":352},[353],"Cache-elj agresszívan."," A 60%-kal olcsóbb cache-olvasás mellett a prefix stabilitása ma a legnagyobb egyedi megtakarítás a hosszú ügynökmunkameneteknél.",[356,359,360,364],{"tag":115,"children":357},[358],"Váltás előtt futtasd újra a saját evaljaidat."," Ugyanazon a pontozott készleten hasonlítsd össze az Opus 5.5 mediumot azzal, amit ma futtatsz; az ",{"tag":209,"to":361,"children":362},"\u002Fblog\u002Fllm-evals-for-product-features",[363],"evals útmutató"," megmutatja, hogyan rakhatsz össze egyet egy délután alatt.",{"type":111,"content":366},[367,368,372],"Mind az öt mögött ugyanaz a gondolat áll: az effort-szint ma már termékdöntés, nem modellrészlet. Az a csapat, amelyik funkciónként választja meg, az előző generáció zászlóshajójának minőségét kapja az előző generációs számla töredékéért. Az a csapat, amelyik mindent maxon hagy, tizenegy perces válaszokért fog fizetni. Ha segítség kell ehhez a döntéshez egy valódi rendszerben, az ",{"tag":209,"to":369,"children":370},"\u002Fexpertise\u002Fai-engineer",[371],"AI fejlesztés"," oldalon leírom, hogyan közelítem meg.",{"type":136,"level":137,"id":107,"text":108},{"type":177,"ordered":328,"items":375},[376,380,384,388,392,396,399],[377],{"tag":119,"href":35,"children":378},[379],"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (2026. szeptember 22.)",[381],{"tag":119,"href":38,"children":382},[383],"Artificial Analysis: Claude Opus 5.5 (max) modelloldal",[385],{"tag":119,"href":41,"children":386},[387],"Artificial Analysis: Claude Opus 5.5 (medium) modelloldal",[389],{"tag":119,"href":44,"children":390},[391],"Artificial Analysis: Claude Opus 5 (max) modelloldal",[393],{"tag":119,"href":120,"children":394},[395],"Artificial Analysis: modell-ranglista és Intelligence Index",[397],{"tag":119,"href":47,"children":398},[46],[400],{"tag":119,"href":50,"children":401},[402],"Claude API docs: Models overview, context windows and prices (2026. szeptemberi állapot)",[404,458,502,537],{"slug":405,"published":406,"minutes":407,"category":7,"tags":408,"keywords":414,"about":424,"sources":433,"cover":452,"og":453,"expertise":53,"locales":454,"lang":57,"title":455,"description":456,"coverAlt":457},"jev-typed-decisions-llm-routing","2026-09-27",10,[409,410,411,412,413],"LLM routing","Classification","Calibration","OpenRouter","Human in the loop",[415,416,417,418,419,420,421,422,423],"llm routing","llm classification","calibrated confidence llm","typed llm output","jev model","openrouter decisions api","ai triage of code review findings","how to route low-confidence llm answers to a human","llm classifier vs structured output",[425,428,431],{"name":426,"url":427},"Calibration (statistics)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FCalibration_(statistics)",{"name":429,"url":430},"Statistical classification","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FStatistical_classification",{"name":412,"url":432},"https:\u002F\u002Fopenrouter.ai\u002F",[434,437,440,443,446,449],{"title":435,"url":436},"OpenRouter: Jev documentation","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Fcommunity\u002Fjev",{"title":438,"url":439},"OpenRouter: What is Jev?","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Finsights\u002Fwhat-is-jev\u002F",{"title":441,"url":442},"OpenRouter: How to use Jev","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Ftutorials\u002Fhow-to-use-jev\u002F",{"title":444,"url":445},"Guo et al.: On Calibration of Modern Neural Networks","https:\u002F\u002Farxiv.org\u002Fabs\u002F1706.04599",{"title":447,"url":448},"Claude API: Structured outputs","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fstructured-outputs",{"title":450,"url":451},"AI SDK: Generating structured data","https:\u002F\u002Fai-sdk.dev\u002Fdocs\u002Fai-sdk-core\u002Fgenerating-structured-data","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fog.jpg",[55,56,57],"Tipizált döntések LLM routingra és triázsra: kalibrált konfidencia Jevvel","Tipizált döntések az LLM routingban: Choice, Score és igen-valószínűség válaszok kalibrált konfidenciával, küszöbökkel és átadással embernek, Jevvel.","Kiszélesítési diagram: egy diff hunk state-ként egy Choice, egy Score és egy Noul kérdést táplál egyetlen decisions hívásban",{"slug":459,"published":406,"minutes":6,"category":7,"tags":460,"keywords":465,"about":472,"sources":477,"cover":496,"og":497,"expertise":53,"locales":498,"lang":57,"title":499,"description":500,"coverAlt":501},"llm-evals-for-product-features",[461,462,463,464],"LLM evals","LLM-as-judge","Error analysis","CI",[461,466,462,467,468,469,470,471],"AI evals","eval-driven development","pass^k vs pass@k","agent evaluation harness","regression eval suite","error analysis LLM",[473,474],{"name":27,"url":28},{"name":475,"url":476},"Software testing","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSoftware_testing",[478,481,484,487,490,493],{"title":479,"url":480},"Anthropic: Demystifying evals for AI agents (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"title":482,"url":483},"Hamel Husain: LLM evals FAQ (updated September 2026)","https:\u002F\u002Fhamel.dev\u002Fblog\u002Fposts\u002Fevals-faq\u002F",{"title":485,"url":486},"Shankar et al., Who Validates the Validators? (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2404.12272",{"title":488,"url":489},"Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (2023)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2306.05685",{"title":491,"url":492},"Yao et al., tau-bench: A Benchmark for Tool-Agent-User Interaction (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2406.12045",{"title":494,"url":495},"Anthropic: Quantifying infrastructure noise in agentic coding evals (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Finfrastructure-noise","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fog.jpg",[55,56,57],"LLM evals termékfunkciókhoz: a valódi trace-ektől a CI kapuig","Az LLM evals teszthalmazzá alakítja a benyomást: hibaelemzés valódi trace-eken, grader választás, validált LLM-as-judge, pass^k és CI kapu.","Pipeline valódi trace-ektől a nyílt kódoláson és a megszámolt hibaforma-taxonómián át a graderekig, a validált judge-ig és a CI kapuig",{"slug":503,"published":406,"minutes":504,"category":7,"tags":505,"keywords":509,"about":518,"sources":523,"cover":531,"og":532,"expertise":53,"locales":533,"lang":57,"title":534,"description":535,"coverAlt":536},"llm-cost-latency-prompt-caching-routing",9,[506,507,12,508],"Prompt caching","Model routing","Latency",[510,511,512,513,514,515,516,517],"prompt caching","LLM cost optimization","LLM latency","model routing","batch API LLM","LLM cost per request","cheaper LLM model","cache hit rate LLM",[519,520],{"name":27,"url":28},{"name":521,"url":522},"Latency (engineering)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLatency_(engineering)",[524,527,530],{"title":525,"url":526},"Claude API docs: Prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fdocs\u002Fbuild-with-claude\u002Fprompt-caching",{"title":528,"url":529},"OpenAI API docs: Prompt caching","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fprompt-caching",{"title":49,"url":50},"\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fog.jpg",[55,56,57],"Prompt caching és modell-routing: LLM költség és késleltetés csökkentése","A prompt caching, a kisebb modellre routing és a batch API-k csökkentik az éles LLM költségét és késleltetését. Így használd mindegyiket.","Négy relatív költségsáv egy kéréshez: drága modell cache nélkül, olcsóbb modell, gecachelt prefix, illetve gecachelt prefix egy batch jobban",{"slug":538,"published":5,"minutes":539,"category":540,"tags":541,"keywords":546,"about":557,"sources":563,"cover":624,"og":625,"expertise":53,"locales":626,"lang":57,"title":627,"description":628,"coverAlt":629},"token-saving-tools-coding-agents-top-20",17,"agents",[542,543,544,545],"Claude Code","token usage","context engineering","developer tools",[547,548,549,550,551,552,553,554,510,555,556,544],"reduce Claude Code token usage","token saving tools for coding agents","rtk token killer","lean-ctx","context-mode MCP","Serena MCP","Repomix compress","MCP tool search","ccusage","coding agent cost",[558,559,560],{"name":27,"url":28},{"name":24,"url":25},{"name":561,"url":562},"Prompt engineering","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPrompt_engineering",[564,567,570,573,576,579,582,585,588,591,594,597,600,603,606,609,612,615,618,621],{"title":565,"url":566},"rtk: a CLI proxy that filters shell output for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002Frtk-ai\u002Frtk",{"title":568,"url":569},"lean-ctx: context read modes and shell compression for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002Fyvgude\u002Flean-ctx",{"title":571,"url":572},"context-mode: sandboxed tool output with SQLite FTS5 search (GitHub)","https:\u002F\u002Fgithub.com\u002Fmksglu\u002Fcontext-mode",{"title":574,"url":575},"Serena: semantic code retrieval and editing over MCP (GitHub)","https:\u002F\u002Fgithub.com\u002Foraios\u002Fserena",{"title":577,"url":578},"token-savior: symbol index, memory and bash compaction over MCP (GitHub)","https:\u002F\u002Fgithub.com\u002FMibayy\u002Ftoken-savior",{"title":580,"url":581},"code-review-graph: a code graph for blast-radius reviews (GitHub)","https:\u002F\u002Fgithub.com\u002Ftirth8205\u002Fcode-review-graph",{"title":583,"url":584},"Aider documentation: repository map","https:\u002F\u002Faider.chat\u002Fdocs\u002Frepomap.html",{"title":586,"url":587},"Repomix: pack a repository into one AI-friendly file (GitHub)","https:\u002F\u002Fgithub.com\u002Fyamadashy\u002Frepomix",{"title":589,"url":590},"Context7: up-to-date library documentation for LLMs (GitHub)","https:\u002F\u002Fgithub.com\u002Fupstash\u002Fcontext7",{"title":592,"url":593},"claude-context: hybrid code search MCP (GitHub)","https:\u002F\u002Fgithub.com\u002Fzilliztech\u002Fclaude-context",{"title":595,"url":596},"caveman: terse output modes for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002FJuliusBrussee\u002Fcaveman",{"title":598,"url":599},"claude-token-efficient: an eight-rule CLAUDE.md (GitHub)","https:\u002F\u002Fgithub.com\u002Fdrona23\u002Fclaude-token-efficient",{"title":601,"url":602},"claude-code-router: a local model gateway for coding agents (GitHub)","https:\u002F\u002Fgithub.com\u002Fmusistudio\u002Fclaude-code-router",{"title":604,"url":605},"ccusage: token and cost reports from local agent logs (GitHub)","https:\u002F\u002Fgithub.com\u002Fryoppippi\u002Fccusage",{"title":607,"url":608},"LLMLingua: prompt compression (Microsoft, GitHub)","https:\u002F\u002Fgithub.com\u002Fmicrosoft\u002FLLMLingua",{"title":610,"url":611},"ComputingForGeeks: tools that reduce Claude Code token usage, tested (April 2026)","https:\u002F\u002Fcomputingforgeeks.com\u002Freduce-claude-code-token-usage-tools\u002F",{"title":613,"url":614},"Claude Code docs: manage costs effectively","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fcosts",{"title":616,"url":617},"Claude Code docs: MCP, output limits and tool search","https:\u002F\u002Fcode.claude.com\u002Fdocs\u002Fen\u002Fmcp",{"title":619,"url":620},"Claude API docs: tool search tool","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fagents-and-tools\u002Ftool-use\u002Ftool-search-tool",{"title":622,"url":623},"Claude API docs: prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fprompt-caching","\u002Fimages\u002Fblog\u002Ftoken-saving-tools-coding-agents-top-20\u002Fcover.webp","\u002Fimages\u002Fblog\u002Ftoken-saving-tools-coding-agents-top-20\u002Fog.jpg",[55,56,57],"20 módszer, hogy kevesebb tokent égessenek a kódoló ágensek: rtk, lean-ctx, Serena és társaik, bizonyítékok szerint rangsorolva","Az rtk, a lean-ctx, a context-mode, a Serena és még 16 tokenspóroló kódoló ágensekhez, bizonyítékok szerint rangsorolva, saját mérésekkel egy valódi Nuxt-kódbázison.","Oszlopdiagram, amely egy 15 100 tokenes build-naplótól szűrés után körülbelül 370 tokenig esik, a Top 20 token savers angol cím alatt.",1790582553271]