[{"data":1,"prerenderedAt":897},["ShallowReactive",2],{"blog-fine-tuning-vs-rag-vs-prompting-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":13,"about":24,"sources":34,"cover":101,"og":102,"expertise":103,"locales":104,"lang":107,"title":108,"description":109,"coverAlt":110,"metaTitle":111,"takeaways":112,"faq":118,"toc":137,"blocks":174,"others":657},"fine-tuning-vs-rag-vs-prompting","2026-10-02",12,"llmops",[9,10,11,12],"Fine-tuning","RAG","Prompting","Distillation",[14,15,16,17,18,19,20,21,22,23],"fine-tuning vs RAG","prompting vs RAG vs fine-tuning","when to fine-tune an LLM","RAG or fine-tuning","SFT vs DPO vs RFT","reinforcement fine-tuning","LLM distillation","OpenAI fine-tuning shutdown","fine-tuning decision tree","fine-tune for knowledge",[25,28,31],{"name":26,"url":27},"Fine-tuning (deep learning)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FFine-tuning_(deep_learning)",{"name":29,"url":30},"Retrieval-augmented generation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FRetrieval-augmented_generation",{"name":32,"url":33},"Knowledge distillation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FKnowledge_distillation",[35,38,41,44,47,50,53,56,59,62,65,68,71,74,77,80,83,86,89,92,95,98],{"title":36,"url":37},"OpenAI community: OpenAI self-serve fine-tuning availability (wind-down announcement)","https:\u002F\u002Fcommunity.openai.com\u002Ft\u002Fopenai-s-self-serve-fine-tuning-availability\u002F1380481",{"title":39,"url":40},"Tessl: OpenAI is shutting down self-serve fine-tuning","https:\u002F\u002Ftessl.io\u002Fblog\u002Fopenai-shutting-fine-tuning-signals-for-enterprise-ai",{"title":42,"url":43},"OpenAI API docs: Model optimization","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fmodel-optimization",{"title":45,"url":46},"OpenAI API docs: Supervised fine-tuning","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fsupervised-fine-tuning",{"title":48,"url":49},"OpenAI API docs: Direct preference optimization","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fdirect-preference-optimization",{"title":51,"url":52},"OpenAI API docs: Reinforcement fine-tuning","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Freinforcement-fine-tuning",{"title":54,"url":55},"OpenAI API docs: Fine-tuning best practices","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffine-tuning-best-practices",{"title":57,"url":58},"OpenAI Cookbook: Choosing between SFT, DPO and RFT","https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Ffine_tuning_direct_preference_optimization_guide",{"title":60,"url":61},"Google Cloud: Introduction to tuning (Gemini)","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Ftune-models",{"title":63,"url":64},"Google Cloud: About supervised fine-tuning for Gemini models","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Fgemini-supervised-tuning",{"title":66,"url":67},"Google Cloud: About preference tuning for Gemini models","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Fgemini-preference-tuning",{"title":69,"url":70},"Google Cloud: Reward functions for reinforcement learning fine-tuning","https:\u002F\u002Fdocs.cloud.google.com\u002Fgemini-enterprise-agent-platform\u002Fmodels\u002Ftuning\u002Freinforcement-tuning\u002Freinforcement-tuning-job\u002Freward-functions",{"title":72,"url":73},"Google Cloud: Supervised and distillation fine-tuning for open models","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Fopen-model-tuning",{"title":75,"url":76},"AWS: Fine-tuning for Claude 3 Haiku in Amazon Bedrock is now generally available","https:\u002F\u002Faws.amazon.com\u002Fblogs\u002Faws\u002Ffine-tuning-for-anthropics-claude-3-haiku-model-in-amazon-bedrock-is-now-generally-available\u002F",{"title":78,"url":79},"AWS: Amazon Bedrock now supports reinforcement fine-tuning","https:\u002F\u002Faws.amazon.com\u002Fabout-aws\u002Fwhats-new\u002F2025\u002F12\u002Fbedrock-reinforcement-fine-tuning-66-base-models",{"title":81,"url":82},"AWS: Amazon Bedrock Model Distillation (preview announcement)","https:\u002F\u002Faws.amazon.com\u002Fblogs\u002Faws\u002Fbuild-faster-more-cost-efficient-highly-accurate-models-with-amazon-bedrock-model-distillation-preview\u002F",{"title":84,"url":85},"AWS: Bedrock reinforcement fine-tuning adds open-weight models","https:\u002F\u002Faws.amazon.com\u002Fabout-aws\u002Fwhats-new\u002F2026\u002F02\u002Famazon-bedrock-reinforcement-fine-tuning-openai",{"title":87,"url":88},"Microsoft Foundry blog: What is new in Foundry fine-tuning, April 2026","https:\u002F\u002Fdevblogs.microsoft.com\u002Ffoundry\u002Fwhats-new-in-foundry-finetune-april-2026\u002F",{"title":90,"url":91},"Microsoft: Announcing new fine-tuning models and techniques in Azure AI Foundry","https:\u002F\u002Fazure.microsoft.com\u002Fen-us\u002Fblog\u002Fannouncing-new-fine-tuning-models-and-techniques-in-azure-ai-foundry\u002F",{"title":93,"url":94},"Ovadia et al.: Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs","https:\u002F\u002Farxiv.org\u002Fabs\u002F2312.05934",{"title":96,"url":97},"Gekhman et al.: Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?","https:\u002F\u002Farxiv.org\u002Fabs\u002F2405.05904",{"title":99,"url":100},"Hu et al.: LoRA: Low-Rank Adaptation of Large Language Models","https:\u002F\u002Farxiv.org\u002Fabs\u002F2106.09685","\u002Fimages\u002Fblog\u002Ffine-tuning-vs-rag-vs-prompting\u002Fcover.webp","\u002Fimages\u002Fblog\u002Ffine-tuning-vs-rag-vs-prompting\u002Fog.jpg","ai-engineer",[105,106,107],"en","de","hu","Prompting vs RAG vs fine-tuning vs distillation: döntési útmutató 2026-ra","Fine-tuning vs RAG vs prompting: mit változtat meg mindegyik (tudás, viselkedés, formátum), mennyibe kerül, ki kínál 2026-ban SFT-t, DPO-t és RFT-t, plusz döntési fa.","Ábra: döntési folyamat a letesztelt promptól a hiányzó tényekhez használt retrievalig, a viselkedést javító felügyelt fine-tuningig és a költségcsökkentő, kisebb modellbe történő distillationig.","Fine-tuning vs RAG vs prompting 2026 · Balázs Csorba",[113,114,115,116,117],"Minden eszköz mást változtat: a prompting az utasításokat, a RAG azt, amit a modell lát, a fine-tuning a viselkedést és a formátumot, a distillation a költséget és a sebességet.","A klasszikus hiba a tudás fine-tuningolása. A kutatások szerint új tényeknél a RAG jobb, az új tudást tartalmazó példák pedig növelhetik a hallucinációt.","2026-ban átrendeződött a szolgáltatói térkép: az OpenAI leépíti a fine-tuning platformját (új jobok 2027. január 6-ig), a Google és az AWS továbbra is kínál menedzselt SFT-t és RFT-t.","A preference tuning és az RFT csak akkor térül meg, ha tudsz kimeneteket rangsorolni vagy gradert írni, vagyis az értékelésnek a tanítás előtt léteznie kell.","Indulj mért prompttal, add hozzá a retrievalt a tényekhez, csak stabil, értékelhető viselkedést finomhangolj, és csak akkor desztillálj, ha a forgalom láthatóvá teszi a költséget.",[119,122,125,128,131,134],{"q":120,"a":121},"RAG-ot vagy fine-tuningot használjak?","RAG-ot, ha hiányzó vagy változó tények a gond, fine-tuningot, ha a viselkedés, a hangnem vagy a kimeneti formátum. A fine-tuning rossz módszer tudás hozzáadására: egy 2023-as tanulmány szerint a RAG a meglévő és az új tudásnál is jobb, egy 2024-es pedig azt találta, hogy az új tényeket tartalmazó példákat lassan tanulja meg a modell, és a megtanulásuk után nő a hallucináció.",{"q":123,"a":124},"Mikor éri meg a fine-tuning?","Ha egy letesztelt, példákkal ellátott prompt egy stabil, jól definiált viselkedésnél még mindig hibázik, van néhány száz jó példád, és mérni tudod az eredményt. Tipikus nyereség a szigorú kimeneti formátum, az osztályozás, az egységes hangnem és a rövidebb promptok nagy forgalomnál.",{"q":126,"a":127},"Elérhető még az OpenAI fine-tuning 2026-ban?","Csak azoknak a szervezeteknek, amelyek már használták. Az OpenAI 2026 májusában jelezte a fejlesztőknek, hogy leépíti a platformot: új szervezetek nem hozhatnak létre jobokat, 2027. január 6-án pedig mindenki számára megszűnik a jobok létrehozása. A meglévő finomhangolt modellek addig futnak, amíg az alapmodellt ki nem vezetik.",{"q":129,"a":130},"Mi a különbség az SFT, a DPO és az RFT között?","A supervised fine-tuning (SFT) bemenet és ideális kimenet párokon tanít. A direct preference optimization (DPO) promptonként egy preferált és egy elutasított válaszon. A reinforcement fine-tuning (RFT) során a modell válaszokat generál, amelyeket egy grader pontoz, ez az ellenőrizhető eredményű feladatokhoz illik.",{"q":132,"a":133},"Mi az a distillation, és mikor használjam?","A distillation során egy erősebb tanár modell tanítóadatot generál egy kisebb diák modellnek. Stabil, nagy forgalmú feladatnál használd, ha egy olcsóbb modell az értékelő halmazodon eléri a tanárt, és valódi pénzt spórol. Az AWS azt javasolja, hogy ha a diák modell már így is jól teljesít, maradj annál.",{"q":135,"a":136},"Hány példa kell a fine-tuninghoz?","A szolgáltatók kis kezdőszámokat mondanak: az OpenAI minimum 10 példát fogadott el, és 50–100 példától látott javulást, a Google nagyjából 100 vagy több címkézett példát javasol. A DPO-hoz jellemzően jóval több kell, az OpenAI szerint ezres nagyságrend. A minőség és a szélső esetek lefedettsége többet számít a puszta darabszámnál.",[138,141,144,147,150,153,156,159,162,165,168,171],{"id":139,"title":140},"what-each-changes","Mit változtat meg valójában az egyes eszköz",{"id":142,"title":143},"what-is-offered-in-2026","Ki mit kínál 2026-ban",{"id":145,"title":146},"prompting-first","Kezdd promptinggal, de mérd",{"id":148,"title":149},"rag-for-knowledge","RAG a tudáshoz, nem fine-tuning",{"id":151,"title":152},"sft-for-behaviour","Supervised fine-tuning viselkedésre és formátumra",{"id":154,"title":155},"preference-and-rft","Preference tuning és RFT: csak jelzéssel",{"id":157,"title":158},"distillation","Distillation: költség és késleltetés visszavásárlása",{"id":160,"title":161},"decision-tree","Döntési fa",{"id":163,"title":164},"common-mistakes","A leggyakoribb hibák",{"id":166,"title":167},"evaluation-and-maintenance","Értékelési és karbantartási ellenőrzőlista",{"id":169,"title":170},"what-i-would-do","Mit tennék én",{"id":172,"title":173},"sources","Források",[175,179,182,185,188,204,299,300,303,314,386,389,390,397,419,422,423,435,448,451,452,455,461,467,473,474,481,491,492,495,503,504,507,518,521,522,559,560,563,580,581,584,587,588],{"type":176,"content":177},"paragraph",[178],"Minden LLM-ekre építő csapat ugyanahhoz az útelágazáshoz ér: a válaszok nem elég jók, és négy eszköz van az asztalon. Jobb promptot írni, retrievalt hozzáadni, finomhangolni a modellt, vagy egy kisebbet desztillálni. Gyakran a divat dönt. A fine-tuning komoly opciónak tűnik, ezért olyan problémákra is ezt választják, amelyeket nem tud megoldani.",{"type":176,"content":180},[181],"A térkép ráadásul elmozdult. 2026 májusában az OpenAI bejelentette, hogy leépíti az önkiszolgáló fine-tuning platformját, azzal az indoklással, hogy az újabb alapmodellek annyira jól követik az utasításokat és a formátumokat, hogy a prompting mostanra olcsóbb és gyorsabb. A Google és az AWS továbbra is kínál menedzselt tuningot, nyílt modelleket pedig bárhol hangolhatsz. Ha utoljára egy éve hasonlítottad össze ezeket a lehetőségeket, a képed egy része elavult.",{"type":176,"content":183},[184],"Ezt a keretrendszert használom az ügyfeleimnél. Az eszközöket aszerint választja szét, mit változtatnak, összeveti a költséget, az adatigényt és a karbantartást, felsorolja, ki mit kínál 2026. október 2-án, megnevezi a leggyakoribb hibákat, és döntési fával meg ellenőrzőlistával zár.",{"type":186,"level":187,"id":139,"text":140},"heading",2,{"type":176,"content":189},[190,191,195,196,199,200,203],"A legegyszerűbb, ha azt kérdezed, mi a baj a kimenettel. Háromféle hiba van. A modell ",{"tag":192,"children":193},"strong",[194],"nem tud"," valamit (tudás). ",{"tag":192,"children":197},[198],"Rosszat csinál"," abból, amit tud (viselkedés). Vagy a helyes tartalmat ",{"tag":192,"children":201},[202],"rossz formában"," adja (formátum). Egy negyedik szempont, a költség és a késleltetés, külön áll: a kimenet jó, csak túl drága.",{"type":205,"head":206,"rows":217},"table",[207,209,211,213,215],[208],"Eszköz",[210],"Mit változtat",[212],"Szükséges adat",[214],"Működési költség és karbantartás",[216],"Tipikus hiba",[218,236,248,261,274,287],[219,222,224,226,234],[220],{"tag":192,"children":221},[11],[223],"Utasítások, példák, kimeneti struktúra egy híváshoz",[225],"Néhány példa és egy eval-halmaz",[227,228,233],"A hosszabb promptok minden híváskor tokent esznek; a ",{"tag":229,"to":230,"children":231},"link","\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing",[232],"prompt caching"," enyhít ezen",[235],"Prompt-drift, törékeny szélső esetek",[237,240,242,244,246],[238],{"tag":192,"children":239},[10],[241],"Amit a modell lát: privát, friss vagy nagy tudás",[243],"Dokumentumkorpusz, és a retrieval teszteléséhez kérdések",[245],"Az indexet és a pipeline-t üzemeltetni kell; hívásonként extra kontextus-token",[247],"Rossz chunk jön elő, így magabiztos téves válasz születik",[249,253,255,257,259],[250],{"tag":192,"children":251},[252],"SFT",[254],"Viselkedés, hangnem, formátum, feladatkészség",[256],"Több száz tiszta bemenet és ideális kimenet pár",[258],"Újratanítás, ha változik a követelmény vagy az alapmodell",[260],"Túltanulás, szűk általánosítás, elavult viselkedés",[262,266,268,270,272],[263],{"tag":192,"children":264},[265],"Preference tuning (DPO)",[267],"Szubjektív stílus és hangsúly",[269],"Ezernyi preferált és elutasított pár",[271],"Mint az SFT, és a címkézés a költség",[273],"A zajos preferenciák rossz ízlést tanítanak",[275,279,281,283,285],[276],{"tag":192,"children":277},[278],"RFT",[280],"Következtetés ellenőrizhető válaszú feladatoknál",[282],"Tucatnyi-több száz prompt és egy grader",[284],"A grader karbantartása; a tanítást idő alapján számlázzák",[286],"Reward hacking: a modell kijátssza a gyenge gradert",[288,291,293,295,297],[289],{"tag":192,"children":290},[12],[292],"Költség és késleltetés: a tudás kisebb modellbe kerül",[294],"Tanár kimenetek a valódi forgalmadon",[296],"Újradesztillálás, ha változik a feladat vagy a tanár",[298],"A diák csak a könnyű eseteknél éri el a tanárt",{"type":186,"level":187,"id":142,"text":143},{"type":176,"content":301},[302],"Módszer választása előtt nézd meg, hogy a szolgáltatód még árulja-e. Ez az az állapot, amelyet 2026. október 2-án a szolgáltatók dokumentációjából és bejelentéseiből ellenőrizni tudtam.",{"type":304,"variant":305,"title":306,"body":307},"callout","warn","Az OpenAI leépíti a fine-tuningot",[308],[309,310,313],"Az OpenAI 2026 májusában jelezte a fejlesztőknek, hogy azok a szervezetek, amelyek még sosem finomhangoltak, nem hozhatnak létre új jobokat, a közösségi fórumon közzétett bejelentés pedig ",{"tag":192,"children":311},[312],"2027. január 6-át"," nevezi meg dátumként, ami után egyáltalán nem lehet új jobot indítani. A meglévő finomhangolt modellek inferenciája addig működik, amíg az alapjukul szolgáló modellt ki nem vezetik. A dokumentált indok: az újabb alapmodellek sokkal jobban követik az utasításokat és a formátumokat, a prompt-alapú megoldások olcsóbbak és gyorsabbak, és kevesebb olyan eset van, amelyhez fine-tuning kell. Ha függsz egy OpenAI-os fine-tune-tól, tervezd meg a migrációt most.",{"type":205,"head":315,"rows":325},[316,318,320,322,324],[317],"Szolgáltató",[319],"Felügyelt (SFT)",[321],"Preferencia",[323],"Reinforcement (RFT)",[12],[326,339,350,363,374],[327,331,333,335,337],[328],{"tag":192,"children":329},[330],"OpenAI API",[332],"GPT-4.1, 4.1-mini, 4.1-nano (leépítés alatt)",[334],"DPO ugyanezen három modellen (leépítés alatt)",[336],"Csak o4-mini (leépítés alatt)",[338],"Nem ellenőrzött",[340,344,346,347,349],[341],{"tag":192,"children":342},[343],"Microsoft Foundry",[345],"GPT-4.1-család és Llama 4 Scout bejelentve",[338],[348],"o4-mini, modell-graderekkel (GPT-4.1-család)",[338],[351,355,357,359,361],[352],{"tag":192,"children":353},[354],"Google, Gemini",[356],"Gemini 3.5 Flash, 3.1 Flash-Lite, 2.5 Pro, 2.5 Flash és Flash-Lite",[358],"Gemini 2.5 Flash és Flash-Lite",[360],"Pre-GA előzetes ugyanezeken a Gemini modelleken",[362],"Nyílt modelleken keresztül",[364,368,370,371,372],[365],{"tag":192,"children":366},[367],"Google, nyílt modellek",[369],"Gemma, Qwen, Llama; teljes tuning vagy LoRA",[338],[338],[373],"A tanár modell hangol egy kisebb diák modellt",[375,379,381,382,384],[376],{"tag":192,"children":377},[378],"AWS Bedrock",[380],"Amazon Nova és mások; Claude 3 Haiku az us-west-2-ben",[338],[383],"Nova 2 Lite, gpt-oss-20B, Qwen3 32B",[385],"Igen; tanár és diák azonos családból",{"type":176,"content":387},[388],"Három gyakorlati következmény. Először: ma a „melyik modellt hangolhatom?” többet számít, mint a „melyik módszer?”: azok a frontier modellek, amelyeket a legtöbb csapat élesben használ, többnyire nem hangolhatók, mert a jelenlegi Claude- vagy GPT-5-osztályú modellekhez nem találtam menedzselt fine-tuningot. Másodszor: az RFT valós, de fiatal: a Google Pre-GA-ként listázza, a Microsoft saját RFT-posztjai pedig determinisztikus graderekkel javasolják kezdeni. Harmadszor: a nyílt súlyú út (LoRA Gemmán, Qwenen vagy Llamán) az egyetlen hordozható, és a hosting üzemeltetési terhét is magával hozza.",{"type":186,"level":187,"id":145,"text":146},{"type":176,"content":391},[392,393,396],"Az OpenAI saját optimalizálási útmutatója a munkát evalok, prompt engineering és fine-tuning körforgásaként írja le, és az alapvonal-értékelést teszi az elejére. A sorrenddel egyetértek, és hozzáteszek egy szabályt: ",{"tag":192,"children":394},[395],"addig nem mondhatod, hogy a prompting megbukott, amíg ki nem próbáltad az erős változatát."," Ez azt jelenti: világos feladatleírás, strukturált kimeneti séma, három–tíz valódi példa a nehéz esetekkel együtt, és egy a feladathoz elég erős modell.",{"type":398,"ordered":399,"items":400},"list",false,[401,403,405,411,413],[402],"A formátumszerződést sémába vagy structured output módba tedd, ne folyó szövegbe.",[404],"A few-shot példákat valódi hibákból vedd, ne kitalált esetekből.",[406,407,410],"Cache-eld a stabil előtagot. A hosszú, ismétlődő prompt főleg költségprobléma, és a caching nagy részét megoldja (lásd: ",{"tag":229,"to":230,"children":408},[409],"költség, késleltetés és routing",").",[412],"Előbb próbálj erősebb modellt, mielőtt egy gyengébbet hangolnál. Sok „fine-tuning probléma” valójában modellméret-probléma.",[414,415,410],"Az eval-halmazt írd meg először. Nélküle nem tudod, hogy egy későbbi változtatás segített-e (lásd: ",{"tag":229,"to":416,"children":417},"\u002Fblog\u002Fllm-evals-for-product-features",[418],"evalok termékfunkciókhoz",{"type":176,"content":420},[421],"A Google tuning-dokumentációja ugyanezt a határt húzza: a prompting a kevés címkézett adathoz és a gyors prototípusokhoz illik, a tuning akkor a leghatékonyabb, ha nagyobb címkézett adathalmazod van (100 vagy több példát javasol), és a feladatot a fejlett prompting sem oldja meg. A tuning előnyét maga is megnevezi: jobb minőség a feladatodon, kisebb késleltetés és költség a rövidebb promptoknak köszönhetően.",{"type":186,"level":187,"id":148,"text":149},{"type":176,"content":424},[425,426,430,431,434],"Ha a modellből tények hiányoznak, add oda neki a tényeket lekérdezéskor. Itt történik a legdrágább hiba, ezért érdemes kimondani a bizonyítékot. A ",{"tag":427,"children":428},"em",[429],"Fine-Tuning or Retrieval?"," című tanulmányban Ovadia és társai a felügyelet nélküli fine-tuningot hasonlították össze a RAG-gal, és azt találták, hogy a RAG következetesen jobb, mind a tanítás során látott tudásnál, mind a teljesen új tudásnál; a modellek egyáltalán nehezen tanultak új tényeket fine-tuninggal. A ",{"tag":427,"children":432},[433],"Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?"," című tanulmányban Gekhman és társai azt találták, hogy az új tudást hozó példákat lassabban tanulja meg a modell, és ha már megtanulta, lineárisan nő a hallucinációra való hajlama. Következtetésük: a modellek a ténybeli tudást főleg az előtanítás alatt szerzik, a fine-tuning azt tanítja meg, hogyan használják hatékonyabban.",{"type":176,"content":436},[437,438,442,443,447],"A gyakorlati érvek ugyanilyen erősek, mint a kutatási érvek. A tények változnak, és egy betanított tényt nem lehet újratanítás nélkül frissíteni, idézni vagy GDPR-kérésre törölni. A RAG forrásokat, dokumentumonkénti jogosultságot és percek alatt megvalósuló frissítést ad. Az ár egy jól megépítendő pipeline: chunkolás, hibrid keresés és reranking, amelyekről a ",{"tag":229,"to":439,"children":440},"\u002Fblog\u002Frag-pipeline-chunking-hybrid-search-reranking",[441],"RAG pipeline útmutatóban"," és a ",{"tag":229,"to":444,"children":445},"\u002Fblog\u002Frag-2026-hybrid-agentic-long-context",[446],"RAG 2026: hibrid, ágens-alapú vagy hosszú kontextus"," cikkben írok.",{"type":176,"content":449},[450],"Egy hasznos próba: ha a helyes válasz benne van egy dokumentumban, amelyet valaki a kezedbe adhatna, az retrieval-probléma. Ha egyetlen dokumentum sem tartalmazhatná, mert a gond az, hogyan kell válaszolni, akkor nem az.",{"type":186,"level":187,"id":151,"text":152},{"type":176,"content":453},[454],"Az SFT akkor a jó eszköz, ha a probléma a következetes viselkedés. Az OpenAI útmutatója az osztályozást, az árnyalt fordítást, a meghatározott formátumú tartalom előállítását és az utasításkövetési hibák javítását említi, és óv attól, hogy az SFT-t teljesen új tudásra használd. Projektekből származó kiegészítéseim: szigorú házi stílus, rögzített sémába történő kinyerés ott, ahol a promptok túl hosszúvá válnának, és egy 3000 tokenes prompt súlyokba sűrítése, hogy minden hívás olcsóbb legyen.",{"type":176,"content":456},[457,460],{"tag":192,"children":458},[459],"Adat."," A szolgáltatók által említett számok kicsik. Az OpenAI már 10 példát elfogadott, és 50–100 példától látott javulást; a Google útmutatója több száz címkézett példáról beszél; az AWS Claude 3 Haiku fine-tuningja 32 és 10 000 sor közötti adatot fogadott. A mennyiség nem a nehéz rész. Az OpenAI best practice útmutatója jól fogalmaz: ha a modelled nyelvtani, logikai vagy stílusproblémákkal küzd, nézd meg, hogy az adataidban nincsenek-e ugyanezek, és kevesebb jó minőségű adat többet ér, mint sok rossz. Figyelj az egyensúlyra is: a 60 százalékban elutasítást tartalmazó tanítóadatból túl sokat elutasító modell lesz.",{"type":176,"content":462},[463,466],{"tag":192,"children":464},[465],"Módszer."," A paraméterhatékony tuning megfizethetően tartja ezt. A LoRA-tanulmány nagyjából 10 000-szer kevesebb tanítható paramétert és körülbelül háromszor kevesebb GPU-memóriát említ a GPT-3 175B teljes finomhangolásához képest, plusz inferencia-késleltetés nélkül. A menedzselt szolgáltatások ezt elrejtik; nyílt modelleknél magad választasz a LoRA és a teljes tuning között.",{"type":176,"content":468},[469,472],{"tag":192,"children":470},[471],"Karbantartás."," A fine-tune egy adott alapmodell elágazása. Amikor azt a modellt kivezetik, újratanítasz, és a tanítóadatod meg az eval-halmazod az az érték, amely megmarad. Néhány platform azt is megváltoztatja, hogyan fizetsz: az AWS Provisioned Throughputot kér egy testre szabott Claude 3 Haiku futtatásához, ami a tokenenkénti költséget állandó költséggé alakítja.",{"type":186,"level":187,"id":154,"text":155},{"type":176,"content":475},[476,477,480],"A ",{"tag":192,"children":478},[479],"DPO"," párokon tanít: egy prompt, egy preferált és egy nem preferált kimenet. Az OpenAI a megfelelő hangsúlyú összefoglalásra és a jó hangnemű, stílusú chatre ajánlja, a cookbook pedig ezres-tízezres nagyságrendű példát említ adatigényként. A Google azt javasolja, hogy előbb SFT-t, utána preference tuningot futtass, és az OpenAI pipeline-ja is először az SFT-vel tanítja meg a pontos megfogalmazást. A DPO ízlésbeli finomhangolás, nem módja egy feladat megtanításának.",{"type":176,"content":482},[483,484,486,487,490],"Az ",{"tag":192,"children":485},[278]," más természetű: a modell a tanítás alatt válaszokat generál, és egy grader pontozza őket. Az OpenAI dokumentációja azt tanácsolja, hogy kicsiben kezdj, néhány tucattól néhány százig terjedő példával, hogy lásd, hasznos-e egyáltalán az RFT. Ellenőrizhető eredményű feladatokhoz illik, például teszteken átmenő kódhoz, ismert válaszú strukturált kinyeréshez vagy korlátozott következtetéshez. A Google string-match, Gemini-autorater és kódvégrehajtásos jutalmakat kínál, akár 16-ot kombinálva; az AWS az RFT-jére alapmodellekhez képest átlagosan 66 százalékos pontosságnövekedést közöl, ami kiválasztott esetekből származó gyártói állítás, nem garancia. Az RFT nem működik ott, ahol a modellnek nincs kezdeti képessége vagy homályos a jel, és a gyenge gradert kihasználják. A grader megírása a valódi projekt; egy másik nevű értékelés, ezért az ",{"tag":229,"to":416,"children":488},[489],"evalokról szóló útmutatóm"," közvetlenül érvényes.",{"type":186,"level":187,"id":157,"text":158},{"type":176,"content":493},[494],"A distillation az az egy eszköz, amely a számlát célozza. Egy erős tanár modell kimeneteket generál a valódi bemeneteiden, és egy kisebb diák modellt hangolnak rájuk. Az AWS a Bedrock Model Distillationt az eredeti nagy modellnél akár ötször gyorsabbnak és akár 75 százalékkal olcsóbbnak írja le, kevesebb mint két százalék pontosságvesztéssel, főleg RAG-alkalmazásoknál. Ezek az AWS számai a saját termékére, ezért mérj a saját adataidon. A korlátok tanulságosak: a tanárnak és a diáknak azonos családból kell származnia, és az AWS maga is azt tanácsolja, hogy ha a diák már így is jól teljesít, használd változtatás nélkül.",{"type":176,"content":496},[497,498,502],"A Google nyílt modellekre vonatkozó dokumentációja ugyanezt mondja a másik oldalról: a distillation akkor működik a legjobban, ha a tanár érdemben erősebb a diáknál, például többlépéses következtetésnél, és kisebb nyereséget hoz, ha a diák már közel jár, vagy a feladat rövid retrieval. Szabályom: csak stabil, valódi forgalmú feladatot desztillálj, miután egy értékelés bizonyítja, hogy a diák eléri a tanárt. Ha ehelyett egy kicsi és egy nagy modell közti routing a célod, nézd meg a ",{"tag":229,"to":499,"children":500},"\u002Fblog\u002Fjev-typed-decisions-llm-routing",[501],"típusos döntések LLM-routinghoz"," cikket.",{"type":186,"level":187,"id":160,"text":161},{"type":176,"content":505},[506],"A kérdések sorrendje a lényeg. Mindegyiket olcsóbb kipróbálni, mint a következőt, és minden válasz kizárja a drágább eszközöket.",{"type":508,"attrs":509,"inner":513,"caption":514},"diagram",{"viewBox":510,"role":511,"aria-labelledby":512},"0 0 720 430","img","d1-ftr-t d1-ftr-d","\u003Ctitle id=\"d1-ftr-t\">Melyik eszköz melyik problémát oldja\u003C\u002Ftitle>\u003Cdesc id=\"d1-ftr-d\">Döntési folyamat. Indulj letesztelt prompttal. Ha tények hiányoznak vagy változnak, használj retrievalt. Ha a formátum vagy a viselkedés még mindig rossz, használj felügyelt fine-tuningot, preference tuningot vagy reinforcement fine-tuningot. Ha a minőség jó, de a költség magas, desztillálj kisebb modellbe. Különben maradj a promptingnál.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">Melyik eszköz melyik problémát oldja\u003C\u002Ftext>\u003Crect x=\"20\" y=\"50\" width=\"340\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"190\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">Hiányzó, privát vagy változó tények?\u003C\u002Ftext>\u003Ctext x=\"190\" y=\"99\" text-anchor=\"middle\" class=\"d-small\">tudásprobléma\u003C\u002Ftext>\u003Cpath d=\"M360 82 H422\" class=\"d-line\" \u002F>\u003Cpath d=\"M430 82 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"395\" y=\"74\" text-anchor=\"middle\" class=\"d-label\">igen\u003C\u002Ftext>\u003Crect x=\"430\" y=\"50\" width=\"270\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"565\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">RAG\u003C\u002Ftext>\u003Ctext x=\"565\" y=\"99\" text-anchor=\"middle\" class=\"d-small\">retrieval, források, frissítés\u003C\u002Ftext>\u003Cpath d=\"M190 114 V132\" class=\"d-line\" \u002F>\u003Cpath d=\"M190 140 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"202\" y=\"132\" class=\"d-label\">nem\u003C\u002Ftext>\u003Crect x=\"20\" y=\"140\" width=\"340\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"190\" y=\"168\" text-anchor=\"middle\" class=\"d-text\">Formátum vagy viselkedés még rossz?\u003C\u002Ftext>\u003Ctext x=\"190\" y=\"189\" text-anchor=\"middle\" class=\"d-small\">erős, tesztelt prompt után\u003C\u002Ftext>\u003Cpath d=\"M360 172 H422\" class=\"d-line\" \u002F>\u003Cpath d=\"M430 172 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"395\" y=\"164\" text-anchor=\"middle\" class=\"d-label\">igen\u003C\u002Ftext>\u003Crect x=\"430\" y=\"140\" width=\"270\" height=\"64\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"565\" y=\"168\" text-anchor=\"middle\" class=\"d-text\">Hangolás: előbb SFT\u003C\u002Ftext>\u003Ctext x=\"565\" y=\"189\" text-anchor=\"middle\" class=\"d-small\">DPO: rangsor; RFT: grader\u003C\u002Ftext>\u003Cpath d=\"M190 204 V222\" class=\"d-line\" \u002F>\u003Cpath d=\"M190 230 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"202\" y=\"222\" class=\"d-label\">nem\u003C\u002Ftext>\u003Crect x=\"20\" y=\"230\" width=\"340\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"190\" y=\"258\" text-anchor=\"middle\" class=\"d-text\">Jó minőség, de lassú vagy drága?\u003C\u002Ftext>\u003Ctext x=\"190\" y=\"279\" text-anchor=\"middle\" class=\"d-small\">stabil feladat, nagy forgalom\u003C\u002Ftext>\u003Cpath d=\"M360 262 H422\" class=\"d-line\" \u002F>\u003Cpath d=\"M430 262 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"395\" y=\"254\" text-anchor=\"middle\" class=\"d-label\">igen\u003C\u002Ftext>\u003Crect x=\"430\" y=\"230\" width=\"270\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"565\" y=\"258\" text-anchor=\"middle\" class=\"d-text\">Desztillálás\u003C\u002Ftext>\u003Ctext x=\"565\" y=\"279\" text-anchor=\"middle\" class=\"d-small\">kisebb diák modell\u003C\u002Ftext>\u003Cpath d=\"M190 294 V312\" class=\"d-line\" \u002F>\u003Cpath d=\"M190 320 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"202\" y=\"312\" class=\"d-label\">nem\u003C\u002Ftext>\u003Crect x=\"20\" y=\"320\" width=\"340\" height=\"56\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"190\" y=\"353\" text-anchor=\"middle\" class=\"d-text\">Maradj promptingnál és evaloknál\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"410\" class=\"d-small\">Futtasd újra a fát, ha az alapmodell változik.\u003C\u002Ftext>",[515],{"tag":427,"children":516},[517],"A kérdések költség szerint rendezettek. Az első előtt alapvonal-értékelés áll.",{"type":176,"content":519},[520],"Két megjegyzés az olvasáshoz. Az eszközök kombinálhatók: egy éles rendszer gyakran egy hangolt vagy jól promptolt modell, a tényekhez retrievallal, egy eval-kapu mögött. A fa pedig újraindul, valahányszor az alapmodell változik, mert egy jobb modell feleslegessé teheti a tegnapi fine-tune-t, és az OpenAI szerint pontosan ezt látták.",{"type":186,"level":187,"id":163,"text":164},{"type":398,"ordered":399,"items":523},[524,529,534,539,544,549,554],[525,528],{"tag":192,"children":526},[527],"Fine-tuning tudásra."," A modell a tanítás alatt felmondja a termékkatalógusodat, élesben pedig árakat talál ki. Használj retrievalt.",[530,533],{"tag":192,"children":531},[532],"Hangolás mérés előtt."," Nincs alapvonal, nincs eval, így senki sem mondhatja meg, hogy a hangolt modell jobb-e. A letesztelt eseteken kívül gyakran rosszabb.",[535,538],{"tag":192,"children":536},[537],"Piszkos tanítóadat."," A korábbi modellkimenetekből vagy egymásnak ellentmondó emberi válaszokból másolt példák az ellentmondást tanítják.",[540,543],{"tag":192,"children":541},[542],"Gyenge modell hangolása egy rossz feladatdefiníció megmentésére."," Ha két ember nem ért egyet a helyes válaszban, semmilyen módszer nem segít.",[545,548],{"tag":192,"children":546},[547],"Az alapmodell életciklusának figyelmen kívül hagyása."," A fine-tune az alapmodelljével együtt hal meg, és 2026-ban a szolgáltató akár teljesen meg is szüntetheti a tuningot.",[550,553],{"tag":192,"children":551},[552],"Regressziós halmaz kihagyása."," Egy viselkedésre hangolva csendben más viselkedéseket is károsíthatsz, a biztonságit is.",[555,558],{"tag":192,"children":556},[557],"Bekapcsolva hagyott thinking egy hangolt feladatnál."," A Google azt javasolja, hogy hangolt feladatoknál állítsd a thinking budgetet 0-ra (Gemini 3-tól felfelé a szintet minimálisra), ami javíthatja a teljesítményt és csökkentheti a költséget.",{"type":186,"level":187,"id":166,"text":167},{"type":176,"content":561},[562],"Bármelyik eszközt is húzod meg, ugyanaz a fegyelem érvényes. Ezt az ellenőrzőlistát tenném egy pull request sablonba minden prompt-, retrieval- vagy modellváltoztatáshoz.",{"type":398,"ordered":564,"items":565},true,[566,568,570,572,574,576,578],[567],"Fagyassz be egy eval-halmazt valódi forgalomból, hibákkal és szélső esetekkel, mielőtt bármit változtatsz.",[569],"Rögzítsd az alapvonalat a jelenlegi promptra és modellre, minőséggel, késleltetéssel és feladatonkénti költséggel.",[571],"Egyszerre egy eszközt változtass, és futtasd újra a teljes halmazt, ne csak azokat az eseteket, amelyeket éppen néztél.",[573],"Tarts regressziós halmazt olyan viselkedésekhez, amelyeket nem veszíthetsz el: elutasítások, biztonság, formázás.",[575],"Verziózd a tanítóadatot, a grader vagy judge promptot és az alapmodell azonosítóját a hangolt modell mellett.",[577],"Állíts be újratanítási triggert: alapmodell kivezetése, az eval-pontszám elcsúszása vagy megváltozott követelmény.",[579],"Számold ki a megtérülést: a tuning és a hosting költsége a havonta megspórolt tokenekkel szemben.",{"type":186,"level":187,"id":169,"text":170},{"type":176,"content":582},[583],"Egy új LLM-funkciónál az első héten megépíteném az eval-halmazt, a másodikban jó promptig jutnék, és retrievalt adnék hozzá, amint a tények számítanak. Fine-tuningot csak akkor mérlegelnék, ha ezek után egy stabil viselkedés még mindig hibázik, és csak olyan platformon, amelyről azt várom, hogy két év múlva is kínálja. Ma ez a Google, az AWS vagy a nyílt modellek felé mutat, nem egy visszavonuló zárt API felé. RFT-t csak determinisztikus graderrel próbálnék, distillationt pedig csak akkor, ha a havi számla elég nagy ahhoz, hogy kifizesse a projektet.",{"type":176,"content":585},[586],"A legtöbb európai B2B termékben a prompting plusz a retrieval plusz egy jó értékelés megadja az érték 90 százalékát. Ez a projektjeimből származó megítélés, nem mért szám, és az eval-halmazodnak felül kell bírálnia. A mesterség abban áll, hogy felismerd, milyen fajta hibát látsz magad előtt.",{"type":186,"level":187,"id":172,"text":173},{"type":398,"ordered":564,"items":589},[590,594,597,600,603,606,609,612,615,618,621,624,627,630,633,636,639,642,645,648,651,654],[591],{"tag":592,"href":37,"children":593},"a",[36],[595],{"tag":592,"href":40,"children":596},[39],[598],{"tag":592,"href":43,"children":599},[42],[601],{"tag":592,"href":46,"children":602},[45],[604],{"tag":592,"href":49,"children":605},[48],[607],{"tag":592,"href":52,"children":608},[51],[610],{"tag":592,"href":55,"children":611},[54],[613],{"tag":592,"href":58,"children":614},[57],[616],{"tag":592,"href":61,"children":617},[60],[619],{"tag":592,"href":64,"children":620},[63],[622],{"tag":592,"href":67,"children":623},[66],[625],{"tag":592,"href":70,"children":626},[69],[628],{"tag":592,"href":73,"children":629},[72],[631],{"tag":592,"href":76,"children":632},[75],[634],{"tag":592,"href":79,"children":635},[78],[637],{"tag":592,"href":82,"children":638},[81],[640],{"tag":592,"href":85,"children":641},[84],[643],{"tag":592,"href":88,"children":644},[87],[646],{"tag":592,"href":91,"children":647},[90],[649],{"tag":592,"href":94,"children":650},[93],[652],{"tag":592,"href":97,"children":653},[96],[655],{"tag":592,"href":100,"children":656},[99],[658,744,799,853],{"slug":659,"published":5,"minutes":6,"category":7,"tags":660,"keywords":666,"about":677,"sources":686,"cover":738,"og":739,"expertise":103,"locales":740,"lang":107,"title":741,"description":742,"coverAlt":743},"agent-observability-opentelemetry",[661,662,663,664,665],"OpenTelemetry","LLM observability","AI agents","Tracing","Evals",[667,668,669,670,671,672,673,674,675,676],"LLM agent observability OpenTelemetry","OpenTelemetry GenAI semantic conventions","how to trace LLM agents","gen_ai semantic conventions attributes","LLM token usage and cost metrics","LLM tracing sampling","PII in LLM traces","Langfuse vs Arize Phoenix vs Datadog","AI agent tracing evals","OpenTelemetry LLM tracing",[678,680,683],{"name":661,"url":679},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":681,"url":682},"Observability","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",{"name":684,"url":685},"Intelligent agent","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FIntelligent_agent",[687,690,693,696,699,702,705,708,711,714,717,720,723,726,729,732,735],{"title":688,"url":689},"OpenTelemetry: GenAI semantic conventions repository (open-telemetry\u002Fsemantic-conventions-genai)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai",{"title":691,"url":692},"GenAI conventions: overview (status Development)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002FREADME.md",{"title":694,"url":695},"GenAI conventions: model spans, execute_tool and content capture","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-spans.md",{"title":697,"url":698},"GenAI conventions: agent spans","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-agent-spans.md",{"title":700,"url":701},"GenAI conventions: metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-metrics.md",{"title":703,"url":704},"GenAI conventions: inference token metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-token-metrics.md",{"title":706,"url":707},"GenAI conventions: events (gen_ai.evaluation.result)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-events.md",{"title":709,"url":710},"GenAI conventions: Model Context Protocol","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fmcp.md",{"title":712,"url":713},"OpenTelemetry docs: GenAI conventions moved notice","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fspecs\u002Fsemconv\u002Fgen-ai\u002F",{"title":715,"url":716},"OpenTelemetry docs: Sampling","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fconcepts\u002Fsampling\u002F",{"title":718,"url":719},"John Hodge: The state of the OpenTelemetry GenAI semantic conventions (July 2026)","https:\u002F\u002Fjohn-hodge.com\u002Fblog\u002Fopentelemetry-genai-semantic-conventions\u002F",{"title":721,"url":722},"Langfuse docs: OpenTelemetry integration","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fopentelemetry\u002Fget-started",{"title":724,"url":725},"Langfuse repository and licence","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse",{"title":727,"url":728},"Arize Phoenix repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fphoenix",{"title":730,"url":731},"Arize OpenInference repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fopeninference",{"title":733,"url":734},"Datadog docs: OpenTelemetry instrumentation for LLM Observability","https:\u002F\u002Fdocs.datadoghq.com\u002Fllm_observability\u002Finstrumentation\u002Fotel_instrumentation\u002F",{"title":736,"url":737},"Honeycomb docs: Send data with OpenTelemetry","https:\u002F\u002Fdocs.honeycomb.io\u002Fsend-data\u002Fopentelemetry\u002F","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fog.jpg",[105,106,107],"LLM-ügynökök megfigyelhetősége OpenTelemetryvel: trace-ek, tokenek, PII és eval","Így trace-eld az LLM-ügynököket OpenTelemetryvel: GenAI semantic conventions és státuszuk, span-fa, token-metrikák, sampling, PII, eval és eszközök.","Ábra: egy ügynökfuttatás OpenTelemetry span-okra ágazik szét a modellhívásokhoz, eszközhívásokhoz, token-metrikákhoz és eval-eredményekhez, majd egy trace-backendbe exportálódik.",{"slug":745,"published":746,"updated":5,"minutes":747,"category":7,"tags":748,"keywords":753,"about":764,"sources":774,"cover":793,"og":794,"expertise":103,"locales":795,"lang":107,"title":796,"description":797,"coverAlt":798},"artificial-analysis-leaderboard-claude-opus-5-5","2026-09-28",8,[749,750,751,752],"Claude Opus 5.5","Artificial Analysis","LLM benchmarks","LLM cost",[754,755,749,756,757,758,759,760,761,762,763],"Claude Opus 5.5 benchmark","Claude Opus 5.5 pricing","Artificial Analysis Intelligence Index","AI model leaderboard","Opus 5.5 benchmark","Opus 5.5 vs GPT-6 Astra","LLM cost per task","reasoning effort setting","Opus 5.5 pricing","best LLM September 2026",[765,768,771],{"name":766,"url":767},"Claude (language model)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClaude_(language_model)",{"name":769,"url":770},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":772,"url":773},"Benchmark (computing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBenchmark_(computing)",[775,778,781,784,787,790],{"title":776,"url":777},"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22 September 2026)","https:\u002F\u002Fartificialanalysis.ai\u002Farticles\u002Fclaude-opus-5-5",{"title":779,"url":780},"Artificial Analysis: Claude Opus 5.5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5",{"title":782,"url":783},"Artificial Analysis: Claude Opus 5.5 (medium) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5-medium",{"title":785,"url":786},"Artificial Analysis: Claude Opus 5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5",{"title":788,"url":789},"OfficeChai: Claude Opus 5.5 creates a 5-point lead over GPT-6 Astra","https:\u002F\u002Fofficechai.com\u002Fai\u002Fclaude-opus-5-5-creates-5-point-lead-over-gpt-6-astra-jumps-to-top-spot-on-artificial-analysis-intelligence-index\u002F",{"title":791,"url":792},"Claude API docs: Models overview, context windows and prices (as of September 2026)","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fmodels\u002Foverview","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fog.jpg",[105,106,107],"Claude Opus 5.5 az Artificial Analysis élén, de az igazi hír a medium effort","A Claude Opus 5.5 az 1. a 211 modellből az Artificial Analysisnél, 58 ponttal. Medium efforttal hozza az Opus 5 szintjét, 1,34 $ helyett 5,86 $ feladatonként.","Vízszintes sávok az Intelligence Index pontszámaival: Claude Opus 5.5 max effort mellett 58, GPT-6 Astra és Claude Fable 5.1 53, Opus 5 51, Opus 5.5 medium effort mellett 51",{"slug":800,"published":801,"minutes":802,"category":7,"tags":803,"keywords":809,"about":819,"sources":828,"cover":847,"og":848,"expertise":103,"locales":849,"lang":107,"title":850,"description":851,"coverAlt":852},"jev-typed-decisions-llm-routing","2026-09-27",10,[804,805,806,807,808],"LLM routing","Classification","Calibration","OpenRouter","Human in the loop",[810,811,812,813,814,815,816,817,818],"llm routing","llm classification","calibrated confidence llm","typed llm output","jev model","openrouter decisions api","ai triage of code review findings","how to route low-confidence llm answers to a human","llm classifier vs structured output",[820,823,826],{"name":821,"url":822},"Calibration (statistics)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FCalibration_(statistics)",{"name":824,"url":825},"Statistical classification","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FStatistical_classification",{"name":807,"url":827},"https:\u002F\u002Fopenrouter.ai\u002F",[829,832,835,838,841,844],{"title":830,"url":831},"OpenRouter: Jev documentation","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Fcommunity\u002Fjev",{"title":833,"url":834},"OpenRouter: What is Jev?","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Finsights\u002Fwhat-is-jev\u002F",{"title":836,"url":837},"OpenRouter: How to use Jev","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Ftutorials\u002Fhow-to-use-jev\u002F",{"title":839,"url":840},"Guo et al.: On Calibration of Modern Neural Networks","https:\u002F\u002Farxiv.org\u002Fabs\u002F1706.04599",{"title":842,"url":843},"Claude API: Structured outputs","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fstructured-outputs",{"title":845,"url":846},"AI SDK: Generating structured data","https:\u002F\u002Fai-sdk.dev\u002Fdocs\u002Fai-sdk-core\u002Fgenerating-structured-data","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fog.jpg",[105,106,107],"Tipizált döntések LLM routingra és triázsra: kalibrált konfidencia Jevvel","Tipizált döntések az LLM routingban: Choice, Score és igen-valószínűség válaszok kalibrált konfidenciával, küszöbökkel és átadással embernek, Jevvel.","Kiszélesítési diagram: egy diff hunk state-ként egy Choice, egy Score és egy Noul kérdést táplál egyetlen decisions hívásban",{"slug":854,"published":801,"minutes":747,"category":7,"tags":855,"keywords":860,"about":867,"sources":872,"cover":891,"og":892,"expertise":103,"locales":893,"lang":107,"title":894,"description":895,"coverAlt":896},"llm-evals-for-product-features",[856,857,858,859],"LLM evals","LLM-as-judge","Error analysis","CI",[856,861,857,862,863,864,865,866],"AI evals","eval-driven development","pass^k vs pass@k","agent evaluation harness","regression eval suite","error analysis LLM",[868,869],{"name":769,"url":770},{"name":870,"url":871},"Software testing","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSoftware_testing",[873,876,879,882,885,888],{"title":874,"url":875},"Anthropic: Demystifying evals for AI agents (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"title":877,"url":878},"Hamel Husain: LLM evals FAQ (updated September 2026)","https:\u002F\u002Fhamel.dev\u002Fblog\u002Fposts\u002Fevals-faq\u002F",{"title":880,"url":881},"Shankar et al., Who Validates the Validators? (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2404.12272",{"title":883,"url":884},"Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (2023)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2306.05685",{"title":886,"url":887},"Yao et al., tau-bench: A Benchmark for Tool-Agent-User Interaction (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2406.12045",{"title":889,"url":890},"Anthropic: Quantifying infrastructure noise in agentic coding evals (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Finfrastructure-noise","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fog.jpg",[105,106,107],"LLM evals termékfunkciókhoz: a valódi trace-ektől a CI kapuig","Az LLM evals teszthalmazzá alakítja a benyomást: hibaelemzés valódi trace-eken, grader választás, validált LLM-as-judge, pass^k és CI kapu.","Pipeline valódi trace-ektől a nyílt kódoláson és a megszámolt hibaforma-taxonómián át a graderekig, a validált judge-ig és a CI kapuig",1791009036703]