[{"data":1,"prerenderedAt":895},["ShallowReactive",2],{"blog-fine-tuning-vs-rag-vs-prompting-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":13,"about":24,"sources":34,"cover":101,"og":102,"expertise":103,"locales":104,"lang":106,"title":108,"description":109,"coverAlt":110,"metaTitle":111,"takeaways":112,"faq":118,"toc":137,"blocks":174,"others":655},"fine-tuning-vs-rag-vs-prompting","2026-10-02",12,"llmops",[9,10,11,12],"Fine-tuning","RAG","Prompting","Distillation",[14,15,16,17,18,19,20,21,22,23],"fine-tuning vs RAG","prompting vs RAG vs fine-tuning","when to fine-tune an LLM","RAG or fine-tuning","SFT vs DPO vs RFT","reinforcement fine-tuning","LLM distillation","OpenAI fine-tuning shutdown","fine-tuning decision tree","fine-tune for knowledge",[25,28,31],{"name":26,"url":27},"Fine-tuning (deep learning)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FFine-tuning_(deep_learning)",{"name":29,"url":30},"Retrieval-augmented generation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FRetrieval-augmented_generation",{"name":32,"url":33},"Knowledge distillation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FKnowledge_distillation",[35,38,41,44,47,50,53,56,59,62,65,68,71,74,77,80,83,86,89,92,95,98],{"title":36,"url":37},"OpenAI community: OpenAI self-serve fine-tuning availability (wind-down announcement)","https:\u002F\u002Fcommunity.openai.com\u002Ft\u002Fopenai-s-self-serve-fine-tuning-availability\u002F1380481",{"title":39,"url":40},"Tessl: OpenAI is shutting down self-serve fine-tuning","https:\u002F\u002Ftessl.io\u002Fblog\u002Fopenai-shutting-fine-tuning-signals-for-enterprise-ai",{"title":42,"url":43},"OpenAI API docs: Model optimization","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fmodel-optimization",{"title":45,"url":46},"OpenAI API docs: Supervised fine-tuning","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fsupervised-fine-tuning",{"title":48,"url":49},"OpenAI API docs: Direct preference optimization","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fdirect-preference-optimization",{"title":51,"url":52},"OpenAI API docs: Reinforcement fine-tuning","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Freinforcement-fine-tuning",{"title":54,"url":55},"OpenAI API docs: Fine-tuning best practices","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Ffine-tuning-best-practices",{"title":57,"url":58},"OpenAI Cookbook: Choosing between SFT, DPO and RFT","https:\u002F\u002Fdevelopers.openai.com\u002Fcookbook\u002Fexamples\u002Ffine_tuning_direct_preference_optimization_guide",{"title":60,"url":61},"Google Cloud: Introduction to tuning (Gemini)","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Ftune-models",{"title":63,"url":64},"Google Cloud: About supervised fine-tuning for Gemini models","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Fgemini-supervised-tuning",{"title":66,"url":67},"Google Cloud: About preference tuning for Gemini models","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Fgemini-preference-tuning",{"title":69,"url":70},"Google Cloud: Reward functions for reinforcement learning fine-tuning","https:\u002F\u002Fdocs.cloud.google.com\u002Fgemini-enterprise-agent-platform\u002Fmodels\u002Ftuning\u002Freinforcement-tuning\u002Freinforcement-tuning-job\u002Freward-functions",{"title":72,"url":73},"Google Cloud: Supervised and distillation fine-tuning for open models","https:\u002F\u002Fdocs.cloud.google.com\u002Fvertex-ai\u002Fgenerative-ai\u002Fdocs\u002Fmodels\u002Fopen-model-tuning",{"title":75,"url":76},"AWS: Fine-tuning for Claude 3 Haiku in Amazon Bedrock is now generally available","https:\u002F\u002Faws.amazon.com\u002Fblogs\u002Faws\u002Ffine-tuning-for-anthropics-claude-3-haiku-model-in-amazon-bedrock-is-now-generally-available\u002F",{"title":78,"url":79},"AWS: Amazon Bedrock now supports reinforcement fine-tuning","https:\u002F\u002Faws.amazon.com\u002Fabout-aws\u002Fwhats-new\u002F2025\u002F12\u002Fbedrock-reinforcement-fine-tuning-66-base-models",{"title":81,"url":82},"AWS: Amazon Bedrock Model Distillation (preview announcement)","https:\u002F\u002Faws.amazon.com\u002Fblogs\u002Faws\u002Fbuild-faster-more-cost-efficient-highly-accurate-models-with-amazon-bedrock-model-distillation-preview\u002F",{"title":84,"url":85},"AWS: Bedrock reinforcement fine-tuning adds open-weight models","https:\u002F\u002Faws.amazon.com\u002Fabout-aws\u002Fwhats-new\u002F2026\u002F02\u002Famazon-bedrock-reinforcement-fine-tuning-openai",{"title":87,"url":88},"Microsoft Foundry blog: What is new in Foundry fine-tuning, April 2026","https:\u002F\u002Fdevblogs.microsoft.com\u002Ffoundry\u002Fwhats-new-in-foundry-finetune-april-2026\u002F",{"title":90,"url":91},"Microsoft: Announcing new fine-tuning models and techniques in Azure AI Foundry","https:\u002F\u002Fazure.microsoft.com\u002Fen-us\u002Fblog\u002Fannouncing-new-fine-tuning-models-and-techniques-in-azure-ai-foundry\u002F",{"title":93,"url":94},"Ovadia et al.: Fine-Tuning or Retrieval? Comparing Knowledge Injection in LLMs","https:\u002F\u002Farxiv.org\u002Fabs\u002F2312.05934",{"title":96,"url":97},"Gekhman et al.: Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?","https:\u002F\u002Farxiv.org\u002Fabs\u002F2405.05904",{"title":99,"url":100},"Hu et al.: LoRA: Low-Rank Adaptation of Large Language Models","https:\u002F\u002Farxiv.org\u002Fabs\u002F2106.09685","\u002Fimages\u002Fblog\u002Ffine-tuning-vs-rag-vs-prompting\u002Fcover.webp","\u002Fimages\u002Fblog\u002Ffine-tuning-vs-rag-vs-prompting\u002Fog.jpg","ai-engineer",[105,106,107],"en","de","hu","Prompting vs. RAG vs. Fine-Tuning vs. Distillation: Entscheidungshilfe für 2026","Fine-Tuning vs. RAG vs. Prompting: was jeder Hebel ändert (Wissen, Verhalten, Format), was er kostet, wer 2026 noch SFT, DPO und RFT anbietet, plus Entscheidungsbaum.","Diagramm: Entscheidungsfluss von einem getesteten Prompt zu Retrieval bei fehlenden Fakten, überwachtem Fine-Tuning für Verhalten und Distillation in ein kleineres Modell für Kosten.","Fine-Tuning vs. RAG vs. Prompting 2026 · Balázs Csorba",[113,114,115,116,117],"Jeder Hebel ändert etwas anderes: Prompting ändert Anweisungen, RAG ändert, was das Modell sehen kann, Fine-Tuning ändert Verhalten und Format, Distillation ändert Kosten und Geschwindigkeit.","Fine-Tuning für Wissen ist der klassische Fehler. Studien zeigen, dass RAG bei neuen Fakten besser abschneidet und Beispiele mit neuem Wissen Halluzinationen erhöhen können.","Die Anbieterlandschaft hat sich 2026 verschoben: OpenAI fährt seine Fine-Tuning-Plattform herunter (neue Jobs enden am 6. Januar 2027), Google und AWS bieten weiter verwaltetes SFT und RFT.","Preference Tuning und RFT lohnen sich nur, wenn du Ausgaben ranken oder einen Grader schreiben kannst. Die Evaluation muss also vor dem Trainingslauf existieren.","Starte mit einem gemessenen Prompt, ergänze Retrieval für Fakten, tune nur ein stabiles, evaluierbares Verhalten und destilliere erst, wenn das Volumen die Kosten sichtbar macht.",[119,122,125,128,131,134],{"q":120,"a":121},"Soll ich RAG oder Fine-Tuning verwenden?","Nimm RAG, wenn Fakten fehlen oder sich ändern, und Fine-Tuning, wenn Verhalten, Ton oder Ausgabeformat das Problem sind. Fine-Tuning ist ein schlechter Weg, Wissen hinzuzufügen: Eine Studie von 2023 fand, dass RAG sowohl bei vorhandenem als auch bei neuem Wissen besser abschneidet, und eine Studie von 2024 zeigte, dass Beispiele mit neuen Fakten langsam gelernt werden und nach dem Lernen Halluzinationen erhöhen.",{"q":123,"a":124},"Wann lohnt sich Fine-Tuning?","Wenn ein getesteter Prompt mit Beispielen bei einem stabilen, klar definierten Verhalten weiter scheitert, du einige hundert gute Beispiele hast und das Ergebnis messen kannst. Typische Gewinne sind strikte Ausgabeformate, Klassifikation, ein einheitlicher Ton und kürzere Prompts bei hohem Volumen.",{"q":126,"a":127},"Gibt es OpenAI Fine-Tuning 2026 noch?","Nur für Organisationen, die es schon genutzt haben. OpenAI hat Entwicklern im Mai 2026 mitgeteilt, dass die Plattform heruntergefahren wird: Neue Organisationen können keine Jobs anlegen, und am 6. Januar 2027 endet die Job-Erstellung für alle. Bestehende Fine-Tunes laufen, bis ihr Basismodell abgekündigt wird.",{"q":129,"a":130},"Was ist der Unterschied zwischen SFT, DPO und RFT?","Supervised Fine-Tuning (SFT) trainiert auf Paaren aus Eingabe und idealer Ausgabe. Direct Preference Optimization (DPO) trainiert auf einer bevorzugten und einer abgelehnten Antwort pro Prompt. Reinforcement Fine-Tuning (RFT) lässt das Modell Antworten erzeugen, die ein Grader bewertet, was zu Aufgaben mit prüfbarem Ergebnis passt.",{"q":132,"a":133},"Was ist Distillation und wann sollte ich sie nutzen?","Bei der Distillation erzeugt ein stärkeres Lehrermodell Trainingsdaten für ein kleineres Schülermodell. Nutze sie bei stabilen Aufgaben mit hohem Volumen, wenn ein günstigeres Modell auf deinem Evaluationsset mit dem Lehrer gleichzieht und echtes Geld spart. AWS rät, das Schülermodell unverändert zu nutzen, wenn es bereits gut genug ist.",{"q":135,"a":136},"Wie viele Beispiele brauche ich für Fine-Tuning?","Die Anbieter nennen kleine Startwerte: OpenAI akzeptierte mindestens 10 und sah Verbesserungen ab 50 bis 100 Beispielen, Google empfiehlt etwa 100 oder mehr gelabelte Beispiele. DPO braucht meist deutlich mehr, laut OpenAI Tausende. Qualität und Abdeckung von Randfällen zählen mehr als die reine Zahl.",[138,141,144,147,150,153,156,159,162,165,168,171],{"id":139,"title":140},"what-each-changes","Was jeder Hebel tatsächlich ändert",{"id":142,"title":143},"what-is-offered-in-2026","Wer 2026 was anbietet",{"id":145,"title":146},"prompting-first","Starte mit Prompting, aber miss es",{"id":148,"title":149},"rag-for-knowledge","RAG für Wissen, nicht Fine-Tuning",{"id":151,"title":152},"sft-for-behaviour","Supervised Fine-Tuning für Verhalten und Format",{"id":154,"title":155},"preference-and-rft","Preference Tuning und RFT: nur mit Signal",{"id":157,"title":158},"distillation","Distillation: Kosten und Latenz zurückkaufen",{"id":160,"title":161},"decision-tree","Ein Entscheidungsbaum",{"id":163,"title":164},"common-mistakes","Fehler, die ich am häufigsten sehe",{"id":166,"title":167},"evaluation-and-maintenance","Checkliste für Evaluation und Pflege",{"id":169,"title":170},"what-i-would-do","Was ich tun würde",{"id":172,"title":173},"sources","Quellen",[175,179,182,185,188,204,299,300,303,314,386,389,390,397,419,422,423,435,448,451,452,455,461,467,473,474,480,489,490,493,501,502,505,516,519,520,557,558,561,578,579,582,585,586],{"type":176,"content":177},"paragraph",[178],"Jedes Team, das auf LLMs baut, landet an derselben Weggabelung: Die Antworten sind nicht gut genug, und vier Hebel stehen zur Wahl. Einen besseren Prompt schreiben, Retrieval ergänzen, das Modell feintunen oder ein kleineres destillieren. Oft entscheidet die Mode. Fine-Tuning wirkt wie die seriöse Option und wird deshalb gewählt, um Probleme zu lösen, die es nicht lösen kann.",{"type":176,"content":180},[181],"Die Landkarte hat sich zudem verschoben. Im Mai 2026 hat OpenAI angekündigt, die Self-Service-Fine-Tuning-Plattform herunterzufahren, mit der Begründung, neuere Basismodelle würden Anweisungen und Formate so gut befolgen, dass Prompting jetzt günstiger und schneller sei. Google und AWS bieten weiterhin verwaltetes Tuning an, und offene Modelle kannst du überall tunen. Wenn du diese Optionen zuletzt vor einem Jahr verglichen hast, ist ein Teil deines Bildes veraltet.",{"type":176,"content":183},[184],"Das ist das Framework, das ich mit Kunden nutze. Es trennt die Hebel danach, was sie ändern, vergleicht Kosten, Daten und Pflegeaufwand, listet auf, wer am 2. Oktober 2026 was anbietet, nennt die häufigsten Fehler und endet mit Entscheidungsbaum und Checkliste.",{"type":186,"level":187,"id":139,"text":140},"heading",2,{"type":176,"content":189},[190,191,195,196,199,200,203],"Am einfachsten fragst du, was an der Ausgabe falsch ist. Es gibt drei Arten von falsch. Das Modell ",{"tag":192,"children":193},"strong",[194],"weiß etwas nicht"," (Wissen). Es ",{"tag":192,"children":197},[198],"tut das Falsche"," mit dem, was es weiß (Verhalten). Oder es liefert den richtigen Inhalt in der ",{"tag":192,"children":201},[202],"falschen Form"," (Format). Ein viertes Thema, Kosten und Latenz, steht für sich: Die Ausgabe passt, ist aber zu teuer.",{"type":205,"head":206,"rows":217},"table",[207,209,211,213,215],[208],"Hebel",[210],"Was er ändert",[212],"Benötigte Daten",[214],"Laufende Kosten und Pflege",[216],"Typischer Fehler",[218,236,248,261,274,287],[219,222,224,226,234],[220],{"tag":192,"children":221},[11],[223],"Anweisungen, Beispiele, Ausgabestruktur für einen Aufruf",[225],"Einige Beispiele und ein Eval-Set",[227,228,233],"Längere Prompts kosten bei jedem Aufruf Tokens; ",{"tag":229,"to":230,"children":231},"link","\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing",[232],"Prompt Caching"," mildert das",[235],"Prompt-Drift, brüchige Randfälle",[237,240,242,244,246],[238],{"tag":192,"children":239},[10],[241],"Was das Modell sehen kann: privates, frisches oder großes Wissen",[243],"Ein Dokumentenkorpus und Testanfragen für das Retrieval",[245],"Index und Pipeline betreiben; zusätzliche Kontext-Tokens pro Aufruf",[247],"Falscher Chunk gefunden, also eine selbstsichere falsche Antwort",[249,253,255,257,259],[250],{"tag":192,"children":251},[252],"SFT",[254],"Verhalten, Ton, Format, Aufgabenkönnen",[256],"Hunderte saubere Paare aus Eingabe und idealer Ausgabe",[258],"Neu trainieren, wenn sich Anforderungen oder Basismodell ändern",[260],"Overfitting, enge Generalisierung, veraltetes Verhalten",[262,266,268,270,272],[263],{"tag":192,"children":264},[265],"Preference Tuning (DPO)",[267],"Subjektiver Stil und Gewichtung",[269],"Tausende Paare aus bevorzugter und abgelehnter Antwort",[271],"Wie SFT, und das Labeling ist der Kostenfaktor",[273],"Verrauschte Präferenzen trainieren den falschen Geschmack",[275,279,281,283,285],[276],{"tag":192,"children":277},[278],"RFT",[280],"Schlussfolgern bei Aufgaben mit prüfbarer Antwort",[282],"Dutzende bis Hunderte Prompts plus ein Grader",[284],"Grader pflegen; Training wird nach Zeit abgerechnet",[286],"Reward Hacking: Das Modell überlistet einen schwachen Grader",[288,291,293,295,297],[289],{"tag":192,"children":290},[12],[292],"Kosten und Latenz, indem Können in ein kleineres Modell wandert",[294],"Lehrer-Ausgaben auf deinem echten Traffic",[296],"Neu destillieren, wenn sich Aufgabe oder Lehrer ändern",[298],"Der Schüler gleicht den Lehrer nur bei leichten Fällen aus",{"type":186,"level":187,"id":142,"text":143},{"type":176,"content":301},[302],"Prüfe vor der Methodenwahl, ob dein Anbieter sie noch verkauft. Das ist der Stand, den ich am 2. Oktober 2026 aus Dokumentation und Ankündigungen der Anbieter verifizieren konnte.",{"type":304,"variant":305,"title":306,"body":307},"callout","warn","OpenAI fährt Fine-Tuning herunter",[308],[309,310,313],"OpenAI hat Entwicklern im Mai 2026 mitgeteilt, dass Organisationen, die nie feingetunt hatten, keine Jobs mehr anlegen können, und die Ankündigung im Community-Forum nennt den ",{"tag":192,"children":311},[312],"6. Januar 2027"," als Datum, ab dem gar keine neuen Jobs mehr angelegt werden können. Inferenz auf bestehenden Fine-Tunes läuft weiter, bis das zugrunde liegende Basismodell abgekündigt wird. Die dokumentierte Begründung: Neuere Basismodelle befolgen Anweisungen und Formate deutlich besser, Prompt-basierte Ansätze sind günstiger und schneller, und es gibt weniger Anwendungsfälle, die Fine-Tuning brauchen. Wenn du von einem OpenAI-Fine-Tune abhängst, plane die Migration jetzt.",{"type":205,"head":315,"rows":325},[316,318,320,322,324],[317],"Anbieter",[319],"Überwacht (SFT)",[321],"Präferenz",[323],"Reinforcement (RFT)",[12],[326,339,350,363,374],[327,331,333,335,337],[328],{"tag":192,"children":329},[330],"OpenAI API",[332],"GPT-4.1, 4.1-mini, 4.1-nano (wird heruntergefahren)",[334],"DPO auf denselben drei Modellen (wird heruntergefahren)",[336],"Nur o4-mini (wird heruntergefahren)",[338],"Nicht verifiziert",[340,344,346,347,349],[341],{"tag":192,"children":342},[343],"Microsoft Foundry",[345],"GPT-4.1-Familie und Llama 4 Scout angekündigt",[338],[348],"o4-mini, mit Modell-Gradern (GPT-4.1-Familie)",[338],[351,355,357,359,361],[352],{"tag":192,"children":353},[354],"Google, Gemini",[356],"Gemini 3.5 Flash, 3.1 Flash-Lite, 2.5 Pro, 2.5 Flash und Flash-Lite",[358],"Gemini 2.5 Flash und Flash-Lite",[360],"Pre-GA-Vorschau auf denselben Gemini-Modellen",[362],"Über offene Modelle",[364,368,370,371,372],[365],{"tag":192,"children":366},[367],"Google, offene Modelle",[369],"Gemma, Qwen, Llama; volles Tuning oder LoRA",[338],[338],[373],"Lehrermodell tunt ein kleineres Schülermodell",[375,379,381,382,384],[376],{"tag":192,"children":377},[378],"AWS Bedrock",[380],"Amazon Nova und weitere; Claude 3 Haiku in us-west-2",[338],[383],"Nova 2 Lite, gpt-oss-20B, Qwen3 32B",[385],"Ja; Lehrer und Schüler aus derselben Familie",{"type":176,"content":387},[388],"Drei praktische Folgen. Erstens entscheidet „Welches Modell kann ich tunen?” heute mehr als „Welche Methode?”: Die Frontier-Modelle, die die meisten Teams produktiv nutzen, sind größtenteils nicht tunbar, denn ich habe kein verwaltetes Fine-Tuning für aktuelle Claude- oder GPT-5-Modelle gefunden. Zweitens ist RFT real, aber jung: Google führt es als Pre-GA, und Microsofts eigene RFT-Beiträge empfehlen, mit deterministischen Gradern zu beginnen. Drittens ist der Open-Weight-Weg (LoRA auf Gemma, Qwen oder Llama) der einzige portable, und er bringt die Betriebslast des Hostings mit.",{"type":186,"level":187,"id":145,"text":146},{"type":176,"content":391},[392,393,396],"OpenAIs eigener Optimierungsleitfaden beschreibt die Arbeit als Schleife aus Evals, Prompt Engineering und Fine-Tuning und stellt eine Baseline-Evaluation an den Anfang. Der Reihenfolge stimme ich zu und ergänze eine Regel: ",{"tag":192,"children":394},[395],"Du darfst erst sagen, dass Prompting gescheitert ist, wenn du die starke Version davon probiert hast."," Das heißt: klare Aufgabenbeschreibung, ein strukturiertes Ausgabeschema, drei bis zehn echte Beispiele inklusive schwerer Fälle und ein Modell, das für die Aufgabe stark genug ist.",{"type":398,"ordered":399,"items":400},"list",false,[401,403,405,411,413],[402],"Lege den Formatvertrag in ein Schema oder einen Structured-Output-Modus, nicht in Fließtext.",[404],"Nimm Few-Shot-Beispiele aus echten Fehlern, keine erfundenen.",[406,407,410],"Cache das stabile Präfix. Ein langer, wiederholter Prompt ist vor allem ein Kostenproblem, und Caching löst einen großen Teil davon (siehe ",{"tag":229,"to":230,"children":408},[409],"Kosten, Latenz und Routing",").",[412],"Probiere ein stärkeres Modell, bevor du ein schwächeres tunst. Viele „Fine-Tuning-Probleme” sind Modellgrößen-Probleme.",[414,415,410],"Schreibe zuerst das Eval-Set. Ohne es kannst du nicht sagen, ob eine spätere Änderung geholfen hat (siehe ",{"tag":229,"to":416,"children":417},"\u002Fblog\u002Fllm-evals-for-product-features",[418],"Evals für Produkt-Features",{"type":176,"content":420},[421],"Googles Tuning-Dokumentation zieht dieselbe Linie: Prompting passt zu wenigen gelabelten Daten und schnellem Prototyping, Tuning wirkt am besten bei einem umfangreichen gelabelten Datensatz (empfohlen werden 100 Beispiele oder mehr) und einer Aufgabe, die fortgeschrittenes Prompting nicht löst. Den Vorteil des Tunings nennt sie selbst: höhere Qualität bei deiner Aufgabe und geringere Latenz und Kosten durch kürzere Prompts.",{"type":186,"level":187,"id":148,"text":149},{"type":176,"content":424},[425,426,430,431,434],"Wenn dem Modell Fakten fehlen, gib sie ihm zur Abfragezeit. Hier passiert der teuerste Fehler, deshalb lohnt sich die Evidenz. In ",{"tag":427,"children":428},"em",[429],"Fine-Tuning or Retrieval?"," verglichen Ovadia und Kollegen unüberwachtes Fine-Tuning mit RAG und fanden, dass RAG durchgehend besser abschneidet, sowohl bei Wissen, das das Modell im Training gesehen hatte, als auch bei völlig neuem Wissen; Modelle taten sich schwer, neue Fakten per Fine-Tuning überhaupt zu lernen. In ",{"tag":427,"children":432},[433],"Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations?"," fanden Gekhman und Kollegen, dass Beispiele mit neuem Wissen langsamer gelernt werden und, einmal gelernt, die Halluzinationsneigung linear erhöhen. Ihr Schluss: Modelle erwerben Faktenwissen hauptsächlich im Pre-Training, und Fine-Tuning lehrt sie, es effizienter zu nutzen.",{"type":176,"content":436},[437,438,442,443,447],"Die praktischen Gründe wiegen so schwer wie die Forschung. Fakten ändern sich, und ein eingetunter Fakt lässt sich ohne Neutraining weder aktualisieren noch zitieren noch für eine DSGVO-Anfrage löschen. RAG liefert dir Quellen, Berechtigungen pro Dokument und Updates in Minuten. Der Preis ist eine Pipeline, die du gut bauen musst: Chunking, Hybrid-Suche und Reranking, die ich im ",{"tag":229,"to":439,"children":440},"\u002Fblog\u002Frag-pipeline-chunking-hybrid-search-reranking",[441],"RAG-Pipeline-Leitfaden"," und in ",{"tag":229,"to":444,"children":445},"\u002Fblog\u002Frag-2026-hybrid-agentic-long-context",[446],"RAG 2026: hybrid, agentisch oder Long Context"," behandle.",{"type":176,"content":449},[450],"Ein nützlicher Test: Wenn die richtige Antwort in einem Dokument steht, das dir jemand reichen könnte, ist es ein Retrieval-Problem. Wenn kein Dokument sie enthalten könnte, weil das Problem das Wie der Antwort ist, dann nicht.",{"type":186,"level":187,"id":151,"text":152},{"type":176,"content":453},[454],"SFT ist das richtige Werkzeug, wenn das Problem konsistentes Verhalten ist. OpenAIs Leitfaden nennt Klassifikation, nuancierte Übersetzung, Inhalte in einem bestimmten Format und das Korrigieren von Fehlern bei der Befolgung von Anweisungen und warnt davor, SFT für völlig neues Wissen zu nutzen. Meine Ergänzungen aus Projekten: strikter Hausstil, Extraktion in ein festes Schema, wo Prompts zu lang werden, und ein 3.000-Token-Prompt, der in die Gewichte komprimiert wird, damit jeder Aufruf günstiger ist.",{"type":176,"content":456},[457,460],{"tag":192,"children":458},[459],"Daten."," Die Zahlen der Anbieter sind klein. OpenAI akzeptierte schon 10 Beispiele und sah Verbesserungen ab 50 bis 100; Googles Leitfaden spricht von Hunderten gelabelter Beispiele; AWS' Fine-Tuning für Claude 3 Haiku nahm zwischen 32 und 10.000 Zeilen. Die Menge ist nicht das Schwierige. OpenAIs Best-Practice-Leitfaden sagt es gut: Wenn dein Modell Grammatik-, Logik- oder Stilprobleme hat, prüfe, ob deine Daten dieselben Probleme haben, und eine kleinere Menge hochwertiger Daten schlägt eine größere Menge minderwertiger. Achte auch auf die Balance: Trainingsdaten mit 60 Prozent Ablehnungen erzeugen ein Modell, das zu oft ablehnt.",{"type":176,"content":462},[463,466],{"tag":192,"children":464},[465],"Methode."," Parameter-effizientes Tuning hält das bezahlbar. Das LoRA-Paper berichtet von etwa 10.000-mal weniger trainierbaren Parametern und rund dreimal weniger GPU-Speicher als beim vollen Fine-Tuning von GPT-3 175B, ohne zusätzliche Inferenz-Latenz. Verwaltete Dienste verbergen das; bei offenen Modellen wählst du selbst zwischen LoRA und vollem Tuning.",{"type":176,"content":468},[469,472],{"tag":192,"children":470},[471],"Pflege."," Ein Fine-Tune ist ein Fork eines bestimmten Basismodells. Wird dieses Modell abgekündigt, trainierst du neu, und deine Trainingsdaten und dein Eval-Set sind die Werte, die überleben. Manche Plattformen ändern auch, wie du zahlst: AWS verlangt Provisioned Throughput, um ein angepasstes Claude 3 Haiku zu betreiben, was aus einem Token-Preis einen Fixposten macht.",{"type":186,"level":187,"id":154,"text":155},{"type":176,"content":475},[476,479],{"tag":192,"children":477},[478],"DPO"," trainiert auf Paaren: ein Prompt, eine bevorzugte und eine nicht bevorzugte Ausgabe. OpenAI empfiehlt es für Zusammenfassungen mit der richtigen Gewichtung und für Chat mit passendem Ton und Stil, und das Cookbook beziffert den Datenbedarf auf Tausende bis Zehntausende Beispiele. Google empfiehlt, zuerst SFT und danach Preference Tuning auszuführen, und auch OpenAIs Pipeline lässt SFT zuerst den genauen Wortlaut lehren. DPO ist ein Feinschliff für Geschmack, kein Weg, eine Aufgabe beizubringen.",{"type":176,"content":481},[482,484,485,488],{"tag":192,"children":483},[278]," ist von anderer Art: Das Modell erzeugt im Training Antworten, und ein Grader bewertet sie. OpenAIs Dokumentation rät, klein zu starten, mit einigen Dutzend bis wenigen Hundert Beispielen, um zu sehen, ob RFT überhaupt nützt. Es passt zu Aufgaben mit prüfbarem Ergebnis wie Code, der Tests besteht, strukturierte Extraktion mit bekannter Antwort oder eingegrenztes Schlussfolgern. Google bietet String-Match-, Gemini-Autorater- und Code-Execution-Rewards, bis zu 16 kombiniert; AWS nennt im Schnitt 66 Prozent mehr Genauigkeit gegenüber Basismodellen für sein RFT, was eine Herstellerangabe aus ausgewählten Fällen und keine Garantie ist. RFT funktioniert nicht, wo das Modell anfangs keine Fähigkeit hat oder das Signal vage ist, und ein schwacher Grader wird ausgenutzt. Den Grader zu schreiben ist das eigentliche Projekt; er ist eine Evaluation unter anderem Namen, daher gilt mein ",{"tag":229,"to":416,"children":486},[487],"Leitfaden zu Evals"," direkt.",{"type":186,"level":187,"id":157,"text":158},{"type":176,"content":491},[492],"Distillation ist der eine Hebel, der auf die Rechnung zielt. Ein starkes Lehrermodell erzeugt Ausgaben auf deinen echten Eingaben, und ein kleineres Schülermodell wird darauf getunt. AWS beschreibt Bedrock Model Distillation als bis zu fünfmal schneller und bis zu 75 Prozent günstiger als das ursprüngliche große Modell, bei weniger als zwei Prozent Genauigkeitsverlust, besonders für RAG-Anwendungen. Das sind AWS' Zahlen für das eigene Produkt, miss also auf deinen Daten. Die Einschränkungen sind lehrreich: Lehrer und Schüler müssen aus derselben Familie stammen, und AWS rät selbst, den Schüler unverändert zu nutzen, wenn er schon gut genug ist.",{"type":176,"content":494},[495,496,500],"Googles Dokumentation für offene Modelle sagt dasselbe von der anderen Seite: Distillation wirkt am besten, wenn der Lehrer dem Schüler deutlich überlegen ist, etwa bei mehrstufigem Schlussfolgern, und bringt weniger, wenn der Schüler schon nahe dran ist oder die Aufgabe kurzes Retrieval ist. Meine Regel: Destilliere nur eine stabile Aufgabe mit echtem Volumen, nachdem eine Evaluation belegt, dass der Schüler den Lehrer erreicht. Geht es dir stattdessen um Routing zwischen einem kleinen und einem großen Modell, siehe ",{"tag":229,"to":497,"children":498},"\u002Fblog\u002Fjev-typed-decisions-llm-routing",[499],"typisierte Entscheidungen für LLM-Routing",".",{"type":186,"level":187,"id":160,"text":161},{"type":176,"content":503},[504],"Die Reihenfolge der Fragen ist der Punkt. Jede ist günstiger auszuprobieren als die nächste, und jede Antwort schließt die teureren Hebel aus.",{"type":506,"attrs":507,"inner":511,"caption":512},"diagram",{"viewBox":508,"role":509,"aria-labelledby":510},"0 0 720 430","img","d1-ftr-t d1-ftr-d","\u003Ctitle id=\"d1-ftr-t\">Welcher Hebel löst welches Problem\u003C\u002Ftitle>\u003Cdesc id=\"d1-ftr-d\">Entscheidungsfluss. Starte mit einem getesteten Prompt. Fehlen Fakten oder ändern sie sich, nimm Retrieval. Sind Format oder Verhalten weiter falsch, nimm überwachtes Fine-Tuning, Preference Tuning oder Reinforcement Fine-Tuning. Stimmt die Qualität, aber die Kosten sind zu hoch, destilliere in ein kleineres Modell. Sonst bleibe beim Prompting.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">Welcher Hebel löst welches Problem\u003C\u002Ftext>\u003Crect x=\"20\" y=\"50\" width=\"340\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"190\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">Fehlen Fakten, privat oder wechselnd?\u003C\u002Ftext>\u003Ctext x=\"190\" y=\"99\" text-anchor=\"middle\" class=\"d-small\">Wissensproblem\u003C\u002Ftext>\u003Cpath d=\"M360 82 H422\" class=\"d-line\" \u002F>\u003Cpath d=\"M430 82 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"395\" y=\"74\" text-anchor=\"middle\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"430\" y=\"50\" width=\"270\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"565\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">RAG\u003C\u002Ftext>\u003Ctext x=\"565\" y=\"99\" text-anchor=\"middle\" class=\"d-small\">Retrieval, Quellen, Updates\u003C\u002Ftext>\u003Cpath d=\"M190 114 V132\" class=\"d-line\" \u002F>\u003Cpath d=\"M190 140 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"202\" y=\"132\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"20\" y=\"140\" width=\"340\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"190\" y=\"168\" text-anchor=\"middle\" class=\"d-text\">Format oder Verhalten noch falsch?\u003C\u002Ftext>\u003Ctext x=\"190\" y=\"189\" text-anchor=\"middle\" class=\"d-small\">nach starkem, getestetem Prompt\u003C\u002Ftext>\u003Cpath d=\"M360 172 H422\" class=\"d-line\" \u002F>\u003Cpath d=\"M430 172 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"395\" y=\"164\" text-anchor=\"middle\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"430\" y=\"140\" width=\"270\" height=\"64\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"565\" y=\"168\" text-anchor=\"middle\" class=\"d-text\">Tunen: erst SFT\u003C\u002Ftext>\u003Ctext x=\"565\" y=\"189\" text-anchor=\"middle\" class=\"d-small\">DPO: Rankings; RFT: Grader\u003C\u002Ftext>\u003Cpath d=\"M190 204 V222\" class=\"d-line\" \u002F>\u003Cpath d=\"M190 230 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"202\" y=\"222\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"20\" y=\"230\" width=\"340\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"190\" y=\"258\" text-anchor=\"middle\" class=\"d-text\">Qualität gut, aber zu langsam\u002Fteuer?\u003C\u002Ftext>\u003Ctext x=\"190\" y=\"279\" text-anchor=\"middle\" class=\"d-small\">stabile Aufgabe, hohes Volumen\u003C\u002Ftext>\u003Cpath d=\"M360 262 H422\" class=\"d-line\" \u002F>\u003Cpath d=\"M430 262 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"395\" y=\"254\" text-anchor=\"middle\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"430\" y=\"230\" width=\"270\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"565\" y=\"258\" text-anchor=\"middle\" class=\"d-text\">Destillieren\u003C\u002Ftext>\u003Ctext x=\"565\" y=\"279\" text-anchor=\"middle\" class=\"d-small\">kleineres Schülermodell\u003C\u002Ftext>\u003Cpath d=\"M190 294 V312\" class=\"d-line\" \u002F>\u003Cpath d=\"M190 320 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"202\" y=\"312\" class=\"d-label\">nein\u003C\u002Ftext>\u003Crect x=\"20\" y=\"320\" width=\"340\" height=\"56\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"190\" y=\"353\" text-anchor=\"middle\" class=\"d-text\">Beim Prompting mit Evals bleiben\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"410\" class=\"d-small\">Baum neu durchlaufen, sobald sich das Basismodell ändert.\u003C\u002Ftext>",[513],{"tag":427,"children":514},[515],"Die Fragen sind nach Kosten geordnet. Eine Baseline-Evaluation kommt vor der ersten.",{"type":176,"content":517},[518],"Zwei Hinweise zum Lesen. Die Hebel lassen sich kombinieren: Ein Produktivsystem ist oft ein getuntes oder gut promptetes Modell, mit Retrieval für Fakten, hinter einem Eval-Gate. Und der Baum beginnt von vorn, sobald sich das Basismodell ändert, denn ein besseres Modell kann den Fine-Tune von gestern überflüssig machen, genau das beobachtet laut eigener Aussage OpenAI.",{"type":186,"level":187,"id":163,"text":164},{"type":398,"ordered":399,"items":521},[522,527,532,537,542,547,552],[523,526],{"tag":192,"children":524},[525],"Fine-Tuning für Wissen."," Das Modell rezitiert deinen Produktkatalog im Training und erfindet in Produktion Preise. Nimm Retrieval.",[528,531],{"tag":192,"children":529},[530],"Tunen vor dem Messen."," Keine Baseline, keine Evaluation, also kann niemand sagen, ob das getunte Modell besser ist. Bei ungetesteten Fällen ist es oft schlechter.",[533,536],{"tag":192,"children":534},[535],"Schmutzige Trainingsdaten."," Beispiele, die aus früheren Modellausgaben oder uneinheitlichen menschlichen Antworten stammen, lehren die Uneinheitlichkeit.",[538,541],{"tag":192,"children":539},[540],"Ein schwaches Modell tunen, um eine schlechte Aufgabendefinition zu retten."," Wenn zwei Menschen sich über die richtige Antwort uneinig sind, behebt keine Methode das.",[543,546],{"tag":192,"children":544},[545],"Den Lebenszyklus des Basismodells ignorieren."," Der Fine-Tune stirbt mit seinem Basismodell, und 2026 kann der Anbieter Tuning ganz einstellen.",[548,551],{"tag":192,"children":549},[550],"Kein Regressions-Set."," Tuning für ein Verhalten kann andere still beschädigen, auch Sicherheitsverhalten.",[553,556],{"tag":192,"children":554},[555],"Thinking in einer getunten Aufgabe aktiviert lassen."," Google rät, das Thinking-Budget auf 0 (bzw. das Level auf minimal bei Gemini 3 und höher) zu setzen, was Leistung verbessern und Kosten senken kann.",{"type":186,"level":187,"id":166,"text":167},{"type":176,"content":559},[560],"Welchen Hebel du auch ziehst, dieselbe Disziplin gilt. Das ist die Checkliste, die ich in eine Pull-Request-Vorlage für jede Änderung an Prompts, Retrieval oder Modellen legen würde.",{"type":398,"ordered":562,"items":563},true,[564,566,568,570,572,574,576],[565],"Friere ein Eval-Set aus echtem Traffic ein, inklusive Fehlern und Randfällen, bevor du etwas änderst.",[567],"Halte die Baseline für aktuellen Prompt und Modell fest, mit Qualität, Latenz und Kosten pro Aufgabe.",[569],"Ändere einen Hebel nach dem anderen und führe das ganze Set erneut aus, nicht nur die Fälle, die du gerade angesehen hast.",[571],"Führe ein Regressions-Set für Verhalten, die du nicht verlieren darfst: Ablehnungen, Sicherheit, Formatierung.",[573],"Versioniere Trainingsdaten, Grader- oder Judge-Prompt und die Basismodell-Kennung neben dem getunten Modell.",[575],"Lege einen Trigger für Neutraining fest: Abkündigung des Basismodells, Drift im Eval-Score oder eine geänderte Anforderung.",[577],"Berechne den Break-even: Kosten für Tuning und Hosting gegen die Tokens, die du pro Monat sparst.",{"type":186,"level":187,"id":169,"text":170},{"type":176,"content":580},[581],"Bei einem neuen LLM-Feature würde ich in Woche eins das Eval-Set bauen, in Woche zwei einen guten Prompt erreichen und Retrieval ergänzen, sobald Fakten zählen. Fine-Tuning würde ich erst erwägen, wenn danach ein stabiles Verhalten weiter scheitert, und nur auf einer Plattform, bei der ich davon ausgehe, dass sie es in zwei Jahren noch anbietet. Heute zeigt das auf Google, AWS oder offene Modelle statt auf eine geschlossene API, die sich zurückzieht. RFT würde ich nur mit einem deterministischen Grader probieren und Distillation nur, wenn die Monatsrechnung groß genug ist, um das Projekt zu bezahlen.",{"type":176,"content":583},[584],"Für die meisten europäischen B2B-Produkte bringen Prompting plus Retrieval plus eine gute Evaluation 90 Prozent des Nutzens. Das ist ein Urteil aus meinen Projekten, keine gemessene Zahl, und dein Eval-Set sollte es überstimmen. Die Kunst ist zu erkennen, welche Art von falsch du vor dir hast.",{"type":186,"level":187,"id":172,"text":173},{"type":398,"ordered":562,"items":587},[588,592,595,598,601,604,607,610,613,616,619,622,625,628,631,634,637,640,643,646,649,652],[589],{"tag":590,"href":37,"children":591},"a",[36],[593],{"tag":590,"href":40,"children":594},[39],[596],{"tag":590,"href":43,"children":597},[42],[599],{"tag":590,"href":46,"children":600},[45],[602],{"tag":590,"href":49,"children":603},[48],[605],{"tag":590,"href":52,"children":606},[51],[608],{"tag":590,"href":55,"children":609},[54],[611],{"tag":590,"href":58,"children":612},[57],[614],{"tag":590,"href":61,"children":615},[60],[617],{"tag":590,"href":64,"children":618},[63],[620],{"tag":590,"href":67,"children":621},[66],[623],{"tag":590,"href":70,"children":624},[69],[626],{"tag":590,"href":73,"children":627},[72],[629],{"tag":590,"href":76,"children":630},[75],[632],{"tag":590,"href":79,"children":633},[78],[635],{"tag":590,"href":82,"children":636},[81],[638],{"tag":590,"href":85,"children":639},[84],[641],{"tag":590,"href":88,"children":642},[87],[644],{"tag":590,"href":91,"children":645},[90],[647],{"tag":590,"href":94,"children":648},[93],[650],{"tag":590,"href":97,"children":651},[96],[653],{"tag":590,"href":100,"children":654},[99],[656,742,797,851],{"slug":657,"published":5,"minutes":6,"category":7,"tags":658,"keywords":664,"about":675,"sources":684,"cover":736,"og":737,"expertise":103,"locales":738,"lang":106,"title":739,"description":740,"coverAlt":741},"agent-observability-opentelemetry",[659,660,661,662,663],"OpenTelemetry","LLM observability","AI agents","Tracing","Evals",[665,666,667,668,669,670,671,672,673,674],"LLM agent observability OpenTelemetry","OpenTelemetry GenAI semantic conventions","how to trace LLM agents","gen_ai semantic conventions attributes","LLM token usage and cost metrics","LLM tracing sampling","PII in LLM traces","Langfuse vs Arize Phoenix vs Datadog","AI agent tracing evals","OpenTelemetry LLM tracing",[676,678,681],{"name":659,"url":677},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":679,"url":680},"Observability","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",{"name":682,"url":683},"Intelligent agent","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FIntelligent_agent",[685,688,691,694,697,700,703,706,709,712,715,718,721,724,727,730,733],{"title":686,"url":687},"OpenTelemetry: GenAI semantic conventions repository (open-telemetry\u002Fsemantic-conventions-genai)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai",{"title":689,"url":690},"GenAI conventions: overview (status Development)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002FREADME.md",{"title":692,"url":693},"GenAI conventions: model spans, execute_tool and content capture","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-spans.md",{"title":695,"url":696},"GenAI conventions: agent spans","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-agent-spans.md",{"title":698,"url":699},"GenAI conventions: metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-metrics.md",{"title":701,"url":702},"GenAI conventions: inference token metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-token-metrics.md",{"title":704,"url":705},"GenAI conventions: events (gen_ai.evaluation.result)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-events.md",{"title":707,"url":708},"GenAI conventions: Model Context Protocol","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fmcp.md",{"title":710,"url":711},"OpenTelemetry docs: GenAI conventions moved notice","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fspecs\u002Fsemconv\u002Fgen-ai\u002F",{"title":713,"url":714},"OpenTelemetry docs: Sampling","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fconcepts\u002Fsampling\u002F",{"title":716,"url":717},"John Hodge: The state of the OpenTelemetry GenAI semantic conventions (July 2026)","https:\u002F\u002Fjohn-hodge.com\u002Fblog\u002Fopentelemetry-genai-semantic-conventions\u002F",{"title":719,"url":720},"Langfuse docs: OpenTelemetry integration","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fopentelemetry\u002Fget-started",{"title":722,"url":723},"Langfuse repository and licence","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse",{"title":725,"url":726},"Arize Phoenix repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fphoenix",{"title":728,"url":729},"Arize OpenInference repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fopeninference",{"title":731,"url":732},"Datadog docs: OpenTelemetry instrumentation for LLM Observability","https:\u002F\u002Fdocs.datadoghq.com\u002Fllm_observability\u002Finstrumentation\u002Fotel_instrumentation\u002F",{"title":734,"url":735},"Honeycomb docs: Send data with OpenTelemetry","https:\u002F\u002Fdocs.honeycomb.io\u002Fsend-data\u002Fopentelemetry\u002F","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fog.jpg",[105,106,107],"Observability für LLM-Agenten mit OpenTelemetry: Traces, Tokens, PII und Evals","So tracest du LLM-Agenten mit OpenTelemetry: GenAI Semantic Conventions und ihr Status, Span-Baum, Token-Metriken, Sampling, PII, Evals und Tool-Optionen.","Diagramm: Ein Agentenlauf verzweigt sich in OpenTelemetry-Spans für Modellaufrufe, Tool-Aufrufe, Token-Metriken und Eval-Ergebnisse, die an ein Trace-Backend exportiert werden.",{"slug":743,"published":744,"updated":5,"minutes":745,"category":7,"tags":746,"keywords":751,"about":762,"sources":772,"cover":791,"og":792,"expertise":103,"locales":793,"lang":106,"title":794,"description":795,"coverAlt":796},"artificial-analysis-leaderboard-claude-opus-5-5","2026-09-28",8,[747,748,749,750],"Claude Opus 5.5","Artificial Analysis","LLM benchmarks","LLM cost",[752,753,747,754,755,756,757,758,759,760,761],"Claude Opus 5.5 benchmark","Claude Opus 5.5 pricing","Artificial Analysis Intelligence Index","AI model leaderboard","Opus 5.5 benchmark","Opus 5.5 vs GPT-6 Astra","LLM cost per task","reasoning effort setting","Opus 5.5 pricing","best LLM September 2026",[763,766,769],{"name":764,"url":765},"Claude (language model)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClaude_(language_model)",{"name":767,"url":768},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":770,"url":771},"Benchmark (computing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBenchmark_(computing)",[773,776,779,782,785,788],{"title":774,"url":775},"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22 September 2026)","https:\u002F\u002Fartificialanalysis.ai\u002Farticles\u002Fclaude-opus-5-5",{"title":777,"url":778},"Artificial Analysis: Claude Opus 5.5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5",{"title":780,"url":781},"Artificial Analysis: Claude Opus 5.5 (medium) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5-medium",{"title":783,"url":784},"Artificial Analysis: Claude Opus 5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5",{"title":786,"url":787},"OfficeChai: Claude Opus 5.5 creates a 5-point lead over GPT-6 Astra","https:\u002F\u002Fofficechai.com\u002Fai\u002Fclaude-opus-5-5-creates-5-point-lead-over-gpt-6-astra-jumps-to-top-spot-on-artificial-analysis-intelligence-index\u002F",{"title":789,"url":790},"Claude API docs: Models overview, context windows and prices (as of September 2026)","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fmodels\u002Foverview","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fog.jpg",[105,106,107],"Claude Opus 5.5 holt Platz 1 bei Artificial Analysis – die eigentliche Story ist medium","Claude Opus 5.5 ist Platz 1 von 211 Modellen bei Artificial Analysis (58 Punkte). Mit Effort medium erreicht es Opus 5 für 1,34 $ statt 5,86 $ pro Aufgabe.","Horizontale Balken mit Werten im Intelligence Index: Claude Opus 5.5 mit Effort max 58, GPT-6 Astra und Claude Fable 5.1 53, Opus 5 51, Opus 5.5 mit Effort medium 51",{"slug":798,"published":799,"minutes":800,"category":7,"tags":801,"keywords":807,"about":817,"sources":826,"cover":845,"og":846,"expertise":103,"locales":847,"lang":106,"title":848,"description":849,"coverAlt":850},"jev-typed-decisions-llm-routing","2026-09-27",10,[802,803,804,805,806],"LLM routing","Classification","Calibration","OpenRouter","Human in the loop",[808,809,810,811,812,813,814,815,816],"llm routing","llm classification","calibrated confidence llm","typed llm output","jev model","openrouter decisions api","ai triage of code review findings","how to route low-confidence llm answers to a human","llm classifier vs structured output",[818,821,824],{"name":819,"url":820},"Calibration (statistics)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FCalibration_(statistics)",{"name":822,"url":823},"Statistical classification","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FStatistical_classification",{"name":805,"url":825},"https:\u002F\u002Fopenrouter.ai\u002F",[827,830,833,836,839,842],{"title":828,"url":829},"OpenRouter: Jev documentation","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Fcommunity\u002Fjev",{"title":831,"url":832},"OpenRouter: What is Jev?","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Finsights\u002Fwhat-is-jev\u002F",{"title":834,"url":835},"OpenRouter: How to use Jev","https:\u002F\u002Fopenrouter.ai\u002Fblog\u002Ftutorials\u002Fhow-to-use-jev\u002F",{"title":837,"url":838},"Guo et al.: On Calibration of Modern Neural Networks","https:\u002F\u002Farxiv.org\u002Fabs\u002F1706.04599",{"title":840,"url":841},"Claude API: Structured outputs","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fbuild-with-claude\u002Fstructured-outputs",{"title":843,"url":844},"AI SDK: Generating structured data","https:\u002F\u002Fai-sdk.dev\u002Fdocs\u002Fai-sdk-core\u002Fgenerating-structured-data","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fjev-typed-decisions-llm-routing\u002Fog.jpg",[105,106,107],"Typisierte Entscheidungen für LLM-Routing und Triage: kalibrierte Konfidenz mit Jev","LLM-Routing mit typisierten Entscheidungen: Choice-, Score- und Ja-Wahrscheinlichkeits-Antworten mit kalibrierter Konfidenz, Schwellen und Hand-off, mit Jev.","Fan-out-Diagramm: ein Diff-Hunk als State speist eine Choice-, eine Score- und eine Noul-Frage in einem einzigen decisions-Aufruf",{"slug":852,"published":799,"minutes":745,"category":7,"tags":853,"keywords":858,"about":865,"sources":870,"cover":889,"og":890,"expertise":103,"locales":891,"lang":106,"title":892,"description":893,"coverAlt":894},"llm-evals-for-product-features",[854,855,856,857],"LLM evals","LLM-as-judge","Error analysis","CI",[854,859,855,860,861,862,863,864],"AI evals","eval-driven development","pass^k vs pass@k","agent evaluation harness","regression eval suite","error analysis LLM",[866,867],{"name":767,"url":768},{"name":868,"url":869},"Software testing","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSoftware_testing",[871,874,877,880,883,886],{"title":872,"url":873},"Anthropic: Demystifying evals for AI agents (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Fdemystifying-evals-for-ai-agents",{"title":875,"url":876},"Hamel Husain: LLM evals FAQ (updated September 2026)","https:\u002F\u002Fhamel.dev\u002Fblog\u002Fposts\u002Fevals-faq\u002F",{"title":878,"url":879},"Shankar et al., Who Validates the Validators? (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2404.12272",{"title":881,"url":882},"Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena (2023)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2306.05685",{"title":884,"url":885},"Yao et al., tau-bench: A Benchmark for Tool-Agent-User Interaction (2024)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2406.12045",{"title":887,"url":888},"Anthropic: Quantifying infrastructure noise in agentic coding evals (2026)","https:\u002F\u002Fwww.anthropic.com\u002Fengineering\u002Finfrastructure-noise","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-evals-for-product-features\u002Fog.jpg",[105,106,107],"LLM-Evals für Produktfeatures: von handgelesenen Traces zum CI-Gate","LLM-Evals machen aus dem Bauchgefühl eine Testsuite: Fehleranalyse auf echten Traces, Grader-Wahl, ein validierter LLM-as-judge, pass^k und ein CI-Gate.","Pipeline von echten Traces über offenes Kodieren und eine gezählte Fehlertaxonomie bis zu Gradern, validiertem Judge und CI-Gate",1791009037615]