[{"data":1,"prerenderedAt":629},["ShallowReactive",2],{"tool-ragas-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":22,"sources":25,"cover":43,"og":44,"expertise":45,"locales":46,"lang":48,"title":50,"description":51,"coverAlt":52,"url":53,"pricing":54,"kind":55,"metaTitle":56,"takeaways":57,"faq":63,"toc":76,"blocks":101,"others":393},"ragas","2026-05-20",10,"llmops",[9,10,11,12,13],"RAG evaluation","LLM-as-judge","Test sets","CI quality","Ragas",[4,15,16,17,18,19,20,21],"ragas tutorial","ragas vs deepeval","llm evaluation metrics","faithfulness context precision","rag evaluation framework","llm as a judge","ragas pricing",[23],{"name":13,"url":24},"https:\u002F\u002Fwww.ragas.io\u002F",[26,29,32,35,38,41],{"title":27,"url":28},"Ragas documentation: introduction","https:\u002F\u002Fdocs.ragas.io\u002Fen\u002Fstable\u002F",{"title":30,"url":31},"Ragas documentation: quick start","https:\u002F\u002Fdocs.ragas.io\u002Fen\u002Fstable\u002Fgetstarted\u002Fquickstart\u002F",{"title":33,"url":34},"Ragas documentation: list of available metrics","https:\u002F\u002Fdocs.ragas.io\u002Fen\u002Fstable\u002Fconcepts\u002Fmetrics\u002Favailable_metrics\u002F",{"title":36,"url":37},"Ragas on GitHub","https:\u002F\u002Fgithub.com\u002Fvibrantlabsai\u002Fragas",{"title":39,"url":40},"Ragas on PyPI","https:\u002F\u002Fpypi.org\u002Fproject\u002Fragas\u002F",{"title":42,"url":24},"Ragas website","\u002Fimages\u002Fblog\u002Fragas\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fragas\u002Fog.jpg","ai-engineer",[47,48,49],"en","de","hu","Ragas-Review: der Standard fur RAG-Evaluation","Ragas bewertet RAG- und Agenten-Pipelines mit Faithfulness, Context Precision und Context Recall, erzeugt Testdaten und protokolliert Experimente. Apache-2.0, das Judge-Modell kostet extra.","Diagramm eines Ragas-Experiment-Loops: ein eingefrorenes Testset speist einen Lauf der Anwendung, Metriken rufen pro Zeile ein Judge-Modell auf, Scores kommen mit schriftlicher Begruendung, und das Ergebnis wird mit der Basislinie verglichen.","https:\u002F\u002Fdocs.ragas.io","Apache-2.0 · paid platform","Evaluation framework","Ragas-Review: Metriken, Experimente, Kosten · Balázs Csorba",[58,59,60,61,62],"Ragas ist eine Apache-2.0-Python-Bibliothek in Version 0.4.3, deren Metriken Faithfulness, Context Precision und Context Recall zur Standardsprache der RAG-Evaluation geworden sind.","Die meisten Metriken rufen ein Judge-Modell auf, ein Lauf kostet also Geld und erbt die Blindstellen des Judges; Modellversion vor dem Vergleich zweier Laufe festschreiben.","Die Bibliothek speichert keine Traces und zeichnet keine Dashboards, deshalb kombinieren Teams mit Produktions-Beobachtbarkeit Ragas mit einem Werkzeug wie Langfuse oder bauen den Speicher selbst.","Fur die gehostete Plattform gibt es keinen publizierten Preislist, deshalb ist das Judge-Modell und nicht die Lizenz die Zahl, die man budgetieren muss.","Referenzfreie Metriken messen, ob eine Antwort gestutzt ist, nicht ob sie korrekt ist; fur Korrektheit ein kleines gelabeltes Set aufbewahren.",[64,67,70,73],{"q":65,"a":66},"Ist Ragas kostenlos nutzbar?","Die Python-Bibliothek ist Apache-2.0 und frei, einschliesslich Metriken, synthetischer Testset-Generierung und Experiments-Workflow. Die gehostete Plattform und Enterprise-Support verkauft VibrantLabs direkt, ohne publizierte Preise.",{"q":68,"a":69},"Welche Ragas-Metriken brauchen ein Golden Set?","Context Recall und Factual Correctness vergleichen mit einer Referenzantwort, wahrend Faithfulness, Response Relevancy und der Aspect Critic allein mit Frage, Kontext und Antwort arbeiten. Die meisten Teams starten referenzfrei und labeln nur die Zeilen, die dauerhaft falsch sind.",{"q":71,"a":72},"Ersetzt Ragas ein Observability-Werkzeug?","Nein. Es bewertet einen bereitgestellten Datensatz und schreibt Ergebnisse als CSV; es sammelt keine Traces, zieht keinen Produktionsverkehr und zeichnet keine Dashboards. Einsetzen als Metrik-Schicht unter etwas, das Laufe speichert.",{"q":74,"a":75},"Was kostet ein Ragas-Lauf?","Was das Judge-Modell abrechnet. Faithfulness macht mehrere LLM-Aufrufe pro Zeile, weil es Behauptung fur Behauptung pruft, ein Set mit 500 Zeilen uber vier Metriken lauft also auf tausende Aufrufe; Caching und ein kleineres Judge-Modell sind die Regler.",[77,80,83,86,89,92,95,98],{"id":78,"title":79},"what-it-is","Was es ist",{"id":81,"title":82},"how-it-works","Wie es funktioniert",{"id":84,"title":85},"getting-started","Erste Schritte",{"id":87,"title":88},"performance","Performance und Kosten",{"id":90,"title":91},"pricing","Preise",{"id":93,"title":94},"where-it-shingles","Wo es scheuert",{"id":96,"title":97},"verdict","Fazit",{"id":99,"title":100},"sources","Quellen",[102,111,114,117,125,147,148,151,160,163,164,167,169,192,199,200,203,250,253,261,264,265,268,278,279,286,331,334,344,345,348,361,365,366],{"type":103,"content":104},"paragraph",[105,106,110],"Ragas ist eine Apache-2.0-Python-Bibliothek zur Bewertung von LLM-Anwendungen und inzwischen die Sprache, in der man sich uber RAG-Evaluation streitet: Faithfulness, Context Precision und Context Recall stammen alle aus ihrem Metrik-Set. ",{"tag":107,"children":108},"strong",[109],"Als erstes Bewertungswerkzeug fur eine Retrieval-Pipeline ist sie sehr nutzlich, als Produktions-Monitoring ist sie praktisch wertlos",", denn sie berechnet Zahlen uber einen Datensatz, den man ihr reingibt, und uberlasst Speicherung, Dashboards, Sampling und Alerting jemand anderem.",{"type":103,"content":112},[113],"Sie liegt zwischen dem Retrieval-Stack und dem Build: nachdem LlamaIndex, LangChain oder ein selbst geschriebener Retriever Antworten erzeugt, bewertet Ragas sie, und die Zahlen landen neben dem Commit. Konkurrenz sind DeepEval, TruLens und Phoenix sowie die Eval-Features in Langfuse, LangSmith und Braintrust; der Unterschied: Ragas bleibt eine Bibliothek, ohne Dienst zum Betreiben und ohne Anbieter, der die Testdaten hait.",{"type":115,"level":116,"id":78,"text":79},"heading",2,{"type":103,"content":118},[119,120,124],"Das Paket installiert sich mit ",{"tag":121,"children":122},"code",[123],"pip install ragas"," von PyPI und lauft im Prozess; Version 0.4.3 erschien am 13. Januar 2026 und verlangt Python 3.9 oder neuer. Metriken gibt es in zwei Formen: LLM-basiert, wobei ein Judge-Modell eine Zeile liest und einen Wert mit schriftlicher Begrundung zuruckliefert, und klassisch, wo Zeichenketten direkt verglichen werden, etwa BLEU, ROUGE, Exact Match und Semantic Similarity. Darum herum gibt es einen Experiments-Workflow, Datensatz, Lauf, Aufzeichnung, Vergleich, der aus einer Sammlung von Metrikfunktionen eine wiederholbare Evaluation macht.",{"type":126,"ordered":127,"items":128},"list",false,[129,131,133,135,137,139,145],[130],"Lizenz und Tragerschaft: Apache-2.0, betreut von VibrantLabs; das Repository zeigt etwa 16.000 Stars und 1.700 Forks.",[132],"RAG-Metriken: Context Precision, Context Recall, Context Entities Recall, Noise Sensitivity, Response Relevancy und Faithfulness, dazu multimodale Varianten von Faithfulness und Relevance.",[134],"Agenten-Metriken: Tool Call Accuracy, Tool Call F1, Agent Goal Accuracy und Topic Adherence.",[136],"Belegung und Vergleich: Factual Correctness, Semantic Similarity, BLEU, CHRF, ROUGE, String Presence und Exact Match.",[138],"SQL und Zusammenfassung: ausfuehrungsbasierter DataCompy-Score, SQL-Query-Äquivalenz und ein Summarisation Score.",[140,141,144],"Testdaten und Geruest: synthetische Testset-Generierung aus eigenen Dokumenten sowie eine ",{"tag":121,"children":142},[143],"ragas quickstart rag_eval","-Vorlage, die ein lauffahiges Projekt schreibt.",[146],"Ausgabe: Experiment-Ergebnisse als CSV-Dateien im Repository, diffbar wie jedes andere Build-Artefakt.",{"type":115,"level":116,"id":81,"text":82},{"type":103,"content":149},[150],"Ein Lauf arbeitet die Zeilen nacheinander ab. Jede Zeile enthalt die Nutzereingabe, die Antwort der Anwendung und den Kontext, den der Retriever geliefert hat. Eine Metrik nimmt diese Zeile, macht einen oder mehrere LLM-Aufrufe mit einem Prompt, das das Kriterium genau benennt, und liefert einen Wert samt Begrundung des Judges; klassische Metriken uberspringen den Aufruf und vergleichen Zeichenketten. Zeilen werden unabhangig bewertet, das heisst, der Satz parallelisiert sauber, und eine einzelne Zeile laisst sich wiederholen, wenn der Mittelwert falsch aussieht.",{"type":152,"attrs":153,"inner":157,"caption":158},"diagram",{"viewBox":154,"role":155,"aria-labelledby":156},"0 0 760 215","img","d-ragas-t d-ragas-d","\u003Ctitle id=\"d-ragas-t\">Wie ein Ragas-Experiment abläuft\u003C\u002Ftitle>\u003Cdesc id=\"d-ragas-d\">Ein Fünf-Schritte-Loop. Ein eingefrorenes Testset speist einen Lauf der Anwendung, Metriken rufen pro Zeile ein Judge-Modell auf, die Scores kommen mit schriftlicher Begründung, und das Experiment wird mit der Basislinie verglichen, bevor der nächste Build dieselben Zeilen erneut abarbeitet.\u003C\u002Fdesc>\u003Cdefs>\u003Cmarker id=\"ah-r\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head\" \u002F>\u003C\u002Fmarker>\u003Cmarker id=\"ah-ra\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head-accent\" \u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Ctext x=\"10\" y=\"26\" class=\"d-title\">Zeile fur Zeile\u003C\u002Ftext>\u003Crect x=\"10\" y=\"56\" width=\"125\" height=\"66\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"72\" y=\"86\" text-anchor=\"middle\" class=\"d-text\">Testset\u003C\u002Ftext>\u003Ctext x=\"72\" y=\"108\" text-anchor=\"middle\" class=\"d-small\">Fragen, Labels\u003C\u002Ftext>\u003Crect x=\"165\" y=\"56\" width=\"125\" height=\"66\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"227\" y=\"86\" text-anchor=\"middle\" class=\"d-text\">App laufen\u003C\u002Ftext>\u003Ctext x=\"227\" y=\"108\" text-anchor=\"middle\" class=\"d-small\">RAG-Pipeline\u003C\u002Ftext>\u003Crect x=\"320\" y=\"56\" width=\"125\" height=\"66\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"382\" y=\"86\" text-anchor=\"middle\" class=\"d-text\">Metriken\u003C\u002Ftext>\u003Ctext x=\"382\" y=\"108\" text-anchor=\"middle\" class=\"d-small\">Judge-Aufrufe\u003C\u002Ftext>\u003Crect x=\"475\" y=\"56\" width=\"125\" height=\"66\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"537\" y=\"86\" text-anchor=\"middle\" class=\"d-text\">Scores\u003C\u002Ftext>\u003Ctext x=\"537\" y=\"108\" text-anchor=\"middle\" class=\"d-small\">Wert + Grund\u003C\u002Ftext>\u003Crect x=\"630\" y=\"56\" width=\"125\" height=\"66\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"692\" y=\"86\" text-anchor=\"middle\" class=\"d-text\">Vergleich\u003C\u002Ftext>\u003Ctext x=\"692\" y=\"108\" text-anchor=\"middle\" class=\"d-small\">vs. Basislinie\u003C\u002Ftext>\u003Cpath d=\"M137 89 H161\" class=\"d-line\" marker-end=\"url(#ah-r)\" \u002F>\u003Cpath d=\"M292 89 H316\" class=\"d-line\" marker-end=\"url(#ah-r)\" \u002F>\u003Cpath d=\"M447 89 H471\" class=\"d-line\" marker-end=\"url(#ah-r)\" \u002F>\u003Cpath d=\"M602 89 H626\" class=\"d-line\" marker-end=\"url(#ah-r)\" \u002F>\u003Cpath d=\"M692 124 V170 H72 V126\" class=\"d-line-accent\" marker-end=\"url(#ah-ra)\" \u002F>\u003Ctext x=\"382\" y=\"196\" text-anchor=\"middle\" class=\"d-small\">naechstes Experiment: gleiche Zeilen, neuer Build\u003C\u002Ftext>",[159],"Der Loop sagt nur dann etwas aus, wenn Zeilen und Judge gleich bleiben: Wer beides ändert, vergleicht zwei Experimente, die nicht zusammengehören.",{"type":103,"content":161},[162],"Dass sich diese Art der Evaluation durchgesetzt hat, liegt an der Lesbarkeit der Ausgabe. Ein niedriger Faithfulness-Score kommt mit dem Satz, den der Judge uber den nicht gestutzten Behauptung geschrieben hat, also mit einem Diff, auf den ein Mensch reagieren kann, statt mit einer Zahl zum Streiten.",{"type":115,"level":116,"id":84,"text":85},{"type":103,"content":165},[166],"Der kleinste sinnvolle Test ist eine Metrik auf einer Zeile, und so stellt die README die Bibliothek auch vor.",{"type":121,"code":168},"import asyncio\nfrom ragas.metrics.collections import AspectCritic\nfrom ragas.llms import llm_factory\n\n# The judge: llm_factory() takes OpenAI by default, Anthropic and others as options\nllm = llm_factory(\"gpt-4o\")\n\nmetric = AspectCritic(\n    name=\"summary_accuracy\",\n    definition=\"Verify if the summary is accurate and captures key information.\",\n    llm=llm,\n)\n\nrow = {\n    \"user_input\": \"summarise given text: the company reported an 8% rise in Q3 2024.\",\n    \"response\": \"The company saw an 8% increase in Q3 2024.\",\n}\n\nasync def main():\n    score = await metric.ascore(user_input=row[\"user_input\"], response=row[\"response\"])\n    print(score.value, score.reason)\n\nasyncio.run(main())",{"type":103,"content":170},[171,172,175,176,179,180,183,184,187,188,191],"Fur ein ganzes Projekt ist das Geruest schneller: ",{"tag":121,"children":173},[174],"uvx ragas quickstart rag_eval"," schreibt ein Paket mit ",{"tag":121,"children":177},[178],"rag.py",", ",{"tag":121,"children":181},[182],"evals.py",", einem Datasets- und einem Experiments-Ordner, ",{"tag":121,"children":185},[186],"uv sync"," installiert es, und ",{"tag":121,"children":189},[190],"uv run python evals.py"," laadt den Datensatz, fragt die Anwendung ab, bewertet jede Zeile und hangt das Ergebnis ans CSV an. Die Dokumentation setzt die Vorlage standardmassig auf OpenAI und zeigt dieselben drei Zeilen umgestellt auf Anthropic, Google Gemini, Ollama oder eine beliebige OpenAI-kompatible Endpunkt-Adresse.",{"type":193,"variant":194,"title":195,"body":196},"callout","tip","Judge festschreiben, bevor man vergleicht",[197],[198],"Zwei Laufe sind nur vergleichbar, wenn Metrik-Implementierung, Judge-Modell und Zeilen identisch sind. Modellversion festschreiben, Datensatz im Repository halten, und ein Metrik-Upgrade als Neubaseline behandeln statt als Regression.",{"type":115,"level":116,"id":87,"text":88},{"type":103,"content":201},[202],"Ragas bringt dem Produkt keine Latenz; es bringt dem Build Kosten und Wandzeit. Die Rechnung ist Zeilen mal Metriken mal Judge-Aufrufe pro Zeile, und die teuren Metriken sind die, die eine Antwort in Behauptungen zerlegen und jede einzeln prufen.",{"type":204,"head":205,"rows":214},"table",[206,208,210,212],[207],"Metrik",[209],"Judge-Arbeit pro Zeile",[211],"Braucht Referenzantwort",[213],"Was ein niedriger Wert bedeutet",[215,224,233,242],[216,218,220,222],[217],"Faithfulness",[219],"Zerlegt die Antwort in Behauptungen und pruft jede gegen den Kontext",[221],"Nein",[223],"Die Antwort sagt mehr, als der abgerufene Text stutzt",[225,227,229,231],[226],"Context Precision",[228],"Rangiert die abgerufenen Chunks gegen die Frage",[230],"Optional",[232],"Irrelevante Chunks werden in den Prompt gedruckt",[234,236,238,240],[235],"Context recall",[237],"Vergleicht abgerufenen Kontext mit der Referenzantwort",[239],"Ja",[241],"Der Retriever hat einen Teil dessen nie gesehen, was die Antwort braucht",[243,245,247,248],[244],"Tool Call Accuracy",[246],"Vergleicht Tool-Call und Argumente des Agenten mit dem erwarteten",[239],[249],"Der Agent waehlt das falsche Werkzeug oder liefert kaputte Argumente",{"type":103,"content":251},[252],"Ein Datensatz mit 500 Zeilen und vier LLM-Metriken bedeutet pro Lauf tausende Judge-Aufrufe. Teams drosseln das mit Caching, wo die Bibliothek es zulasst, mit einem kleinen Judge-Modell fur die billigen Metriken und mit einem vollen Lauf nur kurz vor dem Merge.",{"type":126,"ordered":127,"items":254},[255,257,259],[256],"Die billigen Metriken bei jedem Push bewerten; Faithfulness und die Agenten-Metriken beim Merge oder auf Zeitplan laufen lassen.",[258],"Den Datensatz klein und adversarial halten statt gross und zufallig: 200 Zeilen, die schon einmal versagt haben, schlagen 5.000 Zeilen, die nie versagen.",[260],"Synthetische Zeilen fur Abdeckung erzeugen und danach einfrieren; das Testset in jedem Zyklus neu zu erzeugen, laisst jedes Ergebnis wie Rauschen aussehen.",{"type":103,"content":262},[263],"Nichts davon ist Ragas-spezifisch: jede LLM-as-a-Judge-Konstruktion rechnet pro Aufruf ab und erbt die Blindstellen des Judges. Ragas entscheidet, wie viel dieser Mechanik man gratis bekommt und wie viel man drumherum selbst bauen muss.",{"type":115,"level":116,"id":90,"text":91},{"type":103,"content":266},[267],"Die Bibliothek ist frei und Apache-2.0, ohne Seat-Zahl und ohne Nutzungslimite. Die kommerzielle Seite, die gehostete Plattform und direkter Support, wird von den Betreuern per Kontakt und Office Hours verkauft, und dafur gibt es keinen publizierten Preislist. Die Kosten, die also zaehlen, sind das Judge-Modell: jede LLM-Metrik wird von dem Provider abgerechnet, auf den man sie zeigt, und die synthetische Testset-Generierung lauft auf demselben Zaehler.",{"type":126,"ordered":127,"items":269},[270,272,274,276],[271],"Bibliothek: frei, Apache-2.0, Installation von PyPI, kein Konto noetig.",[273],"Judge-Modell: pro Aufruf beim Provider berechnet, typischerweise die groesste Posten eines Eval-Budgets.",[275],"Synthetische Testdaten: ebenfalls LLM-Arbeit, genau wie das Scoring abgerechnet.",[277],"Gehostete Plattform und Support: direkt verkauft, kein oeffentlicher Preis; vor der Zusage klaeren, was enthalten ist.",{"type":115,"level":116,"id":93,"text":94},{"type":103,"content":280},[281,282,285],"Ragas bewertet Zeilen, keine Systeme. Es zieht keinen Produktionsverkehr, speichert keine Traces und sagt nicht, wenn sich p95-Latenz verschoben hat, und es kann nicht sagen, ob die Testfragen reprasentativ sind, genau der Fehler, der eine grune Pipeline nutzlos macht. Das Release-Tempo ist hoch, 0.3.0 im Juli 2025, 0.4.0 im Dezember 2025, 0.4.3 im Januar 2026, Versionen mussen also gepinnt werden. Zum Zeitpunkt der Recherche hatte das Repository 381 offene Issues, der uebliche Preis dafur, der Standard zu sein, und die Dokumentation von ",{"tag":121,"children":283},[284],"stable"," hinterhergehinkt.",{"type":204,"head":287,"rows":295},[288,290,291,293],[289],"Werkzeug",[79],[292],"Wo es gewinnt",[294],"Was man aufgibt",[296,304,313,322],[297,298,300,302],[13],[299],"Metrik-Bibliothek mit synthetischen Testdaten",[301],"Die Metrik-Sprache und ein lauffahiges Projekt mit einem Befehl",[303],"Kein Trace-Speicher, kein Dashboard, kein Produktions-Sampling",[305,307,309,311],[306],"DeepEval",[308],"Metriken im Pytest-Stil mit gehosteter Plattform dahinter",[310],"Unit-Test-Ergonomie und eine lange Metrikliste",[312],"Der Plattform-Teil ist ein eigenes kommerzielles Produkt",[314,316,318,320],[315],"Langfuse",[317],"Open-Source-Tracing mit Datasets und Evaluationen",[319],"Traces, Prompts und Scores an einem Ort",[321],"Metrik-Mathematik nach Ragas-Art ist nur ein Feature von vielen",[323,325,327,329],[324],"Arize Phoenix",[326],"Open-Source-Tracing und Evaluation fur LLM-Anwendungen",[328],"Span-Level-Debugging direkt neben den Scores",[330],"Ein schmales, referenzfreies RAG-Metrik-Set",{"type":103,"content":332},[333],"Die eigentliche Entscheidung ist, wo die Zahlen wohnen. Ragas ist die richtige Motorik, wenn etwas anderes die Laufe speichert, ein CSV im Repository, eine Tabelle im Warehouse, ein Observability-Werkzeug, das importierte Scores annimmt. Das falsche Produkt fur ein Team, das eine URL oeffnen will und sehen will, ob die Qualitat zurueckgegangen ist.",{"type":193,"variant":335,"title":336,"body":337},"warn","Jede Zeile verlasst Ihr Netzwerk",[338],[339,340,343],"Eine LLM-Metrik schickt Frage, abgerufene Chunks und Antwort an die Endpunkt-Adresse des Judges. Wenn der Korpus vertraulich ist, heisst das: ein Judge innerhalb der eigenen Perimeter, die Dokumentation nennt Ollama und jede OpenAI-kompatible Endpoint-Adresse, oder eine bewusste Uebermittlung an Dritte. Die Bibliothek meldet ausserdem standardmassig anonyme Nutzungsdaten; ",{"tag":121,"children":341},[342],"RAGAS_DO_NOT_TRACK=true"," schaltet das ab, der Sammelcode liegt im Repository.",{"type":115,"level":116,"id":96,"text":97},{"type":103,"content":346},[347],"Ragas verdient seinen Status als Standard fur Retrieval-Arbeit: die Metriken sind sauber definiert, die Ausgabe liefert Begruendungen, und ein Projekt ist einen Befehl entfernt. Man sollte es als Scoring-Motor in einen Workflow nehmen, den man ohnehin besitzt, nicht als Evaluations-Plattform.",{"type":126,"ordered":349,"items":350},true,[351,353,355,357,359],[352],"Nutzen, wenn eine Retrieval-Pipeline existiert und noch kein Golden Set: synthetische Testset-Generierung plus referenzfreie Metriken liefert am ersten Tag einen ersten Messwert.",[354],"Nutzen, wenn Evaluation im CI laufen muss, wo ein CSV-Diff pro Pull Request genau die richtige Menge an Signal ist.",[356],"Nicht waehlen als einziges Evaluationswerkzeug fur ein Agenten-Produkt: Agenten-Metriken gibt es, aber Trajektorien, Werkzeug-Nebenwirkungen und Kosten pro Aufgabe brauchen einen Harness, der Laufe speichert.",[358],"Nicht waehlen, wenn eine Antwort gegenueber Regulator oder Kunde aus gespeicherten Belegen begruendet werden muss; gespeichert wird nichts, was man nicht selbst speichert.",[360],"Das Judge-Modell vor der Lizenz budgetieren: ein gepinntes kleines Modell fur die billigen Metriken und ein faehiges fur Faithfulness ist die uebliche Aufteilung.",{"type":362,"content":363},"quote",[364],"Ragas ist der billigste Weg, aufzuhoren, daruber zu streiten, ob eine Änderung geholfen hat: Judge festschreiben, Zeilen einfrieren, den Diff lesen. Alles, was es nicht tut, ist Arbeit, die man trotzdem bezahlen muss.",{"type":115,"level":116,"id":99,"text":100},{"type":126,"ordered":349,"items":367},[368,373,377,381,385,389],[369],{"tag":370,"href":28,"children":371},"a",[372],"Ragas-Dokumentation: Einfuhrung",[374],{"tag":370,"href":31,"children":375},[376],"Ragas-Dokumentation: Quick Start",[378],{"tag":370,"href":34,"children":379},[380],"Ragas-Dokumentation: verfugbare Metriken",[382],{"tag":370,"href":37,"children":383},[384],"Ragas auf GitHub",[386],{"tag":370,"href":40,"children":387},[388],"Ragas auf PyPI",[390],{"tag":370,"href":24,"children":391},[392],"Ragas-Webseite",[394,443,526,586],{"slug":395,"published":396,"minutes":397,"category":7,"tags":398,"keywords":404,"about":411,"sources":415,"cover":434,"og":435,"expertise":45,"locales":436,"lang":48,"title":437,"description":438,"coverAlt":439,"url":440,"pricing":441,"kind":442},"ollama","2026-09-29",11,[399,400,401,402,403],"Local inference","Open models","llama.cpp","GGUF","Model serving",[395,405,406,407,408,409,410],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[412],{"name":413,"url":414},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[416,419,422,425,428,431],{"title":417,"url":418},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":420,"url":421},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":423,"url":424},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":426,"url":427},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":429,"url":430},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":432,"url":433},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg",[47,48,49],"Ollama im Test: der freundliche Weg zu offenen Modellen","Ollama liefert offene Modelle über eine HTTP-API auf eigener Hardware aus. Was es gut macht, wo der Durchsatz zu kurz kommt, was die MIT-Lizenz nicht abdeckt.","Abstrakte Titelgrafik für den Ollama-Test","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime",{"slug":444,"published":445,"minutes":397,"category":7,"tags":446,"keywords":452,"about":460,"sources":467,"cover":519,"og":520,"expertise":45,"locales":521,"lang":48,"title":522,"description":523,"coverAlt":524,"url":463,"pricing":525,"kind":447},"portkey","2026-09-28",[447,448,449,450,451],"LLM gateway","Guardrails","Routing","Observability","Cost control",[453,454,455,456,457,458,459],"portkey ai gateway","portkey vs litellm","llm gateway comparison","llm gateway latency overhead","llm guardrails gateway","self-hosted llm gateway","portkey pricing",[461,464],{"name":462,"url":463},"Portkey","https:\u002F\u002Fportkey.ai",{"name":465,"url":466},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[468,471,474,477,480,483,486,489,492,495,498,501,504,507,510,513,516],{"title":469,"url":470},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":472,"url":473},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":475,"url":476},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":478,"url":479},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":481,"url":482},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":484,"url":485},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":487,"url":488},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":490,"url":491},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":493,"url":494},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":496,"url":497},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":499,"url":500},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":502,"url":503},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":505,"url":506},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":508,"url":509},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":511,"url":512},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":514,"url":515},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing",{"title":517,"url":518},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[47,48,49],"Portkey: ein LLM-Gateway für die Produktion, geprüft auf Routing, Guardrails und Kosten","Portkey bündelt Retries, Fallbacks, Cache, Guardrails und Kostenkontrolle hinter einer OpenAI-kompatiblen Schnittstelle. Was die Konfiguration gut löst und was das Gateway an Latenz kostet.","Ein Requestweg von der Anwendung durch das Portkey-Gateway zu drei Modellanbietern, darunter das Guardrail-Ergebnis und das Protokoll.","Free · from $49 per month",{"slug":527,"published":528,"minutes":6,"category":7,"tags":529,"keywords":535,"about":543,"sources":554,"cover":579,"og":580,"expertise":45,"locales":581,"lang":48,"title":582,"description":583,"coverAlt":584,"url":545,"pricing":585,"kind":530},"langfuse","2026-08-13",[530,531,532,533,534],"LLM observability","Tracing","OpenTelemetry","Self-hosting","Evaluation",[527,536,537,538,539,540,541,542],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[544,546,548,551],{"name":315,"url":545},"https:\u002F\u002Flangfuse.com",{"name":532,"url":547},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":549,"url":550},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":552,"url":553},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[555,558,561,564,567,570,573,576],{"title":556,"url":557},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":559,"url":560},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":562,"url":563},"Langfuse pricing: cloud plans, billable units and worked examples","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":565,"url":566},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":568,"url":569},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":571,"url":572},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":574,"url":575},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":577,"url":578},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[47,48,49],"Langfuse-Test: Tracing, Prompts und Evals selbst gehostet","Langfuse legt LLM-Traces, Prompt-Versionen und Experimente auf eine MIT-lizenzierte Plattform. Was das Selbsthosten wirklich kostet, wie die Einheitspreise rechnen und wo es verliert.","Eine Pipeline vom gebündelten Application-Event über den Langfuse-Web-Container und den Object Storage in ClickHouse, mit Redis und PostgreSQL daneben.","MIT · paid from $59 per month",{"slug":587,"published":588,"minutes":6,"category":7,"tags":589,"keywords":594,"about":601,"sources":605,"cover":621,"og":622,"expertise":45,"locales":623,"lang":48,"title":624,"description":625,"coverAlt":626,"url":627,"pricing":628,"kind":447},"openrouter","2026-07-23",[447,590,591,592,593],"Model routing","Fallbacks","OpenAI-compatible","Pay per token",[587,595,455,596,597,598,599,600],"openrouter vs litellm","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[602],{"name":603,"url":604},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[606,609,610,613,616,619],{"title":607,"url":608},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":517,"url":518},{"title":611,"url":612},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":614,"url":615},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":617,"url":618},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":620,"url":604},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg",[47,48,49],"OpenRouter: ein API-Schlüssel vor jedem Modell im Katalog","OpenRouter packt 500+ Modelle von 80+ Anbietern hinter einen OpenAI-kompatiblen Endpunkt, mit Fallbacks und Weiterverrechnung zum Listenpreis. Kosten und Schwächen.","Anfragepfad durch OpenRouter: Client, Router, mögliche Anbieter, Fallback-Liste und das Modell, das tatsächlich antwortet.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription",1791383550880]