Eszközök/LLMOps és értékelés

Ragas-ismertető: az alapértelmezett RAG-evalualációs keretrendszer

A Ragas faithfulness, context precision és context recall metrikákkal értékeli a RAG- és ügynök-pipeline-okat, tesztadatot generál és kísérleteket rögzít. Apache-2.0, az ítélőmodell külön számlázva.

Típus
Evaluation framework
Ár
Apache-2.0 · paid platform

··10 perc olvasás

  • RAG evaluation
  • LLM-as-judge
  • Test sets
  • CI quality
  • Ragas
A Ragas-kísérlet ciklusának diagramja: a befagyasztott tesztkészlet hajtja az alkalmazás futását, a metrikák soronként ítélőmodellt hívnak, az értékek írásos indoklással érkeznek, az eredményt pedig a kiindulóértékhez hasonlítják.

A lényeg röviden

  • A Ragas egy Apache-2.0 licencű Python-könyvtár 0.4.3-as verzióban, amelynek faithfulness, context precision és context recall metrikái a RAG-evalualáció szabványos nyelvévé váltak.
  • A legtöbb metrika ítélőmodellt hív, a futás tehát pénzbe kerül és örökli a modell vakságait; a két futás összevetése előtt rögzítse a modellverziót.
  • A könyvtár nem tárol trace-eket és nem rajzol dashboardot, ezért a termelési megfigyelhetőséget igénylő csapatok a Ragashoz egy Langfuse-hoz hasonló eszközt társítanak, vagy maguk építik a tárolót.
  • A hostolt platformra nincs nyilvános árlista, ezért a költségkeret száma az ítélőmodell, nem a licenc.
  • A referenciamentes metrikák azt mérik, alátámasztott-e a válasz, nem azt, hogy helyes-e; a helyességhez tartsanak egy kis címkézett készletet.

A Ragas egy Apache-2.0 licencű Python-könyvtár az LLM-alkalmazások értékelésére, és észrevétlenül a RAG-evalualáció nyelvévé vált: a faithfulness, a context precision és a context recall mind az ő metrikakészletéből származik. Egy retriever-pipeline első értékelőeszközeként nagyon értékes, termelési monitoringszerként viszont gyakorlatilag nulla, mert számokat számol egy neki átadott adathalmazon, a tárolást, a dashboardokat, a mintavételt és a riasztást pedig másra bízza.

A retriever-készlet és a build közé ül be: miután a LlamaIndex, a LangChain vagy egy saját retriever válaszokat ad, a Ragas kiértékeli őket, a számok pedig a commit mellé kerülnek. Vetélytársai a DeepEval, a TruLens és a Phoenix, valamint a Langfuse, a LangSmith és a Braintrust beépített értékelő funkciói; a különbség, hogy a Ragas könyvtár marad: nincs üzemeltetendő szolgáltatás és nincs szolgáltató, aki a tesztadatokat őrzi.

Mi ez

A csomag pip install ragas segítséggel a PyPI-ról települ és a folyamaton belül fut; a 0.4.3-as verzió 2026. január 13-án jelent meg, és Python 3.9-est vagy újabbat igényel. A metrikák kétfélék: LLM-alapúak, amikor egy ítélőmodell elolvassa a sort, és értéket ad vissza írásos indoklással, valamint hagyományosak, amikor a szövegeket közvetlenül hasonlítják össze, ilyen a BLEU, a ROUGE, az exact match és a semantic similarity. Eré épül az experiments-munkafolyamat, adathalmaz, futás, rögzítés, összevetés, ami egy metrikafunkció-halmazt megismételhető értékeléssé alakít.

  • Licenc és tulajdonos: Apache-2.0, a VibrantLabs karbantartja; a repó körülbelül 16 000 csillagot és 1 700 forkot mutat.
  • RAG-metrikák: context precision, context recall, context entities recall, noise sensitivity, response relevancy és faithfulness, továbbá a faithfulness és a relevance többdimenziós változatai.
  • Ügynök-metrikák: tool call accuracy, tool call F1, agent goal accuracy és topic adherence.
  • Alátámasztás és összehasonlítás: factual correctness, semantic similarity, BLEU, CHRF, ROUGE, string presence és exact match.
  • SQL és összefoglalás: végrehajtás alapú DataCompy-pontszám, SQL-lekérdezés-ekvivalencia és összefoglaló pontszám.
  • Tesztadatok és váz: szintetikus tesztkészlet-generálás a saját dokumentumokból, valamint egy ragas quickstart rag_eval sablon, amely futtatható projektet ír.
  • Kimenet: a kísérletek eredménye CSV-fájlokban a repóban, bármely más build-termékhez hasonlóan diffelhető.

Hogyan működik

Egy futás soronként járja végig a sorokat. Minden sor tartalmazza a felhasználó bemenetét, az alkalmazás válaszát és azt a kontextust, amit a retriever szállított. Egy metrika felveszi a sort, egy vagy több LLM-hívást indít egy, a szempontot pontosan megnevező prompttal, majd értéket ad vissza az ítélő indoklásával; a hagyományos metrikák kihagyják a hívást és szövegeket hasonlítanak össze. A sorok függetlenül értékelődnek, így az adathalmaz párhuzamosítható, és egyetlen sor újrafuttatható, ha a átlag rosszul néz ki.

Ahogy egy Ragas-kísérlet lefutÖt lépésből álló ciklus. A befagyasztott tesztkészlet hajtja a alkalmazás futását, a metrikák soronként ítélőmodellt hívnak, az értékek írásos indoklással érkeznek, majd a kísérletet a kiindulóértékhez hasonlítják, mielőtt a következő build ugyanazokat a sorokat újrafuttatná.soronkenttesztkeszletkerdesek, cimkekfutasRAG pipelinemetrikakitelohivasokpontszamokertek + indokosszevetesalapertekhezkovetkezo kiserlet: ugyanazok a sorok, uj build
A ciklusnak csak akkor van értelme, ha a sorok és az ítélőmodell változatlanok: ha bármelyiket cseréli, két kísérlet már nem hasonlítható össze.

Azért terjedt el ez az értékelési mert a kimenet olvasható. Egy alacsony faithfulness-pontszám azzal a mondattal érkezik, amit az ítélő az alátámasztatlan állításról írt, vagyis olyan diffel, amire egy ember reagálni tud, nem vitára való számmal.

Első lépések

A legkisebb értelmes teszt egy metrika egyetlen soron, ahogy a README is bemutatja a könyvtárat.

import asyncio
from ragas.metrics.collections import AspectCritic
from ragas.llms import llm_factory

# The judge: llm_factory() takes OpenAI by default, Anthropic and others as options
llm = llm_factory("gpt-4o")

metric = AspectCritic(
    name="summary_accuracy",
    definition="Verify if the summary is accurate and captures key information.",
    llm=llm,
)

row = {
    "user_input": "summarise given text: the company reported an 8% rise in Q3 2024.",
    "response": "The company saw an 8% increase in Q3 2024.",
}

async def main():
    score = await metric.ascore(user_input=row["user_input"], response=row["response"])
    print(score.value, score.reason)

asyncio.run(main())

Egész projekthez a váz gyorsabb: az uvx ragas quickstart rag_eval egy csomagot ír rag.py, evals.py, datasets és experiments mappával, az uv sync telepíti, a uv run python evals.py betölti az adathalmazt, lekérdezi az alkalmazást, kiértékeli az összes sort, és az eredményt a CSV-hez fűzi. A dokumentáció a sablont alapértelmezésben OpenAI-ra állítja, és ugyanezt a három sort mutatja Anthropicra, Google Geminire, Ollamára vagy bármely OpenAI-kompatibilis végpontra állítva.

Teljesítmény és költség

A Ragas nem ad késést a terméknek; költséget és valós időt ad a buildnek. A számla: sorok szorozva metrikákkal szorozva ítélőhívásokkal soronként, a drága metrikák pedig azok, amelyek a választ állításokra bontva külön-külön ellenőriznek.

MetrikaAz ítélő munkája soronkéntReferenciaválasz kellMit jelent az alacsony érték
FaithfulnessAz választ állításokra bontja, és mindegyiket a kontextushoz igazítjaNemA válasz többet állít, mint amit a visszakeresett szöveg alátámaszt
Context precisionA visszakeresett chunkokat rangsorolja a kérdéshez képestOpcionálisReleváns chunkok kerülnek a promptba
Context recallA visszakeresett kontextust a referenciaválssal hasonlítja összeIgenA retriever sosem látta a válasz egy részét
Tool call accuracyAz ügynök eszközhívását és argumentumait a várttal hasonlítja összeIgenAz ügynök rossz eszközt választ vagy hibás argumentumot ad meg

Egy 500 soros adathalmaz négy LLM-metrikával futásonként több ezer ítélőhívást jelent. A csapatok úgy tartják elérhetőnek, hogy ahol a könyvtár engedi, gyorsítótáraznak, a olcsó metrikákhoz kis ítélőmodellt használnak, és a teljes készletet csak egy merge előtt futtatják.

  • Az olcsó metrikákat minden pushnál értékelje, a faithfulness-t és az ügynök-metrikákat merge-kor vagy időzítve futtassa.
  • Tartsa az adathalmazt kicsinek és agresszív véletlenszerű helyett: 200, már korábban hibát adott sor többet ér, mint 5 000, amely sosem hibázik.
  • Szintetikus sorokat generáljon lefedettségre, majd fagyasztja be őket; ha minden ciklusban újragenerálja a tesztkészletet, minden pontszám zajnak tűnik.

Ebből semmi sem Ragas-specifikus: minden LLM-as-a-judge megoldás hívásonként számláz és örökli az ítélő vakságait. A Ragas arról dönt, hogy ennek a gépezetnek mekkora részét kapja ingyen, és mekkorát kell köré építeni.

Árazás

A könyvtár ingyenes és Apache-2.0, ülés- és felhasználási korlát nélkül. az üzleti oldal, a hostolt platform és a közvetlen támogatás, a karbantartókon keresztül, kontakton és office hours-on át kapható, nyilvános árlista nélkül. Emiatt a tényleges költség az ítélőmodell: minden LLM-metrikát az a szolgáltató számláz, amelyre irányítják, a szintetikus tesztkészlet-generálás pedig ugyanezen a mérőn fut.

  • Könyvtár: ingyenes, Apache-2.0, PyPI-ról települ, nem kell hozzá fiók.
  • Ítélőmodell: hívásonként a szolgáltatónál számlázva, általában a eval-költségvetés legnagyobb tétele.
  • Szintetikus tesztadat: szintén LLM-munka, pontosan úgy számlázva, mint az értékelés.
  • Hostolt platform és támogatás: közvetlenül, nyilvános ár nélkül; a vállalás előtt kérdezze meg, mi jár bele.

Hol akad el

A Ragas sorokat értékel, nem rendszereket. Nem vesz mintát a termelési forgalomból, nem tárol trace-eket, nem szól, ha a p95-ös késés elmozdult, és nem tudja megmondani, reprezentatívak-e a tesztkérdések, pedig ez a hiba teszi haszontalanná a zöld pipeline-t. A kiadási tempó gyors, 0.3.0 2025 júliusában, 0.4.0 2025 decemberében, 0.4.3 2026 januárjában, így a verziókat rögzíteni kell. A kutatás időpontjában a repó 381 nyitott issue-t mutatott, ami a az alapértelmezett eszköz szokásos ára, a stable dokumentáció pedig lemarad a kiadott API mögött.

EszközMi azHol győzMiről mond le
RagasMetrikakönyvtár szintetikus tesztadatokkalA metrikanyelv és egyetlen paranccsal futtatható projektNincs trace-tároló, nincs dashboard, nincs termelési mintavétel
DeepEvalPytest-stílusú metrikák hostolt platformmal mögötteUnit-test ergonomika és hosszú metrikalistaA platform rész külön kereskedelmi termék
LangfuseNyílt forráskódú tracing adathalmazokkal és értékelésekkelTrace-ek, promptok és pontszámok egy helyenA Ragas-stílusú metrikamatematika csak egy funkció a sok közül
Arize PhoenixNyílt forráskódú tracing és értékelés LLM-alkalmazásokhozSpan-szintű hibakeresés a pontszámok mellettSzűkebb, referenciamentes RAG-metrikakészlet

A valódi döntés az, hol laknak a számok. A Ragas a megfelelő motor, ha valami más tárolja a futásokat: egy CSV a repóban, egy táblázat az adatwarehouse-ban, egy olyan megfigyelőeszköz, amely befogadja az importált pontszámokat. Rossz vásárlás viszont annak a csapatnak, amely egy URL-t akar megnyitni, és látni, romlott-e a minőség.

Ítélet

A Ragas megérdemli az alapértelmezett szerepet a retriever-munkában: a metrikák jól definiáltak, a kimenet indoklást hoz, és egy projekt egy parancsnyira van. Scoring-motorként szabad elfogadni egy olyan munkafolyamatban, amelyet egyébként is birtokol, nem értékelési platformként.

  1. Használja, ha van retriever-pipelineja, de még nincs golden setje: a szintetikus tesztkészlet-generálás és a referenciamentes metrikák egy nap alatt adnak első mérőszámot.
  2. Használja, ha az értékelésnek CI-ben kell futnia, ahol egy CSV-diff pull requestenként éppen a megfelelő mennyiségű jelzés.
  3. Ne ezt válassza egyetlen értékelőeszközként ügynök-termékhez: az ügynök-metrikák megvannak, de a trajektóriák, az eszközök mellékhatásai és a feladatonkénti költség olyan harneszt kíván, amely tárolja a futásokat.
  4. Ne ezt válassza, ha a választ eltárolt bizonyítékokból kell alátámasztani szabályozó vagy ügyfél előtt; nem marad meg semmi, amit nem ön tárol el.
  5. A liccnél előbb az ítélőmodellt költségelje: a bevett megosztás egy rögzített kis modell az olcsó metrikákhoz és egy jobb a faithfulness-hoz.
A Ragas a legolcsóbb módja annak, hogy abbahagyja annak a vitát, segített-e egy változtatás: rögzítse az ítélőt, fagyassza be a sorokat, olvassa el a diffet. Amit nem csinál meg, azt akkor is meg kell fizetni.

Források

  1. Ragas-dokumentáció: bevezetés
  2. Ragas-dokumentáció: quick start
  3. Ragas-dokumentáció: elérhető metrikák
  4. Ragas a GitHubon
  5. Ragas a PyPI-n
  6. Ragas weboldal

Gyakori kérdések

A Ragas ingyenesen használható?

A Python-könyvtár Apache-2.0 és ingyenes, beleértve a metrikákat, a szintetikus tesztkészlet-generálást és az experiments-munkafolyamatot. A hostolt platformot és az üzleti támogatást a VibrantLabs közvetlenül árulja, nyilvános ár nélkül.

Melyik Ragas-metrikához kell golden set?

A context recall és a factual correctness referenciaválssal hasonlít össze, míg a faithfulness, a response relevancy és az aspect critic önmagában a kérdésből, a kontextusból és a válaszból dolgozik. A legtöbb csapat referenciamentesen kezd, és csak a rendre rossz sorokhoz ad címkét.

A Ragas kiváltja a megfigyelőeszközöket?

Nem. Az Ön által megadott adathalmazt értékeli, és az eredményt CSV-be írja; nem gyűjt trace-eket, nem vesz mintát a termelési forgalomból és nem rajzol dashboardot. Használja metrikarétegként egy futásokat tároló rendszer alatt.

Mennyibe kerül egy Ragas-futás?

Amit az ítélőmodell felszámít. A faithfulness soronként több LLM-hívást indít, mert állításanként ellenőriz, így egy 500 soros, négy metrikás készlet több ezer hívásból áll; a gyorsítótár és a kisebb ítélőmodell a szabályozók.

Pont erre van szükséged?

Írj a projektedről vagy a pozícióról – szívesen hallok felőled.