Eszközök/LLMOps és értékelés
Ragas-ismertető: az alapértelmezett RAG-evalualációs keretrendszer
A Ragas faithfulness, context precision és context recall metrikákkal értékeli a RAG- és ügynök-pipeline-okat, tesztadatot generál és kísérleteket rögzít. Apache-2.0, az ítélőmodell külön számlázva.
- Típus
- Evaluation framework
- Ár
- Apache-2.0 · paid platform
Balázs Csorba··10 perc olvasás
- RAG evaluation
- LLM-as-judge
- Test sets
- CI quality
- Ragas

A lényeg röviden
- A Ragas egy Apache-2.0 licencű Python-könyvtár 0.4.3-as verzióban, amelynek faithfulness, context precision és context recall metrikái a RAG-evalualáció szabványos nyelvévé váltak.
- A legtöbb metrika ítélőmodellt hív, a futás tehát pénzbe kerül és örökli a modell vakságait; a két futás összevetése előtt rögzítse a modellverziót.
- A könyvtár nem tárol trace-eket és nem rajzol dashboardot, ezért a termelési megfigyelhetőséget igénylő csapatok a Ragashoz egy Langfuse-hoz hasonló eszközt társítanak, vagy maguk építik a tárolót.
- A hostolt platformra nincs nyilvános árlista, ezért a költségkeret száma az ítélőmodell, nem a licenc.
- A referenciamentes metrikák azt mérik, alátámasztott-e a válasz, nem azt, hogy helyes-e; a helyességhez tartsanak egy kis címkézett készletet.
A Ragas egy Apache-2.0 licencű Python-könyvtár az LLM-alkalmazások értékelésére, és észrevétlenül a RAG-evalualáció nyelvévé vált: a faithfulness, a context precision és a context recall mind az ő metrikakészletéből származik. Egy retriever-pipeline első értékelőeszközeként nagyon értékes, termelési monitoringszerként viszont gyakorlatilag nulla, mert számokat számol egy neki átadott adathalmazon, a tárolást, a dashboardokat, a mintavételt és a riasztást pedig másra bízza.
A retriever-készlet és a build közé ül be: miután a LlamaIndex, a LangChain vagy egy saját retriever válaszokat ad, a Ragas kiértékeli őket, a számok pedig a commit mellé kerülnek. Vetélytársai a DeepEval, a TruLens és a Phoenix, valamint a Langfuse, a LangSmith és a Braintrust beépített értékelő funkciói; a különbség, hogy a Ragas könyvtár marad: nincs üzemeltetendő szolgáltatás és nincs szolgáltató, aki a tesztadatokat őrzi.
Mi ez
A csomag pip install ragas segítséggel a PyPI-ról települ és a folyamaton belül fut; a 0.4.3-as verzió 2026. január 13-án jelent meg, és Python 3.9-est vagy újabbat igényel. A metrikák kétfélék: LLM-alapúak, amikor egy ítélőmodell elolvassa a sort, és értéket ad vissza írásos indoklással, valamint hagyományosak, amikor a szövegeket közvetlenül hasonlítják össze, ilyen a BLEU, a ROUGE, az exact match és a semantic similarity. Eré épül az experiments-munkafolyamat, adathalmaz, futás, rögzítés, összevetés, ami egy metrikafunkció-halmazt megismételhető értékeléssé alakít.
- Licenc és tulajdonos: Apache-2.0, a VibrantLabs karbantartja; a repó körülbelül 16 000 csillagot és 1 700 forkot mutat.
- RAG-metrikák: context precision, context recall, context entities recall, noise sensitivity, response relevancy és faithfulness, továbbá a faithfulness és a relevance többdimenziós változatai.
- Ügynök-metrikák: tool call accuracy, tool call F1, agent goal accuracy és topic adherence.
- Alátámasztás és összehasonlítás: factual correctness, semantic similarity, BLEU, CHRF, ROUGE, string presence és exact match.
- SQL és összefoglalás: végrehajtás alapú DataCompy-pontszám, SQL-lekérdezés-ekvivalencia és összefoglaló pontszám.
- Tesztadatok és váz: szintetikus tesztkészlet-generálás a saját dokumentumokból, valamint egy
ragas quickstart rag_evalsablon, amely futtatható projektet ír. - Kimenet: a kísérletek eredménye CSV-fájlokban a repóban, bármely más build-termékhez hasonlóan diffelhető.
Hogyan működik
Egy futás soronként járja végig a sorokat. Minden sor tartalmazza a felhasználó bemenetét, az alkalmazás válaszát és azt a kontextust, amit a retriever szállított. Egy metrika felveszi a sort, egy vagy több LLM-hívást indít egy, a szempontot pontosan megnevező prompttal, majd értéket ad vissza az ítélő indoklásával; a hagyományos metrikák kihagyják a hívást és szövegeket hasonlítanak össze. A sorok függetlenül értékelődnek, így az adathalmaz párhuzamosítható, és egyetlen sor újrafuttatható, ha a átlag rosszul néz ki.
Azért terjedt el ez az értékelési mert a kimenet olvasható. Egy alacsony faithfulness-pontszám azzal a mondattal érkezik, amit az ítélő az alátámasztatlan állításról írt, vagyis olyan diffel, amire egy ember reagálni tud, nem vitára való számmal.
Első lépések
A legkisebb értelmes teszt egy metrika egyetlen soron, ahogy a README is bemutatja a könyvtárat.
import asyncio
from ragas.metrics.collections import AspectCritic
from ragas.llms import llm_factory
# The judge: llm_factory() takes OpenAI by default, Anthropic and others as options
llm = llm_factory("gpt-4o")
metric = AspectCritic(
name="summary_accuracy",
definition="Verify if the summary is accurate and captures key information.",
llm=llm,
)
row = {
"user_input": "summarise given text: the company reported an 8% rise in Q3 2024.",
"response": "The company saw an 8% increase in Q3 2024.",
}
async def main():
score = await metric.ascore(user_input=row["user_input"], response=row["response"])
print(score.value, score.reason)
asyncio.run(main())Egész projekthez a váz gyorsabb: az uvx ragas quickstart rag_eval egy csomagot ír rag.py, evals.py, datasets és experiments mappával, az uv sync telepíti, a uv run python evals.py betölti az adathalmazt, lekérdezi az alkalmazást, kiértékeli az összes sort, és az eredményt a CSV-hez fűzi. A dokumentáció a sablont alapértelmezésben OpenAI-ra állítja, és ugyanezt a három sort mutatja Anthropicra, Google Geminire, Ollamára vagy bármely OpenAI-kompatibilis végpontra állítva.
Teljesítmény és költség
A Ragas nem ad késést a terméknek; költséget és valós időt ad a buildnek. A számla: sorok szorozva metrikákkal szorozva ítélőhívásokkal soronként, a drága metrikák pedig azok, amelyek a választ állításokra bontva külön-külön ellenőriznek.
| Metrika | Az ítélő munkája soronként | Referenciaválasz kell | Mit jelent az alacsony érték |
|---|---|---|---|
| Faithfulness | Az választ állításokra bontja, és mindegyiket a kontextushoz igazítja | Nem | A válasz többet állít, mint amit a visszakeresett szöveg alátámaszt |
| Context precision | A visszakeresett chunkokat rangsorolja a kérdéshez képest | Opcionális | Releváns chunkok kerülnek a promptba |
| Context recall | A visszakeresett kontextust a referenciaválssal hasonlítja össze | Igen | A retriever sosem látta a válasz egy részét |
| Tool call accuracy | Az ügynök eszközhívását és argumentumait a várttal hasonlítja össze | Igen | Az ügynök rossz eszközt választ vagy hibás argumentumot ad meg |
Egy 500 soros adathalmaz négy LLM-metrikával futásonként több ezer ítélőhívást jelent. A csapatok úgy tartják elérhetőnek, hogy ahol a könyvtár engedi, gyorsítótáraznak, a olcsó metrikákhoz kis ítélőmodellt használnak, és a teljes készletet csak egy merge előtt futtatják.
- Az olcsó metrikákat minden pushnál értékelje, a faithfulness-t és az ügynök-metrikákat merge-kor vagy időzítve futtassa.
- Tartsa az adathalmazt kicsinek és agresszív véletlenszerű helyett: 200, már korábban hibát adott sor többet ér, mint 5 000, amely sosem hibázik.
- Szintetikus sorokat generáljon lefedettségre, majd fagyasztja be őket; ha minden ciklusban újragenerálja a tesztkészletet, minden pontszám zajnak tűnik.
Ebből semmi sem Ragas-specifikus: minden LLM-as-a-judge megoldás hívásonként számláz és örökli az ítélő vakságait. A Ragas arról dönt, hogy ennek a gépezetnek mekkora részét kapja ingyen, és mekkorát kell köré építeni.
Árazás
A könyvtár ingyenes és Apache-2.0, ülés- és felhasználási korlát nélkül. az üzleti oldal, a hostolt platform és a közvetlen támogatás, a karbantartókon keresztül, kontakton és office hours-on át kapható, nyilvános árlista nélkül. Emiatt a tényleges költség az ítélőmodell: minden LLM-metrikát az a szolgáltató számláz, amelyre irányítják, a szintetikus tesztkészlet-generálás pedig ugyanezen a mérőn fut.
- Könyvtár: ingyenes, Apache-2.0, PyPI-ról települ, nem kell hozzá fiók.
- Ítélőmodell: hívásonként a szolgáltatónál számlázva, általában a eval-költségvetés legnagyobb tétele.
- Szintetikus tesztadat: szintén LLM-munka, pontosan úgy számlázva, mint az értékelés.
- Hostolt platform és támogatás: közvetlenül, nyilvános ár nélkül; a vállalás előtt kérdezze meg, mi jár bele.
Hol akad el
A Ragas sorokat értékel, nem rendszereket. Nem vesz mintát a termelési forgalomból, nem tárol trace-eket, nem szól, ha a p95-ös késés elmozdult, és nem tudja megmondani, reprezentatívak-e a tesztkérdések, pedig ez a hiba teszi haszontalanná a zöld pipeline-t. A kiadási tempó gyors, 0.3.0 2025 júliusában, 0.4.0 2025 decemberében, 0.4.3 2026 januárjában, így a verziókat rögzíteni kell. A kutatás időpontjában a repó 381 nyitott issue-t mutatott, ami a az alapértelmezett eszköz szokásos ára, a stable dokumentáció pedig lemarad a kiadott API mögött.
| Eszköz | Mi az | Hol győz | Miről mond le |
|---|---|---|---|
| Ragas | Metrikakönyvtár szintetikus tesztadatokkal | A metrikanyelv és egyetlen paranccsal futtatható projekt | Nincs trace-tároló, nincs dashboard, nincs termelési mintavétel |
| DeepEval | Pytest-stílusú metrikák hostolt platformmal mögötte | Unit-test ergonomika és hosszú metrikalista | A platform rész külön kereskedelmi termék |
| Langfuse | Nyílt forráskódú tracing adathalmazokkal és értékelésekkel | Trace-ek, promptok és pontszámok egy helyen | A Ragas-stílusú metrikamatematika csak egy funkció a sok közül |
| Arize Phoenix | Nyílt forráskódú tracing és értékelés LLM-alkalmazásokhoz | Span-szintű hibakeresés a pontszámok mellett | Szűkebb, referenciamentes RAG-metrikakészlet |
A valódi döntés az, hol laknak a számok. A Ragas a megfelelő motor, ha valami más tárolja a futásokat: egy CSV a repóban, egy táblázat az adatwarehouse-ban, egy olyan megfigyelőeszköz, amely befogadja az importált pontszámokat. Rossz vásárlás viszont annak a csapatnak, amely egy URL-t akar megnyitni, és látni, romlott-e a minőség.
Ítélet
A Ragas megérdemli az alapértelmezett szerepet a retriever-munkában: a metrikák jól definiáltak, a kimenet indoklást hoz, és egy projekt egy parancsnyira van. Scoring-motorként szabad elfogadni egy olyan munkafolyamatban, amelyet egyébként is birtokol, nem értékelési platformként.
- Használja, ha van retriever-pipelineja, de még nincs golden setje: a szintetikus tesztkészlet-generálás és a referenciamentes metrikák egy nap alatt adnak első mérőszámot.
- Használja, ha az értékelésnek CI-ben kell futnia, ahol egy CSV-diff pull requestenként éppen a megfelelő mennyiségű jelzés.
- Ne ezt válassza egyetlen értékelőeszközként ügynök-termékhez: az ügynök-metrikák megvannak, de a trajektóriák, az eszközök mellékhatásai és a feladatonkénti költség olyan harneszt kíván, amely tárolja a futásokat.
- Ne ezt válassza, ha a választ eltárolt bizonyítékokból kell alátámasztani szabályozó vagy ügyfél előtt; nem marad meg semmi, amit nem ön tárol el.
- A liccnél előbb az ítélőmodellt költségelje: a bevett megosztás egy rögzített kis modell az olcsó metrikákhoz és egy jobb a faithfulness-hoz.
A Ragas a legolcsóbb módja annak, hogy abbahagyja annak a vitát, segített-e egy változtatás: rögzítse az ítélőt, fagyassza be a sorokat, olvassa el a diffet. Amit nem csinál meg, azt akkor is meg kell fizetni.
Források
Gyakori kérdések
A Ragas ingyenesen használható?
A Python-könyvtár Apache-2.0 és ingyenes, beleértve a metrikákat, a szintetikus tesztkészlet-generálást és az experiments-munkafolyamatot. A hostolt platformot és az üzleti támogatást a VibrantLabs közvetlenül árulja, nyilvános ár nélkül.
Melyik Ragas-metrikához kell golden set?
A context recall és a factual correctness referenciaválssal hasonlít össze, míg a faithfulness, a response relevancy és az aspect critic önmagában a kérdésből, a kontextusból és a válaszból dolgozik. A legtöbb csapat referenciamentesen kezd, és csak a rendre rossz sorokhoz ad címkét.
A Ragas kiváltja a megfigyelőeszközöket?
Nem. Az Ön által megadott adathalmazt értékeli, és az eredményt CSV-be írja; nem gyűjt trace-eket, nem vesz mintát a termelési forgalomból és nem rajzol dashboardot. Használja metrikarétegként egy futásokat tároló rendszer alatt.
Mennyibe kerül egy Ragas-futás?
Amit az ítélőmodell felszámít. A faithfulness soronként több LLM-hívást indít, mert állításanként ellenőriz, így egy 500 soros, négy metrikás készlet több ezer hívásból áll; a gyorsítótár és a kisebb ítélőmodell a szabályozók.