Eszközök/LLMOps és értékelés
Braintrust teszt: eval-first observability kemény mérőórával
A Braintrust a termelési trace-ekből datasetet és gate-elt kísérleteket csinál. Mit ad a Starter és a Pro, mi a nyílt forrás, és hol erősebb a Phoenix, a Langfuse és a LangSmith.
- Típus
- Evaluation platform
- Ár
- Free · from $249 per month
Balázs Csorba··10 perc olvasás
- Evaluations
- Observability
- LLM-as-a-judge
- CI gates
- Tracing

A lényeg röviden
- A Starter valóban használható, de kicsi: 1 GB feldolgozott adat, 10 000 pontszám és 14 nap megőrzés, utána a Pro havi 249 dollár 5 GB-ért, 50 000 pontszámért és 30 napért.
- A feldolgozott adatot bevételnél mérik, a trace-ek törlése tehát nem csökkenti a számlát, a túlfutás pedig Starteren gigabájtonként 4 dollár, Pron gigabájtonként 3 dollár.
- A platform zárt forrássú, az eszközök nyíltak: hat nyelvi SDK Apache-2.0 alatt, autoevals MIT-tel, bt CLI Apache-2.0-val.
- A BYOC és a self-hosting Enterprise-t kér, a SAML SSO, az audit naplózás, az egyéni megőrzés és a SOC 2 tanúsítvány szintén Enterprise-tételek.
- 0 és 249 dollár között nincs szint, ezért a Braintrust olcsó egyedüli értékelési projektnél, és drága annak a csapatnak, amely csak dashboardokat akart.
A Braintrust egy hosztolt platform, amely instrumentál egy LLM-alkalmazást, eltárolja a trace-jeit, és datasetek ellen pontozza őket, olyan formában, ami megismételhető. A súlypontja az értékelés: egy Eval() hívás, amely feladatot futtat egy dataset fölött, pontozza a kimeneteket, és minden lefutást összehasonlítható kísérletként tárol. Ennek az értékelésnek az álláspontja: a Braintrust a kategóriájának legerősebb eval-first terméke, és a legjobban megmért a versenytársai közül — a technika kiváló, a számlázás pedig azokat a csapatokat jutalmazza, akik pontosan tudják, mennyi adatot szándékoznak küldeni.
Három feladatot fed le, amit máskülönben szétosztanának eszközök között: tracing a termelésben, offline értékelés, és a köztük lévő gate a folyamatos integrációban. Az Arize Phoenix és a Langfuse a nyílt forrássú oldalon versenyez, a LangSmith azokkal, akik már LangGraph-ra építenek. Általában rosszabbat vált ki: egy tesztkészletet, amely hívja a modellt, pontszámot nyomtat a stdout-ra, és akkor törlődik, amikor elkezd szétesni.
Mi ez
A Braintrust a Braintrust Data SaaS-terméke, három objektumra építve: logok, amelyek az alkalmazás trace-jei; datasetek, amelyek bemeneti és elvárt kimeneti sorok; és kísérletek, amelyek feladatot futtatnak egy dataset fölött, hozzárendelt scorerokkal. A dokumentáció ötlépéses workflowt ír le — instrumentálni, megfigyelni, annotálni, értékelni, kiadni —, és SDK-kat szállít Pythonhoz, TypeScripthez, Go-hoz, Rubyhoz, Javához és C#-höz. Maga a platform zárt forrássú; az eszközök jó része nem az.
- Licenc: a platform zárt forrássú; SDK-k Apache-2.0, autoevals MIT, braintrust-proxy MIT
- Instrumentálás: a braintrust.auto_instrument() a folyamatban már futó szolgáltatói klienseket csomagolja, plusz bt CLI az agentes beállításhoz
- Értékelés: Eval() dataset fölött autoevals scorerokkal, saját kóddal vagy LLM-as-a-judge-dal
- Tarifák: Starter 0 dollár, Pro havi 249 dollár, Enterprise egyedi áron, mindhárom korlátlan felhasználóval, projekttel, datasettel és kísérlettel
- Mérés: feldolgozott adat gigabájtban, pontszám ezrenként, modell-egyenleg dollárban
- Deployolás: SaaS a Starteren és a Pron, BYOC és self-hosting csak az Enterprise-ban
- Extrák: playgroundok, környezetek és egyedi chartok Pron felül, továbbá a Loop, egy beépített agent, amely scorerokat, teszteseteket és prompt-iterációkat ír
Ez az utolsó sor az árulkodó jel. A Braintrust abból indul ki, hogy a platform más problémája, az értékelés pedig a tiéd, és az ezt elfogadó csapatok nagyon rövid hurkot kapnak a termelési hibától a datasetsorig, majd a gate-elt kiadásig. Akiknek a teljes rendszernek a saját fiókjukban kell lennie, azok arra jönnek rá, hogy ennek a hurknak az ára egy Enterprise-szerződés, nem a 249 dolláros tarifa.
Hogyan működik
Az instrumentálás a folyamatban történik: a braintrust.auto_instrument() azt a szolgáltatói klient fűzi be, amelyet az alkalmazás amúgy is használ, így a spanek költségekkel érkeznek, és nem kell sidecart telepíteni. Minden egy projektbe kerül, a logok, a datasetek és a kísérletek pedig ugyanezt a projektet osztják meg — ezért lehet egy termelési trace-et tesztesetté emelni, export nélkül.
A különlegesség az összehasonlítás. Egy kísérlet tartós record, a második lefutás pedig új kísérletnéven a felületen össze van vetve az elsővel. A dokumentáció saját quickstartje erre épít: az első lefutás ExactMatch alatt majdnem nulla, mert a modell mondatban válaszol, a promptot szűkítik csupasz címre, és a második kísérlet a növekedést pontszám-deltaként adja meg, nem benyomásként.
Első lépések
Két kulcs és egy fájl: BRAINTRUST_API_KEY a platformhoz, a szolgáltatói kulcs a modellhez, és egy Python-fájl az adatokkal, a feladattal és a scorerrel. Az alábbi részlet a dokumentált quickstart formája az ismétlés nélkül:
# BRAINTRUST_API_KEY és OPENAI_API_KEY környezeti változók
# pip install braintrust openai autoevals
import braintrust
from braintrust import Eval
from autoevals import ExactMatch
from openai import OpenAI
braintrust.auto_instrument() # minden hívást naplóz ebben a folyamatban
client = OpenAI()
def task(input):
r = client.responses.create(
model="gpt-5-mini",
input=[{"role": "system", "content": "Name the film."},
{"role": "user", "content": input}],
)
return r.output_text
Eval(
"movie-matcher",
experiment_name="baseline-v1",
data=[{"input": "A detective hunts a killer through the seven deadly sins.",
"expected": "Se7en"}],
task=task,
scores=[ExactMatch],
)Futtasd bt eval movie_matcher.py paranccsal, a terminál pedig kiírja a kísérlet linkjét; a sima Python is működik, mert a CLI csak a belépési pontot csomagolja. Ugyanezt a fájlt futtatja a pull request: az eval-action GitHub-workflow a main ellen futtatja, és bukik a build, ha egy pontszám visszaesik.
Mennyibe kerül
Három tarifa és nincs középső fok: az árlap a Startert 0 dollárral, a Prot havi 249 dollárral, az Enterprisest egyedi áron sorolja fel, korlátlan felhasználóval, projekttel, datasettel, playgrounddal és kísérlettel mindháromban. Ami eltér, az a mérőóra:
| Tarifa | Ár | Feldolgozott adat | Pontszám | Megőrzés |
|---|---|---|---|---|
| Starter | 0 dollár | 1 GB, utána 4 dollár/GB | 10 000, utána 2,50 dollár / 1 000 | 14 nap |
| Pro | havi 249 dollár | 5 GB, utána 3 dollár/GB | 50 000, utána 1,50 dollár / 1 000 | 30 nap, utána 0,50 dollár / GB-hó |
| Enterprise | Egyedi | Egyedi | Egyedi | Egyedi, akár 365 nap |
Mellette futnak a modell-egyenlegek: havonta 10 dollár Starteren és 100 dolláron Pron a beépített modelleket és a platformfunkciókat, például a Topicsot fedi, utána token-árak érvényesek. A váltás bináris — amelyik csapat kinövi az 1 GB-ot és a 14 napot, a teljes 249 dollárt fizeti, igaz, a dokumentáció jogosult új startup-ügyfeleknek hat-tizenkét hónap Pro-t ad.
Mi nyílt és mi nem
Ez a különbség külön szakaszt érdemel, mert a A Braintrust nyílt forrássú mondat éppen ott hamis, ahol számít: Enterprise alatt nem tudod magad üzemeltetni a platformot. Ami nyílt, az az instrumentálás és az értékelési eszköztár körülötte.
- braintrust-sdk-python, -javascript, -go és -ruby: Apache-2.0
- autoevals: MIT, körülbelül ezer csillag, a quickstart által importált scorer-könyvtár
- braintrust-proxy: MIT, proxy a modellforgalom előtt
- agentbehavior: Apache-2.0, nyílt szabvány és dataset az agentek viselkedéséhez
- A bt CLI és a coding-agent pluginok: Apache-2.0 vagy MIT; a hosztolt webalkalmazás nem publikus
Egy engineering-csapatnak ez a különbség a beszerzésig legfeljebb filozófiai, onnantól viszont a vita tárgya. Az elútválasztást is meghatározza: az SDK-k átállíthatók másik backendre az alkalmazás átírása nélkül, de a datasetek, kísérletek és dashboardok a Braintrust szolgáltatásában élnek, az S3-ba vagy Google Cloud Storagebe ütemezett export pedig Enterprise-funkció.
Hol akad
Az első gyengeség a számtan. 0 és 249 dollár között nincs tarifa, az ingyenes szint 1 GB-ja és 14 napja demóköltségvetés egy termelési agentnek, a pontozás pedig a bevételre jön rá, aki tehát minden termelési trace fölött judge-t futtat, a pontszám-keret előbb merül ki, mint az adat. A második, amit az alsó tarifák nem hordoznak: a SAML SSO, az audit naplózás, az egyéni megőrzés, az export-automatizálás, a SOC 2 tanúsítvány és a Business Associate Agreement mind Enterprise-tétel, a Starter pedig korlátozott a tulajdonos-engedélycsoportra és projektenként egy human-review pontszámra. A harmadik a szerződési sodródás: a dokumentáció még mindig hordoz egy régi-tarifa megjegyzést a 2026. március 16. előtt létrehozott fiókokhoz, a régi feltételek alatti értékelést tehát érdemes újracsinálni.
| Eszköz | Ingyenes szint | Első fizetős szint | Self-hosting |
|---|---|---|---|
| Braintrust | 1 GB, 10 000 pontszám, 14 nap | Pro havi 249 dollár | Csak Enterprise |
| Arize Phoenix | Nincs korlát helyi telepítésnél | AX Pro havi 50 dollár | Ingyenes, ELv2 |
| Langfuse | 50 000 egység, 30 nap, 2 felhasználó | Core havi 29 dollár | Ingyenes, Docker Compose |
| LangSmith | 1 ülőhely, 5 000 alap-trace | Plus 39 dollár ülőhelyenként | Enterprise kiegészítő |
Őszintén olvasva a Braintrust és a Phoenix nem ugyanazon a tengelyen versenyez: az egyik olyan csapatokra van árazva, akik értékelési folyamatot vesznek, a másik olyanokra, akik birtokolják az infrastruktúrát. A Langfuse a legközelebbi közvetlen helyettesítő, nagyjából harmadannyi belépő áron, a LangSmith pedig a természetes választás, ha az alkalmazás már LangGraphon ül, és a saját trace-formátumok fontosabbak a scorer-könyvtárnál.
A SaaS minden tarifában elérhető. A BYOC és a self-hostes deployolás, amelyek az adatot a saját felhőben tartják, Enterprise-t igényel. — Braintrust dokumentáció, tarifák és korlátok
Ítélet
A Braintrust megtérül, ha az értékelés rendszeres engineering-rituálé, és nem egyszeri script: a kísérletmodell, a scorer-könyvtár és a CI-akció egy olyan hurkot ad, amely alkatrészekből összerakni unalmas munka. Rossz választás olyan csapatnak, amelynek fő igénye egy dashboard mögötti traces tárolás, mert az 249 dolláros szokás adatszámlával.
- Válaszd, ha egy pull requestnek eval-regresszión kell buknia, és azt akarod, hogy a scorer-könyvtár már meglegyen.
- Válaszd, ha több szerep — fejlesztők, reviewerök, product manager — ugyanazokat a kísérleteket és dashboardokat szeretné; az ülőhelyek minden tarifában korlátlanok.
- Válaszd, ha a volumen kiszámítható: 5 GB és 50 000 pontszám havonta ismert mennyiség, a túlfutási árak pedig nyilvánosak.
- Ne válassz, ha a trace-eknek a saját fiókban kell maradniuk; a BYOC és a self-hosting Enterprise-szerződést kér.
- Ne válassz, ha a terhelés beszédes és korlátlan: a bevételnél mért mérés plusz pontszám-díj drágává tesz egy zajos agentet, az ülőhelyes eszközökkel ellentétben.
Források
- Braintrust árak: tarifák, egyenlegek és használati díjak
- Braintrust dokumentáció: tarifák és korlátok
- Braintrust dokumentáció: értékelési quickstart
- Braintrust dokumentáció: első lépések
- GitHub: Braintrust szervezet tárolói
- Arize Phoenix dokumentáció: self-hosting
- Langfuse árak: cloud tarifák és számlázható egységek
- LangChain árak: LangSmith tarifák
Gyakori kérdések
Mennyibe kerül a Braintrust?
A Starter 0 dollár, 10 dollár modell-egyenleggel, 1 GB feldolgozott adattal, 10 000 pontszámmal és 14 napos megőrzéssel, korlátlan felhasználóval, projekttel, datasettel, playgrounddal és kísérlettel. A Pro havi 249 dollár 100 dollár egyenlegért, 5 GB-ért, 50 000 pontszámért, 30 napos megőrzésért, egyedi chartokért, környezetekért, RBAC-ért és kiemelt támogatásért. Az Enterprise egyedi áras, és hozzáadja a BYOC-ot, a self-hostinget, a SAML vagy OIDC belépést, az audit naplózást, a BAA-t és a rendelkezésre állási SLA-t.
Nyílt forrássú a Braintrust?
A platform nem, az eszközök jelentős része igen. A Python, TypeScript, Go, Ruby, Java és C# SDK-k Apache-2.0 alatt futnak, az autoevals MIT alatt, körülbelül ezer GitHub-csillaggal, a braintrust-proxy MIT-tel, az agentbehavior szabvány pedig Apache-2.0 alatt. A szolgáltatás self-hostelt változata az Enterprise tarifáig nem létezik.
Mit számít pontszámnak az árlista?
A pontszám egy rögzített értékelési eredmény, legyen az LLM-as-a-judge hívás, autoevals scorer vagy saját kód, amely egy trace-hez vagy kísérletsorhoz kapcsolódik. A Starter havi 10 000-et ad, majd 2,50 dollárt kér ezerenként; a Pro 50 000-et ad, majd 1,50 dollárt ezerenként. A judge-alapú értékelés dataseten gyorsan felszaporodik, ezért a pontszám-limit gyakran hamarabb kifogy, mint maguk az adatok.
Braintrust vagy Arize Phoenix?
Braintrust, ha az értékelésnek a CI-ben a helye, és a platformdíj elfogadható: az Eval API, a scorer-könyvtár és az eval-action egyetlen integráció. Phoenix, ha a trace-ek nem hagyhatják el a saját infrastruktúrát, mert a Braintrust BYOC-ja és self-hostingje Enterprise-szerződést kér, míg a Phoenix az Elastic License 2.0 alatt szabadon self-hostelhető.