Eszközök/LLMOps és értékelés

Braintrust teszt: eval-first observability kemény mérőórával

A Braintrust a termelési trace-ekből datasetet és gate-elt kísérleteket csinál. Mit ad a Starter és a Pro, mi a nyílt forrás, és hol erősebb a Phoenix, a Langfuse és a LangSmith.

Típus
Evaluation platform
Ár
Free · from $249 per month

··10 perc olvasás

  • Evaluations
  • Observability
  • LLM-as-a-judge
  • CI gates
  • Tracing
Hurok az instrumentált alkalmazási logoktól egy dataseten át a scorerokkal futó kísérletig, majd az összehasonlításig, amely blokkolja a pull requestet, mielőtt a változás visszakerül az alkalmazásba.

A lényeg röviden

  • A Starter valóban használható, de kicsi: 1 GB feldolgozott adat, 10 000 pontszám és 14 nap megőrzés, utána a Pro havi 249 dollár 5 GB-ért, 50 000 pontszámért és 30 napért.
  • A feldolgozott adatot bevételnél mérik, a trace-ek törlése tehát nem csökkenti a számlát, a túlfutás pedig Starteren gigabájtonként 4 dollár, Pron gigabájtonként 3 dollár.
  • A platform zárt forrássú, az eszközök nyíltak: hat nyelvi SDK Apache-2.0 alatt, autoevals MIT-tel, bt CLI Apache-2.0-val.
  • A BYOC és a self-hosting Enterprise-t kér, a SAML SSO, az audit naplózás, az egyéni megőrzés és a SOC 2 tanúsítvány szintén Enterprise-tételek.
  • 0 és 249 dollár között nincs szint, ezért a Braintrust olcsó egyedüli értékelési projektnél, és drága annak a csapatnak, amely csak dashboardokat akart.

A Braintrust egy hosztolt platform, amely instrumentál egy LLM-alkalmazást, eltárolja a trace-jeit, és datasetek ellen pontozza őket, olyan formában, ami megismételhető. A súlypontja az értékelés: egy Eval() hívás, amely feladatot futtat egy dataset fölött, pontozza a kimeneteket, és minden lefutást összehasonlítható kísérletként tárol. Ennek az értékelésnek az álláspontja: a Braintrust a kategóriájának legerősebb eval-first terméke, és a legjobban megmért a versenytársai közül — a technika kiváló, a számlázás pedig azokat a csapatokat jutalmazza, akik pontosan tudják, mennyi adatot szándékoznak küldeni.

Három feladatot fed le, amit máskülönben szétosztanának eszközök között: tracing a termelésben, offline értékelés, és a köztük lévő gate a folyamatos integrációban. Az Arize Phoenix és a Langfuse a nyílt forrássú oldalon versenyez, a LangSmith azokkal, akik már LangGraph-ra építenek. Általában rosszabbat vált ki: egy tesztkészletet, amely hívja a modellt, pontszámot nyomtat a stdout-ra, és akkor törlődik, amikor elkezd szétesni.

Mi ez

A Braintrust a Braintrust Data SaaS-terméke, három objektumra építve: logok, amelyek az alkalmazás trace-jei; datasetek, amelyek bemeneti és elvárt kimeneti sorok; és kísérletek, amelyek feladatot futtatnak egy dataset fölött, hozzárendelt scorerokkal. A dokumentáció ötlépéses workflowt ír le — instrumentálni, megfigyelni, annotálni, értékelni, kiadni —, és SDK-kat szállít Pythonhoz, TypeScripthez, Go-hoz, Rubyhoz, Javához és C#-höz. Maga a platform zárt forrássú; az eszközök jó része nem az.

  • Licenc: a platform zárt forrássú; SDK-k Apache-2.0, autoevals MIT, braintrust-proxy MIT
  • Instrumentálás: a braintrust.auto_instrument() a folyamatban már futó szolgáltatói klienseket csomagolja, plusz bt CLI az agentes beállításhoz
  • Értékelés: Eval() dataset fölött autoevals scorerokkal, saját kóddal vagy LLM-as-a-judge-dal
  • Tarifák: Starter 0 dollár, Pro havi 249 dollár, Enterprise egyedi áron, mindhárom korlátlan felhasználóval, projekttel, datasettel és kísérlettel
  • Mérés: feldolgozott adat gigabájtban, pontszám ezrenként, modell-egyenleg dollárban
  • Deployolás: SaaS a Starteren és a Pron, BYOC és self-hosting csak az Enterprise-ban
  • Extrák: playgroundok, környezetek és egyedi chartok Pron felül, továbbá a Loop, egy beépített agent, amely scorerokat, teszteseteket és prompt-iterációkat ír

Ez az utolsó sor az árulkodó jel. A Braintrust abból indul ki, hogy a platform más problémája, az értékelés pedig a tiéd, és az ezt elfogadó csapatok nagyon rövid hurkot kapnak a termelési hibától a datasetsorig, majd a gate-elt kiadásig. Akiknek a teljes rendszernek a saját fiókjukban kell lennie, azok arra jönnek rá, hogy ennek a hurknak az ára egy Enterprise-szerződés, nem a 249 dolláros tarifa.

Hogyan működik

Az instrumentálás a folyamatban történik: a braintrust.auto_instrument() azt a szolgáltatói klient fűzi be, amelyet az alkalmazás amúgy is használ, így a spanek költségekkel érkeznek, és nem kell sidecart telepíteni. Minden egy projektbe kerül, a logok, a datasetek és a kísérletek pedig ugyanezt a projektet osztják meg — ezért lehet egy termelési trace-et tesztesetté emelni, export nélkül.

A Braintrust-hurok a trace-től a gate-elt kiadásigEgy instrumentált alkalmazás trace-eket és költségeiket naplóz egy projektbe. A termelési trace-ek dataset-sorokká válnak, egy kísérlet feladatot futtat a dataset föl scorerokkal, és két lefutás összehasonlítása blokkolja a pull requestet, mielőtt a változás visszakerül az alkalmazásba.Egy hurok, három dologprojekt-hatókörApp + SDKauto_instrumentLogoktrace, költségDatasetsorok a trace-bőlKísérlettask + scorerokFutások összevetésepull request blokkolA scorer lehet autoevals, saját kód vagy judge-hívás, amely soronként egy modellkérést költ.Minden kísérlet tartós record: a második lefutást diffelik az elsőhöz
A trace-ek, a datasetek és a kísérletek egy projektet osztanak meg, így termelési hibából lesz teszteset export nélkül.

A különlegesség az összehasonlítás. Egy kísérlet tartós record, a második lefutás pedig új kísérletnéven a felületen össze van vetve az elsővel. A dokumentáció saját quickstartje erre épít: az első lefutás ExactMatch alatt majdnem nulla, mert a modell mondatban válaszol, a promptot szűkítik csupasz címre, és a második kísérlet a növekedést pontszám-deltaként adja meg, nem benyomásként.

Első lépések

Két kulcs és egy fájl: BRAINTRUST_API_KEY a platformhoz, a szolgáltatói kulcs a modellhez, és egy Python-fájl az adatokkal, a feladattal és a scorerrel. Az alábbi részlet a dokumentált quickstart formája az ismétlés nélkül:

# BRAINTRUST_API_KEY és OPENAI_API_KEY környezeti változók
# pip install braintrust openai autoevals
import braintrust
from braintrust import Eval
from autoevals import ExactMatch
from openai import OpenAI

braintrust.auto_instrument()  # minden hívást naplóz ebben a folyamatban
client = OpenAI()

def task(input):
    r = client.responses.create(
        model="gpt-5-mini",
        input=[{"role": "system", "content": "Name the film."},
               {"role": "user", "content": input}],
    )
    return r.output_text

Eval(
    "movie-matcher",
    experiment_name="baseline-v1",
    data=[{"input": "A detective hunts a killer through the seven deadly sins.",
           "expected": "Se7en"}],
    task=task,
    scores=[ExactMatch],
)

Futtasd bt eval movie_matcher.py paranccsal, a terminál pedig kiírja a kísérlet linkjét; a sima Python is működik, mert a CLI csak a belépési pontot csomagolja. Ugyanezt a fájlt futtatja a pull request: az eval-action GitHub-workflow a main ellen futtatja, és bukik a build, ha egy pontszám visszaesik.

Mennyibe kerül

Három tarifa és nincs középső fok: az árlap a Startert 0 dollárral, a Prot havi 249 dollárral, az Enterprisest egyedi áron sorolja fel, korlátlan felhasználóval, projekttel, datasettel, playgrounddal és kísérlettel mindháromban. Ami eltér, az a mérőóra:

TarifaÁrFeldolgozott adatPontszámMegőrzés
Starter0 dollár1 GB, utána 4 dollár/GB10 000, utána 2,50 dollár / 1 00014 nap
Prohavi 249 dollár5 GB, utána 3 dollár/GB50 000, utána 1,50 dollár / 1 00030 nap, utána 0,50 dollár / GB-hó
EnterpriseEgyediEgyediEgyediEgyedi, akár 365 nap

Mellette futnak a modell-egyenlegek: havonta 10 dollár Starteren és 100 dolláron Pron a beépített modelleket és a platformfunkciókat, például a Topicsot fedi, utána token-árak érvényesek. A váltás bináris — amelyik csapat kinövi az 1 GB-ot és a 14 napot, a teljes 249 dollárt fizeti, igaz, a dokumentáció jogosult új startup-ügyfeleknek hat-tizenkét hónap Pro-t ad.

Mi nyílt és mi nem

Ez a különbség külön szakaszt érdemel, mert a A Braintrust nyílt forrássú mondat éppen ott hamis, ahol számít: Enterprise alatt nem tudod magad üzemeltetni a platformot. Ami nyílt, az az instrumentálás és az értékelési eszköztár körülötte.

  • braintrust-sdk-python, -javascript, -go és -ruby: Apache-2.0
  • autoevals: MIT, körülbelül ezer csillag, a quickstart által importált scorer-könyvtár
  • braintrust-proxy: MIT, proxy a modellforgalom előtt
  • agentbehavior: Apache-2.0, nyílt szabvány és dataset az agentek viselkedéséhez
  • A bt CLI és a coding-agent pluginok: Apache-2.0 vagy MIT; a hosztolt webalkalmazás nem publikus

Egy engineering-csapatnak ez a különbség a beszerzésig legfeljebb filozófiai, onnantól viszont a vita tárgya. Az elútválasztást is meghatározza: az SDK-k átállíthatók másik backendre az alkalmazás átírása nélkül, de a datasetek, kísérletek és dashboardok a Braintrust szolgáltatásában élnek, az S3-ba vagy Google Cloud Storagebe ütemezett export pedig Enterprise-funkció.

Hol akad

Az első gyengeség a számtan. 0 és 249 dollár között nincs tarifa, az ingyenes szint 1 GB-ja és 14 napja demóköltségvetés egy termelési agentnek, a pontozás pedig a bevételre jön rá, aki tehát minden termelési trace fölött judge-t futtat, a pontszám-keret előbb merül ki, mint az adat. A második, amit az alsó tarifák nem hordoznak: a SAML SSO, az audit naplózás, az egyéni megőrzés, az export-automatizálás, a SOC 2 tanúsítvány és a Business Associate Agreement mind Enterprise-tétel, a Starter pedig korlátozott a tulajdonos-engedélycsoportra és projektenként egy human-review pontszámra. A harmadik a szerződési sodródás: a dokumentáció még mindig hordoz egy régi-tarifa megjegyzést a 2026. március 16. előtt létrehozott fiókokhoz, a régi feltételek alatti értékelést tehát érdemes újracsinálni.

EszközIngyenes szintElső fizetős szintSelf-hosting
Braintrust1 GB, 10 000 pontszám, 14 napPro havi 249 dollárCsak Enterprise
Arize PhoenixNincs korlát helyi telepítésnélAX Pro havi 50 dollárIngyenes, ELv2
Langfuse50 000 egység, 30 nap, 2 felhasználóCore havi 29 dollárIngyenes, Docker Compose
LangSmith1 ülőhely, 5 000 alap-tracePlus 39 dollár ülőhelyenkéntEnterprise kiegészítő

Őszintén olvasva a Braintrust és a Phoenix nem ugyanazon a tengelyen versenyez: az egyik olyan csapatokra van árazva, akik értékelési folyamatot vesznek, a másik olyanokra, akik birtokolják az infrastruktúrát. A Langfuse a legközelebbi közvetlen helyettesítő, nagyjából harmadannyi belépő áron, a LangSmith pedig a természetes választás, ha az alkalmazás már LangGraphon ül, és a saját trace-formátumok fontosabbak a scorer-könyvtárnál.

A SaaS minden tarifában elérhető. A BYOC és a self-hostes deployolás, amelyek az adatot a saját felhőben tartják, Enterprise-t igényel. — Braintrust dokumentáció, tarifák és korlátok

Ítélet

A Braintrust megtérül, ha az értékelés rendszeres engineering-rituálé, és nem egyszeri script: a kísérletmodell, a scorer-könyvtár és a CI-akció egy olyan hurkot ad, amely alkatrészekből összerakni unalmas munka. Rossz választás olyan csapatnak, amelynek fő igénye egy dashboard mögötti traces tárolás, mert az 249 dolláros szokás adatszámlával.

  1. Válaszd, ha egy pull requestnek eval-regresszión kell buknia, és azt akarod, hogy a scorer-könyvtár már meglegyen.
  2. Válaszd, ha több szerep — fejlesztők, reviewerök, product manager — ugyanazokat a kísérleteket és dashboardokat szeretné; az ülőhelyek minden tarifában korlátlanok.
  3. Válaszd, ha a volumen kiszámítható: 5 GB és 50 000 pontszám havonta ismert mennyiség, a túlfutási árak pedig nyilvánosak.
  4. Ne válassz, ha a trace-eknek a saját fiókban kell maradniuk; a BYOC és a self-hosting Enterprise-szerződést kér.
  5. Ne válassz, ha a terhelés beszédes és korlátlan: a bevételnél mért mérés plusz pontszám-díj drágává tesz egy zajos agentet, az ülőhelyes eszközökkel ellentétben.

Források

  1. Braintrust árak: tarifák, egyenlegek és használati díjak
  2. Braintrust dokumentáció: tarifák és korlátok
  3. Braintrust dokumentáció: értékelési quickstart
  4. Braintrust dokumentáció: első lépések
  5. GitHub: Braintrust szervezet tárolói
  6. Arize Phoenix dokumentáció: self-hosting
  7. Langfuse árak: cloud tarifák és számlázható egységek
  8. LangChain árak: LangSmith tarifák

Gyakori kérdések

Mennyibe kerül a Braintrust?

A Starter 0 dollár, 10 dollár modell-egyenleggel, 1 GB feldolgozott adattal, 10 000 pontszámmal és 14 napos megőrzéssel, korlátlan felhasználóval, projekttel, datasettel, playgrounddal és kísérlettel. A Pro havi 249 dollár 100 dollár egyenlegért, 5 GB-ért, 50 000 pontszámért, 30 napos megőrzésért, egyedi chartokért, környezetekért, RBAC-ért és kiemelt támogatásért. Az Enterprise egyedi áras, és hozzáadja a BYOC-ot, a self-hostinget, a SAML vagy OIDC belépést, az audit naplózást, a BAA-t és a rendelkezésre állási SLA-t.

Nyílt forrássú a Braintrust?

A platform nem, az eszközök jelentős része igen. A Python, TypeScript, Go, Ruby, Java és C# SDK-k Apache-2.0 alatt futnak, az autoevals MIT alatt, körülbelül ezer GitHub-csillaggal, a braintrust-proxy MIT-tel, az agentbehavior szabvány pedig Apache-2.0 alatt. A szolgáltatás self-hostelt változata az Enterprise tarifáig nem létezik.

Mit számít pontszámnak az árlista?

A pontszám egy rögzített értékelési eredmény, legyen az LLM-as-a-judge hívás, autoevals scorer vagy saját kód, amely egy trace-hez vagy kísérletsorhoz kapcsolódik. A Starter havi 10 000-et ad, majd 2,50 dollárt kér ezerenként; a Pro 50 000-et ad, majd 1,50 dollárt ezerenként. A judge-alapú értékelés dataseten gyorsan felszaporodik, ezért a pontszám-limit gyakran hamarabb kifogy, mint maguk az adatok.

Braintrust vagy Arize Phoenix?

Braintrust, ha az értékelésnek a CI-ben a helye, és a platformdíj elfogadható: az Eval API, a scorer-könyvtár és az eval-action egyetlen integráció. Phoenix, ha a trace-ek nem hagyhatják el a saját infrastruktúrát, mert a Braintrust BYOC-ja és self-hostingje Enterprise-szerződést kér, míg a Phoenix az Elastic License 2.0 alatt szabadon self-hostelhető.

Pont erre van szükséged?

Írj a projektedről vagy a pozícióról – szívesen hallok felőled.