Tools/LLMOps & Evals
Braintrust im Test: Eval-first Observability mit hartem Zähler
Braintrust macht aus Produktions-Traces Datasets und gate-te Experimente. Was Starter und Pro wirklich enthalten, welches Teil quelloffen ist und wo Phoenix, Langfuse und LangSmith gewinnen.
- Art
- Evaluation platform
- Preis
- Free · from $249 per month
Balázs Csorba··10 Min. Lesezeit
- Evaluations
- Observability
- LLM-as-a-judge
- CI gates
- Tracing

Das Wichtigste in Kürze
- Starter ist wirklich nutzbar, aber klein: 1 GB verarbeitete Daten, 10.000 Scores und 14 Tage Aufbewahrung, danach Pro für 249 Dollar im Monat mit 5 GB, 50.000 Scores und 30 Tagen.
- Verarbeitete Daten werden bei der Aufnahme gezählt, Löschen reduziert die Rechnung also nicht, und Überlauf kostet 4 Dollar pro GB auf Starter und 3 Dollar pro GB auf Pro.
- Die Plattform ist proprietär, das Werkzeug offen: SDKs für sechs Sprachen unter Apache-2.0, autoevals unter MIT und die bt CLI unter Apache-2.0.
- BYOC und Self-Hosting brauchen Enterprise, und SAML-SSO, Audit-Logging, individuelle Retention und SOC-2-Atteste sind ebenfalls Enterprise-Zeilen.
- Zwischen 0 und 249 Dollar gibt es keine Stufe, wodurch Braintrust für ein Einzel-Projekt günstig und für ein Team, das nur Dashboards wollte, teuer wird.
Braintrust ist eine gehostete Plattform, die eine LLM-Anwendung instrumentiert, ihre Traces aufbewahrt und gegen Datasets bewertet, auf eine Weise, die sich wiederholt. Der Schwerpunkt liegt auf der Evaluation: ein Eval()-Aufruf, der eine Aufgabe über ein Dataset laufen lässt, die Ausgaben bewertet und jeden Lauf als vergleichbares Experiment speichert. Die Position dieses Tests: Braintrust ist das stärkste eval-first-Produkt seiner Klasse und das am strengsten gemessene seiner Konkurrenz — die Technik ist exzellent, und die Abrechnung belohnt Teams, die genau wissen, wie viele Daten sie senden wollen.
Er deckt drei Aufgaben ab, die sonst zwischen Werkzeugen aufgeteilt sind: Tracing in Produktion, Offline-Evaluation und das Gate dazwischen in der Continuous Integration. Arize Phoenix und Langfuse konkurrieren auf der Open-Source-Seite, LangSmith für Shops, die bereits auf LangGraph bauen. Er ersetzt meist etwas Schlimmeres: einen Satz Testfälle, der das Modell aufruft, Scores nach stdout schreibt und in der Woche gelöscht wird, in der er anfängt zu flackern.
Was es ist
Braintrust ist ein SaaS-Produkt von Braintrust Data, aufgebaut um drei Objekte: Logs, also Traces aus der Anwendung; Datasets, also Zeilen mit Eingabe und erwarteter Ausgabe; und Experimente, die eine Aufgabe über ein Dataset mit angehängten Scorern ausführen. Die Dokumentation beschreibt einen fünfstufigen Workflow — instrumentieren, beobachten, annotieren, evaluieren, ausliefern — und liefert SDKs für Python, TypeScript, Go, Ruby, Java und C#. Die Plattform selbst ist proprietär; ein großer Teil des Werkzeugs darum nicht.
- Lizenz: Plattform proprietär; SDKs Apache-2.0, autoevals MIT, braintrust-proxy MIT
- Instrumentierung: braintrust.auto_instrument() packt die Provider-Clienten, die im Prozess schon laufen, dazu eine bt CLI für Setup über einen Coding-Agenten
- Evaluation: Eval() über ein Dataset mit autoevals-Scorern, eigenem Code oder LLM-as-a-Judge
- Tarife: Starter für 0 Dollar, Pro für 249 Dollar im Monat und Enterprise auf Anfrage, alle mit unbegrenzten Nutzern, Projekten, Datasets und Experimenten
- Abrechnung: verarbeitete Daten in Gigabyte, Scores in Tausend, Modell-Credits in Dollar
- Deployment: SaaS auf Starter und Pro, BYOC und Self-Hosting nur auf Enterprise
- Extras: Playgrounds, Environments und eigene Charts ab Pro, dazu Loop, ein eingebauter Agent, der Scorer, Testfälle und Prompt-Iterationen schreibt
Diese letzte Zeile ist das Signal. Braintrust setzt voraus, dass die Plattform das Problem von jemand anderem ist und die Evaluation das eigene, und Teams, die diese Prämisse annehmen, bekommen eine sehr kurze Schleife vom Produktionsfehler zur Datasets-Zeile zum getagten Release. Teams, die das ganze System im eigenen Konto brauchen, merken, dass der Preis dieser Schleife ein Enterprise-Vertrag ist und nicht die Stufe für 249 Dollar.
So funktioniert es
Die Instrumentierung passiert im Prozess: braintrust.auto_instrument() patcht den Provider-Client, den die Anwendung ohnehin benutzt, sodass Spans mit Token-Kosten ankommen und kein Sidecar nötig ist. Alles landet in einem Projekt, und Logs, Datasets und Experimente teilen dieses Projekt — deshalb lässt sich ein Produktions-Trace in einen Testfall überführen, ohne einen Export.
Das Besondere ist der Vergleich. Ein Experiment ist ein Dauerrecord, und ein zweiter Lauf unter neuem Experimentnamen wird in der Oberfläche gegen den ersten gediffed. Das eigene Quickstart der Dokumentation lebt davon: Der erste Lauf landet bei ExactMatch fast bei null, weil das Modell mit einem Satz antwortet, der Prompt wird auf den nackten Titel gezogen, und das zweite Experiment weist den Zugewinn als Score-Delta statt als Eindruck aus.
Erste Schritte
Zwei Schlüssel und eine Datei: BRAINTRUST_API_KEY für die Plattform, der Provider-Schlüssel für das Modell und eine Python-Datei mit Daten, Task und Scorer. Der Ausschnitt unten ist die dokumentierte Quickstart-Form, ohne Wiederholung:
# BRAINTRUST_API_KEY und OPENAI_API_KEY als Umgebungsvariablen setzen
# pip install braintrust openai autoevals
import braintrust
from braintrust import Eval
from autoevals import ExactMatch
from openai import OpenAI
braintrust.auto_instrument() # protokolliert jeden Aufruf dieses Prozesses
client = OpenAI()
def task(input):
r = client.responses.create(
model="gpt-5-mini",
input=[{"role": "system", "content": "Name the film."},
{"role": "user", "content": input}],
)
return r.output_text
Eval(
"movie-matcher",
experiment_name="baseline-v1",
data=[{"input": "A detective hunts a killer through the seven deadly sins.",
"expected": "Se7en"}],
task=task,
scores=[ExactMatch],
)Aufrufen mit bt eval movie_matcher.py, und das Terminal druckt einen Link zum Experiment; reines Python funktioniert auch, weil die CLI nur den Einstiegspunkt kapselt. Diese Datei ist es auch, die ein Pull Request ausführt: die eval-action-GitHub-Workflow führt sie gegen main aus und lässt den Build fehlschlagen, wenn ein Score zurückgeht.
Was es kostet
Drei Tarife und kein Zwischenschritt: Die Preisliste nennt Starter mit 0 Dollar, Pro mit 249 Dollar im Monat und Enterprise auf Anfrage, mit unbegrenzten Nutzern, Projekten, Datasets, Playgrounds und Experimenten in allen drei. Der Unterschied ist die Messeinheit:
| Tarif | Preis | Verarbeitete Daten | Scores | Aufbewahrung |
|---|---|---|---|---|
| Starter | 0 Dollar | 1 GB, dann 4 Dollar pro GB | 10.000, dann 2,50 Dollar pro 1.000 | 14 Tage |
| Pro | 249 Dollar pro Monat | 5 GB, dann 3 Dollar pro GB | 50.000, dann 1,50 Dollar pro 1.000 | 30 Tage, dann 0,50 Dollar pro GB-Monat |
| Enterprise | Individuell | Individuell | Individuell | Individuell, bis 365 Tage |
Daneben laufen Modell-Credits: 10 Dollar pro Monat auf Starter und 100 Dollar auf Pro decken eingebaute Modelle und Plattformfunktionen wie Topics, danach gelten Token-Sätze. Der Sprung ist binär — ein Team, das 1 GB und 14 Tage überwächst, zahlt die vollen 249 Dollar, wobei die Dokumentation qualifizierten neuen Startup-Kunden sechs bis zwölf Monate Pro anbietet.
Was offen ist und was nicht
Diese Trennung verdient einen eigenen Abschnitt, denn der Satz Braintrust ist quelloffen ist ausgerechnet dort falsch, wo es zählt: Unterhalb von Enterprise kannst du die Plattform nicht selbst betreiben. Offen ist die Instrumentierung und das Bewertungswerkzeug darum herum.
- braintrust-sdk-python, -javascript, -go und -ruby: Apache-2.0
- autoevals: MIT, etwa tausend Sterne, die Scorer-Bibliothek, die das Quickstart importiert
- braintrust-proxy: MIT, ein Proxy vor dem Modellverkehr
- agentbehavior: Apache-2.0, ein offener Standard und ein Dataset für Agentenverhalten
- Die bt CLI und die Coding-Agenten-Plugins: Apache-2.0 oder MIT; die gehostete Webanwendung wird nicht veröffentlicht
Für ein Engineering-Team ist dieser Unterschied bis zur Beschaffung meist philosophisch, und dann ist er die ganze Diskussion. Er legt auch den Ausweg fest: Die SDKs lassen sich ohne Umbau der Anwendung auf ein anderes Backend zeigen, aber Datasets, Experimente und Dashboards liegen im Dienst von Braintrust, und ein geplanter Export nach S3 oder Google Cloud Storage ist eine Enterprise-Funktion.
Wo es hakt
Die erste Schwäche ist Rechnen. Zwischen 0 und 249 Dollar gibt es keine Stufe, die 1 GB und 14 Tage der Gratisstufe sind ein Demo-Budget für einen Produktions-Agenten, und das Scoring kommt obendrauf auf die Aufnahme, wer also einen Judge über jeden Produktions-Trace laufen lässt, erreicht das Score-Kontingent vor dem Datenvolumen. Die zweite ist das, was die unteren Tarife nicht tragen: SAML-Single-Sign-On, Audit-Logging, individuelle Retention, Export-Automatisierung, SOC-2-Attest und ein Business Associate Agreement sind Enterprise-Zeilen, Starter bleibt auf die Owner-Berechtigungsgruppe und einen Human-Review-Score pro Projekt begrenzt. Die dritte ist vertragliches Wandern: Die Dokumentation trägt noch einen Alttarif-Hinweis für Konten vor dem 16. März 2026, eine Evaluation unter den alten Bedingungen lohnt sich also erneut.
| Werkzeug | Gratisstufe | Erste bezahlte Stufe | Selbst hosten |
|---|---|---|---|
| Braintrust | 1 GB, 10.000 Scores, 14 Tage | Pro 249 Dollar pro Monat | Nur Enterprise |
| Arize Phoenix | Keine Limits bei lokaler Installation | AX Pro 50 Dollar pro Monat | Gratis unter ELv2 |
| Langfuse | 50.000 Einheiten, 30 Tage, 2 Nutzer | Core 29 Dollar pro Monat | Gratis, Docker Compose |
| LangSmith | 1 Sitzplatz, 5.000 Basis-Traces | Plus 39 Dollar pro Sitzplatz | Enterprise-Add-on |
Ehrlich gelesen konkurrieren Braintrust und Phoenix nicht auf derselben Achse: Der eine ist für Teams kalkuliert, die einen Evaluationsprozess kaufen, der andere für Teams, die die Infrastruktur besitzen. Langfuse ist der nächste direkte Ersatz zu etwa einem Drittel des Einstiegspreises, und LangSmith ist die natürliche Wahl, wenn die Anwendung bereits auf LangGraph sitzt und eigene Trace-Formate wichtiger sind als die Scorer-Bibliothek.
SaaS ist in allen Tarifen verfügbar. BYOC und selbst gehostete Deployments, die Daten in der eigenen Cloud halten, erfordern Enterprise. — Braintrust-Dokumentation, Tarife und Limits
Fazit
Braintrust bezahlt seinen Preis, wenn Evaluation ein wiederkehrendes Engineering-Ritual ist und kein Einmalskript: Das Experimentmodell, die Scorer-Bibliothek und die CI-Aktion bilden eine Schleife, die aus Einzelteilen zusammengebaut mühsam ist. Er ist die falsche Wahl für ein Team, dessen Hauptbedarf Trace-Speicher hinter einem Dashboard ist, denn das ist eine Gewohnheit für 249 Dollar mit einer Datenrechnung obendrauf.
- Wählen, wenn ein Pull Request an einer Eval-Regression scheitern soll und die Scorer-Bibliothek schon existieren soll.
- Wählen, wenn mehrere Rollen — Engineers, Reviewer, eine Product-Managerin — dieselben Experimente und Dashboards brauchen; Sitzplätze sind in allen Tarifen unbegrenzt.
- Wählen, wenn das Volumen planbar ist: 5 GB und 50.000 Scores im Monat sind eine bekannte Größe, und die Überlaufraten sind veröffentlicht.
- Nicht wählen, wenn Traces im eigenen Konto bleiben müssen; BYOC und Self-Hosting brauchen einen Enterprise-Vertrag.
- Nicht wählen, wenn die Last chattig und unbegrenzt ist: Messung bei der Aufnahme plus Gebühr pro Score macht einen lauten Agenten teuer, wie es Sitzplatz-Werkzeuge nicht tun.
Quellen
- Braintrust-Preise: Tarife, Credits und Nutzungspreise
- Braintrust-Dokumentation: Tarife und Limits
- Braintrust-Dokumentation: Evaluation-Quickstart
- Braintrust-Dokumentation: Erste Schritte
- GitHub: Braintrust-Organisation, Repository-Liste
- Arize-Phoenix-Dokumentation: Self-Hosting
- Langfuse-Preise: Cloud-Tarife und abrechenbare Einheiten
- LangChain-Preise: LangSmith-Tarife
Häufige Fragen
Wie viel kostet Braintrust?
Starter kostet 0 Dollar mit 10 Dollar Modell-Credits, 1 GB verarbeiteten Daten, 10.000 Scores und 14 Tagen Aufbewahrung, dazu unbegrenzt Nutzer, Projekte, Datasets, Playgrounds und Experimente. Pro kostet 249 Dollar im Monat für 100 Dollar Credits, 5 GB, 50.000 Scores, 30 Tage Aufbewahrung, eigene Charts, Environments, RBAC und priorisierten Support. Enterprise hat einen individuellen Preis und ergänzt BYOC, Self-Hosting, SAML- oder OIDC-Single-Sign-On, Audit-Logging, ein BAA und ein Verfügarkeits-SLA.
Ist Braintrust quelloffen?
Die Plattform nicht, ein großer Teil des Werkzeugs schon. Die SDKs für Python, TypeScript, Go, Ruby, Java und C# laufen unter Apache-2.0, autoevals unter MIT mit etwa tausend GitHub-Sternen, braintrust-proxy unter MIT und der agentbehavior-Standard unter Apache-2.0. Eine selbst gehostete Variante des Dienstes gibt es unterhalb des Enterprise-Tarifs nicht.
Was zählt in der Preisliste als Score?
Ein Score ist ein einzelnes aufgezeichnetes Evaluationsergebnis, ob es aus einem LLM-as-a-Judge-Aufruf, einem autoevals-Scorer oder eigenem Code stammt, gehängt an einen Trace oder eine Experimentzeile. Starter enthält 10.000 pro Monat und verlangt dann 2,50 Dollar pro Tausend, Pro enthält 50.000 und dann 1,50 Dollar pro Tausend. Judge-basiertes Scoring wächst über ein Dataset schnell, deshalb ist das Score-Kontingent oft vor dem Datenvolumen erschöpft.
Braintrust oder Arize Phoenix?
Braintrust, wenn Evaluation in CI gehört und eine Plattformgebühr akzeptabel ist: Eval-API, Scorer-Bibliothek und eval-action sind eine Integration. Phoenix, wenn Traces die eigene Infrastruktur nicht verlassen dürfen, denn BYOC und Self-Hosting bei Braintrust brauchen einen Enterprise-Vertrag, während Phoenix unter der Elastic License 2.0 frei self-hostbar ist.