[{"data":1,"prerenderedAt":621},["ShallowReactive",2],{"tool-braintrust-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":21,"sources":31,"cover":56,"og":57,"expertise":58,"locales":59,"lang":61,"title":63,"description":64,"coverAlt":65,"url":24,"pricing":66,"kind":67,"metaTitle":68,"takeaways":69,"faq":75,"toc":88,"blocks":113,"others":390},"braintrust","2026-07-07",10,"llmops",[9,10,11,12,13],"Evaluations","Observability","LLM-as-a-judge","CI gates","Tracing",[4,15,16,17,18,19,20],"braintrust pricing","braintrust eval","autoevals library","braintrust vs langfuse","llm evaluation platform","eval driven development",[22,25,28],{"name":23,"url":24},"Braintrust","https:\u002F\u002Fwww.braintrust.dev",{"name":26,"url":27},"Continuous integration","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FContinuous_integration",{"name":29,"url":30},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[32,35,38,41,44,47,50,53],{"title":33,"url":34},"Braintrust pricing: plans, credits and usage rates","https:\u002F\u002Fwww.braintrust.dev\u002Fpricing",{"title":36,"url":37},"Braintrust documentation: plans and limits","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fplans-and-limits",{"title":39,"url":40},"Braintrust documentation: evaluation quickstart","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fevaluation-quickstart",{"title":42,"url":43},"Braintrust documentation: get started","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs",{"title":45,"url":46},"GitHub: Braintrust organisation repositories","https:\u002F\u002Fgithub.com\u002Forgs\u002Fbraintrustdata\u002Frepositories",{"title":48,"url":49},"Arize Phoenix documentation: self-hosting","https:\u002F\u002Farize.com\u002Fdocs\u002Fphoenix\u002Fself-hosting",{"title":51,"url":52},"Langfuse pricing: cloud plans and billable units","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":54,"url":55},"LangChain pricing: LangSmith plans","https:\u002F\u002Fwww.langchain.com\u002Fpricing","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fog.jpg","ai-engineer",[60,61,62],"en","de","hu","Braintrust im Test: Eval-first Observability mit hartem Zähler","Braintrust macht aus Produktions-Traces Datasets und gate-te Experimente. Was Starter und Pro wirklich enthalten, welches Teil quelloffen ist und wo Phoenix, Langfuse und LangSmith gewinnen.","Eine Schleife von instrumentierten Anwendungs-Logs in ein Dataset, ein Experiment mit Scorern und einen Vergleich, der den Pull Request sperrt, bevor die Änderung zurück in die Anwendung geht.","Free · from $249 per month","Evaluation platform","Braintrust: Eval-first Observability · Balázs Csorba",[70,71,72,73,74],"Starter ist wirklich nutzbar, aber klein: 1 GB verarbeitete Daten, 10.000 Scores und 14 Tage Aufbewahrung, danach Pro für 249 Dollar im Monat mit 5 GB, 50.000 Scores und 30 Tagen.","Verarbeitete Daten werden bei der Aufnahme gezählt, Löschen reduziert die Rechnung also nicht, und Überlauf kostet 4 Dollar pro GB auf Starter und 3 Dollar pro GB auf Pro.","Die Plattform ist proprietär, das Werkzeug offen: SDKs für sechs Sprachen unter Apache-2.0, autoevals unter MIT und die bt CLI unter Apache-2.0.","BYOC und Self-Hosting brauchen Enterprise, und SAML-SSO, Audit-Logging, individuelle Retention und SOC-2-Atteste sind ebenfalls Enterprise-Zeilen.","Zwischen 0 und 249 Dollar gibt es keine Stufe, wodurch Braintrust für ein Einzel-Projekt günstig und für ein Team, das nur Dashboards wollte, teuer wird.",[76,79,82,85],{"q":77,"a":78},"Wie viel kostet Braintrust?","Starter kostet 0 Dollar mit 10 Dollar Modell-Credits, 1 GB verarbeiteten Daten, 10.000 Scores und 14 Tagen Aufbewahrung, dazu unbegrenzt Nutzer, Projekte, Datasets, Playgrounds und Experimente. Pro kostet 249 Dollar im Monat für 100 Dollar Credits, 5 GB, 50.000 Scores, 30 Tage Aufbewahrung, eigene Charts, Environments, RBAC und priorisierten Support. Enterprise hat einen individuellen Preis und ergänzt BYOC, Self-Hosting, SAML- oder OIDC-Single-Sign-On, Audit-Logging, ein BAA und ein Verfügarkeits-SLA.",{"q":80,"a":81},"Ist Braintrust quelloffen?","Die Plattform nicht, ein großer Teil des Werkzeugs schon. Die SDKs für Python, TypeScript, Go, Ruby, Java und C# laufen unter Apache-2.0, autoevals unter MIT mit etwa tausend GitHub-Sternen, braintrust-proxy unter MIT und der agentbehavior-Standard unter Apache-2.0. Eine selbst gehostete Variante des Dienstes gibt es unterhalb des Enterprise-Tarifs nicht.",{"q":83,"a":84},"Was zählt in der Preisliste als Score?","Ein Score ist ein einzelnes aufgezeichnetes Evaluationsergebnis, ob es aus einem LLM-as-a-Judge-Aufruf, einem autoevals-Scorer oder eigenem Code stammt, gehängt an einen Trace oder eine Experimentzeile. Starter enthält 10.000 pro Monat und verlangt dann 2,50 Dollar pro Tausend, Pro enthält 50.000 und dann 1,50 Dollar pro Tausend. Judge-basiertes Scoring wächst über ein Dataset schnell, deshalb ist das Score-Kontingent oft vor dem Datenvolumen erschöpft.",{"q":86,"a":87},"Braintrust oder Arize Phoenix?","Braintrust, wenn Evaluation in CI gehört und eine Plattformgebühr akzeptabel ist: Eval-API, Scorer-Bibliothek und eval-action sind eine Integration. Phoenix, wenn Traces die eigene Infrastruktur nicht verlassen dürfen, denn BYOC und Self-Hosting bei Braintrust brauchen einen Enterprise-Vertrag, während Phoenix unter der Elastic License 2.0 frei self-hostbar ist.",[89,92,95,98,101,104,107,110],{"id":90,"title":91},"what-it-is","Was es ist",{"id":93,"title":94},"how-it-works","So funktioniert es",{"id":96,"title":97},"getting-started","Erste Schritte",{"id":99,"title":100},"pricing","Was es kostet",{"id":102,"title":103},"open-or-closed","Was offen ist und was nicht",{"id":105,"title":106},"where-it-shingles","Wo es hakt",{"id":108,"title":109},"verdict","Fazit",{"id":111,"title":112},"sources","Quellen",[114,123,126,129,132,150,153,154,161,170,173,174,181,183,190,197,198,201,246,249,255,256,259,271,274,275,278,324,327,332,333,336,349,354,355],{"type":115,"content":116},"paragraph",[117,118,122],"Braintrust ist eine gehostete Plattform, die eine LLM-Anwendung instrumentiert, ihre Traces aufbewahrt und gegen Datasets bewertet, auf eine Weise, die sich wiederholt. Der Schwerpunkt liegt auf der Evaluation: ein ",{"tag":119,"children":120},"code",[121],"Eval()","-Aufruf, der eine Aufgabe über ein Dataset laufen lässt, die Ausgaben bewertet und jeden Lauf als vergleichbares Experiment speichert. Die Position dieses Tests: Braintrust ist das stärkste eval-first-Produkt seiner Klasse und das am strengsten gemessene seiner Konkurrenz — die Technik ist exzellent, und die Abrechnung belohnt Teams, die genau wissen, wie viele Daten sie senden wollen.",{"type":115,"content":124},[125],"Er deckt drei Aufgaben ab, die sonst zwischen Werkzeugen aufgeteilt sind: Tracing in Produktion, Offline-Evaluation und das Gate dazwischen in der Continuous Integration. Arize Phoenix und Langfuse konkurrieren auf der Open-Source-Seite, LangSmith für Shops, die bereits auf LangGraph bauen. Er ersetzt meist etwas Schlimmeres: einen Satz Testfälle, der das Modell aufruft, Scores nach stdout schreibt und in der Woche gelöscht wird, in der er anfängt zu flackern.",{"type":127,"level":128,"id":90,"text":91},"heading",2,{"type":115,"content":130},[131],"Braintrust ist ein SaaS-Produkt von Braintrust Data, aufgebaut um drei Objekte: Logs, also Traces aus der Anwendung; Datasets, also Zeilen mit Eingabe und erwarteter Ausgabe; und Experimente, die eine Aufgabe über ein Dataset mit angehängten Scorern ausführen. Die Dokumentation beschreibt einen fünfstufigen Workflow — instrumentieren, beobachten, annotieren, evaluieren, ausliefern — und liefert SDKs für Python, TypeScript, Go, Ruby, Java und C#. Die Plattform selbst ist proprietär; ein großer Teil des Werkzeugs darum nicht.",{"type":133,"ordered":134,"items":135},"list",false,[136,138,140,142,144,146,148],[137],"Lizenz: Plattform proprietär; SDKs Apache-2.0, autoevals MIT, braintrust-proxy MIT",[139],"Instrumentierung: braintrust.auto_instrument() packt die Provider-Clienten, die im Prozess schon laufen, dazu eine bt CLI für Setup über einen Coding-Agenten",[141],"Evaluation: Eval() über ein Dataset mit autoevals-Scorern, eigenem Code oder LLM-as-a-Judge",[143],"Tarife: Starter für 0 Dollar, Pro für 249 Dollar im Monat und Enterprise auf Anfrage, alle mit unbegrenzten Nutzern, Projekten, Datasets und Experimenten",[145],"Abrechnung: verarbeitete Daten in Gigabyte, Scores in Tausend, Modell-Credits in Dollar",[147],"Deployment: SaaS auf Starter und Pro, BYOC und Self-Hosting nur auf Enterprise",[149],"Extras: Playgrounds, Environments und eigene Charts ab Pro, dazu Loop, ein eingebauter Agent, der Scorer, Testfälle und Prompt-Iterationen schreibt",{"type":115,"content":151},[152],"Diese letzte Zeile ist das Signal. Braintrust setzt voraus, dass die Plattform das Problem von jemand anderem ist und die Evaluation das eigene, und Teams, die diese Prämisse annehmen, bekommen eine sehr kurze Schleife vom Produktionsfehler zur Datasets-Zeile zum getagten Release. Teams, die das ganze System im eigenen Konto brauchen, merken, dass der Preis dieser Schleife ein Enterprise-Vertrag ist und nicht die Stufe für 249 Dollar.",{"type":127,"level":128,"id":93,"text":94},{"type":115,"content":155},[156,157,160],"Die Instrumentierung passiert im Prozess: ",{"tag":119,"children":158},[159],"braintrust.auto_instrument()"," patcht den Provider-Client, den die Anwendung ohnehin benutzt, sodass Spans mit Token-Kosten ankommen und kein Sidecar nötig ist. Alles landet in einem Projekt, und Logs, Datasets und Experimente teilen dieses Projekt — deshalb lässt sich ein Produktions-Trace in einen Testfall überführen, ohne einen Export.",{"type":162,"attrs":163,"inner":167,"caption":168},"diagram",{"viewBox":164,"role":165,"aria-labelledby":166},"0 0 715 300","img","d1-bt-t d1-bt-d","\u003Ctitle id='d1-bt-t'>Die Braintrust-Schleife vom Trace bis zum getagten Release\u003C\u002Ftitle>\u003Cdesc id='d1-bt-d'>Eine instrumentierte Anwendung schreibt Traces und ihre Kosten in ein Projekt. Produktions-Traces werden zu Zeilen eines Datasets, ein Experiment läuft eine Aufgabe über dieses Dataset mit angehängten Scorern, und der Vergleich zweier Läufe sperrt den Pull Request, bevor die Änderung zurück in die Anwendung geht.\u003C\u002Fdesc>\u003Ctext x='20' y='28' class='d-title'>Eine Schleife, drei Artefakte\u003C\u002Ftext>\u003Ctext x='695' y='28' text-anchor='end' class='d-label'>Projektumfang\u003C\u002Ftext>\u003Crect x='20' y='50' width='150' height='64' rx='10' class='d-box'\u002F>\u003Ctext x='95' y='78' text-anchor='middle' class='d-text'>App + SDK\u003C\u002Ftext>\u003Ctext x='95' y='100' text-anchor='middle' class='d-small'>auto_instrument\u003C\u002Ftext>\u003Crect x='195' y='50' width='150' height='64' rx='10' class='d-accent'\u002F>\u003Ctext x='270' y='78' text-anchor='middle' class='d-text'>Logs\u003C\u002Ftext>\u003Ctext x='270' y='100' text-anchor='middle' class='d-small'>Traces, Kosten\u003C\u002Ftext>\u003Crect x='370' y='50' width='150' height='64' rx='10' class='d-sky'\u002F>\u003Ctext x='445' y='78' text-anchor='middle' class='d-text'>Dataset\u003C\u002Ftext>\u003Ctext x='445' y='100' text-anchor='middle' class='d-small'>Zeilen aus Traces\u003C\u002Ftext>\u003Crect x='545' y='50' width='150' height='64' rx='10' class='d-gold'\u002F>\u003Ctext x='620' y='78' text-anchor='middle' class='d-text'>Experiment\u003C\u002Ftext>\u003Ctext x='620' y='100' text-anchor='middle' class='d-small'>Task + Scorers\u003C\u002Ftext>\u003Cpath d='M172 82 H193' class='d-line' marker-end='url(#ah-bt)'\u002F>\u003Cpath d='M347 82 H368' class='d-line' marker-end='url(#ah-bt)'\u002F>\u003Cpath d='M522 82 H543' class='d-line' marker-end='url(#ah-bt)'\u002F>\u003Crect x='250' y='160' width='220' height='64' rx='10' class='d-mint'\u002F>\u003Ctext x='360' y='188' text-anchor='middle' class='d-text'>Läufe vergleichen\u003C\u002Ftext>\u003Ctext x='360' y='210' text-anchor='middle' class='d-small'>Pull Request sperren\u003C\u002Ftext>\u003Cpath d='M620 114 V192 H472' class='d-line' marker-end='url(#ah-bt)'\u002F>\u003Cpath d='M250 192 H95 V116' class='d-line' marker-end='url(#ah-bt)'\u002F>\u003Cdefs>\u003Cmarker id='ah-bt' viewBox='0 0 10 10' refX='9' refY='5' markerWidth='7' markerHeight='7' orient='auto-start-reverse'>\u003Cpath d='M0 0L10 5L0 10z' class='d-head'\u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Ctext x='20' y='256' class='d-small'>Scorer sind autoevals, eigener Code oder ein Judge-Aufruf, der pro Zeile eine Modellanfrage kostet.\u003C\u002Ftext>\u003Ctext x='20' y='282' class='d-label'>Jedes Experiment ist ein Dauerrecord: der zweite Lauf wird gegen den ersten diffed\u003C\u002Ftext>",[169],"Traces, Datasets und Experimente teilen ein Projekt, deshalb wird aus einem Produktionsfehler ein Testfall, ohne Export.",{"type":115,"content":171},[172],"Das Besondere ist der Vergleich. Ein Experiment ist ein Dauerrecord, und ein zweiter Lauf unter neuem Experimentnamen wird in der Oberfläche gegen den ersten gediffed. Das eigene Quickstart der Dokumentation lebt davon: Der erste Lauf landet bei ExactMatch fast bei null, weil das Modell mit einem Satz antwortet, der Prompt wird auf den nackten Titel gezogen, und das zweite Experiment weist den Zugewinn als Score-Delta statt als Eindruck aus.",{"type":127,"level":128,"id":96,"text":97},{"type":115,"content":175},[176,177,180],"Zwei Schlüssel und eine Datei: ",{"tag":119,"children":178},[179],"BRAINTRUST_API_KEY"," für die Plattform, der Provider-Schlüssel für das Modell und eine Python-Datei mit Daten, Task und Scorer. Der Ausschnitt unten ist die dokumentierte Quickstart-Form, ohne Wiederholung:",{"type":119,"code":182},"# BRAINTRUST_API_KEY und OPENAI_API_KEY als Umgebungsvariablen setzen\n# pip install braintrust openai autoevals\nimport braintrust\nfrom braintrust import Eval\nfrom autoevals import ExactMatch\nfrom openai import OpenAI\n\nbraintrust.auto_instrument()  # protokolliert jeden Aufruf dieses Prozesses\nclient = OpenAI()\n\ndef task(input):\n    r = client.responses.create(\n        model=\"gpt-5-mini\",\n        input=[{\"role\": \"system\", \"content\": \"Name the film.\"},\n               {\"role\": \"user\", \"content\": input}],\n    )\n    return r.output_text\n\nEval(\n    \"movie-matcher\",\n    experiment_name=\"baseline-v1\",\n    data=[{\"input\": \"A detective hunts a killer through the seven deadly sins.\",\n           \"expected\": \"Se7en\"}],\n    task=task,\n    scores=[ExactMatch],\n)",{"type":115,"content":184},[185,186,189],"Aufrufen mit ",{"tag":119,"children":187},[188],"bt eval movie_matcher.py",", und das Terminal druckt einen Link zum Experiment; reines Python funktioniert auch, weil die CLI nur den Einstiegspunkt kapselt. Diese Datei ist es auch, die ein Pull Request ausführt: die eval-action-GitHub-Workflow führt sie gegen main aus und lässt den Build fehlschlagen, wenn ein Score zurückgeht.",{"type":191,"variant":192,"title":193,"body":194},"callout","warn","Bewerten wird abgerechnet, nicht nur gerechnet",[195],[196],"Jeder Scorer-Aufruf, der einen Score speichert, zählt gegen das Monatskontingent — 10.000 auf Starter, 50.000 auf Pro —, und judge-basiertes Scoring ist enthalten, mit einer Modellanfrage pro Zeile. Scorer sollten genau die Fehler adressieren, die zählen, denn ein vollständiger Lauf über ein großes Dataset kann mehr kosten als der Trace, der ihn erzeugt hat.",{"type":127,"level":128,"id":99,"text":100},{"type":115,"content":199},[200],"Drei Tarife und kein Zwischenschritt: Die Preisliste nennt Starter mit 0 Dollar, Pro mit 249 Dollar im Monat und Enterprise auf Anfrage, mit unbegrenzten Nutzern, Projekten, Datasets, Playgrounds und Experimenten in allen drei. Der Unterschied ist die Messeinheit:",{"type":202,"head":203,"rows":214},"table",[204,206,208,210,212],[205],"Tarif",[207],"Preis",[209],"Verarbeitete Daten",[211],"Scores",[213],"Aufbewahrung",[215,226,237],[216,218,220,222,224],[217],"Starter",[219],"0 Dollar",[221],"1 GB, dann 4 Dollar pro GB",[223],"10.000, dann 2,50 Dollar pro 1.000",[225],"14 Tage",[227,229,231,233,235],[228],"Pro",[230],"249 Dollar pro Monat",[232],"5 GB, dann 3 Dollar pro GB",[234],"50.000, dann 1,50 Dollar pro 1.000",[236],"30 Tage, dann 0,50 Dollar pro GB-Monat",[238,240,242,243,244],[239],"Enterprise",[241],"Individuell",[241],[241],[245],"Individuell, bis 365 Tage",{"type":115,"content":247},[248],"Daneben laufen Modell-Credits: 10 Dollar pro Monat auf Starter und 100 Dollar auf Pro decken eingebaute Modelle und Plattformfunktionen wie Topics, danach gelten Token-Sätze. Der Sprung ist binär — ein Team, das 1 GB und 14 Tage überwächst, zahlt die vollen 249 Dollar, wobei die Dokumentation qualifizierten neuen Startup-Kunden sechs bis zwölf Monate Pro anbietet.",{"type":191,"variant":250,"title":251,"body":252},"note","Verarbeitete Daten zählen bei der Aufnahme",[253],[254],"Die Tarifseite sagt klar: Verarbeitete Daten messen Bytes bei der Aufnahme, und Löschen reduziert sie nicht — das Zusammenschrumpfen lauter Traces verkleinert also nie rückwirkend eine Rechnung. Experimentergebnisse werden auf allen Tarifen bis zu 365 Tage aufbewahrt, Logs und Playground-Daten folgen dem 14- oder 30-Tage-Fenster, und das ist zugleich der Horizont, den die unteren Tarife überhaupt abfragen können.",{"type":127,"level":128,"id":102,"text":103},{"type":115,"content":257},[258],"Diese Trennung verdient einen eigenen Abschnitt, denn der Satz Braintrust ist quelloffen ist ausgerechnet dort falsch, wo es zählt: Unterhalb von Enterprise kannst du die Plattform nicht selbst betreiben. Offen ist die Instrumentierung und das Bewertungswerkzeug darum herum.",{"type":133,"ordered":134,"items":260},[261,263,265,267,269],[262],"braintrust-sdk-python, -javascript, -go und -ruby: Apache-2.0",[264],"autoevals: MIT, etwa tausend Sterne, die Scorer-Bibliothek, die das Quickstart importiert",[266],"braintrust-proxy: MIT, ein Proxy vor dem Modellverkehr",[268],"agentbehavior: Apache-2.0, ein offener Standard und ein Dataset für Agentenverhalten",[270],"Die bt CLI und die Coding-Agenten-Plugins: Apache-2.0 oder MIT; die gehostete Webanwendung wird nicht veröffentlicht",{"type":115,"content":272},[273],"Für ein Engineering-Team ist dieser Unterschied bis zur Beschaffung meist philosophisch, und dann ist er die ganze Diskussion. Er legt auch den Ausweg fest: Die SDKs lassen sich ohne Umbau der Anwendung auf ein anderes Backend zeigen, aber Datasets, Experimente und Dashboards liegen im Dienst von Braintrust, und ein geplanter Export nach S3 oder Google Cloud Storage ist eine Enterprise-Funktion.",{"type":127,"level":128,"id":105,"text":106},{"type":115,"content":276},[277],"Die erste Schwäche ist Rechnen. Zwischen 0 und 249 Dollar gibt es keine Stufe, die 1 GB und 14 Tage der Gratisstufe sind ein Demo-Budget für einen Produktions-Agenten, und das Scoring kommt obendrauf auf die Aufnahme, wer also einen Judge über jeden Produktions-Trace laufen lässt, erreicht das Score-Kontingent vor dem Datenvolumen. Die zweite ist das, was die unteren Tarife nicht tragen: SAML-Single-Sign-On, Audit-Logging, individuelle Retention, Export-Automatisierung, SOC-2-Attest und ein Business Associate Agreement sind Enterprise-Zeilen, Starter bleibt auf die Owner-Berechtigungsgruppe und einen Human-Review-Score pro Projekt begrenzt. Die dritte ist vertragliches Wandern: Die Dokumentation trägt noch einen Alttarif-Hinweis für Konten vor dem 16. März 2026, eine Evaluation unter den alten Bedingungen lohnt sich also erneut.",{"type":202,"head":279,"rows":288},[280,282,284,286],[281],"Werkzeug",[283],"Gratisstufe",[285],"Erste bezahlte Stufe",[287],"Selbst hosten",[289,297,306,315],[290,291,293,295],[23],[292],"1 GB, 10.000 Scores, 14 Tage",[294],"Pro 249 Dollar pro Monat",[296],"Nur Enterprise",[298,300,302,304],[299],"Arize Phoenix",[301],"Keine Limits bei lokaler Installation",[303],"AX Pro 50 Dollar pro Monat",[305],"Gratis unter ELv2",[307,309,311,313],[308],"Langfuse",[310],"50.000 Einheiten, 30 Tage, 2 Nutzer",[312],"Core 29 Dollar pro Monat",[314],"Gratis, Docker Compose",[316,318,320,322],[317],"LangSmith",[319],"1 Sitzplatz, 5.000 Basis-Traces",[321],"Plus 39 Dollar pro Sitzplatz",[323],"Enterprise-Add-on",{"type":115,"content":325},[326],"Ehrlich gelesen konkurrieren Braintrust und Phoenix nicht auf derselben Achse: Der eine ist für Teams kalkuliert, die einen Evaluationsprozess kaufen, der andere für Teams, die die Infrastruktur besitzen. Langfuse ist der nächste direkte Ersatz zu etwa einem Drittel des Einstiegspreises, und LangSmith ist die natürliche Wahl, wenn die Anwendung bereits auf LangGraph sitzt und eigene Trace-Formate wichtiger sind als die Scorer-Bibliothek.",{"type":328,"content":329},"quote",[330,331],"SaaS ist in allen Tarifen verfügbar. BYOC und selbst gehostete Deployments, die Daten in der eigenen Cloud halten, erfordern Enterprise."," — Braintrust-Dokumentation, Tarife und Limits",{"type":127,"level":128,"id":108,"text":109},{"type":115,"content":334},[335],"Braintrust bezahlt seinen Preis, wenn Evaluation ein wiederkehrendes Engineering-Ritual ist und kein Einmalskript: Das Experimentmodell, die Scorer-Bibliothek und die CI-Aktion bilden eine Schleife, die aus Einzelteilen zusammengebaut mühsam ist. Er ist die falsche Wahl für ein Team, dessen Hauptbedarf Trace-Speicher hinter einem Dashboard ist, denn das ist eine Gewohnheit für 249 Dollar mit einer Datenrechnung obendrauf.",{"type":133,"ordered":337,"items":338},true,[339,341,343,345,347],[340],"Wählen, wenn ein Pull Request an einer Eval-Regression scheitern soll und die Scorer-Bibliothek schon existieren soll.",[342],"Wählen, wenn mehrere Rollen — Engineers, Reviewer, eine Product-Managerin — dieselben Experimente und Dashboards brauchen; Sitzplätze sind in allen Tarifen unbegrenzt.",[344],"Wählen, wenn das Volumen planbar ist: 5 GB und 50.000 Scores im Monat sind eine bekannte Größe, und die Überlaufraten sind veröffentlicht.",[346],"Nicht wählen, wenn Traces im eigenen Konto bleiben müssen; BYOC und Self-Hosting brauchen einen Enterprise-Vertrag.",[348],"Nicht wählen, wenn die Last chattig und unbegrenzt ist: Messung bei der Aufnahme plus Gebühr pro Score macht einen lauten Agenten teuer, wie es Sitzplatz-Werkzeuge nicht tun.",{"type":191,"variant":250,"title":350,"body":351},"Fazit in einem Satz",[352],[353],"Für den Preis der halbtägigen Aufmerksamkeit eines Engineers im Monat liefert Braintrust die Evaluationsdisziplin, die die meisten Teams vorhaben und nie fertig werden. Kaufe es für die Evaluationsschleife, nicht für das Trace-Speichern; für Speichern allein macht selbst gehostetes Phoenix oder ein Langfuse-Tarif für 29 Dollar denselben Job zu einem Bruchteil der Kosten.",{"type":127,"level":128,"id":111,"text":112},{"type":133,"ordered":337,"items":356},[357,362,366,370,374,378,382,386],[358],{"tag":359,"href":34,"children":360},"a",[361],"Braintrust-Preise: Tarife, Credits und Nutzungspreise",[363],{"tag":359,"href":37,"children":364},[365],"Braintrust-Dokumentation: Tarife und Limits",[367],{"tag":359,"href":40,"children":368},[369],"Braintrust-Dokumentation: Evaluation-Quickstart",[371],{"tag":359,"href":43,"children":372},[373],"Braintrust-Dokumentation: Erste Schritte",[375],{"tag":359,"href":46,"children":376},[377],"GitHub: Braintrust-Organisation, Repository-Liste",[379],{"tag":359,"href":49,"children":380},[381],"Arize-Phoenix-Dokumentation: Self-Hosting",[383],{"tag":359,"href":52,"children":384},[385],"Langfuse-Preise: Cloud-Tarife und abrechenbare Einheiten",[387],{"tag":359,"href":55,"children":388},[389],"LangChain-Preise: LangSmith-Tarife",[391,440,522,578],{"slug":392,"published":393,"minutes":394,"category":7,"tags":395,"keywords":401,"about":408,"sources":412,"cover":431,"og":432,"expertise":58,"locales":433,"lang":61,"title":434,"description":435,"coverAlt":436,"url":437,"pricing":438,"kind":439},"ollama","2026-09-29",11,[396,397,398,399,400],"Local inference","Open models","llama.cpp","GGUF","Model serving",[392,402,403,404,405,406,407],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[409],{"name":410,"url":411},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[413,416,419,422,425,428],{"title":414,"url":415},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":417,"url":418},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":420,"url":421},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":423,"url":424},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":426,"url":427},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":429,"url":430},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg",[60,61,62],"Ollama im Test: der freundliche Weg zu offenen Modellen","Ollama liefert offene Modelle über eine HTTP-API auf eigener Hardware aus. Was es gut macht, wo der Durchsatz zu kurz kommt, was die MIT-Lizenz nicht abdeckt.","Abstrakte Titelgrafik für den Ollama-Test","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime",{"slug":441,"published":442,"minutes":394,"category":7,"tags":443,"keywords":448,"about":456,"sources":463,"cover":515,"og":516,"expertise":58,"locales":517,"lang":61,"title":518,"description":519,"coverAlt":520,"url":459,"pricing":521,"kind":444},"portkey","2026-09-28",[444,445,446,10,447],"LLM gateway","Guardrails","Routing","Cost control",[449,450,451,452,453,454,455],"portkey ai gateway","portkey vs litellm","llm gateway comparison","llm gateway latency overhead","llm guardrails gateway","self-hosted llm gateway","portkey pricing",[457,460],{"name":458,"url":459},"Portkey","https:\u002F\u002Fportkey.ai",{"name":461,"url":462},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[464,467,470,473,476,479,482,485,488,491,494,497,500,503,506,509,512],{"title":465,"url":466},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":468,"url":469},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":471,"url":472},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":474,"url":475},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":477,"url":478},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":480,"url":481},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":483,"url":484},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":486,"url":487},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":489,"url":490},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":492,"url":493},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":495,"url":496},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":498,"url":499},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":501,"url":502},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":504,"url":505},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":507,"url":508},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":510,"url":511},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing",{"title":513,"url":514},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[60,61,62],"Portkey: ein LLM-Gateway für die Produktion, geprüft auf Routing, Guardrails und Kosten","Portkey bündelt Retries, Fallbacks, Cache, Guardrails und Kostenkontrolle hinter einer OpenAI-kompatiblen Schnittstelle. Was die Konfiguration gut löst und was das Gateway an Latenz kostet.","Ein Requestweg von der Anwendung durch das Portkey-Gateway zu drei Modellanbietern, darunter das Guardrail-Ergebnis und das Protokoll.","Free · from $49 per month",{"slug":523,"published":524,"minutes":6,"category":7,"tags":525,"keywords":530,"about":538,"sources":547,"cover":571,"og":572,"expertise":58,"locales":573,"lang":61,"title":574,"description":575,"coverAlt":576,"url":540,"pricing":577,"kind":526},"langfuse","2026-08-13",[526,13,527,528,529],"LLM observability","OpenTelemetry","Self-hosting","Evaluation",[523,531,532,533,534,535,536,537],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[539,541,543,546],{"name":308,"url":540},"https:\u002F\u002Flangfuse.com",{"name":527,"url":542},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":544,"url":545},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":29,"url":30},[548,551,554,556,559,562,565,568],{"title":549,"url":550},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":552,"url":553},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":555,"url":52},"Langfuse pricing: cloud plans, billable units and worked examples",{"title":557,"url":558},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":560,"url":561},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":563,"url":564},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":566,"url":567},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":569,"url":570},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[60,61,62],"Langfuse-Test: Tracing, Prompts und Evals selbst gehostet","Langfuse legt LLM-Traces, Prompt-Versionen und Experimente auf eine MIT-lizenzierte Plattform. Was das Selbsthosten wirklich kostet, wie die Einheitspreise rechnen und wo es verliert.","Eine Pipeline vom gebündelten Application-Event über den Langfuse-Web-Container und den Object Storage in ClickHouse, mit Redis und PostgreSQL daneben.","MIT · paid from $59 per month",{"slug":579,"published":580,"minutes":6,"category":7,"tags":581,"keywords":586,"about":593,"sources":597,"cover":613,"og":614,"expertise":58,"locales":615,"lang":61,"title":616,"description":617,"coverAlt":618,"url":619,"pricing":620,"kind":444},"openrouter","2026-07-23",[444,582,583,584,585],"Model routing","Fallbacks","OpenAI-compatible","Pay per token",[579,587,451,588,589,590,591,592],"openrouter vs litellm","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[594],{"name":595,"url":596},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[598,601,602,605,608,611],{"title":599,"url":600},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":513,"url":514},{"title":603,"url":604},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":606,"url":607},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":609,"url":610},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":612,"url":596},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg",[60,61,62],"OpenRouter: ein API-Schlüssel vor jedem Modell im Katalog","OpenRouter packt 500+ Modelle von 80+ Anbietern hinter einen OpenAI-kompatiblen Endpunkt, mit Fallbacks und Weiterverrechnung zum Listenpreis. Kosten und Schwächen.","Anfragepfad durch OpenRouter: Client, Router, mögliche Anbieter, Fallback-Liste und das Modell, das tatsächlich antwortet.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription",1791383550748]