Tools/LLMOps & Evals
Promptfoo: LLM-Evals und Red Teaming aus einer YAML-Datei
Promptfoo 2026: Evals und Red Team unter MIT-Lizenz, seit März 2026 im Besitz von OpenAI. Was es gut kann, wo der YAML-Ansatz bricht und was die Stufen kosten.
- Art
- Evaluation and red teaming
- Preis
- MIT · Enterprise paid
Balázs Csorba··10 Min. Lesezeit
- LLM evaluation
- Red teaming
- Prompt testing
- CI/CD

Das Wichtigste in Kürze
- Promptfoo ist eine MIT-lizenzierte CLI, die Qualitäts-Evals und Red Teaming aus einer YAML-Datei ausführt, und das Repository wurde mit der Ankündigung vom März 2026 Teil von OpenAI.
- Die Community-Stufe ist kostenlos und enthält 10.000 Red-Team-Probes pro Monat; Dashboards, eigene Plugins, SSO und API sind Enterprise-Zeilen auf Anfrage.
- Deklarative Testfälle sind der eigentliche Stärke, weil man eine Eval-Änderung als Diff lesen kann, ohne eine Python-Testsuite auszuführen.
- Modellbewertete Assertions wie llm-rubric sind nicht deterministisch und kosten pro Zelle einen Judge-Aufruf, deshalb misst die Pass-Rate den Bewerter so sehr wie den Prompt.
- Konfiguration und Testdaten portabel halten: MIT hält den Code forkbahr, aber ein Modellvergleichswerkzeug im Besitz eines Kandidaten ist ein Neutralitätsproblem, das die Lizenz nicht löst.
Promptfoo ist eine Open-Source-CLI und Bibliothek, die LLM-Evaluierungen und adversariales Red Teaming aus einer einzigen YAML-Datei ausführt. Position vorweg: Es ist der praktischste Weg, eine Prompt-Änderung oder einen Modellwechsel in einen Textdiff zu verwandeln, den CI rot machen kann, und seit März 2026 ist es auch ein Eval-Tool, das OpenAI gehört.
Es liegt zwischen einem Ordner mit Pytest-Skripten und einer gehosteten Evaluierungsplattform. Gegenüber LangSmith und Braintrust verzichtet man in der kostenlosen Stufe auf Dashboards, geteilte Historie und eine Team-Oberfläche, im Gegenzug läuft es auf dem eigenen Rechner, spricht direkt mit mehr als 60 Providern und braucht kein Konto. Gegenüber DeepEval tauscht man Python-Ausdrucksstärke gegen eine Konfigurationsdatei, die auch ohne Programmierkenntnisse im Review lesbar ist.
Was es ist
Zwei Produkte teilen sich ein Repository und ein Konfigurationsformat. Die Evaluierungsseite führt Prompts gegen Testfälle aus und bewertet die Ausgaben; die Red-Team-Seite greift ein konfiguriertes Ziel mit generierten Payloads an und dokumentiert die Funde als Schwachstellenbericht. Beides steuert promptfooconfig.yaml, beides läuft über dieselbe Kommandozeile und beides lässt sich in CI einbinden.
- CLI und Bibliothek unter MIT-Lizenz: Version 0.124.0 auf npm, etwa 25,8k Sterne und 2,4k Forks auf GitHub
- Deklarative Konfiguration: Prompts, Provider, Tests und Assertions in einer YAML-Datei
- Mehr als 60 Provider, darunter OpenAI, Anthropic, Google, Azure, Bedrock, Ollama und eigene HTTP-, Python- oder JavaScript-Endpunkte
- Zwei Befehle decken den Rest ab:
promptfoo evalfür Qualität,promptfoo redteam runfür Sicherheit - Die Community-Stufe ist kostenlos und enthält 10.000 Red-Team-Probes pro Monat; Enterprise und On-Premise sind auf Anfrage bepreist
- Der Anbieter nennt 350.000 Entwickler, 130.000 monatlich Aktive und mehr als 25 % der Fortune 500
- Der Seitenfuß trägt SOC-2- und ISO-27001-Siegel, und die Dokumentation liefert eine GitHub Action für CI
Was die kostenlose Stufe bewusst vorenthält, ist der gehostete Teil. Community hat kein Team-Dashboard, keine durchsuchbare Scan-Historie, kein kontinuierliches Monitoring und keine API; das sind Enterprise-Zeilen im Feature-Vergleich. Das Tool selbst bleibt ein lokaler Prozess, der Ihre Provider aufruft und Ergebnisse auf die Festplatte schreibt.
Wie es funktioniert
Eine Evaluierung ist eine Matrix. Die Konfiguration deklariert Prompts, Provider und Testfälle, der Runner bildet das Kreuzprodukt, schickt jede Zelle an jedes Modell und bewertet die Antwort gegen die an diese Zelle gebundenen Assertions. Assertions sind typisiert: Teilstring- und JSON-Schema-Prüfungen, Similarity-, Kosten- und Latenzschwellen sowie modellbewertete Prüfungen wie llm-rubric, die einen zusätzlichen Modellaufruf kosten.
Der Runner arbeitet parallel und cached abgeschlossene Aufrufe, deshalb liest ein erneuter Lauf nach kleiner Änderung überwiegend den Cache. Die Ergebnisse öffnen sich in einem lokalen Web-Viewer als seitliche Matrix, und die CLI kann JSON, YAML, CSV oder HTML schreiben. Die Exit-Codes sind die Integrationsstelle: promptfoo eval liefert 100, sobald mindestens ein Test fehlschlägt oder die Pass-Rate unter PROMPTFOO_PASS_RATE_THRESHOLD fällt, und 1 für jeden anderen Fehler.
Erste Schritte
Installation mit npm, brew oder pip, oder ohne Installation mit npx promptfoo@latest. Eine minimale Konfiguration, die zwei Modelle mit einem übersetzten Satz vergleicht:
# promptfooconfig.yaml: two models, one prompt, three checks
prompts:
- 'Translate this sentence into {{language}}: {{input}}'
providers:
- openai:gpt-6-sol
- openai:gpt-6-luna
tests:
- vars:
language: French
input: Hello world
assert:
- type: contains
value: 'Bonjour'
- type: llm-rubric
value: 'the translation is idiomatic and complete'
- type: cost
threshold: 0.01promptfoo eval führt jede Zelle dieser Matrix aus und gibt eine Pass-Rate aus; promptfoo view öffnet den seitlichen Vergleich im Browser. Das Flag -r tauscht Provider auf der Kommandozeile ohne Dateiänderung, so wie die Dokumentation einen Kandidaten gegen eine Basislinie prüft.
Red Teaming
promptfoo redteam init schreibt eine Red-Team-Konfiguration, redteam setup führt durch das Ziel, redteam run generiert und führt die Angriffe aus, und redteam report stellt die Funde dar. Die Dokumentation beschreibt jedes Plugin als ein trainiertes Modell, das Payloads für eine bestimmte Schwäche erzeugt, nicht als feste Wortliste.
- 157 Plugins in sechs Kategorien: Marke, Compliance und Recht, Datensatz, Sicherheit und Zugriffskontrolle, Trust und Safety sowie eigene Tests
- Sicherheits-Plugins ordnen den OWASP Top 10 for LLMs, der OWASP API Security Top 10 und MITRE ATLAS zu
- Compliance-Plugins ordnen NIST AI RMF, ISO/IEC 42001, DSGVO Artikel 5 und EU AI Act Artikel 5 zu
- Plugins werden pro Ziel in der Konfiguration gewählt, sodass sich ein Scan auf die Kategorien eingrenzen lässt, die eine Anwendung tatsächlich offenlegt
Framework-Zuordnungen
Für Teams, die Abdeckung statt eines Fundhaufens vorzeigen müssen, sind die Framework-IDs der nützliche Teil: nist:ai:measure:1.1, owasp:llm:01, iso:42001:privacy, gdpr:art5, eu:ai-act:art5. Ein nach diesen IDs gruppierter Bericht ist ein Abdeckungsargument, dem ein Prüfer folgen kann. Das ist Compliance-Mechanik, kein Compliance-Versprechen: Das Tool zeigt, welche Probes gelaufen sind, nicht, dass das Produkt die Regelung erfüllt.
Die Gratis-Obergrenze liegt bei 10.000 Probes pro Monat, und die Plugins, die zum Erzeugen und Bewerten von Payloads Inference brauchen, verbrauchen sie. Danach verweist die Preisübersicht für individuelle Limits auf Enterprise.
Wem gehört es jetzt
Am 9. März 2026 gab Promptfoo bekannt, dass eine Übernahme durch OpenAI vereinbart worden war. Der Beitrag versprach, dass das Produkt Open Source und MIT-lizenziert bleibt und das Team die Kunden weiter betreut, und nannte den Abschluss als von üblichen Bedingungen abhängig. Das Repository trägt jetzt die Zeile, dass Promptfoo Teil von OpenAI ist, und die Dokumentation wurde zuletzt am 7. Oktober 2026 aktualisiert.
Die Lizenz hält den Code forkbahr; sie hält die Roadmap nicht neutral. Das technische Bedenken ist eng und konkret: Ein Tool, dessen Aufgabe es ist zu beantworten, welches Modell ausgeliefert wird, gehört jetzt einem der Kandidaten, und seine Red-Team-, Guardrail- und Model-Security-Produkte stehen neben der Agentenplattform von OpenAI. Die MIT-Lizenz verhindert keinen Fork, aber sie verpflichtet das Unternehmen auch nicht, den Modellvergleich voranzubringen.
Wo es klemmt
Die erste Schwäche ist die Konfiguration selbst. Eine Datei mit einem Dutzend Prompts und vierzig Testfällen ist lesbar; eine mit vierhundert Fällen nicht, und alles, was eine Schleife, einen Join mit Produktionsdaten oder einen eigenen Parser braucht, führt in JavaScript-Assertion-Callbacks zurück, und damit ist die vermiedene Sprache zurück. Die zweite ist Bewertungsdrift: modellbewertete Assertions wandern zwischen Judge-Versionen, sodass eine grüne Suite amber wird, weil sich der Bewerter bewegt hat. Die dritte ist der Umfang, denn ein Security-Team, das einen Audit-Trail braucht, kauft Enterprise, egal wie gut die Evals sind.
| Tool | Oberfläche | Kostenlose Stufe | Kostenmodell |
|---|---|---|---|
| promptfoo | YAML und CLI, läuft lokal | Volle Evals, 10k Red-Team-Probes pro Monat | MIT; Enterprise auf Anfrage |
| LangSmith | Gehostete Plattform plus SDK | 1 Seat und 5k Base-Traces pro Monat | Plus ab 39 USD pro Seat und Monat |
| Braintrust | Gehostete Plattform plus SDK | Unbegrenzte Nutzer, 1 GB verarbeitete Daten | Pro mit 249 USD pro Monat |
| DeepEval | Python, Pytest-Stil | Das gesamte Framework | Apache 2.0; dahinter eine gehostete Plattform |
Das Geschäftsmodell ist ein kostenloser Harness mit einer bezahlten Kontrollebene. Kontinuierliches Monitoring, ein zentrales Dashboard, eigene Plugins, organisationsweite Angriffsprofile, SSO, gespeicherte Ziele, durchsuchbare Historie und die API sind Enterprise-Zeilen, und On-Premise-Deployment fügt ein zweites Angebot hinzu. Ein Solo-Entwickler braucht das nie; ein Team, das belegen muss, was es im letzten Quartal getestet hat, schon.
Fazit
Promptfoo ist ein guter lokaler Harness mit einem ernsthaften Sicherheitsteil. Es ist schnell, prüfbar und ehrlich in dem, was es misst, und die Red-Team-Abdeckung ist inzwischen konkret genug, um darüber zu streiten. Die offene Frage ist nicht die Lizenz, die MIT bleibt, sondern wer entscheidet, welche Modelle das Tool überhaupt bemerkt.
- Nehmen Sie es, wenn Sie Prompt- und Modelländerungen in CI als Textdiffs gateen wollen, mit einem Exit-Code, der den Job fehlschlagen lässt.
- Nehmen Sie es, wenn Sie vor dem Release adversariales Testen brauchen und es im selben Pull Request wie Ihre Qualitäts-Evals reviewed haben wollen.
- Verzichten Sie darauf, wenn Sie einen gehosteten Dienst brauchen, denn Dashboards, geteilte Historie, Scan-Suche und API gibt es nur in Enterprise.
- Verzichten Sie darauf, wenn Ihre Evaluierungslogik echten Code braucht, denn ein Python-Framework kostet weniger Aufwand als eine YAML-Datei, die sich in eine Schleife hineinzwängen muss.
- Halten Sie Ihre Testdaten portabel: Die Konfiguration ist MIT und forkbahr, aber ein Modellvergleichswerkzeug, das einem der Kandidaten gehört, ist ein Neutralitätsproblem, das die Lizenz nicht löst.
Eine Suite, die man im Pull Request lesen kann, schlägt ein Dashboard, durch das man klicken muss, und promptfoo ist auf dieser Prämisse gebaut. Der neue Eigentümer ist der Grund, Exit-Code und Testdaten portabel zu halten.
Quellen
- Promptfoo-Dokumentation: Intro
- Promptfoo-Preise: Stufenvergleich
- Promptfoo-Dokumentation: Erste Schritte
- Promptfoo-Dokumentation: Kommandozeile (Exit-Codes)
- Promptfoo-Dokumentation: Red-Team-Plugins
- Promptfoo-Dokumentation: Assertions und Metriken
- Promptfoo-Repository auf GitHub (MIT-Lizenz)
- Promptfoo-Blog: Promptfoo is joining OpenAI (9. März 2026)
Häufige Fragen
Ist promptfoo kostenlos nutzbar?
Ja. Die Community-Version ist MIT-lizenziert, läuft lokal und enthält alle Evaluierungsfunktionen sowie bis zu 10.000 Red-Team-Probes pro Monat. Enterprise ergänzt individuelle Probe-Limits, Team-Freigaben, kontinuierliches Monitoring, SSO und API-Zugang; Enterprise und On-Premise sind auf Anfrage bepreist.
Was ist der Unterschied zwischen promptfoo evals und Red Teaming?
Evals führen Ihre Prompts gegen Testfälle aus und bewerten die Ausgaben mit Assertions wie Teilstring-Prüfungen, KostenSchwellen oder llm-rubric. Das Red Teaming generiert adversarielle Payloads gegen ein konfiguriertes Ziel: promptfoo redteam run führt die Probes aus und promptfoo redteam report macht aus den Funden einen Schwachstellenbericht.
Welche Modell-Provider unterstützt promptfoo?
Die Dokumentation nennt mehr als 60 Provider, darunter OpenAI, Anthropic, Google, Azure, Bedrock und lokale Modelle über Ollama. Alles andere lässt sich über einen eigenen HTTP-, Python- oder JavaScript-Provider ansprechen, sodass sich die Konfigurationsdatei nicht ändern muss, wenn das Modell hinter einem Endpunkt wechselt.
Was ist nach der Übernahme durch OpenAI mit promptfoo passiert?
Promptfoo kündigte am 9. März 2026 an, dass eine Übernahme durch OpenAI vereinbart worden sei, und stellte klar, dass das Produkt Open Source und MIT-lizenziert bleibt und das Team die Kunden weiter betreut. Das Repository beschreibt promptfoo jetzt als Teil von OpenAI, und die Dokumentation wird weiter gepflegt.