Tools/LLMOps & Evals
Helicone: Observability, die im Request-Pfad sitzt
Helicone ist eine Apache-2.0-Plattform für LLM-Gateway und Observability. Was die Proxy-Architektur bringt, was sie kostet und wie der selbst gehostete Stack wirklich aussieht.
- Art
- LLM observability
- Preis
- Open core · from $20 per month
Balázs Csorba··10 Min. Lesezeit
- LLM observability
- OpenTelemetry
- Cost tracking
- Proxy
- Gateway
Das Wichtigste in Kürze
- Helicone ist Apache-2.0, hat rund 6.200 GitHub-Sterne und bündelt mehr als 100 Modelle hinter einem OpenAI-kompatiblen Endpunkt.
- Die Integration ist eine Zeile: eine andere Base-URL, oder der asynchrone OpenLLMetry-Pfad, wenn der Proxy nicht im kritischen Pfad liegen darf.
- Der Proxy bringt Caching, Rate-Limits, Fallbacks und Retries — der asynchrone Pfad verzichtet auf all das.
- Der Benchmark des Herstellers nennt im Mittel 2,21 Sekunden, direkt wie über den Proxy, gemessen mit 500 verschränkten Anfragen auf text-ada-001.
- Selbst hosten bedeutet fünf Komponenten — Web, Worker, Jawn, Supabase und ClickHouse plus MinIO — und Jawn proxyt nicht mehr, das Gateway ist ein eigener Dienst.
Helicone ist eine Apache-2.0-lizenzierte Plattform für LLM-Gateway und Observability, und die Position dieses Tests ist, dass die Architektur die ganze Geschichte erzählt: Helicone funktioniert, indem es sich zwischen Anwendung und Modellanbieter stellt. Das kauft für eine geänderte Zeile Code enorm viel Funktionalität und kostet einen Netzwerk-Hopf, eine Frage der Datenlokation und einen Anbieter im kritischen Pfad. Für Teams, die am Montag ein Dashboard brauchen, ist das ein guter Handel. Für Teams mit einem Latenzbudget in Millisekunden oder der Regel, dass Prompts das Netz nicht verlassen dürfen, ist es die falsche Form.
Es konkurriert in zwei Richtungen gleichzeitig. Gegenüber reinen Tracing-Backends wie Langfuse, Arize Phoenix und LangSmith gewinnt es beim Time-to-first-Dashboard und bei den Gateway-Funktionen, die am Proxy hängen, und verliert bei OpenTelemetry-nativer Instrumentierung und bei Evaluierungswerkzeugen. Gegenüber API-Routern wie LiteLLM oder OpenRouter ist es Observability zuerst, mit angehängtem Routing.
Was es ist
Zwei Produkte teilen sich eine Codebasis. Das Gateway ist ein OpenAI-kompatibler Endpunkt vor mehr als 100 Anbietern, erreicht durch Zeigen der Base-URL auf ai-gateway.helicone.ai. Die Observability-Plattform ist das, was die hindurchgehenden Anfragen aufzeichnet, in ClickHouse speichert und Fragen zu Kosten, Latenz, Sessions und Nutzern über ein Dashboard, eine SQL-ähnliche Abfragesprache namens HQL, Alerts, Reports und Webhooks beantwortet.
- Lizenz Apache 2.0, rund 6.200 GitHub-Sterne, und der Hinweis, dass Helicone 2025 zu Mintlify kam.
- Integration in einer Zeile: Base-URL ändern, oder einen asynchronen Log über die OpenLLMetry-Instrumentierung senden.
- Kostentracking aus Token-Verbrauch und einer öffentlichen Preisdatenbank mit mehr als 300 Modellen und Anbietern.
- Gateway-Funktionen im Request-Pfad: Edge-Cache, eigene Rate-Limits nach Anfragezahl, Kosten oder Property, und automatische Fallbacks.
- Operative Oberfläche: Sessions, Nutzermetriken, Custom Properties, Scores, Datensätze, Webhooks und ein MCP-Server über die Daten.
- Selbst hosten bedeutet fünf Dienste: ein Web-Frontend, einen Cloudflare Worker, den Jawn-Collector, Supabase und ClickHouse, dazu MinIO für die Inhalte.
Wie es funktioniert
Der Request-Pfad ist absichtlich dünn. Sofern kein Header eine Funktion aktiviert, leitet der Worker die Anfrage unverändert weiter und gibt die Antwort zurück; nach abgeschlossener Antwort schickt der Proxy Logs an Kafka für einen getrennten Dienst. Die Verfügbarkeitsdokumentation benennt die Absicht direkt: Jede Geschäftslogik fällt bei jedem Fehler auf reines Proxying zurück, sodass ein Fehler in der Observability zu einer funktionierenden Weiche heruntergestuft wird.
Eine Konsequenz ist klar zu sagen: Im Proxy-Modus passieren standardmässig jeder Prompt und jede Antwort ein fremdes Edge-Netz. Die selbst gehostete Instanz beseitigt das, entfernt aber gerade den Teil des Produkts, der Helicone leicht macht, denn ein selbst gehostetes Jawn proxy't nicht mehr — die Dokumentation hält fest, dass die Gateway-Routen entfernt wurden und das AI Gateway separat deployed werden muss.
Erste Schritte
Die gesamte Integration ist eine Base-URL. Das Beispiel schaltet zusätzlich den Edge-Cache ein, der schnellste Weg, die Plattform etwas sichtbar tun zu lassen: Die zweite identische Anfrage kommt aus dem KV-Speicher von Cloudflare statt vom Anbieter.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://ai-gateway.helicone.ai",
api_key=os.environ["HELICONE_API_KEY"],
default_headers={
"Helicone-Cache-Enabled": "true",
"Cache-Control": "max-age=3600",
"Helicone-Cache-Seed": "user-123",
"Helicone-Property-Env": "production",
},
)
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[{"role": "user", "content": "Summarise the refund policy."}],
)
print(response.choices[0].message.content)
# The next identical call returns Helicone-Cache: HIT and skips the provider.Der Cache-Key ist ein Hash aus Cache-Seed, Request-URL, dem gesamten Request-Body und den relevanten Headern, also ein exakter Treffer und kein semantischer: ein geändertes Wort oder eine andere Temperatur bedeutet einen Miss. Die Dauer geht von einer Stunde bis maximal 365 Tagen, Buckets bis 20 gespeicherte Antworten gibt es für nicht deterministische Prompts, und Helicone-Cache-Ignore-Keys nimmt Felder wie eine Request-ID oder einen provider-eigenen prompt_cache_key aus dem Schlüssel.
Proxy oder Async — bewusst wählen
Das ist die Entscheidung, die alles andere formt. Helicone dokumentiert beide Modi und ist ungewöhnlich offen über die Lücke zwischen ihnen, was die Wahl nachvollziehbar macht, auch wenn die Antwort selten bequem ist.
| Fähigkeit | Proxy-Modus | Async-Modus |
|---|---|---|
| Im kritischen Pfad | ja | nein |
| Gateway-Cache und Buckets | ja | nicht verfügbar |
| Eigene Rate-Limits | ja | nicht verfügbar |
| Automatische Retries | ja | nicht verfügbar |
| Automatisches Prompt-Formatting | ja | nicht verfügbar |
| Einrichtungsaufwand | eine Base-URL | mit OpenLLMetry instrumentieren |
| Sessions und Nutzermetriken | ja | ja |
| Custom Properties und Scores | ja | ja |
| Datenpfad | Prompts queren Helicones Edge | Prompts bleiben beim Anbieter |
| Wählen, wenn | Caching und Rate-Limits zählen | Propagationsverzögerung inakzeptabel ist |
Die vernünftige Schlussfolgerung: das sind zwei Produkte mit einem Namen. Der Proxy ist ein Gateway mit angehängter Analytics; die asynchrone Integration ist eine Logging-Bibliothek mit Web-Oberfläche. Wer den Proxy wählt, bekommt Caching, Rate-Limits und Fallbacks, die man sich sonst selbst bauen müsste, und zahlt mit einem zusätzlichen Hop und einer Datenlokationsentscheidung. Wer den asynchronen Weg wählt, behält Latenzbudget und Netzgrenze und baut das Gateway selbst oder verzichtet darauf.
Latenz und die Kosten eines Hops
Der veröffentlichte Benchmark ist klein, aber ungewöhnlich gut spezifiziert: 500 Anfragen mit eindeutigen Prompts, zwischen OpenAI und Helicone innerhalb desselben Ein-Sekunden-Fensters verschränkt, abwechselnd welcher Endpunkt zuerst gerufen wurde, mit maximalem Prompt-Kontext, auf text-ada-001, Round-Trip-Latenz für beide Mengen protokolliert.
| Statistik | OpenAI direkt (s) | Helicone über Proxy (s) |
|---|---|---|
| Mittelwert | 2.21 | 2.21 |
| Median | 2.87 | 2.90 |
| Standardabweichung | 1.12 | 1.12 |
| p90 | 3.27 | 3.29 |
| Maximum | 3.56 | 3.76 |
| Methode | 500 verschränkte Anfragen | gleiche Prompts, wechselnde Reihenfolge |
| Modell | text-ada-001 | text-ada-001, maximaler Kontext |
| Overhead | Basislinie | nur im Maximum sichtbar |
| Durchgeführt von | Hersteller | Hersteller |
Lies die Maximum-Zeile genau. 200 Millisekunden Unterschied auf einer dreieinhalbsekündigen Antwort sind 6 Prozent, und derselbe absolute Hop auf einen 300-Millisekunden-Modellaufruf oder einen 40-Millisekunden-Tool-Call würde ihn dominieren. Der Benchmark ist ausserdem ein Herstellertest auf einem abgelösten Modell; er zeigt, dass der Overhead begrenzt ist, nicht wie er für eine konkrete Last ausfällt.
Preise und welcher Zähler zählt
Der kostenlose Hobby-Plan umfasst 10.000 Anfragen pro Monat, einen Platz, eine Organisation, ein Gigabyte und sieben Tage Aufbewahrung. Pro kostet 79 $ pro Monat für unbegrenzte Plätze, eine Organisation, Alerts, Reports, HQL, einen Monat Aufbewahrung und 1.000 eingelesene Logs pro Minute. Team kostet 799 $ für fünf Organisationen, SOC 2 und HIPAA, drei Monate Aufbewahrung und 15.000 Logs pro Minute. Enterprise ergänzt unbegrenzte Organisationen, SAML SSO und On-Prem-Betrieb.
Die Zahl, auf die es ankommt, preist niemand prominent: die Ingestion. Ein Hobby-Workspace liest 10 Logs pro Minute ein, Pro 1.000, Team 15.000. Eine Produktionsanwendung kann pro Nutzeranfrage mehrere Logs erzeugen — ein Modellaufruf, ein Retrieval-Schritt, ein Tool-Call —, also erschöpft ein mässig beschäftigtes Produkt die Pro-Grenze, bevor es das Anfragekontingent erschöpft, und der Plan, der das behebt, kostet 799 $ pro Monat. Speicher wird über dem ersten Gigabyte separat abgerechnet.
| PlanPreisAnfragenIngestionAufbewahrung | Hobby0 $10.000 pro Monat10 Logs pro Minute7 Tage | Pro79 $ pro Monatnutzungsabhängig1.000 Logs pro Minute1 Monat | Team799 $ pro Monatnutzungsabhängig15.000 Logs pro Minute3 Monate | Enterpriseindividuellnutzungsabhängig30.000 Logs pro Minuteunbegrenzt |
|---|---|---|---|---|
| Plätze | 1 | unbegrenzt | unbegrenzt | unbegrenzt |
| Organisationen | 1 | 1 | 5 | unbegrenzt |
| Wichtige Extras | nichts | HQL, Alerts, Reports | SOC 2, HIPAA | SAML SSO, On-Prem |
| Selbst hosten | gratis | gratis | gratis | Helm-Chart auf Anfrage |
Den ganzen Stack selbst hosten
Das Apache-2.0-Repository enthält die komplette Plattform, und das README benennt die Betriebsform direkt: fünf Dienste, und eine manuelle Installation, die es als nicht empfohlen zugunsten der Docker-Compose-Datei oder eines Enterprise-Helm-Charts markiert.
- Web: das Dashboard-Frontend, eine Next.js-Anwendung.
- Worker: der Proxy, in der gehosteten Version als Cloudflare Workers betrieben.
- Jawn: der Log-Sammler, ein Express-Dienst mit Tsoa-generierten Routen.
- Supabase: die Anwendungsdatenbank und die Authentifizierung.
- ClickHouse: der Analytics-Speicher, der Kosten- und Latenzfragen beantwortet.
- MinIO: Objektspeicher für Request- und Response-Bodies.
Wo es schwächelt
Die ehrlichen Schwächen sind strukturell, nicht kosmetisch. Helicones Datenmodell ist auf Anfragen ausgelegt, die durch sein Gateway gehen; ein Team, das bereits mit OpenTelemetry-Spans traced, muss sich zwischen zwei Instrumentierungsstacks entscheiden. Die Evaluierungsgeschichte ist im Vergleich zu Langfuse oder Braintrust dünn: Prompts, Playground und Scores gibt es, aber keinen ersten-Klasse-Experiments-Workflow. Und die Eigentumsfrage ist offen — Helicone kam 2025 zu Mintlify, was das Open-Core-Lock-in-Risiko nimmt, aber die übliche Anbieterabhängigkeit hinzufügt.
| Helicone | Langfuse | Arize Phoenix | |
|---|---|---|---|
| Lizenz | Apache 2.0 | MIT-Kern, Enterprise-Extras | Elastic License 2.0 |
| Instrumentierung | Proxy oder OpenLLMetry | OpenTelemetry-nativ | OpenInference auf OTel |
| Stärkste Seite | Einstieg in einer Zeile, Gateway-Funktionen | Evaluierung und Prompt-Workflows | lokale, notebook-artige Evaluierung |
| Schwächste Seite | nicht OTel-nativ fürs Tracing | schwerer zu starten als eine Base-URL | ELv2 ist nicht permissiv |
| Gateway-Funktionen | Cache, Limits, Fallbacks | nein | nein |
| Selbst hosten | Apache 2.0, fünf Dienste | MIT, Docker Compose oder Helm | ELv2, selbst hostbar |
| Kostentracking | eingebaut | pro Modell konfigurierbar | separates Produkt |
| Am besten geeignet | Teams mit Sichtbarkeit diese Woche | Teams, die evaluieren | Teams, die lokal traced und evaluiert |
Langfuse ist MIT-lizenziert, wurde im Januar 2026 von ClickHouse übernommen, wobei Lizenz und Selbst hosten ausdrücklich unverändert bleiben, und speichert Traces ebenfalls in ClickHouse; ist die permissivere Lizenz mit echter Evaluierungsstrecke das entscheidende Kriterium, ist es das stärkere Werkzeug. Arize Phoenix baut auf OpenInference-Konventionen und läuft überall, auch air-gapped, aber die Elastic License 2.0 ist keine permissive. Helicones Argument ist nicht Funktionsumfang, sondern Zeit: Der Weg von einem Repository zu einem Kosten-Dashboard, gemessen in Anfragen pro Nutzer, ist eine Zeile Code.
Urteil
Helicone ist das richtige Werkzeug, wenn niemand sagen kann, was die LLM-Kosten letzten Dienstag waren, und das falsche, wenn Latenz, Datenlokation oder Tracing-Standards die Architektur entscheiden. Seine Ingenieursarbeit ist unspektakulär im besten Sinn: Der Proxy ist dünn, Logs gehen nach der Antwort raus, und das Produkt ist vom Gateway bis zum Dashboard Apache-2.0. Die Schwäche ist ebenso klar: Es will dein Gateway sein, und alles, was es bequem macht, ist eine Folge davon.
- Nimm es, wenn das Team Kosten, Latenz und Fehler pro Anfrage innerhalb einer Woche braucht und noch keinen Tracing-Stack hat.
- Nimm es, wenn Edge-Cache, eigene Rate-Limits und automatische Fallbacks im Request-Pfad den Aufpreis wert sind.
- Nimm den asynchronen OpenLLMetry-Pfad, wenn du Helicones Analytics ohne Proxy-Hop willst, und akzeptiere den Verzicht auf Gateway-Funktionen.
- Lass es weg, wenn Prompts das Netz nicht verlassen dürfen oder der Proxy-Hop ein hartes Latenzbudget auffrisst.
- Lass es weg, wenn die Plattform bereits mit OpenTelemetry traced und ein zweites Instrumentierungsmodell die Daten fragmentieren würde.
- Denk neu darüber nach oberhalb von rund 1.000 eingelesenen Logs pro Minute oder wenn das Anfragekontingent so gross ist, dass der Nutzungszähler eine eigene Budgetzeile braucht.
Quellen
Häufige Fragen
Ist Helicone quelloffen?
Ja, unter Apache 2.0. Das Repository mit rund 6.200 Sternen enthält Gateway, Log-Sammler und Dashboard. Die gehosteten Stufen ergänzen Funktionen wie SOC-2-Berichte, HIPAA-Optionen, SAML SSO und On-Prem-Verträge.
Verursacht der Helicone-Proxy Latenz?
Der eigene Benchmark des Herstellers schickt 500 verschränkte Anfragen direkt an OpenAI und über Helicone und meldet im Mittel 2,21 Sekunden in beiden Fällen, p90 3,27 gegenüber 3,29 Sekunden. Das ist ein Herstellertest auf text-ada-001, also ein Hinweis, dass der Overhead klein ist, keine Zahl zum Planen.
Kann Helicone aus dem kritischen Pfad bleiben?
Ja, über die asynchrone OpenLLMetry-Integration, die nach der Antwort loggt und nie zwischen Anwendung und Anbieter steht. Die Dokumentation benennt den Preis ausdrücklich: der asynchrone Pfad verliert Bucket-Caching, eigene Rate-Limits und Retries.
Wie funktioniert Helicone mit mehreren Anbietern?
Das AI Gateway stellt mehr als 100 Modelle über einen OpenAI-kompatiblen Endpunkt bereit und übersetzt die Anfrage in das Format des jeweiligen Anbieters. Mit Credits hält Helicone die Anbieterschlüssel und nennt null Aufschlag; eigene Schlüssel sind auch möglich.