Tools/LLMOps & Evals

Helicone: Observability, die im Request-Pfad sitzt

Helicone ist eine Apache-2.0-Plattform für LLM-Gateway und Observability. Was die Proxy-Architektur bringt, was sie kostet und wie der selbst gehostete Stack wirklich aussieht.

Art
LLM observability
Preis
Open core · from $20 per month

··10 Min. Lesezeit

  • LLM observability
  • OpenTelemetry
  • Cost tracking
  • Proxy
  • Gateway
Titelbild: Helicone, eine Plattform für LLM-Observability, mit dem Request-Pfad von der Anwendung über den Edge-Proxy zum Anbieter und zurück in den Log-Speicher

Das Wichtigste in Kürze

  • Helicone ist Apache-2.0, hat rund 6.200 GitHub-Sterne und bündelt mehr als 100 Modelle hinter einem OpenAI-kompatiblen Endpunkt.
  • Die Integration ist eine Zeile: eine andere Base-URL, oder der asynchrone OpenLLMetry-Pfad, wenn der Proxy nicht im kritischen Pfad liegen darf.
  • Der Proxy bringt Caching, Rate-Limits, Fallbacks und Retries — der asynchrone Pfad verzichtet auf all das.
  • Der Benchmark des Herstellers nennt im Mittel 2,21 Sekunden, direkt wie über den Proxy, gemessen mit 500 verschränkten Anfragen auf text-ada-001.
  • Selbst hosten bedeutet fünf Komponenten — Web, Worker, Jawn, Supabase und ClickHouse plus MinIO — und Jawn proxyt nicht mehr, das Gateway ist ein eigener Dienst.

Helicone ist eine Apache-2.0-lizenzierte Plattform für LLM-Gateway und Observability, und die Position dieses Tests ist, dass die Architektur die ganze Geschichte erzählt: Helicone funktioniert, indem es sich zwischen Anwendung und Modellanbieter stellt. Das kauft für eine geänderte Zeile Code enorm viel Funktionalität und kostet einen Netzwerk-Hopf, eine Frage der Datenlokation und einen Anbieter im kritischen Pfad. Für Teams, die am Montag ein Dashboard brauchen, ist das ein guter Handel. Für Teams mit einem Latenzbudget in Millisekunden oder der Regel, dass Prompts das Netz nicht verlassen dürfen, ist es die falsche Form.

Es konkurriert in zwei Richtungen gleichzeitig. Gegenüber reinen Tracing-Backends wie Langfuse, Arize Phoenix und LangSmith gewinnt es beim Time-to-first-Dashboard und bei den Gateway-Funktionen, die am Proxy hängen, und verliert bei OpenTelemetry-nativer Instrumentierung und bei Evaluierungswerkzeugen. Gegenüber API-Routern wie LiteLLM oder OpenRouter ist es Observability zuerst, mit angehängtem Routing.

Was es ist

Zwei Produkte teilen sich eine Codebasis. Das Gateway ist ein OpenAI-kompatibler Endpunkt vor mehr als 100 Anbietern, erreicht durch Zeigen der Base-URL auf ai-gateway.helicone.ai. Die Observability-Plattform ist das, was die hindurchgehenden Anfragen aufzeichnet, in ClickHouse speichert und Fragen zu Kosten, Latenz, Sessions und Nutzern über ein Dashboard, eine SQL-ähnliche Abfragesprache namens HQL, Alerts, Reports und Webhooks beantwortet.

  • Lizenz Apache 2.0, rund 6.200 GitHub-Sterne, und der Hinweis, dass Helicone 2025 zu Mintlify kam.
  • Integration in einer Zeile: Base-URL ändern, oder einen asynchronen Log über die OpenLLMetry-Instrumentierung senden.
  • Kostentracking aus Token-Verbrauch und einer öffentlichen Preisdatenbank mit mehr als 300 Modellen und Anbietern.
  • Gateway-Funktionen im Request-Pfad: Edge-Cache, eigene Rate-Limits nach Anfragezahl, Kosten oder Property, und automatische Fallbacks.
  • Operative Oberfläche: Sessions, Nutzermetriken, Custom Properties, Scores, Datensätze, Webhooks und ein MCP-Server über die Daten.
  • Selbst hosten bedeutet fünf Dienste: ein Web-Frontend, einen Cloudflare Worker, den Jawn-Collector, Supabase und ClickHouse, dazu MinIO für die Inhalte.

Wie es funktioniert

Der Request-Pfad ist absichtlich dünn. Sofern kein Header eine Funktion aktiviert, leitet der Worker die Anfrage unverändert weiter und gibt die Antwort zurück; nach abgeschlossener Antwort schickt der Proxy Logs an Kafka für einen getrennten Dienst. Die Verfügbarkeitsdokumentation benennt die Absicht direkt: Jede Geschäftslogik fällt bei jedem Fehler auf reines Proxying zurück, sodass ein Fehler in der Observability zu einer funktionierenden Weiche heruntergestuft wird.

Der Helicone-Request-PfadObere Zeile: Die Anwendung sendet eine Chat-Completion über das OpenAI-SDK an das Helicone-Gateway, das auf Cloudflare Workers läuft und entweder einen Cache-Treffer ausliefert oder an den Anbieter weiterleitet und die Antwort zurückgibt. Untere Zeile: Nach abgeschlossener Antwort gehen Logs an Kafka und weiter in ClickHouse für Analysen und MinIO für Request- und Response-Bodies, wo Dashboard, HQL, Alerts und Reports lesen. Darunter ein Balken: Der asynchrone Pfad umgeht das Gateway komplett und loggt nach der Antwort aus der Anwendung selbst, und gibt dafür Caching, Rate-Limits und Retries auf. Bei jedem Fehler fällt der Worker auf reines Proxying zurück, sodass Observability zu einer Weiche degradiert.Der Helicone-Request-Pfaderst Proxy, dann LogsDeine AppOpenAI-SDK, eine ZeileAnfrageGatewayCloudflare Workers, EdgeweiterAnbieter100+ Modelle, eine APIAntworterst nach der AntwortLogs an KafkaEdge-CacheRate-Limits, FallbacksClickHouse für AnalysenMinIO für Request-BodiesDashboard, HQL, Alerts, Reports, MCPAsync-Pfad ohne Gateway: Log nach der Antwort, ohne Caching, Rate-Limits und RetriesBei Fehler fällt der Worker auf reines Proxying zurück, Observability degradiert zur Weiche
Nur im Proxy-Modus liegt das Gateway im kritischen Pfad, das Logging passiert in beiden Modi erst nach der Antwort.

Eine Konsequenz ist klar zu sagen: Im Proxy-Modus passieren standardmässig jeder Prompt und jede Antwort ein fremdes Edge-Netz. Die selbst gehostete Instanz beseitigt das, entfernt aber gerade den Teil des Produkts, der Helicone leicht macht, denn ein selbst gehostetes Jawn proxy't nicht mehr — die Dokumentation hält fest, dass die Gateway-Routen entfernt wurden und das AI Gateway separat deployed werden muss.

Erste Schritte

Die gesamte Integration ist eine Base-URL. Das Beispiel schaltet zusätzlich den Edge-Cache ein, der schnellste Weg, die Plattform etwas sichtbar tun zu lassen: Die zweite identische Anfrage kommt aus dem KV-Speicher von Cloudflare statt vom Anbieter.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://ai-gateway.helicone.ai",
    api_key=os.environ["HELICONE_API_KEY"],
    default_headers={
        "Helicone-Cache-Enabled": "true",
        "Cache-Control": "max-age=3600",
        "Helicone-Cache-Seed": "user-123",
        "Helicone-Property-Env": "production",
    },
)

response = client.chat.completions.create(
    model="gpt-4o-mini",
    messages=[{"role": "user", "content": "Summarise the refund policy."}],
)

print(response.choices[0].message.content)
# The next identical call returns Helicone-Cache: HIT and skips the provider.

Der Cache-Key ist ein Hash aus Cache-Seed, Request-URL, dem gesamten Request-Body und den relevanten Headern, also ein exakter Treffer und kein semantischer: ein geändertes Wort oder eine andere Temperatur bedeutet einen Miss. Die Dauer geht von einer Stunde bis maximal 365 Tagen, Buckets bis 20 gespeicherte Antworten gibt es für nicht deterministische Prompts, und Helicone-Cache-Ignore-Keys nimmt Felder wie eine Request-ID oder einen provider-eigenen prompt_cache_key aus dem Schlüssel.

Proxy oder Async — bewusst wählen

Das ist die Entscheidung, die alles andere formt. Helicone dokumentiert beide Modi und ist ungewöhnlich offen über die Lücke zwischen ihnen, was die Wahl nachvollziehbar macht, auch wenn die Antwort selten bequem ist.

FähigkeitProxy-ModusAsync-Modus
Im kritischen Pfadjanein
Gateway-Cache und Bucketsjanicht verfügbar
Eigene Rate-Limitsjanicht verfügbar
Automatische Retriesjanicht verfügbar
Automatisches Prompt-Formattingjanicht verfügbar
Einrichtungsaufwandeine Base-URLmit OpenLLMetry instrumentieren
Sessions und Nutzermetrikenjaja
Custom Properties und Scoresjaja
DatenpfadPrompts queren Helicones EdgePrompts bleiben beim Anbieter
Wählen, wennCaching und Rate-Limits zählenPropagationsverzögerung inakzeptabel ist

Die vernünftige Schlussfolgerung: das sind zwei Produkte mit einem Namen. Der Proxy ist ein Gateway mit angehängter Analytics; die asynchrone Integration ist eine Logging-Bibliothek mit Web-Oberfläche. Wer den Proxy wählt, bekommt Caching, Rate-Limits und Fallbacks, die man sich sonst selbst bauen müsste, und zahlt mit einem zusätzlichen Hop und einer Datenlokationsentscheidung. Wer den asynchronen Weg wählt, behält Latenzbudget und Netzgrenze und baut das Gateway selbst oder verzichtet darauf.

Latenz und die Kosten eines Hops

Der veröffentlichte Benchmark ist klein, aber ungewöhnlich gut spezifiziert: 500 Anfragen mit eindeutigen Prompts, zwischen OpenAI und Helicone innerhalb desselben Ein-Sekunden-Fensters verschränkt, abwechselnd welcher Endpunkt zuerst gerufen wurde, mit maximalem Prompt-Kontext, auf text-ada-001, Round-Trip-Latenz für beide Mengen protokolliert.

StatistikOpenAI direkt (s)Helicone über Proxy (s)
Mittelwert2.212.21
Median2.872.90
Standardabweichung1.121.12
p903.273.29
Maximum3.563.76
Methode500 verschränkte Anfragengleiche Prompts, wechselnde Reihenfolge
Modelltext-ada-001text-ada-001, maximaler Kontext
OverheadBasislinienur im Maximum sichtbar
Durchgeführt vonHerstellerHersteller

Lies die Maximum-Zeile genau. 200 Millisekunden Unterschied auf einer dreieinhalbsekündigen Antwort sind 6 Prozent, und derselbe absolute Hop auf einen 300-Millisekunden-Modellaufruf oder einen 40-Millisekunden-Tool-Call würde ihn dominieren. Der Benchmark ist ausserdem ein Herstellertest auf einem abgelösten Modell; er zeigt, dass der Overhead begrenzt ist, nicht wie er für eine konkrete Last ausfällt.

Preise und welcher Zähler zählt

Der kostenlose Hobby-Plan umfasst 10.000 Anfragen pro Monat, einen Platz, eine Organisation, ein Gigabyte und sieben Tage Aufbewahrung. Pro kostet 79 $ pro Monat für unbegrenzte Plätze, eine Organisation, Alerts, Reports, HQL, einen Monat Aufbewahrung und 1.000 eingelesene Logs pro Minute. Team kostet 799 $ für fünf Organisationen, SOC 2 und HIPAA, drei Monate Aufbewahrung und 15.000 Logs pro Minute. Enterprise ergänzt unbegrenzte Organisationen, SAML SSO und On-Prem-Betrieb.

Die Zahl, auf die es ankommt, preist niemand prominent: die Ingestion. Ein Hobby-Workspace liest 10 Logs pro Minute ein, Pro 1.000, Team 15.000. Eine Produktionsanwendung kann pro Nutzeranfrage mehrere Logs erzeugen — ein Modellaufruf, ein Retrieval-Schritt, ein Tool-Call —, also erschöpft ein mässig beschäftigtes Produkt die Pro-Grenze, bevor es das Anfragekontingent erschöpft, und der Plan, der das behebt, kostet 799 $ pro Monat. Speicher wird über dem ersten Gigabyte separat abgerechnet.

PlanPreisAnfragenIngestionAufbewahrungHobby0 $10.000 pro Monat10 Logs pro Minute7 TagePro79 $ pro Monatnutzungsabhängig1.000 Logs pro Minute1 MonatTeam799 $ pro Monatnutzungsabhängig15.000 Logs pro Minute3 MonateEnterpriseindividuellnutzungsabhängig30.000 Logs pro Minuteunbegrenzt
Plätze1unbegrenztunbegrenztunbegrenzt
Organisationen115unbegrenzt
Wichtige ExtrasnichtsHQL, Alerts, ReportsSOC 2, HIPAASAML SSO, On-Prem
Selbst hostengratisgratisgratisHelm-Chart auf Anfrage

Den ganzen Stack selbst hosten

Das Apache-2.0-Repository enthält die komplette Plattform, und das README benennt die Betriebsform direkt: fünf Dienste, und eine manuelle Installation, die es als nicht empfohlen zugunsten der Docker-Compose-Datei oder eines Enterprise-Helm-Charts markiert.

  • Web: das Dashboard-Frontend, eine Next.js-Anwendung.
  • Worker: der Proxy, in der gehosteten Version als Cloudflare Workers betrieben.
  • Jawn: der Log-Sammler, ein Express-Dienst mit Tsoa-generierten Routen.
  • Supabase: die Anwendungsdatenbank und die Authentifizierung.
  • ClickHouse: der Analytics-Speicher, der Kosten- und Latenzfragen beantwortet.
  • MinIO: Objektspeicher für Request- und Response-Bodies.

Wo es schwächelt

Die ehrlichen Schwächen sind strukturell, nicht kosmetisch. Helicones Datenmodell ist auf Anfragen ausgelegt, die durch sein Gateway gehen; ein Team, das bereits mit OpenTelemetry-Spans traced, muss sich zwischen zwei Instrumentierungsstacks entscheiden. Die Evaluierungsgeschichte ist im Vergleich zu Langfuse oder Braintrust dünn: Prompts, Playground und Scores gibt es, aber keinen ersten-Klasse-Experiments-Workflow. Und die Eigentumsfrage ist offen — Helicone kam 2025 zu Mintlify, was das Open-Core-Lock-in-Risiko nimmt, aber die übliche Anbieterabhängigkeit hinzufügt.

HeliconeLangfuseArize Phoenix
LizenzApache 2.0MIT-Kern, Enterprise-ExtrasElastic License 2.0
InstrumentierungProxy oder OpenLLMetryOpenTelemetry-nativOpenInference auf OTel
Stärkste SeiteEinstieg in einer Zeile, Gateway-FunktionenEvaluierung und Prompt-Workflowslokale, notebook-artige Evaluierung
Schwächste Seitenicht OTel-nativ fürs Tracingschwerer zu starten als eine Base-URLELv2 ist nicht permissiv
Gateway-FunktionenCache, Limits, Fallbacksneinnein
Selbst hostenApache 2.0, fünf DiensteMIT, Docker Compose oder HelmELv2, selbst hostbar
Kostentrackingeingebautpro Modell konfigurierbarseparates Produkt
Am besten geeignetTeams mit Sichtbarkeit diese WocheTeams, die evaluierenTeams, die lokal traced und evaluiert

Langfuse ist MIT-lizenziert, wurde im Januar 2026 von ClickHouse übernommen, wobei Lizenz und Selbst hosten ausdrücklich unverändert bleiben, und speichert Traces ebenfalls in ClickHouse; ist die permissivere Lizenz mit echter Evaluierungsstrecke das entscheidende Kriterium, ist es das stärkere Werkzeug. Arize Phoenix baut auf OpenInference-Konventionen und läuft überall, auch air-gapped, aber die Elastic License 2.0 ist keine permissive. Helicones Argument ist nicht Funktionsumfang, sondern Zeit: Der Weg von einem Repository zu einem Kosten-Dashboard, gemessen in Anfragen pro Nutzer, ist eine Zeile Code.

Urteil

Helicone ist das richtige Werkzeug, wenn niemand sagen kann, was die LLM-Kosten letzten Dienstag waren, und das falsche, wenn Latenz, Datenlokation oder Tracing-Standards die Architektur entscheiden. Seine Ingenieursarbeit ist unspektakulär im besten Sinn: Der Proxy ist dünn, Logs gehen nach der Antwort raus, und das Produkt ist vom Gateway bis zum Dashboard Apache-2.0. Die Schwäche ist ebenso klar: Es will dein Gateway sein, und alles, was es bequem macht, ist eine Folge davon.

  1. Nimm es, wenn das Team Kosten, Latenz und Fehler pro Anfrage innerhalb einer Woche braucht und noch keinen Tracing-Stack hat.
  2. Nimm es, wenn Edge-Cache, eigene Rate-Limits und automatische Fallbacks im Request-Pfad den Aufpreis wert sind.
  3. Nimm den asynchronen OpenLLMetry-Pfad, wenn du Helicones Analytics ohne Proxy-Hop willst, und akzeptiere den Verzicht auf Gateway-Funktionen.
  4. Lass es weg, wenn Prompts das Netz nicht verlassen dürfen oder der Proxy-Hop ein hartes Latenzbudget auffrisst.
  5. Lass es weg, wenn die Plattform bereits mit OpenTelemetry traced und ein zweites Instrumentierungsmodell die Daten fragmentieren würde.
  6. Denk neu darüber nach oberhalb von rund 1.000 eingelesenen Logs pro Minute oder wenn das Anfragekontingent so gross ist, dass der Nutzungszähler eine eigene Budgetzeile braucht.

Quellen

  1. Helicone Schnellstart
  2. Helicone AI Gateway Überblick
  3. Helicone: Latenzwirkung und Benchmark
  4. Helicone: Proxy versus Async
  5. Helicone: LLM-Caching
  6. Helicone: Selbst hosten mit Docker
  7. Helicone: Kostenberechnung
  8. Helicone Preise
  9. Helicone Repository auf GitHub

Häufige Fragen

Ist Helicone quelloffen?

Ja, unter Apache 2.0. Das Repository mit rund 6.200 Sternen enthält Gateway, Log-Sammler und Dashboard. Die gehosteten Stufen ergänzen Funktionen wie SOC-2-Berichte, HIPAA-Optionen, SAML SSO und On-Prem-Verträge.

Verursacht der Helicone-Proxy Latenz?

Der eigene Benchmark des Herstellers schickt 500 verschränkte Anfragen direkt an OpenAI und über Helicone und meldet im Mittel 2,21 Sekunden in beiden Fällen, p90 3,27 gegenüber 3,29 Sekunden. Das ist ein Herstellertest auf text-ada-001, also ein Hinweis, dass der Overhead klein ist, keine Zahl zum Planen.

Kann Helicone aus dem kritischen Pfad bleiben?

Ja, über die asynchrone OpenLLMetry-Integration, die nach der Antwort loggt und nie zwischen Anwendung und Anbieter steht. Die Dokumentation benennt den Preis ausdrücklich: der asynchrone Pfad verliert Bucket-Caching, eigene Rate-Limits und Retries.

Wie funktioniert Helicone mit mehreren Anbietern?

Das AI Gateway stellt mehr als 100 Modelle über einen OpenAI-kompatiblen Endpunkt bereit und übersetzt die Anfrage in das Format des jeweiligen Anbieters. Mit Credits hält Helicone die Anbieterschlüssel und nennt null Aufschlag; eigene Schlüssel sind auch möglich.

Klingt nach dem, was du suchst?

Erzähl mir von deinem Projekt oder deiner Stelle – ich freue mich, von dir zu hören.