[{"data":1,"prerenderedAt":822},["ShallowReactive",2],{"tool-helicone-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":22,"sources":28,"cover":56,"og":57,"expertise":58,"locales":59,"lang":61,"title":63,"description":64,"coverAlt":65,"url":66,"pricing":67,"kind":9,"metaTitle":68,"takeaways":69,"faq":75,"toc":88,"blocks":119,"others":589},"helicone","2026-07-03",10,"llmops",[9,10,11,12,13],"LLM observability","OpenTelemetry","Cost tracking","Proxy","Gateway",[15,16,17,18,19,20,21],"helicone llm observability","helicone vs langfuse","llm cost tracking tool","open source llm observability","llm gateway proxy","self-host llm observability","helicone cache",[23,25],{"name":10,"url":24},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":26,"url":27},"Apache License 2.0","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FApache_License",[29,32,35,38,41,44,47,50,53],{"title":30,"url":31},"Helicone quickstart","https:\u002F\u002Fdocs.helicone.ai\u002Fgetting-started\u002Fquick-start",{"title":33,"url":34},"Helicone AI Gateway overview","https:\u002F\u002Fdocs.helicone.ai\u002Fgateway\u002Foverview",{"title":36,"url":37},"Helicone: latency impact and benchmark","https:\u002F\u002Fdocs.helicone.ai\u002Freferences\u002Flatency-affect",{"title":39,"url":40},"Helicone: proxy versus async integration","https:\u002F\u002Fdocs.helicone.ai\u002Freferences\u002Fproxy-vs-async",{"title":42,"url":43},"Helicone: LLM caching","https:\u002F\u002Fdocs.helicone.ai\u002Ffeatures\u002Fadvanced-usage\u002Fcaching",{"title":45,"url":46},"Helicone: self-hosting with Docker","https:\u002F\u002Fdocs.helicone.ai\u002Fgetting-started\u002Fself-deploy-docker",{"title":48,"url":49},"Helicone: how we calculate cost","https:\u002F\u002Fdocs.helicone.ai\u002Ffaq\u002Fhow-we-calculate-cost",{"title":51,"url":52},"Helicone pricing","https:\u002F\u002Fwww.helicone.ai\u002Fpricing",{"title":54,"url":55},"Helicone repository on GitHub","https:\u002F\u002Fgithub.com\u002FHelicone\u002Fhelicone","\u002Fimages\u002Fblog\u002Fhelicone\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fhelicone\u002Fog.jpg","ai-engineer",[60,61,62],"en","de","hu","Helicone: Observability, die im Request-Pfad sitzt","Helicone ist eine Apache-2.0-Plattform für LLM-Gateway und Observability. Was die Proxy-Architektur bringt, was sie kostet und wie der selbst gehostete Stack wirklich aussieht.","Titelbild: Helicone, eine Plattform für LLM-Observability, mit dem Request-Pfad von der Anwendung über den Edge-Proxy zum Anbieter und zurück in den Log-Speicher","https:\u002F\u002Fwww.helicone.ai","Open core · from $20 per month","Helicone: LLM-Observability mit Proxy im Pfad",[70,71,72,73,74],"Helicone ist Apache-2.0, hat rund 6.200 GitHub-Sterne und bündelt mehr als 100 Modelle hinter einem OpenAI-kompatiblen Endpunkt.","Die Integration ist eine Zeile: eine andere Base-URL, oder der asynchrone OpenLLMetry-Pfad, wenn der Proxy nicht im kritischen Pfad liegen darf.","Der Proxy bringt Caching, Rate-Limits, Fallbacks und Retries — der asynchrone Pfad verzichtet auf all das.","Der Benchmark des Herstellers nennt im Mittel 2,21 Sekunden, direkt wie über den Proxy, gemessen mit 500 verschränkten Anfragen auf text-ada-001.","Selbst hosten bedeutet fünf Komponenten — Web, Worker, Jawn, Supabase und ClickHouse plus MinIO — und Jawn proxyt nicht mehr, das Gateway ist ein eigener Dienst.",[76,79,82,85],{"q":77,"a":78},"Ist Helicone quelloffen?","Ja, unter Apache 2.0. Das Repository mit rund 6.200 Sternen enthält Gateway, Log-Sammler und Dashboard. Die gehosteten Stufen ergänzen Funktionen wie SOC-2-Berichte, HIPAA-Optionen, SAML SSO und On-Prem-Verträge.",{"q":80,"a":81},"Verursacht der Helicone-Proxy Latenz?","Der eigene Benchmark des Herstellers schickt 500 verschränkte Anfragen direkt an OpenAI und über Helicone und meldet im Mittel 2,21 Sekunden in beiden Fällen, p90 3,27 gegenüber 3,29 Sekunden. Das ist ein Herstellertest auf text-ada-001, also ein Hinweis, dass der Overhead klein ist, keine Zahl zum Planen.",{"q":83,"a":84},"Kann Helicone aus dem kritischen Pfad bleiben?","Ja, über die asynchrone OpenLLMetry-Integration, die nach der Antwort loggt und nie zwischen Anwendung und Anbieter steht. Die Dokumentation benennt den Preis ausdrücklich: der asynchrone Pfad verliert Bucket-Caching, eigene Rate-Limits und Retries.",{"q":86,"a":87},"Wie funktioniert Helicone mit mehreren Anbietern?","Das AI Gateway stellt mehr als 100 Modelle über einen OpenAI-kompatiblen Endpunkt bereit und übersetzt die Anfrage in das Format des jeweiligen Anbieters. Mit Credits hält Helicone die Anbieterschlüssel und nennt null Aufschlag; eigene Schlüssel sind auch möglich.",[89,92,95,98,101,104,107,110,113,116],{"id":90,"title":91},"what-it-is","Was es ist",{"id":93,"title":94},"how-it-works","Wie es funktioniert",{"id":96,"title":97},"getting-started","Erste Schritte",{"id":99,"title":100},"proxy-or-async","Proxy oder Async — bewusst wählen",{"id":102,"title":103},"performance","Latenz und die Kosten eines Hops",{"id":105,"title":106},"pricing","Preise und welcher Zähler zählt",{"id":108,"title":109},"self-hosting","Den ganzen Stack selbst hosten",{"id":111,"title":112},"where-it-shingles","Wo es schwächelt",{"id":114,"title":115},"verdict","Urteil",{"id":117,"title":118},"sources","Quellen",[120,124,127,130,133,149,150,153,162,165,166,169,172,175,182,183,186,255,258,259,262,331,334,340,341,344,347,414,415,418,432,437,438,441,521,524,525,528,543,549,550],{"type":121,"content":122},"paragraph",[123],"Helicone ist eine Apache-2.0-lizenzierte Plattform für LLM-Gateway und Observability, und die Position dieses Tests ist, dass die Architektur die ganze Geschichte erzählt: Helicone funktioniert, indem es sich zwischen Anwendung und Modellanbieter stellt. Das kauft für eine geänderte Zeile Code enorm viel Funktionalität und kostet einen Netzwerk-Hopf, eine Frage der Datenlokation und einen Anbieter im kritischen Pfad. Für Teams, die am Montag ein Dashboard brauchen, ist das ein guter Handel. Für Teams mit einem Latenzbudget in Millisekunden oder der Regel, dass Prompts das Netz nicht verlassen dürfen, ist es die falsche Form.",{"type":121,"content":125},[126],"Es konkurriert in zwei Richtungen gleichzeitig. Gegenüber reinen Tracing-Backends wie Langfuse, Arize Phoenix und LangSmith gewinnt es beim Time-to-first-Dashboard und bei den Gateway-Funktionen, die am Proxy hängen, und verliert bei OpenTelemetry-nativer Instrumentierung und bei Evaluierungswerkzeugen. Gegenüber API-Routern wie LiteLLM oder OpenRouter ist es Observability zuerst, mit angehängtem Routing.",{"type":128,"level":129,"id":90,"text":91},"heading",2,{"type":121,"content":131},[132],"Zwei Produkte teilen sich eine Codebasis. Das Gateway ist ein OpenAI-kompatibler Endpunkt vor mehr als 100 Anbietern, erreicht durch Zeigen der Base-URL auf ai-gateway.helicone.ai. Die Observability-Plattform ist das, was die hindurchgehenden Anfragen aufzeichnet, in ClickHouse speichert und Fragen zu Kosten, Latenz, Sessions und Nutzern über ein Dashboard, eine SQL-ähnliche Abfragesprache namens HQL, Alerts, Reports und Webhooks beantwortet.",{"type":134,"ordered":135,"items":136},"list",false,[137,139,141,143,145,147],[138],"Lizenz Apache 2.0, rund 6.200 GitHub-Sterne, und der Hinweis, dass Helicone 2025 zu Mintlify kam.",[140],"Integration in einer Zeile: Base-URL ändern, oder einen asynchronen Log über die OpenLLMetry-Instrumentierung senden.",[142],"Kostentracking aus Token-Verbrauch und einer öffentlichen Preisdatenbank mit mehr als 300 Modellen und Anbietern.",[144],"Gateway-Funktionen im Request-Pfad: Edge-Cache, eigene Rate-Limits nach Anfragezahl, Kosten oder Property, und automatische Fallbacks.",[146],"Operative Oberfläche: Sessions, Nutzermetriken, Custom Properties, Scores, Datensätze, Webhooks und ein MCP-Server über die Daten.",[148],"Selbst hosten bedeutet fünf Dienste: ein Web-Frontend, einen Cloudflare Worker, den Jawn-Collector, Supabase und ClickHouse, dazu MinIO für die Inhalte.",{"type":128,"level":129,"id":93,"text":94},{"type":121,"content":151},[152],"Der Request-Pfad ist absichtlich dünn. Sofern kein Header eine Funktion aktiviert, leitet der Worker die Anfrage unverändert weiter und gibt die Antwort zurück; nach abgeschlossener Antwort schickt der Proxy Logs an Kafka für einen getrennten Dienst. Die Verfügbarkeitsdokumentation benennt die Absicht direkt: Jede Geschäftslogik fällt bei jedem Fehler auf reines Proxying zurück, sodass ein Fehler in der Observability zu einer funktionierenden Weiche heruntergestuft wird.",{"type":154,"attrs":155,"inner":159,"caption":160},"diagram",{"viewBox":156,"role":157,"aria-labelledby":158},"0 0 720 372","img","hel-t hel-d","\u003Ctitle id=\"hel-t\">Der Helicone-Request-Pfad\u003C\u002Ftitle>\u003Cdesc id=\"hel-d\">Obere Zeile: Die Anwendung sendet eine Chat-Completion über das OpenAI-SDK an das Helicone-Gateway, das auf Cloudflare Workers läuft und entweder einen Cache-Treffer ausliefert oder an den Anbieter weiterleitet und die Antwort zurückgibt. Untere Zeile: Nach abgeschlossener Antwort gehen Logs an Kafka und weiter in ClickHouse für Analysen und MinIO für Request- und Response-Bodies, wo Dashboard, HQL, Alerts und Reports lesen. Darunter ein Balken: Der asynchrone Pfad umgeht das Gateway komplett und loggt nach der Antwort aus der Anwendung selbst, und gibt dafür Caching, Rate-Limits und Retries auf. Bei jedem Fehler fällt der Worker auf reines Proxying zurück, sodass Observability zu einer Weiche degradiert.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">Der Helicone-Request-Pfad\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">erst Proxy, dann Logs\u003C\u002Ftext>\u003Crect x=\"20\" y=\"46\" width=\"164\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"102\" y=\"73\" text-anchor=\"middle\" class=\"d-text\">Deine App\u003C\u002Ftext>\u003Ctext x=\"102\" y=\"95\" text-anchor=\"middle\" class=\"d-small\">OpenAI-SDK, eine Zeile\u003C\u002Ftext>\u003Cpath d=\"M184 78 H216\" class=\"d-line\" \u002F>\u003Ctext x=\"200\" y=\"70\" text-anchor=\"middle\" class=\"d-small\">Anfrage\u003C\u002Ftext>\u003Crect x=\"216\" y=\"46\" width=\"184\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"308\" y=\"73\" text-anchor=\"middle\" class=\"d-text\">Gateway\u003C\u002Ftext>\u003Ctext x=\"308\" y=\"95\" text-anchor=\"middle\" class=\"d-small\">Cloudflare Workers, Edge\u003C\u002Ftext>\u003Cpath d=\"M400 78 H432\" class=\"d-line\" \u002F>\u003Ctext x=\"416\" y=\"70\" text-anchor=\"middle\" class=\"d-small\">weiter\u003C\u002Ftext>\u003Crect x=\"432\" y=\"46\" width=\"164\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"514\" y=\"73\" text-anchor=\"middle\" class=\"d-text\">Anbieter\u003C\u002Ftext>\u003Ctext x=\"514\" y=\"95\" text-anchor=\"middle\" class=\"d-small\">100+ Modelle, eine API\u003C\u002Ftext>\u003Cpath d=\"M596 78 H628\" class=\"d-line\" \u002F>\u003Ctext x=\"612\" y=\"70\" text-anchor=\"middle\" class=\"d-small\">Antwort\u003C\u002Ftext>\u003Crect x=\"216\" y=\"150\" width=\"184\" height=\"64\" rx=\"10\" class=\"d-box d-dash\" \u002F>\u003Ctext x=\"308\" y=\"177\" text-anchor=\"middle\" class=\"d-small\">erst nach der Antwort\u003C\u002Ftext>\u003Ctext x=\"308\" y=\"199\" text-anchor=\"middle\" class=\"d-small\">Logs an Kafka\u003C\u002Ftext>\u003Cpath d=\"M308 110 V150\" class=\"d-line\" \u002F>\u003Crect x=\"20\" y=\"150\" width=\"164\" height=\"64\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"102\" y=\"177\" text-anchor=\"middle\" class=\"d-small\">Edge-Cache\u003C\u002Ftext>\u003Ctext x=\"102\" y=\"199\" text-anchor=\"middle\" class=\"d-small\">Rate-Limits, Fallbacks\u003C\u002Ftext>\u003Cpath d=\"M184 182 H216\" class=\"d-line\" \u002F>\u003Crect x=\"432\" y=\"150\" width=\"268\" height=\"64\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"566\" y=\"177\" text-anchor=\"middle\" class=\"d-small\">ClickHouse für Analysen\u003C\u002Ftext>\u003Ctext x=\"566\" y=\"199\" text-anchor=\"middle\" class=\"d-small\">MinIO für Request-Bodies\u003C\u002Ftext>\u003Cpath d=\"M400 182 H432\" class=\"d-line\" \u002F>\u003Crect x=\"20\" y=\"254\" width=\"680\" height=\"64\" rx=\"10\" class=\"d-box d-dash\" \u002F>\u003Ctext x=\"360\" y=\"281\" text-anchor=\"middle\" class=\"d-text\">Dashboard, HQL, Alerts, Reports, MCP\u003C\u002Ftext>\u003Ctext x=\"360\" y=\"303\" text-anchor=\"middle\" class=\"d-small\">Async-Pfad ohne Gateway: Log nach der Antwort, ohne Caching, Rate-Limits und Retries\u003C\u002Ftext>\u003Crect x=\"20\" y=\"336\" width=\"680\" height=\"28\" rx=\"8\" class=\"d-box\" \u002F>\u003Ctext x=\"360\" y=\"355\" text-anchor=\"middle\" class=\"d-small\">Bei Fehler fällt der Worker auf reines Proxying zurück, Observability degradiert zur Weiche\u003C\u002Ftext>",[161],"Nur im Proxy-Modus liegt das Gateway im kritischen Pfad, das Logging passiert in beiden Modi erst nach der Antwort.",{"type":121,"content":163},[164],"Eine Konsequenz ist klar zu sagen: Im Proxy-Modus passieren standardmässig jeder Prompt und jede Antwort ein fremdes Edge-Netz. Die selbst gehostete Instanz beseitigt das, entfernt aber gerade den Teil des Produkts, der Helicone leicht macht, denn ein selbst gehostetes Jawn proxy't nicht mehr — die Dokumentation hält fest, dass die Gateway-Routen entfernt wurden und das AI Gateway separat deployed werden muss.",{"type":128,"level":129,"id":96,"text":97},{"type":121,"content":167},[168],"Die gesamte Integration ist eine Base-URL. Das Beispiel schaltet zusätzlich den Edge-Cache ein, der schnellste Weg, die Plattform etwas sichtbar tun zu lassen: Die zweite identische Anfrage kommt aus dem KV-Speicher von Cloudflare statt vom Anbieter.",{"type":170,"code":171},"code","import os\nfrom openai import OpenAI\n\nclient = OpenAI(\n    base_url=\"https:\u002F\u002Fai-gateway.helicone.ai\",\n    api_key=os.environ[\"HELICONE_API_KEY\"],\n    default_headers={\n        \"Helicone-Cache-Enabled\": \"true\",\n        \"Cache-Control\": \"max-age=3600\",\n        \"Helicone-Cache-Seed\": \"user-123\",\n        \"Helicone-Property-Env\": \"production\",\n    },\n)\n\nresponse = client.chat.completions.create(\n    model=\"gpt-4o-mini\",\n    messages=[{\"role\": \"user\", \"content\": \"Summarise the refund policy.\"}],\n)\n\nprint(response.choices[0].message.content)\n# The next identical call returns Helicone-Cache: HIT and skips the provider.",{"type":121,"content":173},[174],"Der Cache-Key ist ein Hash aus Cache-Seed, Request-URL, dem gesamten Request-Body und den relevanten Headern, also ein exakter Treffer und kein semantischer: ein geändertes Wort oder eine andere Temperatur bedeutet einen Miss. Die Dauer geht von einer Stunde bis maximal 365 Tagen, Buckets bis 20 gespeicherte Antworten gibt es für nicht deterministische Prompts, und Helicone-Cache-Ignore-Keys nimmt Felder wie eine Request-ID oder einen provider-eigenen prompt_cache_key aus dem Schlüssel.",{"type":176,"variant":177,"title":178,"body":179},"callout","warn","Cache-Keys geben Kontext preis",[180],[181],"Weil der Schlüssel den Request-Body enthält, leitet sich ein Cache-Key pro Nutzer immer noch aus dem Prompt-Inhalt dieses Nutzers ab, und die Antworten liegen im KV-Speicher von Cloudflare Workers statt in eigener Infrastruktur. Für alles mit Personendaten lieber den Cache auslassen und bewusst entscheiden, ob Helicone überhaupt in den Request-Pfad gehört.",{"type":128,"level":129,"id":99,"text":100},{"type":121,"content":184},[185],"Das ist die Entscheidung, die alles andere formt. Helicone dokumentiert beide Modi und ist ungewöhnlich offen über die Lücke zwischen ihnen, was die Wahl nachvollziehbar macht, auch wenn die Antwort selten bequem ist.",{"type":187,"head":188,"rows":195},"table",[189,191,193],[190],"Fähigkeit",[192],"Proxy-Modus",[194],"Async-Modus",[196,203,209,214,219,224,231,236,241,248],[197,199,201],[198],"Im kritischen Pfad",[200],"ja",[202],"nein",[204,206,207],[205],"Gateway-Cache und Buckets",[200],[208],"nicht verfügbar",[210,212,213],[211],"Eigene Rate-Limits",[200],[208],[215,217,218],[216],"Automatische Retries",[200],[208],[220,222,223],[221],"Automatisches Prompt-Formatting",[200],[208],[225,227,229],[226],"Einrichtungsaufwand",[228],"eine Base-URL",[230],"mit OpenLLMetry instrumentieren",[232,234,235],[233],"Sessions und Nutzermetriken",[200],[200],[237,239,240],[238],"Custom Properties und Scores",[200],[200],[242,244,246],[243],"Datenpfad",[245],"Prompts queren Helicones Edge",[247],"Prompts bleiben beim Anbieter",[249,251,253],[250],"Wählen, wenn",[252],"Caching und Rate-Limits zählen",[254],"Propagationsverzögerung inakzeptabel ist",{"type":121,"content":256},[257],"Die vernünftige Schlussfolgerung: das sind zwei Produkte mit einem Namen. Der Proxy ist ein Gateway mit angehängter Analytics; die asynchrone Integration ist eine Logging-Bibliothek mit Web-Oberfläche. Wer den Proxy wählt, bekommt Caching, Rate-Limits und Fallbacks, die man sich sonst selbst bauen müsste, und zahlt mit einem zusätzlichen Hop und einer Datenlokationsentscheidung. Wer den asynchronen Weg wählt, behält Latenzbudget und Netzgrenze und baut das Gateway selbst oder verzichtet darauf.",{"type":128,"level":129,"id":102,"text":103},{"type":121,"content":260},[261],"Der veröffentlichte Benchmark ist klein, aber ungewöhnlich gut spezifiziert: 500 Anfragen mit eindeutigen Prompts, zwischen OpenAI und Helicone innerhalb desselben Ein-Sekunden-Fensters verschränkt, abwechselnd welcher Endpunkt zuerst gerufen wurde, mit maximalem Prompt-Kontext, auf text-ada-001, Round-Trip-Latenz für beide Mengen protokolliert.",{"type":187,"head":263,"rows":270},[264,266,268],[265],"Statistik",[267],"OpenAI direkt (s)",[269],"Helicone über Proxy (s)",[271,277,284,290,297,304,311,318,325],[272,274,276],[273],"Mittelwert",[275],"2.21",[275],[278,280,282],[279],"Median",[281],"2.87",[283],"2.90",[285,287,289],[286],"Standardabweichung",[288],"1.12",[288],[291,293,295],[292],"p90",[294],"3.27",[296],"3.29",[298,300,302],[299],"Maximum",[301],"3.56",[303],"3.76",[305,307,309],[306],"Methode",[308],"500 verschränkte Anfragen",[310],"gleiche Prompts, wechselnde Reihenfolge",[312,314,316],[313],"Modell",[315],"text-ada-001",[317],"text-ada-001, maximaler Kontext",[319,321,323],[320],"Overhead",[322],"Basislinie",[324],"nur im Maximum sichtbar",[326,328,330],[327],"Durchgeführt von",[329],"Hersteller",[329],{"type":121,"content":332},[333],"Lies die Maximum-Zeile genau. 200 Millisekunden Unterschied auf einer dreieinhalbsekündigen Antwort sind 6 Prozent, und derselbe absolute Hop auf einen 300-Millisekunden-Modellaufruf oder einen 40-Millisekunden-Tool-Call würde ihn dominieren. Der Benchmark ist ausserdem ein Herstellertest auf einem abgelösten Modell; er zeigt, dass der Overhead begrenzt ist, nicht wie er für eine konkrete Last ausfällt.",{"type":176,"variant":335,"title":336,"body":337},"note","Wohin die Zeit wirklich geht",[338],[339],"Das Logging ist nicht der Kostenpunkt. Der Proxy schreibt erst nach der zurückgegebenen Antwort an Kafka, Telemetrie steht also nicht vor dem Nutzer. Der Kostenpunkt ist der Round-Trip zu einem Edge-Standort, der nah am Aufrufer, aber nicht necessarily nah an der Provider-Region liegt — plus die Gateway-Funktionen, die du einschaltest, die definitionsgemäss pro Anfrage Arbeit tun.",{"type":128,"level":129,"id":105,"text":106},{"type":121,"content":342},[343],"Der kostenlose Hobby-Plan umfasst 10.000 Anfragen pro Monat, einen Platz, eine Organisation, ein Gigabyte und sieben Tage Aufbewahrung. Pro kostet 79 $ pro Monat für unbegrenzte Plätze, eine Organisation, Alerts, Reports, HQL, einen Monat Aufbewahrung und 1.000 eingelesene Logs pro Minute. Team kostet 799 $ für fünf Organisationen, SOC 2 und HIPAA, drei Monate Aufbewahrung und 15.000 Logs pro Minute. Enterprise ergänzt unbegrenzte Organisationen, SAML SSO und On-Prem-Betrieb.",{"type":121,"content":345},[346],"Die Zahl, auf die es ankommt, preist niemand prominent: die Ingestion. Ein Hobby-Workspace liest 10 Logs pro Minute ein, Pro 1.000, Team 15.000. Eine Produktionsanwendung kann pro Nutzeranfrage mehrere Logs erzeugen — ein Modellaufruf, ein Retrieval-Schritt, ein Tool-Call —, also erschöpft ein mässig beschäftigtes Produkt die Pro-Grenze, bevor es das Anfragekontingent erschöpft, und der Plan, der das behebt, kostet 799 $ pro Monat. Speicher wird über dem ersten Gigabyte separat abgerechnet.",{"type":187,"head":348,"rows":377},[349,355,361,367,372],[350,351,352,353,354],"Plan","Preis","Anfragen","Ingestion","Aufbewahrung",[356,357,358,359,360],"Hobby","0 $","10.000 pro Monat","10 Logs pro Minute","7 Tage",[362,363,364,365,366],"Pro","79 $ pro Monat","nutzungsabhängig","1.000 Logs pro Minute","1 Monat",[368,369,364,370,371],"Team","799 $ pro Monat","15.000 Logs pro Minute","3 Monate",[373,374,364,375,376],"Enterprise","individuell","30.000 Logs pro Minute","unbegrenzt",[378,386,394,405],[379,381,383,384,385],[380],"Plätze",[382],"1",[376],[376],[376],[387,389,390,391,393],[388],"Organisationen",[382],[382],[392],"5",[376],[395,397,399,401,403],[396],"Wichtige Extras",[398],"nichts",[400],"HQL, Alerts, Reports",[402],"SOC 2, HIPAA",[404],"SAML SSO, On-Prem",[406,408,410,411,412],[407],"Selbst hosten",[409],"gratis",[409],[409],[413],"Helm-Chart auf Anfrage",{"type":128,"level":129,"id":108,"text":109},{"type":121,"content":416},[417],"Das Apache-2.0-Repository enthält die komplette Plattform, und das README benennt die Betriebsform direkt: fünf Dienste, und eine manuelle Installation, die es als nicht empfohlen zugunsten der Docker-Compose-Datei oder eines Enterprise-Helm-Charts markiert.",{"type":134,"ordered":135,"items":419},[420,422,424,426,428,430],[421],"Web: das Dashboard-Frontend, eine Next.js-Anwendung.",[423],"Worker: der Proxy, in der gehosteten Version als Cloudflare Workers betrieben.",[425],"Jawn: der Log-Sammler, ein Express-Dienst mit Tsoa-generierten Routen.",[427],"Supabase: die Anwendungsdatenbank und die Authentifizierung.",[429],"ClickHouse: der Analytics-Speicher, der Kosten- und Latenzfragen beantwortet.",[431],"MinIO: Objektspeicher für Request- und Response-Bodies.",{"type":176,"variant":177,"title":433,"body":434},"Zwei Dinge, vor denen die Docs zu Recht warnen",[435],[436],"Jawn proxy't nicht mehr: die Gateway-Routen wurden entfernt, eine selbst gehostete Instanz betreibt das AI Gateway also als getrennten Dienst oder gar nicht. Und Port 8585 nimmt Proxy-Anfragen ohne Authentifizierung an, wer ihn erreicht kann also das Guthaben des Anbieters ausgeben — per Firewall einschränken, TLS davorlegen und Volumes für Postgres, ClickHouse und MinIO mounten, sonst löscht ein Neustart die Daten.",{"type":128,"level":129,"id":111,"text":112},{"type":121,"content":439},[440],"Die ehrlichen Schwächen sind strukturell, nicht kosmetisch. Helicones Datenmodell ist auf Anfragen ausgelegt, die durch sein Gateway gehen; ein Team, das bereits mit OpenTelemetry-Spans traced, muss sich zwischen zwei Instrumentierungsstacks entscheiden. Die Evaluierungsgeschichte ist im Vergleich zu Langfuse oder Braintrust dünn: Prompts, Playground und Scores gibt es, aber keinen ersten-Klasse-Experiments-Workflow. Und die Eigentumsfrage ist offen — Helicone kam 2025 zu Mintlify, was das Open-Core-Lock-in-Risiko nimmt, aber die übliche Anbieterabhängigkeit hinzufügt.",{"type":187,"head":442,"rows":451},[443,445,447,449],[444],"",[446],"Helicone",[448],"Langfuse",[450],"Arize Phoenix",[452,461,470,479,488,495,503,512],[453,455,457,459],[454],"Lizenz",[456],"Apache 2.0",[458],"MIT-Kern, Enterprise-Extras",[460],"Elastic License 2.0",[462,464,466,468],[463],"Instrumentierung",[465],"Proxy oder OpenLLMetry",[467],"OpenTelemetry-nativ",[469],"OpenInference auf OTel",[471,473,475,477],[472],"Stärkste Seite",[474],"Einstieg in einer Zeile, Gateway-Funktionen",[476],"Evaluierung und Prompt-Workflows",[478],"lokale, notebook-artige Evaluierung",[480,482,484,486],[481],"Schwächste Seite",[483],"nicht OTel-nativ fürs Tracing",[485],"schwerer zu starten als eine Base-URL",[487],"ELv2 ist nicht permissiv",[489,491,493,494],[490],"Gateway-Funktionen",[492],"Cache, Limits, Fallbacks",[202],[202],[496,497,499,501],[407],[498],"Apache 2.0, fünf Dienste",[500],"MIT, Docker Compose oder Helm",[502],"ELv2, selbst hostbar",[504,506,508,510],[505],"Kostentracking",[507],"eingebaut",[509],"pro Modell konfigurierbar",[511],"separates Produkt",[513,515,517,519],[514],"Am besten geeignet",[516],"Teams mit Sichtbarkeit diese Woche",[518],"Teams, die evaluieren",[520],"Teams, die lokal traced und evaluiert",{"type":121,"content":522},[523],"Langfuse ist MIT-lizenziert, wurde im Januar 2026 von ClickHouse übernommen, wobei Lizenz und Selbst hosten ausdrücklich unverändert bleiben, und speichert Traces ebenfalls in ClickHouse; ist die permissivere Lizenz mit echter Evaluierungsstrecke das entscheidende Kriterium, ist es das stärkere Werkzeug. Arize Phoenix baut auf OpenInference-Konventionen und läuft überall, auch air-gapped, aber die Elastic License 2.0 ist keine permissive. Helicones Argument ist nicht Funktionsumfang, sondern Zeit: Der Weg von einem Repository zu einem Kosten-Dashboard, gemessen in Anfragen pro Nutzer, ist eine Zeile Code.",{"type":128,"level":129,"id":114,"text":115},{"type":121,"content":526},[527],"Helicone ist das richtige Werkzeug, wenn niemand sagen kann, was die LLM-Kosten letzten Dienstag waren, und das falsche, wenn Latenz, Datenlokation oder Tracing-Standards die Architektur entscheiden. Seine Ingenieursarbeit ist unspektakulär im besten Sinn: Der Proxy ist dünn, Logs gehen nach der Antwort raus, und das Produkt ist vom Gateway bis zum Dashboard Apache-2.0. Die Schwäche ist ebenso klar: Es will dein Gateway sein, und alles, was es bequem macht, ist eine Folge davon.",{"type":134,"ordered":529,"items":530},true,[531,533,535,537,539,541],[532],"Nimm es, wenn das Team Kosten, Latenz und Fehler pro Anfrage innerhalb einer Woche braucht und noch keinen Tracing-Stack hat.",[534],"Nimm es, wenn Edge-Cache, eigene Rate-Limits und automatische Fallbacks im Request-Pfad den Aufpreis wert sind.",[536],"Nimm den asynchronen OpenLLMetry-Pfad, wenn du Helicones Analytics ohne Proxy-Hop willst, und akzeptiere den Verzicht auf Gateway-Funktionen.",[538],"Lass es weg, wenn Prompts das Netz nicht verlassen dürfen oder der Proxy-Hop ein hartes Latenzbudget auffrisst.",[540],"Lass es weg, wenn die Plattform bereits mit OpenTelemetry traced und ein zweites Instrumentierungsmodell die Daten fragmentieren würde.",[542],"Denk neu darüber nach oberhalb von rund 1.000 eingelesenen Logs pro Minute oder wenn das Anfragekontingent so gross ist, dass der Nutzungszähler eine eigene Budgetzeile braucht.",{"type":176,"variant":544,"title":545,"body":546},"tip","Das eine, was man messen sollte",[547],[548],"Miss vor der Zusage den Gateway-Hop gegen dein eigenes Latenzbudget, mit deinem Modell und deiner Region. Helicone veröffentlicht einen fairen Benchmark, aber ein fairer Benchmark auf text-ada-001 sagt fast nichts über eine 300-Millisekunden-Streaming-Antwort aus einer Region, drei Zeitzonen vom Anbieter entfernt.",{"type":128,"level":129,"id":117,"text":118},{"type":134,"ordered":529,"items":551},[552,557,561,565,569,573,577,581,585],[553],{"tag":554,"href":31,"children":555},"a",[556],"Helicone Schnellstart",[558],{"tag":554,"href":34,"children":559},[560],"Helicone AI Gateway Überblick",[562],{"tag":554,"href":37,"children":563},[564],"Helicone: Latenzwirkung und Benchmark",[566],{"tag":554,"href":40,"children":567},[568],"Helicone: Proxy versus Async",[570],{"tag":554,"href":43,"children":571},[572],"Helicone: LLM-Caching",[574],{"tag":554,"href":46,"children":575},[576],"Helicone: Selbst hosten mit Docker",[578],{"tag":554,"href":49,"children":579},[580],"Helicone: Kostenberechnung",[582],{"tag":554,"href":52,"children":583},[584],"Helicone Preise",[586],{"tag":554,"href":55,"children":587},[588],"Helicone Repository auf GitHub",[590,639,722,779],{"slug":591,"published":592,"minutes":593,"category":7,"tags":594,"keywords":600,"about":607,"sources":611,"cover":630,"og":631,"expertise":58,"locales":632,"lang":61,"title":633,"description":634,"coverAlt":635,"url":636,"pricing":637,"kind":638},"ollama","2026-09-29",11,[595,596,597,598,599],"Local inference","Open models","llama.cpp","GGUF","Model serving",[591,601,602,603,604,605,606],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[608],{"name":609,"url":610},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[612,615,618,621,624,627],{"title":613,"url":614},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":616,"url":617},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":619,"url":620},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":622,"url":623},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":625,"url":626},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":628,"url":629},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg",[60,61,62],"Ollama im Test: der freundliche Weg zu offenen Modellen","Ollama liefert offene Modelle über eine HTTP-API auf eigener Hardware aus. Was es gut macht, wo der Durchsatz zu kurz kommt, was die MIT-Lizenz nicht abdeckt.","Abstrakte Titelgrafik für den Ollama-Test","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime",{"slug":640,"published":641,"minutes":593,"category":7,"tags":642,"keywords":648,"about":656,"sources":663,"cover":715,"og":716,"expertise":58,"locales":717,"lang":61,"title":718,"description":719,"coverAlt":720,"url":659,"pricing":721,"kind":643},"portkey","2026-09-28",[643,644,645,646,647],"LLM gateway","Guardrails","Routing","Observability","Cost control",[649,650,651,652,653,654,655],"portkey ai gateway","portkey vs litellm","llm gateway comparison","llm gateway latency overhead","llm guardrails gateway","self-hosted llm gateway","portkey pricing",[657,660],{"name":658,"url":659},"Portkey","https:\u002F\u002Fportkey.ai",{"name":661,"url":662},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[664,667,670,673,676,679,682,685,688,691,694,697,700,703,706,709,712],{"title":665,"url":666},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":668,"url":669},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":671,"url":672},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":674,"url":675},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":677,"url":678},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":680,"url":681},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":683,"url":684},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":686,"url":687},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":689,"url":690},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":692,"url":693},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":695,"url":696},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":698,"url":699},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":701,"url":702},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":704,"url":705},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":707,"url":708},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":710,"url":711},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing",{"title":713,"url":714},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[60,61,62],"Portkey: ein LLM-Gateway für die Produktion, geprüft auf Routing, Guardrails und Kosten","Portkey bündelt Retries, Fallbacks, Cache, Guardrails und Kostenkontrolle hinter einer OpenAI-kompatiblen Schnittstelle. Was die Konfiguration gut löst und was das Gateway an Latenz kostet.","Ein Requestweg von der Anwendung durch das Portkey-Gateway zu drei Modellanbietern, darunter das Guardrail-Ergebnis und das Protokoll.","Free · from $49 per month",{"slug":723,"published":724,"minutes":6,"category":7,"tags":725,"keywords":729,"about":737,"sources":747,"cover":772,"og":773,"expertise":58,"locales":774,"lang":61,"title":775,"description":776,"coverAlt":777,"url":739,"pricing":778,"kind":9},"langfuse","2026-08-13",[9,726,10,727,728],"Tracing","Self-hosting","Evaluation",[723,730,731,732,733,734,735,736],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[738,740,741,744],{"name":448,"url":739},"https:\u002F\u002Flangfuse.com",{"name":10,"url":24},{"name":742,"url":743},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":745,"url":746},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[748,751,754,757,760,763,766,769],{"title":749,"url":750},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":752,"url":753},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":755,"url":756},"Langfuse pricing: cloud plans, billable units and worked examples","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":758,"url":759},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":761,"url":762},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":764,"url":765},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":767,"url":768},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":770,"url":771},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[60,61,62],"Langfuse-Test: Tracing, Prompts und Evals selbst gehostet","Langfuse legt LLM-Traces, Prompt-Versionen und Experimente auf eine MIT-lizenzierte Plattform. Was das Selbsthosten wirklich kostet, wie die Einheitspreise rechnen und wo es verliert.","Eine Pipeline vom gebündelten Application-Event über den Langfuse-Web-Container und den Object Storage in ClickHouse, mit Redis und PostgreSQL daneben.","MIT · paid from $59 per month",{"slug":780,"published":781,"minutes":6,"category":7,"tags":782,"keywords":787,"about":794,"sources":798,"cover":814,"og":815,"expertise":58,"locales":816,"lang":61,"title":817,"description":818,"coverAlt":819,"url":820,"pricing":821,"kind":643},"openrouter","2026-07-23",[643,783,784,785,786],"Model routing","Fallbacks","OpenAI-compatible","Pay per token",[780,788,651,789,790,791,792,793],"openrouter vs litellm","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[795],{"name":796,"url":797},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[799,802,803,806,809,812],{"title":800,"url":801},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":713,"url":714},{"title":804,"url":805},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":807,"url":808},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":810,"url":811},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":813,"url":797},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg",[60,61,62],"OpenRouter: ein API-Schlüssel vor jedem Modell im Katalog","OpenRouter packt 500+ Modelle von 80+ Anbietern hinter einen OpenAI-kompatiblen Endpunkt, mit Fallbacks und Weiterverrechnung zum Listenpreis. Kosten und Schwächen.","Anfragepfad durch OpenRouter: Client, Router, mögliche Anbieter, Fallback-Liste und das Modell, das tatsächlich antwortet.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription",1791383550776]