[{"data":1,"prerenderedAt":680},["ShallowReactive",2],{"tool-openrouter-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":22,"sources":26,"cover":44,"og":45,"expertise":46,"locales":47,"lang":49,"title":51,"description":52,"coverAlt":53,"url":54,"pricing":55,"kind":9,"metaTitle":56,"takeaways":57,"faq":63,"toc":76,"blocks":101,"others":436},"openrouter","2026-07-23",10,"llmops",[9,10,11,12,13],"LLM gateway","Model routing","Fallbacks","OpenAI-compatible","Pay per token",[4,15,16,17,18,19,20,21],"openrouter vs litellm","llm gateway comparison","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[23],{"name":24,"url":25},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[27,30,33,36,39,42],{"title":28,"url":29},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":31,"url":32},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing",{"title":34,"url":35},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":37,"url":38},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":40,"url":41},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":43,"url":25},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg","ai-engineer",[48,49,50],"en","de","hu","OpenRouter: ein API-Schlüssel vor jedem Modell im Katalog","OpenRouter packt 500+ Modelle von 80+ Anbietern hinter einen OpenAI-kompatiblen Endpunkt, mit Fallbacks und Weiterverrechnung zum Listenpreis. Kosten und Schwächen.","Anfragepfad durch OpenRouter: Client, Router, mögliche Anbieter, Fallback-Liste und das Modell, das tatsächlich antwortet.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription","OpenRouter-Test: ein Schlüssel, jedes Modell · Balázs Csorba",[58,59,60,61,62],"OpenRouter ist eine gehostete Routing-Schicht: ein OpenAI-kompatibler Endpunkt vor 500+ Modellen von 80+ Anbietern, abgerechnet zum Listenpreis des Anbieters plus 5,5% Gebühr beim Kauf von Credits.","Das Standard-Routing gewichtet nach Preis: unter den Anbietern ohne Ausfall der letzten 30 Sekunden wählt der Router nach dem Kehrwert des Quadrats des Preises und behält den Rest als Fallback.","Fehlgeschlagene und Fallback-Versuche werden nicht für Modell-Tokens berechnet — der Ausfall kostet Latenz statt Tokens.","Die Gebühr fällt beim Credit-Kauf an, nie pro Anfrage; daraus wird eine feste Prozentzahl, die sich planen lässt.","Zero Data Retention gibt es auf jedem Plan, aber Prompts in der EU oder den USA bleiben erst ab Business in der Region, wo die Gebühr 8% beträgt.",[64,67,70,73],{"q":65,"a":66},"Rechnet OpenRouter Modelle mit auf?","Die Preisseite sagt nein: Inference wird auf jedem Plan zum Listenpreis des Anbieters abgerechnet, die Plattformgebühr von 5,5% bei Standard und 8% bei Business fällt beim Kauf von Credits an. openrouter\u002Fauto kostet ebenfalls keine Zusatzgebühr, gezahlt wird der Satz des Modells, das die Anfrage bedient.",{"q":68,"a":69},"Wie viel Latenz addiert das Gateway?","Es addiert einen Netzwerk-Hop vor dem Anbieter, und die Dokumentation sagt unverhohlen, dass Routing die Zuverlässigkeit verbessert, die Latenz aber von Modell, Anbieter und Region abhängt. Die Empfehlung für konstante Latenz lautet: Modell und Anbieter pinnen — dann schaltet sich das Load-Balancing ab und der Pfad verhält sich wie ein direkter API-Aufruf.",{"q":71,"a":72},"Was passiert bei einem Fallback?","Jeder Fehler kann das nächste Modell aus der models-Liste auslösen, darunter Kontextlängen-Validierung, Moderationsflags, Rate-Limits und Ausfälle. Der fehlgeschlagene Versuch wird nicht für seine Modell-Tokens berechnet, die Rechnung enthält also nur den Lauf, der antwortet — gewartet wird aber auf beide.",{"q":74,"a":75},"Können Prompts in einer Region bleiben?","Ja, mit Business und Enterprise: Anfragen an eu.openrouter.ai oder us.openrouter.ai halten Prompt und Antwort in dieser Region, ohne Fallback in eine andere. Zero Data Retention gibt es auf jedem Plan, kontoweit oder pro Anfrage.",[77,80,83,86,89,92,95,98],{"id":78,"title":79},"what-it-is","Was es ist",{"id":81,"title":82},"how-it-works","Wie es funktioniert",{"id":84,"title":85},"getting-started","Erste Schritte",{"id":87,"title":88},"pricing","Preise",{"id":90,"title":91},"control-plane","Steuerungsebene",{"id":93,"title":94},"where-it-shingles","Wo es quietscht",{"id":96,"title":97},"verdict","Fazit",{"id":99,"title":100},"sources","Quellen",[102,106,109,112,115,153,154,164,173,177,180,183,222,223,226,228,235,250,251,254,271,277,278,281,291,297,298,304,360,363,380,381,384,400,410,411],{"type":103,"content":104},"paragraph",[105],"OpenRouter ist eine gehostete Routing-Schicht für Modell-APIs: ein einziger OpenAI-kompatibler Endpunkt, der jede Anfrage dorthin weiterreicht, wo das gewählte Modell gerade gehostet wird. Das Unternehmen betreibt keine eigenen Modelle, und die Preisseite formuliert es so, dass Inference zum Listenpreis des Anbieters abgerechnet wird, während die Plattformgebühr beim Kauf von Credits anfällt. Die Position dieses Tests: der billigste Weg, einen wechselnden Katalog hinter einem Schlüssel zu versammeln — und die teuerste Abhängigkeit, die man wieder loswird, sobald jeder Dienst diesen Dialekt spricht.",{"type":103,"content":107},[108],"Es besetzt den Platz, den ein selbst gehostetes Gateway besetzen würde, und konkurriert mit LiteLLM, Portkey und der Gewohnheit, jeden Anbieter direkt anzusprechen. Der Unterschied liegt in der Verantwortung, nicht in den Features. Ein Gateway ist ein Prozess, den man ausrollt, patcht und skaliert; OpenRouter ist ein Dienst im Anfrageweg jedes Aufrufs des Produkts — Verfügbarkeit, Datenschutz und Preisgestaltung werden damit zu fremden Problemen. Genau das wird hier gekauft.",{"type":110,"level":111,"id":78,"text":79},"heading",2,{"type":103,"content":113},[114],"Das Unternehmen leitet seit 2023 Traffic und beschreibt das Produkt als einheitliche Schnittstelle für hunderte Modelle. Die dokumentierte Oberfläche ist bewusst klein: ein Endpunkt, ein Schlüssel, ein Modell-Slug und ein paar optionale Routing-Hinweise. Gesundheit der Anbieter, Preisvergleich und Failover passieren auf der anderen Seite dieses Aufrufs.",{"type":116,"ordered":117,"items":118},"list",false,[119,126,128,130,136,149,151],[120,121,125],"Nur gehostet: es gibt keine selbst gehostete Variante, das Produkt ist der Endpunkt ",{"tag":122,"children":123},"code",[124],"https:\u002F\u002Fopenrouter.ai\u002Fapi\u002Fv1",".",[127],"500+ Modelle von 80+ Anbietern auf den bezahlten Plänen; der Free-Plan zeigt 25+ kostenlose Modelle von 4 Anbietern.",[129],"OpenAI-kompatible Chat-Completions, dazu eine Anthropic-Messages-Route, eine Responses-API, Embeddings und Batches.",[131,132,135],"Modell-Fallbacks über ein ",{"tag":122,"children":133},[134],"models","-Array: Das nächste Modell wird versucht, wenn das erste fehlschlägt, rate-limitet wird oder die Moderation ablehnt.",[137,138,141,142,141,145,148],"Anbietersteuerung pro Anfrage — ",{"tag":122,"children":139},[140],"order",", ",{"tag":122,"children":143},[144],"only",{"tag":122,"children":146},[147],"ignore",", Quantisierungsfilter sowie Sortierung nach Preis, Durchsatz oder Latenz.",[150],"Bring-your-own-key-Routing: die ersten 25.000 USD Listenpreis-Inference pro Monat auf einem Anbieterschlüssel ohne OpenRouter-Gebühr.",[152],"Activity-Logs mit Export auf jedem Plan, Aufzeichnung pro Generation und Trace-Export nach Datadog, Grafana Cloud, Langfuse, OpenTelemetry, Snowflake oder ein Webhook.",{"type":110,"level":111,"id":81,"text":82},{"type":103,"content":155},[156,157,160,161,163],"Die Standardstrategie ist preisbasiertes Load-Balancing. Der Router verwirft zuerst Anbieter mit einem deutlichen Ausfall der letzten 30 Sekunden, wählt dann unter den stabilen nach dem Kehrwert des Quadrats des Preises und behält den Rest als Fallback: zwischen einem Endpunkt für 1 USD und einem für 3 USD pro Million Tokens wird das billige neunmal häufiger zuerst versucht. Jede explizite ",{"tag":122,"children":158},[159],"sort","- oder ",{"tag":122,"children":162},[140],"-Angabe schaltet dieses Balancing ab — der Schalter, der aus einem kostensoptimierenden Router einen vorhersagbaren macht.",{"type":165,"attrs":166,"inner":170,"caption":171},"diagram",{"viewBox":167,"role":168,"aria-labelledby":169},"0 0 720 320","img","or-t or-d","\u003Ctitle id=\"or-t\">OpenRouter-Anfragepfad\u003C\u002Ftitle>\u003Cdesc id=\"or-d\">Eine Anwendung schickt einen Chat-Completion an einen OpenAI-kompatiblen Endpunkt. Der Router sortiert mögliche Anbieter nach Preis, die Fallback-Liste nennt das nächste Modell, ein Anbieter antwortet, und die Antwort benennt das Modell, das tatsächlich gedient hat. Workspaces, Guardrails und Activity-Logs liegen unter dem Anfragepfad.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">OpenRouter-Anfragepfad\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">openai-kompatibel\u003C\u002Ftext>\u003Crect x=\"20\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"78\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Client\u003C\u002Ftext>\u003Ctext x=\"78\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">OpenAI-SDK\u003C\u002Ftext>\u003Cpath d=\"M136 102 H148\" class=\"d-line\" \u002F>\u003Cpath d=\"M156 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"156\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"214\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Router\u003C\u002Ftext>\u003Ctext x=\"214\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">sort, order\u003C\u002Ftext>\u003Cpath d=\"M272 102 H284\" class=\"d-line\" \u002F>\u003Cpath d=\"M292 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"292\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"350\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Fallback\u003C\u002Ftext>\u003Ctext x=\"350\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">models[]-Liste\u003C\u002Ftext>\u003Cpath d=\"M408 102 H420\" class=\"d-line\" \u002F>\u003Cpath d=\"M428 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"428\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"486\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Anbieter\u003C\u002Ftext>\u003Ctext x=\"486\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">80+ Vendor\u003C\u002Ftext>\u003Cpath d=\"M544 102 H556\" class=\"d-line\" \u002F>\u003Cpath d=\"M564 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"564\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"622\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Antwort\u003C\u002Ftext>\u003Ctext x=\"622\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">model-Feld\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"172\" class=\"d-label\">STEUERUNGSEBENE\u003C\u002Ftext>\u003Cpath d=\"M214 216 V146\" class=\"d-line d-dash\" \u002F>\u003Cpath d=\"M214 138 l-5 9 h10 z\" class=\"d-head\" \u002F>\u003Cpath d=\"M368 216 V146\" class=\"d-line d-dash\" \u002F>\u003Cpath d=\"M368 138 l-5 9 h10 z\" class=\"d-head\" \u002F>\u003Cpath d=\"M546 216 V146\" class=\"d-line d-dash\" \u002F>\u003Cpath d=\"M546 138 l-5 9 h10 z\" class=\"d-head\" \u002F>\u003Crect x=\"134\" y=\"216\" width=\"160\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"214\" y=\"244\" text-anchor=\"middle\" class=\"d-text\">Workspaces\u003C\u002Ftext>\u003Ctext x=\"214\" y=\"265\" text-anchor=\"middle\" class=\"d-small\">Budgets, Keys\u003C\u002Ftext>\u003Crect x=\"288\" y=\"216\" width=\"160\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"368\" y=\"244\" text-anchor=\"middle\" class=\"d-text\">Guardrails\u003C\u002Ftext>\u003Ctext x=\"368\" y=\"265\" text-anchor=\"middle\" class=\"d-small\">Ausgaben, Regeln\u003C\u002Ftext>\u003Crect x=\"446\" y=\"216\" width=\"200\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"546\" y=\"244\" text-anchor=\"middle\" class=\"d-text\">Activity-Logs\u003C\u002Ftext>\u003Ctext x=\"546\" y=\"265\" text-anchor=\"middle\" class=\"d-small\">Export, Traces\u003C\u002Ftext>\u003Ctext x=\"360\" y=\"306\" text-anchor=\"middle\" class=\"d-label\">Die Gebühr fällt beim Credit-Kauf an, nicht bei der Anfrage\u003C\u002Ftext>",[172],"Ein Endpunkt ersetzt einen Stapel Anbieter-Integrationen. Routing, Failover und Abrechnung liegen auf der anderen Seite des Aufrufs — genau das kauft man mit der Plattformgebühr.",{"type":110,"level":174,"id":175,"text":176},3,"latency-cost","Der Preis des Hops",{"type":103,"content":178},[179],"Jeder Aufruf kreuzt jetzt zwei Netze statt eines. Die FAQ zur Preisseite sagt unverhohlen, dass Routing die Zuverlässigkeit verbessert, die Latenz aber von Modell, Anbieter und Region abhängt, und die Empfehlung für konstante Latenz lautet: Modell und Anbieter pinnen. Der zusätzliche Hop ist neben einer Generierung von Sekunden vernachlässigbar und neben einer Klassifikation unter einer Sekunde nicht: Pinnen liefert das Verhalten einer direkten API plus einer Rundreise.",{"type":103,"content":181},[182],"Die Zwischenschaltung bleibt dort sichtbar, wo es zählt. Die Antwort benennt den Endpunkt, der die Anfrage tatsächlich bedient hat, und ein opt-in Header zeigt die Routing-Entscheidung in jeder Antwort — ein unerwarteter Anbieter taucht in einer Logzeile auf statt in einer Beschwerde.",{"type":116,"ordered":117,"items":184},[185,200,208,213],[186,188,189,141,192,195,196,199],{"tag":122,"children":187},[159],": ",{"tag":122,"children":190},[191],"price",{"tag":122,"children":193},[194],"throughput"," oder ",{"tag":122,"children":197},[198],"latency",", und schaltet dabei das Load-Balancing ab.",[201,203,204,207],{"tag":122,"children":202},[140],": eine explizite Anbieterfolge, mit ",{"tag":122,"children":205},[206],"allow_fallbacks"," false, wenn nichts außerhalb versucht werden darf.",[209,212],{"tag":122,"children":210},[211],"require_parameters",": nur Anbieter, die jeden Parameter der Anfrage unterstützen — strukturierte Outputs und Tool-Aufrufe werden so nicht still abgewertet.",[214,217,218,221],{"tag":122,"children":215},[216],"zdr"," und ",{"tag":122,"children":219},[220],"data_collection",": nur Endpunkte ohne Datenaufbewahrung routen, oder nur Anbieter, die Eingaben nicht speichern.",{"type":110,"level":111,"id":84,"text":85},{"type":103,"content":224},[225],"Ein Schlüssel und ein POST. Free-Konten erhalten sofort einen funktionierenden Endpunkt: kostenlose Modelle sind auf 20 Anfragen pro Minute und 50 pro Tag begrenzt, und die Tagesgrenze steigt auf 1.000, sobald das Konto mindestens 10 USD an Credits gekauft hat.",{"type":122,"code":227},"curl https:\u002F\u002Fopenrouter.ai\u002Fapi\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H \"Authorization: Bearer $OPENROUTER_API_KEY\" \\\n  -H \"Content-Type: application\u002Fjson\" \\\n  -d '{\n    \"models\": [\"~openai\u002Fgpt-sol-latest\", \"~anthropic\u002Fclaude-sonnet-latest\"],\n    \"messages\": [\n      { \"role\": \"user\", \"content\": \"Summarise this stack trace in one sentence.\" }\n    ],\n    \"provider\": {\n      \"sort\": \"price\",\n      \"require_parameters\": true\n    }\n  }'",{"type":103,"content":229},[230,231,234],"Die Antwort kommt in OpenAI-Form zurück, und das ",{"tag":122,"children":232},[233],"model","-Feld benennt den Endpunkt, der sie tatsächlich geliefert hat. Nach diesem Modell wird die Anfrage auch abgerechnet, unabhängig davon, ob es zuerst in der Liste stand. Ein vorhandener OpenAI-Client braucht nur eine andere Base-URL; die Dokumentation zeigt denselben Tausch in Python und TypeScript.",{"type":236,"variant":237,"title":238,"body":239},"callout","tip","Alias statt Pin",[240],[241,242,245,246,249],"Slugs, die mit ",{"tag":122,"children":243},[244],"~"," beginnen, verweisen auf das neueste Modell einer Familie, und die Beispiele der Dokumentation nutzen ",{"tag":122,"children":247},[248],"~openai\u002Fgpt-sol-latest",", damit Deployments neue Versionen mitnehmen, ohne neu auszurollen. Der Mechanismus funktioniert in beide Richtungen: Wer Rechnung, Benchmark oder Reproduktion an ein exaktes Modell bindet, nimmt die vollständige Kennung und muss mit einem 404 rechnen, sobald das Modell abgelöst wird.",{"type":110,"level":111,"id":87,"text":88},{"type":103,"content":252},[253],"Es gibt kein Abo, keine Mindestsumme und kein Lock-in. Credits kauft man vorab per Karte, AliPay oder USDC, und jede Anfrage bucht den Listenpreis vom Saldo ab; die Plattformgebühr — 5,5% bei Standard, 8% bei Business — fällt beim Kauf an, nie bei der Anfrage.",{"type":116,"ordered":117,"items":255},[256,258,260,269],[257],"Free: 25+ kostenlose Modelle, 4 Anbieter, Activity-Logs mit Export, 50 Anfragen pro Tag bei kostenlosen Modellen. Kein Auto-Routing, keine Budgets, kein Prompt-Caching.",[259],"Standard: alle 500+ Modelle und 80+ Anbieter mit 5,5% Gebühr auf Credit-Käufe, dazu Auto-Routing, Budgets, Prompt-Caching, Management-API-Keys und fünf Workspaces.",[261,262,217,265,268],"Business: derselbe Katalog mit 8%, In-Region-Routing in der EU oder den USA über ",{"tag":122,"children":263},[264],"eu.openrouter.ai",{"tag":122,"children":266},[267],"us.openrouter.ai",", 1.000 Workspaces und Workload Identity Federation.",[270],"Enterprise: verhandelte Gebühren, Rechnungen, SSO und SCIM, vertragliche SLAs sowie 200.000 USD BYOK-Listenpreis-Inference pro Monat, bevor 5% anfallen.",{"type":236,"variant":272,"title":273,"body":274},"note","Wo die Prozentzahl landet",[275],[276],"Weil die Gebühr beim Kauf fixiert ist, bleibt die Overhead auf Inference eine feste Prozentzahl, unabhängig davon, welches Modell antwortet: 10.000 USD Listenpreis-Traffic kosten bei Standard 550 USD im Monat. Die bezahlten Pläne kaufen Routing-Features statt Durchsatz — OpenRouter kennt keine plangebundenen Rate-Limits; was ein bezahltes Modell auslöst, kommt üblicherweise vom Anbieter.",{"type":110,"level":111,"id":90,"text":91},{"type":103,"content":279},[280],"Für Teams sind die entscheidenden Teile nicht im Request-Body. Workspaces, Budgets und Guardrails legen fest, wer was mit welchem Schlüssel aufrufen darf, und sie liegen in der Plattform statt im eigenen Code. Genau darin besteht der Sinn: Richtlinienänderungen sind keine Deployments mehr.",{"type":116,"ordered":117,"items":282},[283,285,287,289],[284],"Workspaces trennen Umgebungen: fünf bei Free und Standard, 1.000 bei Business, jeweils mit eigenen Schlüsseln und Limits, plus Credit-Cap pro Schlüssel.",[286],"Guardrails hängen an Schlüsseln oder Mitgliedern und decken Ausgaben, Modellzugriff, Prompt-Injection-Muster und Regeln für sensible Informationen ab.",[288],"Management-API-Keys erzeugen, listen und löschen Schlüssel programmatisch — der Schlüssellebenszyklus gehört damit in die CI statt in eine Gewohnheit im Dashboard.",[290],"Broadcast schickt Traces nach Datadog, Grafana Cloud, Langfuse, OpenTelemetry, Sentry, Snowflake oder an einen beliebigen HTTP-Endpunkt, wodurch Ausgaben mit dem Rest des Stacks verknüpfbar werden.",{"type":103,"content":292},[293,294,296],"Zero Data Retention läuft auf jedem Plan, kontoweit oder pro Anfrage mit ",{"tag":122,"children":295},[216],". Regionale Residenz ist das Feature, das nicht gratis ist: Prompts und Antworten in der EU oder den USA bleiben erst ab Business in der Region, damit ist für regulierte Anwendungen der 8%-Plan die Basis statt des Upgrades.",{"type":110,"level":111,"id":93,"text":94},{"type":103,"content":299},[300,301,303],"Die Schwächen sind strukturell. Jede Anfrage hängt an der Verfügbarkeit eines Drittanbieters, und die Routing-Entscheidung bleibt unsichtbar, solange der Metadata-Header nicht aktiviert ist. Die Parameterunterstützung unterscheidet sich zwischen Anbietern desselben Modells: ein Aufruf über den einen Endpunkt kann über einen anderen still abgewertet werden, wenn ",{"tag":122,"children":302},[211]," fehlt. Anbieterpreisänderungen gehen direkt durch — die FAQ stellt klar, dass zum neuen Satz abgerechnet wird —, und das Free-Angebot ist durch Rate-Limits begrenzt statt großzügig. Dazu die Eigentumsfrage: Bloomberg und der Wall Street Journal berichteten im August 2026, Stripe habe die Übernahme vereinbart — eine Erinnerung daran, dass die Schicht im Anfrageweg einen Eigentümer hat.",{"type":305,"head":306,"rows":314},"table",[307,309,310,312],[308],"",[24],[311],"LiteLLM",[313],"APIs der Anbieter",[315,324,333,342,351],[316,318,320,322],[317],"Betrieb",[319],"Gehostet, keine Selbsthosted-Variante",[321],"Selbst gehosteter Proxy",[323],"Eigener Code pro Anbieter",[325,327,329,331],[326],"Gebühr",[328],"5,5% auf Credits (Standard)",[330],"MIT-frei, Paid nach Angebot",[332],"Keine",[334,336,338,340],[335],"Katalog",[337],"500+ Modelle, 80+ Anbieter",[339],"140+ Anbieter, ~1.900 Modelle",[341],"Ein Anbieter pro Integration",[343,345,347,349],[344],"Fallback",[346],"Pro Anfrage, über Anbieter und Modelle",[348],"Im Router konfiguriert",[350],"Selbst geschrieben",[352,354,356,358],[353],"Passt zu",[355],"Viele Modelle, eine Rechnung, kein Betrieb",[357],"Platform-Team mit Keys und Budgets",[359],"Ein Modell auf dem Hot Path",{"type":103,"content":361},[362],"Der Vergleich, der zählt, betrifft die Verantwortung, nicht die Features. OpenRouter nimmt den Betrieb ab und fügt eine Prozentzahl plus eine Abhängigkeit hinzu; LiteLLM behält Schlüssel und Last in der eigenen Infrastruktur; die APIs der Anbieter bieten den kürzesten Weg und den geringsten Schutz, wenn ein Modell ausfällt. Für ein Produkt, das so oft das Modell wechselt, wie andere ein Preisseite ändern, ist dieser Schutz mehr wert als die Gebühr.",{"type":236,"variant":364,"title":365,"body":366},"warn","Vorher pinnen",[367],[368,369,195,371,373,374,376,377,379],"Standard-Load-Balancing kann die nächste Anfrage zu einem anderen Anbieter schicken, was Latenz, Quantisierung und bisweilen die Ausgabe ändert. ",{"tag":122,"children":370},[159],{"tag":122,"children":372},[140]," explizit setzen, ",{"tag":122,"children":375},[211]," für strukturierte Outputs anlassen und bewusst entscheiden, ob ",{"tag":122,"children":378},[206]," die Modellfamilie wechseln darf — standardmäßig wandert ein Fehler zum nächsten Modell in der Liste.",{"type":110,"level":111,"id":96,"text":97},{"type":103,"content":382},[383],"OpenRouter beantwortet, wie viele Agents, Dienste und Teams Zugang zu einem sich schnell ändernden Modellkatalog bekommen, ohne ein Gateway zu betreiben. Es beantwortet nicht, wie man den Anfrageweg besitzt.",{"type":116,"ordered":385,"items":386},true,[387,392,394,396,398],[388,389,391],"Nutzen, wenn der Modellkatalog schneller wechselt als die eigene Integration: ein Endpunkt und ein ",{"tag":122,"children":390},[134],"-Array machen aus einer Anbieterbewertung einen Konfigurationswert.",[393],"Nutzen für Agent- und Coding-Agent-Lasten, bei denen die Rechnung über viele Modelle geht und ein Activity-Log mit Export mehr bringt als vier Anbieter-Dashboards.",[395],"BYOK nutzen, wenn Verträge oder Datenschutz eine direkte Beziehung zum Anbieter verlangen; Routing und Analyse bleiben, die ersten 25.000 USD Listenpreis-Inference pro Monat sind gebührenfrei.",[397],"Verzichten auf latenzkritischen Pfaden, die keinen Anbieter pinnen können: Verfügbarkeits-Routing ist das Produkt, und eine Anfrage, die den Endpunkt wechseln kann, ist eine Tail-Latenz, die niemand kontrolliert.",[399],"Verzichten, wenn ein Anbieter und ein Modell das ganze Produkt sind: ein SDK des Anbieters, direkte Abrechnung und keine Vermittler-Prozentzahl ist weniger Maschinerie für denselben Aufruf.",{"type":401,"content":402},"quote",[403,404,405,409],"„Inference wird auf jedem Plan zum Listenpreis des Anbieters abgerechnet.“"," ",{"tag":406,"href":32,"children":407},"a",[408],"die Preisseite"," Die Gebühr ist klein und nachvollziehbar; die Abhängigkeit ist der Teil, den man einpreisen muss, und der steht nirgends in der Liste.",{"type":110,"level":111,"id":99,"text":100},{"type":116,"ordered":385,"items":412},[413,417,421,425,429,433],[414],{"tag":406,"href":29,"children":415},[416],"OpenRouter-Dokumentation: Quickstart",[418],{"tag":406,"href":32,"children":419},[420],"OpenRouter-Preise",[422],{"tag":406,"href":35,"children":423},[424],"OpenRouter-Dokumentation: Modell-Fallbacks",[426],{"tag":406,"href":38,"children":427},[428],"OpenRouter-Dokumentation: Provider-Routing",[430],{"tag":406,"href":41,"children":431},[432],"OpenRouter-Dokumentationsverzeichnis",[434],{"tag":406,"href":25,"children":435},[43],[437,486,565,626],{"slug":438,"published":439,"minutes":440,"category":7,"tags":441,"keywords":447,"about":454,"sources":458,"cover":477,"og":478,"expertise":46,"locales":479,"lang":49,"title":480,"description":481,"coverAlt":482,"url":483,"pricing":484,"kind":485},"ollama","2026-09-29",11,[442,443,444,445,446],"Local inference","Open models","llama.cpp","GGUF","Model serving",[438,448,449,450,451,452,453],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[455],{"name":456,"url":457},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[459,462,465,468,471,474],{"title":460,"url":461},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":463,"url":464},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":466,"url":467},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":469,"url":470},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":472,"url":473},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":475,"url":476},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg",[48,49,50],"Ollama im Test: der freundliche Weg zu offenen Modellen","Ollama liefert offene Modelle über eine HTTP-API auf eigener Hardware aus. Was es gut macht, wo der Durchsatz zu kurz kommt, was die MIT-Lizenz nicht abdeckt.","Abstrakte Titelgrafik für den Ollama-Test","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime",{"slug":487,"published":488,"minutes":440,"category":7,"tags":489,"keywords":494,"about":501,"sources":508,"cover":558,"og":559,"expertise":46,"locales":560,"lang":49,"title":561,"description":562,"coverAlt":563,"url":504,"pricing":564,"kind":9},"portkey","2026-09-28",[9,490,491,492,493],"Guardrails","Routing","Observability","Cost control",[495,496,16,497,498,499,500],"portkey ai gateway","portkey vs litellm","llm gateway latency overhead","llm guardrails gateway","self-hosted llm gateway","portkey pricing",[502,505],{"name":503,"url":504},"Portkey","https:\u002F\u002Fportkey.ai",{"name":506,"url":507},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[509,512,515,518,521,524,527,530,533,536,539,542,545,548,551,554,557],{"title":510,"url":511},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":513,"url":514},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":516,"url":517},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":519,"url":520},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":522,"url":523},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":525,"url":526},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":528,"url":529},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":531,"url":532},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":534,"url":535},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":537,"url":538},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":540,"url":541},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":543,"url":544},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":546,"url":547},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":549,"url":550},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":552,"url":553},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":555,"url":556},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing",{"title":31,"url":32},"\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[48,49,50],"Portkey: ein LLM-Gateway für die Produktion, geprüft auf Routing, Guardrails und Kosten","Portkey bündelt Retries, Fallbacks, Cache, Guardrails und Kostenkontrolle hinter einer OpenAI-kompatiblen Schnittstelle. Was die Konfiguration gut löst und was das Gateway an Latenz kostet.","Ein Requestweg von der Anwendung durch das Portkey-Gateway zu drei Modellanbietern, darunter das Guardrail-Ergebnis und das Protokoll.","Free · from $49 per month",{"slug":566,"published":567,"minutes":6,"category":7,"tags":568,"keywords":574,"about":582,"sources":594,"cover":619,"og":620,"expertise":46,"locales":621,"lang":49,"title":622,"description":623,"coverAlt":624,"url":585,"pricing":625,"kind":569},"langfuse","2026-08-13",[569,570,571,572,573],"LLM observability","Tracing","OpenTelemetry","Self-hosting","Evaluation",[566,575,576,577,578,579,580,581],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[583,586,588,591],{"name":584,"url":585},"Langfuse","https:\u002F\u002Flangfuse.com",{"name":571,"url":587},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":589,"url":590},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":592,"url":593},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[595,598,601,604,607,610,613,616],{"title":596,"url":597},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":599,"url":600},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":602,"url":603},"Langfuse pricing: cloud plans, billable units and worked examples","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":605,"url":606},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":608,"url":609},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":611,"url":612},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":614,"url":615},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":617,"url":618},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[48,49,50],"Langfuse-Test: Tracing, Prompts und Evals selbst gehostet","Langfuse legt LLM-Traces, Prompt-Versionen und Experimente auf eine MIT-lizenzierte Plattform. Was das Selbsthosten wirklich kostet, wie die Einheitspreise rechnen und wo es verliert.","Eine Pipeline vom gebündelten Application-Event über den Langfuse-Web-Container und den Object Storage in ClickHouse, mit Redis und PostgreSQL daneben.","MIT · paid from $59 per month",{"slug":627,"published":628,"minutes":6,"category":7,"tags":629,"keywords":633,"about":640,"sources":648,"cover":672,"og":673,"expertise":46,"locales":674,"lang":49,"title":675,"description":676,"coverAlt":677,"url":643,"pricing":678,"kind":679},"braintrust","2026-07-07",[630,492,631,632,570],"Evaluations","LLM-as-a-judge","CI gates",[627,634,635,636,637,638,639],"braintrust pricing","braintrust eval","autoevals library","braintrust vs langfuse","llm evaluation platform","eval driven development",[641,644,647],{"name":642,"url":643},"Braintrust","https:\u002F\u002Fwww.braintrust.dev",{"name":645,"url":646},"Continuous integration","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FContinuous_integration",{"name":592,"url":593},[649,652,655,658,661,664,667,669],{"title":650,"url":651},"Braintrust pricing: plans, credits and usage rates","https:\u002F\u002Fwww.braintrust.dev\u002Fpricing",{"title":653,"url":654},"Braintrust documentation: plans and limits","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fplans-and-limits",{"title":656,"url":657},"Braintrust documentation: evaluation quickstart","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fevaluation-quickstart",{"title":659,"url":660},"Braintrust documentation: get started","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs",{"title":662,"url":663},"GitHub: Braintrust organisation repositories","https:\u002F\u002Fgithub.com\u002Forgs\u002Fbraintrustdata\u002Frepositories",{"title":665,"url":666},"Arize Phoenix documentation: self-hosting","https:\u002F\u002Farize.com\u002Fdocs\u002Fphoenix\u002Fself-hosting",{"title":668,"url":603},"Langfuse pricing: cloud plans and billable units",{"title":670,"url":671},"LangChain pricing: LangSmith plans","https:\u002F\u002Fwww.langchain.com\u002Fpricing","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fog.jpg",[48,49,50],"Braintrust im Test: Eval-first Observability mit hartem Zähler","Braintrust macht aus Produktions-Traces Datasets und gate-te Experimente. Was Starter und Pro wirklich enthalten, welches Teil quelloffen ist und wo Phoenix, Langfuse und LangSmith gewinnen.","Eine Schleife von instrumentierten Anwendungs-Logs in ein Dataset, ein Experiment mit Scorern und einen Vergleich, der den Pull Request sperrt, bevor die Änderung zurück in die Anwendung geht.","Free · from $249 per month","Evaluation platform",1791383550655]