[{"data":1,"prerenderedAt":566},["ShallowReactive",2],{"tool-litellm-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":22,"sources":29,"cover":51,"og":52,"expertise":53,"locales":54,"lang":56,"title":58,"description":59,"coverAlt":60,"url":61,"pricing":62,"kind":9,"metaTitle":63,"takeaways":64,"faq":70,"toc":83,"blocks":108,"others":338},"litellm","2026-05-20",10,"llmops",[9,10,11,12,13],"LLM gateway","OpenAI-compatible","Cost control","Routing","MCP",[4,15,16,17,18,19,20,21],"litellm vs portkey","llm gateway comparison","openai compatible proxy","litellm proxy config yaml","llm spend tracking per team","self-hosted llm gateway","llm budget enforcement",[23,26],{"name":24,"url":25},"LiteLLM","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLiteLLM",{"name":27,"url":28},"Model Context Protocol","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FModel_Context_Protocol",[30,33,36,39,42,45,48],{"title":31,"url":32},"LiteLLM documentation: getting started","https:\u002F\u002Fdocs.litellm.ai\u002Fdocs\u002F",{"title":34,"url":35},"LiteLLM documentation: virtual keys","https:\u002F\u002Fdocs.litellm.ai\u002Fdocs\u002Fproxy\u002Fvirtual_keys",{"title":37,"url":38},"LiteLLM documentation: router and load balancing","https:\u002F\u002Fdocs.litellm.ai\u002Fdocs\u002Frouting",{"title":40,"url":41},"LiteLLM documentation: benchmarks","https:\u002F\u002Fdocs.litellm.ai\u002Fdocs\u002Fbenchmarks",{"title":43,"url":44},"LiteLLM documentation: supported endpoints","https:\u002F\u002Fdocs.litellm.ai\u002Fdocs\u002Fsupported_endpoints",{"title":46,"url":47},"LiteLLM documentation: Enterprise","https:\u002F\u002Fdocs.litellm.ai\u002Fdocs\u002Fenterprise",{"title":49,"url":50},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Flitellm\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flitellm\u002Fog.jpg","ai-engineer",[55,56,57],"en","de","hu","LiteLLM: das OpenAI-kompatible Gateway, das die meisten Plattformteams betreiben","LiteLLM ist das MIT-lizenzierte OpenAI-kompatible Gateway, das die meisten Plattformteams vor ihre Anbieter setzen. Was es gut macht, was es kostet und wo es kippt.","Anfragepfad durch das LiteLLM-Gateway: Anwendung, Schlüsselprüfung, Router, Anbieter, Antwort, darunter Postgres und Redis.","https:\u002F\u002Fwww.litellm.ai","MIT · Enterprise from $20 per seat","LiteLLM-Test: das Gateway in der Mitte · Balázs Csorba",[65,66,67,68,69],"LiteLLM ist ein MIT-lizenziertes Python-SDK und ein Proxy, die mehr als 140 Anbieter hinter einem OpenAI-kompatiblen Endpunkt bündeln, mit virtuellen Schlüsseln, Budgets pro Team und Fallback über Anbietergrenzen hinweg.","Der Nutzen ist organisatorisch, nicht technisch: Ein Modellwechsel ist eine Konfigurationsänderung, und jede Anfrage erzeugt eine Kostenzeile.","Die Zusatzlast ist messbar und veröffentlicht: Die Dokumentation nennt 8 ms p95 bei 1.000 Anfragen pro Sekunde und weist ungewöhnlich deutlich darauf hin, dass Latenz nur zusammen mit der Zahl der gleichzeitig offenen Anfragen etwas bedeutet.","Die kostenlose Stufe ist das komplette Gateway. SSO ab mehr als fünf Nutzern, Audit-Logs, Schlüsselrotation und die eingebauten Moderations-Callbacks liegen hinter einer Lizenz, die nach jährlicher Anfragekapazität kalkuliert wird und keinen öffentlichen Preis hat.","Der Release-Takt liegt bei etwa einer Minor-Linie pro Woche bei einem Support-Fenster von vier Linien, das Upgrade ist also wiederkehrende Betriebsarbeit.",[71,74,77,80],{"q":72,"a":73},"Ist LiteLLM nur ein Wrapper um das OpenAI-SDK?","Nein. Das SDK vereinheitlicht Anfragen, Antworten und Fehlerklassen über die unterstützten Anbieter, der Proxy ergänzt virtuelle Schlüssel, Kostentracking, Budgets, Routing, Cooldowns, Fallbacks und Caching. Der übliche Weg ist, mit dem SDK in einem Service anzufangen und auf den Proxy umzusteigen, sobald mehr als ein Team Zugang braucht.",{"q":75,"a":76},"Wie viel Latenz fügt das Gateway hinzu?","Die Benchmark-Seite nennt 8 ms p95 bei 1.000 Anfragen pro Sekunde auf vier Instanzen mit je 4 vCPU und 8 GB. Diese Zahl enthält den Client: Die Dokumentation weist darauf hin, dass ein Closed-Loop-Client ohne Denkzeit rund 1.000 offene Anfragen hält statt etwa 130, was nach dem Little's Law bei gleichem Durchsatz ungefähr achtmal so hohe Latenz ausweist.",{"q":78,"a":79},"Setzt die kostenlose Version Budgets wirklich durch?","Ja. Virtuelle Schlüssel, Teams, Kostentracking, Budgets, Ratelimits und LLM-Fallbacks liegen alle in der Open-Source-Stufe. Lizenzpflichtig sind Identität und Governance: SSO ab mehr als fünf Nutzern, SCIM, Audit-Logs, Secret-Manager-Schreibzugriff, Schlüsselrotation und die eingebauten Moderations-Callbacks.",{"q":81,"a":82},"Wie ist die Enterprise-Version bepreist?","Es gibt keinen öffentlichen Listenpreis. Die Preisseite sagt, die Lizenz richte sich nach jährlicher Gateway-Anfragekapazität, Deployment-Architektur und Support-Bedarf, nie pro Token, und jedes Angebot kommt vom Vertrieb. Ein 30-Tage-Testschlüssel wird ohne Kreditkarte ausgestellt, die Beschaffung läuft auch über den AWS Marketplace und Reseller.",[84,87,90,93,96,99,102,105],{"id":85,"title":86},"what-it-is","Was LiteLLM ist",{"id":88,"title":89},"how-it-works","Wie es funktioniert",{"id":91,"title":92},"getting-started","Erste Schritte",{"id":94,"title":95},"keys-and-budgets","Schlüssel, Budgets und Kosten",{"id":97,"title":98},"pricing","Preis und Lizenzgrenzen",{"id":100,"title":101},"where-it-shingles","Wo es knirscht",{"id":103,"title":104},"verdict","Fazit",{"id":106,"title":107},"sources","Quellen",[109,113,116,119,122,140,141,144,153,156,160,163,166,178,179,182,184,191,213,214,217,219,222,223,226,229,230,233,280,283,284,287,300,306,307],{"type":110,"content":111},"paragraph",[112],"LiteLLM ist das quelloffene LLM-Gateway, das die meisten Plattformteams betreiben, ob sie es vorhatten oder nicht. Es sind zwei Produkte in einem Paket: ein Python-SDK, das die großen Anbieter auf das Anfrage- und Antwortformat von OpenAI vereinheitlicht, und ein Proxy-Server, der virtuelle Schlüssel, Budgets, Routing und Kostentracking davorstellt. Nach Dokumentation und publizierten Zahlen ist es das vollständigste Bauteil dieser Kategorie und schwer genug, um eine bewusste Entscheidung zu verdienen.",{"type":110,"content":114},[115],"Es sitzt einen Sprung vor den Modellanbietern, nicht vor den Anwendungsdaten. Retrieval, Prompt-Verwaltung und Agent-Orchestrierung leben woanders; ein OpenAI-Client, ein LangGraph-Workflow und ein LiteLLM-Proxy koexistieren problemlos. Was das Gateway besitzt, ist die Anfrage selbst: wer sie stellen darf, welches Deployment sie bedient, was sie kostet und wer die Rechnung trägt.",{"type":117,"level":118,"id":85,"text":86},"heading",2,{"type":110,"content":120},[121],"Der Name deckt zwei lauffähige Dinge ab, die sich eine Konfigurationsdatei und eine Modellpreistabelle teilen. Das SDK ist eine Bibliothek, die man importiert. Der Proxy ist ein Server, der das OpenAI-Wire-Format spricht, sodass jeder Client, der bereits gegen OpenAI läuft, durch eine andere Basis-URL und einen anderen Schlüssel umgeleitet werden kann.",{"type":123,"ordered":124,"items":125},"list",false,[126,128,130,132,134,136,138],[127],"MIT-lizenziert, mit einer Enterprise-Stufe, die Identitäts- und Governance-Funktionen ergänzt und keine Kapazität verkauft.",[129],"Mehr als 140 Provider-Integrationen und rund 1.900 Modelle, geführt in einer öffentlichen Preis- und Kontextfenster-Datei, die mit dem Paket ausgeliefert wird.",[131],"OpenAI-kompatible Endpunkte für Chat Completions, die Anthropic-Messages-Route, die Responses-API, Embeddings, Batches und Realtime.",[133],"Virtuelle Schlüssel mit Budgets, Ratelimits und Modellerlaubnissen je Schlüssel, Team und Nutzer, gesichert über Postgres.",[135],"Ein Router mit mehreren Auswahlstrategien, Cooldowns je Deployment, gewichtetem Failover, Fallback über Modellgrenzen hinweg und Session-Affinität.",[137],"Ein MCP-Gateway und ein A2A-Agent-Gateway auf demselben Endpunkt und derselben Schlüsselrichtlinie, damit Agenten geregelten Werkzeugzugriff bekommen statt eines zweiten.",[139],"Callbacks nach Langfuse, MLflow, Helicone, LangSmith und OpenTelemetry sowie Prometheus-Metriken und eine Admin-Oberfläche.",{"type":117,"level":118,"id":88,"text":89},{"type":110,"content":142},[143],"Jede Anfrage durch den Proxy folgt derselben Reihenfolge: Schlüssel authentifizieren, Budget und Ratelimits prüfen, Tokens zählen, Deployment auswählen, Anbieter aufrufen, Antwort übersetzen, Kosten festhalten. Jeder Schritt kann für sich allein scheitern, und das Verhalten des Routers im Fehlerfall ist der Ort, an dem das meiste Betriebswissen entsteht.",{"type":145,"attrs":146,"inner":150,"caption":151},"diagram",{"viewBox":147,"role":148,"aria-labelledby":149},"0 0 720 320","img","d1-llm-t d1-llm-d","\u003Ctitle id=\"d1-llm-t\">LiteLLM-Anfragepfad\u003C\u002Ftitle>\u003Cdesc id=\"d1-llm-d\">Eine Anwendung sendet eine Chat-Completion-Anfrage an das LiteLLM-Gateway. Das Gateway prüft den virtuellen Schlüssel und das Budget, der Router wählt ein Deployment, der Anbieter antwortet, und dasselbe OpenAI-kompatible JSON geht zurück. Postgres, Redis und Observability-Callbacks liegen unter dem Anfragepfad.\u003C\u002Fdesc>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">LiteLLM-Anfragepfad\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">openai-kompatibel\u003C\u002Ftext>\u003Crect x=\"20\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"78\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">App\u003C\u002Ftext>\u003Ctext x=\"78\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">OpenAI-Client\u003C\u002Ftext>\u003Cpath d=\"M136 102 H148\" class=\"d-line\" \u002F>\u003Cpath d=\"M156 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"156\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"214\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Gateway\u003C\u002Ftext>\u003Ctext x=\"214\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">Schlüssel, Budget\u003C\u002Ftext>\u003Cpath d=\"M272 102 H284\" class=\"d-line\" \u002F>\u003Cpath d=\"M292 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"292\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"350\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Router\u003C\u002Ftext>\u003Ctext x=\"350\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">Deployment wählen\u003C\u002Ftext>\u003Cpath d=\"M408 102 H420\" class=\"d-line\" \u002F>\u003Cpath d=\"M428 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"428\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"486\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Anbieter\u003C\u002Ftext>\u003Ctext x=\"486\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">OpenAI, Bedrock\u003C\u002Ftext>\u003Cpath d=\"M544 102 H556\" class=\"d-line\" \u002F>\u003Cpath d=\"M564 102 l-9 -5 v10 z\" class=\"d-head\" \u002F>\u003Crect x=\"564\" y=\"70\" width=\"116\" height=\"64\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"622\" y=\"98\" text-anchor=\"middle\" class=\"d-text\">Antwort\u003C\u002Ftext>\u003Ctext x=\"622\" y=\"119\" text-anchor=\"middle\" class=\"d-small\">gleiche JSON-Form\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"172\" class=\"d-label\">ZUSTAND UND OBSERVABILITY\u003C\u002Ftext>\u003Cpath d=\"M214 216 V146\" class=\"d-line d-dash\" \u002F>\u003Cpath d=\"M214 138 l-5 9 h10 z\" class=\"d-head\" \u002F>\u003Cpath d=\"M350 216 V146\" class=\"d-line d-dash\" \u002F>\u003Cpath d=\"M350 138 l-5 9 h10 z\" class=\"d-head\" \u002F>\u003Cpath d=\"M601 216 V146\" class=\"d-line d-dash\" \u002F>\u003Cpath d=\"M601 138 l-5 9 h10 z\" class=\"d-head\" \u002F>\u003Crect x=\"134\" y=\"216\" width=\"160\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"214\" y=\"244\" text-anchor=\"middle\" class=\"d-text\">Postgres\u003C\u002Ftext>\u003Ctext x=\"214\" y=\"265\" text-anchor=\"middle\" class=\"d-small\">Schlüssel, Kosten\u003C\u002Ftext>\u003Crect x=\"270\" y=\"216\" width=\"160\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"350\" y=\"244\" text-anchor=\"middle\" class=\"d-text\">Redis\u003C\u002Ftext>\u003Ctext x=\"350\" y=\"265\" text-anchor=\"middle\" class=\"d-small\">Cooldowns, Cache\u003C\u002Ftext>\u003Crect x=\"502\" y=\"216\" width=\"198\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"601\" y=\"244\" text-anchor=\"middle\" class=\"d-text\">Callbacks\u003C\u002Ftext>\u003Ctext x=\"601\" y=\"265\" text-anchor=\"middle\" class=\"d-small\">Langfuse, OTEL\u003C\u002Ftext>\u003Ctext x=\"360\" y=\"306\" text-anchor=\"middle\" class=\"d-label\">Das Gateway verwahrt nie die Anbieterschlüssel\u003C\u002Ftext>",[152],"Ein Sprung vor jedem Anbieter. Postgres und Redis machen aus einem Übersetzer einen Kontrollpunkt und müssen zugleich dimensioniert und gesichert werden.",{"type":110,"content":154},[155],"Modellnamen sind die Abstraktion, auf der das Ganze beruht. Die Konfigurationsdatei listet Deployments unter einem gemeinsamen Alias, mehrere Deployments dürfen denselben Alias tragen, und eine Anfrage für diesen Alias beantwortet das Deployment, das die Routingstrategie wählt. Verschiebt man den Alias, wechseln alle Aufrufer den Anbieter ohne Codeänderung. In derselben Tabelle stehen die Fallbacks: Ein ausgefallenes Deployment wird entweder unter den Geschwistern neu gewählt oder an ein benanntes Fallback-Modell eskaliert.",{"type":117,"level":157,"id":158,"text":159},3,"overhead","Gemessene Zusatzlast",{"type":110,"content":161},[162],"Die Benchmark-Seite nennt 8 ms p95 bei 1.000 Anfragen pro Sekunde auf vier Instanzen mit je 4 vCPU und 8 GB sowie für den Realtime-Endpunkt 59 ms Median, 67 ms p95 und 99 ms p99 bei 1.207 RPS. Dieselbe Seite veröffentlicht einen direkten Vergleich mit Portkey bei rund 1.170 RPS auf gleicher Hardware, dort meldet LiteLLM p95 150 ms und p99 240 ms gegenüber 230 ms und 500 ms.",{"type":110,"content":164},[165],"Nützlicher ist der Vorbehalt, den die Dokumentation selbst liefert. Der Lastgenerator schläft zwischen Anfragen 0,5 bis 1 Sekunde, es sind also jederzeit rund 130 Anfragen offen; ein Closed-Loop-Client ohne Denkzeit hält 1.000 und meldet bei gleichem Durchsatz ungefähr achtmal so hohe Latenz. Eine veröffentlichte Latenzzahl ohne die zugehörige In-Flight-Tiefe bedeutet nichts, und das ist mehr Offenlegung als die meisten Anbieterbenchmarks mitbringen.",{"type":167,"variant":168,"title":169,"body":170},"callout","note","Selbst messen",[171],[172,173,177],"Die Dokumentation liefert einen Modus ",{"tag":174,"children":175},"code",[176],"network_mock",", der ausgehende Anfragen auf der HTTP-Transportschicht abfängt und vorbereitete Antworten zurückgibt, dazu ein öffentliches Benchmark-Skript. Das gegen den eigenen Verkehr zu fahren dauert Minuten und liefert die einzige Zusatzlastzahl, mit der man planen sollte.",{"type":117,"level":118,"id":91,"text":92},{"type":110,"content":180},[181],"Das kleinste sinnvolle Deployment ist eine Konfigurationsdatei mit zwei Deployments unter einem Alias, einem Master-Schlüssel und einer Postgres-Verbindung. Caching, Guardrails, Callbacks und die Admin-Oberfläche kommen später.",{"type":174,"code":183},"# config.yaml: zwei Deployments unter einem Alias, plus ein verwalteter Fallback\nmodel_list:\n  - model_name: chat-fast\n    litellm_params:\n      model: openai\u002Fgpt-5.6-luna\n      api_key: os.environ\u002FOPENAI_API_KEY\n      rpm: 900\n  - model_name: chat-fast\n    litellm_params:\n      model: anthropic\u002Fclaude-sonnet-5\n      api_key: os.environ\u002FANTHROPIC_API_KEY\n      rpm: 60\n  - model_name: chat-cheap\n    litellm_params:\n      model: openai\u002Fgpt-5.6-luna\n      api_key: os.environ\u002FOPENAI_API_KEY\n\nrouter_settings:\n  routing_strategy: simple-shuffle\n  num_retries: 2\n  fallbacks:\n    - chat-fast: [chat-cheap]\n\ngeneral_settings:\n  master_key: os.environ\u002FLITELLM_MASTER_KEY\n  database_url: os.environ\u002FDATABASE_URL\n\n# docker run -p 4000:4000 -v $(pwd)\u002Fconfig.yaml:\u002Fapp\u002Fconfig.yaml \\\n#   -e DATABASE_URL -e LITELLM_MASTER_KEY \\\n#   docker.litellm.ai\u002Fberriai\u002Flitellm:latest --config \u002Fapp\u002Fconfig.yaml",{"type":110,"content":185},[186,187,190],"Die Client-Änderung sind zwei Zeilen: das OpenAI-SDK auf den Proxy zeigen und einen virtuellen Schlüssel statt des Anbieterschlüssels übergeben. Jede Antwort trägt den Header ",{"tag":174,"children":188},[189],"x-litellm-overhead-duration-ms"," mit der selbst verursachten Zusatzlast, und genau darauf sollte ein Alarm feuern, wenn die Latenz steigt, ohne dass sich der Anbieter geändert hat.",{"type":167,"variant":192,"title":193,"body":194},"warn","Retries multiplizieren, Parallelitätsgrenzen lehnen jetzt ab",[195],[196,197,200,201,204,205,208,209,212],"Die Dokumentation stellt klar, dass ",{"tag":174,"children":198},[199],"num_retries"," die eigene Schleife von LiteLLM ist und dass ",{"tag":174,"children":202},[203],"max_retries"," des Anbieter-SDKs bei gerouteten Aufrufen auf null gepinnt bleibt, ein Deployment-Wert also nicht doppelt greift. Getrennt davon liefert ein Deployment, dessen ",{"tag":174,"children":206},[207],"max_parallel_requests"," oder abgeleitetes ",{"tag":174,"children":210},[211],"rpm","-Limit erschöpft ist, sofort 429 statt zu warten. Frühere Versionen warteten auf einen freien Platz; wer sich auf diese Warteschlange verlassen hat, muss das Limit anheben statt das Timeout zu verlängern.",{"type":117,"level":118,"id":94,"text":95},{"type":110,"content":215},[216],"Das Schlüsselmodell ist der Grund, warum sich LiteLLM rechnet. Ein virtueller Schlüssel trägt eine Modellerlaubnis, ein Höchstbudget mit Zurücksetzintervall, TPM- und RPM-Limits, eine Parallelitätsgrenze und einen Besitzer. Schlüssel erben von ihrem Besitzer, was bequem ist und zugleich die schärfste Kante des Designs: Ein von einem Admin ohne Nutzer-ID erzeugter Schlüssel erbt gar nichts, und ein Schlüssel, dessen Besitzer Proxy-Admin ist, erreicht die Verwaltungsrouten, weil der Verwaltungszugriff der Rolle des Besitzers folgt und nicht den eigenen Berechtigungen des Schlüssels.",{"type":174,"code":218},"# einen Schlüssel für ein Team erzeugen: gedeckelt, ratenbegrenzt, zugeordnet\ncurl 'http:\u002F\u002Flocalhost:4000\u002Fkey\u002Fgenerate' \\\n  -H \"Authorization: Bearer $LITELLM_MASTER_KEY\" \\\n  -H 'Content-Type: application\u002Fjson' \\\n  -d '{\n    \"models\": [\"chat-fast\"],\n    \"max_budget\": 40,\n    \"budget_duration\": \"30d\",\n    \"rpm_limit\": 600,\n    \"tpm_limit\": 400000,\n    \"metadata\": {\"team\": \"platform\", \"env\": \"prod\"}\n  }'\n\n# was hat dieser Schlüssel ausgegeben, und gegen welches Limit\ncurl 'http:\u002F\u002Flocalhost:4000\u002Fkey\u002Finfo?key=sk-...' \\\n  -H \"Authorization: Bearer $LITELLM_MASTER_KEY\"",{"type":110,"content":220},[221],"Die Kosten werden aus derselben öffentlichen Preistabelle berechnet, die das SDK mitliefert, bei jedem Completion-, Embedding- und Image-Aufruf geschrieben und je Schlüssel, Nutzer und Team abfragbar. Diese Zahlen sind also Schätzungen aus einer Tabelle, die der Abrechnung des Anbieters hinterherlaufen kann: nah genug für eine interne Kostenverrechnung, zu ungenau für den Abgleich einer Rechnung. Wenn eine Zahl vertraglich zählt, kommt sie aus der Anbieterrechnung.",{"type":117,"level":118,"id":97,"text":98},{"type":110,"content":224},[225],"Das Gateway ist unter MIT dauerhaft kostenlos selbst zu hosten, ohne Sitzungs- und ohne Token-Gebühr. Die Preisseite führt zur Open-Source-Stufe mehr als 140 Provider-Integrationen, virtuelle Schlüssel, Nutzer und Teams, Kostentracking, Budgets und Ratelimits, LLM-Fallbacks, Request- und Response-Logging, Prometheus-Metriken und Guardrails. Die Beschaffung läuft direkt oder über den AWS Marketplace und Reseller.",{"type":110,"content":227},[228],"Die Lizenz kauft Kontrolle, nicht Durchsatz. SSO ist bis zu fünf Nutzer inklusive und darüber hinaus lizenzpflichtig; SCIM, Audit-Logs, Schreibzugriff auf Secret Manager, IP-Allowlists, die Multi-Region-Steuerungsebene, virtuelle Schlüsselrotation und die eingebauten Moderations-Callbacks liegen alle dahinter, und die Dokumentation benennt sie einzeln, damit niemand die Grenze nach dem Rollout entdeckt. Der Enterprise-Preis wird nach jährlicher Anfragekapazität und Deployment-Form kalkuliert, nie pro Token, und es gibt keinen Listenpreis, also beginnt jeder echte Kostenvergleich mit einem Gespräch mit dem Vertrieb.",{"type":117,"level":118,"id":100,"text":101},{"type":110,"content":231},[232],"Die Schwächen sind betrieblich, nicht funktional. Der Proxy braucht Postgres und ab mehr als einer Instanz Redis; das ist ein zustandsbehaftetes System mit Schema-Migrationen und Verbindungsarithmetik, und die Dokumentation hat eigene Seiten zur Dimensionierung genau weil dort Deployments scheitern. Das Python-SDK zieht einen großen Abhängigkeitsbaum in einen Dienst, der im Kern Anfragen formatiert. Und der Supply-Chain-Vorfall vom März 2026, bei dem mit LiteLLM präparierte Versionen über PyPI verbreitet wurden, erinnert daran, dass hier ein Paket mit sehr hohen Installationszahlen Produktionsschlüssel verarbeitet.",{"type":234,"head":235,"rows":243},"table",[236,238,239,241],[237],"",[24],[240],"Portkey",[242],"Bifrost",[244,253,262,271],[245,247,249,251],[246],"Deployment",[248],"Selbst gehostet, air-gap-fähig",[250],"Verwaltete Cloud und selbst gehostet",[252],"Selbst gehostet",[254,256,258,260],[255],"Kostenbasis",[257],"OSS kostenlos, Lizenz nach Kapazität",[259],"Monatliches Abo",[261],"Kein öffentlicher Preis",[263,265,267,269],[264],"Vom Anbieter genannte p99-Last",[266],"0,66 ms",[268],"2,29 ms",[270],"4,54 ms",[272,274,276,278],[273],"Passt am besten zu",[275],"Plattformteam mit Zugangskontrolle",[277],"Guardrails zuerst",[279],"Minimaler Hop-Overhead",{"type":110,"content":281},[282],"Diese Lastzahlen stammen aus dem Benchmark von LiteLLM selbst, gemessen mit allen Gateways auf demselben deterministischen Mock-Upstream und identischer Hardware, was den Vergleich fair und den Sieger vorhersehbar macht. Für alles, was kein LLM-Gateway ist, verdient die Kubernetes-native Variante einen Blick: Envoy AI Gateway stellt die OpenAI-Routing-Oberfläche bereit, ohne einen Python-Laufzeitprozess in den Anfragepfad zu bringen, und dieser strukturelle Unterschied wiegt schwerer als alle Zahlen oben.",{"type":117,"level":118,"id":103,"text":104},{"type":110,"content":285},[286],"LiteLLM ist die richtige Voreinstellung für ein Plattformteam, das vielen Teams Zugang zu mehreren Anbietern geben muss und drei Fragen im Betrieb beantworten will: wer hat das ausgegeben, welches Deployment hat gearbeitet, und was passiert, wenn dieser Anbieter abbaut. Es beantwortet alle drei besser als die Alternativen und nimmt dabei nicht einmal die Anbieterschlüssel in Verwahrung.",{"type":123,"ordered":288,"items":289},true,[290,292,294,296,298],[291],"Nehmen, wenn mehr als ein Team über mehr als einen Anbieter Modelle aufruft. Budgets, Kostenverrechnung und Fallback über Anbietergrenzen hinweg rechtfertigen das zustandsbehaftete Deployment.",[293],"Nehmen, wenn die Bündelung der Beschaffung das Ziel ist. Der Wechsel von einem Modell zum nächsten wird zur Konfigurationsänderung statt zur Sicherheitsprüfungs-Runde.",[295],"Zuerst nur das SDK nehmen, wenn es einen einzigen Dienst gibt. Es vereinheitlicht Fehler und Antworten für einen Bruchteil der Betriebskosten und lässt die Tür zum Proxy später offen.",[297],"Lass weg, wenn ein Team und ein Anbieter die ganze Geschichte sind. Anbieter-SDK und eine Kostenübersicht sind weniger Maschinerie für dasselbe Ergebnis.",[299],"Lass weg, wenn auf dem heißen Pfad die letzte Millisekunde zählt. Das Gateway ist ein Python-Prozess im Anfragepfad, und die Rust-Neufassung ist noch als Beta gekennzeichnet.",{"type":167,"variant":301,"title":302,"body":303},"tip","Vor der Zusage",[304],[305],"Eine Minor-Linie festpinnen, deren Patches einspielen und hochgehen, bevor sie aus dem Support-Fenster von vier Linien fällt. Die Seite zur Datenbankdimensionierung vor der ersten Skalierung lesen, nicht danach. Und wenn das Anbieter-SDK überall schon installiert ist, die exakte Version in einer Lockdatei pinnen statt dem Resolver zu vertrauen.",{"type":117,"level":118,"id":106,"text":107},{"type":123,"ordered":288,"items":308},[309,314,318,322,326,330,334],[310],{"tag":311,"href":32,"children":312},"a",[313],"LiteLLM-Dokumentation: Erste Schritte",[315],{"tag":311,"href":35,"children":316},[317],"LiteLLM-Dokumentation: virtuelle Schlüssel",[319],{"tag":311,"href":38,"children":320},[321],"LiteLLM-Dokumentation: Router und Load Balancing",[323],{"tag":311,"href":41,"children":324},[325],"LiteLLM-Dokumentation: Benchmarks",[327],{"tag":311,"href":44,"children":328},[329],"LiteLLM-Dokumentation: unterstützte Endpunkte",[331],{"tag":311,"href":47,"children":332},[333],"LiteLLM-Dokumentation: Enterprise",[335],{"tag":311,"href":50,"children":336},[337],"LiteLLM-Preise",[339,388,463,524],{"slug":340,"published":341,"minutes":342,"category":7,"tags":343,"keywords":349,"about":356,"sources":360,"cover":379,"og":380,"expertise":53,"locales":381,"lang":56,"title":382,"description":383,"coverAlt":384,"url":385,"pricing":386,"kind":387},"ollama","2026-09-29",11,[344,345,346,347,348],"Local inference","Open models","llama.cpp","GGUF","Model serving",[340,350,351,352,353,354,355],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[357],{"name":358,"url":359},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[361,364,367,370,373,376],{"title":362,"url":363},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":365,"url":366},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":368,"url":369},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":371,"url":372},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":374,"url":375},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":377,"url":378},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg",[55,56,57],"Ollama im Test: der freundliche Weg zu offenen Modellen","Ollama liefert offene Modelle über eine HTTP-API auf eigener Hardware aus. Was es gut macht, wo der Durchsatz zu kurz kommt, was die MIT-Lizenz nicht abdeckt.","Abstrakte Titelgrafik für den Ollama-Test","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime",{"slug":389,"published":390,"minutes":342,"category":7,"tags":391,"keywords":394,"about":400,"sources":406,"cover":456,"og":457,"expertise":53,"locales":458,"lang":56,"title":459,"description":460,"coverAlt":461,"url":402,"pricing":462,"kind":9},"portkey","2026-09-28",[9,392,12,393,11],"Guardrails","Observability",[395,396,16,397,398,20,399],"portkey ai gateway","portkey vs litellm","llm gateway latency overhead","llm guardrails gateway","portkey pricing",[401,403],{"name":240,"url":402},"https:\u002F\u002Fportkey.ai",{"name":404,"url":405},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[407,410,413,416,419,422,425,428,431,434,437,440,443,446,449,452,453],{"title":408,"url":409},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":411,"url":412},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":414,"url":415},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":417,"url":418},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":420,"url":421},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":423,"url":424},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":426,"url":427},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":429,"url":430},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":432,"url":433},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":435,"url":436},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":438,"url":439},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":441,"url":442},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":444,"url":445},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":447,"url":448},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":450,"url":451},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":49,"url":50},{"title":454,"url":455},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[55,56,57],"Portkey: ein LLM-Gateway für die Produktion, geprüft auf Routing, Guardrails und Kosten","Portkey bündelt Retries, Fallbacks, Cache, Guardrails und Kostenkontrolle hinter einer OpenAI-kompatiblen Schnittstelle. Was die Konfiguration gut löst und was das Gateway an Latenz kostet.","Ein Requestweg von der Anwendung durch das Portkey-Gateway zu drei Modellanbietern, darunter das Guardrail-Ergebnis und das Protokoll.","Free · from $49 per month",{"slug":464,"published":465,"minutes":6,"category":7,"tags":466,"keywords":472,"about":480,"sources":492,"cover":517,"og":518,"expertise":53,"locales":519,"lang":56,"title":520,"description":521,"coverAlt":522,"url":483,"pricing":523,"kind":467},"langfuse","2026-08-13",[467,468,469,470,471],"LLM observability","Tracing","OpenTelemetry","Self-hosting","Evaluation",[464,473,474,475,476,477,478,479],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[481,484,486,489],{"name":482,"url":483},"Langfuse","https:\u002F\u002Flangfuse.com",{"name":469,"url":485},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":487,"url":488},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":490,"url":491},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[493,496,499,502,505,508,511,514],{"title":494,"url":495},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":497,"url":498},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":500,"url":501},"Langfuse pricing: cloud plans, billable units and worked examples","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":503,"url":504},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":506,"url":507},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":509,"url":510},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":512,"url":513},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":515,"url":516},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[55,56,57],"Langfuse-Test: Tracing, Prompts und Evals selbst gehostet","Langfuse legt LLM-Traces, Prompt-Versionen und Experimente auf eine MIT-lizenzierte Plattform. Was das Selbsthosten wirklich kostet, wie die Einheitspreise rechnen und wo es verliert.","Eine Pipeline vom gebündelten Application-Event über den Langfuse-Web-Container und den Object Storage in ClickHouse, mit Redis und PostgreSQL daneben.","MIT · paid from $59 per month",{"slug":525,"published":526,"minutes":6,"category":7,"tags":527,"keywords":531,"about":538,"sources":542,"cover":558,"og":559,"expertise":53,"locales":560,"lang":56,"title":561,"description":562,"coverAlt":563,"url":564,"pricing":565,"kind":9},"openrouter","2026-07-23",[9,528,529,10,530],"Model routing","Fallbacks","Pay per token",[525,532,16,533,534,535,536,537],"openrouter vs litellm","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[539],{"name":540,"url":541},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[543,546,547,550,553,556],{"title":544,"url":545},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":454,"url":455},{"title":548,"url":549},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":551,"url":552},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":554,"url":555},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":557,"url":541},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg",[55,56,57],"OpenRouter: ein API-Schlüssel vor jedem Modell im Katalog","OpenRouter packt 500+ Modelle von 80+ Anbietern hinter einen OpenAI-kompatiblen Endpunkt, mit Fallbacks und Weiterverrechnung zum Listenpreis. Kosten und Schwächen.","Anfragepfad durch OpenRouter: Client, Router, mögliche Anbieter, Fallback-Liste und das Modell, das tatsächlich antwortet.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription",1791383550875]