[{"data":1,"prerenderedAt":701},["ShallowReactive",2],{"tool-ollama-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":21,"sources":25,"cover":44,"og":45,"expertise":46,"locales":47,"lang":49,"title":51,"description":52,"coverAlt":53,"url":54,"pricing":55,"kind":56,"metaTitle":57,"takeaways":58,"faq":64,"toc":77,"blocks":102,"others":458},"ollama","2026-09-29",11,"llmops",[9,10,11,12,13],"Local inference","Open models","llama.cpp","GGUF","Model serving",[4,15,16,17,18,19,20],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[22],{"name":23,"url":24},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[26,29,32,35,38,41],{"title":27,"url":28},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":30,"url":31},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":33,"url":34},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":36,"url":37},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":39,"url":40},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":42,"url":43},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg","ai-engineer",[48,49,50],"en","de","hu","Ollama im Test: der freundliche Weg zu offenen Modellen","Ollama liefert offene Modelle über eine HTTP-API auf eigener Hardware aus. Was es gut macht, wo der Durchsatz zu kurz kommt, was die MIT-Lizenz nicht abdeckt.","Abstrakte Titelgrafik für den Ollama-Test","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime","Ollama im Test: freundliche lokale Laufzeit · Balázs Csorba",[59,60,61,62,63],"Ollamas eigene Software ist MIT-lizenziert, ohne Nutzungseinschränkung und ohne Nutzergrenze; die oft zugeschriebene Grenze von 700 Millionen monatlich aktiven Nutzern gehört zur Llama Community Licence von Meta und gilt für die Gewichte, nicht für die Laufzeitumgebung.","Parallele Anfragen teilen sich ein Kontextfenster, statt gebündelte Sequenzen zu bekommen: Der Speicher skaliert mit OLLAMA_NUM_PARALLEL mal Kontextlänge, und die Parallelität liegt standardmäßig bei eins.","Der Server auf Port 11434 hat keine Authentifizierung, und der OpenAI-kompatible Endpunkt ignoriert den verlangten Schlüssel; er bindet standardmäßig auf Loopback und sollte dort bleiben.","Die Ollama Cloud ist ein bezahlter Token-Dienst neben der Laufzeitumgebung, Pro kostet $20 im Monat bei $60 Guthaben, während lokale Inferenz auf eigener Hardware unbegrenzt und kostenlos bleibt.","Das richtige Werkzeug für Entwicklung, Evaluierung und On-Prem-Betrieb auf einem Knoten – und das falsche, sobald der Durchsatz pro GPU über das Projekt entscheidet.",[65,68,71,74],{"q":66,"a":67},"Ist Ollama wirklich MIT-lizenziert, oder gibt es eine Nutzungsgrenze?","Die Software ist MIT-lizenziert, ohne Zusatzklausel, also ohne Nutzer-Obergrenze und ohne OpenAI-Einschränkung. Die Klausel mit 700 Millionen monatlich aktiven Nutzern, die oft Ollama zugeschrieben wird, stammt aus Metas Llama Community Licence und gilt für die heruntergeladenen Llama-Gewichte, nicht für die ausliefernde Laufzeitumgebung. Der Zugang zu ollama.com selbst regeln gesondert die Nutzungsbedingungen, zuletzt aktualisiert im Mai 2026.",{"q":69,"a":70},"Braucht Ollama einen API-Schlüssel?","Für einen lokalen Server nicht. Die lokale Instanz hat überhaupt keine Authentifizierung, und der OpenAI-kompatible Endpunkt verlangt trotzdem einen Schlüsselwert, den er dann ignoriert – jeder Platzhalter tut es. Cloud-Anfragen an https:\u002F\u002Follama.com brauchen einen Schlüssel, und ein mit ollama signin angemeldeter lokaler Server kann zu Cloud-Modellen weiterleiten.",{"q":72,"a":73},"Wie bediene ich mehr als eine Anfrage gleichzeitig?","Setzen Sie OLLAMA_NUM_PARALLEL, dessen Standard 1 ist. Der Speicher skaliert mit parallelen Anfragen mal Kontextlänge, und das Kontextfenster wird zwischen ihnen geteilt: vier parallele Anfragen auf einem 2.000-Token-Kontext verhalten sich wie ein 8.000-Token-Kontext. Anfragen über dem Limit werden eingereiht, bis OLLAMA_MAX_QUEUE, standardmäßig 512, danach kommt ein 503.",{"q":75,"a":76},"Ist Ollama schneller als vLLM?","Nein, und darauf zielt es auch nicht ab. Ollama bedient standardmäßig eine Anfrage pro Modell, legt parallele Anfragen in einen gemeinsamen Kontext statt sie unabhängig zu bündeln, und kennt keine Parallelität über mehrere Knoten. Für interaktive Nutzung mit wenigen gleichzeitigen Aufrufern ist der Unterschied klein; beim Batch-Durchsatz pro GPU ist er die gesamte Entscheidung.",[78,81,84,87,90,93,96,99],{"id":79,"title":80},"what-it-is","Was es tatsächlich ist",{"id":82,"title":83},"how-it-works","Wie es funktioniert",{"id":85,"title":86},"getting-started","Erste Schritte",{"id":88,"title":89},"licence","Die Lizenz – und die Klausel, die es nicht gibt",{"id":91,"title":92},"production","Betrieb in Produktion",{"id":94,"title":95},"where-it-shingles","Wo es scheitert",{"id":97,"title":98},"verdict","Urteil",{"id":100,"title":101},"sources","Quellen",[103,107,110,113,116,156,157,160,169,172,173,176,179,182,211,212,215,218,235,240,241,244,313,316,326,331,332,335,397,400,403,404,407,432,436,437],{"type":104,"content":105},"paragraph",[106],"Ollama ist eine lokale Inference-Laufzeitumgebung. Sie lädt offene Gewichtsmodelle herunter, legt sie auf der vorhandenen GPU oder CPU ab und stellt sie über eine HTTP-API auf Port 11434 bereit. Der Anbieter nennt mehr als neun Millionen Installationen pro Monat, über eine Milliarde Modell-Downloads und 182.000 GitHub-Sterne – und diese Reichweite ist erklärbar: Es ist der mit dem geringsten Aufwand erreichbare Weg, ein offenes Modell tatsächlich zum Antworten zu bringen. Der Tausch steckt in denselben Zahlen. Ollama optimiert darauf, ein Modell zum Laufen zu bringen, nicht darauf, Tokens aus einer GPU zu pressen, und wer es für einen Produktions-Inferenzserver hält, wird das merken.",{"type":104,"content":108},[109],"Im Stack ist es ein Modellserver, kein Framework. Es ersetzt den eigenen Server von llama.cpp, die Laufzeitumgebung von LM Studio und ein von Hand gebautes Docker-Image – und konkurriert mit vLLM nur im allereisesten Sinne. Darüber liegen LangChain, LlamaIndex, die Coding-Agents und die selbst gehosteten Chat-Oberflächen; austauschbar mit alledem macht Ollama die Form seiner API, nicht das, was darin passiert. Was es nicht liefert, sind Orchestrierung, kontinuierliches Batching, Autoscaling oder Tensor-Parallelität über mehrere Knoten. Das bleibt bei vLLM oder SGLang.",{"type":111,"level":112,"id":79,"text":80},"heading",2,{"type":104,"content":114},[115],"Ollama ist ein Go-Server mit angebautem Modellverwalter, kein Modell. Er wird als eine Binärdatei, eine CLI und ein Docker-Image ausgeliefert, und die CLI ist die gesamte Produktoberfläche, die die meisten je berühren. Die Engines darunter sind llama.cpp für CUDA, ROCm, Vulkan und CPU sowie – seit v0.40.0 – MLX als Standard auf Apple Silicon für die unterstützten Architekturen. Alles Übrige ist Verpackung um diese Engines, und genau deshalb lohnt es sich zu wissen, wo die Grenze verläuft.",{"type":117,"ordered":118,"items":119},"list",false,[120,126,131,136,141,146,151],[121,125],{"tag":122,"children":123},"strong",[124],"Lizenz:"," MIT für die Software, ohne Nutzungseinschränkung, ohne Nutzergrenze und ohne Zusatzklausel.",[127,130],{"tag":122,"children":128},[129],"Aktuelles Release:"," v0.40.0, als Plattform-Binärdateien und Docker-Image. Der Takt ist schnell, die Nummern springen aber: auf v0.34.4 folgte v0.35.1 und dann direkt v0.40.0.",[132,135],{"tag":122,"children":133},[134],"APIs:"," eine native REST-Fläche unter \u002Fapi, eine OpenAI-kompatible Fläche unter \u002Fv1 und eine Anthropic-kompatible Basis-URL – lokal wie in der Ollama Cloud gleichermassen.",[137,140],{"tag":122,"children":138},[139],"Engines:"," llama.cpp für CUDA, ROCm, Vulkan und CPU, dazu MLX auf Apple Silicon ab v0.40.0. Nvidia verlangt Compute Capability 5.0 oder neuer, AMD unter Linux den ROCm-v7-Treiber.",[142,145],{"tag":122,"children":143},[144],"Modellformat:"," GGUF für llama.cpp-Modelle, Safetensors für MLX. Seit v0.34.1 muss die GGUF-Konvertierung mit llama.cpp-Werkzeugen stattfinden, nicht in Ollama.",[147,150],{"tag":122,"children":148},[149],"Anpassung:"," eine Modelfile mit FROM, PARAMETER, TEMPLATE, SYSTEM, MESSAGE, LICENSE, REQUIRES und CAPABILITY – ein abgestimmtes Modell ist damit eine reviewbare Textdatei.",[152,155],{"tag":122,"children":153},[154],"Ebenfalls enthalten:"," strukturiertes Ausgeben gegen ein JSON-Schema, Tool-Calling, Vision, Embeddings, Websuche, experimentelle Bildgenerierung unter macOS und Entscheidungsmodelle, die Wahrscheinlichkeiten statt Text zurückgeben.",{"type":111,"level":112,"id":82,"text":83},{"type":104,"content":158},[159],"Im Zentrum steht ein HTTP-Server, der eine Modellbibliothek und einen VRAM-bewussten Scheduler hält. Eine Anfrage nennt ein Modell-Tag; liegen diese Gewichte nicht schon im Speicher, lädt der Server sie, und passen sie nicht neben das bereits Geladene, reiht sich die Anfrage ein, während ein untätiges Modell verdrängt wird. Geladene Modelle bleiben fünf Minuten nach der letzten Anfrage resident, die Kontextlänge richtet sich nach der VRAM-Klasse der Maschine, und parallele Anfragen an ein Modell teilen sich dessen Kontext, statt je einen eigenen zu bekommen.",{"type":161,"attrs":162,"inner":166,"caption":167},"diagram",{"viewBox":163,"role":164,"aria-labelledby":165},"0 0 720 250","img","ol-pfad-t ol-pfad-d","\u003Ctitle id=\"ol-pfad-t\">Weg einer Anfrage durch den Ollama-Server\u003C\u002Ftitle>\u003Cdesc id=\"ol-pfad-d\">Eine Anfrage erreicht \u002Fapi\u002Fchat und nennt ein Modell-Tag. Der Scheduler prüft die gemeldete VRAM. Liegen die Gewichte schon resident, startet die Generierung sofort; sonst reiht sich die Anfrage ein, die Gewichte werden in die VRAM geladen und die Anfrage erneut versucht. Nach der Generierung bleibt das Modell für das keep_alive-Fenster untätig, standardmäßig fünf Minuten, und wird danach entladen, sodass seine VRAM wieder frei wird.\u003C\u002Fdesc>\u003Cdefs>\u003Cmarker id=\"ah-ol\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head\" \u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Crect x=\"20\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"95\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">request\u003C\u002Ftext>\u003Ctext x=\"95\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">POST \u002Fapi\u002Fchat\u003C\u002Ftext>\u003Crect x=\"195\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"270\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">scheduler\u003C\u002Ftext>\u003Ctext x=\"270\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">reads VRAM\u003C\u002Ftext>\u003Crect x=\"370\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"445\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">engine\u003C\u002Ftext>\u003Ctext x=\"445\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">ggml or MLX\u003C\u002Ftext>\u003Crect x=\"545\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"620\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">tokens\u003C\u002Ftext>\u003Ctext x=\"620\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">streamed NDJSON\u003C\u002Ftext>\u003Crect x=\"20\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"95\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">queue\u003C\u002Ftext>\u003Ctext x=\"95\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">MAX_QUEUE\u003C\u002Ftext>\u003Crect x=\"195\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"270\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">load weights\u003C\u002Ftext>\u003Ctext x=\"270\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">then retry\u003C\u002Ftext>\u003Crect x=\"370\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"445\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">idle\u003C\u002Ftext>\u003Ctext x=\"445\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">keep_alive\u003C\u002Ftext>\u003Crect x=\"545\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"620\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">unload\u003C\u002Ftext>\u003Ctext x=\"620\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">VRAM released\u003C\u002Ftext>\u003Cpath d=\"M170 82H193\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M345 82H368\" class=\"d-line-accent\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M520 82H543\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M270 116V142H95V168\" class=\"d-line d-dash\" marker-end=\"url(#ah-ol)\" \u002F>\u003Ctext x=\"182\" y=\"138\" text-anchor=\"middle\" class=\"d-label\">no free VRAM\u003C\u002Ftext>\u003Cpath d=\"M170 200H193\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M345 200H445V120\" class=\"d-line-accent\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M445 116V168\" class=\"d-line d-dash\" marker-end=\"url(#ah-ol)\" \u002F>\u003Ctext x=\"455\" y=\"146\" class=\"d-label\">5 min\u003C\u002Ftext>\u003Cpath d=\"M520 200H543\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M620 116V168\" class=\"d-line d-dash\" marker-end=\"url(#ah-ol)\" \u002F>",[168],"Der gesamte Lebenszyklus einer Anfrage: eine VRAM-Prüfung, ein sofortiger Start, wenn die Gewichte resident sind, sonst Warteschlange und Laden, danach ein Leerlauf-Fenster mit anschließendem Entladen.",{"type":104,"content":170},[171],"Dieses Design hat eine Folge, die Leute überrascht: Das Modell ist die Einheit der Planung und die Einheit der Kosten. Ein Tag-Wechsel unter Last bedeutet ein Laden, eine VRAM-Prüfung und auf einer Maschine mit einer GPU möglicherweise das Verdrängen dessen, was gerade allen anderen geantwortet hat. Ollamas Antwort sind OLLAMA_MAX_LOADED_MODELS und OLLAMA_NUM_PARALLEL – und beide bezahlt man mit Speicher statt mit Rechenleistung.",{"type":111,"level":112,"id":85,"text":86},{"type":104,"content":174},[175],"Die Installation ist ein Shell-Skript, eine Desktop-App oder ein Docker-Image. Die API ist ein POST, und ein lokaler Server braucht weder Schlüssel noch Konfigurationsdatei. Das Snippet unten ist das Kleinste, was in der Produktion zu schreiben sich lohnt: ein streamender Aufruf mit explizitem Kontextfenster, ein zwischen den Aufrufen resident gehaltenes Modell und die Zeitmessfelder, die der Server ohnehin berechnet.",{"type":177,"code":178},"code","import json, urllib.request, time\n\nURL = \"http:\u002F\u002Flocalhost:11434\u002Fapi\u002Fchat\"\nBODY = {\n    \"model\": \"gemma4\",\n    \"messages\": [{\"role\": \"user\", \"content\": \"Summarise this ticket in one line.\"}],\n    \"stream\": True,\n    \"keep_alive\": \"30m\",              # keep the weights resident between calls\n    \"options\": {\"num_ctx\": 8192, \"temperature\": 0},\n}\n\nrequest = urllib.request.Request(\n    URL, data=json.dumps(BODY).encode(), headers={\"Content-Type\": \"application\u002Fjson\"})\n\nchunks = []\nwith urllib.request.urlopen(request) as response:\n    for line in response:                       # newline-delimited JSON events\n        event = json.loads(line)\n        if \"message\" in event:\n            chunks.append(event[\"message\"].get(\"content\", \"\"))\n        if event.get(\"done\"):\n            seconds = event[\"eval_duration\"] \u002F 1e9   # nanoseconds\n            print(f\"{event['eval_count']} tokens in {seconds:.1f}s\"\n                  f\" -> {event['eval_count'] \u002F seconds:.1f} tok\u002Fs\")\n            print(f\"prompt tokens {event['prompt_eval_count']}, cached\"\n                  f\" {event.get('prompt_eval_cached_count', 0)},\"\n                  f\" load {event['load_duration'] \u002F 1e9:.1f}s\")\n\nprint(\"\".join(chunks))",{"type":104,"content":180},[181],"Zwei Felder lohnen sich in einem Dashboard: eval_count geteilt durch eval_duration für die Generierungsgeschwindigkeit und load_duration für die Kaltstartstrafe. prompt_eval_cached_count meldet, wie viele Prompt-Token aus dem Cache kamen – das ist das einzige Gratis-Beschleunigung, die Ollama anbietet. Setzen Sie den stabilen Präfix eines Prompts zuerst und den variablen Teil zuletzt, dann wird der gemeinsame System-Prompt nicht bei jedem Aufruf neu ausgewertet.",{"type":183,"variant":184,"body":185},"callout","tip",[186],[187,188,190,191,194,195,198,199,202,203,206,207,210],"Wenn der aufrufende Code bereits OpenAI spricht, zeigen Sie base_url auf http:\u002F\u002Flocalhost:11434\u002Fv1\u002F und lassen Sie den Schlüssel als ",{"tag":177,"children":189},[4]," stehen – der Server ignoriert ihn. Die kompatible Fläche deckt Chat, Streaming, JSON-Modus, Tools und Vision ab, nicht aber logprobs, ",{"tag":177,"children":192},[193],"tool_choice",", ",{"tag":177,"children":196},[197],"logit_bias"," oder Bild-URLs. Der native Endpunkt ",{"tag":177,"children":200},[201],"\u002Fapi\u002Fchat"," führt ",{"tag":177,"children":204},[205],"logprobs"," und ",{"tag":177,"children":208},[209],"top_logprobs"," már jóval korábban, und das ist der Grund, ihn zu bevorzugen, sobald Token-Wahrscheinlichkeiten zählen.",{"type":111,"level":112,"id":88,"text":89},{"type":104,"content":213},[214],"Ollamas Software ist MIT-lizenziert, ohne Wenn und Aber. Die LICENSE-Datei im Repository ollama\u002Follama ist der unveränderte MIT-Text: keine Zusatzklausel, keine Nutzer-Obergrenze, keine Nutzungseinschränkung. Es gibt keine OpenAI-Klausel darin und keine Grenze von 700 Millionen monatlich aktiven Nutzern – und das sollte klar gesagt sein, weil die Behauptung weit verbreitet ist. Die Schwelle von 700 Millionen gehört zur Llama Community Licence von Meta, und die gilt für Llama-Gewichte, nicht für die Laufzeitumgebung, die sie ausliefert. Ollama verdient außerdem an bezahlten Cloud-Tarifen und wurde im Juli 2026 mit einer Finanzierungsrunde über 65 Millionen Dollar bedacht, und nichts davon setzt eine Klausel in die Quelllizenz.",{"type":104,"content":216},[217],"Die MIT-Gewährung deckt die Server-Binärdatei. Über die damit ausgeführten Modelle sagt sie nichts, und genau dort liegt das tatsächliche Lizenzrisiko. Die Bibliothek liefert Gewichte von einem Dutzend Herausgeber unter einem Dutzend Bedingungen aus – die bindende Lizenz steht auf der Modellkarte, nicht auf der Laufzeitumgebung. Eine Modelfile hält neben den Gewichten eine LICENSE-Anweisung fest, und ollama show --modelfile gibt sie aus. Dieser String, je Modellversion, ist das Artefakt für das Compliance-Register.",{"type":117,"ordered":118,"items":219},[220,225,230],[221,224],{"tag":122,"children":222},[223],"MIT auf der Laufzeitumgebung. ","Kommerziell nutzen, forken, in ein Produkt ausliefern. Keine Namensnennungspflicht über den Copyright-Hinweis hinaus, keine Umsatzgrenze, keine Nutzergrenze, keine Telemetrie-Pflicht.",[226,229],{"tag":122,"children":227},[228],"Die Modelllizenz ist separat. ","Metas Llama Community Licence verlangt oberhalb von 700 Millionen monatlich aktiven Nutzern eine separate Lizenz von Meta, andere Familien setzen eigene Umsatz- oder Nutzergrenzen. Manche Modelle werden nur nicht-kommerziell lizenziert ausgeliefert. Lesen Sie die Modellkarte.",[231,234],{"tag":122,"children":232},[233],"ollama.com selbst ist nicht MIT. ","Die gehostete Cloud, die Bibliothekskonten und die bezahlten Tarife fallen unter die Nutzungsbedingungen, zuletzt aktualisiert im Mai 2026: verbindliche Schiedsverfahren in San Francisco, kalifornisches Recht, eine Haftungsgrenze in Höhe der in den zwölf Monaten zuvor gezahlten Beträge und eine Klausel, die die Nutzung des Dienstes zur Entwicklung konkurrierender Produkte untersagt.",{"type":183,"variant":236,"body":237},"warn",[238],[239],"Ein Pull ist ein Download aus der Registrierung eines Dritten auf Ihre Platte, und diese Registrierung fällt nicht unter die MIT-Gewährung. Teams mit einem Modell-Freigabeprozess sollten die GGUF-Dateien, die sie tatsächlich nutzen, in eine Registrierung spiegeln, die sie selbst kontrollieren: ein Tag ist ein veränderlicher Name, und ollama pull folgt ihm. Version festhalten, Lizenz dokumentieren und einen Digest des Ausgelieferten bewahren.",{"type":111,"level":112,"id":91,"text":92},{"type":104,"content":242},[243],"Bei der Parallelität sind lokale Laufzeitumgebungen ehrlich über ihre Grenzen. Ollama verarbeitet standardmäßig eine Anfrage pro Modell, und parallele Anfragen teilen sich einen Kontext, statt unabhängig gebündelt zu werden: Die Dokumentation sagt es direkt – ein Kontext von 2.000 Tokens mit vier parallelen Anfragen verhält sich wie ein Kontext von 8.000 Tokens, und der benötigte RAM skaliert mit parallelen Anfragen mal Kontextlänge. Für interaktive Nutzung ist das ein tragfähiger Tausch, für Stapelverarbeitung ein schlechter.",{"type":245,"head":246,"rows":253},"table",[247,249,251],[248],"Einstellung",[250],"Standard",[252],"Was es kostet",[254,265,274,285,302],[255,259,263],[256],{"tag":177,"children":257},[258],"OLLAMA_NUM_PARALLEL",[260],{"tag":177,"children":261},[262],"1",[264],"RAM skaliert linear; ein gemeinsamer Kontext",[266,270,272],[267],{"tag":177,"children":268},[269],"OLLAMA_MAX_LOADED_MODELS",[271],"3 pro GPU, 3 auf CPU",[273],"Volle VRAM für jedes resident gehaltene Modell",[275,279,283],[276],{"tag":177,"children":277},[278],"OLLAMA_MAX_QUEUE",[280],{"tag":177,"children":281},[282],"512",[284],"Warteschlangentiefe, bevor Anfragen ein 503 bekommen",[286,290,292],[287],{"tag":177,"children":288},[289],"OLLAMA_KEEP_ALIVE",[291],"5 Minuten",[293,294,297,298,301],"VRAM bleibt untätig belegt; ",{"tag":177,"children":295},[296],"-1"," fixiert, ",{"tag":177,"children":299},[300],"0"," lädt sofort ab",[303,307,311],[304],{"tag":177,"children":305},[306],"OLLAMA_KV_CACHE_TYPE",[308],{"tag":177,"children":309},[310],"f16",[312],"q8_0 halbiert, q4_0 viertelt, mit Präzisionsverlust",{"type":104,"content":314},[315],"Der Server hat keine Authentifizierung. Er bindet standardmäßig auf 127.0.0.1, und der OpenAI-kompatible Endpunkt verlangt einen API-Schlüsselwert, den er anschließend ignoriert – was eine präzise Aussage darüber ist, wie sehr die lokale Fläche vertraut wird. Alles, was OLLAMA_HOST auf eine routbare Adresse setzt, veröffentlicht einen unauthentifizierten Inferenz-Endpunkt. Im Januar 2026 berichteten Forscher über rund 175.000 öffentlich erreichbare Ollama-Server in 130 Ländern, die meisten durch Bindung auf 0.0.0.0 exponiert.",{"type":117,"ordered":118,"items":317},[318,320,322,324],[319],"Lassen Sie die Bind-Adresse auf 127.0.0.1. Es gibt keine Authentifizierung zu konfigurieren, also ist ein Reverse Proxy mit TLS und echter Zugriffsprüfung die einzige verfügbare Zugriffskontrolle.",[321],"Setzen Sie OLLAMA_ORIGINS explizit, wenn ein Browser-Client es braucht. Loopback-Ursprünge sind standardmäßig erlaubt, also ist der Standard für lokale Werkzeuge richtig und für alles Geteilte falsch.",[323],"Auf Maschinen, die ollama.com gar nicht erreichen dürfen, setzen Sie OLLAMA_NO_CLOUD=1 oder disable_ollama_cloud in ~\u002F.ollama\u002Fserver.json, starten neu und prüfen die Log-Zeile Ollama cloud disabled: true.",[325],"Bedenken Sie, dass die Desktop-App sich unter macOS und Windows als Login-Element registriert: Port 11434 liefert also schon beim Start, ob danach jemand gefragt hat oder nicht.",{"type":183,"variant":327,"body":328},"note",[329],[330],"Die Ollama Cloud ist ein anderes Produkt als die lokale Laufzeitumgebung, und die Preisseite ist weit über kostenlos hinausgegangen. Cloud-Modelle rechnen pro Million Token aus Usage-Guthaben ab – gemma4 nennt $0,14 Eingang und $0,40 Ausgang, gpt-oss:20b $0,07 und $0,30 –, mit Off-Peak-Preisen außerhalb von 12:00 bis 18:00 UTC an Werktagen und ganztags am Wochenende. Pro kostet $20 im Monat mit $60 Guthaben und drei parallelen Anfragen, Max $100 mit $300 und zehn, Team $500 in der Early Access. Modelle auf der eigenen Hardware laufen auf jeder Stufe unbegrenzt und kostenlos.",{"type":111,"level":112,"id":94,"text":95},{"type":104,"content":333},[334],"Die Schwächen sind real und sie liegen an einer Stelle: der Durchsatz pro GPU. Standardmäßig eine Anfrage pro Modell, kein unabhängiges Batching paralleler Anfragen, keine Parallelität über mehrere Knoten und kein Tensor-Parallel-Serving. Für einen interaktiven Endpunkt mit einer Handvoll Nutzern fällt das nicht auf. Für alles mit Warteschlange, Stapeljob oder Kostenziel schon: Dieselbe GPU liefert einen Bruchteil dessen, was vLLM mit demselben Modell liefert – und diese Lücke ist kein Konfigurationsproblem, sondern das Design.",{"type":245,"head":336,"rows":345},[337,339,341,343],[338],"",[340],"Ollama",[342],"vLLM",[344],"llama.cpp-Server",[346,355,363,371,380,389],[347,349,351,353],[348],"Installation",[350],"Skript, App, Image",[352],"pip, Container",[354],"Binärdatei oder Build",[356,358,360,362],[357],"Durchsatz pro GPU",[359],"niedrig bis mittel",[361],"hoch",[359],[364,366,368,370],[365],"Unabhängiges Batching",[367],"nein",[369],"ja",[367],[372,374,376,378],[373],"Hardware-Reichweite",[375],"CUDA, ROCm, Vulkan, Metal, CPU",[377],"CUDA, ROCm",[379],"CUDA, Vulkan, Metal, CPU",[381,383,385,387],[382],"Betriebsaufwand",[384],"ein Server, Env-Variablen",[386],"Flags, Metriken, Cluster",[388],"eine Binärdatei, Flags",[390,392,394,396],[391],"Lizenz",[393],"MIT",[395],"Apache 2.0",[393],{"type":104,"content":398},[399],"Gegenüber LM Studio ist der Vergleich knapp und im Kern eine Verpackungsfrage: LM Studio hat eine GUI und einen Modell-Browser, Ollama hat eine CLI, ein Docker-Image und natives Headless-Format, und um die API-Form von Ollama herum ist das Open-WebUI-Ökosystem gewachsen. Gegenüber dem eigenen Server von llama.cpp ist der Unterschied der Modellverwalter und der Scheduler – für ein Team viel wert, für jemanden, der llama.cpp ohnehin schon kennt, nichts. Gegenüber vLLM ist der Unterschied der gesamte Geschäftsfall: Wenn die Frage lautet, wie man das zu planbaren Kosten ausliefert, sind vLLM oder SGLang das Werkzeug und Ollama die Entwicklungsumgebung, in der prototypisiert wird.",{"type":104,"content":401},[402],"Das zweite Abwägungspunkt ist die Richtung. Die Ollama Cloud führt inzwischen Pro-, Max- und Team-Tarife, Preise pro Token und eine auf Unternehmen ausgerichtete Zugriffskontrolle auf Modelle. Das Projekt ist also ein kommerzieller Inferenzanbieter und zugleich eine Laufzeitumgebung. Das finanziert den Release-Takt und ist kein Vorwurf. Es bedeutet aber, dass der Schwerpunkt von „ein Modell auf der eigenen Maschine betreiben“ zu „anmelden und ein größeres nutzen“ wandert – und ein Team, das von lokaler Inferenz abhängt, sollte Version, Modell-Pins und Artefakte selbst besitzen, statt anzunehmen, die Fläche bleibe, wo sie ist.",{"type":111,"level":112,"id":97,"text":98},{"type":104,"content":405},[406],"Ollama ist die beste Standardantwort auf die Frage, wie man ein offenes Modell betreibt, ohne jemanden einzustellen, der llama.cpp betreibt. Es ist MIT, es startet mit einem Befehl, seine API ist die Kompatibilitätsschicht, die fast jedes Agenten-Framework bereits spricht, und es verbirgt eine enorme Menge GPU-Planung hinter zwei Umgebungsvariablen. Was es nicht ist, ist eine skalierbare Inferenzplattform – und sobald eine Anfragewarteschlange auf einem Dashboard sichtbar wird, ist das das Signal zum Wechseln, nicht zum Tunen.",{"type":117,"ordered":408,"items":409},true,[410,415,419,423,428],[411,414],{"tag":122,"children":412},[413],"Nehmen Sie es für ","lokale Entwicklung, Evaluierungs-Harnesses, CI-Fixtures, On-Prem-Installationen, auf denen sich eine Handvoll Personen eine Workstation teilen, und datengebundene Workloads, deren Prompts das Gebäude nicht verlassen dürfen.",[416,418],{"tag":122,"children":417},[413],"einen lokalen oder selbst gehosteten Endpunkt in einem Agenten-Framework, weil die OpenAI-kompatible Fläche einen anbieterspezifischen Client überflüssig macht.",[420,422],{"tag":122,"children":421},[413],"ein Team an einem Nachmittag zu einem funktionierenden Open-Model-Prototyp zu bringen. Das ist ein echter operativer Gewinn und der Grund, warum die meisten Nutzer nie wieder gehen.",[424,427],{"tag":122,"children":425},[426],"Lassen Sie es weg für ","Mehrbenutzer-Serving unter Last, Batch-Generierung oder alles, wo Tokens pro Sekunde pro GPU die Kennzahl ist, an der das Projekt gemessen wird.",[429,431],{"tag":122,"children":430},[426],"regulierte Umgebungen, die Authentifizierung, Audit-Protokollierung oder einen Scheduler unterhalb der Inferenzschicht brauchen. Stellen Sie einen Proxy davor, oder nehmen Sie eine andere Laufzeitumgebung.",{"type":183,"variant":327,"body":433},[434],[435],"Ein abschließender Vorbehalt, klar gesagt. „Läuft lokal“ und „ist MIT“ sind Eigenschaften von zwei verschiedenen Artefakten. Die Laufzeitumgebung ist MIT und prüfbar. Die Gewichte sind, was der Herausgeber gewählt hat, die Registrierung ist ein gehosteter Dienst unter eigenen Bedingungen – und eine Compliance-Prüfung muss alle drei getrennt abdecken.",{"type":111,"level":112,"id":100,"text":101},{"type":117,"ordered":408,"items":438},[439,443,446,449,452,455],[440],{"tag":441,"href":28,"children":442},"a",[27],[444],{"tag":441,"href":31,"children":445},[30],[447],{"tag":441,"href":34,"children":448},[33],[450],{"tag":441,"href":37,"children":451},[36],[453],{"tag":441,"href":40,"children":454},[39],[456],{"tag":441,"href":43,"children":457},[42],[459,542,604,647],{"slug":460,"published":461,"minutes":6,"category":7,"tags":462,"keywords":468,"about":476,"sources":483,"cover":535,"og":536,"expertise":46,"locales":537,"lang":49,"title":538,"description":539,"coverAlt":540,"url":479,"pricing":541,"kind":463},"portkey","2026-09-28",[463,464,465,466,467],"LLM gateway","Guardrails","Routing","Observability","Cost control",[469,470,471,472,473,474,475],"portkey ai gateway","portkey vs litellm","llm gateway comparison","llm gateway latency overhead","llm guardrails gateway","self-hosted llm gateway","portkey pricing",[477,480],{"name":478,"url":479},"Portkey","https:\u002F\u002Fportkey.ai",{"name":481,"url":482},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[484,487,490,493,496,499,502,505,508,511,514,517,520,523,526,529,532],{"title":485,"url":486},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":488,"url":489},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":491,"url":492},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":494,"url":495},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":497,"url":498},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":500,"url":501},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":503,"url":504},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":506,"url":507},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":509,"url":510},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":512,"url":513},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":515,"url":516},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":518,"url":519},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":521,"url":522},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":524,"url":525},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":527,"url":528},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":530,"url":531},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing",{"title":533,"url":534},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[48,49,50],"Portkey: ein LLM-Gateway für die Produktion, geprüft auf Routing, Guardrails und Kosten","Portkey bündelt Retries, Fallbacks, Cache, Guardrails und Kostenkontrolle hinter einer OpenAI-kompatiblen Schnittstelle. Was die Konfiguration gut löst und was das Gateway an Latenz kostet.","Ein Requestweg von der Anwendung durch das Portkey-Gateway zu drei Modellanbietern, darunter das Guardrail-Ergebnis und das Protokoll.","Free · from $49 per month",{"slug":543,"published":544,"minutes":545,"category":7,"tags":546,"keywords":552,"about":560,"sources":572,"cover":597,"og":598,"expertise":46,"locales":599,"lang":49,"title":600,"description":601,"coverAlt":602,"url":563,"pricing":603,"kind":547},"langfuse","2026-08-13",10,[547,548,549,550,551],"LLM observability","Tracing","OpenTelemetry","Self-hosting","Evaluation",[543,553,554,555,556,557,558,559],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[561,564,566,569],{"name":562,"url":563},"Langfuse","https:\u002F\u002Flangfuse.com",{"name":549,"url":565},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":567,"url":568},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":570,"url":571},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[573,576,579,582,585,588,591,594],{"title":574,"url":575},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":577,"url":578},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":580,"url":581},"Langfuse pricing: cloud plans, billable units and worked examples","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":583,"url":584},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":586,"url":587},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":589,"url":590},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":592,"url":593},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":595,"url":596},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[48,49,50],"Langfuse-Test: Tracing, Prompts und Evals selbst gehostet","Langfuse legt LLM-Traces, Prompt-Versionen und Experimente auf eine MIT-lizenzierte Plattform. Was das Selbsthosten wirklich kostet, wie die Einheitspreise rechnen und wo es verliert.","Eine Pipeline vom gebündelten Application-Event über den Langfuse-Web-Container und den Object Storage in ClickHouse, mit Redis und PostgreSQL daneben.","MIT · paid from $59 per month",{"slug":605,"published":606,"minutes":545,"category":7,"tags":607,"keywords":612,"about":619,"sources":623,"cover":639,"og":640,"expertise":46,"locales":641,"lang":49,"title":642,"description":643,"coverAlt":644,"url":645,"pricing":646,"kind":463},"openrouter","2026-07-23",[463,608,609,610,611],"Model routing","Fallbacks","OpenAI-compatible","Pay per token",[605,613,471,614,615,616,617,618],"openrouter vs litellm","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[620],{"name":621,"url":622},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[624,627,628,631,634,637],{"title":625,"url":626},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":533,"url":534},{"title":629,"url":630},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":632,"url":633},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":635,"url":636},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":638,"url":622},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg",[48,49,50],"OpenRouter: ein API-Schlüssel vor jedem Modell im Katalog","OpenRouter packt 500+ Modelle von 80+ Anbietern hinter einen OpenAI-kompatiblen Endpunkt, mit Fallbacks und Weiterverrechnung zum Listenpreis. Kosten und Schwächen.","Anfragepfad durch OpenRouter: Client, Router, mögliche Anbieter, Fallback-Liste und das Modell, das tatsächlich antwortet.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription",{"slug":648,"published":649,"minutes":545,"category":7,"tags":650,"keywords":654,"about":661,"sources":669,"cover":693,"og":694,"expertise":46,"locales":695,"lang":49,"title":696,"description":697,"coverAlt":698,"url":664,"pricing":699,"kind":700},"braintrust","2026-07-07",[651,466,652,653,548],"Evaluations","LLM-as-a-judge","CI gates",[648,655,656,657,658,659,660],"braintrust pricing","braintrust eval","autoevals library","braintrust vs langfuse","llm evaluation platform","eval driven development",[662,665,668],{"name":663,"url":664},"Braintrust","https:\u002F\u002Fwww.braintrust.dev",{"name":666,"url":667},"Continuous integration","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FContinuous_integration",{"name":570,"url":571},[670,673,676,679,682,685,688,690],{"title":671,"url":672},"Braintrust pricing: plans, credits and usage rates","https:\u002F\u002Fwww.braintrust.dev\u002Fpricing",{"title":674,"url":675},"Braintrust documentation: plans and limits","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fplans-and-limits",{"title":677,"url":678},"Braintrust documentation: evaluation quickstart","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fevaluation-quickstart",{"title":680,"url":681},"Braintrust documentation: get started","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs",{"title":683,"url":684},"GitHub: Braintrust organisation repositories","https:\u002F\u002Fgithub.com\u002Forgs\u002Fbraintrustdata\u002Frepositories",{"title":686,"url":687},"Arize Phoenix documentation: self-hosting","https:\u002F\u002Farize.com\u002Fdocs\u002Fphoenix\u002Fself-hosting",{"title":689,"url":581},"Langfuse pricing: cloud plans and billable units",{"title":691,"url":692},"LangChain pricing: LangSmith plans","https:\u002F\u002Fwww.langchain.com\u002Fpricing","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fog.jpg",[48,49,50],"Braintrust im Test: Eval-first Observability mit hartem Zähler","Braintrust macht aus Produktions-Traces Datasets und gate-te Experimente. Was Starter und Pro wirklich enthalten, welches Teil quelloffen ist und wo Phoenix, Langfuse und LangSmith gewinnen.","Eine Schleife von instrumentierten Anwendungs-Logs in ein Dataset, ein Experiment mit Scorern und einen Vergleich, der den Pull Request sperrt, bevor die Änderung zurück in die Anwendung geht.","Free · from $249 per month","Evaluation platform",1791383550499]