[{"data":1,"prerenderedAt":913},["ShallowReactive",2],{"blog-self-hosted-llm-gdpr-cost-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":23,"sources":35,"cover":105,"og":106,"expertise":107,"locales":108,"lang":110,"title":112,"description":113,"coverAlt":114,"metaTitle":115,"takeaways":116,"faq":123,"toc":136,"blocks":164,"others":676},"self-hosted-llm-gdpr-cost","2026-10-09",10,"llmops",[9,10,11,12,13],"Self-hosting","GDPR","vLLM","GPU cost","Open-weight models",[15,16,17,18,19,20,21,22],"self-hosted LLM GDPR","self-host LLM data protection","LLM GPU memory requirements","vLLM throughput benchmark","EU GPU cloud for LLMs","LLM API vs self-hosting break-even","open-weight LLM hardware cost","data processing agreement LLM",[24,27,30,33],{"name":25,"url":26},"General Data Protection Regulation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGeneral_Data_Protection_Regulation",{"name":28,"url":29},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":31,"url":32},"Graphics processing unit","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGraphics_processing_unit",{"name":11,"url":34},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[36,39,42,45,48,51,54,57,60,63,66,69,72,75,78,81,84,87,90,93,96,99,102],{"title":37,"url":38},"openai\u002Fgpt-oss-120b model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fopenai\u002Fgpt-oss-120b",{"title":40,"url":41},"mistralai\u002FMistral-Small-3.2-24B-Instruct-2506 model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fmistralai\u002FMistral-Small-3.2-24B-Instruct-2506",{"title":43,"url":44},"meta-llama\u002FLlama-3.3-70B-Instruct model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fmeta-llama\u002FLlama-3.3-70B-Instruct",{"title":46,"url":47},"mistralai\u002FMistral-Large-3-675B-Instruct-2512 model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fmistralai\u002FMistral-Large-3-675B-Instruct-2512",{"title":49,"url":50},"vLLM blog: v0.6.0 performance update (September 2024)","https:\u002F\u002Fblog.vllm.ai\u002F2024\u002F09\u002F05\u002Fperf-update.html",{"title":52,"url":53},"vLLM documentation: engine arguments","https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fconfiguration\u002Fengine_args.html",{"title":55,"url":56},"vLLM documentation: vllm bench serve","https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fcli\u002Fbench\u002Fserve.html",{"title":58,"url":59},"SemiAnalysis InferenceX: Llama 3.3 70B on H100 vs H200","https:\u002F\u002Finferencex.semianalysis.com\u002Fcompare\u002Fllama-3-3-70b-h100-vs-h200",{"title":61,"url":62},"Scaleway GPU instances pricing","https:\u002F\u002Fwww.scaleway.com\u002Fen\u002Fpricing\u002Fgpu\u002F",{"title":64,"url":65},"Scaleway blog: a transparent update on Scaleway pricing (27 April 2026)","https:\u002F\u002Fwww.scaleway.com\u002Fen\u002Fblog\u002Fa-transparent-update-on-scaleway-pricing\u002F",{"title":67,"url":68},"Scaleway Generative APIs pricing","https:\u002F\u002Fwww.scaleway.com\u002Fen\u002Fpricing\u002Fmodel-as-a-service\u002F",{"title":70,"url":71},"OVHcloud public cloud price list","https:\u002F\u002Fwww.ovhcloud.com\u002Fen\u002Fpublic-cloud\u002Fprices\u002F",{"title":73,"url":74},"OVHcloud AI Endpoints","https:\u002F\u002Fwww.ovhcloud.com\u002Fen\u002Fpublic-cloud\u002Fai-endpoints\u002F",{"title":76,"url":77},"OVHcloud AI Endpoints model catalogue","https:\u002F\u002Fwww.ovhcloud.com\u002Fen\u002Fpublic-cloud\u002Fai-endpoints\u002Fcatalog\u002F",{"title":79,"url":80},"Hetzner dedicated GPU servers","https:\u002F\u002Fwww.hetzner.com\u002Fdedicated-rootserver\u002Fmatrix-gpu\u002F",{"title":82,"url":83},"NVIDIA newsroom: GeForce RTX 50 Series launch","https:\u002F\u002Fnvidianews.nvidia.com\u002Fnews\u002Fnvidia-blackwell-geforce-rtx-50-series-opens-new-world-of-ai-computer-graphics",{"title":85,"url":86},"NVIDIA GeForce RTX 5090","https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fgeforce\u002Fgraphics-cards\u002F50-series\u002Frtx-5090\u002F",{"title":88,"url":89},"NVIDIA GeForce software licence","https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fdrivers\u002Fgeforce-license\u002F",{"title":91,"url":92},"GDPR Article 28: processor","https:\u002F\u002Fgdpr-info.eu\u002Fart-28-gdpr\u002F",{"title":94,"url":95},"GDPR Article 44: general principle for transfers","https:\u002F\u002Fgdpr-info.eu\u002Fart-44-gdpr\u002F",{"title":97,"url":98},"European Commission: EU-US data transfers (Data Privacy Framework)","https:\u002F\u002Fcommission.europa.eu\u002Flaw\u002Flaw-topic\u002Fdata-protection\u002Finternational-dimension-data-protection\u002Feu-us-data-transfers_en",{"title":100,"url":101},"EDPB Opinion 28\u002F2024 on AI models (adopted 17 December 2024)","https:\u002F\u002Fwww.edpb.europa.eu\u002Fsystem\u002Ffiles\u002F2024-12\u002Fedpb_opinion_202428_ai-models_en.pdf",{"title":103,"url":104},"Mistral AI pricing","https:\u002F\u002Fmistral.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fself-hosted-llm-gdpr-cost\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fself-hosted-llm-gdpr-cost\u002Fog.jpg","ai-engineer",[109,110,111],"en","de","hu","LLMs selbst hosten für die DSGVO: wann es nötig ist und was es kostet","LLMs selbst hosten für die DSGVO: wann es nötig ist, GPU-Speicher für offene Modelle, EU-Preise Stand Oktober 2026 und Break-even pro Million Token.","Coverbild zu selbst gehosteten LLMs unter der DSGVO: die Wahl zwischen eigenen GPUs und einer EU-API, mit einer Break-even-Linie.","Eigene LLMs für die DSGVO: Kosten, Break-even · Balázs Csorba",[117,118,119,120,121,122],"Selbst hosten solltest du nur, wenn personenbezogene Daten in einem Netz bleiben müssen, das du kontrollierst, oder wenn ein Vertrag oder eine Aufsichtsbehörde jeden Auftragsverarbeiter ausschließt, den du nicht prüfen kannst.","Eine EU-gehostete API mit Auftragsverarbeitungsvertrag (DPA), kurzer Speicherdauer und ohne Training auf deinen Daten kann viele B2B-Textanwendungen abdecken.","Eine gemietete GPU entfernt den Auftragsverarbeiter nicht: Auch der Hoster braucht einen DPA. Selbst hosten verlagert den Auftragsverarbeiter also, statt ihn abzuschaffen.","Die Gewichte brauchen etwa 2 GB pro Milliarde Parameter bei 16 Bit, 1 GB bei 8 Bit und 0,5 GB bei 4 Bit, jeweils ohne KV-Cache.","Zu EU-API-Preisen schlägt eine gemietete H100 die API nur bei hoher Auslastung, und der Betrieb kommt noch dazu.","Miss den Durchsatz mit deinen eigenen Prompts, bevor du Hardware kaufst oder mietest, mit vllm bench serve, denn veröffentlichte Werte schwanken stark.",[124,127,130,133],{"q":125,"a":126},"Macht ein selbst gehostetes LLM die DSGVO-Konformität automatisch?","Nein. Du streichst einen Auftragsverarbeiter, brauchst aber weiterhin eine Rechtsgrundlage, eine Risikobewertung, ein Verzeichnis der Verarbeitungstätigkeiten, Löschregeln und einen DPA mit dem Unternehmen, das deine Server betreibt. Der EDSA sagt außerdem, dass KI-Modelle, die mit personenbezogenen Daten trainiert wurden, nicht in allen Fällen als anonym gelten können.",{"q":128,"a":129},"Wie viel GPU-Speicher braucht ein 70B-Modell?","Etwa 140 GB Gewichte bei 16 Bit, 70 GB bei 8 Bit und 35 GB bei 4 Bit, jeweils ohne KV-Cache (meine Berechnung). Bei 8 Bit bleibt auf einer 80-GB-Karte wenig Platz für den Kontext. Plane deshalb zwei Karten oder eine Karte mit 96 GB.",{"q":131,"a":132},"Wann reicht eine EU-gehostete API mit DPA?","Wenn keine besonderen Kategorien personenbezogener Daten im Spiel sind und weder ein Kundenvertrag noch eine Folgenabschätzung einen Auftragsverarbeiter ausschließt. Prüfe die Liste der Unterauftragsverarbeiter, die Hosting-Region, die Speichereinstellungen und ob der Anbieter mit deinen Daten trainiert.",{"q":134,"a":135},"Was kostet eine gemietete H100 pro Million Token?","Bei 2.094 € im Monat (meine Berechnung: 2,868 € pro Stunde über 730 Stunden) etwa 0,68 € pro Million Output-Token bei 1.171 Token pro Sekunde über den ganzen Monat (58 Token pro Sekunde und Nutzer), und etwa 1,36 € bei der halben Auslastung (meine Berechnung).",[137,140,143,146,149,152,155,158,161],{"id":138,"title":139},"when-self-hosting-is-required","Wann Selbsthosting wirklich nötig ist",{"id":141,"title":142},"model-sizes-and-gpu-memory","Modellgrößen und GPU-Speicher bei Quantisierung",{"id":144,"title":145},"gpu-options-and-prices","GPU-Optionen und Preise am 10. Oktober 2026",{"id":147,"title":148},"throughput-with-vllm","Durchsatz mit vLLM: die Zahlen und wie du sie misst",{"id":150,"title":151},"break-even-per-million-tokens","Break-even pro Million Token",{"id":153,"title":154},"on-premise-hardware","Eigene Hardware: die Karte ist günstig, Strom und Lizenz nicht",{"id":156,"title":157},"hidden-costs","Die Kosten, die nach dem Go-live auftauchen",{"id":159,"title":160},"first-steps","Was ich zuerst tun würde",{"id":162,"title":163},"sources","Quellen",[165,169,172,175,178,198,201,210,217,220,221,229,297,300,301,304,382,385,388,389,398,401,403,406,407,410,413,451,454,457,463,466,467,470,475,476,479,530,531,564,582,583],{"type":166,"content":167},"paragraph",[168],"Viele Teams wollen ein Sprachmodell aus Datenschutzgründen selbst hosten. Für die meisten B2B-Textanwendungen ist das nicht nötig. Die DSGVO verbietet Auftragsverarbeiter von Drittanbietern nicht. Sie verlangt einen Vertrag mit jedem Auftragsverarbeiter, eine Rechtsgrundlage für jede Übermittlung und bei riskanter Verarbeitung eine dokumentierte Risikobewertung. Eine EU-gehostete API mit Auftragsverarbeitungsvertrag (DPA) kann diese Anforderungen erfüllen. Selbst hosten ist die richtige Antwort, wenn personenbezogene Daten in einem Netz bleiben müssen, das du kontrollierst, oder wenn ein Vertrag oder eine Aufsichtsbehörde jeden Auftragsverarbeiter ausschließt, den du nicht prüfen kannst. Dann ist die GPU-Rechnung der leichte Teil der Planung – das meiste Geld geht in den Betrieb.",{"type":166,"content":170},[171],"Dieser Artikel prüft die Zahlen am 10. Oktober 2026 und stützt sich nur auf Seiten, die ich öffnen konnte. Er behandelt, wann Selbsthosting nötig ist, wie viel GPU-Speicher offene Modelle je Genauigkeitsstufe brauchen, was EU-basierte GPUs kosten, was vLLM leistet, einen Break-even pro Million Token gegenüber EU-gehosteten APIs und die Kosten, die nach dem Go-live entstehen.",{"type":173,"level":174,"id":138,"text":139},"heading",2,{"type":166,"content":176},[177],"Die Frage ist nicht, ob ein Modell auf deiner Hardware laufen kann, sondern ob personenbezogene Daten dort bleiben müssen. Drei Situationen bringen mich zu einem selbst gehosteten Modell:",{"type":179,"ordered":180,"items":181},"list",false,[182,188,193],[183,187],{"tag":184,"children":185},"strong",[186],"Ein Vertrag verbietet es."," Manche Kundenverträge und interne Richtlinien schließen Unterauftragsverarbeiter aus, die du nicht kontrollierst, oder verlangen, dass Daten ein definiertes Netz nie verlassen.",[189,192],{"tag":184,"children":190},[191],"Deine Datenschutz-Folgenabschätzung sagt nein."," Die DSFA für den Anwendungsfall stuft das Risiko einer Verarbeitungskette als zu hoch ein, etwa bei Gesundheitsdaten oder Personalakten.",[194,197],{"tag":184,"children":195},[196],"Es gibt keinen passenden Anbieter."," Kein EU-gehosteter Anbieter bietet das Modell zu den nötigen Bedingungen an, oder das System muss offline laufen, etwa in der Produktionshalle oder am Edge.",{"type":166,"content":199},[200],"Alles Übrige ist eine Frage an den Auftragsverarbeiter, und eine EU-gehostete API beantwortet sie. Artikel 28 verlangt einen Vertrag, der Gegenstand und Dauer der Verarbeitung, Art und Zweck, die Arten personenbezogener Daten und Kategorien betroffener Personen sowie die Pflichten und Rechte des Verantwortlichen festlegt. Er verlangt außerdem eine vorherige schriftliche Genehmigung für Unterauftragsverarbeiter, allgemein oder für den Einzelfall, wobei dieselben Pflichten an sie weitergegeben werden. Artikel 44 macht jede Übermittlung in ein Drittland von den Bedingungen des Kapitels V abhängig. Für US-Unternehmen, die nach dem EU-US Data Privacy Framework zertifiziert sind, bildet der Angemessenheitsbeschluss der Kommission vom 10. Juli 2023 die Grundlage für die Übermittlung.",{"type":202,"attrs":203,"inner":207,"caption":208},"diagram",{"viewBox":204,"role":205,"aria-labelledby":206},"0 0 720 330","img","d1-self-t d1-self-d","\u003Ctitle id=\"d1-self-t\">Wohin der Prompt gehen darf\u003C\u002Ftitle>\u003Cdesc id=\"d1-self-d\">Eine Entscheidungskette. Wenn personenbezogene Daten in deinem Netz bleiben müssen, folgt Selbsthosting mit vLLM. Wenn nicht, prüfe, ob ein EU-Hoster mit DPA und ohne Speicherung verfügbar ist: Ja bedeutet eine EU-API mit DPA, Nein bedeutet selbst hosten oder den Anbieter wechseln.\u003C\u002Fdesc>\u003Crect x=\"20\" y=\"40\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"170\" y=\"71\" text-anchor=\"middle\" class=\"d-text\">Daten nur im eigenen Netz?\u003C\u002Ftext>\u003Crect x=\"400\" y=\"40\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"550\" y=\"71\" text-anchor=\"middle\" class=\"d-text\">EU-Hoster mit AVV, ohne Logs?\u003C\u002Ftext>\u003Cpath d=\"M320 66 H392\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M400 66 l-9 -5 v10 z\" class=\"d-head-accent\" \u002F>\u003Ctext x=\"332\" y=\"60\" class=\"d-label\">nein\u003C\u002Ftext>\u003Cpath d=\"M170 92 V102\" class=\"d-line\" \u002F>\u003Cpath d=\"M170 110 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"180\" y=\"105\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"20\" y=\"130\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"170\" y=\"156\" text-anchor=\"middle\" class=\"d-text\">Selbst hosten mit vLLM\u003C\u002Ftext>\u003Ctext x=\"170\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Daten bleiben in deinem Netz\u003C\u002Ftext>\u003Cpath d=\"M550 92 V102\" class=\"d-line\" \u002F>\u003Cpath d=\"M550 110 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"560\" y=\"105\" class=\"d-label\">ja\u003C\u002Ftext>\u003Crect x=\"400\" y=\"130\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"550\" y=\"156\" text-anchor=\"middle\" class=\"d-text\">EU-API mit DPA\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Unterauftragsverarbeiter und Speicherdauer\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"206\" text-anchor=\"middle\" class=\"d-small\">Bei Nein: selbst hosten oder wechseln\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"300\" class=\"d-small\">Ein Hoster außerhalb der EU braucht Garantien nach Kapitel V, bevor du ihn nutzt.\u003C\u002Ftext>",[209],"Lies von oben nach unten. Die erste Antwort, die die Frage entscheidet, bestimmt die Architektur.",{"type":211,"variant":212,"title":213,"body":214},"callout","warn","Eine gemietete GPU braucht trotzdem einen DPA",[215],[216],"Eine GPU-Server-Miete entfernt den Auftragsverarbeiter nicht. Der Hoster betreibt die Maschine, auf der deine Daten liegen. In den meisten Fällen ist er deshalb Auftragsverarbeiter, und du brauchst einen DPA mit ihm. Eigene Hardware entfernt den Auftragsverarbeiter; Mieten ändert nur, welchen du hast.",{"type":166,"content":218},[219],"Selbst zu hosten klärt auch die Modellfrage nicht. Die Stellungnahme 28\u002F2024 des EDSA, angenommen am 17. Dezember 2024, sagt, dass KI-Modelle, die mit personenbezogenen Daten trainiert wurden, nicht in allen Fällen als anonym gelten können. Anonymitätsbehauptungen sind daher im Einzelfall zu prüfen. Frag den Anbieter deshalb nach Dokumentation zu den Trainingsdaten, bevor du dich auf eine solche Behauptung stützt.",{"type":173,"level":174,"id":141,"text":142},{"type":166,"content":222},[223,224,228],"Der Speicherbedarf der Gewichte ist einfache Rechnung: Parameter mal Bit pro Gewicht, geteilt durch acht. Ein Modell mit 70 Milliarden Parametern braucht etwa 140 GB bei 16 Bit, 70 GB bei 8 Bit und 35 GB bei 4 Bit (meine Berechnung). Dazu kommt der KV-Cache, der mit der Kontextlänge und den gleichzeitigen Anfragen wächst, sowie der Eigenbedarf der Laufzeitumgebung. Standardmäßig darf vLLM 92 Prozent des GPU-Speichers nutzen (",{"tag":225,"children":226},"code",[227],"gpu_memory_utilization",", in der aktuellen Doku 0,92), und der KV-Cache bekommt, was die Gewichte übrig lassen.",{"type":230,"head":231,"rows":242},"table",[232,234,236,238,240],[233],"Modell",[235],"Größe, gesamt \u002F aktiv",[237],"Genauigkeit",[239],"Gewichte, GB",[241],"benötigte Hardware",[243,254,265,276,286],[244,246,248,250,252],[245],"gpt-oss-20b",[247],"21 Mrd. \u002F 3,6 Mrd.",[249],"MXFP4, wie veröffentlicht",[251],"unter 16, laut Karte",[253],"16 GB GPU-Speicher, laut Karte",[255,257,259,261,263],[256],"Mistral Small 3.2",[258],"24 Mrd., dicht",[260],"bf16",[262],"48 (meine Berechnung); laut Karte etwa 55",[264],"eine 80-GB-Karte, mit Platz für den Cache (meine Berechnung)",[266,268,270,272,274],[267],"Llama 3.3 70B",[269],"70 Mrd., dicht",[271],"bf16 \u002F FP8 \u002F 4 Bit",[273],"140 \u002F 70 \u002F 35 (meine Berechnung)",[275],"zwei 80-GB-Karten bei bf16; eine 96-GB-Karte bei FP8; eine 48-GB-Karte bei 4 Bit (meine Berechnung)",[277,279,281,282,284],[278],"gpt-oss-120b",[280],"117 Mrd. \u002F 5,1 Mrd.",[249],[283],"laut Karte nicht angegeben",[285],"eine 80-GB-GPU, laut Karte",[287,289,291,293,295],[288],"Mistral Large 3",[290],"675 Mrd., gesamt",[292],"FP8 \u002F 4 Bit",[294],"675 \u002F etwa 340 (meine Berechnung)",[296],"mehr als 8 × 80 GB bei FP8; etwa 340 GB bei 4 Bit passen auf 8 × 80 GB (meine Berechnung)",{"type":166,"content":298},[299],"Zwei Lehren aus der Tabelle. Auf einer 80-GB-Karte bleiben einem 70B-Modell bei 8 Bit, nachdem vLLM seinen Anteil genommen hat, nur wenige Gigabyte für den Cache (meine Berechnung). Plane deshalb zwei Karten oder eine 96-GB-Karte ein. Und welches Modell du betreiben kannst, hängt vom Speicher ab, den du mieten kannst. Prüfe den Speicher also, bevor du einen Benchmark liest.",{"type":173,"level":174,"id":144,"text":145},{"type":166,"content":302},[303],"Das sind die Preise, die ich auf den Anbieterseiten lesen konnte, mit ihren Datumsangaben. Wo ein Anbieter einen Monatspreis nennt, zitiere ich ihn. Wo nicht, rechne ich mit 730 Stunden pro Monat und sage das dazu.",{"type":230,"head":305,"rows":316},[306,308,310,312,314],[307],"Option",[309],"GPU-Speicher",[311],"Preis laut Anbieter",[313],"pro Monat",[315],"Datum und Quelle",[317,328,339,350,360,371],[318,320,322,324,326],[319],"Scaleway L4-1-24G, Paris",[321],"24 GB",[323],"0,79 € pro Stunde, netto",[325],"etwa 575 € (Scaleway)",[327],"10. Okt. 2026, GPU-Preisseite",[329,331,333,335,337],[330],"Scaleway H100-1-80G",[332],"80 GB",[334],"2,868 € pro Stunde ab 1. Juni 2026",[336],"etwa 2.094 € (meine Berechnung)",[338],"27. Apr. 2026, Scaleway-Blogbeitrag",[340,342,344,346,348],[341],"OVHcloud l40s-1-gpu",[343],"nicht auf der Preisliste",[345],"1,69 $ pro Stunde, ohne USt.",[347],"etwa 1.237 $ (OVHcloud)",[349],"10. Okt. 2026, Preisliste Public Cloud",[351,353,355,357,359],[352],"OVHcloud h100-1-gpu",[354],"80 GiB",[356],"3,39 $ pro Stunde, ohne USt.",[358],"etwa 2.473 $ (OVHcloud)",[349],[361,363,365,367,369],[362],"RTX 5090, gekauft",[364],"32 GB",[366],"1.999 $ Einführungspreis",[368],"etwa 56 $ über 36 Monate (meine Berechnung)",[370],"NVIDIA-Newsroom, ab 30. Januar",[372,374,376,378,380],[373],"Hetzner GEX63 oder GEX131",[375],"96 GB",[377],"auf der statischen Seite nicht lesbar",[379],"entfällt",[381],"10. Okt. 2026, GPU-Server-Matrix",{"type":166,"content":383},[384],"Hetzner beschreibt seine GPU-Server als DSGVO-konform und in Europa gelegen. Die Matrixseite listet RTX-PRO-6000-Blackwell-Karten mit 96 GB GDDR7 in den Modellen GEX63 und GEX131 auf. Die monatlichen Preise stehen nur im Konfigurator, den ich nicht lesen konnte, deshalb lasse ich sie in der Tabelle weg. Prüfe sie dort, bevor du vergleichst.",{"type":166,"content":386},[387],"Zwei Dinge sind zu beachten. Scaleway hat den Preis einer H100 am 1. Juni 2026 von 2,73 € auf 2,868 € pro Stunde angehoben, ältere Vergleichsseiten sind also veraltet. OVHcloud zeigt seine Preise in Dollar. Rechne sie deshalb am Tag des Vergleichs in Euro um, bevor du sie neben die Euro-Zeilen stellst.",{"type":173,"level":174,"id":147,"text":148},{"type":166,"content":390},[391,392,397],"Die eigenen Benchmarks von vLLM nennen relative Zugewinne statt absoluter Token pro Sekunde. Im Beitrag vom September 2024 zu v0.6.0 berichtete das Team vom 2,7-fachen Durchsatz gegenüber v0.5.3 bei Llama 3 8B auf einer H100 und vom 1,8-fachen bei Llama 3 70B auf vier H100, jeweils mit dem ShareGPT-Datensatz und 500 Prompts. Für den Server würde ich mit vLLM anfangen; meine ",{"tag":393,"to":394,"children":395},"link","\u002Ftools\u002Fvllm",[396],"vLLM-Rezension"," beschreibt die Abwägungen.",{"type":166,"content":399},[400],"Absolute Zahlen hängen vom Modell, von der Länge der Prompts und Antworten und davon ab, wie schnell jeder Nutzer antworten soll. Der Benchmark von SemiAnalysis InferenceX zeigt diesen Zielkonflikt für Llama 3.3 70B auf H100. Pro GPU erreicht er etwa 1.850 Token pro Sekunde, wenn jeder Nutzer 38 Token pro Sekunde bekommt, etwa 1.170 bei 58 Token pro Sekunde und Nutzer und etwa 880 bei 78. Diese drei Werte sind aus den Datenpunkten der Seite interpoliert (meine Lesart), und der Benchmark nutzt 8K\u002F1K-Sequenzlängen. Die Seite nennt Genauigkeit und Serving-Engine nicht durchgehend, deshalb behandle ich die Zahlen als Größenordnung.",{"type":225,"code":402},"# serve gpt-oss-120b on one 80 GB GPU (model card)\nvllm serve openai\u002Fgpt-oss-120b\n\n# a 70B model at bf16 needs two 80 GB GPUs (my calculation)\nvllm serve meta-llama\u002FLlama-3.3-70B-Instruct --tensor-parallel-size 2\n\n# from a second terminal, send 500 random prompts at 4 requests per second\nvllm bench serve --model openai\u002Fgpt-oss-120b --dataset-name random --num-prompts 500 --request-rate 4",{"type":166,"content":404},[405],"Miss deine eigenen Zahlen mit vllm bench serve. Die Standardwerte senden 1.000 zufällige Prompts mit unendlicher Anfragerate (inf), deshalb setzt du Anzahl und Rate selbst und nimmst nach Möglichkeit Prompts, die deinen ähneln. Steigere dann die Rate und notiere bei jeder Stufe Time to First Token und Time per Output Token. Die Option --goodput zählt nur die Anfragen, die deine Latenzziele einhalten. Das ist die Zahl, die bei einem Feature mit Nutzerkontakt zählt.",{"type":173,"level":174,"id":150,"text":151},{"type":166,"content":408},[409],"Die Formel passt in eine Zeile. Die Kosten pro Million Token ergeben sich aus den monatlichen GPU-Kosten, geteilt durch die im Monat erzeugten Token, mal eine Million. Die Token pro Monat ergeben sich aus den Token pro Sekunde mal 2.628.000 Sekunden (730 Stunden) mal dem Anteil der Zeit, in dem die GPU ausgelastet ist. Ich behandle jeden bedienten Token als einen abrechenbaren Token zum Output-Preis der API. Das hält den Vergleich einfach (meine Methode, kein Benchmark-Ergebnis).",{"type":166,"content":411},[412],"Kosten pro Million Token für eine gemietete H100 bei 2.094 € im Monat, mit den InferenceX-Werten (meine Berechnung):",{"type":230,"head":414,"rows":423},[415,417,419,421],[416],"Token pro Sekunde (Tempo pro Nutzer)",[418],"25 % ausgelastet",[420],"50 % ausgelastet",[422],"100 % ausgelastet",[424,433,442],[425,427,429,431],[426],"877 (78 Token\u002Fs pro Nutzer)",[428],"3,63 €",[430],"1,82 €",[432],"0,91 €",[434,436,438,440],[435],"1.171 (58 Token\u002Fs pro Nutzer)",[437],"2,72 €",[439],"1,36 €",[441],"0,68 €",[443,445,447,449],[444],"1.848 (38 Token\u002Fs pro Nutzer)",[446],"1,72 €",[448],"0,86 €",[450],"0,43 €",{"type":166,"content":452},[453],"Gegen die EU-APIs ist Llama 3.3 70B der nähere Fall. OVHcloud verlangt 0,67 € pro Million Token, Scaleway 0,90 €. Bei 58 Token pro Sekunde und Nutzer müsste eine gemietete H100 rund um die Uhr etwa 1.190 Token pro Sekunde liefern, um OVHcloud zu erreichen (meine Berechnung). Der Benchmark liefert bei diesem Tempo 1.171 Token pro Sekunde, also schafft sie es nicht. Gegenüber 0,90 € bei Scaleway liegt der Break-even bei etwa 885 Token pro Sekunde, rund drei Vierteln dieses Benchmark-Werts.",{"type":166,"content":455},[456],"gpt-oss-120b setzt die Latte höher. Die API kostet bei Scaleway 0,60 € pro Million Output-Token und bei OVHcloud 0,40 €. Eine gemietete H100 für 2.094 € im Monat muss daher im Schnitt etwa 1.330 Output-Token pro Sekunde erzeugen, um Scaleway zu erreichen, und etwa 1.990, um OVHcloud zu erreichen (meine Berechnung). Ich habe keine verifizierte H100-Zahl für gpt-oss-120b gefunden, miss also, bevor du entscheidest. Input-Token sind noch günstiger, mit 0,15 € und 0,08 € pro Million.",{"type":202,"attrs":458,"inner":460,"caption":461},{"viewBox":204,"role":205,"aria-labelledby":459},"d2-brk-t d2-brk-d","\u003Ctitle id=\"d2-brk-t\">Break-even: eine gemietete H100 gegen eine EU-API\u003C\u002Ftitle>\u003Cdesc id=\"d2-brk-d\">Ein Liniendiagramm der monatlichen Kosten über die Output-Token pro Monat. Die API-Kosten steigen geradlinig von null an, bei 0,60 Euro pro Million Output-Token. Die gemietete H100 kostet etwa 2.094 Euro im Monat, egal wie viel sie bedient. Die beiden Linien kreuzen sich bei etwa 3,5 Milliarden Output-Token im Monat. Oberhalb dieses Volumens ist die eigene GPU günstiger, aber nur, wenn sie ausgelastet bleibt.\u003C\u002Fdesc>\u003Cpath d=\"M90 280 H680\" class=\"d-line\" \u002F>\u003Cpath d=\"M90 40 V280\" class=\"d-line\" \u002F>\u003Cpath d=\"M90 112.5 H680\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M90 280 L680 40\" class=\"d-line\" \u002F>\u003Cpath d=\"M502 106.5 l6 6 l-6 6 l-6 -6 z\" class=\"d-accent\" \u002F>\u003Ctext x=\"90\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">0\u003C\u002Ftext>\u003Ctext x=\"208\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">1\u003C\u002Ftext>\u003Ctext x=\"326\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">2\u003C\u002Ftext>\u003Ctext x=\"444\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">3\u003C\u002Ftext>\u003Ctext x=\"562\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">4\u003C\u002Ftext>\u003Ctext x=\"680\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">5\u003C\u002Ftext>\u003Ctext x=\"385\" y=\"320\" text-anchor=\"middle\" class=\"d-small\">Output-Token pro Monat (Milliarden)\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"284\" text-anchor=\"end\" class=\"d-small\">0 €\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"204\" text-anchor=\"end\" class=\"d-small\">1.000 €\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"124\" text-anchor=\"end\" class=\"d-small\">2.000 €\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"44\" text-anchor=\"end\" class=\"d-small\">3.000 €\u003C\u002Ftext>\u003Ctext x=\"90\" y=\"28\" class=\"d-small\">Kosten pro Monat\u003C\u002Ftext>\u003Ctext x=\"100\" y=\"100\" class=\"d-text\">Eine gemietete H100: 2.094 € im Monat\u003C\u002Ftext>\u003Ctext x=\"470\" y=\"200\" class=\"d-small\">EU-API: 0,60 € pro Million\u003C\u002Ftext>\u003Ctext x=\"514\" y=\"140\" class=\"d-small\">Break-even: 3,5 Mrd. Token\u003C\u002Ftext>",[462],"Break-even für eine gemietete H100 bei 2.094 € im Monat (meine Berechnung), gegen den Scaleway-Preis von 0,60 € pro Million Output-Token für gpt-oss-120b. Ab etwa 3,5 Milliarden Output-Token im Monat ist die GPU günstiger, sofern sie diese Last tatsächlich bedienen kann. Das habe ich für gpt-oss-120b nicht verifiziert.",{"type":166,"content":464},[465],"Die Betriebskosten kommen obendrauf. Jede 1.000 € monatlicher Betriebskosten verschieben den Break-even von gpt-oss-120b bei 0,60 € pro Million Token um etwa 1,7 Milliarden Output-Token im Monat, oder rund 630 Token pro Sekunde rund um die Uhr (meine Berechnung). Der Preis allein rechtfertigt Selbsthosting also selten, wenn eine EU-gehostete API das Modell schon anbietet. Der Fall entsteht, wenn die Hardware dir bereits gehört, wenn die Last eine GPU den ganzen Monat auslastet oder wenn kein EU-Anbieter das gewünschte Modell hat.",{"type":173,"level":174,"id":153,"text":154},{"type":166,"content":468},[469],"Eine gekaufte Karte wirkt neben einer gemieteten günstig. NVIDIA hat die GeForce RTX 5090 zum Start mit 1.999 $ angesetzt, mit 32 GB GDDR7 und 575 W Gesamtgrafikleistung. Auf 36 Monate verteilt kostet die Karte etwa 56 $ im Monat (meine Berechnung). Läuft sie rund um die Uhr auf Volllast, verbraucht allein die Karte etwa 420 kWh im Monat (575 W mal 730 Stunden, meine Berechnung). Bei der Beispielannahme von 30 ct\u002FkWh sind das etwa 126 € im Monat (meine Berechnung, kein Tarif-Zitat). Über drei Jahre kommt allein der Strom auf rund 4.500 €, mehr als das Doppelte des Einführungspreises von 1.999 $.",{"type":211,"variant":212,"title":471,"body":472},"Prüfe die Lizenz, bevor die Karte in den Serverraum kommt",[473],[474],"Nach Klausel 2.8 der GeForce-Lizenz von NVIDIA ist GeForce- und Titan-Software nicht für den Rechenzentrumseinsatz lizenziert (Originalwortlaut: „is not licensed for datacenter deployment“). Eine Verbraucherkarte im Serverschrank kann also außerhalb der Lizenz liegen. Prüfe die Bedingungen für genau die Karte, die du kaufen willst, bevor du darauf aufbaust.",{"type":173,"level":174,"id":156,"text":157},{"type":166,"content":477},[478],"Sobald der Dienst läuft, ist die GPU-Miete meist der kleinste Posten. Der Rest sind Arbeitszeit und Risiko. Die Planungswerte in der Tabelle sind meine eigenen Annahmen, keine gemessenen Daten, ersetze sie deshalb durch die Zahlen deines Teams.",{"type":230,"head":480,"rows":487},[481,483,485],[482],"Posten",[484],"Was dazugehört",[486],"Planungsannahme (meine)",[488,495,502,509,516,523],[489,491,493],[490],"Betrieb",[492],"Serving, Monitoring, GPU-Ausfälle, Neustarts, Kapazitätsplanung",[494],"0,1 bis 0,2 der Arbeitszeit einer Person",[496,498,500],[497],"Updates",[499],"neue Versionen von vLLM, CUDA und Treiber, OS-Patches, Modellwechsel",[501],"zwei bis fünf Ingenieurstage pro Modellwechsel",[503,505,507],[504],"Evals",[506],"ein Regressionsset vor jeder Modell- oder Serving-Änderung",[508],"zwei bis fünf Tage zum Aufbau, danach etwa ein Tag pro Lauf",[510,512,514],[511],"Bereitschaft",[513],"jemand antwortet, wenn der Endpunkt außerhalb der Arbeitszeit ausfällt",[515],"mindestens zwei Personen für einen 24\u002F7-Dienst",[517,519,521],[518],"Redundanz",[520],"ein zweiter GPU-Knoten für das Failover",[522],"verdoppelt die Miete ungefähr",[524,526,528],[525],"Compliance",[527],"DPA mit dem Hoster, Aktualisierung der DSFA, Verzeichnis der Verarbeitungstätigkeiten, Logs, die du dann selbst besitzt",[529],"ein paar Tage pro Jahr",{"type":173,"level":174,"id":159,"text":160},{"type":179,"ordered":532,"items":533},true,[534,539,544,549,554,559],[535,538],{"tag":184,"children":536},[537],"Schreib die Daten und die Regeln auf."," Notiere, welche Datenklassen das Modell erreichen und welche Verträge oder DSFA-Ergebnisse gelten. Schließt keine davon einen Auftragsverarbeiter aus, starte mit einer EU-API mit DPA.",[540,543],{"tag":184,"children":541},[542],"Hol dir die Hosting-Fakten schriftlich."," Frag nach der Hosting-Region, der Liste der Unterauftragsverarbeiter und den Speichereinstellungen. Mistrals Preisseite verlinkt einen DPA, sagt aber nicht, wo die API läuft. Diese Antwort muss deshalb aus dem Vertrag kommen.",[545,548],{"tag":184,"children":546},[547],"Wähle das kleinste Modell, das deine Evals besteht."," Prüfe dann seinen Speicherbedarf bei der Genauigkeit, die du tatsächlich betreiben kannst, nicht bei der auf der Modellkarte.",[550,553],{"tag":184,"children":551},[552],"Miss mit deinen eigenen Prompts."," Führe vllm bench serve mit deinen echten Prompt-Längen und einem Latenzziel aus, bevor du dich auf Hardware festlegst.",[555,558],{"tag":184,"children":556},[557],"Berechne den Break-even mit deinen eigenen Zahlen neu."," Nutze deine gemessenen Token pro Sekunde, deine echte Auslastung und dein Betriebsbudget. Geht es nicht auf, bleib bei der API und halte Selbsthosting als dokumentierte Rückfalloption fest.",[560,563],{"tag":184,"children":561},[562],"Plane den Betrieb vor dem Go-live ein."," Lege zuerst die Eval-Suite, den Bereitschaftsplan und die Update-Regeln fest. Die GPU ist der einfache Teil.",{"type":166,"content":565},[566,567,571,572,576,577,581],"Für die Datenseite der Pipeline lies meine Notizen zu ",{"tag":393,"to":568,"children":569},"\u002Fblog\u002Fgdpr-llm-api-eu-data-residency",[570],"EU-Datenresidenz, Regionskontrollen und Zero Retention"," und zu ",{"tag":393,"to":573,"children":574},"\u002Fblog\u002Fpii-redaction-llm-pipelines",[575],"PII-Redaktion",". Für das Regressionsset siehe ",{"tag":393,"to":578,"children":579},"\u002Fblog\u002Fllm-evals-for-product-features",[580],"LLM-Evals für Produktfeatures",".",{"type":173,"level":174,"id":162,"text":163},{"type":179,"ordered":532,"items":584},[585,590,594,598,602,606,610,614,618,622,626,630,634,637,641,645,649,652,656,660,664,668,672],[586],{"tag":587,"href":38,"children":588},"a",[589],"Modellkarte openai\u002Fgpt-oss-120b (Hugging Face)",[591],{"tag":587,"href":41,"children":592},[593],"Modellkarte mistralai\u002FMistral-Small-3.2-24B-Instruct-2506 (Hugging Face)",[595],{"tag":587,"href":44,"children":596},[597],"Modellkarte meta-llama\u002FLlama-3.3-70B-Instruct (Hugging Face)",[599],{"tag":587,"href":47,"children":600},[601],"Modellkarte mistralai\u002FMistral-Large-3-675B-Instruct-2512 (Hugging Face)",[603],{"tag":587,"href":50,"children":604},[605],"vLLM-Blog: Leistungsupdate v0.6.0 (September 2024)",[607],{"tag":587,"href":53,"children":608},[609],"vLLM-Dokumentation: Engine-Argumente",[611],{"tag":587,"href":56,"children":612},[613],"vLLM-Dokumentation: vllm bench serve",[615],{"tag":587,"href":59,"children":616},[617],"SemiAnalysis InferenceX: Llama 3.3 70B auf H100 vs. H200",[619],{"tag":587,"href":62,"children":620},[621],"Scaleway: Preise für GPU-Instanzen",[623],{"tag":587,"href":65,"children":624},[625],"Scaleway-Blog: Ein transparentes Update zu den Scaleway-Preisen (27. April 2026)",[627],{"tag":587,"href":68,"children":628},[629],"Scaleway Generative APIs: Preise",[631],{"tag":587,"href":71,"children":632},[633],"OVHcloud: Preisliste Public Cloud",[635],{"tag":587,"href":74,"children":636},[73],[638],{"tag":587,"href":77,"children":639},[640],"OVHcloud AI Endpoints: Modellkatalog",[642],{"tag":587,"href":80,"children":643},[644],"Hetzner: dedizierte GPU-Server",[646],{"tag":587,"href":83,"children":647},[648],"NVIDIA-Newsroom: Start der GeForce-RTX-50-Serie",[650],{"tag":587,"href":86,"children":651},[85],[653],{"tag":587,"href":89,"children":654},[655],"NVIDIA GeForce-Softwarelizenz",[657],{"tag":587,"href":92,"children":658},[659],"DSGVO Artikel 28: Auftragsverarbeiter",[661],{"tag":587,"href":95,"children":662},[663],"DSGVO Artikel 44: allgemeiner Grundsatz für Übermittlungen",[665],{"tag":587,"href":98,"children":666},[667],"Europäische Kommission: EU-US-Datenübermittlungen (Data Privacy Framework)",[669],{"tag":587,"href":101,"children":670},[671],"EDSA-Stellungnahme 28\u002F2024 zu KI-Modellen (angenommen am 17. Dezember 2024)",[673],{"tag":587,"href":104,"children":674},[675],"Mistral AI: Preise",[677,736,790,877],{"slug":678,"published":679,"minutes":680,"category":7,"tags":681,"keywords":687,"about":698,"sources":708,"cover":730,"og":731,"expertise":107,"locales":732,"lang":110,"title":733,"description":734,"coverAlt":735},"local-text-to-speech-pipeline","2026-10-01",11,[682,683,684,685,686],"Text-to-speech","Audio","Kokoro","FFmpeg","Vue",[688,689,690,691,692,693,694,695,696,697],"local text-to-speech","text-to-speech pipeline","kokoro tts","piper tts","bark tts comparison","narrate blog posts","wav to m4a ffmpeg","aac 192 kbit\u002Fs faststart","vue audio player","onnx tts mac",[699,702,705],{"name":700,"url":701},"Speech synthesis","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSpeech_synthesis",{"name":703,"url":704},"Advanced Audio Coding","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAdvanced_Audio_Coding",{"name":706,"url":707},"ESpeak","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FESpeak",[709,712,715,718,721,724,727],{"title":710,"url":711},"Kokoro onnx: runtime bindings","https:\u002F\u002Fgithub.com\u002Fthewh1teagle\u002Fkokoro-onnx",{"title":713,"url":714},"Kokoro-82M model card","https:\u002F\u002Fhuggingface.co\u002Fhexgrad\u002FKokoro-82M",{"title":716,"url":717},"Piper text-to-speech","https:\u002F\u002Fgithub.com\u002Frhasspy\u002Fpiper",{"title":719,"url":720},"Bark by Suno","https:\u002F\u002Fgithub.com\u002Fsuno-ai\u002Fbark",{"title":722,"url":723},"FFmpeg AAC encoder documentation","https:\u002F\u002Fffmpeg.org\u002Fffmpeg-codecs.html#aac",{"title":725,"url":726},"torch.load weights_only documentation","https:\u002F\u002Fpytorch.org\u002Fdocs\u002Fstable\u002Fgenerated\u002Ftorch.load.html",{"title":728,"url":729},"ESpeak NG phonemizer","https:\u002F\u002Fgithub.com\u002Fespeak-ng\u002Fespeak-ng","\u002Fimages\u002Fblog\u002Flocal-text-to-speech-pipeline\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flocal-text-to-speech-pipeline\u002Fog.jpg",[109,110,111],"Lokales Text-to-Speech im großen Maßstab: 96 Artikel mit offenen Modellen vertont","Drei offene TTS-Modelle, ein Laptop: wie 96 Artikel zu 1.512 Minuten Sprachausgabe wurden — von SQLite-Zeilen über chunkierte Synthese und 192-kbit\u002Fs-AAC bis zum Player, der mit der Seite mitläuft.","Wellendiagramm der Sprachpipeline: Datenbankzeilen werden in Sätze zerlegt, von einem lokalen Modell synthetisiert, zu AAC kodiert und über einen klebenden Tab am Bildschirmrand abgespielt.",{"slug":737,"published":738,"updated":739,"minutes":740,"category":7,"tags":741,"keywords":746,"about":757,"sources":765,"cover":784,"og":785,"expertise":107,"locales":786,"lang":110,"title":787,"description":788,"coverAlt":789},"artificial-analysis-leaderboard-claude-opus-5-5","2026-09-07","2026-09-11",8,[742,743,744,745],"Claude Opus 5.5","Artificial Analysis","LLM benchmarks","LLM cost",[747,748,742,749,750,751,752,753,754,755,756],"Claude Opus 5.5 benchmark","Claude Opus 5.5 pricing","Artificial Analysis Intelligence Index","AI model leaderboard","Opus 5.5 benchmark","Opus 5.5 vs GPT-6 Astra","LLM cost per task","reasoning effort setting","Opus 5.5 pricing","best LLM September 2026",[758,761,762],{"name":759,"url":760},"Claude (language model)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClaude_(language_model)",{"name":28,"url":29},{"name":763,"url":764},"Benchmark (computing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBenchmark_(computing)",[766,769,772,775,778,781],{"title":767,"url":768},"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22 September 2026)","https:\u002F\u002Fartificialanalysis.ai\u002Farticles\u002Fclaude-opus-5-5",{"title":770,"url":771},"Artificial Analysis: Claude Opus 5.5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5",{"title":773,"url":774},"Artificial Analysis: Claude Opus 5.5 (medium) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5-medium",{"title":776,"url":777},"Artificial Analysis: Claude Opus 5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5",{"title":779,"url":780},"OfficeChai: Claude Opus 5.5 creates a 5-point lead over GPT-6 Astra","https:\u002F\u002Fofficechai.com\u002Fai\u002Fclaude-opus-5-5-creates-5-point-lead-over-gpt-6-astra-jumps-to-top-spot-on-artificial-analysis-intelligence-index\u002F",{"title":782,"url":783},"Claude API docs: Models overview, context windows and prices (as of September 2026)","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fmodels\u002Foverview","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fog.jpg",[109,110,111],"Claude Opus 5.5 holt Platz 1 bei Artificial Analysis – die eigentliche Story ist medium","Claude Opus 5.5 ist Platz 1 von 211 Modellen bei Artificial Analysis (58 Punkte). Mit Effort medium erreicht es Opus 5 für 1,34 $ statt 5,86 $ pro Aufgabe.","Horizontale Balken mit Werten im Intelligence Index: Claude Opus 5.5 mit Effort max 58, GPT-6 Astra und Claude Fable 5.1 53, Opus 5 51, Opus 5.5 mit Effort medium 51",{"slug":791,"published":792,"minutes":793,"category":7,"tags":794,"keywords":799,"about":810,"sources":819,"cover":871,"og":872,"expertise":107,"locales":873,"lang":110,"title":874,"description":875,"coverAlt":876},"agent-observability-opentelemetry","2026-08-06",12,[795,796,797,798,504],"OpenTelemetry","LLM observability","AI agents","Tracing",[800,801,802,803,804,805,806,807,808,809],"LLM agent observability OpenTelemetry","OpenTelemetry GenAI semantic conventions","how to trace LLM agents","gen_ai semantic conventions attributes","LLM token usage and cost metrics","LLM tracing sampling","PII in LLM traces","Langfuse vs Arize Phoenix vs Datadog","AI agent tracing evals","OpenTelemetry LLM tracing",[811,813,816],{"name":795,"url":812},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":814,"url":815},"Observability","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",{"name":817,"url":818},"Intelligent agent","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FIntelligent_agent",[820,823,826,829,832,835,838,841,844,847,850,853,856,859,862,865,868],{"title":821,"url":822},"OpenTelemetry: GenAI semantic conventions repository (open-telemetry\u002Fsemantic-conventions-genai)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai",{"title":824,"url":825},"GenAI conventions: overview (status Development)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002FREADME.md",{"title":827,"url":828},"GenAI conventions: model spans, execute_tool and content capture","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-spans.md",{"title":830,"url":831},"GenAI conventions: agent spans","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-agent-spans.md",{"title":833,"url":834},"GenAI conventions: metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-metrics.md",{"title":836,"url":837},"GenAI conventions: inference token metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-token-metrics.md",{"title":839,"url":840},"GenAI conventions: events (gen_ai.evaluation.result)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-events.md",{"title":842,"url":843},"GenAI conventions: Model Context Protocol","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fmcp.md",{"title":845,"url":846},"OpenTelemetry docs: GenAI conventions moved notice","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fspecs\u002Fsemconv\u002Fgen-ai\u002F",{"title":848,"url":849},"OpenTelemetry docs: Sampling","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fconcepts\u002Fsampling\u002F",{"title":851,"url":852},"John Hodge: The state of the OpenTelemetry GenAI semantic conventions (July 2026)","https:\u002F\u002Fjohn-hodge.com\u002Fblog\u002Fopentelemetry-genai-semantic-conventions\u002F",{"title":854,"url":855},"Langfuse docs: OpenTelemetry integration","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fopentelemetry\u002Fget-started",{"title":857,"url":858},"Langfuse repository and licence","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse",{"title":860,"url":861},"Arize Phoenix repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fphoenix",{"title":863,"url":864},"Arize OpenInference repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fopeninference",{"title":866,"url":867},"Datadog docs: OpenTelemetry instrumentation for LLM Observability","https:\u002F\u002Fdocs.datadoghq.com\u002Fllm_observability\u002Finstrumentation\u002Fotel_instrumentation\u002F",{"title":869,"url":870},"Honeycomb docs: Send data with OpenTelemetry","https:\u002F\u002Fdocs.honeycomb.io\u002Fsend-data\u002Fopentelemetry\u002F","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fog.jpg",[109,110,111],"Observability für LLM-Agenten mit OpenTelemetry: Traces, Tokens, PII und Evals","So tracest du LLM-Agenten mit OpenTelemetry: GenAI Semantic Conventions und ihr Status, Span-Baum, Token-Metriken, Sampling, PII, Evals und Tool-Optionen.","Diagramm: Ein Agentenlauf verzweigt sich in OpenTelemetry-Spans für Modellaufrufe, Tool-Aufrufe, Token-Metriken und Eval-Ergebnisse, die an ein Trace-Backend exportiert werden.",{"slug":878,"published":879,"minutes":880,"category":7,"tags":881,"keywords":885,"about":894,"sources":899,"cover":907,"og":908,"expertise":107,"locales":909,"lang":110,"title":910,"description":911,"coverAlt":912},"llm-cost-latency-prompt-caching-routing","2026-06-01",9,[882,883,745,884],"Prompt caching","Model routing","Latency",[886,887,888,889,890,891,892,893],"prompt caching","LLM cost optimization","LLM latency","model routing","batch API LLM","LLM cost per request","cheaper LLM model","cache hit rate LLM",[895,896],{"name":28,"url":29},{"name":897,"url":898},"Latency (engineering)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLatency_(engineering)",[900,903,906],{"title":901,"url":902},"Claude API docs: Prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fdocs\u002Fbuild-with-claude\u002Fprompt-caching",{"title":904,"url":905},"OpenAI API docs: Prompt caching","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fprompt-caching",{"title":782,"url":783},"\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fog.jpg",[109,110,111],"Prompt-Caching und Modell-Routing: LLM-Kosten und Latenz senken","Prompt-Caching, Routing auf das kleinere Modell und Batch-APIs sind die Hebel, die LLM-Kosten und Latenz im Produktivbetrieb senken. So nutzt du jeden davon.","Vier relative Kostenbalken für eine Anfrage: teures Modell ohne Cache, billigeres Modell, gecachter Prefix und gecachter Prefix in einem Batch-Job",1791636873355]