> LLMs selbst hosten für die DSGVO: wann es nötig ist, GPU-Speicher für offene Modelle, EU-Preise Stand Oktober 2026 und Break-even pro Million Token.
>
> Web page: https://balazscsorba.com/de/blog/self-hosted-llm-gdpr-cost · Language: Deutsch · Also available in: [English](https://balazscsorba.com/blog/self-hosted-llm-gdpr-cost.md) · [Magyar](https://balazscsorba.com/hu/blog/self-hosted-llm-gdpr-cost.md)
> Author: Balázs Csorba · Published: 2026-10-09 · Keywords: self-hosted LLM GDPR, self-host LLM data protection, LLM GPU memory requirements, vLLM throughput benchmark, EU GPU cloud for LLMs, LLM API vs self-hosting break-even, open-weight LLM hardware cost, data processing agreement LLM

[Blog](https://balazscsorba.com/de/blog)/LLMOps & Evals

# LLMs selbst hosten für die DSGVO: wann es nötig ist und was es kostet

LLMs selbst hosten für die DSGVO: wann es nötig ist, GPU-Speicher für offene Modelle, EU-Preise Stand Oktober 2026 und Break-even pro Million Token.

[Balázs Csorba](https://balazscsorba.com/de/about)·9\. Oktober 2026·10 Min. Lesezeit

-   Self-hosting
-   GDPR
-   vLLM
-   GPU cost
-   Open-weight models

![Coverbild zu selbst gehosteten LLMs unter der DSGVO: die Wahl zwischen eigenen GPUs und einer EU-API, mit einer Break-even-Linie.](https://balazscsorba.com/images/blog/self-hosted-llm-gdpr-cost/cover.webp?v=f2db601f6c)

## Das Wichtigste in Kürze

-   Selbst hosten solltest du nur, wenn personenbezogene Daten in einem Netz bleiben müssen, das du kontrollierst, oder wenn ein Vertrag oder eine Aufsichtsbehörde jeden Auftragsverarbeiter ausschließt, den du nicht prüfen kannst.
-   Eine EU-gehostete API mit Auftragsverarbeitungsvertrag (DPA), kurzer Speicherdauer und ohne Training auf deinen Daten kann viele B2B-Textanwendungen abdecken.
-   Eine gemietete GPU entfernt den Auftragsverarbeiter nicht: Auch der Hoster braucht einen DPA. Selbst hosten verlagert den Auftragsverarbeiter also, statt ihn abzuschaffen.
-   Die Gewichte brauchen etwa 2 GB pro Milliarde Parameter bei 16 Bit, 1 GB bei 8 Bit und 0,5 GB bei 4 Bit, jeweils ohne KV-Cache.
-   Zu EU-API-Preisen schlägt eine gemietete H100 die API nur bei hoher Auslastung, und der Betrieb kommt noch dazu.
-   Miss den Durchsatz mit deinen eigenen Prompts, bevor du Hardware kaufst oder mietest, mit vllm bench serve, denn veröffentlichte Werte schwanken stark.

Auf dieser Seite

1.  [Wann Selbsthosting wirklich nötig ist](https://balazscsorba.com/#when-self-hosting-is-required)
2.  [Modellgrößen und GPU-Speicher bei Quantisierung](https://balazscsorba.com/#model-sizes-and-gpu-memory)
3.  [GPU-Optionen und Preise am 10. Oktober 2026](https://balazscsorba.com/#gpu-options-and-prices)
4.  [Durchsatz mit vLLM: die Zahlen und wie du sie misst](https://balazscsorba.com/#throughput-with-vllm)
5.  [Break-even pro Million Token](https://balazscsorba.com/#break-even-per-million-tokens)
6.  [Eigene Hardware: die Karte ist günstig, Strom und Lizenz nicht](https://balazscsorba.com/#on-premise-hardware)
7.  [Die Kosten, die nach dem Go-live auftauchen](https://balazscsorba.com/#hidden-costs)
8.  [Was ich zuerst tun würde](https://balazscsorba.com/#first-steps)
9.  [Quellen](https://balazscsorba.com/#sources)

Diesen Artikel anhören

0:000:00

Viele Teams wollen ein Sprachmodell aus Datenschutzgründen selbst hosten. Für die meisten B2B-Textanwendungen ist das nicht nötig. Die DSGVO verbietet Auftragsverarbeiter von Drittanbietern nicht. Sie verlangt einen Vertrag mit jedem Auftragsverarbeiter, eine Rechtsgrundlage für jede Übermittlung und bei riskanter Verarbeitung eine dokumentierte Risikobewertung. Eine EU-gehostete API mit Auftragsverarbeitungsvertrag (DPA) kann diese Anforderungen erfüllen. Selbst hosten ist die richtige Antwort, wenn personenbezogene Daten in einem Netz bleiben müssen, das du kontrollierst, oder wenn ein Vertrag oder eine Aufsichtsbehörde jeden Auftragsverarbeiter ausschließt, den du nicht prüfen kannst. Dann ist die GPU-Rechnung der leichte Teil der Planung – das meiste Geld geht in den Betrieb.

Dieser Artikel prüft die Zahlen am 10. Oktober 2026 und stützt sich nur auf Seiten, die ich öffnen konnte. Er behandelt, wann Selbsthosting nötig ist, wie viel GPU-Speicher offene Modelle je Genauigkeitsstufe brauchen, was EU-basierte GPUs kosten, was vLLM leistet, einen Break-even pro Million Token gegenüber EU-gehosteten APIs und die Kosten, die nach dem Go-live entstehen.

## Wann Selbsthosting wirklich nötig ist

Die Frage ist nicht, ob ein Modell auf deiner Hardware laufen kann, sondern ob personenbezogene Daten dort bleiben müssen. Drei Situationen bringen mich zu einem selbst gehosteten Modell:

-   **Ein Vertrag verbietet es.** Manche Kundenverträge und interne Richtlinien schließen Unterauftragsverarbeiter aus, die du nicht kontrollierst, oder verlangen, dass Daten ein definiertes Netz nie verlassen.
-   **Deine Datenschutz-Folgenabschätzung sagt nein.** Die DSFA für den Anwendungsfall stuft das Risiko einer Verarbeitungskette als zu hoch ein, etwa bei Gesundheitsdaten oder Personalakten.
-   **Es gibt keinen passenden Anbieter.** Kein EU-gehosteter Anbieter bietet das Modell zu den nötigen Bedingungen an, oder das System muss offline laufen, etwa in der Produktionshalle oder am Edge.

Alles Übrige ist eine Frage an den Auftragsverarbeiter, und eine EU-gehostete API beantwortet sie. Artikel 28 verlangt einen Vertrag, der Gegenstand und Dauer der Verarbeitung, Art und Zweck, die Arten personenbezogener Daten und Kategorien betroffener Personen sowie die Pflichten und Rechte des Verantwortlichen festlegt. Er verlangt außerdem eine vorherige schriftliche Genehmigung für Unterauftragsverarbeiter, allgemein oder für den Einzelfall, wobei dieselben Pflichten an sie weitergegeben werden. Artikel 44 macht jede Übermittlung in ein Drittland von den Bedingungen des Kapitels V abhängig. Für US-Unternehmen, die nach dem EU-US Data Privacy Framework zertifiziert sind, bildet der Angemessenheitsbeschluss der Kommission vom 10. Juli 2023 die Grundlage für die Übermittlung.

Lies von oben nach unten. Die erste Antwort, die die Frage entscheidet, bestimmt die Architektur.

**Eine gemietete GPU braucht trotzdem einen DPA**

Eine GPU-Server-Miete entfernt den Auftragsverarbeiter nicht. Der Hoster betreibt die Maschine, auf der deine Daten liegen. In den meisten Fällen ist er deshalb Auftragsverarbeiter, und du brauchst einen DPA mit ihm. Eigene Hardware entfernt den Auftragsverarbeiter; Mieten ändert nur, welchen du hast.

Selbst zu hosten klärt auch die Modellfrage nicht. Die Stellungnahme 28/2024 des EDSA, angenommen am 17. Dezember 2024, sagt, dass KI-Modelle, die mit personenbezogenen Daten trainiert wurden, nicht in allen Fällen als anonym gelten können. Anonymitätsbehauptungen sind daher im Einzelfall zu prüfen. Frag den Anbieter deshalb nach Dokumentation zu den Trainingsdaten, bevor du dich auf eine solche Behauptung stützt.

## Modellgrößen und GPU-Speicher bei Quantisierung

Der Speicherbedarf der Gewichte ist einfache Rechnung: Parameter mal Bit pro Gewicht, geteilt durch acht. Ein Modell mit 70 Milliarden Parametern braucht etwa 140 GB bei 16 Bit, 70 GB bei 8 Bit und 35 GB bei 4 Bit (meine Berechnung). Dazu kommt der KV-Cache, der mit der Kontextlänge und den gleichzeitigen Anfragen wächst, sowie der Eigenbedarf der Laufzeitumgebung. Standardmäßig darf vLLM 92 Prozent des GPU-Speichers nutzen (`gpu_memory_utilization`, in der aktuellen Doku 0,92), und der KV-Cache bekommt, was die Gewichte übrig lassen.

Modell

Größe, gesamt / aktiv

Genauigkeit

Gewichte, GB

benötigte Hardware

gpt-oss-20b

21 Mrd. / 3,6 Mrd.

MXFP4, wie veröffentlicht

unter 16, laut Karte

16 GB GPU-Speicher, laut Karte

Mistral Small 3.2

24 Mrd., dicht

bf16

48 (meine Berechnung); laut Karte etwa 55

eine 80-GB-Karte, mit Platz für den Cache (meine Berechnung)

Llama 3.3 70B

70 Mrd., dicht

bf16 / FP8 / 4 Bit

140 / 70 / 35 (meine Berechnung)

zwei 80-GB-Karten bei bf16; eine 96-GB-Karte bei FP8; eine 48-GB-Karte bei 4 Bit (meine Berechnung)

gpt-oss-120b

117 Mrd. / 5,1 Mrd.

MXFP4, wie veröffentlicht

laut Karte nicht angegeben

eine 80-GB-GPU, laut Karte

Mistral Large 3

675 Mrd., gesamt

FP8 / 4 Bit

675 / etwa 340 (meine Berechnung)

mehr als 8 × 80 GB bei FP8; etwa 340 GB bei 4 Bit passen auf 8 × 80 GB (meine Berechnung)

Zwei Lehren aus der Tabelle. Auf einer 80-GB-Karte bleiben einem 70B-Modell bei 8 Bit, nachdem vLLM seinen Anteil genommen hat, nur wenige Gigabyte für den Cache (meine Berechnung). Plane deshalb zwei Karten oder eine 96-GB-Karte ein. Und welches Modell du betreiben kannst, hängt vom Speicher ab, den du mieten kannst. Prüfe den Speicher also, bevor du einen Benchmark liest.

## GPU-Optionen und Preise am 10. Oktober 2026

Das sind die Preise, die ich auf den Anbieterseiten lesen konnte, mit ihren Datumsangaben. Wo ein Anbieter einen Monatspreis nennt, zitiere ich ihn. Wo nicht, rechne ich mit 730 Stunden pro Monat und sage das dazu.

Option

GPU-Speicher

Preis laut Anbieter

pro Monat

Datum und Quelle

Scaleway L4-1-24G, Paris

24 GB

0,79 € pro Stunde, netto

etwa 575 € (Scaleway)

10\. Okt. 2026, GPU-Preisseite

Scaleway H100-1-80G

80 GB

2,868 € pro Stunde ab 1. Juni 2026

etwa 2.094 € (meine Berechnung)

27\. Apr. 2026, Scaleway-Blogbeitrag

OVHcloud l40s-1-gpu

nicht auf der Preisliste

1,69 $ pro Stunde, ohne USt.

etwa 1.237 $ (OVHcloud)

10\. Okt. 2026, Preisliste Public Cloud

OVHcloud h100-1-gpu

80 GiB

3,39 $ pro Stunde, ohne USt.

etwa 2.473 $ (OVHcloud)

10\. Okt. 2026, Preisliste Public Cloud

RTX 5090, gekauft

32 GB

1.999 $ Einführungspreis

etwa 56 $ über 36 Monate (meine Berechnung)

NVIDIA-Newsroom, ab 30. Januar

Hetzner GEX63 oder GEX131

96 GB

auf der statischen Seite nicht lesbar

entfällt

10\. Okt. 2026, GPU-Server-Matrix

Hetzner beschreibt seine GPU-Server als DSGVO-konform und in Europa gelegen. Die Matrixseite listet RTX-PRO-6000-Blackwell-Karten mit 96 GB GDDR7 in den Modellen GEX63 und GEX131 auf. Die monatlichen Preise stehen nur im Konfigurator, den ich nicht lesen konnte, deshalb lasse ich sie in der Tabelle weg. Prüfe sie dort, bevor du vergleichst.

Zwei Dinge sind zu beachten. Scaleway hat den Preis einer H100 am 1. Juni 2026 von 2,73 € auf 2,868 € pro Stunde angehoben, ältere Vergleichsseiten sind also veraltet. OVHcloud zeigt seine Preise in Dollar. Rechne sie deshalb am Tag des Vergleichs in Euro um, bevor du sie neben die Euro-Zeilen stellst.

## Durchsatz mit vLLM: die Zahlen und wie du sie misst

Die eigenen Benchmarks von vLLM nennen relative Zugewinne statt absoluter Token pro Sekunde. Im Beitrag vom September 2024 zu v0.6.0 berichtete das Team vom 2,7-fachen Durchsatz gegenüber v0.5.3 bei Llama 3 8B auf einer H100 und vom 1,8-fachen bei Llama 3 70B auf vier H100, jeweils mit dem ShareGPT-Datensatz und 500 Prompts. Für den Server würde ich mit vLLM anfangen; meine [vLLM-Rezension](https://balazscsorba.com/de/tools/vllm) beschreibt die Abwägungen.

Absolute Zahlen hängen vom Modell, von der Länge der Prompts und Antworten und davon ab, wie schnell jeder Nutzer antworten soll. Der Benchmark von SemiAnalysis InferenceX zeigt diesen Zielkonflikt für Llama 3.3 70B auf H100. Pro GPU erreicht er etwa 1.850 Token pro Sekunde, wenn jeder Nutzer 38 Token pro Sekunde bekommt, etwa 1.170 bei 58 Token pro Sekunde und Nutzer und etwa 880 bei 78. Diese drei Werte sind aus den Datenpunkten der Seite interpoliert (meine Lesart), und der Benchmark nutzt 8K/1K-Sequenzlängen. Die Seite nennt Genauigkeit und Serving-Engine nicht durchgehend, deshalb behandle ich die Zahlen als Größenordnung.

```
# serve gpt-oss-120b on one 80 GB GPU (model card)
vllm serve openai/gpt-oss-120b

# a 70B model at bf16 needs two 80 GB GPUs (my calculation)
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2

# from a second terminal, send 500 random prompts at 4 requests per second
vllm bench serve --model openai/gpt-oss-120b --dataset-name random --num-prompts 500 --request-rate 4
```

Miss deine eigenen Zahlen mit vllm bench serve. Die Standardwerte senden 1.000 zufällige Prompts mit unendlicher Anfragerate (inf), deshalb setzt du Anzahl und Rate selbst und nimmst nach Möglichkeit Prompts, die deinen ähneln. Steigere dann die Rate und notiere bei jeder Stufe Time to First Token und Time per Output Token. Die Option --goodput zählt nur die Anfragen, die deine Latenzziele einhalten. Das ist die Zahl, die bei einem Feature mit Nutzerkontakt zählt.

## Break-even pro Million Token

Die Formel passt in eine Zeile. Die Kosten pro Million Token ergeben sich aus den monatlichen GPU-Kosten, geteilt durch die im Monat erzeugten Token, mal eine Million. Die Token pro Monat ergeben sich aus den Token pro Sekunde mal 2.628.000 Sekunden (730 Stunden) mal dem Anteil der Zeit, in dem die GPU ausgelastet ist. Ich behandle jeden bedienten Token als einen abrechenbaren Token zum Output-Preis der API. Das hält den Vergleich einfach (meine Methode, kein Benchmark-Ergebnis).

Kosten pro Million Token für eine gemietete H100 bei 2.094 € im Monat, mit den InferenceX-Werten (meine Berechnung):

Token pro Sekunde (Tempo pro Nutzer)

25 % ausgelastet

50 % ausgelastet

100 % ausgelastet

877 (78 Token/s pro Nutzer)

3,63 €

1,82 €

0,91 €

1.171 (58 Token/s pro Nutzer)

2,72 €

1,36 €

0,68 €

1.848 (38 Token/s pro Nutzer)

1,72 €

0,86 €

0,43 €

Gegen die EU-APIs ist Llama 3.3 70B der nähere Fall. OVHcloud verlangt 0,67 € pro Million Token, Scaleway 0,90 €. Bei 58 Token pro Sekunde und Nutzer müsste eine gemietete H100 rund um die Uhr etwa 1.190 Token pro Sekunde liefern, um OVHcloud zu erreichen (meine Berechnung). Der Benchmark liefert bei diesem Tempo 1.171 Token pro Sekunde, also schafft sie es nicht. Gegenüber 0,90 € bei Scaleway liegt der Break-even bei etwa 885 Token pro Sekunde, rund drei Vierteln dieses Benchmark-Werts.

gpt-oss-120b setzt die Latte höher. Die API kostet bei Scaleway 0,60 € pro Million Output-Token und bei OVHcloud 0,40 €. Eine gemietete H100 für 2.094 € im Monat muss daher im Schnitt etwa 1.330 Output-Token pro Sekunde erzeugen, um Scaleway zu erreichen, und etwa 1.990, um OVHcloud zu erreichen (meine Berechnung). Ich habe keine verifizierte H100-Zahl für gpt-oss-120b gefunden, miss also, bevor du entscheidest. Input-Token sind noch günstiger, mit 0,15 € und 0,08 € pro Million.

Break-even für eine gemietete H100 bei 2.094 € im Monat (meine Berechnung), gegen den Scaleway-Preis von 0,60 € pro Million Output-Token für gpt-oss-120b. Ab etwa 3,5 Milliarden Output-Token im Monat ist die GPU günstiger, sofern sie diese Last tatsächlich bedienen kann. Das habe ich für gpt-oss-120b nicht verifiziert.

Die Betriebskosten kommen obendrauf. Jede 1.000 € monatlicher Betriebskosten verschieben den Break-even von gpt-oss-120b bei 0,60 € pro Million Token um etwa 1,7 Milliarden Output-Token im Monat, oder rund 630 Token pro Sekunde rund um die Uhr (meine Berechnung). Der Preis allein rechtfertigt Selbsthosting also selten, wenn eine EU-gehostete API das Modell schon anbietet. Der Fall entsteht, wenn die Hardware dir bereits gehört, wenn die Last eine GPU den ganzen Monat auslastet oder wenn kein EU-Anbieter das gewünschte Modell hat.

## Eigene Hardware: die Karte ist günstig, Strom und Lizenz nicht

Eine gekaufte Karte wirkt neben einer gemieteten günstig. NVIDIA hat die GeForce RTX 5090 zum Start mit 1.999 $ angesetzt, mit 32 GB GDDR7 und 575 W Gesamtgrafikleistung. Auf 36 Monate verteilt kostet die Karte etwa 56 $ im Monat (meine Berechnung). Läuft sie rund um die Uhr auf Volllast, verbraucht allein die Karte etwa 420 kWh im Monat (575 W mal 730 Stunden, meine Berechnung). Bei der Beispielannahme von 30 ct/kWh sind das etwa 126 € im Monat (meine Berechnung, kein Tarif-Zitat). Über drei Jahre kommt allein der Strom auf rund 4.500 €, mehr als das Doppelte des Einführungspreises von 1.999 $.

**Prüfe die Lizenz, bevor die Karte in den Serverraum kommt**

Nach Klausel 2.8 der GeForce-Lizenz von NVIDIA ist GeForce- und Titan-Software nicht für den Rechenzentrumseinsatz lizenziert (Originalwortlaut: „is not licensed for datacenter deployment“). Eine Verbraucherkarte im Serverschrank kann also außerhalb der Lizenz liegen. Prüfe die Bedingungen für genau die Karte, die du kaufen willst, bevor du darauf aufbaust.

## Die Kosten, die nach dem Go-live auftauchen

Sobald der Dienst läuft, ist die GPU-Miete meist der kleinste Posten. Der Rest sind Arbeitszeit und Risiko. Die Planungswerte in der Tabelle sind meine eigenen Annahmen, keine gemessenen Daten, ersetze sie deshalb durch die Zahlen deines Teams.

Posten

Was dazugehört

Planungsannahme (meine)

Betrieb

Serving, Monitoring, GPU-Ausfälle, Neustarts, Kapazitätsplanung

0,1 bis 0,2 der Arbeitszeit einer Person

Updates

neue Versionen von vLLM, CUDA und Treiber, OS-Patches, Modellwechsel

zwei bis fünf Ingenieurstage pro Modellwechsel

Evals

ein Regressionsset vor jeder Modell- oder Serving-Änderung

zwei bis fünf Tage zum Aufbau, danach etwa ein Tag pro Lauf

Bereitschaft

jemand antwortet, wenn der Endpunkt außerhalb der Arbeitszeit ausfällt

mindestens zwei Personen für einen 24/7-Dienst

Redundanz

ein zweiter GPU-Knoten für das Failover

verdoppelt die Miete ungefähr

Compliance

DPA mit dem Hoster, Aktualisierung der DSFA, Verzeichnis der Verarbeitungstätigkeiten, Logs, die du dann selbst besitzt

ein paar Tage pro Jahr

## Was ich zuerst tun würde

1.  **Schreib die Daten und die Regeln auf.** Notiere, welche Datenklassen das Modell erreichen und welche Verträge oder DSFA-Ergebnisse gelten. Schließt keine davon einen Auftragsverarbeiter aus, starte mit einer EU-API mit DPA.
2.  **Hol dir die Hosting-Fakten schriftlich.** Frag nach der Hosting-Region, der Liste der Unterauftragsverarbeiter und den Speichereinstellungen. Mistrals Preisseite verlinkt einen DPA, sagt aber nicht, wo die API läuft. Diese Antwort muss deshalb aus dem Vertrag kommen.
3.  **Wähle das kleinste Modell, das deine Evals besteht.** Prüfe dann seinen Speicherbedarf bei der Genauigkeit, die du tatsächlich betreiben kannst, nicht bei der auf der Modellkarte.
4.  **Miss mit deinen eigenen Prompts.** Führe vllm bench serve mit deinen echten Prompt-Längen und einem Latenzziel aus, bevor du dich auf Hardware festlegst.
5.  **Berechne den Break-even mit deinen eigenen Zahlen neu.** Nutze deine gemessenen Token pro Sekunde, deine echte Auslastung und dein Betriebsbudget. Geht es nicht auf, bleib bei der API und halte Selbsthosting als dokumentierte Rückfalloption fest.
6.  **Plane den Betrieb vor dem Go-live ein.** Lege zuerst die Eval-Suite, den Bereitschaftsplan und die Update-Regeln fest. Die GPU ist der einfache Teil.

Für die Datenseite der Pipeline lies meine Notizen zu [EU-Datenresidenz, Regionskontrollen und Zero Retention](https://balazscsorba.com/de/blog/gdpr-llm-api-eu-data-residency) und zu [PII-Redaktion](https://balazscsorba.com/de/blog/pii-redaction-llm-pipelines). Für das Regressionsset siehe [LLM-Evals für Produktfeatures](https://balazscsorba.com/de/blog/llm-evals-for-product-features).

## Quellen

1.  [Modellkarte openai/gpt-oss-120b (Hugging Face)](https://huggingface.co/openai/gpt-oss-120b)
2.  [Modellkarte mistralai/Mistral-Small-3.2-24B-Instruct-2506 (Hugging Face)](https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506)
3.  [Modellkarte meta-llama/Llama-3.3-70B-Instruct (Hugging Face)](https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct)
4.  [Modellkarte mistralai/Mistral-Large-3-675B-Instruct-2512 (Hugging Face)](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512)
5.  [vLLM-Blog: Leistungsupdate v0.6.0 (September 2024)](https://blog.vllm.ai/2024/09/05/perf-update.html)
6.  [vLLM-Dokumentation: Engine-Argumente](https://docs.vllm.ai/en/latest/configuration/engine_args.html)
7.  [vLLM-Dokumentation: vllm bench serve](https://docs.vllm.ai/en/latest/cli/bench/serve.html)
8.  [SemiAnalysis InferenceX: Llama 3.3 70B auf H100 vs. H200](https://inferencex.semianalysis.com/compare/llama-3-3-70b-h100-vs-h200)
9.  [Scaleway: Preise für GPU-Instanzen](https://www.scaleway.com/en/pricing/gpu/)
10.  [Scaleway-Blog: Ein transparentes Update zu den Scaleway-Preisen (27. April 2026)](https://www.scaleway.com/en/blog/a-transparent-update-on-scaleway-pricing/)
11.  [Scaleway Generative APIs: Preise](https://www.scaleway.com/en/pricing/model-as-a-service/)
12.  [OVHcloud: Preisliste Public Cloud](https://www.ovhcloud.com/en/public-cloud/prices/)
13.  [OVHcloud AI Endpoints](https://www.ovhcloud.com/en/public-cloud/ai-endpoints/)
14.  [OVHcloud AI Endpoints: Modellkatalog](https://www.ovhcloud.com/en/public-cloud/ai-endpoints/catalog/)
15.  [Hetzner: dedizierte GPU-Server](https://www.hetzner.com/dedicated-rootserver/matrix-gpu/)
16.  [NVIDIA-Newsroom: Start der GeForce-RTX-50-Serie](https://nvidianews.nvidia.com/news/nvidia-blackwell-geforce-rtx-50-series-opens-new-world-of-ai-computer-graphics)
17.  [NVIDIA GeForce RTX 5090](https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/)
18.  [NVIDIA GeForce-Softwarelizenz](https://www.nvidia.com/en-us/drivers/geforce-license/)
19.  [DSGVO Artikel 28: Auftragsverarbeiter](https://gdpr-info.eu/art-28-gdpr/)
20.  [DSGVO Artikel 44: allgemeiner Grundsatz für Übermittlungen](https://gdpr-info.eu/art-44-gdpr/)
21.  [Europäische Kommission: EU-US-Datenübermittlungen (Data Privacy Framework)](https://commission.europa.eu/law/law-topic/data-protection/international-dimension-data-protection/eu-us-data-transfers_en)
22.  [EDSA-Stellungnahme 28/2024 zu KI-Modellen (angenommen am 17. Dezember 2024)](https://www.edpb.europa.eu/system/files/2024-12/edpb_opinion_202428_ai-models_en.pdf)
23.  [Mistral AI: Preise](https://mistral.ai/pricing)

## Häufige Fragen

Macht ein selbst gehostetes LLM die DSGVO-Konformität automatisch?

Nein. Du streichst einen Auftragsverarbeiter, brauchst aber weiterhin eine Rechtsgrundlage, eine Risikobewertung, ein Verzeichnis der Verarbeitungstätigkeiten, Löschregeln und einen DPA mit dem Unternehmen, das deine Server betreibt. Der EDSA sagt außerdem, dass KI-Modelle, die mit personenbezogenen Daten trainiert wurden, nicht in allen Fällen als anonym gelten können.

Wie viel GPU-Speicher braucht ein 70B-Modell?

Etwa 140 GB Gewichte bei 16 Bit, 70 GB bei 8 Bit und 35 GB bei 4 Bit, jeweils ohne KV-Cache (meine Berechnung). Bei 8 Bit bleibt auf einer 80-GB-Karte wenig Platz für den Kontext. Plane deshalb zwei Karten oder eine Karte mit 96 GB.

Wann reicht eine EU-gehostete API mit DPA?

Wenn keine besonderen Kategorien personenbezogener Daten im Spiel sind und weder ein Kundenvertrag noch eine Folgenabschätzung einen Auftragsverarbeiter ausschließt. Prüfe die Liste der Unterauftragsverarbeiter, die Hosting-Region, die Speichereinstellungen und ob der Anbieter mit deinen Daten trainiert.

Was kostet eine gemietete H100 pro Million Token?

Bei 2.094 € im Monat (meine Berechnung: 2,868 € pro Stunde über 730 Stunden) etwa 0,68 € pro Million Output-Token bei 1.171 Token pro Sekunde über den ganzen Monat (58 Token pro Sekunde und Nutzer), und etwa 1,36 € bei der halben Auslastung (meine Berechnung).

Geschrieben von Balázs Csorba

Senior Fullstack & AI Engineer in der Steiermark – über 10 Jahre Vue, Nuxt, Node.js und PHP, heute baue ich Werkzeuge für KI-Agenten.

[KI-Entwicklung & MCP-Server →](https://balazscsorba.com/de/expertise/ai-engineer)[Über mich →](https://balazscsorba.com/de/about)

## Weitere Artikel

-   [Lokales Text-to-Speech im großen Maßstab: 96 Artikel mit offenen Modellen vertont](https://balazscsorba.com/de/blog/local-text-to-speech-pipeline)
-   [Claude Opus 5.5 holt Platz 1 bei Artificial Analysis – die eigentliche Story ist medium](https://balazscsorba.com/de/blog/artificial-analysis-leaderboard-claude-opus-5-5)
-   [Observability für LLM-Agenten mit OpenTelemetry: Traces, Tokens, PII und Evals](https://balazscsorba.com/de/blog/agent-observability-opentelemetry)
-   [Prompt-Caching und Modell-Routing: LLM-Kosten und Latenz senken](https://balazscsorba.com/de/blog/llm-cost-latency-prompt-caching-routing)

## Klingt nach dem, was du suchst?

Erzähl mir von deinem Projekt oder deiner Stelle – ich freue mich, von dir zu hören.

[Gespräch buchen](mailto:contact@balazscsorba.com) [Auf LinkedIn vernetzen](https://www.linkedin.com/in/balazs-csorba)
