Blog/LLMOps és értékelés

Saját LLM-üzemeltetés a GDPR miatt: mikor kell és mibe kerül

Saját LLM a GDPR miatt: mikor kell, mennyi GPU-memória kell a nyílt modellekhez, az EU-s árak 2026 októberében és a break-even millió tokenenként.

··10 perc olvasás

  • Self-hosting
  • GDPR
  • vLLM
  • GPU cost
  • Open-weight models
Borítókép a saját üzemeltetésű LLM-ekről a GDPR alatt: döntés a saját GPU-k és egy EU-s API között, break-even vonallal.

A lényeg röviden

  • Saját üzemeltetést csak akkor válassz, ha a személyes adatoknak a te irányításod alatt álló hálózaton belül kell maradniuk, vagy ha szerződés vagy hatóság kizár minden olyan feldolgozót, amelyet nem tudsz ellenőrizni.
  • Egy EU-ban üzemeltetett API adatfeldolgozási szerződéssel (DPA), rövid megőrzéssel és az adataid tanítás nélkül sok B2B szöveges feladatot lefedhet.
  • A bérelt GPU nem szünteti meg a feldolgozót: a hosting cégnek is kell DPA. A saját üzemeltetés tehát a feldolgozót áthelyezi, nem megszünteti.
  • A súlyokhoz milliárd paraméterenként nagyjából 2 GB kell 16 bites pontossággal, 1 GB 8 bitnél és 0,5 GB 4 bitnél, a KV-cache nélkül.
  • Az EU-s API-árak mellett egy bérelt H100 csak nagy kihasználtságnál éri meg az API-t, és az üzemeltetés költsége még rákerül.
  • Mérd meg az áteresztőképességet a saját promptjaiddal a vllm bench serve paranccsal, mielőtt hardvert vennél vagy bérelnél, mert a közzétett értékek erősen eltérnek.

Cikk meghallgatása

0:000:00

Sokan szeretnének adatvédelmi okokból saját nyelvi modellt üzemeltetni, de a legtöbb B2B szöveges feladathoz ez nem szükséges. A GDPR nem tiltja a harmadik fél feldolgozóit. Szerződést kér minden feldolgozóval, jogalapot minden továbbításhoz, és kockázatos feldolgozásnál dokumentált kockázatelemzést. Egy EU-ban üzemeltetett API adatfeldolgozási szerződéssel (DPA) teljesítheti ezeket a követelményeket. A saját üzemeltetés akkor a helyes válasz, ha a személyes adatoknak a te irányításod alatt álló hálózaton belül kell maradniuk, vagy ha szerződés vagy hatóság kizár minden olyan feldolgozót, amelyet nem tudsz ellenőrizni. Ilyenkor a GPU-számla a könnyebben tervezhető rész – a pénz nagy része az üzemeltetésbe megy.

Ez a cikk 2026. október 10-én ellenőrzi a számokat, és csak olyan oldalakra támaszkodik, amelyeket meg tudtam nyitni. Bemutatja, mikor kötelező a saját üzemeltetés, mennyi GPU-memória kell a nyílt súlyú modelleknek az egyes pontossági szinteken, mibe kerülnek az EU-s GPU-k, mit nyújt a vLLM, egy millió tokenre vetített break-even számítást az EU-s API-kkal szemben, és a bevezetés utáni költségeket.

Mikor kell valóban saját üzemeltetés

A kérdés nem az, hogy a modell fut-e a te hardveredén, hanem az, hogy a személyes adatoknak ott kell-e maradniuk. Három helyzet terel saját modell felé:

  • Szerződés tiltja. Egyes ügyfélszerződések és belső szabályzatok kizárják azokat az alfeldolgozókat, amelyeket nem irányítasz, vagy előírják, hogy az adatok soha ne hagyják el a meghatározott hálózatot.
  • A hatásvizsgálatod nemet mond. Az adott felhasználási esetre készült adatvédelmi hatásvizsgálat szerint egy feldolgozói lánc kockázata túl nagy, például egészségügyi adatoknál vagy munkavállalói nyilvántartásnál.
  • Nincs megfelelő szolgáltató. Egyetlen EU-s szolgáltató sem kínálja a modellt a szükséges feltételekkel, vagy a rendszernek offline kell futnia, például a gyártósoron vagy az edge-en.

Minden más feldolgozói kérdés, és erre egy EU-s API válaszol. A 28. cikk olyan szerződést ír elő, amely rögzíti a feldolgozás tárgyát és időtartamát, jellegét és célját, a személyes adatok típusait és az érintettek körét, valamint az adatkezelő kötelezettségeit és jogait. Előírja azt is, hogy az alfeldolgozókhoz előzetes írásbeli hozzájárulás kell, akár egyedi, akár általános formában, és ugyanezek a kötelezettségek rájuk is átszállnak. A 44. cikk minden harmadik országba irányuló továbbítást a rendelet továbbítási fejezetének feltételeihez köt. Az Európai Bizottság 2023. július 10-i megfelelőségi határozata az EU–USA adatvédelmi keretrendszerben (Data Privacy Framework) tanúsított amerikai cégekre a továbbítások alapját adja.

Hova mehet a promptDöntési lánc. Ha a személyes adatoknak a hálózaton belül kell maradniuk, következik a saját üzemeltetés vLLM-mel. Ha nem, nézd meg, elérhető-e EU-s hoster DPA-val és nulla megőrzéssel: az igen egy EU-s API DPA-val, a nem pedig saját üzemeltetést vagy szolgáltatóváltást jelent.Marad az adat a hálózatodban?EU-s hoster, DPA, nincs megőrzés?nemigenSaját üzemeltetés vLLM-mela személyes adat a hálózaton maradigenEU-s API DPA-valAlfeldolgozók és megőrzés ellenőrzéseHa nem: saját üzemeltetés vagy váltásNem EU-s hosztnál a V. fejezet szerinti garanciák kellenek, mielőtt használnád.
Felülről lefelé olvasd. Az első válasz, amely eldönti a kérdést, határozza meg az architektúrát.

A saját üzemeltetés a modellkérdést sem oldja meg. Az Európai Adatvédelmi Testület (EDPB) 28/2024. számú véleménye, amelyet 2024. december 17-én fogadtak el, szerint a személyes adatokkal tanított AI-modellek nem minden esetben tekinthetők anonimnak. Az anonimitásra hivatkozást ezért esetenként kell megítélni. Kérdezd meg a szolgáltatótól a tanítóadatokra vonatkozó dokumentációt, mielőtt egy ilyen állításra támaszkodnál.

Modellméretek és GPU-memória kvantálással

A súlyok memóriaigénye egyszerű számítás: paraméterek száma szorozva a bitekkel súlyonként, osztva nyolccal. Egy 70 milliárd paraméteres modell nagyjából 140 GB-ot igényel 16 biten, 70 GB-ot 8 biten és 35 GB-ot 4 biten (saját számítás). Ebbe nem tartozik bele a KV-cache, amely a kontextushosszal és a párhuzamos kérésekkel nő, sem a futtatókörnyezet saját terhelése. Alapértelmezés szerint a vLLM a GPU-memória 92 százalékát használhatja (gpu_memory_utilization, az aktuális dokumentációban 0,92), a KV-cache pedig azt kapja, amit a súlyok meghagynak.

ModellMéret, összes / aktívPontosságSúlyok, GBSzükséges hardver
gpt-oss-20b21 Mrd / 3,6 MrdMXFP4, ahogy megjelent16 alatt, a kártya szerint16 GB GPU-memória, a kártya szerint
Mistral Small 3.224 Mrd, sűrűbf1648 (saját számítás); a kártya szerint kb. 55egy 80 GB-os kártya, a cache-nek marad hely (saját számítás)
Llama 3.3 70B70 Mrd, sűrűbf16 / FP8 / 4 bit140 / 70 / 35 (saját számítás)két 80 GB-os kártya bf16-on; egy 96 GB-os kártya FP8-on; egy 48 GB-os kártya 4 biten (saját számítás)
gpt-oss-120b117 Mrd / 5,1 MrdMXFP4, ahogy megjelenta kártyán nincs megadvaegy 80 GB-os GPU, a kártya szerint
Mistral Large 3675 Mrd, összesFP8 / 4 bit675 / kb. 340 (saját számítás)több mint 8 × 80 GB FP8-on; kb. 340 GB 4 biten nyolc 80 GB-os kártyára fér (saját számítás)

Két tanulság a táblázatból. Egy 80 GB-os kártyán egy 70B-s modell 8 biten, miután a vLLM a maga részét elvette, csak néhány gigabájtot hagy a cache-nek (saját számítás), ezért tervezz két kártyát vagy egy 96 GB-os kártyát. A futtatható modell attól függ, mennyi memóriát tudsz bérelni, ezért ellenőrizd a memóriát, mielőtt benchmarkot olvasol.

GPU-opciók és árak 2026. október 10-én

Ezek azok az árak, amelyeket a szolgáltatói oldalakon olvashattam le, a dátumukkal együtt. Ahol a szolgáltató havi összeget ad meg, azt idézem; ahol nem, 730 órás hónappal számolok, és ezt jelzem.

OpcióGPU-memóriaListaárhavontaDátum és forrás
Scaleway L4-1-24G, Párizs24 GB0,79 € óránként, adó nélkülkb. 575 € (Scaleway)2026. okt. 10., GPU-árlap
Scaleway H100-1-80G80 GB2,868 € óránként 2026. június 1-tőlkb. 2 094 € (saját számítás)2026. ápr. 27., Scaleway-blogbejegyzés
OVHcloud l40s-1-gpunincs az árlistán1,69 $ óránként, ÁFA nélkülkb. 1 237 $ (OVHcloud)2026. okt. 10., public cloud árlista
OVHcloud h100-1-gpu80 GiB3,39 $ óránként, ÁFA nélkülkb. 2 473 $ (OVHcloud)2026. okt. 10., public cloud árlista
RTX 5090, megvásárolva32 GB1 999 $ indulási árkb. 56 $ 36 hónapra osztva (saját számítás)NVIDIA-hírszoba, január 30-tól
Hetzner GEX63 vagy GEX13196 GBa statikus oldalon nem olvashatón/a2026. okt. 10., GPU-szerver mátrix

A Hetzner GDPR-kompatibilisnek és Európában elhelyezettnek írja le a GPU-szervereit. A mátrixoldalán 96 GB GDDR7 memóriás RTX PRO 6000 Blackwell kártyák szerepelnek a GEX63 és a GEX131 típusban. A havi árak csak a konfigurátorban jelennek meg, amelyet nem tudtam elolvasni, ezért kihagytam őket a táblázatból. Ellenőrizd ott, mielőtt összehasonlítasz.

Két dologra figyelj. A Scaleway 2026. június 1-jétől 2,73 €-ról 2,868 €-ra emelte az H100 óradíját, így a régebbi összehasonlító oldalak elavultak. Az OVHcloud dollárban mutatja az áraikat, ezért az összehasonlítás napján váltsd át őket euróra, mielőtt az eurós sorok mellé teszed.

Áteresztőképesség vLLM-mel: a számok és a mérés módja

A vLLM saját benchmarkjai relatív nyereséget közölnek, nem abszolút token/másodperc értéket. A csapat 2024 szeptemberi, a v0.6.0-ról szóló bejegyzésében a v0.5.3-hoz képest 2,7-szeres áteresztőképességet jelentett Llama 3 8B modellen egy H100-on, és 1,8-szorosat Llama 3 70B modellen négy H100-on, a ShareGPT adatkészlettel és 500 prompttal. A szerverhez a vLLM-mel kezdeném; a vLLM-áttekintésem a kompromisszumokat tárgyalja.

Az abszolút számok függnek a modelltől, a promptok és a válaszok hosszától, és attól, milyen gyorsan kell egy-egy felhasználónak választ kapnia. A SemiAnalysis InferenceX benchmarkja ezt a kompromisszumot mutatja Llama 3.3 70B modellre H100-on. GPU-nként nagyjából 1 850 token/másodpercet ér el, ha minden felhasználó 38 token/másodpercet kap, nagyjából 1 170-et 58 token/másodperc/felhasználó mellett, és nagyjából 880-at 78 mellett. A három érték az oldal adatpontjaiból interpolált (az én olvasatom), a benchmark pedig 8K/1K sorozathosszokat használ. Az oldal a pontosságot és a szerver-motort nem következetesen adja meg, ezért a számokat nagyságrendnek tekintem.

# serve gpt-oss-120b on one 80 GB GPU (model card)
vllm serve openai/gpt-oss-120b

# a 70B model at bf16 needs two 80 GB GPUs (my calculation)
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2

# from a second terminal, send 500 random prompts at 4 requests per second
vllm bench serve --model openai/gpt-oss-120b --dataset-name random --num-prompts 500 --request-rate 4

Mérd a saját számaidat a vllm bench serve paranccsal. Az alapértelmezett beállítás 1 000 véletlen promptot küld, végtelen kérési rátával, ezért a prompt-számot és a rátát magadnak kell beállítanod, és ahol lehet, a saját promptjaidhoz hasonló promptokat használj. Utána növeld a rátát, és minden szinten jegyezd fel a Time to First Tokent és a Time per Output Tokent. A --goodput opció csak azokat a kéréseket számolja, amelyek teljesítik a késleltetési céljaidat. Ez az a szám, amely egy felhasználóknak szánt funkciónál számít.

Break-even millió tokenenként

A képlet egy sorba fér. A millió tokenre jutó költség a havi GPU-költség osztva az adott hónapban megtermelt tokenekkel, szorozva egymillióval. A havi tokenek a másodpercenkénti tokenek szorozva 2 628 000 másodperccel (730 óra), szorozva azzal az időhányaddal, amelyben a GPU ki van használva. Minden kiszolgált tokent egy számlázható tokennek veszek az API output-árán, így az összehasonlítás egyszerű marad (saját módszer, nem benchmark-eredmény).

Millió tokenre jutó költség egy bérelt H100-on, havi 2 094 €-val, az InferenceX-értékekkel (saját számítás):

Token/másodperc (sebesség felhasználónként)25%-ban kihasználva50%-ban kihasználva100%-ban kihasználva
877 (78 token/s felhasználónként)3,63 €1,82 €0,91 €
1 171 (58 token/s felhasználónként)2,72 €1,36 €0,68 €
1 848 (38 token/s felhasználónként)1,72 €0,86 €0,43 €

Az EU-s API-kkal szemben a Llama 3.3 70B a közelebbi eset. Az OVHcloud 0,67 €-t kér egymillió tokenért, a Scaleway 0,90 €-t. 58 token/másodperc/felhasználó mellett egy bérelt H100-nak az óra körül nagyjából 1 190 token/másodpercet kellene szolgáltatnia ahhoz, hogy elérje az OVHcloud árát (saját számítás). A benchmark ezen a sebességen 1 171-et ad, így nem jut el oda. A Scaleway 0,90 €-s árához a break-even körülbelül 885 token/másodperc, vagyis a benchmark-érték nagyjából háromnegyede.

A gpt-oss-120b magasabbra teszi a lécet. Az API a Scaleway-nél 0,60 €-t kér millió output tokenért, az OVHcloud-nál 0,40 €-t. Egy bérelt H100, havi 2 094 €-val, átlagosan nagyjából 1 330 output tokent kell másodpercenként termelnie, hogy elérje a Scaleway árát, és nagyjából 1 990-et, hogy elérje az OVHcloud árát (saját számítás). Nem találtam ellenőrzött H100-as értéket a gpt-oss-120b-re, ezért mérd meg, mielőtt döntesz. A bemeneti tokenek még olcsóbbak: millióra 0,15 €, illetve 0,08 €.

Break-even: egy bérelt H100 egy EU-s API ellenVonaldiagram a havi költségről a havi output tokenek függvényében. Az API költsége nullától egyenesen emelkedik, millió output tokenenként 0,60 euróval. A bérelt H100 havi költsége nagyjából 2 094 euró, függetlenül attól, mennyi tokent szolgál ki. A két vonal nagyjából havi 3,5 milliárd output tokennél metszi egymást. E fölött a saját GPU olcsóbb, de csak akkor, ha ki van használva.012345Output tokenek havonta (milliárd)0 €1 000 €2 000 €3 000 €Költség havontaEgy bérelt H100: havi 2 094 €EU-s API: 0,60 € milliókéntBreak-even: 3,5 Mrd token
Break-even egy bérelt H100-ra, havi 2 094 € mellett (saját számítás), a gpt-oss-120b Scaleway-árával szemben, amely millió output tokenenként 0,60 €. Havi nagyjából 3,5 milliárd output token felett a GPU olcsóbb, feltéve hogy valóban ki tudja szolgálni ezt a terhelést, amit a gpt-oss-120b esetén nem ellenőriztem.

Az üzemeltetési költségek ráadásul rákerülnek. Minden 1 000 € havi üzemeltetési költség nagyjából 1,7 milliárd output tokennel tolja feljebb a gpt-oss-120b break-even pontját 0,60 €-nál millió tokenenként, vagyis az óra körül nagyjából 630 token/másodperccel (saját számítás). Az ár önmagában ezért ritkán indokolja a saját üzemeltetést, ha egy EU-s API már kínálja a modellt. A saját üzemeltetés akkor éri meg, ha a hardver már a tiéd, ha a terhelés egész hónapban leköti a GPU-t, vagy ha egyetlen EU-s szolgáltató sem kínálja a szükséges modellt.

Saját hardver: a kártya olcsó, az áram és a licenc nem

A megvásárolt kártya a bérelthez képest olcsónak látszik. Az NVIDIA a GeForce RTX 5090 indulási árát 1 999 $-ban adta meg, 32 GB GDDR7 memóriával és 575 W összes grafikai teljesítménnyel. 36 hónapra osztva a kártya havonta nagyjából 56 $-ba kerül (saját számítás). Ha 24 órában, teljes terhelésen fut, egymagában nagyjából 420 kWh-t fogyaszt havonta (575 W × 730 óra, saját számítás), ami a 30 ct/kWh példafeltevéssel nagyjából 126 € havonta (saját számítás, nem idézett tarifa). Három év alatt az áram önmagában nagyjából 4 500 €-ra jön ki, ami több mint kétszerese az 1 999 $-os indulási árnak.

A bevezetés után megjelenő költségek

Amint a szolgáltatás él, a GPU bérleti díja általában a legkisebb tétel. A többi munkaidő és kockázat. A táblázat tervezési számai saját feltételezéseim, nem mért adatok, ezért cseréld le őket a csapatod számaira.

KöltségtételHogyan néz kiTervezési feltételezés (saját)
Üzemeltetéskiszolgálás, monitorozás, GPU-hibák, újraindítások, kapacitástervezésegy mérnök munkaidejének 0,1–0,2-e
Frissítésekúj vLLM-, CUDA- és driververziók, OS-foltok, modellcserékkét–öt mérnöknap modellcserénként
Evalokregressziós készlet futtatása minden modell- vagy kiszolgálás-változtatás előttkét–öt nap a felépítésre, utána nagyjából egy nap futásonként
Ügyeletvalaki válaszol, ha a végpont munkaidőn kívül leálllegalább két ember egy 24/7 szolgáltatáshoz
Redundanciamásodik GPU-csomópont a meghibásodás kezelésérenagyjából megduplázza a bérleti díjat
MegfelelőségDPA a hostinggal, DPIA-frissítés, adatkezelési nyilvántartás, a logok, amelyek most már a tiédnéhány nap évente

Mit tennék először

  1. Írd le az adatokat és a szabályokat. Sorold fel, mely adatkategóriák érik el a modellt, és mely szerződések vagy DPIA-következtetések érvényesek. Ha egyik sem zárja ki a feldolgozót, kezdj egy DPA-s EU-s API-val.
  2. Szerezd meg írásban a hosting-tényeket. Kérdezd meg a hosting régiót, az alfeldolgozók listáját és a megőrzési beállításokat. A Mistral árazási oldala egy DPA-ra linkel, de nem mondja meg, hol fut az API, ezt a választ a szerződésből kell megkapnod.
  3. Válaszd a legkisebb modellt, amely átmegy az evalokon. Utána ellenőrizd a memóriáját azon a pontosságon, amelyen ténylegesen ki tudod szolgálni, ne a modellkártyán szereplőn.
  4. Mérj a saját promptjaiddal. Futtasd a vllm bench serve parancsot a valós prompt-hosszokkal és egy latenciacéllal, mielőtt bármilyen hardverre elköteleznéd magad.
  5. Számold újra a break-even-t a saját számaiddal. Használd a mért token/másodperc értékeidet, a valós kihasználtságodat és az üzemeltetési költségvetésedet. Ha nem jön ki, maradj az API-nál, és tartsd nyilván a saját üzemeltetést tartalék lehetőségként.
  6. Tervezd meg az üzemeltetést az élesítés előtt. Előbb rögzítsd az evalkészletet, az ügyeleti beosztást és a frissítési szabályokat. A GPU a könnyű rész.

A pipeline adatoldalához olvasd el ezeket: EU-s adatrezidencia, régiókezelés és zero retention és PII-redakció. A regressziós készlethez lásd: LLM-evalok termékfunkciókhoz.

Források

  1. openai/gpt-oss-120b modellkártya (Hugging Face)
  2. mistralai/Mistral-Small-3.2-24B-Instruct-2506 modellkártya (Hugging Face)
  3. meta-llama/Llama-3.3-70B-Instruct modellkártya (Hugging Face)
  4. mistralai/Mistral-Large-3-675B-Instruct-2512 modellkártya (Hugging Face)
  5. vLLM-blog: v0.6.0 teljesítményfrissítés (2024. szeptember)
  6. vLLM-dokumentáció: motor-argumentumok
  7. vLLM-dokumentáció: vllm bench serve
  8. SemiAnalysis InferenceX: Llama 3.3 70B H100 vs H200
  9. Scaleway GPU-példányok árai
  10. Scaleway-blog: átlátható frissítés a Scaleway-árakról (2026. április 27.)
  11. Scaleway Generative APIs árai
  12. OVHcloud public cloud árlista
  13. OVHcloud AI Endpoints
  14. OVHcloud AI Endpoints modellkatalógus
  15. Hetzner dedikált GPU-szerverek
  16. NVIDIA hírszoba: a GeForce RTX 50 sorozat bevezetése
  17. NVIDIA GeForce RTX 5090
  18. NVIDIA GeForce szoftverlicenc
  19. GDPR 28. cikk: feldolgozó
  20. GDPR 44. cikk: az átadások általános elve
  21. Európai Bizottság: EU–USA adattovábbítás (Data Privacy Framework)
  22. EDPB 28/2024. számú vélemény az AI-modellekről (elfogadva 2024. december 17-én)
  23. Mistral AI árai

Gyakori kérdések

Automatikusan megfelelővé teszi a GDPR-nak, ha saját LLM-et üzemeltetsz?

Nem. Egy feldolgozót kiiktatsz, de továbbra is szükséged lesz jogalapra, kockázatelemzésre, adatkezelési nyilvántartásra, megőrzési szabályokra és DPA-ra a szervereidet üzemeltető céggel. Az Európai Adatvédelmi Testület (EDPB) szerint a személyes adatokon tanított AI-modellek nem minden esetben tekinthetők anonimnak.

Mennyi GPU-memória kell egy 70B-s modellhez?

Nagyjából 140 GB súly 16 biten, 70 GB 8 biten és 35 GB 4 biten, a KV-cache nélkül (saját számítás). 8 biten egy 80 GB-os kártyán kevés marad a kontextusnak, ezért számolj két kártyával vagy egy 96 GB-os kártyával.

Mikor elég egy EU-ban üzemeltetett API DPA-val?

Ha nincs benne különleges kategóriájú személyes adat, és sem ügyfélszerződés, sem hatásvizsgálat nem zárja ki a feldolgozót. Nézd meg az alfeldolgozók listáját, a hosting régiót, a megőrzési beállításokat, és azt, hogy a szolgáltató tanít-e az adataiddal.

Mennyibe kerül egy bérelt H100 millió tokenre?

Havi 2 094 €-nál (saját számítás: 2,868 € óránként, 730 órára) nagyjából 0,68 € millió output tokenre, ha egész hónapban 1 171 token/másodperc az áteresztőképesség (felhasználónként 58 token/másodperc), és nagyjából 1,36 €, ha ennek a felét használja ki (saját számítás).

Pont erre van szükséged?

Írj a projektedről vagy a pozícióról – szívesen hallok felőled.