> Saját LLM a GDPR miatt: mikor kell, mennyi GPU-memória kell a nyílt modellekhez, az EU-s árak 2026 októberében és a break-even millió tokenenként.
>
> Web page: https://balazscsorba.com/hu/blog/self-hosted-llm-gdpr-cost · Language: Magyar · Also available in: [English](https://balazscsorba.com/blog/self-hosted-llm-gdpr-cost.md) · [Deutsch](https://balazscsorba.com/de/blog/self-hosted-llm-gdpr-cost.md)
> Author: Balázs Csorba · Published: 2026-10-09 · Keywords: self-hosted LLM GDPR, self-host LLM data protection, LLM GPU memory requirements, vLLM throughput benchmark, EU GPU cloud for LLMs, LLM API vs self-hosting break-even, open-weight LLM hardware cost, data processing agreement LLM

[Blog](https://balazscsorba.com/hu/blog)/LLMOps és értékelés

# Saját LLM-üzemeltetés a GDPR miatt: mikor kell és mibe kerül

Saját LLM a GDPR miatt: mikor kell, mennyi GPU-memória kell a nyílt modellekhez, az EU-s árak 2026 októberében és a break-even millió tokenenként.

[Balázs Csorba](https://balazscsorba.com/hu/about)·2026\. október 9.·10 perc olvasás

-   Self-hosting
-   GDPR
-   vLLM
-   GPU cost
-   Open-weight models

![Borítókép a saját üzemeltetésű LLM-ekről a GDPR alatt: döntés a saját GPU-k és egy EU-s API között, break-even vonallal.](https://balazscsorba.com/images/blog/self-hosted-llm-gdpr-cost/cover.webp?v=f2db601f6c)

## A lényeg röviden

-   Saját üzemeltetést csak akkor válassz, ha a személyes adatoknak a te irányításod alatt álló hálózaton belül kell maradniuk, vagy ha szerződés vagy hatóság kizár minden olyan feldolgozót, amelyet nem tudsz ellenőrizni.
-   Egy EU-ban üzemeltetett API adatfeldolgozási szerződéssel (DPA), rövid megőrzéssel és az adataid tanítás nélkül sok B2B szöveges feladatot lefedhet.
-   A bérelt GPU nem szünteti meg a feldolgozót: a hosting cégnek is kell DPA. A saját üzemeltetés tehát a feldolgozót áthelyezi, nem megszünteti.
-   A súlyokhoz milliárd paraméterenként nagyjából 2 GB kell 16 bites pontossággal, 1 GB 8 bitnél és 0,5 GB 4 bitnél, a KV-cache nélkül.
-   Az EU-s API-árak mellett egy bérelt H100 csak nagy kihasználtságnál éri meg az API-t, és az üzemeltetés költsége még rákerül.
-   Mérd meg az áteresztőképességet a saját promptjaiddal a vllm bench serve paranccsal, mielőtt hardvert vennél vagy bérelnél, mert a közzétett értékek erősen eltérnek.

Ezen az oldalon

1.  [Mikor kell valóban saját üzemeltetés](https://balazscsorba.com/#when-self-hosting-is-required)
2.  [Modellméretek és GPU-memória kvantálással](https://balazscsorba.com/#model-sizes-and-gpu-memory)
3.  [GPU-opciók és árak 2026. október 10-én](https://balazscsorba.com/#gpu-options-and-prices)
4.  [Áteresztőképesség vLLM-mel: a számok és a mérés módja](https://balazscsorba.com/#throughput-with-vllm)
5.  [Break-even millió tokenenként](https://balazscsorba.com/#break-even-per-million-tokens)
6.  [Saját hardver: a kártya olcsó, az áram és a licenc nem](https://balazscsorba.com/#on-premise-hardware)
7.  [A bevezetés után megjelenő költségek](https://balazscsorba.com/#hidden-costs)
8.  [Mit tennék először](https://balazscsorba.com/#first-steps)
9.  [Források](https://balazscsorba.com/#sources)

Cikk meghallgatása

0:000:00

Sokan szeretnének adatvédelmi okokból saját nyelvi modellt üzemeltetni, de a legtöbb B2B szöveges feladathoz ez nem szükséges. A GDPR nem tiltja a harmadik fél feldolgozóit. Szerződést kér minden feldolgozóval, jogalapot minden továbbításhoz, és kockázatos feldolgozásnál dokumentált kockázatelemzést. Egy EU-ban üzemeltetett API adatfeldolgozási szerződéssel (DPA) teljesítheti ezeket a követelményeket. A saját üzemeltetés akkor a helyes válasz, ha a személyes adatoknak a te irányításod alatt álló hálózaton belül kell maradniuk, vagy ha szerződés vagy hatóság kizár minden olyan feldolgozót, amelyet nem tudsz ellenőrizni. Ilyenkor a GPU-számla a könnyebben tervezhető rész – a pénz nagy része az üzemeltetésbe megy.

Ez a cikk 2026. október 10-én ellenőrzi a számokat, és csak olyan oldalakra támaszkodik, amelyeket meg tudtam nyitni. Bemutatja, mikor kötelező a saját üzemeltetés, mennyi GPU-memória kell a nyílt súlyú modelleknek az egyes pontossági szinteken, mibe kerülnek az EU-s GPU-k, mit nyújt a vLLM, egy millió tokenre vetített break-even számítást az EU-s API-kkal szemben, és a bevezetés utáni költségeket.

## Mikor kell valóban saját üzemeltetés

A kérdés nem az, hogy a modell fut-e a te hardveredén, hanem az, hogy a személyes adatoknak ott kell-e maradniuk. Három helyzet terel saját modell felé:

-   **Szerződés tiltja.** Egyes ügyfélszerződések és belső szabályzatok kizárják azokat az alfeldolgozókat, amelyeket nem irányítasz, vagy előírják, hogy az adatok soha ne hagyják el a meghatározott hálózatot.
-   **A hatásvizsgálatod nemet mond.** Az adott felhasználási esetre készült adatvédelmi hatásvizsgálat szerint egy feldolgozói lánc kockázata túl nagy, például egészségügyi adatoknál vagy munkavállalói nyilvántartásnál.
-   **Nincs megfelelő szolgáltató.** Egyetlen EU-s szolgáltató sem kínálja a modellt a szükséges feltételekkel, vagy a rendszernek offline kell futnia, például a gyártósoron vagy az edge-en.

Minden más feldolgozói kérdés, és erre egy EU-s API válaszol. A 28. cikk olyan szerződést ír elő, amely rögzíti a feldolgozás tárgyát és időtartamát, jellegét és célját, a személyes adatok típusait és az érintettek körét, valamint az adatkezelő kötelezettségeit és jogait. Előírja azt is, hogy az alfeldolgozókhoz előzetes írásbeli hozzájárulás kell, akár egyedi, akár általános formában, és ugyanezek a kötelezettségek rájuk is átszállnak. A 44. cikk minden harmadik országba irányuló továbbítást a rendelet továbbítási fejezetének feltételeihez köt. Az Európai Bizottság 2023. július 10-i megfelelőségi határozata az EU–USA adatvédelmi keretrendszerben (Data Privacy Framework) tanúsított amerikai cégekre a továbbítások alapját adja.

Felülről lefelé olvasd. Az első válasz, amely eldönti a kérdést, határozza meg az architektúrát.

**A bérelt GPU-hoz is kell DPA**

A GPU-szerver bérlése nem szünteti meg a feldolgozót. A hosting cég üzemelteti a gépet, amelyen az adataid vannak, így a legtöbb esetben ő a feldolgozó, és DPA-t kell kötnöd vele. A saját hardver megszünteti a feldolgozót; a bérlés csak azt változtatja meg, melyik feldolgozód van.

A saját üzemeltetés a modellkérdést sem oldja meg. Az Európai Adatvédelmi Testület (EDPB) 28/2024. számú véleménye, amelyet 2024. december 17-én fogadtak el, szerint a személyes adatokkal tanított AI-modellek nem minden esetben tekinthetők anonimnak. Az anonimitásra hivatkozást ezért esetenként kell megítélni. Kérdezd meg a szolgáltatótól a tanítóadatokra vonatkozó dokumentációt, mielőtt egy ilyen állításra támaszkodnál.

## Modellméretek és GPU-memória kvantálással

A súlyok memóriaigénye egyszerű számítás: paraméterek száma szorozva a bitekkel súlyonként, osztva nyolccal. Egy 70 milliárd paraméteres modell nagyjából 140 GB-ot igényel 16 biten, 70 GB-ot 8 biten és 35 GB-ot 4 biten (saját számítás). Ebbe nem tartozik bele a KV-cache, amely a kontextushosszal és a párhuzamos kérésekkel nő, sem a futtatókörnyezet saját terhelése. Alapértelmezés szerint a vLLM a GPU-memória 92 százalékát használhatja (`gpu_memory_utilization`, az aktuális dokumentációban 0,92), a KV-cache pedig azt kapja, amit a súlyok meghagynak.

Modell

Méret, összes / aktív

Pontosság

Súlyok, GB

Szükséges hardver

gpt-oss-20b

21 Mrd / 3,6 Mrd

MXFP4, ahogy megjelent

16 alatt, a kártya szerint

16 GB GPU-memória, a kártya szerint

Mistral Small 3.2

24 Mrd, sűrű

bf16

48 (saját számítás); a kártya szerint kb. 55

egy 80 GB-os kártya, a cache-nek marad hely (saját számítás)

Llama 3.3 70B

70 Mrd, sűrű

bf16 / FP8 / 4 bit

140 / 70 / 35 (saját számítás)

két 80 GB-os kártya bf16-on; egy 96 GB-os kártya FP8-on; egy 48 GB-os kártya 4 biten (saját számítás)

gpt-oss-120b

117 Mrd / 5,1 Mrd

MXFP4, ahogy megjelent

a kártyán nincs megadva

egy 80 GB-os GPU, a kártya szerint

Mistral Large 3

675 Mrd, összes

FP8 / 4 bit

675 / kb. 340 (saját számítás)

több mint 8 × 80 GB FP8-on; kb. 340 GB 4 biten nyolc 80 GB-os kártyára fér (saját számítás)

Két tanulság a táblázatból. Egy 80 GB-os kártyán egy 70B-s modell 8 biten, miután a vLLM a maga részét elvette, csak néhány gigabájtot hagy a cache-nek (saját számítás), ezért tervezz két kártyát vagy egy 96 GB-os kártyát. A futtatható modell attól függ, mennyi memóriát tudsz bérelni, ezért ellenőrizd a memóriát, mielőtt benchmarkot olvasol.

## GPU-opciók és árak 2026. október 10-én

Ezek azok az árak, amelyeket a szolgáltatói oldalakon olvashattam le, a dátumukkal együtt. Ahol a szolgáltató havi összeget ad meg, azt idézem; ahol nem, 730 órás hónappal számolok, és ezt jelzem.

Opció

GPU-memória

Listaár

havonta

Dátum és forrás

Scaleway L4-1-24G, Párizs

24 GB

0,79 € óránként, adó nélkül

kb. 575 € (Scaleway)

2026\. okt. 10., GPU-árlap

Scaleway H100-1-80G

80 GB

2,868 € óránként 2026. június 1-től

kb. 2 094 € (saját számítás)

2026\. ápr. 27., Scaleway-blogbejegyzés

OVHcloud l40s-1-gpu

nincs az árlistán

1,69 $ óránként, ÁFA nélkül

kb. 1 237 $ (OVHcloud)

2026\. okt. 10., public cloud árlista

OVHcloud h100-1-gpu

80 GiB

3,39 $ óránként, ÁFA nélkül

kb. 2 473 $ (OVHcloud)

2026\. okt. 10., public cloud árlista

RTX 5090, megvásárolva

32 GB

1 999 $ indulási ár

kb. 56 $ 36 hónapra osztva (saját számítás)

NVIDIA-hírszoba, január 30-tól

Hetzner GEX63 vagy GEX131

96 GB

a statikus oldalon nem olvasható

n/a

2026\. okt. 10., GPU-szerver mátrix

A Hetzner GDPR-kompatibilisnek és Európában elhelyezettnek írja le a GPU-szervereit. A mátrixoldalán 96 GB GDDR7 memóriás RTX PRO 6000 Blackwell kártyák szerepelnek a GEX63 és a GEX131 típusban. A havi árak csak a konfigurátorban jelennek meg, amelyet nem tudtam elolvasni, ezért kihagytam őket a táblázatból. Ellenőrizd ott, mielőtt összehasonlítasz.

Két dologra figyelj. A Scaleway 2026. június 1-jétől 2,73 €-ról 2,868 €-ra emelte az H100 óradíját, így a régebbi összehasonlító oldalak elavultak. Az OVHcloud dollárban mutatja az áraikat, ezért az összehasonlítás napján váltsd át őket euróra, mielőtt az eurós sorok mellé teszed.

## Áteresztőképesség vLLM-mel: a számok és a mérés módja

A vLLM saját benchmarkjai relatív nyereséget közölnek, nem abszolút token/másodperc értéket. A csapat 2024 szeptemberi, a v0.6.0-ról szóló bejegyzésében a v0.5.3-hoz képest 2,7-szeres áteresztőképességet jelentett Llama 3 8B modellen egy H100-on, és 1,8-szorosat Llama 3 70B modellen négy H100-on, a ShareGPT adatkészlettel és 500 prompttal. A szerverhez a vLLM-mel kezdeném; a [vLLM-áttekintésem](https://balazscsorba.com/hu/tools/vllm) a kompromisszumokat tárgyalja.

Az abszolút számok függnek a modelltől, a promptok és a válaszok hosszától, és attól, milyen gyorsan kell egy-egy felhasználónak választ kapnia. A SemiAnalysis InferenceX benchmarkja ezt a kompromisszumot mutatja Llama 3.3 70B modellre H100-on. GPU-nként nagyjából 1 850 token/másodpercet ér el, ha minden felhasználó 38 token/másodpercet kap, nagyjából 1 170-et 58 token/másodperc/felhasználó mellett, és nagyjából 880-at 78 mellett. A három érték az oldal adatpontjaiból interpolált (az én olvasatom), a benchmark pedig 8K/1K sorozathosszokat használ. Az oldal a pontosságot és a szerver-motort nem következetesen adja meg, ezért a számokat nagyságrendnek tekintem.

```
# serve gpt-oss-120b on one 80 GB GPU (model card)
vllm serve openai/gpt-oss-120b

# a 70B model at bf16 needs two 80 GB GPUs (my calculation)
vllm serve meta-llama/Llama-3.3-70B-Instruct --tensor-parallel-size 2

# from a second terminal, send 500 random prompts at 4 requests per second
vllm bench serve --model openai/gpt-oss-120b --dataset-name random --num-prompts 500 --request-rate 4
```

Mérd a saját számaidat a vllm bench serve paranccsal. Az alapértelmezett beállítás 1 000 véletlen promptot küld, végtelen kérési rátával, ezért a prompt-számot és a rátát magadnak kell beállítanod, és ahol lehet, a saját promptjaidhoz hasonló promptokat használj. Utána növeld a rátát, és minden szinten jegyezd fel a Time to First Tokent és a Time per Output Tokent. A --goodput opció csak azokat a kéréseket számolja, amelyek teljesítik a késleltetési céljaidat. Ez az a szám, amely egy felhasználóknak szánt funkciónál számít.

## Break-even millió tokenenként

A képlet egy sorba fér. A millió tokenre jutó költség a havi GPU-költség osztva az adott hónapban megtermelt tokenekkel, szorozva egymillióval. A havi tokenek a másodpercenkénti tokenek szorozva 2 628 000 másodperccel (730 óra), szorozva azzal az időhányaddal, amelyben a GPU ki van használva. Minden kiszolgált tokent egy számlázható tokennek veszek az API output-árán, így az összehasonlítás egyszerű marad (saját módszer, nem benchmark-eredmény).

Millió tokenre jutó költség egy bérelt H100-on, havi 2 094 €-val, az InferenceX-értékekkel (saját számítás):

Token/másodperc (sebesség felhasználónként)

25%-ban kihasználva

50%-ban kihasználva

100%-ban kihasználva

877 (78 token/s felhasználónként)

3,63 €

1,82 €

0,91 €

1 171 (58 token/s felhasználónként)

2,72 €

1,36 €

0,68 €

1 848 (38 token/s felhasználónként)

1,72 €

0,86 €

0,43 €

Az EU-s API-kkal szemben a Llama 3.3 70B a közelebbi eset. Az OVHcloud 0,67 €-t kér egymillió tokenért, a Scaleway 0,90 €-t. 58 token/másodperc/felhasználó mellett egy bérelt H100-nak az óra körül nagyjából 1 190 token/másodpercet kellene szolgáltatnia ahhoz, hogy elérje az OVHcloud árát (saját számítás). A benchmark ezen a sebességen 1 171-et ad, így nem jut el oda. A Scaleway 0,90 €-s árához a break-even körülbelül 885 token/másodperc, vagyis a benchmark-érték nagyjából háromnegyede.

A gpt-oss-120b magasabbra teszi a lécet. Az API a Scaleway-nél 0,60 €-t kér millió output tokenért, az OVHcloud-nál 0,40 €-t. Egy bérelt H100, havi 2 094 €-val, átlagosan nagyjából 1 330 output tokent kell másodpercenként termelnie, hogy elérje a Scaleway árát, és nagyjából 1 990-et, hogy elérje az OVHcloud árát (saját számítás). Nem találtam ellenőrzött H100-as értéket a gpt-oss-120b-re, ezért mérd meg, mielőtt döntesz. A bemeneti tokenek még olcsóbbak: millióra 0,15 €, illetve 0,08 €.

Break-even egy bérelt H100-ra, havi 2 094 € mellett (saját számítás), a gpt-oss-120b Scaleway-árával szemben, amely millió output tokenenként 0,60 €. Havi nagyjából 3,5 milliárd output token felett a GPU olcsóbb, feltéve hogy valóban ki tudja szolgálni ezt a terhelést, amit a gpt-oss-120b esetén nem ellenőriztem.

Az üzemeltetési költségek ráadásul rákerülnek. Minden 1 000 € havi üzemeltetési költség nagyjából 1,7 milliárd output tokennel tolja feljebb a gpt-oss-120b break-even pontját 0,60 €-nál millió tokenenként, vagyis az óra körül nagyjából 630 token/másodperccel (saját számítás). Az ár önmagában ezért ritkán indokolja a saját üzemeltetést, ha egy EU-s API már kínálja a modellt. A saját üzemeltetés akkor éri meg, ha a hardver már a tiéd, ha a terhelés egész hónapban leköti a GPU-t, vagy ha egyetlen EU-s szolgáltató sem kínálja a szükséges modellt.

## Saját hardver: a kártya olcsó, az áram és a licenc nem

A megvásárolt kártya a bérelthez képest olcsónak látszik. Az NVIDIA a GeForce RTX 5090 indulási árát 1 999 $-ban adta meg, 32 GB GDDR7 memóriával és 575 W összes grafikai teljesítménnyel. 36 hónapra osztva a kártya havonta nagyjából 56 $-ba kerül (saját számítás). Ha 24 órában, teljes terhelésen fut, egymagában nagyjából 420 kWh-t fogyaszt havonta (575 W × 730 óra, saját számítás), ami a 30 ct/kWh példafeltevéssel nagyjából 126 € havonta (saját számítás, nem idézett tarifa). Három év alatt az áram önmagában nagyjából 4 500 €-ra jön ki, ami több mint kétszerese az 1 999 $-os indulási árnak.

**Nézd meg a licencet, mielőtt a kártya a szerverszobába kerül**

Az NVIDIA GeForce-licencének 2.8. pontja szerint a GeForce- és Titan-szoftver nincs adatközponti telepítésre licencelve (eredeti szöveg: „is not licensed for datacenter deployment”). Egy fogyasztói kártya egy szerverszekrényben így kívül eshet a licencen. Ellenőrizd a feltételeket pontosan arra a kártyára, amelyet venni akarsz, mielőtt bármit ráépítesz.

## A bevezetés után megjelenő költségek

Amint a szolgáltatás él, a GPU bérleti díja általában a legkisebb tétel. A többi munkaidő és kockázat. A táblázat tervezési számai saját feltételezéseim, nem mért adatok, ezért cseréld le őket a csapatod számaira.

Költségtétel

Hogyan néz ki

Tervezési feltételezés (saját)

Üzemeltetés

kiszolgálás, monitorozás, GPU-hibák, újraindítások, kapacitástervezés

egy mérnök munkaidejének 0,1–0,2-e

Frissítések

új vLLM-, CUDA- és driververziók, OS-foltok, modellcserék

két–öt mérnöknap modellcserénként

Evalok

regressziós készlet futtatása minden modell- vagy kiszolgálás-változtatás előtt

két–öt nap a felépítésre, utána nagyjából egy nap futásonként

Ügyelet

valaki válaszol, ha a végpont munkaidőn kívül leáll

legalább két ember egy 24/7 szolgáltatáshoz

Redundancia

második GPU-csomópont a meghibásodás kezelésére

nagyjából megduplázza a bérleti díjat

Megfelelőség

DPA a hostinggal, DPIA-frissítés, adatkezelési nyilvántartás, a logok, amelyek most már a tiéd

néhány nap évente

## Mit tennék először

1.  **Írd le az adatokat és a szabályokat.** Sorold fel, mely adatkategóriák érik el a modellt, és mely szerződések vagy DPIA-következtetések érvényesek. Ha egyik sem zárja ki a feldolgozót, kezdj egy DPA-s EU-s API-val.
2.  **Szerezd meg írásban a hosting-tényeket.** Kérdezd meg a hosting régiót, az alfeldolgozók listáját és a megőrzési beállításokat. A Mistral árazási oldala egy DPA-ra linkel, de nem mondja meg, hol fut az API, ezt a választ a szerződésből kell megkapnod.
3.  **Válaszd a legkisebb modellt, amely átmegy az evalokon.** Utána ellenőrizd a memóriáját azon a pontosságon, amelyen ténylegesen ki tudod szolgálni, ne a modellkártyán szereplőn.
4.  **Mérj a saját promptjaiddal.** Futtasd a vllm bench serve parancsot a valós prompt-hosszokkal és egy latenciacéllal, mielőtt bármilyen hardverre elköteleznéd magad.
5.  **Számold újra a break-even-t a saját számaiddal.** Használd a mért token/másodperc értékeidet, a valós kihasználtságodat és az üzemeltetési költségvetésedet. Ha nem jön ki, maradj az API-nál, és tartsd nyilván a saját üzemeltetést tartalék lehetőségként.
6.  **Tervezd meg az üzemeltetést az élesítés előtt.** Előbb rögzítsd az evalkészletet, az ügyeleti beosztást és a frissítési szabályokat. A GPU a könnyű rész.

A pipeline adatoldalához olvasd el ezeket: [EU-s adatrezidencia, régiókezelés és zero retention](https://balazscsorba.com/hu/blog/gdpr-llm-api-eu-data-residency) és [PII-redakció](https://balazscsorba.com/hu/blog/pii-redaction-llm-pipelines). A regressziós készlethez lásd: [LLM-evalok termékfunkciókhoz](https://balazscsorba.com/hu/blog/llm-evals-for-product-features).

## Források

1.  [openai/gpt-oss-120b modellkártya (Hugging Face)](https://huggingface.co/openai/gpt-oss-120b)
2.  [mistralai/Mistral-Small-3.2-24B-Instruct-2506 modellkártya (Hugging Face)](https://huggingface.co/mistralai/Mistral-Small-3.2-24B-Instruct-2506)
3.  [meta-llama/Llama-3.3-70B-Instruct modellkártya (Hugging Face)](https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct)
4.  [mistralai/Mistral-Large-3-675B-Instruct-2512 modellkártya (Hugging Face)](https://huggingface.co/mistralai/Mistral-Large-3-675B-Instruct-2512)
5.  [vLLM-blog: v0.6.0 teljesítményfrissítés (2024. szeptember)](https://blog.vllm.ai/2024/09/05/perf-update.html)
6.  [vLLM-dokumentáció: motor-argumentumok](https://docs.vllm.ai/en/latest/configuration/engine_args.html)
7.  [vLLM-dokumentáció: vllm bench serve](https://docs.vllm.ai/en/latest/cli/bench/serve.html)
8.  [SemiAnalysis InferenceX: Llama 3.3 70B H100 vs H200](https://inferencex.semianalysis.com/compare/llama-3-3-70b-h100-vs-h200)
9.  [Scaleway GPU-példányok árai](https://www.scaleway.com/en/pricing/gpu/)
10.  [Scaleway-blog: átlátható frissítés a Scaleway-árakról (2026. április 27.)](https://www.scaleway.com/en/blog/a-transparent-update-on-scaleway-pricing/)
11.  [Scaleway Generative APIs árai](https://www.scaleway.com/en/pricing/model-as-a-service/)
12.  [OVHcloud public cloud árlista](https://www.ovhcloud.com/en/public-cloud/prices/)
13.  [OVHcloud AI Endpoints](https://www.ovhcloud.com/en/public-cloud/ai-endpoints/)
14.  [OVHcloud AI Endpoints modellkatalógus](https://www.ovhcloud.com/en/public-cloud/ai-endpoints/catalog/)
15.  [Hetzner dedikált GPU-szerverek](https://www.hetzner.com/dedicated-rootserver/matrix-gpu/)
16.  [NVIDIA hírszoba: a GeForce RTX 50 sorozat bevezetése](https://nvidianews.nvidia.com/news/nvidia-blackwell-geforce-rtx-50-series-opens-new-world-of-ai-computer-graphics)
17.  [NVIDIA GeForce RTX 5090](https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/)
18.  [NVIDIA GeForce szoftverlicenc](https://www.nvidia.com/en-us/drivers/geforce-license/)
19.  [GDPR 28. cikk: feldolgozó](https://gdpr-info.eu/art-28-gdpr/)
20.  [GDPR 44. cikk: az átadások általános elve](https://gdpr-info.eu/art-44-gdpr/)
21.  [Európai Bizottság: EU–USA adattovábbítás (Data Privacy Framework)](https://commission.europa.eu/law/law-topic/data-protection/international-dimension-data-protection/eu-us-data-transfers_en)
22.  [EDPB 28/2024. számú vélemény az AI-modellekről (elfogadva 2024. december 17-én)](https://www.edpb.europa.eu/system/files/2024-12/edpb_opinion_202428_ai-models_en.pdf)
23.  [Mistral AI árai](https://mistral.ai/pricing)

## Gyakori kérdések

Automatikusan megfelelővé teszi a GDPR-nak, ha saját LLM-et üzemeltetsz?

Nem. Egy feldolgozót kiiktatsz, de továbbra is szükséged lesz jogalapra, kockázatelemzésre, adatkezelési nyilvántartásra, megőrzési szabályokra és DPA-ra a szervereidet üzemeltető céggel. Az Európai Adatvédelmi Testület (EDPB) szerint a személyes adatokon tanított AI-modellek nem minden esetben tekinthetők anonimnak.

Mennyi GPU-memória kell egy 70B-s modellhez?

Nagyjából 140 GB súly 16 biten, 70 GB 8 biten és 35 GB 4 biten, a KV-cache nélkül (saját számítás). 8 biten egy 80 GB-os kártyán kevés marad a kontextusnak, ezért számolj két kártyával vagy egy 96 GB-os kártyával.

Mikor elég egy EU-ban üzemeltetett API DPA-val?

Ha nincs benne különleges kategóriájú személyes adat, és sem ügyfélszerződés, sem hatásvizsgálat nem zárja ki a feldolgozót. Nézd meg az alfeldolgozók listáját, a hosting régiót, a megőrzési beállításokat, és azt, hogy a szolgáltató tanít-e az adataiddal.

Mennyibe kerül egy bérelt H100 millió tokenre?

Havi 2 094 €-nál (saját számítás: 2,868 € óránként, 730 órára) nagyjából 0,68 € millió output tokenre, ha egész hónapban 1 171 token/másodperc az áteresztőképesség (felhasználónként 58 token/másodperc), és nagyjából 1,36 €, ha ennek a felét használja ki (saját számítás).

Írta: Csorba Balázs

Senior fullstack és AI mérnök Stájerországban – több mint 10 év Vue, Nuxt, Node.js és PHP, ma AI-ügynököknek építek eszközöket.

[AI fejlesztés és MCP szerverek →](https://balazscsorba.com/hu/expertise/ai-engineer)[Rólam →](https://balazscsorba.com/hu/about)

## További cikkek

-   [Helyi felolvasás nagyban: 96 cikk narrálása nyílt modellekkel](https://balazscsorba.com/hu/blog/local-text-to-speech-pipeline)
-   [Claude Opus 5.5 az Artificial Analysis élén, de az igazi hír a medium effort](https://balazscsorba.com/hu/blog/artificial-analysis-leaderboard-claude-opus-5-5)
-   [LLM-ügynökök megfigyelhetősége OpenTelemetryvel: trace-ek, tokenek, PII és eval](https://balazscsorba.com/hu/blog/agent-observability-opentelemetry)
-   [Prompt caching és modell-routing: LLM költség és késleltetés csökkentése](https://balazscsorba.com/hu/blog/llm-cost-latency-prompt-caching-routing)

## Pont erre van szükséged?

Írj a projektedről vagy a pozícióról – szívesen hallok felőled.

[Beszélgetés kérése](mailto:contact@balazscsorba.com) [Kapcsolódjunk LinkedInen](https://www.linkedin.com/in/balazs-csorba)
