[{"data":1,"prerenderedAt":914},["ShallowReactive",2],{"blog-self-hosted-llm-gdpr-cost-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":23,"sources":35,"cover":105,"og":106,"expertise":107,"locales":108,"lang":111,"title":112,"description":113,"coverAlt":114,"metaTitle":115,"takeaways":116,"faq":123,"toc":136,"blocks":164,"others":676},"self-hosted-llm-gdpr-cost","2026-10-09",10,"llmops",[9,10,11,12,13],"Self-hosting","GDPR","vLLM","GPU cost","Open-weight models",[15,16,17,18,19,20,21,22],"self-hosted LLM GDPR","self-host LLM data protection","LLM GPU memory requirements","vLLM throughput benchmark","EU GPU cloud for LLMs","LLM API vs self-hosting break-even","open-weight LLM hardware cost","data processing agreement LLM",[24,27,30,33],{"name":25,"url":26},"General Data Protection Regulation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGeneral_Data_Protection_Regulation",{"name":28,"url":29},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":31,"url":32},"Graphics processing unit","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGraphics_processing_unit",{"name":11,"url":34},"https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",[36,39,42,45,48,51,54,57,60,63,66,69,72,75,78,81,84,87,90,93,96,99,102],{"title":37,"url":38},"openai\u002Fgpt-oss-120b model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fopenai\u002Fgpt-oss-120b",{"title":40,"url":41},"mistralai\u002FMistral-Small-3.2-24B-Instruct-2506 model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fmistralai\u002FMistral-Small-3.2-24B-Instruct-2506",{"title":43,"url":44},"meta-llama\u002FLlama-3.3-70B-Instruct model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fmeta-llama\u002FLlama-3.3-70B-Instruct",{"title":46,"url":47},"mistralai\u002FMistral-Large-3-675B-Instruct-2512 model card (Hugging Face)","https:\u002F\u002Fhuggingface.co\u002Fmistralai\u002FMistral-Large-3-675B-Instruct-2512",{"title":49,"url":50},"vLLM blog: v0.6.0 performance update (September 2024)","https:\u002F\u002Fblog.vllm.ai\u002F2024\u002F09\u002F05\u002Fperf-update.html",{"title":52,"url":53},"vLLM documentation: engine arguments","https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fconfiguration\u002Fengine_args.html",{"title":55,"url":56},"vLLM documentation: vllm bench serve","https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Fcli\u002Fbench\u002Fserve.html",{"title":58,"url":59},"SemiAnalysis InferenceX: Llama 3.3 70B on H100 vs H200","https:\u002F\u002Finferencex.semianalysis.com\u002Fcompare\u002Fllama-3-3-70b-h100-vs-h200",{"title":61,"url":62},"Scaleway GPU instances pricing","https:\u002F\u002Fwww.scaleway.com\u002Fen\u002Fpricing\u002Fgpu\u002F",{"title":64,"url":65},"Scaleway blog: a transparent update on Scaleway pricing (27 April 2026)","https:\u002F\u002Fwww.scaleway.com\u002Fen\u002Fblog\u002Fa-transparent-update-on-scaleway-pricing\u002F",{"title":67,"url":68},"Scaleway Generative APIs pricing","https:\u002F\u002Fwww.scaleway.com\u002Fen\u002Fpricing\u002Fmodel-as-a-service\u002F",{"title":70,"url":71},"OVHcloud public cloud price list","https:\u002F\u002Fwww.ovhcloud.com\u002Fen\u002Fpublic-cloud\u002Fprices\u002F",{"title":73,"url":74},"OVHcloud AI Endpoints","https:\u002F\u002Fwww.ovhcloud.com\u002Fen\u002Fpublic-cloud\u002Fai-endpoints\u002F",{"title":76,"url":77},"OVHcloud AI Endpoints model catalogue","https:\u002F\u002Fwww.ovhcloud.com\u002Fen\u002Fpublic-cloud\u002Fai-endpoints\u002Fcatalog\u002F",{"title":79,"url":80},"Hetzner dedicated GPU servers","https:\u002F\u002Fwww.hetzner.com\u002Fdedicated-rootserver\u002Fmatrix-gpu\u002F",{"title":82,"url":83},"NVIDIA newsroom: GeForce RTX 50 Series launch","https:\u002F\u002Fnvidianews.nvidia.com\u002Fnews\u002Fnvidia-blackwell-geforce-rtx-50-series-opens-new-world-of-ai-computer-graphics",{"title":85,"url":86},"NVIDIA GeForce RTX 5090","https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fgeforce\u002Fgraphics-cards\u002F50-series\u002Frtx-5090\u002F",{"title":88,"url":89},"NVIDIA GeForce software licence","https:\u002F\u002Fwww.nvidia.com\u002Fen-us\u002Fdrivers\u002Fgeforce-license\u002F",{"title":91,"url":92},"GDPR Article 28: processor","https:\u002F\u002Fgdpr-info.eu\u002Fart-28-gdpr\u002F",{"title":94,"url":95},"GDPR Article 44: general principle for transfers","https:\u002F\u002Fgdpr-info.eu\u002Fart-44-gdpr\u002F",{"title":97,"url":98},"European Commission: EU-US data transfers (Data Privacy Framework)","https:\u002F\u002Fcommission.europa.eu\u002Flaw\u002Flaw-topic\u002Fdata-protection\u002Finternational-dimension-data-protection\u002Feu-us-data-transfers_en",{"title":100,"url":101},"EDPB Opinion 28\u002F2024 on AI models (adopted 17 December 2024)","https:\u002F\u002Fwww.edpb.europa.eu\u002Fsystem\u002Ffiles\u002F2024-12\u002Fedpb_opinion_202428_ai-models_en.pdf",{"title":103,"url":104},"Mistral AI pricing","https:\u002F\u002Fmistral.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fself-hosted-llm-gdpr-cost\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fself-hosted-llm-gdpr-cost\u002Fog.jpg","ai-engineer",[109,110,111],"en","de","hu","Saját LLM-üzemeltetés a GDPR miatt: mikor kell és mibe kerül","Saját LLM a GDPR miatt: mikor kell, mennyi GPU-memória kell a nyílt modellekhez, az EU-s árak 2026 októberében és a break-even millió tokenenként.","Borítókép a saját üzemeltetésű LLM-ekről a GDPR alatt: döntés a saját GPU-k és egy EU-s API között, break-even vonallal.","Saját LLM-ek a GDPR-ban: költség, break-even · Balázs Csorba",[117,118,119,120,121,122],"Saját üzemeltetést csak akkor válassz, ha a személyes adatoknak a te irányításod alatt álló hálózaton belül kell maradniuk, vagy ha szerződés vagy hatóság kizár minden olyan feldolgozót, amelyet nem tudsz ellenőrizni.","Egy EU-ban üzemeltetett API adatfeldolgozási szerződéssel (DPA), rövid megőrzéssel és az adataid tanítás nélkül sok B2B szöveges feladatot lefedhet.","A bérelt GPU nem szünteti meg a feldolgozót: a hosting cégnek is kell DPA. A saját üzemeltetés tehát a feldolgozót áthelyezi, nem megszünteti.","A súlyokhoz milliárd paraméterenként nagyjából 2 GB kell 16 bites pontossággal, 1 GB 8 bitnél és 0,5 GB 4 bitnél, a KV-cache nélkül.","Az EU-s API-árak mellett egy bérelt H100 csak nagy kihasználtságnál éri meg az API-t, és az üzemeltetés költsége még rákerül.","Mérd meg az áteresztőképességet a saját promptjaiddal a vllm bench serve paranccsal, mielőtt hardvert vennél vagy bérelnél, mert a közzétett értékek erősen eltérnek.",[124,127,130,133],{"q":125,"a":126},"Automatikusan megfelelővé teszi a GDPR-nak, ha saját LLM-et üzemeltetsz?","Nem. Egy feldolgozót kiiktatsz, de továbbra is szükséged lesz jogalapra, kockázatelemzésre, adatkezelési nyilvántartásra, megőrzési szabályokra és DPA-ra a szervereidet üzemeltető céggel. Az Európai Adatvédelmi Testület (EDPB) szerint a személyes adatokon tanított AI-modellek nem minden esetben tekinthetők anonimnak.",{"q":128,"a":129},"Mennyi GPU-memória kell egy 70B-s modellhez?","Nagyjából 140 GB súly 16 biten, 70 GB 8 biten és 35 GB 4 biten, a KV-cache nélkül (saját számítás). 8 biten egy 80 GB-os kártyán kevés marad a kontextusnak, ezért számolj két kártyával vagy egy 96 GB-os kártyával.",{"q":131,"a":132},"Mikor elég egy EU-ban üzemeltetett API DPA-val?","Ha nincs benne különleges kategóriájú személyes adat, és sem ügyfélszerződés, sem hatásvizsgálat nem zárja ki a feldolgozót. Nézd meg az alfeldolgozók listáját, a hosting régiót, a megőrzési beállításokat, és azt, hogy a szolgáltató tanít-e az adataiddal.",{"q":134,"a":135},"Mennyibe kerül egy bérelt H100 millió tokenre?","Havi 2 094 €-nál (saját számítás: 2,868 € óránként, 730 órára) nagyjából 0,68 € millió output tokenre, ha egész hónapban 1 171 token\u002Fmásodperc az áteresztőképesség (felhasználónként 58 token\u002Fmásodperc), és nagyjából 1,36 €, ha ennek a felét használja ki (saját számítás).",[137,140,143,146,149,152,155,158,161],{"id":138,"title":139},"when-self-hosting-is-required","Mikor kell valóban saját üzemeltetés",{"id":141,"title":142},"model-sizes-and-gpu-memory","Modellméretek és GPU-memória kvantálással",{"id":144,"title":145},"gpu-options-and-prices","GPU-opciók és árak 2026. október 10-én",{"id":147,"title":148},"throughput-with-vllm","Áteresztőképesség vLLM-mel: a számok és a mérés módja",{"id":150,"title":151},"break-even-per-million-tokens","Break-even millió tokenenként",{"id":153,"title":154},"on-premise-hardware","Saját hardver: a kártya olcsó, az áram és a licenc nem",{"id":156,"title":157},"hidden-costs","A bevezetés után megjelenő költségek",{"id":159,"title":160},"first-steps","Mit tennék először",{"id":162,"title":163},"sources","Források",[165,169,172,175,178,198,201,210,217,220,221,229,297,300,301,304,382,385,388,389,398,401,403,406,407,410,413,451,454,457,463,466,467,470,475,476,479,530,531,564,582,583],{"type":166,"content":167},"paragraph",[168],"Sokan szeretnének adatvédelmi okokból saját nyelvi modellt üzemeltetni, de a legtöbb B2B szöveges feladathoz ez nem szükséges. A GDPR nem tiltja a harmadik fél feldolgozóit. Szerződést kér minden feldolgozóval, jogalapot minden továbbításhoz, és kockázatos feldolgozásnál dokumentált kockázatelemzést. Egy EU-ban üzemeltetett API adatfeldolgozási szerződéssel (DPA) teljesítheti ezeket a követelményeket. A saját üzemeltetés akkor a helyes válasz, ha a személyes adatoknak a te irányításod alatt álló hálózaton belül kell maradniuk, vagy ha szerződés vagy hatóság kizár minden olyan feldolgozót, amelyet nem tudsz ellenőrizni. Ilyenkor a GPU-számla a könnyebben tervezhető rész – a pénz nagy része az üzemeltetésbe megy.",{"type":166,"content":170},[171],"Ez a cikk 2026. október 10-én ellenőrzi a számokat, és csak olyan oldalakra támaszkodik, amelyeket meg tudtam nyitni. Bemutatja, mikor kötelező a saját üzemeltetés, mennyi GPU-memória kell a nyílt súlyú modelleknek az egyes pontossági szinteken, mibe kerülnek az EU-s GPU-k, mit nyújt a vLLM, egy millió tokenre vetített break-even számítást az EU-s API-kkal szemben, és a bevezetés utáni költségeket.",{"type":173,"level":174,"id":138,"text":139},"heading",2,{"type":166,"content":176},[177],"A kérdés nem az, hogy a modell fut-e a te hardveredén, hanem az, hogy a személyes adatoknak ott kell-e maradniuk. Három helyzet terel saját modell felé:",{"type":179,"ordered":180,"items":181},"list",false,[182,188,193],[183,187],{"tag":184,"children":185},"strong",[186],"Szerződés tiltja."," Egyes ügyfélszerződések és belső szabályzatok kizárják azokat az alfeldolgozókat, amelyeket nem irányítasz, vagy előírják, hogy az adatok soha ne hagyják el a meghatározott hálózatot.",[189,192],{"tag":184,"children":190},[191],"A hatásvizsgálatod nemet mond."," Az adott felhasználási esetre készült adatvédelmi hatásvizsgálat szerint egy feldolgozói lánc kockázata túl nagy, például egészségügyi adatoknál vagy munkavállalói nyilvántartásnál.",[194,197],{"tag":184,"children":195},[196],"Nincs megfelelő szolgáltató."," Egyetlen EU-s szolgáltató sem kínálja a modellt a szükséges feltételekkel, vagy a rendszernek offline kell futnia, például a gyártósoron vagy az edge-en.",{"type":166,"content":199},[200],"Minden más feldolgozói kérdés, és erre egy EU-s API válaszol. A 28. cikk olyan szerződést ír elő, amely rögzíti a feldolgozás tárgyát és időtartamát, jellegét és célját, a személyes adatok típusait és az érintettek körét, valamint az adatkezelő kötelezettségeit és jogait. Előírja azt is, hogy az alfeldolgozókhoz előzetes írásbeli hozzájárulás kell, akár egyedi, akár általános formában, és ugyanezek a kötelezettségek rájuk is átszállnak. A 44. cikk minden harmadik országba irányuló továbbítást a rendelet továbbítási fejezetének feltételeihez köt. Az Európai Bizottság 2023. július 10-i megfelelőségi határozata az EU–USA adatvédelmi keretrendszerben (Data Privacy Framework) tanúsított amerikai cégekre a továbbítások alapját adja.",{"type":202,"attrs":203,"inner":207,"caption":208},"diagram",{"viewBox":204,"role":205,"aria-labelledby":206},"0 0 720 330","img","d1-self-t d1-self-d","\u003Ctitle id=\"d1-self-t\">Hova mehet a prompt\u003C\u002Ftitle>\u003Cdesc id=\"d1-self-d\">Döntési lánc. Ha a személyes adatoknak a hálózaton belül kell maradniuk, következik a saját üzemeltetés vLLM-mel. Ha nem, nézd meg, elérhető-e EU-s hoster DPA-val és nulla megőrzéssel: az igen egy EU-s API DPA-val, a nem pedig saját üzemeltetést vagy szolgáltatóváltást jelent.\u003C\u002Fdesc>\u003Crect x=\"20\" y=\"40\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"170\" y=\"71\" text-anchor=\"middle\" class=\"d-text\">Marad az adat a hálózatodban?\u003C\u002Ftext>\u003Crect x=\"400\" y=\"40\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"550\" y=\"71\" text-anchor=\"middle\" class=\"d-text\">EU-s hoster, DPA, nincs megőrzés?\u003C\u002Ftext>\u003Cpath d=\"M320 66 H392\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M400 66 l-9 -5 v10 z\" class=\"d-head-accent\" \u002F>\u003Ctext x=\"332\" y=\"60\" class=\"d-label\">nem\u003C\u002Ftext>\u003Cpath d=\"M170 92 V102\" class=\"d-line\" \u002F>\u003Cpath d=\"M170 110 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"180\" y=\"105\" class=\"d-label\">igen\u003C\u002Ftext>\u003Crect x=\"20\" y=\"130\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"170\" y=\"156\" text-anchor=\"middle\" class=\"d-text\">Saját üzemeltetés vLLM-mel\u003C\u002Ftext>\u003Ctext x=\"170\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">a személyes adat a hálózaton marad\u003C\u002Ftext>\u003Cpath d=\"M550 92 V102\" class=\"d-line\" \u002F>\u003Cpath d=\"M550 110 l-5 -9 h10 z\" class=\"d-head\" \u002F>\u003Ctext x=\"560\" y=\"105\" class=\"d-label\">igen\u003C\u002Ftext>\u003Crect x=\"400\" y=\"130\" width=\"300\" height=\"52\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"550\" y=\"156\" text-anchor=\"middle\" class=\"d-text\">EU-s API DPA-val\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Alfeldolgozók és megőrzés ellenőrzése\u003C\u002Ftext>\u003Ctext x=\"550\" y=\"206\" text-anchor=\"middle\" class=\"d-small\">Ha nem: saját üzemeltetés vagy váltás\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"300\" class=\"d-small\">Nem EU-s hosztnál a V. fejezet szerinti garanciák kellenek, mielőtt használnád.\u003C\u002Ftext>",[209],"Felülről lefelé olvasd. Az első válasz, amely eldönti a kérdést, határozza meg az architektúrát.",{"type":211,"variant":212,"title":213,"body":214},"callout","warn","A bérelt GPU-hoz is kell DPA",[215],[216],"A GPU-szerver bérlése nem szünteti meg a feldolgozót. A hosting cég üzemelteti a gépet, amelyen az adataid vannak, így a legtöbb esetben ő a feldolgozó, és DPA-t kell kötnöd vele. A saját hardver megszünteti a feldolgozót; a bérlés csak azt változtatja meg, melyik feldolgozód van.",{"type":166,"content":218},[219],"A saját üzemeltetés a modellkérdést sem oldja meg. Az Európai Adatvédelmi Testület (EDPB) 28\u002F2024. számú véleménye, amelyet 2024. december 17-én fogadtak el, szerint a személyes adatokkal tanított AI-modellek nem minden esetben tekinthetők anonimnak. Az anonimitásra hivatkozást ezért esetenként kell megítélni. Kérdezd meg a szolgáltatótól a tanítóadatokra vonatkozó dokumentációt, mielőtt egy ilyen állításra támaszkodnál.",{"type":173,"level":174,"id":141,"text":142},{"type":166,"content":222},[223,224,228],"A súlyok memóriaigénye egyszerű számítás: paraméterek száma szorozva a bitekkel súlyonként, osztva nyolccal. Egy 70 milliárd paraméteres modell nagyjából 140 GB-ot igényel 16 biten, 70 GB-ot 8 biten és 35 GB-ot 4 biten (saját számítás). Ebbe nem tartozik bele a KV-cache, amely a kontextushosszal és a párhuzamos kérésekkel nő, sem a futtatókörnyezet saját terhelése. Alapértelmezés szerint a vLLM a GPU-memória 92 százalékát használhatja (",{"tag":225,"children":226},"code",[227],"gpu_memory_utilization",", az aktuális dokumentációban 0,92), a KV-cache pedig azt kapja, amit a súlyok meghagynak.",{"type":230,"head":231,"rows":242},"table",[232,234,236,238,240],[233],"Modell",[235],"Méret, összes \u002F aktív",[237],"Pontosság",[239],"Súlyok, GB",[241],"Szükséges hardver",[243,254,265,276,286],[244,246,248,250,252],[245],"gpt-oss-20b",[247],"21 Mrd \u002F 3,6 Mrd",[249],"MXFP4, ahogy megjelent",[251],"16 alatt, a kártya szerint",[253],"16 GB GPU-memória, a kártya szerint",[255,257,259,261,263],[256],"Mistral Small 3.2",[258],"24 Mrd, sűrű",[260],"bf16",[262],"48 (saját számítás); a kártya szerint kb. 55",[264],"egy 80 GB-os kártya, a cache-nek marad hely (saját számítás)",[266,268,270,272,274],[267],"Llama 3.3 70B",[269],"70 Mrd, sűrű",[271],"bf16 \u002F FP8 \u002F 4 bit",[273],"140 \u002F 70 \u002F 35 (saját számítás)",[275],"két 80 GB-os kártya bf16-on; egy 96 GB-os kártya FP8-on; egy 48 GB-os kártya 4 biten (saját számítás)",[277,279,281,282,284],[278],"gpt-oss-120b",[280],"117 Mrd \u002F 5,1 Mrd",[249],[283],"a kártyán nincs megadva",[285],"egy 80 GB-os GPU, a kártya szerint",[287,289,291,293,295],[288],"Mistral Large 3",[290],"675 Mrd, összes",[292],"FP8 \u002F 4 bit",[294],"675 \u002F kb. 340 (saját számítás)",[296],"több mint 8 × 80 GB FP8-on; kb. 340 GB 4 biten nyolc 80 GB-os kártyára fér (saját számítás)",{"type":166,"content":298},[299],"Két tanulság a táblázatból. Egy 80 GB-os kártyán egy 70B-s modell 8 biten, miután a vLLM a maga részét elvette, csak néhány gigabájtot hagy a cache-nek (saját számítás), ezért tervezz két kártyát vagy egy 96 GB-os kártyát. A futtatható modell attól függ, mennyi memóriát tudsz bérelni, ezért ellenőrizd a memóriát, mielőtt benchmarkot olvasol.",{"type":173,"level":174,"id":144,"text":145},{"type":166,"content":302},[303],"Ezek azok az árak, amelyeket a szolgáltatói oldalakon olvashattam le, a dátumukkal együtt. Ahol a szolgáltató havi összeget ad meg, azt idézem; ahol nem, 730 órás hónappal számolok, és ezt jelzem.",{"type":230,"head":305,"rows":316},[306,308,310,312,314],[307],"Opció",[309],"GPU-memória",[311],"Listaár",[313],"havonta",[315],"Dátum és forrás",[317,328,339,350,360,371],[318,320,322,324,326],[319],"Scaleway L4-1-24G, Párizs",[321],"24 GB",[323],"0,79 € óránként, adó nélkül",[325],"kb. 575 € (Scaleway)",[327],"2026. okt. 10., GPU-árlap",[329,331,333,335,337],[330],"Scaleway H100-1-80G",[332],"80 GB",[334],"2,868 € óránként 2026. június 1-től",[336],"kb. 2 094 € (saját számítás)",[338],"2026. ápr. 27., Scaleway-blogbejegyzés",[340,342,344,346,348],[341],"OVHcloud l40s-1-gpu",[343],"nincs az árlistán",[345],"1,69 $ óránként, ÁFA nélkül",[347],"kb. 1 237 $ (OVHcloud)",[349],"2026. okt. 10., public cloud árlista",[351,353,355,357,359],[352],"OVHcloud h100-1-gpu",[354],"80 GiB",[356],"3,39 $ óránként, ÁFA nélkül",[358],"kb. 2 473 $ (OVHcloud)",[349],[361,363,365,367,369],[362],"RTX 5090, megvásárolva",[364],"32 GB",[366],"1 999 $ indulási ár",[368],"kb. 56 $ 36 hónapra osztva (saját számítás)",[370],"NVIDIA-hírszoba, január 30-tól",[372,374,376,378,380],[373],"Hetzner GEX63 vagy GEX131",[375],"96 GB",[377],"a statikus oldalon nem olvasható",[379],"n\u002Fa",[381],"2026. okt. 10., GPU-szerver mátrix",{"type":166,"content":383},[384],"A Hetzner GDPR-kompatibilisnek és Európában elhelyezettnek írja le a GPU-szervereit. A mátrixoldalán 96 GB GDDR7 memóriás RTX PRO 6000 Blackwell kártyák szerepelnek a GEX63 és a GEX131 típusban. A havi árak csak a konfigurátorban jelennek meg, amelyet nem tudtam elolvasni, ezért kihagytam őket a táblázatból. Ellenőrizd ott, mielőtt összehasonlítasz.",{"type":166,"content":386},[387],"Két dologra figyelj. A Scaleway 2026. június 1-jétől 2,73 €-ról 2,868 €-ra emelte az H100 óradíját, így a régebbi összehasonlító oldalak elavultak. Az OVHcloud dollárban mutatja az áraikat, ezért az összehasonlítás napján váltsd át őket euróra, mielőtt az eurós sorok mellé teszed.",{"type":173,"level":174,"id":147,"text":148},{"type":166,"content":390},[391,392,397],"A vLLM saját benchmarkjai relatív nyereséget közölnek, nem abszolút token\u002Fmásodperc értéket. A csapat 2024 szeptemberi, a v0.6.0-ról szóló bejegyzésében a v0.5.3-hoz képest 2,7-szeres áteresztőképességet jelentett Llama 3 8B modellen egy H100-on, és 1,8-szorosat Llama 3 70B modellen négy H100-on, a ShareGPT adatkészlettel és 500 prompttal. A szerverhez a vLLM-mel kezdeném; a ",{"tag":393,"to":394,"children":395},"link","\u002Ftools\u002Fvllm",[396],"vLLM-áttekintésem"," a kompromisszumokat tárgyalja.",{"type":166,"content":399},[400],"Az abszolút számok függnek a modelltől, a promptok és a válaszok hosszától, és attól, milyen gyorsan kell egy-egy felhasználónak választ kapnia. A SemiAnalysis InferenceX benchmarkja ezt a kompromisszumot mutatja Llama 3.3 70B modellre H100-on. GPU-nként nagyjából 1 850 token\u002Fmásodpercet ér el, ha minden felhasználó 38 token\u002Fmásodpercet kap, nagyjából 1 170-et 58 token\u002Fmásodperc\u002Ffelhasználó mellett, és nagyjából 880-at 78 mellett. A három érték az oldal adatpontjaiból interpolált (az én olvasatom), a benchmark pedig 8K\u002F1K sorozathosszokat használ. Az oldal a pontosságot és a szerver-motort nem következetesen adja meg, ezért a számokat nagyságrendnek tekintem.",{"type":225,"code":402},"# serve gpt-oss-120b on one 80 GB GPU (model card)\nvllm serve openai\u002Fgpt-oss-120b\n\n# a 70B model at bf16 needs two 80 GB GPUs (my calculation)\nvllm serve meta-llama\u002FLlama-3.3-70B-Instruct --tensor-parallel-size 2\n\n# from a second terminal, send 500 random prompts at 4 requests per second\nvllm bench serve --model openai\u002Fgpt-oss-120b --dataset-name random --num-prompts 500 --request-rate 4",{"type":166,"content":404},[405],"Mérd a saját számaidat a vllm bench serve paranccsal. Az alapértelmezett beállítás 1 000 véletlen promptot küld, végtelen kérési rátával, ezért a prompt-számot és a rátát magadnak kell beállítanod, és ahol lehet, a saját promptjaidhoz hasonló promptokat használj. Utána növeld a rátát, és minden szinten jegyezd fel a Time to First Tokent és a Time per Output Tokent. A --goodput opció csak azokat a kéréseket számolja, amelyek teljesítik a késleltetési céljaidat. Ez az a szám, amely egy felhasználóknak szánt funkciónál számít.",{"type":173,"level":174,"id":150,"text":151},{"type":166,"content":408},[409],"A képlet egy sorba fér. A millió tokenre jutó költség a havi GPU-költség osztva az adott hónapban megtermelt tokenekkel, szorozva egymillióval. A havi tokenek a másodpercenkénti tokenek szorozva 2 628 000 másodperccel (730 óra), szorozva azzal az időhányaddal, amelyben a GPU ki van használva. Minden kiszolgált tokent egy számlázható tokennek veszek az API output-árán, így az összehasonlítás egyszerű marad (saját módszer, nem benchmark-eredmény).",{"type":166,"content":411},[412],"Millió tokenre jutó költség egy bérelt H100-on, havi 2 094 €-val, az InferenceX-értékekkel (saját számítás):",{"type":230,"head":414,"rows":423},[415,417,419,421],[416],"Token\u002Fmásodperc (sebesség felhasználónként)",[418],"25%-ban kihasználva",[420],"50%-ban kihasználva",[422],"100%-ban kihasználva",[424,433,442],[425,427,429,431],[426],"877 (78 token\u002Fs felhasználónként)",[428],"3,63 €",[430],"1,82 €",[432],"0,91 €",[434,436,438,440],[435],"1 171 (58 token\u002Fs felhasználónként)",[437],"2,72 €",[439],"1,36 €",[441],"0,68 €",[443,445,447,449],[444],"1 848 (38 token\u002Fs felhasználónként)",[446],"1,72 €",[448],"0,86 €",[450],"0,43 €",{"type":166,"content":452},[453],"Az EU-s API-kkal szemben a Llama 3.3 70B a közelebbi eset. Az OVHcloud 0,67 €-t kér egymillió tokenért, a Scaleway 0,90 €-t. 58 token\u002Fmásodperc\u002Ffelhasználó mellett egy bérelt H100-nak az óra körül nagyjából 1 190 token\u002Fmásodpercet kellene szolgáltatnia ahhoz, hogy elérje az OVHcloud árát (saját számítás). A benchmark ezen a sebességen 1 171-et ad, így nem jut el oda. A Scaleway 0,90 €-s árához a break-even körülbelül 885 token\u002Fmásodperc, vagyis a benchmark-érték nagyjából háromnegyede.",{"type":166,"content":455},[456],"A gpt-oss-120b magasabbra teszi a lécet. Az API a Scaleway-nél 0,60 €-t kér millió output tokenért, az OVHcloud-nál 0,40 €-t. Egy bérelt H100, havi 2 094 €-val, átlagosan nagyjából 1 330 output tokent kell másodpercenként termelnie, hogy elérje a Scaleway árát, és nagyjából 1 990-et, hogy elérje az OVHcloud árát (saját számítás). Nem találtam ellenőrzött H100-as értéket a gpt-oss-120b-re, ezért mérd meg, mielőtt döntesz. A bemeneti tokenek még olcsóbbak: millióra 0,15 €, illetve 0,08 €.",{"type":202,"attrs":458,"inner":460,"caption":461},{"viewBox":204,"role":205,"aria-labelledby":459},"d2-brk-t d2-brk-d","\u003Ctitle id=\"d2-brk-t\">Break-even: egy bérelt H100 egy EU-s API ellen\u003C\u002Ftitle>\u003Cdesc id=\"d2-brk-d\">Vonaldiagram a havi költségről a havi output tokenek függvényében. Az API költsége nullától egyenesen emelkedik, millió output tokenenként 0,60 euróval. A bérelt H100 havi költsége nagyjából 2 094 euró, függetlenül attól, mennyi tokent szolgál ki. A két vonal nagyjából havi 3,5 milliárd output tokennél metszi egymást. E fölött a saját GPU olcsóbb, de csak akkor, ha ki van használva.\u003C\u002Fdesc>\u003Cpath d=\"M90 280 H680\" class=\"d-line\" \u002F>\u003Cpath d=\"M90 40 V280\" class=\"d-line\" \u002F>\u003Cpath d=\"M90 112.5 H680\" class=\"d-line-accent\" \u002F>\u003Cpath d=\"M90 280 L680 40\" class=\"d-line\" \u002F>\u003Cpath d=\"M502 106.5 l6 6 l-6 6 l-6 -6 z\" class=\"d-accent\" \u002F>\u003Ctext x=\"90\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">0\u003C\u002Ftext>\u003Ctext x=\"208\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">1\u003C\u002Ftext>\u003Ctext x=\"326\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">2\u003C\u002Ftext>\u003Ctext x=\"444\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">3\u003C\u002Ftext>\u003Ctext x=\"562\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">4\u003C\u002Ftext>\u003Ctext x=\"680\" y=\"298\" text-anchor=\"middle\" class=\"d-small\">5\u003C\u002Ftext>\u003Ctext x=\"385\" y=\"320\" text-anchor=\"middle\" class=\"d-small\">Output tokenek havonta (milliárd)\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"284\" text-anchor=\"end\" class=\"d-small\">0 €\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"204\" text-anchor=\"end\" class=\"d-small\">1 000 €\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"124\" text-anchor=\"end\" class=\"d-small\">2 000 €\u003C\u002Ftext>\u003Ctext x=\"82\" y=\"44\" text-anchor=\"end\" class=\"d-small\">3 000 €\u003C\u002Ftext>\u003Ctext x=\"90\" y=\"28\" class=\"d-small\">Költség havonta\u003C\u002Ftext>\u003Ctext x=\"100\" y=\"100\" class=\"d-text\">Egy bérelt H100: havi 2 094 €\u003C\u002Ftext>\u003Ctext x=\"470\" y=\"200\" class=\"d-small\">EU-s API: 0,60 € millióként\u003C\u002Ftext>\u003Ctext x=\"514\" y=\"140\" class=\"d-small\">Break-even: 3,5 Mrd token\u003C\u002Ftext>",[462],"Break-even egy bérelt H100-ra, havi 2 094 € mellett (saját számítás), a gpt-oss-120b Scaleway-árával szemben, amely millió output tokenenként 0,60 €. Havi nagyjából 3,5 milliárd output token felett a GPU olcsóbb, feltéve hogy valóban ki tudja szolgálni ezt a terhelést, amit a gpt-oss-120b esetén nem ellenőriztem.",{"type":166,"content":464},[465],"Az üzemeltetési költségek ráadásul rákerülnek. Minden 1 000 € havi üzemeltetési költség nagyjából 1,7 milliárd output tokennel tolja feljebb a gpt-oss-120b break-even pontját 0,60 €-nál millió tokenenként, vagyis az óra körül nagyjából 630 token\u002Fmásodperccel (saját számítás). Az ár önmagában ezért ritkán indokolja a saját üzemeltetést, ha egy EU-s API már kínálja a modellt. A saját üzemeltetés akkor éri meg, ha a hardver már a tiéd, ha a terhelés egész hónapban leköti a GPU-t, vagy ha egyetlen EU-s szolgáltató sem kínálja a szükséges modellt.",{"type":173,"level":174,"id":153,"text":154},{"type":166,"content":468},[469],"A megvásárolt kártya a bérelthez képest olcsónak látszik. Az NVIDIA a GeForce RTX 5090 indulási árát 1 999 $-ban adta meg, 32 GB GDDR7 memóriával és 575 W összes grafikai teljesítménnyel. 36 hónapra osztva a kártya havonta nagyjából 56 $-ba kerül (saját számítás). Ha 24 órában, teljes terhelésen fut, egymagában nagyjából 420 kWh-t fogyaszt havonta (575 W × 730 óra, saját számítás), ami a 30 ct\u002FkWh példafeltevéssel nagyjából 126 € havonta (saját számítás, nem idézett tarifa). Három év alatt az áram önmagában nagyjából 4 500 €-ra jön ki, ami több mint kétszerese az 1 999 $-os indulási árnak.",{"type":211,"variant":212,"title":471,"body":472},"Nézd meg a licencet, mielőtt a kártya a szerverszobába kerül",[473],[474],"Az NVIDIA GeForce-licencének 2.8. pontja szerint a GeForce- és Titan-szoftver nincs adatközponti telepítésre licencelve (eredeti szöveg: „is not licensed for datacenter deployment”). Egy fogyasztói kártya egy szerverszekrényben így kívül eshet a licencen. Ellenőrizd a feltételeket pontosan arra a kártyára, amelyet venni akarsz, mielőtt bármit ráépítesz.",{"type":173,"level":174,"id":156,"text":157},{"type":166,"content":477},[478],"Amint a szolgáltatás él, a GPU bérleti díja általában a legkisebb tétel. A többi munkaidő és kockázat. A táblázat tervezési számai saját feltételezéseim, nem mért adatok, ezért cseréld le őket a csapatod számaira.",{"type":230,"head":480,"rows":487},[481,483,485],[482],"Költségtétel",[484],"Hogyan néz ki",[486],"Tervezési feltételezés (saját)",[488,495,502,509,516,523],[489,491,493],[490],"Üzemeltetés",[492],"kiszolgálás, monitorozás, GPU-hibák, újraindítások, kapacitástervezés",[494],"egy mérnök munkaidejének 0,1–0,2-e",[496,498,500],[497],"Frissítések",[499],"új vLLM-, CUDA- és driververziók, OS-foltok, modellcserék",[501],"két–öt mérnöknap modellcserénként",[503,505,507],[504],"Evalok",[506],"regressziós készlet futtatása minden modell- vagy kiszolgálás-változtatás előtt",[508],"két–öt nap a felépítésre, utána nagyjából egy nap futásonként",[510,512,514],[511],"Ügyelet",[513],"valaki válaszol, ha a végpont munkaidőn kívül leáll",[515],"legalább két ember egy 24\u002F7 szolgáltatáshoz",[517,519,521],[518],"Redundancia",[520],"második GPU-csomópont a meghibásodás kezelésére",[522],"nagyjából megduplázza a bérleti díjat",[524,526,528],[525],"Megfelelőség",[527],"DPA a hostinggal, DPIA-frissítés, adatkezelési nyilvántartás, a logok, amelyek most már a tiéd",[529],"néhány nap évente",{"type":173,"level":174,"id":159,"text":160},{"type":179,"ordered":532,"items":533},true,[534,539,544,549,554,559],[535,538],{"tag":184,"children":536},[537],"Írd le az adatokat és a szabályokat."," Sorold fel, mely adatkategóriák érik el a modellt, és mely szerződések vagy DPIA-következtetések érvényesek. Ha egyik sem zárja ki a feldolgozót, kezdj egy DPA-s EU-s API-val.",[540,543],{"tag":184,"children":541},[542],"Szerezd meg írásban a hosting-tényeket."," Kérdezd meg a hosting régiót, az alfeldolgozók listáját és a megőrzési beállításokat. A Mistral árazási oldala egy DPA-ra linkel, de nem mondja meg, hol fut az API, ezt a választ a szerződésből kell megkapnod.",[545,548],{"tag":184,"children":546},[547],"Válaszd a legkisebb modellt, amely átmegy az evalokon."," Utána ellenőrizd a memóriáját azon a pontosságon, amelyen ténylegesen ki tudod szolgálni, ne a modellkártyán szereplőn.",[550,553],{"tag":184,"children":551},[552],"Mérj a saját promptjaiddal."," Futtasd a vllm bench serve parancsot a valós prompt-hosszokkal és egy latenciacéllal, mielőtt bármilyen hardverre elköteleznéd magad.",[555,558],{"tag":184,"children":556},[557],"Számold újra a break-even-t a saját számaiddal."," Használd a mért token\u002Fmásodperc értékeidet, a valós kihasználtságodat és az üzemeltetési költségvetésedet. Ha nem jön ki, maradj az API-nál, és tartsd nyilván a saját üzemeltetést tartalék lehetőségként.",[560,563],{"tag":184,"children":561},[562],"Tervezd meg az üzemeltetést az élesítés előtt."," Előbb rögzítsd az evalkészletet, az ügyeleti beosztást és a frissítési szabályokat. A GPU a könnyű rész.",{"type":166,"content":565},[566,567,571,572,576,577,581],"A pipeline adatoldalához olvasd el ezeket: ",{"tag":393,"to":568,"children":569},"\u002Fblog\u002Fgdpr-llm-api-eu-data-residency",[570],"EU-s adatrezidencia, régiókezelés és zero retention"," és ",{"tag":393,"to":573,"children":574},"\u002Fblog\u002Fpii-redaction-llm-pipelines",[575],"PII-redakció",". A regressziós készlethez lásd: ",{"tag":393,"to":578,"children":579},"\u002Fblog\u002Fllm-evals-for-product-features",[580],"LLM-evalok termékfunkciókhoz",".",{"type":173,"level":174,"id":162,"text":163},{"type":179,"ordered":532,"items":584},[585,590,594,598,602,606,610,614,618,622,626,630,634,637,641,645,649,652,656,660,664,668,672],[586],{"tag":587,"href":38,"children":588},"a",[589],"openai\u002Fgpt-oss-120b modellkártya (Hugging Face)",[591],{"tag":587,"href":41,"children":592},[593],"mistralai\u002FMistral-Small-3.2-24B-Instruct-2506 modellkártya (Hugging Face)",[595],{"tag":587,"href":44,"children":596},[597],"meta-llama\u002FLlama-3.3-70B-Instruct modellkártya (Hugging Face)",[599],{"tag":587,"href":47,"children":600},[601],"mistralai\u002FMistral-Large-3-675B-Instruct-2512 modellkártya (Hugging Face)",[603],{"tag":587,"href":50,"children":604},[605],"vLLM-blog: v0.6.0 teljesítményfrissítés (2024. szeptember)",[607],{"tag":587,"href":53,"children":608},[609],"vLLM-dokumentáció: motor-argumentumok",[611],{"tag":587,"href":56,"children":612},[613],"vLLM-dokumentáció: vllm bench serve",[615],{"tag":587,"href":59,"children":616},[617],"SemiAnalysis InferenceX: Llama 3.3 70B H100 vs H200",[619],{"tag":587,"href":62,"children":620},[621],"Scaleway GPU-példányok árai",[623],{"tag":587,"href":65,"children":624},[625],"Scaleway-blog: átlátható frissítés a Scaleway-árakról (2026. április 27.)",[627],{"tag":587,"href":68,"children":628},[629],"Scaleway Generative APIs árai",[631],{"tag":587,"href":71,"children":632},[633],"OVHcloud public cloud árlista",[635],{"tag":587,"href":74,"children":636},[73],[638],{"tag":587,"href":77,"children":639},[640],"OVHcloud AI Endpoints modellkatalógus",[642],{"tag":587,"href":80,"children":643},[644],"Hetzner dedikált GPU-szerverek",[646],{"tag":587,"href":83,"children":647},[648],"NVIDIA hírszoba: a GeForce RTX 50 sorozat bevezetése",[650],{"tag":587,"href":86,"children":651},[85],[653],{"tag":587,"href":89,"children":654},[655],"NVIDIA GeForce szoftverlicenc",[657],{"tag":587,"href":92,"children":658},[659],"GDPR 28. cikk: feldolgozó",[661],{"tag":587,"href":95,"children":662},[663],"GDPR 44. cikk: az átadások általános elve",[665],{"tag":587,"href":98,"children":666},[667],"Európai Bizottság: EU–USA adattovábbítás (Data Privacy Framework)",[669],{"tag":587,"href":101,"children":670},[671],"EDPB 28\u002F2024. számú vélemény az AI-modellekről (elfogadva 2024. december 17-én)",[673],{"tag":587,"href":104,"children":674},[675],"Mistral AI árai",[677,736,790,878],{"slug":678,"published":679,"minutes":680,"category":7,"tags":681,"keywords":687,"about":698,"sources":708,"cover":730,"og":731,"expertise":107,"locales":732,"lang":111,"title":733,"description":734,"coverAlt":735},"local-text-to-speech-pipeline","2026-10-01",11,[682,683,684,685,686],"Text-to-speech","Audio","Kokoro","FFmpeg","Vue",[688,689,690,691,692,693,694,695,696,697],"local text-to-speech","text-to-speech pipeline","kokoro tts","piper tts","bark tts comparison","narrate blog posts","wav to m4a ffmpeg","aac 192 kbit\u002Fs faststart","vue audio player","onnx tts mac",[699,702,705],{"name":700,"url":701},"Speech synthesis","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FSpeech_synthesis",{"name":703,"url":704},"Advanced Audio Coding","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAdvanced_Audio_Coding",{"name":706,"url":707},"ESpeak","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FESpeak",[709,712,715,718,721,724,727],{"title":710,"url":711},"Kokoro onnx: runtime bindings","https:\u002F\u002Fgithub.com\u002Fthewh1teagle\u002Fkokoro-onnx",{"title":713,"url":714},"Kokoro-82M model card","https:\u002F\u002Fhuggingface.co\u002Fhexgrad\u002FKokoro-82M",{"title":716,"url":717},"Piper text-to-speech","https:\u002F\u002Fgithub.com\u002Frhasspy\u002Fpiper",{"title":719,"url":720},"Bark by Suno","https:\u002F\u002Fgithub.com\u002Fsuno-ai\u002Fbark",{"title":722,"url":723},"FFmpeg AAC encoder documentation","https:\u002F\u002Fffmpeg.org\u002Fffmpeg-codecs.html#aac",{"title":725,"url":726},"torch.load weights_only documentation","https:\u002F\u002Fpytorch.org\u002Fdocs\u002Fstable\u002Fgenerated\u002Ftorch.load.html",{"title":728,"url":729},"ESpeak NG phonemizer","https:\u002F\u002Fgithub.com\u002Fespeak-ng\u002Fespeak-ng","\u002Fimages\u002Fblog\u002Flocal-text-to-speech-pipeline\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flocal-text-to-speech-pipeline\u002Fog.jpg",[109,110,111],"Helyi felolvasás nagyban: 96 cikk narrálása nyílt modellekkel","Három nyílt TTS-modell egy laptopon: hogyan lett 96 cikkből 1 512 perc felolvasás — a SQLite-soroktól a tagolt szintézisen és a 192 kbit\u002Fs AAC-en át az oldal mellett maradó lejátszóig.","Hullámdiagram a narrációs pipeline-ról: az adatbázsissorok mondatokra hullanak, egy helyi modell szintetizálja őket, AAC-kódolásra kerülnek, és a képernyő szélén ragadó fülről indulnak.",{"slug":737,"published":738,"updated":739,"minutes":740,"category":7,"tags":741,"keywords":746,"about":757,"sources":765,"cover":784,"og":785,"expertise":107,"locales":786,"lang":111,"title":787,"description":788,"coverAlt":789},"artificial-analysis-leaderboard-claude-opus-5-5","2026-09-07","2026-09-11",8,[742,743,744,745],"Claude Opus 5.5","Artificial Analysis","LLM benchmarks","LLM cost",[747,748,742,749,750,751,752,753,754,755,756],"Claude Opus 5.5 benchmark","Claude Opus 5.5 pricing","Artificial Analysis Intelligence Index","AI model leaderboard","Opus 5.5 benchmark","Opus 5.5 vs GPT-6 Astra","LLM cost per task","reasoning effort setting","Opus 5.5 pricing","best LLM September 2026",[758,761,762],{"name":759,"url":760},"Claude (language model)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClaude_(language_model)",{"name":28,"url":29},{"name":763,"url":764},"Benchmark (computing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBenchmark_(computing)",[766,769,772,775,778,781],{"title":767,"url":768},"Artificial Analysis: Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index (22 September 2026)","https:\u002F\u002Fartificialanalysis.ai\u002Farticles\u002Fclaude-opus-5-5",{"title":770,"url":771},"Artificial Analysis: Claude Opus 5.5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5",{"title":773,"url":774},"Artificial Analysis: Claude Opus 5.5 (medium) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5-5-medium",{"title":776,"url":777},"Artificial Analysis: Claude Opus 5 (max) model page","https:\u002F\u002Fartificialanalysis.ai\u002Fmodels\u002Fclaude-opus-5",{"title":779,"url":780},"OfficeChai: Claude Opus 5.5 creates a 5-point lead over GPT-6 Astra","https:\u002F\u002Fofficechai.com\u002Fai\u002Fclaude-opus-5-5-creates-5-point-lead-over-gpt-6-astra-jumps-to-top-spot-on-artificial-analysis-intelligence-index\u002F",{"title":782,"url":783},"Claude API docs: Models overview, context windows and prices (as of September 2026)","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fabout-claude\u002Fmodels\u002Foverview","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fartificial-analysis-leaderboard-claude-opus-5-5\u002Fog.jpg",[109,110,111],"Claude Opus 5.5 az Artificial Analysis élén, de az igazi hír a medium effort","A Claude Opus 5.5 az 1. a 211 modellből az Artificial Analysisnél, 58 ponttal. Medium efforttal hozza az Opus 5 szintjét, 1,34 $ helyett 5,86 $ feladatonként.","Vízszintes sávok az Intelligence Index pontszámaival: Claude Opus 5.5 max effort mellett 58, GPT-6 Astra és Claude Fable 5.1 53, Opus 5 51, Opus 5.5 medium effort mellett 51",{"slug":791,"published":792,"minutes":793,"category":7,"tags":794,"keywords":800,"about":811,"sources":820,"cover":872,"og":873,"expertise":107,"locales":874,"lang":111,"title":875,"description":876,"coverAlt":877},"agent-observability-opentelemetry","2026-08-06",12,[795,796,797,798,799],"OpenTelemetry","LLM observability","AI agents","Tracing","Evals",[801,802,803,804,805,806,807,808,809,810],"LLM agent observability OpenTelemetry","OpenTelemetry GenAI semantic conventions","how to trace LLM agents","gen_ai semantic conventions attributes","LLM token usage and cost metrics","LLM tracing sampling","PII in LLM traces","Langfuse vs Arize Phoenix vs Datadog","AI agent tracing evals","OpenTelemetry LLM tracing",[812,814,817],{"name":795,"url":813},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":815,"url":816},"Observability","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",{"name":818,"url":819},"Intelligent agent","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FIntelligent_agent",[821,824,827,830,833,836,839,842,845,848,851,854,857,860,863,866,869],{"title":822,"url":823},"OpenTelemetry: GenAI semantic conventions repository (open-telemetry\u002Fsemantic-conventions-genai)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai",{"title":825,"url":826},"GenAI conventions: overview (status Development)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002FREADME.md",{"title":828,"url":829},"GenAI conventions: model spans, execute_tool and content capture","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-spans.md",{"title":831,"url":832},"GenAI conventions: agent spans","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-agent-spans.md",{"title":834,"url":835},"GenAI conventions: metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-metrics.md",{"title":837,"url":838},"GenAI conventions: inference token metrics","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-token-metrics.md",{"title":840,"url":841},"GenAI conventions: events (gen_ai.evaluation.result)","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fgen-ai-events.md",{"title":843,"url":844},"GenAI conventions: Model Context Protocol","https:\u002F\u002Fgithub.com\u002Fopen-telemetry\u002Fsemantic-conventions-genai\u002Fblob\u002Fmain\u002Fdocs\u002Fgen-ai\u002Fmcp.md",{"title":846,"url":847},"OpenTelemetry docs: GenAI conventions moved notice","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fspecs\u002Fsemconv\u002Fgen-ai\u002F",{"title":849,"url":850},"OpenTelemetry docs: Sampling","https:\u002F\u002Fopentelemetry.io\u002Fdocs\u002Fconcepts\u002Fsampling\u002F",{"title":852,"url":853},"John Hodge: The state of the OpenTelemetry GenAI semantic conventions (July 2026)","https:\u002F\u002Fjohn-hodge.com\u002Fblog\u002Fopentelemetry-genai-semantic-conventions\u002F",{"title":855,"url":856},"Langfuse docs: OpenTelemetry integration","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fopentelemetry\u002Fget-started",{"title":858,"url":859},"Langfuse repository and licence","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse",{"title":861,"url":862},"Arize Phoenix repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fphoenix",{"title":864,"url":865},"Arize OpenInference repository","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fopeninference",{"title":867,"url":868},"Datadog docs: OpenTelemetry instrumentation for LLM Observability","https:\u002F\u002Fdocs.datadoghq.com\u002Fllm_observability\u002Finstrumentation\u002Fotel_instrumentation\u002F",{"title":870,"url":871},"Honeycomb docs: Send data with OpenTelemetry","https:\u002F\u002Fdocs.honeycomb.io\u002Fsend-data\u002Fopentelemetry\u002F","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fagent-observability-opentelemetry\u002Fog.jpg",[109,110,111],"LLM-ügynökök megfigyelhetősége OpenTelemetryvel: trace-ek, tokenek, PII és eval","Így trace-eld az LLM-ügynököket OpenTelemetryvel: GenAI semantic conventions és státuszuk, span-fa, token-metrikák, sampling, PII, eval és eszközök.","Ábra: egy ügynökfuttatás OpenTelemetry span-okra ágazik szét a modellhívásokhoz, eszközhívásokhoz, token-metrikákhoz és eval-eredményekhez, majd egy trace-backendbe exportálódik.",{"slug":879,"published":880,"minutes":881,"category":7,"tags":882,"keywords":886,"about":895,"sources":900,"cover":908,"og":909,"expertise":107,"locales":910,"lang":111,"title":911,"description":912,"coverAlt":913},"llm-cost-latency-prompt-caching-routing","2026-06-01",9,[883,884,745,885],"Prompt caching","Model routing","Latency",[887,888,889,890,891,892,893,894],"prompt caching","LLM cost optimization","LLM latency","model routing","batch API LLM","LLM cost per request","cheaper LLM model","cache hit rate LLM",[896,897],{"name":28,"url":29},{"name":898,"url":899},"Latency (engineering)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLatency_(engineering)",[901,904,907],{"title":902,"url":903},"Claude API docs: Prompt caching","https:\u002F\u002Fplatform.claude.com\u002Fdocs\u002Fen\u002Fdocs\u002Fbuild-with-claude\u002Fprompt-caching",{"title":905,"url":906},"OpenAI API docs: Prompt caching","https:\u002F\u002Fdevelopers.openai.com\u002Fapi\u002Fdocs\u002Fguides\u002Fprompt-caching",{"title":782,"url":783},"\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllm-cost-latency-prompt-caching-routing\u002Fog.jpg",[109,110,111],"Prompt caching és modell-routing: LLM költség és késleltetés csökkentése","A prompt caching, a kisebb modellre routing és a batch API-k csökkentik az éles LLM költségét és késleltetését. Így használd mindegyiket.","Négy relatív költségsáv egy kéréshez: drága modell cache nélkül, olcsóbb modell, gecachelt prefix, illetve gecachelt prefix egy batch jobban",1791636876322]