[{"data":1,"prerenderedAt":877},["ShallowReactive",2],{"tool-llama-cpp-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":22,"sources":34,"cover":76,"og":77,"expertise":78,"locales":79,"lang":82,"title":83,"description":84,"coverAlt":85,"url":24,"pricing":86,"kind":87,"metaTitle":88,"takeaways":89,"faq":95,"toc":108,"blocks":135,"others":522},"llama-cpp","2026-10-05",8,"llmops",[9,10,11,12,13],"llama.cpp","GGUF","Quantisation","Local inference","llama-server",[9,15,16,17,18,19,20,21],"llama.cpp review","GGUF quantisation levels","llama-server OpenAI compatible","llama.cpp vs Ollama","run LLM locally GDPR","llama.cpp CUDA Metal Vulkan","Q4_K_M vs Q8_0",[23,25,28,31],{"name":9,"url":24},"https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp",{"name":26,"url":27},"Large language model","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FLarge_language_model",{"name":29,"url":30},"Quantization (signal processing)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FQuantization_(signal_processing)",{"name":32,"url":33},"General Data Protection Regulation","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FGeneral_Data_Protection_Regulation",[35,37,40,43,46,49,52,55,58,61,64,67,70,73],{"title":36,"url":24},"llama.cpp repository: goals, backends, licence",{"title":38,"url":39},"llama.cpp releases: builds b11538 to b11541","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Freleases",{"title":41,"url":42},"llama.cpp build documentation: CMake flags","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Fblob\u002Fmaster\u002Fdocs\u002Fbuild.md",{"title":44,"url":45},"llama.cpp server README: endpoints, slots and grammars","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Fblob\u002Fmaster\u002Ftools\u002Fserver\u002FREADME.md",{"title":47,"url":48},"llama.cpp quantisation README: bits, size and speed","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Fblob\u002Fmaster\u002Ftools\u002Fquantize\u002FREADME.md",{"title":50,"url":51},"GGUF specification in the ggml repository","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fggml\u002Fblob\u002Fmaster\u002Fdocs\u002Fgguf.md",{"title":53,"url":54},"Performance of llama.cpp on Apple Silicon M-series","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Fdiscussions\u002F4167",{"title":56,"url":57},"Performance of llama.cpp on Nvidia CUDA","https:\u002F\u002Fgithub.com\u002Fggml-org\u002Fllama.cpp\u002Fdiscussions\u002F15013",{"title":59,"url":60},"Ollama README: supported backends and REST API","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":62,"url":63},"LM Studio documentation: app overview","https:\u002F\u002Flmstudio.ai\u002Fdocs\u002Fapp",{"title":65,"url":66},"vLLM README: features, hardware and licence","https:\u002F\u002Fgithub.com\u002Fvllm-project\u002Fvllm",{"title":68,"url":69},"vLLM documentation: GGUF support","https:\u002F\u002Fdocs.vllm.ai\u002Fen\u002Flatest\u002Ffeatures\u002Fquantization\u002Fgguf.html",{"title":71,"url":72},"GDPR Article 28: processor","https:\u002F\u002Fgdpr-info.eu\u002Fart-28-gdpr\u002F",{"title":74,"url":75},"GDPR Article 32: security of processing","https:\u002F\u002Fgdpr-info.eu\u002Fart-32-gdpr\u002F","\u002Fimages\u002Fblog\u002Fllama-cpp\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fllama-cpp\u002Fog.jpg","ai-engineer",[80,81,82],"en","de","hu","llama.cpp-teszt: a helyi motor az Ollama és az LM Studio alatt","A llama.cpp tiszta C\u002FC++ motor nyílt modellekhez, Metal, CUDA, Vulkan vagy CPU alatt. A GGUF-kvantálásokról, a llama-serverről és a korlátokról írok.","Borítókép a llama.cpp-teszthez: egy GGUF-fájl több háttérmotorra ágazik, majd egy OpenAI-stílusú API mögött áll.","MIT · free","Local inference runtime","llama.cpp-teszt: GGUF, kvantálás és a szerver · Balázs Csorba",[90,91,92,93,94],"A llama.cpp az MIT-licencű motor az Ollama és az LM Studio alatt. Közvetlenül akkor használd, ha a modellfájlt, a kvantálást és minden szerverkapcsolót te akarod irányítani.","A GGUF-fájl tartalmazza a súlyokat, a tokenizálót és a metaadatokat. A build-kapcsolók döntik el a háttérmotort, így ugyanaz a fájl fut Metalon, CUDA-n, Vulkanon vagy CPU-n.","A Q4_K_M jó kiindulópont, de a kvantálási táblázat csak a méretet és a sebességet méri, a minőségellenőrzést neked kell elvégezned.","Apple-chipeken a sebesség a memóriasávszélességet követi, de nem egyenesen. Egy csúcskategóriás chip több tucat tokent generál másodpercenként egy 7B-s modellen, egy adatközponti GPU ugyanilyen típusú tesztben nagyjából háromszor gyorsabb.","A helyi következtetés a promptokat a saját hardveredén tartja, ami kivesz egy adatfeldolgozót a következtetési lépésből, de a naplókra, a hozzáférésre és a megőrzésre vonatkozó GDPR-kötelezettségeid megmaradnak.",[96,99,102,105],{"q":97,"a":98},"Ingyenesen használható a llama.cpp kereskedelmi célra?","A projekt MIT-licencű, így licencdíj nélkül használhatod és szállíthatod. A betöltött modellsúlyok saját licencükkel rendelkeznek, amelyek korlátozhatják a kereskedelmi használatot, ezért minden modellkártyát ellenőrizz, mielőtt terméket építesz rá.",{"q":100,"a":101},"Mi a különbség a llama.cpp és az Ollama között?","Az Ollama a támogatott háttérmotorjai között sorolja fel a llama.cppet, és REST API-t ad a modellek futtatásához és kezeléséhez. A llama.cpp maga a motor: te választod ki a GGUF-fájlt, a kvantálást és minden kapcsolót, a binárist pedig te frissíted.",{"q":103,"a":104},"Melyik GGUF-kvantálással érdemes kezdeni?","A Q4_K_M-mel. A kvantálási README egy naiv Q4_K_M-kvantálást mutat példaként. Lépj feljebb Q5_K_M-re vagy Q6_K-ra, ha a saját értékeléseid minőségi hiányosságot mutatnak, mert a sebességi táblázat a minőségről semmit sem mond.",{"q":106,"a":107},"Segít a helyi llama.cpp-szerver a GDPR-megfelelésben?","Segít, mert egyetlen modellszolgáltató sem kapja meg a promptokat, így ez az adatfeldolgozó kiesik a láncból. A hozzáférés-szabályozást, a naplók megőrzését és a jogalapot továbbra is neked kell rendezned. Egy bérelt GPU-host, amely személyes adatokat kezel helyetted, adatfeldolgozó, és a 28. cikk szerinti szerződésre van szüksége.",[109,112,115,118,121,123,126,129,132],{"id":110,"title":111},"what-it-is","Mi ez",{"id":113,"title":114},"how-it-works","Hogyan működik",{"id":116,"title":117},"getting-started","Első lépések",{"id":119,"title":120},"quantisation-and-speed","Kvantálás és sebesség",{"id":13,"title":122},"llama-server: API, slotok és strukturált kimenet",{"id":124,"title":125},"cost-and-deployment","Költség és üzemeltetés",{"id":127,"title":128},"where-it-falls-short","Hol szorul ki",{"id":130,"title":131},"verdict","Ítélet",{"id":133,"title":134},"sources","Források",[136,140,143,146,175,176,179,188,189,192,230,233,236,237,240,304,313,320,323,326,332,333,336,339,342,344,345,381,384,392,398,399,426,427,430,462,463],{"type":137,"content":138},"paragraph",[139],"A llama.cpp az a C- és C++-motor, amely nyílt súlyú nyelvi modelleket futtat olyan hardveren, amelyet te irányítasz. Több barátságosabb helyi eszköz épül rá, köztük az Ollama és az LM Studio. Az ítélet előre: közvetlenül akkor használd, ha te akarod kiválasztani a modellfájlt, a kvantálást és minden szerverkapcsolót, laptopon vagy a saját szervereden. Ne használd, ha egyetlen paranccsal akarsz modelleket letölteni és kezelni, és ne használd egy forgalmas, sok felhasználós GPU-szolgáltatás kiszolgáló rétegeként sem, ahhoz a vLLM a jobb választás.",{"type":141,"level":142,"id":110,"text":111},"heading",2,{"type":137,"content":144},[145],"A projekt célként az LLM- és VLM-következtetést jelöli meg minimális beállítással és korszerű teljesítménnyel, széles hardverskálán. Tiszta C- és C++-megvalósítás, külső függőségek nélkül, a ggml tenzorkönyvtárra épül. A kiadási oldalon látható legújabb build a b11541, amelyet 2026. október 10-én tettek közzé.",{"type":147,"ordered":148,"items":149},"list",false,[150,156,161,165,170],[151,155],{"tag":152,"children":153},"strong",[154],"MIT-licenc"," az egész projektre, így licencdíj nélkül használhatod és szállíthatod.",[157,160],{"tag":152,"children":158},[159],"Háttérmotorok"," Apple Metalhoz, NVIDIA CUDA-hoz, AMD HIP-hez, Vulkanhoz, OpenCL-hez, SYCL-hez és WebGPU-hoz, valamint x86- és ARM-CPU-s kódútvonalak.",[162,164],{"tag":152,"children":163},[13],", OpenAI-kompatibilis HTTP-szerver beépített webes felülettel.",[166,169],{"tag":152,"children":167},[168],"Kvantálás"," 1,5 és 8 bit között, GGUF modellformátummal.",[171,174],{"tag":152,"children":172},[173],"Hugging Face-támogatás"," a -hf kapcsolón keresztül, valamint olyan konvertáló szkriptek, mint a convert_hf_to_gguf.py.",{"type":141,"level":142,"id":113,"text":114},{"type":137,"content":177},[178],"A GGUF-fájl végzi a munka nagy részét. A specifikáció úgy írja le a GGUF-ot, mint fájlformátumot modellek tárolására, a GGML-lel és a GGML-re épülő futtatókörnyezetekkel történő következtetéshez, gyors betöltésre és mentésre tervezve. Minden fájl tartalmaz fejlécet a tenzorok és a metaadatok számlálóival, típusos kulcs-érték metaadatokat, minden tenzor leírását (név, alak, típus és eltolás), valamint a tenzoradatokat, amelyeket igazítási határra töltenek ki. A specifikáció a memóriatérkép-kompatibilitást célként nevezi meg, így az operációs rendszer a súlyokat leképezheti, ahelyett hogy másolná őket. A tokenizáló is a fájlban van, a tokenizer.ggml kulcsok alatt. A specifikáció figyelmeztet, hogy a beágyazott szótár pontatlanabb lehet az eredeti tokenizálónál, ezért konvertálás után ellenőrizd a kimenet minőségét.",{"type":180,"attrs":181,"inner":185,"caption":186},"diagram",{"viewBox":182,"role":183,"aria-labelledby":184},"0 0 720 330","img","d1-lc-t d1-lc-d","\u003Ctitle id=\"d1-lc-t\">Egy GGUF-fájl, egy API\u003C\u002Ftitle>\u003Cdesc id=\"d1-lc-d\">A GGUF-fájl súlyokat, tokenizálót és metaadatokat tartalmaz. A llama.cpp betölti, és a build során kiválasztott háttérmotoron futtatja, például Metalon, CUDA-n, Vulkanon vagy CPU-n. A llama-server a modellt OpenAI-kompatibilis API-n keresztül teszi elérhetővé, amelyet bármely OpenAI-kliens meghívhat. Csak a háttérmotor változik a hardverrel, a fájl és az API ugyanaz marad.\u003C\u002Fdesc>\u003Cdefs>\u003Cmarker id=\"ah-lc\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head\" \u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Ctext x=\"20\" y=\"28\" class=\"d-title\">Egy GGUF-fájl, egy API\u003C\u002Ftext>\u003Ctext x=\"700\" y=\"28\" text-anchor=\"end\" class=\"d-label\">llama.cpp a saját gépeden\u003C\u002Ftext>\u003Crect x=\"20\" y=\"60\" width=\"150\" height=\"62\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"95\" y=\"88\" text-anchor=\"middle\" class=\"d-text\">GGUF-fájl\u003C\u002Ftext>\u003Ctext x=\"95\" y=\"110\" text-anchor=\"middle\" class=\"d-small\">Súlyok, tokenizáló\u003C\u002Ftext>\u003Cpath d=\"M170 91 H193\" class=\"d-line\" marker-end=\"url(#ah-lc)\" \u002F>\u003Crect x=\"195\" y=\"60\" width=\"150\" height=\"62\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"270\" y=\"88\" text-anchor=\"middle\" class=\"d-text\">llama.cpp\u003C\u002Ftext>\u003Ctext x=\"270\" y=\"110\" text-anchor=\"middle\" class=\"d-small\">ggml-gráf\u003C\u002Ftext>\u003Cpath d=\"M345 91 H368\" class=\"d-line\" marker-end=\"url(#ah-lc)\" \u002F>\u003Crect x=\"370\" y=\"60\" width=\"150\" height=\"62\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"445\" y=\"88\" text-anchor=\"middle\" class=\"d-text\">llama-server\u003C\u002Ftext>\u003Ctext x=\"445\" y=\"110\" text-anchor=\"middle\" class=\"d-small\">OpenAI-kompatibilis\u003C\u002Ftext>\u003Cpath d=\"M520 91 H543\" class=\"d-line\" marker-end=\"url(#ah-lc)\" \u002F>\u003Crect x=\"545\" y=\"60\" width=\"150\" height=\"62\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"620\" y=\"88\" text-anchor=\"middle\" class=\"d-text\">Alkalmazásod\u003C\u002Ftext>\u003Ctext x=\"620\" y=\"110\" text-anchor=\"middle\" class=\"d-small\">OpenAI-kliens\u003C\u002Ftext>\u003Cpath d=\"M270 122 V180\" class=\"d-line\" \u002F>\u003Cpath d=\"M95 180 H620\" class=\"d-line\" \u002F>\u003Cpath d=\"M95 180 V200\" class=\"d-line\" \u002F>\u003Cpath d=\"M270 180 V200\" class=\"d-line\" \u002F>\u003Cpath d=\"M445 180 V200\" class=\"d-line\" \u002F>\u003Cpath d=\"M620 180 V200\" class=\"d-line\" \u002F>\u003Crect x=\"20\" y=\"200\" width=\"150\" height=\"56\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"95\" y=\"224\" text-anchor=\"middle\" class=\"d-text\">Metal\u003C\u002Ftext>\u003Ctext x=\"95\" y=\"244\" text-anchor=\"middle\" class=\"d-small\">Apple Silicon\u003C\u002Ftext>\u003Crect x=\"195\" y=\"200\" width=\"150\" height=\"56\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"270\" y=\"224\" text-anchor=\"middle\" class=\"d-text\">CUDA\u003C\u002Ftext>\u003Ctext x=\"270\" y=\"244\" text-anchor=\"middle\" class=\"d-small\">NVIDIA GPU-k\u003C\u002Ftext>\u003Crect x=\"370\" y=\"200\" width=\"150\" height=\"56\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"445\" y=\"224\" text-anchor=\"middle\" class=\"d-text\">Vulkan\u003C\u002Ftext>\u003Ctext x=\"445\" y=\"244\" text-anchor=\"middle\" class=\"d-small\">GPU-illesztő\u003C\u002Ftext>\u003Crect x=\"545\" y=\"200\" width=\"150\" height=\"56\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"620\" y=\"224\" text-anchor=\"middle\" class=\"d-text\">CPU\u003C\u002Ftext>\u003Ctext x=\"620\" y=\"244\" text-anchor=\"middle\" class=\"d-small\">x86 és ARM\u003C\u002Ftext>\u003Ctext x=\"20\" y=\"290\" class=\"d-small\">A build-kapcsolók döntik el a háttérmotort: -DGGML_CUDA=ON, -DGGML_VULKAN=ON, macOS-en alapból Metal.\u003C\u002Ftext>",[187],"Egy GGUF-fájl és egy API: a háttérmotor a hardveredet követi, a felület ugyanaz marad.",{"type":141,"level":142,"id":116,"text":117},{"type":137,"content":190},[191],"A build-dokumentáció macOS-en alapértelmezetten bekapcsolja a Metalt, így egy sima build a Macen már tartalmazza az Apple-háttérmotort. A többi háttérmotorhoz konfiguráláskor kapcsoló kell, ahogy a táblázat mutatja.",{"type":193,"head":194,"rows":201},"table",[195,197,199],[196],"Háttérmotor",[198],"Hardver",[200],"Bekapcsolás",[202,209,216,223],[203,205,207],[204],"Metal",[206],"Apple Silicon",[208],"macOS-en alapértelmezetten be",[210,212,214],[211],"CUDA",[213],"NVIDIA GPU-k",[215],"-DGGML_CUDA=ON",[217,219,221],[218],"Vulkan",[220],"Vulkan-illesztőprogrammal rendelkező GPU-k",[222],"-DGGML_VULKAN=ON",[224,226,228],[225],"CPU",[227],"x86 (AVX2, AVX512, AMX) és ARM (NEON)",[229],"Az alapértelmezett buildben benne van",{"type":231,"code":232},"code","# macOS includes Metal by default; for NVIDIA GPUs use cmake -B build -DGGML_CUDA=ON\ncmake -B build\ncmake --build build --config Release\n.\u002Fbuild\u002Fbin\u002Fllama-server -m models\u002FLlama-3.1-8B-Instruct-Q4_K_M.gguf -c 8192 -np 4 --host 127.0.0.1 --port 8080",{"type":137,"content":234},[235],"Három kapcsoló dönt a legtöbbet. A -m megnevezi a GGUF-fájlt, a -c a kontextusméretet adja meg tokenben (0 a modellben tárolt értéket jelenti), a -np pedig a párhuzamos slotok számát. A szerver alapértelmezetten a 127.0.0.1 címen figyel, így más gépek addig nem érik el, amíg meg nem változtatod a --host kapcsolót.",{"type":141,"level":142,"id":119,"text":120},{"type":137,"content":238},[239],"A kvantálás azt jelenti, hány bitet kap minden súly, és ezt a fájlmérettel és a minőséggel szemben mérlegeled. A _K jelölés a K-kvantokat jelöli, az IQ típusok pedig az I-kvantok, amelyek körülbelül 2 bit\u002Fsúlyig mennek; az IQ1_S a README táblázatában 2,00 bit. A README példaparancsa naiv Q4_K_M-kvantálás alapbeállításokkal, ezért a Q4_K_M ésszerű kiindulópont.",{"type":193,"head":241,"rows":249},[242,243,245,247],[168],[244],"Bit súlyonként",[246],"Méret (GiB)",[248],"Generálás (token\u002Fs)",[250,259,268,277,286,295],[251,253,255,257],[252],"Q2_K",[254],"3,16",[256],"2,95",[258],"79,85",[260,262,264,266],[261],"Q4_K_M",[263],"4,89",[265],"4,58",[267],"71,93",[269,271,273,275],[270],"Q5_K_M",[272],"5,70",[274],"5,33",[276],"67,23",[278,280,282,284],[279],"Q6_K",[281],"6,56",[283],"6,14",[285],"58,67",[287,289,291,293],[288],"Q8_0",[290],"8,50",[292],"7,95",[294],"50,93",[296,298,300,302],[297],"F16",[299],"16,00",[301],"14,96",[303],"29,17",{"type":137,"content":305},[306,307,312],"A táblázatot kompromisszumként olvasd. A méret a bitszámmal csökken, a generálás pedig gyorsabb lesz, ahogy a fájl kisebb lesz, mert minden tokennek újra be kell olvasnia a súlyokat. Az F16 másodpercenként 29,17 tokent generál, szemben a Q4_K_M 71,93-mal, és több mint háromszor annyi memóriát igényel. A README a Llama 3.1 8B modellt méri, de nem írja le, melyik gép adta a számokat, ezért relatív értékekként kezeld őket. A táblázatban nincs minőségoszlop: a README sem perplexitást, sem KL-divergenciát nem közöl. Választás előtt szerintem minden jelöltre ugyanazt az értékelő halmazt kell lefuttatni, ahogy a ",{"tag":308,"to":309,"children":310},"link","\u002Fblog\u002Fllm-evals-for-product-features",[311],"LLM-értékelések termékfunkciókhoz"," című cikkemben leírtam.",{"type":314,"variant":315,"title":316,"body":317},"callout","tip","Egy alapbeállítás, ami megáll",[318],[319],"Kezdd a Q4_K_M-mel. Lépj Q5_K_M-re vagy Q6_K-ra csak akkor, ha az értékeléseid lényeges hiányosságot mutatnak, Q2_K-ra pedig csak akkor, ha a memória kényszeríti rá. A minőségveszteséget mérd, ne feltételezd.",{"type":137,"content":321},[322],"Apple-chipeken a sebesség a memóriasávszélességet követi. Az Apple Silicon-szálban a LLaMA 7B Q4_0 kvantálással az M4 Max másodpercenként 83,06 tokent generál, 546 GB\u002Fs memóriasávszélességgel, az M1 Pro pedig 36,41-et, 200 GB\u002Fs-mal. Az M2 Ultra 94,27-et ér el 800 GB\u002Fs-mal. Az összefüggés nem egyenes: az M1 Pro az M2 Ultra sávszélességének negyedével rendelkezik, és annak kevesebb mint felével fut.",{"type":137,"content":324},[325],"A CUDA-szál a Llama 2 7B Q4_0 kvantálásán mért llama-bench-eredményeket gyűjti: az RTX 4090 másodpercenként 186,21 tokent, a 80 GB-os H100 267,81-et, az RTX 5090 pedig 290,02-t ad. Tervezéshez ez azt jelenti, hogy egy csúcskategóriás Apple-chipen egy felhasználó több tucat tokent kap másodpercenként egy 7B-s modellen, egy adatközponti GPU pedig ugyanilyen típusú tesztben nagyjából háromszor gyorsabb. A modellek és a buildek szálanként eltérnek, ezért nagyságrendekben gondolkodj. Egyik szál sem tesztel szervert egyidejű terhelés alatt, pedig a GPU-szerver ára éppen ott térül meg.",{"type":314,"variant":327,"title":328,"body":329},"note","Mérd azt a buildet, amelyet használsz",[330],[331],"A buildek gyorsan változnak. A kiadási oldalon 2026. október 9-én és 10-én négy build jelent meg. Mérd meg a saját modelloddal, kvantálásoddal és hardvereddel, és a mérés mellé írd fel a build számát.",{"type":141,"level":142,"id":13,"text":122},{"type":137,"content":334},[335],"A llama-server az a pont, ahol a legtöbb alkalmazás találkozik a llama.cpp-vel. OpenAI-kompatibilis útvonalai a \u002Fv1 alatt vannak: chat completions, completions, responses, models és embeddings. A natív útvonalak a tokenizálást, a sablonrenderelést, a slotok állapotát és az állapotellenőrzést fedik le. Létezik Prometheus-kompatibilis metrikavégpont is, de ki van kapcsolva, amíg meg nem adod a --metrics kapcsolót, ami fontos tudni, mielőtt portot tennél közzé.",{"type":137,"content":337},[338],"A párhuzamos slotok így működnek. Ha a -np az alapértelmezett auto értéken van, a slotok egyetlen KV-gyorsítótár-pufferen osztoznak, és a README ezt az üzemmódot alapból bekapcsolja. Így egy hosszú kérés olyan memóriát is használhat, amelyet egy tétlen slot egyébként lefoglalna. A folytonos kötegelés szintén alapból be van kapcsolva. A README dokumentálja a kapcsolót (--kv-unified) és a slotonkénti korlátot (--kv-unified-per-slot), de nem részletezi, hogyan oszlik meg a keret, ha kézzel állítod be a slotok számát. Ezért mérd meg a memóriát, mielőtt több felhasználós szervert méretezel.",{"type":137,"content":340},[341],"A strukturált kimenetnek két útja van. A --json-schema JSON-sémára korlátozza a generálást, a --grammar pedig BNF-szerű nyelvtant fogad el; a README mindkettőt a generálás korlátozásának módjaként írja le. A chat-végpont elfogad json_schema típusú response_format mezőt is, ahogy ez a kérés mutatja.",{"type":231,"code":343},"curl -s http:\u002F\u002F127.0.0.1:8080\u002Fv1\u002Fchat\u002Fcompletions \\\n  -H \"Content-Type: application\u002Fjson\" \\\n  -d '{\"messages\": [{\"role\": \"user\", \"content\": \"Extract the author from: Written by Balázs Csorba.\"}], \"response_format\": {\"type\": \"json_schema\", \"schema\": {\"type\": \"object\", \"properties\": {\"author\": {\"type\": \"string\"}}, \"required\": [\"author\"]}}}'",{"type":141,"level":142,"id":124,"text":125},{"type":193,"head":346,"rows":353},[347,349,351],[348],"Költségtétel",[350],"Amit fizetsz",[352],"Megjegyzés",[354,360,367,374],[355,356,358],[9],[357],"Semmit",[359],"MIT-licenc, nincs használati díj",[361,363,365],[362],"Saját hardver",[364],"Beszerzés és áram",[366],"A memória határozza meg a legnagyobb betölthető modellt és kvantálást",[368,370,372],[369],"Bérelt GPU-szerver",[371],"A szolgáltató díja",[373],"Válassz EU-régiót, és köss adatfeldolgozási szerződést",[375,377,379],[376],"Modellsúlyok",[378],"Az adott modell saját feltételei",[380],"A modellkártya tünteti fel a licencet",{"type":137,"content":382},[383],"Az adatvédelem a helyi következtetés legerősebb érve. Ha a modell a saját hardveredén fut, a promptok, a lekért dokumentumok és a válaszok azon a gépen maradnak, és egyetlen modellszolgáltató sem kapja meg őket, így a következtetési lépésnek nincs adatfeldolgozója. A GDPR 28. cikke szerint az adatfeldolgozó által végzett adatkezelést kötelező erejű szerződésnek kell szabályoznia, amely dokumentált utasításokhoz köti a feldolgozót. Egy bérelt GPU-host, amely helyetted kezel személyes adatokat, adatfeldolgozó, függetlenül attól, hogy hol található, és szüksége van erre a szerződésre.",{"type":137,"content":385},[386,387,391],"A helyi nem jelent automatikusan megfelelőséget. A 32. cikk az adatkezelőktől és adatfeldolgozóktól megfelelő technikai és szervezési intézkedéseket kér, példaként a titkosítást és az álnevesítést említi. Egy llama.cpp-szervernél ezek a beállítások számítanak: a kötési cím (127.0.0.1, kivéve, ha módosítod a --host kapcsolót), az API-kulcs (a --api-key egy vagy több kulcsot fogad el), a metrikavégpont (kikapcsolva, kivéve, ha megadod a --metrics kapcsolót), és a saját naplóid, amelyekre ugyanaz a megőrzési szabály vonatkozik, mint bármely promptarchívumra. A ",{"tag":308,"to":388,"children":389},"\u002Fblog\u002Fgdpr-llm-api-eu-data-residency",[390],"GDPR és az LLM-adatrezidencia"," cikk lefedi a checklista többi részét.",{"type":314,"variant":393,"title":394,"body":395},"warn","A Docker-példa minden felületre köt",[396],[397],"A README Docker-példája a --host 0.0.0.0 kapcsolóval indítja a szervert. Konténerben ez rendben van, mert a portleképezés dönti el, ki éri el. Laptopon viszont az egész hálózatnak kiteszi a szervert, ezért maradj a 127.0.0.1-en, vagy előbb adj meg --api-key kapcsolót.",{"type":141,"level":142,"id":127,"text":128},{"type":147,"ordered":148,"items":400},[401,406,411,416,421],[402,405],{"tag":152,"children":403},[404],"Futtatókörnyezet, nem platform."," Te választod ki a fájlt, a kvantálást, a kontextusméretet és a kapcsolókat, a binárist pedig te frissíted. A tempó is ide tartozik: a kiadási oldalon 2026. október 9-én és 10-én négy build jelent meg.",[407,410],{"tag":152,"children":408},[409],"Nincs modellkezelés."," A GGUF-fájlt magad töltöd le. A -hf kapcsoló letölt egy Hugging Face-tárolót, és alapból Q4_K_M-et vesz, vagy a tár első fájlját, ha ez a kvantálás hiányzik.",[412,415],{"tag":152,"children":413},[414],"Nincs minőségmérés."," A kvantálási táblázat csak a méretet és a sebességet adja, a minőségellenőrzés tehát rád marad.",[417,420],{"tag":152,"children":418},[419],"A párhuzamosság memóriakérdés."," Vannak slotok és folytonos kötegelés, de a benchmark-szálak nem tesztelnek szervert egyidejű terhelés alatt, a README pedig nem részletezi a memória-felosztást kézzel beállított slotszám mellett.",[422,425],{"tag":152,"children":423},[424],"A GGUF a vLLM-ben még nem kész kiszolgálási út."," A vLLM a GGUF-támogatását erősen kísérletinek és nem eléggé optimalizáltnak nevezi, és azt írja, hogy a GGUF egyelőre főleg a memórialábnyom csökkentésére jó.",{"type":141,"level":142,"id":130,"text":131},{"type":137,"content":428},[429],"Válaszd a llama.cpp-t, ha magát a motort akarod, a fájl, a kvantálás és a kapcsolók a te irányításod alatt állnak, és ha az adatok soha nem hagyhatják el a gépet. Saját eszközökhöz és egy kis privát szerverhez jó alap. Annak, aki egyetlen paranccsal akar modellt letölteni és futtatni, nem az első eszköz, és egy forgalmas GPU-szolgáltatás kiszolgáló rétegeként sem jó. Ha a helyi lehetőségek között választasz: az LM Studio Mac-en, Windowson és Linuxon llama.cpp-vel futtat modelleket, Apple Silicon-on pedig az MLX-et is támogatja. Így azoknak való, akik grafikus alkalmazást szeretnének.",{"type":147,"ordered":431,"items":432},true,[433,438,442,452],[434,437],{"tag":152,"children":435},[436],"Válaszd, ha"," te akarod kiválasztani a GGUF-fájlt, a kvantálást és minden kapcsolót a saját hardveredén.",[439,441],{"tag":152,"children":440},[436]," olyan szervert akarsz, amelyet soronként át tudsz látni, és minden beállítás látszik a saját parancsodban.",[443,446,447,451],{"tag":152,"children":444},[445],"Ne válaszd, ha"," egyetlen paranccsal akarsz modelleket letölteni és kezelni. Ehhez az ",{"tag":308,"to":448,"children":449},"\u002Ftools\u002Follama",[450],"Ollama"," való, amely a llama.cpp-t a támogatott háttérmotorjai között sorolja fel.",[453,456,457,461],{"tag":152,"children":454},[455],"Ne válaszd közös GPU-szolgáltatásra"," sok felhasználóval egyszerre. Előbb a ",{"tag":308,"to":458,"children":459},"\u002Ftools\u002Fvllm",[460],"vLLM","-et mérd meg, mert a magja a PagedAttention és a folytonos kötegelés.",{"type":141,"level":142,"id":133,"text":134},{"type":147,"ordered":148,"items":464},[465,470,474,478,482,486,490,494,498,502,506,510,514,518],[466],{"tag":467,"href":24,"children":468},"a",[469],"llama.cpp-tároló: célok, háttérmotorok, licenc",[471],{"tag":467,"href":39,"children":472},[473],"llama.cpp-kiadások: a b11538–b11541 buildek",[475],{"tag":467,"href":42,"children":476},[477],"llama.cpp build-dokumentáció: CMake-kapcsolók",[479],{"tag":467,"href":45,"children":480},[481],"llama.cpp szerver-README: végpontok, slotok és grammatikák",[483],{"tag":467,"href":48,"children":484},[485],"llama.cpp kvantálási README: bitek, méret és sebesség",[487],{"tag":467,"href":51,"children":488},[489],"GGUF-specifikáció a ggml-tárolóban",[491],{"tag":467,"href":54,"children":492},[493],"A llama.cpp teljesítménye Apple Silicon M-sorozaton",[495],{"tag":467,"href":57,"children":496},[497],"A llama.cpp teljesítménye Nvidia CUDA-n",[499],{"tag":467,"href":60,"children":500},[501],"Ollama README: támogatott háttérmotorok és REST API",[503],{"tag":467,"href":63,"children":504},[505],"LM Studio dokumentáció: az alkalmazás áttekintése",[507],{"tag":467,"href":66,"children":508},[509],"vLLM README: funkciók, hardver és licenc",[511],{"tag":467,"href":69,"children":512},[513],"vLLM dokumentáció: GGUF-támogatás",[515],{"tag":467,"href":72,"children":516},[517],"GDPR 28. cikk: adatfeldolgozó",[519],{"tag":467,"href":75,"children":520},[521],"GDPR 32. cikk: az adatkezelés biztonsága",[523,614,727,833],{"slug":524,"published":525,"minutes":6,"category":7,"tags":526,"keywords":532,"about":540,"sources":551,"cover":606,"og":607,"expertise":78,"locales":608,"lang":82,"title":609,"description":610,"coverAlt":611,"url":543,"pricing":612,"kind":613},"deepeval","2026-10-06",[527,528,529,530,531],"LLM evaluation","pytest","LLM-as-a-judge","Red teaming","Open source",[524,533,534,535,536,537,538,539],"deepeval vs ragas","llm evaluation framework","pytest for llm outputs","g-eval metric","llm judge cost","deepeval pricing","llm red teaming open source",[541,544,547,550],{"name":542,"url":543},"DeepEval","https:\u002F\u002Fdeepeval.com",{"name":545,"url":546},"Confident AI","https:\u002F\u002Fwww.confident-ai.com",{"name":548,"url":549},"Pytest","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPytest",{"name":26,"url":27},[552,555,558,561,564,567,570,573,576,579,582,585,588,591,594,597,600,603],{"title":553,"url":554},"DeepEval documentation: getting started","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fgetting-started",{"title":556,"url":557},"GitHub: confident-ai\u002Fdeepeval, the README and licence","https:\u002F\u002Fgithub.com\u002Fconfident-ai\u002Fdeepeval",{"title":559,"url":560},"PyPI: deepeval, the latest release and Python requirement","https:\u002F\u002Fpypi.org\u002Fproject\u002Fdeepeval\u002F",{"title":562,"url":563},"DeepEval documentation: metrics introduction","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fmetrics-introduction",{"title":565,"url":566},"DeepEval documentation: G-Eval","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fmetrics-llm-evals",{"title":568,"url":569},"DeepEval documentation: Faithfulness","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fmetrics-faithfulness",{"title":571,"url":572},"DeepEval documentation: Tool Correctness","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fmetrics-tool-correctness",{"title":574,"url":575},"DeepEval documentation: generate goldens from documents","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fsynthesizer-generate-from-docs",{"title":577,"url":578},"DeepEval documentation: unit testing in CI\u002FCD","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fevaluation-unit-testing-in-ci-cd",{"title":580,"url":581},"DeepEval FAQ","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Ffaq",{"title":583,"url":584},"DeepEval documentation: data privacy","https:\u002F\u002Fdeepeval.com\u002Fdocs\u002Fdata-privacy",{"title":586,"url":587},"GitHub: confident-ai\u002Fdeepteam, the red-teaming framework","https:\u002F\u002Fgithub.com\u002Fconfident-ai\u002Fdeepteam",{"title":589,"url":590},"Confident AI pricing","https:\u002F\u002Fwww.confident-ai.com\u002Fpricing",{"title":592,"url":593},"Confident AI documentation: data residency","https:\u002F\u002Fwww.confident-ai.com\u002Fdocs\u002Fsettings\u002Fdata-residency",{"title":595,"url":596},"Confident AI subprocessor list","https:\u002F\u002Fwww.confident-ai.com\u002Fsubprocessors-list",{"title":598,"url":599},"GitHub: explodinggradients\u002Fragas, the README","https:\u002F\u002Fgithub.com\u002Fexplodinggradients\u002Fragas",{"title":601,"url":602},"GitHub: promptfoo\u002Fpromptfoo, the README","https:\u002F\u002Fgithub.com\u002Fpromptfoo\u002Fpromptfoo",{"title":604,"url":605},"Braintrust pricing","https:\u002F\u002Fwww.braintrust.dev\u002Fpricing","\u002Fimages\u002Fblog\u002Fdeepeval\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fdeepeval\u002Fog.jpg",[80,81,82],"DeepEval bemutató: pytest az LLM-kimenetekhez, és a bíró számlája","A DeepEval LLM-ellenőrzéseket futtat pytest-szerű tesztként, beépített bírómetrikákkal. Ingyenes könyvtár; a bíróhívások és az adatáramlás a valódi költség.","Borítókép a DeepEval bemutatóhoz: egy tesztesetet bírómetrika visz át egy átmenő vagy elbukó kapuig","Apache-2.0 · free; Confident AI from $0, Starter $200 a month","Evaluation framework",{"slug":615,"published":525,"minutes":6,"category":7,"tags":616,"keywords":622,"about":630,"sources":643,"cover":719,"og":720,"expertise":78,"locales":721,"lang":82,"title":722,"description":723,"coverAlt":724,"url":633,"pricing":725,"kind":726},"dspy",[617,618,619,620,621],"Prompt optimisation","LLM programs","MIPROv2","GEPA","Python",[615,623,624,625,626,627,628,629],"dspy tutorial","dspy optimizer","miprov2","gepa prompt optimization","dspy vs prompt engineering","automatic prompt optimization","dspy signatures",[631,634,637,640],{"name":632,"url":633},"DSPy","https:\u002F\u002Fdspy.ai",{"name":635,"url":636},"Prompt engineering","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPrompt_engineering",{"name":638,"url":639},"Bayesian optimization","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FBayesian_optimization",{"name":641,"url":642},"Fine-tuning (deep learning)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FFine-tuning_(deep_learning)",[644,647,650,653,656,659,662,665,668,671,674,677,680,683,686,689,692,695,698,701,704,707,710,713,716],{"title":645,"url":646},"DSPy home and cost example","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002F",{"title":648,"url":649},"DSPy installation","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fgetting-started\u002Finstallation\u002F",{"title":651,"url":652},"DSPy: program, don't prompt","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fgetting-started\u002Fprogram-dont-prompt\u002F",{"title":654,"url":655},"DSPy signatures","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fdiving-deeper\u002Fsignatures-in-depth\u002F",{"title":657,"url":658},"DSPy metrics","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fgetting-started\u002Fmetrics\u002F",{"title":660,"url":661},"DSPy Example API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Fprimitives\u002FExample\u002F",{"title":663,"url":664},"DSPy Predict API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Fmodules\u002FPredict\u002F",{"title":666,"url":667},"DSPy ChainOfThought API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Fmodules\u002FChainOfThought\u002F",{"title":669,"url":670},"DSPy ReAct API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Fmodules\u002FReAct\u002F",{"title":672,"url":673},"DSPy optimizers index","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Foptimizers\u002F",{"title":675,"url":676},"DSPy MIPROv2 API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Foptimizers\u002FMIPROv2\u002F",{"title":678,"url":679},"MIPROv2 source code","https:\u002F\u002Fgithub.com\u002Fstanfordnlp\u002Fdspy\u002Fblob\u002Fmain\u002Fdspy\u002Fteleprompt\u002Fmipro_optimizer_v2.py",{"title":681,"url":682},"DSPy BootstrapFewShot API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Foptimizers\u002FBootstrapFewShot\u002F",{"title":684,"url":685},"DSPy BootstrapFinetune API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Foptimizers\u002FBootstrapFinetune\u002F",{"title":687,"url":688},"DSPy GEPA guide","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fgetting-started\u002Fgepa-optimization\u002F",{"title":690,"url":691},"GEPA source code","https:\u002F\u002Fgithub.com\u002Fstanfordnlp\u002Fdspy\u002Fblob\u002Fmain\u002Fdspy\u002Fteleprompt\u002Fgepa\u002Fgepa.py",{"title":693,"url":694},"DSPy saving programs","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Ftutorials\u002Fsaving\u002F",{"title":696,"url":697},"DSPy caching","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Ftutorials\u002Fcache\u002F",{"title":699,"url":700},"DSPy LM API","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Fapi\u002Fmodels\u002FLM\u002F",{"title":702,"url":703},"DSPy FAQ","https:\u002F\u002Fdspy.ai\u002Fcurrent\u002Ffaqs\u002F",{"title":705,"url":706},"DSPy GitHub repository","https:\u002F\u002Fgithub.com\u002Fstanfordnlp\u002Fdspy",{"title":708,"url":709},"DSPy 3.4.0 release","https:\u002F\u002Fgithub.com\u002Fstanfordnlp\u002Fdspy\u002Freleases\u002Ftag\u002F3.4.0",{"title":711,"url":712},"DSPy paper, arXiv","https:\u002F\u002Farxiv.org\u002Fabs\u002F2310.03714",{"title":714,"url":715},"MIPRO paper, arXiv","https:\u002F\u002Farxiv.org\u002Fabs\u002F2406.11695",{"title":717,"url":718},"GEPA paper, arXiv","https:\u002F\u002Farxiv.org\u002Fabs\u002F2507.19457","\u002Fimages\u002Fblog\u002Fdspy\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fdspy\u002Fog.jpg",[80,81,82],"DSPy-kritika: promptok metrikához igazítva, nem kézzel","A DSPy aláírásokból, metrikából és példákból állítja elő a promptokat. Mennyibe kerül az optimalizálás modellhívásokban, és mikor éri meg a kézi prompt helyett.","Borítókép a DSPy-kritikához: egy aláírás és egy metrika egy optimalizálóba fut, amely mentett programot fordít.","MIT · free, you pay the model API","Prompt optimisation framework",{"slug":728,"published":5,"minutes":729,"category":7,"tags":730,"keywords":736,"about":744,"sources":756,"cover":826,"og":827,"expertise":78,"locales":828,"lang":82,"title":829,"description":830,"coverAlt":831,"url":768,"pricing":832,"kind":731},"opik",7,[731,732,733,734,735],"LLM observability","Tracing","Evaluation","OpenTelemetry","Self-hosting",[728,737,738,739,740,741,742,743],"opik review","opik vs langfuse","opik pricing","self-hosted llm tracing","opik opentelemetry","llm as a judge metrics","opik guardrails",[745,748,750,753],{"name":746,"url":747},"Comet ML","https:\u002F\u002Fwww.comet.com",{"name":734,"url":749},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":751,"url":752},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",{"name":754,"url":755},"Apache License","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FApache_License",[757,760,763,766,769,772,775,778,781,784,787,790,793,796,799,802,805,808,811,814,817,820,823],{"title":758,"url":759},"Opik repository README on GitHub","https:\u002F\u002Fgithub.com\u002Fcomet-ml\u002Fopik",{"title":761,"url":762},"Opik LICENSE file: Apache License 2.0","https:\u002F\u002Fgithub.com\u002Fcomet-ml\u002Fopik\u002Fblob\u002Fmain\u002FLICENSE",{"title":764,"url":765},"Opik on PyPI: package metadata","https:\u002F\u002Fpypi.org\u002Fpypi\u002Fopik\u002Fjson",{"title":767,"url":768},"Opik product page","https:\u002F\u002Fwww.comet.com\u002Fsite\u002Fproducts\u002Fopik\u002F",{"title":770,"url":771},"Opik pricing","https:\u002F\u002Fwww.comet.com\u002Fsite\u002Fpricing\u002F",{"title":773,"url":774},"Opik docs: run locally with Docker Compose","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fself-host\u002Flocal_deployment",{"title":776,"url":777},"Opik docs: Kubernetes deployment with Helm","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fself-host\u002Fkubernetes",{"title":779,"url":780},"Opik docs: platform architecture","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fself-host\u002Farchitecture",{"title":782,"url":783},"Opik docs: tracing getting started","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Ftracing\u002Fgetting-started",{"title":785,"url":786},"Opik docs: OpenTelemetry integration","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fintegrations\u002Fopentelemetry",{"title":788,"url":789},"Opik docs: evaluation metrics overview","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fevaluation\u002Fmetrics\u002Foverview",{"title":791,"url":792},"Opik docs: online evaluation rules","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fproduction\u002Fonline-evaluation\u002Frules",{"title":794,"url":795},"Opik docs: Prompt Library overview","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fdevelopment\u002Fprompt-library\u002Foverview",{"title":797,"url":798},"Opik docs: optimisation algorithms","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fdevelopment\u002Foptimization-runs\u002Falgorithms\u002Foverview",{"title":800,"url":801},"Opik docs: guardrails overview","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fguardrails\u002Foverview",{"title":803,"url":804},"Opik docs: guardrails server","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fguardrails\u002Fserver",{"title":806,"url":807},"Opik docs: SDK anonymizers","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fproduction\u002Fgateway-guardrails\u002Fanonymizers",{"title":809,"url":810},"Opik docs: data anonymization","https:\u002F\u002Fwww.comet.com\u002Fdocs\u002Fopik\u002Fadministration\u002Fdata_anonymization",{"title":812,"url":813},"Comet ML privacy policy","https:\u002F\u002Fwww.comet.com\u002Fsite\u002Fprivacy-policy\u002F",{"title":815,"url":816},"Comet Trust Center","https:\u002F\u002Ftrust.comet.com\u002F",{"title":818,"url":819},"Langfuse repository README (licence)","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse",{"title":821,"url":822},"Arize Phoenix repository README (licence)","https:\u002F\u002Fgithub.com\u002FArize-ai\u002Fphoenix",{"title":824,"url":825},"LangChain pricing (LangSmith plans)","https:\u002F\u002Fwww.langchain.com\u002Fpricing","\u002Fimages\u002Fblog\u002Fopik\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopik\u002Fog.jpg",[80,81,82],"Opik teszt: nyílt forrású nyomkövetés és értékelés, amerikai felhővel","Nyomok, judge-metrikák, promptverziók és optimalizáló egy Apache 2.0 platformon. Saját szerveren ingyen, a Pro felhő havi 19 dollár, az USA-ban hosztolt.","Borítókép az Opik-teszthez: egy nyom az alkalmazásból a backendbe jut, onnan egy judge-hoz és egy pontszám-kapuhoz.","Apache 2.0 · free to self-host · Pro cloud from $19 a month",{"slug":834,"published":835,"minutes":836,"category":7,"tags":837,"keywords":840,"about":847,"sources":851,"cover":869,"og":870,"expertise":78,"locales":871,"lang":82,"title":872,"description":873,"coverAlt":874,"url":875,"pricing":876,"kind":87},"ollama","2026-09-29",11,[12,838,9,10,839],"Open models","Model serving",[834,841,842,843,844,845,846],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[848],{"name":849,"url":850},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[852,855,857,860,863,866],{"title":853,"url":854},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":856,"url":60},"Ollama on GitHub, with the MIT LICENSE file",{"title":858,"url":859},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":861,"url":862},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":864,"url":865},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":867,"url":868},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg",[80,81,82],"Ollama teszt: a barátságos út a nyílt modellekhez","Az Ollama egyetlen HTTP API-n szolgál ki nyílt modelleket saját hardveren. Ami jól megy, hol elmarad az átvitel, és mit nem fed le az MIT-licenc.","Borítókép az Ollama teszthez: egy kérés a 11434-es porton átmegy az ütemezőn és a motoron, és streamelt tokeneket ad vissza; alatta a modell betöltése és az üresjáratban történő kirakása.","https:\u002F\u002Follama.com","MIT · free for personal use",1791636875781]