[{"data":1,"prerenderedAt":701},["ShallowReactive",2],{"tool-ollama-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":21,"sources":25,"cover":44,"og":45,"expertise":46,"locales":47,"lang":50,"title":51,"description":52,"coverAlt":53,"url":54,"pricing":55,"kind":56,"metaTitle":57,"takeaways":58,"faq":64,"toc":77,"blocks":102,"others":458},"ollama","2026-09-29",11,"llmops",[9,10,11,12,13],"Local inference","Open models","llama.cpp","GGUF","Model serving",[4,15,16,17,18,19,20],"ollama vs lm studio","ollama vs vllm","local llm runtime","gguf model server","ollama self hosting","ollama api",[22],{"name":23,"url":24},"Ollama (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOllama",[26,29,32,35,38,41],{"title":27,"url":28},"Ollama API documentation","https:\u002F\u002Fdocs.ollama.com\u002Fapi",{"title":30,"url":31},"Ollama on GitHub, with the MIT LICENSE file","https:\u002F\u002Fgithub.com\u002Follama\u002Follama",{"title":33,"url":34},"Ollama terms of service, last updated May 2026","https:\u002F\u002Follama.com\u002Fterms",{"title":36,"url":37},"Ollama pricing, cloud plans and per-token model rates","https:\u002F\u002Follama.com\u002Fpricing",{"title":39,"url":40},"Hardware support: Nvidia, AMD, Metal and Vulkan","https:\u002F\u002Fdocs.ollama.com\u002Fgpu",{"title":42,"url":43},"OpenAI compatibility, including what is not supported","https:\u002F\u002Fdocs.ollama.com\u002Fapi\u002Fopenai-compatibility","\u002Fimages\u002Fblog\u002Follama\u002Fcover.webp","\u002Fimages\u002Fblog\u002Follama\u002Fog.jpg","ai-engineer",[48,49,50],"en","de","hu","Ollama teszt: a barátságos út a nyílt modellekhez","Az Ollama egyetlen HTTP API-n szolgál ki nyílt modelleket saját hardveren. Ami jól megy, hol elmarad az átvitel, és mit nem fed le az MIT-licenc.","Absztrakt borítókép az Ollama teszthez","https:\u002F\u002Follama.com","MIT · free for personal use","Local inference runtime","Ollama teszt: barátságos helyi futtató · Balázs Csorba",[59,60,61,62,63],"Az Ollama saját szoftvere MIT-licencelt, használati korlátozás és felhasználói küszöb nélkül; a neki tulajdonított 700 millió havi aktív felhasználói határ a Meta Llama Community Licence-éhez tartozik, és a súlyokra vonatkozik, nem a futtatókörnyezetre.","A párhuzamos kérések megosztják a kontextusablakot ahelyett, hogy batchelt szekvenciákat kapnának, így a memória az OLLAMA_NUM_PARALLEL és a kontextushossz szorzataként nő, az alapértelmezett párhuzamosság pedig egy.","A 11434-es porton futó kiszolgálónak nincs hitelesítése, és az OpenAI-kompatibilis végpont figyelmen kívül hagyja a kért kulcsot; alapértelmezés szerint loopbackre köt, és ott is kell maradnia.","Az Ollama Cloud a futtatókörnyezet mellett futó fizetős tokenalapú szolgáltatás, a Pro havi $20 $60 kredit mellett, miközben a saját hardveren végzett helyi inferencia korlátlan és ingyenes marad.","A megfelelő eszköz fejlesztéshez, értékeléshez és egycsomópontos on-prem használathoz, és a hibás, amint az egy GPU-ra jutó átvitel dönt a projektről.",[65,68,71,74],{"q":66,"a":67},"Valóban MIT-licencelt az Ollama, vagy van használati határ?","A szoftver MIT-licencelt kiegészítő záradek nélkül, tehát nincs felhasználói küszöb és nincs OpenAI-korlátozás. Az a 700 millió havi aktív felhasználói záradek, amelyet gyakran az Ollamához tulajdonítanak, a Meta Llama Community Licence-ből származik, és a letöltött Llama súlyokra vonatkozik, nem a kiszolgáló futtatókörnyezetre. Az ollama.com hozzáférését külön a felhasználási feltételek szabályozzák, utoljára 2026 májusában frissítve.",{"q":69,"a":70},"Kell-e API-kulcs az Ollamához?","Helyi kiszolgálóhoz nem. A helyi példánynak egyáltalán nincs hitelesítése, és az OpenAI-kompatibilis végpont is megköveteli a kulcs értékét, majd figyelmen kívül hagyja, szóval bármilyen helykitöltő megfelel. A https:\u002F\u002Follama.com felhős kérésehez kell kulcs, és az ollama signin paranccsal bejelentkezett helyi kiszolgáló is továbbíthat a felhős modellekhez.",{"q":72,"a":73},"Hogyan szolgálok ki egyszerre egynél több kérést?","Állítsa be az OLLAMA_NUM_PARALLEL értékét, amely alapértelmezés szerint 1. A memória a párhuzamos kérések száma szorozva a kontextushosszal nő, és a kontextusablak meg van osztva közöttük, így négy párhuzamos kérés egy 2000 tokenes kontextuson úgy viselkedik, mint egy 8000 tokenes. A határon felüli kérések sorba állnak, az OLLAMA_MAX_QUEUE határáig, amely alapértelmezés szerint 512, utána 503 érkezik.",{"q":75,"a":76},"Gyorsabb az Ollama, mint a vLLM?","Nem, és nem is törekszik rá. Az Ollama modellenként egy kérést szolgál ki alapértelmezés szerint, a párhuzamos kéréseket közös kontextusba batchingeli független helyett, és nincs több csomópontos párhuzamossága. Interaktív használatnál néhány egyidejű hívóval a különbség kicsi; batch átvitelben GPU-nként ez az egész döntés.",[78,81,84,87,90,93,96,99],{"id":79,"title":80},"what-it-is","Mi ez valójában",{"id":82,"title":83},"how-it-works","Hogyan működik",{"id":85,"title":86},"getting-started","Első lépések",{"id":88,"title":89},"licence","A licenc – és a záradek, ami nincs benne",{"id":91,"title":92},"production","Üzemeltetés productionben",{"id":94,"title":95},"where-it-shingles","Hol csúszik meg",{"id":97,"title":98},"verdict","Ítélet",{"id":100,"title":101},"sources","Források",[103,107,110,113,116,156,157,160,169,172,173,176,179,182,211,212,215,218,235,240,241,244,313,316,326,331,332,335,397,400,403,404,407,432,436,437],{"type":104,"content":105},"paragraph",[106],"Az Ollama helyi futtatókörnyezet. Letölti a nyílt súlyú modelleket, elhelyezi a rendelkezésre álló GPU-n vagy CPU-n, és egyetlen HTTP API-n keresztül szolgálja ki őket a 11434-es porton. A gyártó havi kilencmilliónál több telepítést, egymilliárdnál több modellletöltést és 182 000 GitHub-csillagot jelent – és ez a hatóereje megmagyarázható: ez a legkevesebb húzással járó út, hogy egy nyílt modell válaszoljon. A csere ugyanebben a számokban van. Az Ollama egy modell elindítására optimalizál, nem egy GPU-ből kinyerhető tokenekre, és aki termelési inferenciakiszolgálónak tekinti, az ezt meg fogja érezni.",{"type":104,"content":108},[109],"A stackben modellkiszolgáló, nem keretrendszer. Helyettesíti a llama.cpp saját szerverét, az LM Studio futtatókörnyezetét és egy kézzel összerakott Docker image-et – és a vLLM-mel csak a lehető leglazább értelemben verseng. fölötte LangChain, LlamaIndex, a kódoló ügynökök és a saját hosztolású csevegőfelületek találhatók; az, hogy Ollama mindegyikkel felcserélhető, az API-jának alakjából ered, nem abból, ami a belsejében történik. Amit nem nyújt: orkestrálás, folyamatos batching, autoskálázás vagy több csomópontos tenzorparalellizmus. Azok továbbra is a vLLM vagy az SGLang területe.",{"type":111,"level":112,"id":79,"text":80},"heading",2,{"type":104,"content":114},[115],"Az Ollama egy Go nyelvű szerver egy beépített modellkezelővel, nem maga a modell. Egyetlen binárisfájlként, egy CLI-vel és egy Docker image-ként érkezik, és a CLI az a teljes felület, amelyet az emberek többsége valaha érint. Az alatta futó engine-ek a llama.cpp CUDA, ROCm, Vulkan és CPU módokra, valamint – a v0.40.0 óta – az MLX Apple Siliconon alapértelmezés szerint a támogatott architektúrákra. minden más ezek köré csomagolás, és pont ezért érdemes tudni, hol húzódik a határ.",{"type":117,"ordered":118,"items":119},"list",false,[120,126,131,136,141,146,151],[121,125],{"tag":122,"children":123},"strong",[124],"Licenc:"," MIT a szoftverre, használati korlátozás, felhasználói küszöb és kiegészítő záradek nélkül.",[127,130],{"tag":122,"children":128},[129],"Jelenlegi kiadás:"," v0.40.0, platformbinárisokkal és Docker image-mel. A tempó gyors, de a számok ugranak: a v0.34.4 után jött a v0.35.1, majd egyenesen a v0.40.0.",[132,135],{"tag":122,"children":133},[134],"API-k:"," natív REST felület az \u002Fapi alatt, OpenAI-kompatibilis felület a \u002Fv1 alatt és Anthropic-kompatibilis alap-URL, a helyi kiszolgálón és az Ollama Cloudon egyaránt.",[137,140],{"tag":122,"children":138},[139],"Engine-ek:"," llama.cpp CUDA, ROCm, Vulkan és CPU módokra, plusz MLX Apple Siliconon a v0.40.0-tól. Az Nvidia 5.0 vagy újabb compute capabilityt, az AMD Linuxon ROCm v7 illesztőprogramot igényel.",[142,145],{"tag":122,"children":143},[144],"Modellformátum:"," GGUF a llama.cpp modellekhez, safetensors az MLX-hez. A v0.34.1 óta a GGUF-konverziót llama.cpp eszközökkel kell elvégezni, nem Ollamán belül.",[147,150],{"tag":122,"children":148},[149],"Testreszabás:"," egy Modelfile FROM, PARAMETER, TEMPLATE, SYSTEM, MESSAGE, LICENSE, REQUIRES és CAPABILITY kulcsokkal, így egy finomított modell átnézhető szövegfájl.",[152,155],{"tag":122,"children":153},[154],"A csomagban továbbá:"," strukturált kimenet JSON-sémához, eszközhívás, látvány, beágyazások, webes keresés, kísérleti képgenerálás macOS-en, illetve döntési modellek, amelyek szöveg helyett valószínűségeket adnak vissza.",{"type":111,"level":112,"id":82,"text":83},{"type":104,"content":158},[159],"A középpontban egy HTTP-kiszolgáló áll, amely egy modellkönyvtárat és VRAM-tudatos ütemezőt birtokol. A kérés megnevez egy modell-címkét; ha a súlyok még nincsenek betöltve, a kiszolgáló betölti őket, ha pedig nem férnek a már betöltött mellé, a kérés sorba áll, miközben egy üresen álló modell kilép. A betöltött modellek az utolsó kérés után öt percen át maradnak bent, a kontextushosszt a gép VRAM-osztálya határozza meg, és az egy modellre érkező párhuzamos kérések megosztják annak kontextusát, ahelyett hogy mindegyik sajátot kapna.",{"type":161,"attrs":162,"inner":166,"caption":167},"diagram",{"viewBox":163,"role":164,"aria-labelledby":165},"0 0 720 250","img","ol-út-t ol-út-d","\u003Ctitle id=\"ol-út-t\">Egy kérés útjának végigvezetése az Ollama kiszolgálón\u003C\u002Ftitle>\u003Cdesc id=\"ol-út-d\">Egy kérés érkezik az \u002Fapi\u002Fchat végpontra egy modell-címkét megnevezve. Az ütemező ellenőrzi a jelentett VRAM-ot. Ha a súlyok már bent vannak, a generálás azonnal indul; egyébként a kérés sorba áll, a súlyok betöltődnek a VRAM-ba, és a kérés újrapróbálkozik. A generálás után a modell a keep_alive ablakban üresen áll, alapértelmezés szerint öt percig, majd kilép, és a VRAM-ja felszabadul.\u003C\u002Fdesc>\u003Cdefs>\u003Cmarker id=\"ah-ol\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head\" \u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Crect x=\"20\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"95\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">request\u003C\u002Ftext>\u003Ctext x=\"95\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">POST \u002Fapi\u002Fchat\u003C\u002Ftext>\u003Crect x=\"195\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"270\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">scheduler\u003C\u002Ftext>\u003Ctext x=\"270\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">reads VRAM\u003C\u002Ftext>\u003Crect x=\"370\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-mint\" \u002F>\u003Ctext x=\"445\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">engine\u003C\u002Ftext>\u003Ctext x=\"445\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">ggml or MLX\u003C\u002Ftext>\u003Crect x=\"545\" y=\"50\" width=\"150\" height=\"64\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"620\" y=\"78\" text-anchor=\"middle\" class=\"d-text\">tokens\u003C\u002Ftext>\u003Ctext x=\"620\" y=\"98\" text-anchor=\"middle\" class=\"d-small\">streamed NDJSON\u003C\u002Ftext>\u003Crect x=\"20\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"95\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">queue\u003C\u002Ftext>\u003Ctext x=\"95\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">MAX_QUEUE\u003C\u002Ftext>\u003Crect x=\"195\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"270\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">load weights\u003C\u002Ftext>\u003Ctext x=\"270\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">then retry\u003C\u002Ftext>\u003Crect x=\"370\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"445\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">idle\u003C\u002Ftext>\u003Ctext x=\"445\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">keep_alive\u003C\u002Ftext>\u003Crect x=\"545\" y=\"170\" width=\"150\" height=\"60\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"620\" y=\"196\" text-anchor=\"middle\" class=\"d-text\">unload\u003C\u002Ftext>\u003Ctext x=\"620\" y=\"215\" text-anchor=\"middle\" class=\"d-small\">VRAM released\u003C\u002Ftext>\u003Cpath d=\"M170 82H193\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M345 82H368\" class=\"d-line-accent\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M520 82H543\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M270 116V142H95V168\" class=\"d-line d-dash\" marker-end=\"url(#ah-ol)\" \u002F>\u003Ctext x=\"182\" y=\"138\" text-anchor=\"middle\" class=\"d-label\">no free VRAM\u003C\u002Ftext>\u003Cpath d=\"M170 200H193\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M345 200H445V120\" class=\"d-line-accent\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M445 116V168\" class=\"d-line d-dash\" marker-end=\"url(#ah-ol)\" \u002F>\u003Ctext x=\"455\" y=\"146\" class=\"d-label\">5 min\u003C\u002Ftext>\u003Cpath d=\"M520 200H543\" class=\"d-line\" marker-end=\"url(#ah-ol)\" \u002F>\u003Cpath d=\"M620 116V168\" class=\"d-line d-dash\" marker-end=\"url(#ah-ol)\" \u002F>",[168],"Egy kérés teljes életciklusa: egy VRAM-ellenőrzés, azonnali indítás, ha a súlyok bent vannak, különben várakozás és betöltés, majd egy üresjárási ablak, amely a kilépéssel zárul.",{"type":104,"content":170},[171],"Ennek a kialakításnak van egy következménye, amely meglep: a modell az ütemezés és a költség egysége. A címke váltása terhelés alatt egy betöltést, egy VRAM-ellenőrzést jelent, és egyetlen GPU-s gépen akár azt is, hogy kilép az, ami épp mindenkinek válaszolt. Az Ollama válasza az OLLAMA_MAX_LOADED_MODELS és az OLLAMA_NUM_PARALLEL, és mindkettőt memóriával fizetjük, nem számítási kapacitással.",{"type":111,"level":112,"id":85,"text":86},{"type":104,"content":174},[175],"A telepítés egy shell-szkript, egy asztali alkalmazás vagy egy Docker image. Az API egyetlen POST, és a helyi kiszolgálóhoz sem kulcs, sem konfigurációs fájl nem kell. Az alábbi részlet a legkisebb, amit productionben érdemes leírni: egy streamelt hívás explicit kontextusablakkal, egy hívások között rezidensen tartott modellel, és azokkal az időzítési mezőkkel, amelyeket a kiszolgáló eleve kiszámít.",{"type":177,"code":178},"code","import json, urllib.request, time\n\nURL = \"http:\u002F\u002Flocalhost:11434\u002Fapi\u002Fchat\"\nBODY = {\n    \"model\": \"gemma4\",\n    \"messages\": [{\"role\": \"user\", \"content\": \"Summarise this ticket in one line.\"}],\n    \"stream\": True,\n    \"keep_alive\": \"30m\",              # keep the weights resident between calls\n    \"options\": {\"num_ctx\": 8192, \"temperature\": 0},\n}\n\nrequest = urllib.request.Request(\n    URL, data=json.dumps(BODY).encode(), headers={\"Content-Type\": \"application\u002Fjson\"})\n\nchunks = []\nwith urllib.request.urlopen(request) as response:\n    for line in response:                       # newline-delimited JSON events\n        event = json.loads(line)\n        if \"message\" in event:\n            chunks.append(event[\"message\"].get(\"content\", \"\"))\n        if event.get(\"done\"):\n            seconds = event[\"eval_duration\"] \u002F 1e9   # nanoseconds\n            print(f\"{event['eval_count']} tokens in {seconds:.1f}s\"\n                  f\" -> {event['eval_count'] \u002F seconds:.1f} tok\u002Fs\")\n            print(f\"prompt tokens {event['prompt_eval_count']}, cached\"\n                  f\" {event.get('prompt_eval_cached_count', 0)},\"\n                  f\" load {event['load_duration'] \u002F 1e9:.1f}s\")\n\nprint(\"\".join(chunks))",{"type":104,"content":180},[181],"Két mezőt érdemes egy dashboardra kötni: az eval_count és az eval_duration hányadosát a generálási sebességhez, a load_duration értékét a hidegindítási büntetéshez. A prompt_eval_cached_count jelzi, hány prompt-token jött a gyorsítótárból – ez az Ollama egyetlen ingyenes gyorsítása. A prompt stabil prefixét tegye előre, a változó részt hátra, és a közös rendszerprompt nem értékelődik ki újra minden hívásnál.",{"type":183,"variant":184,"body":185},"callout","tip",[186],[187,188,190,191,194,195,198,199,202,203,206,207,210],"Ha a hívó kód már beszél az OpenAI-val, állítsa a base_url értékét http:\u002F\u002Flocalhost:11434\u002Fv1\u002F címre, és hagyja a kulcsot ",{"tag":177,"children":189},[4]," értéken – a kiszolgáló figyelmen kívül hagyja. A kompatibilis felület lefedi a chatet, a streaminget, a JSON-módot, az eszközöket és a látványt, de nem a logprobs-ot, a ",{"tag":177,"children":192},[193],"tool_choice"," mezőt, a ",{"tag":177,"children":196},[197],"logit_bias"," mezőt vagy a kép-URL-eket. A natív ",{"tag":177,"children":200},[201],"\u002Fapi\u002Fchat"," végpont jóval régebben hordoz ",{"tag":177,"children":204},[205],"logprobs"," és ",{"tag":177,"children":208},[209],"top_logprobs"," értéket, és ez az oka, hogy ezt kell előnyben részesíteni, amikor a tokenvalószínűségek számítanak.",{"type":111,"level":112,"id":88,"text":89},{"type":104,"content":213},[214],"Az Ollama szoftvere MIT-licencelt, minden további nélkül. Az ollama\u002Follama repository LICENSE fájlja a módosítatlan MIT-szöveg: nincs kiegészítő záradek, nincs felhasználói küszöb, nincs használati korlátozás. Nincs benne OpenAI-záradek, és nincs benne 700 millió havi aktív felhasználói határ sem – és ezt érdemes is kimondani, mert az állítás széles körben elterjedt. A 700 milliós küszöb a Meta Llama Community Licence-éhez tartozik, és a Llama súlyokra vonatkozik, nem arra a futtatókörnyezetre, amely kiszolgálja őket. Az Ollama fizetett felhőcsomagokból is bevételt szerez, és 2026 júliusában 65 millió dolláros befektetési kört is kapott, és egyik sem tesz záradékot a forráslicencbe.",{"type":104,"content":216},[217],"Az MIT-engedély a szerver bináris fájljára vonatkozik. Arról, hogy milyen modelleket futtatnak rajta, semmit nem mond, és épp itt van a valódi licenckitettség. A könyvtár egy tucat kiadótól származó súlyokat szolgál ki egy tucat feltétellel – a kötő erejű licenc a modellkártyán áll, nem a futtatókörnyezeten. Egy Modelfile a súlyok mellett egy LICENSE utasítást is tárol, és az ollama show --modelfile kiírja – ez a karakterlánc, modellverenként, az aartefaktum, amelyet a megfelelési nyilvántartásban kell tartani.",{"type":117,"ordered":118,"items":219},[220,225,230],[221,224],{"tag":122,"children":222},[223],"MIT a futtatókörnyezeten. ","Használható üzleti célra, forkolható, beágyazható egy termékbe. A szerzői jogi megjegyzés megtartásán túl nincs megnevezési kötelezettség, nincs bevételi küszöb, nincs felhasználói küszöb, nincs telemetriai kötelezettség.",[226,229],{"tag":122,"children":227},[228],"A modelllicenc különálló. ","A Meta Llama Community Licence 700 millió havi aktív felhasználó felett külön licencet kér a Metától, más családok saját bevételi vagy felhasználói plafont írnak elő. Egyes modellek nem kereskedelmi feltételekkel érkeznek. Olvassa el a modellkártyát.",[231,234],{"tag":122,"children":232},[233],"Az ollama.com maga nem MIT. ","A hosztolt felhő, a könyvtárfiókok és a fizetős csomagok a Felhasználási feltételek hatálya alá tartoznak, utoljára 2026 májusában frissítve: kötelező arbitráció San Franciscóban, kaliforniai jog, felelősségi korlát az előző tizenkét hónapban fizetett összegek mértékéig, valamint egy záradek, amely megtiltja a szolgáltatás használatát versenytárs termékek fejlesztésére.",{"type":183,"variant":236,"body":237},"warn",[238],[239],"A pull valaki másik regiszteréből való letöltés a saját lemezére, és az a regiszter nem tartozik az MIT-engedély hatókörébe. A modelljóváhagyási folyamattal működő csapatok tükrözzék a tényleg használt GGUF-fájlokat olyan regiszterbe, amelyet maguk felügyelnek, mert egy címke változó név, és az ollama pull követi. Rögzítse a verziót, jegyezze fel a licencet, és tartsa meg a szállított fájl lenyomatát.",{"type":111,"level":112,"id":91,"text":92},{"type":104,"content":242},[243],"A párhuzamosság az a pont, ahol a helyi futtatókörnyezetek őszinték a korlátaikról. Az Ollama modellenként egy kérést dolgoz fel alapértelmezés szerint, és a párhuzamos kérések megosztják a kontextust ahelyett, hogy függetlenül batchingelnének: ezt a dokumentáció ki is mondja, egy 2000 tokenes kontextus négy párhuzamos kéréssel úgy viselkedik, mint egy 8000 tokenes, és a szükséges RAM párhuzamos kérések száma szorozva a kontextushosszal nő. Ez interaktív használatra meglevő csere, batch munkára rossz.",{"type":245,"head":246,"rows":253},"table",[247,249,251],[248],"Beállítás",[250],"Alapérték",[252],"Mibe kerül",[254,265,274,285,302],[255,259,263],[256],{"tag":177,"children":257},[258],"OLLAMA_NUM_PARALLEL",[260],{"tag":177,"children":261},[262],"1",[264],"a RAM lineárisan nő; egy közös kontextus",[266,270,272],[267],{"tag":177,"children":268},[269],"OLLAMA_MAX_LOADED_MODELS",[271],"3 GPU-nként, 3 CPU-n",[273],"a teljes VRAM minden rezidens modellhez",[275,279,283],[276],{"tag":177,"children":277},[278],"OLLAMA_MAX_QUEUE",[280],{"tag":177,"children":281},[282],"512",[284],"a sor mélysége, mielőtt a kérések 503-at kapnak",[286,290,292],[287],{"tag":177,"children":288},[289],"OLLAMA_KEEP_ALIVE",[291],"5 perc",[293,294,297,298,301],"a VRAM üresen is foglalva; ",{"tag":177,"children":295},[296],"-1"," rögzíti, ",{"tag":177,"children":299},[300],"0"," azonnal kiléptet",[303,307,311],[304],{"tag":177,"children":305},[306],"OLLAMA_KV_CACHE_TYPE",[308],{"tag":177,"children":309},[310],"f16",[312],"a q8_0 felezi, a q4_0 negyedeli, pontosságvesztéssel",{"type":104,"content":314},[315],"A kiszolgálónak nincs hitelesítése. Alapértelmezés szerint a 127.0.0.1 címre köt, és az OpenAI-kompatibilis végpont megköveteli az API-kulcs értékét, majd figyelmen kívül hagyja – ez pontosan kimondja, mennyire bízik a helyi felület. Ami az OLLAMA_HOST értékét útvonalozható címre állítja, hitelesítés nélküli inferenciavégpontot tesz közzé. 2026 januárjában kutatók mintegy 175 000 nyilvánosan elérhető Ollama-kiszolgálóról számoltak be 130 országból, ezek többsége a 0.0.0.0 címre kötés miatt volt kitett.",{"type":117,"ordered":118,"items":317},[318,320,322,324],[319],"Hagyja a kötési címet a 127.0.0.1 címen. Nincs konfigurálható hitelesítés, így az egyetlen elérhető hozzáférés-szabályozás a TLS-t használó visszaforduló proxy valódi hozzáférési ellenőrzéssel.",[321],"Állítsa be az OLLAMA_ORIGINS értékét, ha böngészős kliens kell hozzá. A loopback eredetek alapértelmezés szerint engedélyezettek, tehát a helyi eszközökhöz jó az alapérték, a megosztott használathoz rossz.",[323],"Azokon a gépeken, amelyek egyáltalán nem érhetik el az ollama.com-ot, állítsa be az OLLAMA_NO_CLOUD=1 értéket vagy a disable_ollama_cloud mezőt a ~\u002F.ollama\u002Fserver.json fájlban, indítsa újra, és ellenőrizze az Ollama cloud disabled: true naplósort.",[325],"Tartsa szem előtt, hogy az asztali alkalmazás macOS-en és Windowson belépési elemként regisztrálja magát, tehát a 11434-es port már rendszerindításkor szolgál, függetlenül attól, kérte-e valaki.",{"type":183,"variant":327,"body":328},"note",[329],[330],"Az Ollama Cloud más termék, mint a helyi futtatókörnyezet, és az árazási oldal jóval meghaladta az ingyenes szintet. A felhős modellek usage-kreditből, millió tokenenként számolnak – a gemma4-nál $0,14 bemenet és $0,40 kimenet, a gpt-oss:20b-nál $0,07 és $0,30 –, csúcsidőn kívüli árakkal a hétköznapokon 12:00 és 18:00 UTC közötti időn kívül, valamint a hétvégén egész nap. A Pro havi $20, $60 kreditet és három párhuzamos kérést tartalmaz, a Max $100, $300 és tíz kérést, a Team korai hozzáféréssel $500, a saját hardveren futó modellek pedig minden csomagban korlátlanul és ingyen futnak.",{"type":111,"level":112,"id":94,"text":95},{"type":104,"content":333},[334],"A gyengeségei valósak, és egy helyen csoportosulnak: az egy GPU-ra jutó átviteli sebesség. Alapértelmezés szerint egy kérés modellenként, nincs a párhuzamos kérések független batchingje, nincs több csomópontos párhuzamosság és nincs tenzorparalell kiszolgálási út. Egy interaktív végpontnál néhány felhasználóval ez láthatatlan. Bármihez, aminek van sora, batch feladata vagy költségcélja, már nem: ugyanaz a GPU a vLLM eredményének töredékét adja ugyanazzal a modellel, és ez a rés nem konfigurációs probléma. Ez a design.",{"type":245,"head":336,"rows":345},[337,339,341,343],[338],"",[340],"Ollama",[342],"vLLM",[344],"llama.cpp szerver",[346,355,363,371,380,389],[347,349,351,353],[348],"Telepítés",[350],"szkript, app, image",[352],"pip, konténer",[354],"bináris vagy build",[356,358,360,362],[357],"Átvitel GPU-nként",[359],"alacsony-tól közepesig",[361],"magas",[359],[364,366,368,370],[365],"Független batching",[367],"nem",[369],"igen",[367],[372,374,376,378],[373],"Hardverlefedettség",[375],"CUDA, ROCm, Vulkan, Metal, CPU",[377],"CUDA, ROCm",[379],"CUDA, Vulkan, Metal, CPU",[381,383,385,387],[382],"Üzemeltetési felület",[384],"egy kiszolgáló, env-változók",[386],"flagek, metrikák, fürt",[388],"egy bináris, flagek",[390,392,394,396],[391],"Licenc",[393],"MIT",[395],"Apache 2.0",[393],{"type":104,"content":398},[399],"Az LM Studio-hoz képesti összehasonlítás szoros, és valójában csomagolási kérdés: az LM Studióban van GUI és modellböngésző, az Ollamában CLI, Docker image és első osztályú headless használat, és az Ollama API-alakja körül nőtt fel az Open WebUI ökoszisztémája. A llama.cpp saját szerveréhez képest a különbség a modellkezelő és az ütemező, ami egy csapatnak sokat ér, annak aki már ismeri a llama.cpp-t semmit. A vLLM-hez képest a különbség maga az üzleti érvelés: ha a kérdés az, hogyan szolgáljuk ki ezt kiszámítható költséggel, akkor a vLLM vagy az SGLang az eszköz, az Ollama pedig az a fejlesztői környezet, amelyben prototípus készül.",{"type":104,"content":401},[402],"A másik mérlegelendő szempont az irány. Az Ollama Cloud ma Pro, Max és Team csomagokat, tokenenkénti modellárazást és vállalatoknak szánt modell-hozzáférés-szabályozást kínál, vagyis a projekt a futtatókörnyezet mellett kereskedelmi inferenciaszolgáltató is. Ez finanszírozza a kiadási tempót, és nem minőségi észrevétel. De azt jelenti, hogy a súlypont eltolódik attól, hogy egy modellt a saját gépén futtat, afelé, hogy bejelentkezik és egy nagyobbat használ – és az a csapat, amely a helyi inferenciára támaszkodik, birtokolja a verziót, a modell-pin-eket és az artefaktumokat, ne pedig feltételezze, hogy a felület marad, ahol van.",{"type":111,"level":112,"id":97,"text":98},{"type":104,"content":405},[406],"Az Ollama a legjobb alapértelmezett válasz arra, hogyan futtassunk egy nyílt modellt anélkül, hogy fel kellene vennünk valakit, aki a llama.cpp-t üzemelteti. MIT-licencelt, egyetlen parancsból indul, az API-ja az a kompatibilitási réteg, amelyet szinte minden ügynökkeretrendszer már beszél, és két környezeti változó mögé rejt egy hatalmas mennyiségű GPU-ütemezést. Ami nem, az egy skálázható inferenciaplatforma – és amikor egy kéréssor megjelenik egy dashboardon, ez a jelzése annak, hogy válts, ne hogy hangolj.",{"type":117,"ordered":408,"items":409},true,[410,415,419,423,428],[411,414],{"tag":122,"children":412},[413],"Használja ","helyi fejlesztéshez, értékelési tesztkörnyezetekhez, CI fixture-ökhöz, olyan on-prem telepítésekhez, ahol néhányan osztoznak egy munkaállomáson, és olyan munkaterhelésekhez, ahol a promptoknak nem szabad elhagyniuk az épületet.",[416,418],{"tag":122,"children":417},[413],"helyi vagy saját hosztolású végpont bekötéséhez egy ügynökkeretrendszerbe, mert az OpenAI-kompatibilis felület feleslegessé teszi a szolgáltató-specifikus klienst.",[420,422],{"tag":122,"children":421},[413],"arra, hogy egy csapat egy délután alatt működő nyílt modell-prototípushoz jusson. Ez valódi üzemeltetési előny, és a legtöbb felhasználó emiatt nem megy el soha.",[424,427],{"tag":122,"children":425},[426],"Ne használja ","terhelés alatti többfelhasználós kiszolgálásra, batch generálásra, vagy bármire, ahol a GPU-nkénti másodpercenkénti tokenek számítanak a projekt értékelésében.",[429,431],{"tag":122,"children":430},[426],"olyan szabályozott környezetekben, amelyek hitelesítést, auditnaplózást vagy az inferenciaréteg alatti ütemezőt igényelnek. Tegyen elé proxyt, vagy használjon másik futtatókörnyezetet.",{"type":183,"variant":327,"body":433},[434],[435],"Egy záró megjegyzés, egyenesen. A „lokálisan fut” és az „MIT-licencelt” két különböző artefaktum tulajdonsága. A futtatókörnyezet MIT-licencelt és átvizsgálható. A súlyok azok, amit a kiadó választott, a regiszter pedig saját feltételek mellett működő hosztolt szolgáltatás – és a megfelelőségi vizsgálat mindhármat külön-külön kell, hogy fedje.",{"type":111,"level":112,"id":100,"text":101},{"type":117,"ordered":408,"items":438},[439,443,446,449,452,455],[440],{"tag":441,"href":28,"children":442},"a",[27],[444],{"tag":441,"href":31,"children":445},[30],[447],{"tag":441,"href":34,"children":448},[33],[450],{"tag":441,"href":37,"children":451},[36],[453],{"tag":441,"href":40,"children":454},[39],[456],{"tag":441,"href":43,"children":457},[42],[459,542,604,647],{"slug":460,"published":461,"minutes":6,"category":7,"tags":462,"keywords":468,"about":476,"sources":483,"cover":535,"og":536,"expertise":46,"locales":537,"lang":50,"title":538,"description":539,"coverAlt":540,"url":479,"pricing":541,"kind":463},"portkey","2026-09-28",[463,464,465,466,467],"LLM gateway","Guardrails","Routing","Observability","Cost control",[469,470,471,472,473,474,475],"portkey ai gateway","portkey vs litellm","llm gateway comparison","llm gateway latency overhead","llm guardrails gateway","self-hosted llm gateway","portkey pricing",[477,480],{"name":478,"url":479},"Portkey","https:\u002F\u002Fportkey.ai",{"name":481,"url":482},"API gateway","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FAPI_gateway",[484,487,490,493,496,499,502,505,508,511,514,517,520,523,526,529,532],{"title":485,"url":486},"Portkey docs: AI Gateway","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway",{"title":488,"url":489},"Portkey docs: Getting started with the AI Gateway","https:\u002F\u002Fdocs.portkey.ai\u002Fdocs\u002Fguides\u002Fgetting-started\u002Fgetting-started-with-ai-gateway",{"title":491,"url":492},"Portkey docs: Gateway config object","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fapi-reference\u002Fconfig-object",{"title":494,"url":495},"Portkey docs: Guardrails","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails",{"title":497,"url":498},"Portkey docs: Guardrail endpoints and capabilities","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fguardrails\u002Fcapabilities",{"title":500,"url":501},"Portkey docs: Cache, simple and semantic","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fcache-simple-and-semantic",{"title":503,"url":504},"Portkey docs: Load balancing","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fproduct\u002Fai-gateway\u002Fload-balancing",{"title":506,"url":507},"Portkey docs: Enterprise hybrid deployment architecture","https:\u002F\u002Fportkey.ai\u002Fdocs\u002Fself-hosting\u002Fhybrid-deployments\u002Farchitecture",{"title":509,"url":510},"Portkey pricing","https:\u002F\u002Fportkey.ai\u002Fpricing",{"title":512,"url":513},"Portkey gateway on GitHub, MIT licensed","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fgateway",{"title":515,"url":516},"Portkey's own benchmark: gateway versus direct Bedrock","https:\u002F\u002Fgithub.com\u002FPortkey-AI\u002Fbenchmark-test",{"title":518,"url":519},"Portkey status page","https:\u002F\u002Fstatus.portkey.ai\u002F",{"title":521,"url":522},"Palo Alto Networks completes acquisition of Portkey, May 2026","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fcompany\u002Fpress\u002F2026\u002Fpalo-alto-networks-completes-acquisition-of-portkey-to-secure-ai-agents",{"title":524,"url":525},"Palo Alto Networks: Prisma AIRS AI Gateway","https:\u002F\u002Fwww.paloaltonetworks.com\u002Fai-security\u002Fai-gateway",{"title":527,"url":528},"Cloudflare AI Gateway pricing","https:\u002F\u002Fdevelopers.cloudflare.com\u002Fai-gateway\u002Freference\u002Fpricing\u002F",{"title":530,"url":531},"LiteLLM pricing","https:\u002F\u002Fwww.litellm.ai\u002Fpricing",{"title":533,"url":534},"OpenRouter pricing","https:\u002F\u002Fopenrouter.ai\u002Fpricing","\u002Fimages\u002Fblog\u002Fportkey\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fportkey\u002Fog.jpg",[48,49,50],"Portkey: éles LLM-átjáró, routing, guardrailok és költség szerint","A Portkey egy OpenAI-kompatibilis végpont mögé szorítja a retry-t, a fallbacket, a cache-t, a guardrailokat és a költségkövetést. Ami jól működik, és mi az ára késleltetésben.","A kérés útja az alkalmazástól a Portkey-átjárón át három modellszolgáltatóig, alatta a guardrail-ítélet és a naplóbejegyzés.","Free · from $49 per month",{"slug":543,"published":544,"minutes":545,"category":7,"tags":546,"keywords":552,"about":560,"sources":572,"cover":597,"og":598,"expertise":46,"locales":599,"lang":50,"title":600,"description":601,"coverAlt":602,"url":563,"pricing":603,"kind":547},"langfuse","2026-08-13",10,[547,548,549,550,551],"LLM observability","Tracing","OpenTelemetry","Self-hosting","Evaluation",[543,553,554,555,556,557,558,559],"langfuse vs langsmith","llm tracing tool","self-hosted llm observability","langfuse pricing","opentelemetry llm traces","llm cost tracking","prompt versioning",[561,564,566,569],{"name":562,"url":563},"Langfuse","https:\u002F\u002Flangfuse.com",{"name":549,"url":565},"https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenTelemetry",{"name":567,"url":568},"ClickHouse","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FClickHouse",{"name":570,"url":571},"Observability (software)","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FObservability_(software)",[573,576,579,582,585,588,591,594],{"title":574,"url":575},"Langfuse documentation: observability and application tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Foverview",{"title":577,"url":578},"Langfuse documentation: get started with tracing","https:\u002F\u002Flangfuse.com\u002Fdocs\u002Fobservability\u002Fget-started",{"title":580,"url":581},"Langfuse pricing: cloud plans, billable units and worked examples","https:\u002F\u002Flangfuse.com\u002Fpricing",{"title":583,"url":584},"Langfuse pricing: self-hosted plans and the feature comparison","https:\u002F\u002Flangfuse.com\u002Fpricing-self-host",{"title":586,"url":587},"Self-host Langfuse: deployment options, containers and storage services","https:\u002F\u002Flangfuse.com\u002Fself-hosting",{"title":589,"url":590},"Langfuse changelog: v4 is live (17 August 2026)","https:\u002F\u002Flangfuse.com\u002Fchangelog\u002F2026-08-17-langfuse-v4",{"title":592,"url":593},"Langfuse blog: Langfuse joins ClickHouse (16 January 2026)","https:\u002F\u002Flangfuse.com\u002Fblog\u002Fjoining-clickhouse",{"title":595,"url":596},"GitHub: langfuse\u002Flangfuse, the platform repository","https:\u002F\u002Fgithub.com\u002Flangfuse\u002Flangfuse","\u002Fimages\u002Fblog\u002Flangfuse\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flangfuse\u002Fog.jpg",[48,49,50],"Langfuse bemutatás: nyomkövetés, promptok és értékelések saját szerveren","A Langfuse egy MIT-licencelt platformra teszi az LLM-nyomokat, a promptverziókat és a kísérleteket. Mibe kerül a saját telepítés, hogy számol a Usage-alapú ár, és hol veszít.","Egy pipeline a kötegelt alkalmazás-eseménytől a Langfuse web konténeren és az objektumtáron át a ClickHouseig, mellette a Redis és a PostgreSQL.","MIT · paid from $59 per month",{"slug":605,"published":606,"minutes":545,"category":7,"tags":607,"keywords":612,"about":619,"sources":623,"cover":639,"og":640,"expertise":46,"locales":641,"lang":50,"title":642,"description":643,"coverAlt":644,"url":645,"pricing":646,"kind":463},"openrouter","2026-07-23",[463,608,609,610,611],"Model routing","Fallbacks","OpenAI-compatible","Pay per token",[605,613,471,614,615,616,617,618],"openrouter vs litellm","openrouter pricing","openai compatible api gateway","llm fallback routing","multi model api gateway","byok llm routing",[620],{"name":621,"url":622},"OpenRouter","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FOpenRouter",[624,627,628,631,634,637],{"title":625,"url":626},"OpenRouter documentation: quickstart","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fquickstart",{"title":533,"url":534},{"title":629,"url":630},"OpenRouter documentation: model fallbacks","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fmodel-fallbacks",{"title":632,"url":633},"OpenRouter documentation: provider routing","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fguides\u002Frouting\u002Fprovider-selection",{"title":635,"url":636},"OpenRouter documentation index","https:\u002F\u002Fopenrouter.ai\u002Fdocs\u002Fllms.txt",{"title":638,"url":622},"Wikipedia: OpenRouter","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fopenrouter\u002Fog.jpg",[48,49,50],"OpenRouter: egy API-kulcs a katalógus minden modellje előtt","OpenRouter egyetlen OpenAI-kompatibilis végpont mögé tereli a 80+ szolgáltató 500+ modelljét, fallbackkel és listaáron. Mennyibe kerül, és hol törik el.","Kérési útvonal az OpenRouteren át: kliens, router, lehetséges szolgáltatók, fallback lista és a végül válaszoló modell.","https:\u002F\u002Fopenrouter.ai","Pay per token, no subscription",{"slug":648,"published":649,"minutes":545,"category":7,"tags":650,"keywords":654,"about":661,"sources":669,"cover":693,"og":694,"expertise":46,"locales":695,"lang":50,"title":696,"description":697,"coverAlt":698,"url":664,"pricing":699,"kind":700},"braintrust","2026-07-07",[651,466,652,653,548],"Evaluations","LLM-as-a-judge","CI gates",[648,655,656,657,658,659,660],"braintrust pricing","braintrust eval","autoevals library","braintrust vs langfuse","llm evaluation platform","eval driven development",[662,665,668],{"name":663,"url":664},"Braintrust","https:\u002F\u002Fwww.braintrust.dev",{"name":666,"url":667},"Continuous integration","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FContinuous_integration",{"name":570,"url":571},[670,673,676,679,682,685,688,690],{"title":671,"url":672},"Braintrust pricing: plans, credits and usage rates","https:\u002F\u002Fwww.braintrust.dev\u002Fpricing",{"title":674,"url":675},"Braintrust documentation: plans and limits","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fplans-and-limits",{"title":677,"url":678},"Braintrust documentation: evaluation quickstart","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs\u002Fevaluation-quickstart",{"title":680,"url":681},"Braintrust documentation: get started","https:\u002F\u002Fwww.braintrust.dev\u002Fdocs",{"title":683,"url":684},"GitHub: Braintrust organisation repositories","https:\u002F\u002Fgithub.com\u002Forgs\u002Fbraintrustdata\u002Frepositories",{"title":686,"url":687},"Arize Phoenix documentation: self-hosting","https:\u002F\u002Farize.com\u002Fdocs\u002Fphoenix\u002Fself-hosting",{"title":689,"url":581},"Langfuse pricing: cloud plans and billable units",{"title":691,"url":692},"LangChain pricing: LangSmith plans","https:\u002F\u002Fwww.langchain.com\u002Fpricing","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fbraintrust\u002Fog.jpg",[48,49,50],"Braintrust teszt: eval-first observability kemény mérőórával","A Braintrust a termelési trace-ekből datasetet és gate-elt kísérleteket csinál. Mit ad a Starter és a Pro, mi a nyílt forrás, és hol erősebb a Phoenix, a Langfuse és a LangSmith.","Hurok az instrumentált alkalmazási logoktól egy dataseten át a scorerokkal futó kísérletig, majd az összehasonlításig, amely blokkolja a pull requestet, mielőtt a változás visszakerül az alkalmazásba.","Free · from $249 per month","Evaluation platform",1791383549994]