[{"data":1,"prerenderedAt":654},["ShallowReactive",2],{"tool-unstructured-hu":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":23,"sources":27,"cover":46,"og":47,"expertise":48,"locales":49,"lang":52,"title":53,"description":54,"coverAlt":55,"url":56,"pricing":57,"kind":58,"metaTitle":59,"takeaways":60,"faq":66,"toc":79,"blocks":104,"others":455},"unstructured","2026-05-21",11,"rag",[9,10,11,12,13],"Document parsing","RAG ingestion","PDF extraction","Chunking","ETL",[15,16,17,18,19,20,21,22],"unstructured.io","unstructured library python","unstructured vs llamaparse","document parsing for rag","pdf partitioning hi_res","unstructured pricing","chunk by title","document ingestion pipeline",[24],{"name":25,"url":26},"Unstructured","https:\u002F\u002Funstructured.io\u002F",[28,31,34,37,40,43],{"title":29,"url":30},"Unstructured documentation: pipelines overview","https:\u002F\u002Fdocs.unstructured.io\u002Fwelcome",{"title":32,"url":33},"Unstructured documentation: transform quickstart","https:\u002F\u002Fdocs.unstructured.io\u002Fapi-reference\u002Ftransform\u002Fquickstart\u002Foverview",{"title":35,"url":36},"Unstructured pricing: free pages, rate per page and plans","https:\u002F\u002Funstructured.io\u002Fpricing",{"title":38,"url":39},"Unstructured benchmarks: 1,000+ enterprise pages against other parsers","https:\u002F\u002Funstructured.io\u002Fbenchmarks",{"title":41,"url":42},"Unstructured library on GitHub","https:\u002F\u002Fgithub.com\u002FUnstructured-IO\u002Funstructured",{"title":44,"url":45},"Unstructured partition endpoint container","https:\u002F\u002Fgithub.com\u002FUnstructured-IO\u002Funstructured-api","\u002Fimages\u002Fblog\u002Funstructured\u002Fcover.webp","\u002Fimages\u002Fblog\u002Funstructured\u002Fog.jpg","ai-engineer",[50,51,52],"en","de","hu","Unstructured ismertető: dokumentumok feldolgozása RAG-hez","Az Unstructured PDF-eket, Word-fájlokat és képeket típusszintű elemekké alakít RAG-hez: Apache-2.0 könyvtár és platform 0,015 dollár oldalanként az első 10 000 ingyenes oldal után.","Az Unstructured pipeline diagramja: a forrásfájlokat elrendezéssel és OCR-rel típusszintű elemekre bontják, chunkokká állítják, metaadatokkal és táblázatokkal gazdagítják, beágyazzák, és több mint húsz célrendszer egyikére töltik.","https:\u002F\u002Funstructured.io","Apache-2.0 · paid tiers","Document ingestion","Unstructured ismertető: parsing, chunking, ár · Balázs Csorba",[61,62,63,64,65],"Az Unstructured egy Apache-2.0 licencű Python-könyvtár, amely PDF-eket, Word-fájlokat és képeket cím, táblázat és lista típusú elemekké alakít, hostolt platformmal, csatlakozókkal és VLM stratégiával.","A platform 0,015 dollárt számol oldalanként az első 10 000 ingyenes oldal után, a könyvtár helyben fut oldalszám nélkül.","A szolgáltató saját, több mint 1 000 vállalati oldalas benchmarkján az open-source változat 0,426 táblázati cellatartalmat ér el 0,820-zal szemben a legjobb platform-pipelinenél.","A táblázati szerkezet és az olvasási sorrend hiba nélkül bukik el, ezért a korpusz mintáját olvassa el, mielőtt embeddig modellt választana.","A telemetria DO_NOT_TRACK és SCARF_NO_ANALYTICS kapcsolókkal kikapcsolható; a könyvtárral a dokumentumok nem hagyják el a gépet.",[67,70,73,76],{"q":68,"a":69},"Az unstructured könyvtár ingyenesen használható?","Igen. A könyvtár Apache-2.0, PyPI-ról települ, és fiók vagy oldal korlát nélkül fut. A hostolt platformért kell fizetni: 10 000 ingyenes oldal induláskor, utána 0,015 dollár oldalanként.",{"q":71,"a":72},"Mi a különbség a könyvtár és a platform között?","A könyvtár a saját folyamatában partitionál, chunkol és rendez. A platform kezelt jobokat, több mint 40 gondozott csatlakozót, módosításfelismerést, hogy csak az új vagy módosított fájlok fussanak, VLM-particionálási stratégiát és megfelelőségi tanúsításokat ad hozzá. A szolgáltató benchmarkján ez 0,426 és 0,820 táblázati cellatartalomként jelenik meg.",{"q":74,"a":75},"Melyik particionálási stratégiát érdemes használni?","Az auto az alapértelmezett, fájlonként választ, a fast a beágyazott szöveget olvassa és a legolcsóbb, a hi_res elrendezés-felismerést és OCR-t futtat, ez a scannekhez és táblázatokhoz való, az ocr_only pedig a szövegréteg nélküli oldalakat kezeli. A VLM stratégia csak a platformon létezik.",{"q":77,"a":78},"Mennyibe kerül egy nagy dokumentumkészlet feldolgozása?","Az első 10 000 ingyenes oldal után 0,015 dollár oldalanként azt jelenti, hogy egy 500 oldalas scan 7,50 dollár a pay-as-you-go tarifán. A könyvtár saját üzemeltetése csak számítási időbe kerül, ezért a nagy archívumokat általában helyben dolgozzák fel, és csak a nehéz dokumentumok mennek a platformra.",[80,83,86,89,92,95,98,101],{"id":81,"title":82},"what-it-is","Mi ez",{"id":84,"title":85},"how-it-works","Hogyan működik",{"id":87,"title":88},"getting-started","Első lépések",{"id":90,"title":91},"performance","Teljesítmény és költség",{"id":93,"title":94},"pricing","Árazás",{"id":96,"title":97},"where-it-shingles","Hol akad el",{"id":99,"title":100},"verdict","Ítélet",{"id":102,"title":103},"sources","Források",[105,113,116,119,154,192,193,205,214,217,218,221,223,229,236,237,249,297,300,314,317,318,321,331,332,335,381,388,402,403,406,423,427,428],{"type":106,"content":107},"paragraph",[108,109],"Az Unstructured az a dokumentumfeldolgozási réteg, amellyel a legtöbb lekérdező pipeline elkezdődik: egy Apache-2.0 licencű Python-könyvtár, amely PDF-eket, Word-fájlokat, HTML-t, képeket és táblázatokat típusszintű elemekké alakít, címekké, táblákká, listákká és szöveggé, emellett egy hostolt platform, amely csatlakozókat, módosításfelismerést és a könyvtárban nem meglévő stratégiákat ad hozzá. ",{"tag":110,"children":111},"strong",[112],"A könyvtár szinte mindenkinek a jó kiindulópont; a platformnak csak akkor éri meg az árát, ha a táblázatok vagy a beszkennelt archívumok döntik el, hogy egyáltalán működik-e a pipeline.",{"type":106,"content":114},[115],"A réteg a stack elején ül, a chunking, az embeddig és a lekérdezés előtt, és a LlamaParse-szel, a Doclinggal, a Reductóval, az Azure Document Intelligence-nel, valamint a nagy felhőszolgáltatók parseoló végpontjaival versenyez. Előnye nem az, hogy minden benchmarkot megnyer, ezt a saját, közzétett számai cáfolják az open-source változatnál, hanem az, hogy a mag helyben, engedélyes licenc alatt fut: ezen a rétegen sem vektoradatbázis, sem chunker, sem hosting nem kényszerül rá.",{"type":117,"level":118,"id":81,"text":82},"heading",2,{"type":106,"content":120},[121,122,126,127,130,131,134,135,138,139,138,142,145,146,149,150,153],"Telepítés ",{"tag":123,"children":124},"code",[125],"pip install \"unstructured[all-docs]\""," paranccsal, majd ",{"tag":123,"children":128},[129],"partition()"," hívás egy fájlra, és visszajön egy elemobjektum-lista, mindegyik típussal, szöveggel és metaadatokkal, például oldalszámmal és bounding boxszal. A ",{"tag":123,"children":132},[133],"strategy"," argumentum választja ki a folyamatot: ",{"tag":123,"children":136},[137],"auto",", ",{"tag":123,"children":140},[141],"fast",{"tag":123,"children":143},[144],"hi_res"," és ",{"tag":123,"children":147},[148],"ocr_only"," a könyvtárban, ",{"tag":123,"children":151},[152],"vlm"," a platformtól, ami vizuális modellen küldi át az oldalakat. Eré épül a lánc, partition, chunk, enrich, embed és load, amit a platform jobként futtat, a könyvtár pedig szokásos függvényekként.",{"type":155,"ordered":156,"items":157},"list",false,[158,160,162,164,178,180,182],[159],"Licenc és tulajdonos: Apache-2.0 a könyvtárhoz; a platform az Unstructured kereskedelmi terméke ingyenes tarifával, pay-as-you-go-val és egyedi tarifával.",[161],"Lefedettség: az árlista több mint 45 támogatott fájltípust és több mint 40 csatlakozót sorol fel, több mint 20 forrásra és több mint 20 célra bontva.",[163],"Kimenet: típusszintű elemek, mint Title, NarrativeText, Table, ListItem és Image, oldalszámmal, koordinátákkal és metaadatokkal a helyett, hogy egyetlen szövegfal jönne vissza.",[165,166,138,168,138,170,145,172,174,175,177],"Stratégiák: ",{"tag":123,"children":167},[137],{"tag":123,"children":169},[141],{"tag":123,"children":171},[144],{"tag":123,"children":173},[148]," helyben, plusz ",{"tag":123,"children":176},[152]," és a gazdagítási lépések a platformon.",[179],"Chunking: cím szerint, oldal szerint, karakter szerint és hasonlóság szerint, a kontextuális chunking a platform funkciója.",[181],"Benchmarkok: az Unstructured több mint 1 000 vállalati oldalon közöl eredményeket a Reducto, a LlamaParse, a Docling, a Snowflake, a Databricks és az NVIDIA ellen.",[183,184,187,188,191],"Telemetria: a könyvtár névtelen használati adatokat küld, hacsak nincs beállítva a ",{"tag":123,"children":185},[186],"DO_NOT_TRACK"," vagy a ",{"tag":123,"children":189},[190],"SCARF_NO_ANALYTICS",".",{"type":117,"level":118,"id":84,"text":85},{"type":106,"content":194},[195,196,198,199,201,202,204],"Egy futás beolvassa a fájlt, szükség esetén rendereli az oldalakat, majd a területeket elemekre osztja. A ",{"tag":123,"children":197},[141]," a beágyazott szöveget veszi és címkézi; a ",{"tag":123,"children":200},[144]," elrendezés-felismerést és OCR-t futtat az oldalképen, ezért lassabb, ezért kell hozzá telepített modellcsomag, és ez a stratégia adja a táblázatokat, amiket érdemes megtartani; az ",{"tag":123,"children":203},[148]," a tartalék, amikor egy oldalon egyáltalán nincs szövegréteg. Ezután a chunking a elemeket karakterkeret alá gyűjti, igyekezve nem elválasztani a címet attól az abszolútól, amelyet bevezet.",{"type":206,"attrs":207,"inner":211,"caption":212},"diagram",{"viewBox":208,"role":209,"aria-labelledby":210},"0 0 760 290","img","d-uzz-t d-uzz-d","\u003Ctitle id=\"d-uzz-t\">Ahogy egy dokumentum kereshető szöveggé válik\u003C\u002Ftitle>\u003Cdesc id=\"d-uzz-d\">A forrásfájlok felülről érkeznek, a partition lépés típusszintű elemekre bontja őket, miközben olvassa az elrendezést és OCR-t futtat. Az elemeket címkék, oldalak vagy méret szerint chunkokká állítja össze, metaadatokkal és táblázati szerkezettel gazdagítja, vektorokba ágyazza, és több mint húsz célrendszer egyikébe tölti.\u003C\u002Fdesc>\u003Cdefs>\u003Cmarker id=\"ah-p\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head\" \u002F>\u003C\u002Fmarker>\u003Cmarker id=\"ah-pa\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head-accent\" \u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Crect x=\"260\" y=\"16\" width=\"240\" height=\"42\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"380\" y=\"43\" text-anchor=\"middle\" class=\"d-text\">forrásfájlok\u003C\u002Ftext>\u003Crect x=\"40\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"110\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">partition\u003C\u002Ftext>\u003Ctext x=\"110\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">elrendezés + OCR\u003C\u002Ftext>\u003Crect x=\"220\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"290\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">chunk\u003C\u002Ftext>\u003Ctext x=\"290\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">cím, oldal, méret\u003C\u002Ftext>\u003Crect x=\"400\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"470\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">gazdagítás\u003C\u002Ftext>\u003Ctext x=\"470\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">metaadat, táblák\u003C\u002Ftext>\u003Crect x=\"580\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"650\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">beágyazás\u003C\u002Ftext>\u003Ctext x=\"650\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">vektorok + kulcsok\u003C\u002Ftext>\u003Cpath d=\"M380 58 L110 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M380 58 L290 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M380 58 L470 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M380 58 L650 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M184 156 H214\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M364 156 H394\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M544 156 H574\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M650 198 V242\" class=\"d-line-accent\" marker-end=\"url(#ah-pa)\" \u002F>\u003Ctext x=\"650\" y=\"266\" text-anchor=\"middle\" class=\"d-title\">20+ célrendszer\u003C\u002Ftext>",[213],"Minden lépés a könyvtárban külön hívás, a platformon külön fázis, így a pipeline a közből újrafuttatható anélkül, hogy az egész korpuszt újra kellene feldolgozni.",{"type":106,"content":215},[216],"A kimenetön áll vagy bukik az elemszél. Egy HTML-be, érintetlen fejlécsorral kijövő táblázat egy hasznos csomóponttá válik; ugyanaz a táblázat prózaként olvasva több chunkká szakad, amelyek mindegyike a szám felét hordozza. Ez az egész érv amellett, hogy számítson ez a réteg, és ez az egész ok arra, hogy az eredményt olvassuk, mielőtt az embeddig modellt cserélnénk.",{"type":117,"level":118,"id":87,"text":88},{"type":106,"content":219},[220],"A könyvtár quickstartje egyetlen függvényhívás. Az alábbi kódrészlet PDF-et dolgoz fel a felbontásnál precíz stratégiával, megtartja a táblázati szerkezetet, cím szerint chunkol, és JSON-ba írja az eredményt.",{"type":123,"code":222},"from unstructured.partition.auto import partition\nfrom unstructured.chunking.title import chunk_by_title\nfrom unstructured.staging.base import elements_to_json\n\n# strategy: auto, fast, hi_res or ocr_only; hi_res is the one that keeps table structure\nelements = partition(\n    filename=\"report.pdf\",\n    strategy=\"hi_res\",\n    infer_table_structure=True,\n)\nchunks = chunk_by_title(elements, max_characters=1_200, combine_under=300)\n\nelements_to_json(chunks, filename=\"report.elements.json\")\nprint(len(elements), \"elements,\", len(chunks), \"chunks\")",{"type":106,"content":224},[225,226,228],"A helyi kísérleten túl a platform a gondozott út: ugyanaz a partition lépés API vagy ütemezett job mögött, csatlakozók S3-hoz, SharePoint-hoz, Google Drive-hoz és a többihez, módosításfelismerés, hogy csak az új vagy módosított fájlok dolgozódjanak fel, valamint a ",{"tag":123,"children":227},[152]," stratégia. A könyvtár marad az a hely, ahol a parseoló kód maga él, és a dokumentáció is köré épül.",{"type":230,"variant":231,"title":232,"body":233},"callout","tip","Előbb az elemeket olvassa, csak utána az embeddigeket",[234],[235],"Partitionáljon száz oldalt a saját korpuszából, és olvassa el a kimenetet: elemtípusok, táblázati szerkezet, olvasási sorrend. Ennél a rétegnél a hiba csendes: a parseoló, amelyik a táblázat felét ejti, tiszta JSON-t ad vissza, és minden további metrika helyette a retrievert okolja.",{"type":117,"level":118,"id":90,"text":91},{"type":106,"content":238},[239,240,242,243,245,246,248],"A platform oldalakat számláz: 10 000 ingyen az elején, utána 0,015 dollár oldalanként, így egy 400 oldalas beszkennelt archívum hat dollárnyi feldolgozás, még mielőtt bárki feltett volna egy kérdést. A könyvtár CPU-ban és valós időben számláz: a ",{"tag":123,"children":241},[141]," közel I\u002FO-kötött, a ",{"tag":123,"children":244},[144]," oldalanként elrendezési modellt és OCR-t futtat, a ",{"tag":123,"children":247},[152]," pedig a számlát a számításról a modell tokenjeire helyezi át.",{"type":250,"head":251,"rows":260},"table",[252,254,256,258],[253],"Pipeline",[255],"Adjusted CCT",[257],"Tokens added",[259],"Table cell content",[261,270,279,288],[262,264,266,268],[263],"Unstructured platform",[265],"0.880",[267],"0.051",[269],"0.820",[271,273,275,277],[272],"Unstructured open source",[274],"0.715",[276],"0.119",[278],"0.426",[280,282,284,286],[281],"LlamaParse VLM",[283],"0.835",[285],"0.069",[287],"0.522",[289,291,293,295],[290],"Docling alapértelmezett",[292],"0.716",[294],"0.135",[296],"0.657",{"type":106,"content":298},[299],"A számok az Unstructured saját, több mint 1 000 vállalati oldalra végzett benchmarkjából származnak, beszkennelt számlákból, egymásba ágyazott táblázatokból és kézírásból, a szolgáltatói összehasonlítás pedig marketing, ezért a használható jel egyetlen terméken belüli rés: 0,426 szemben 0,820 táblázati cellatartalommal az open-source változat és a legjobb platform-pipeline között, és 0,715 szemben 0,880 a javított szövegpontosságon. Az element alignment, hogy területet címkéztek-e szövegként, táblázatként vagy bekezdésként, az a mutató, amelynél az összes eszköz 0,53 és 0,61 közé esik, és ez ennek a rétegnek a becsületes nehézsége.",{"type":155,"ordered":156,"items":301},[302,304,312],[303],"Egyszer parse-oljon, és tartsa meg az elem-JSON-t: ugyanazt a korpuszt chunkolási kísérlet közben újrapartitionálni ennek a rétegnek a leggyakoribb pénzégetése.",[305,306,308,309,311],"A stratégiát dokumentumtípusonként válassza, nem korpuszonként: ",{"tag":123,"children":307},[141]," digitális szövegre, ",{"tag":123,"children":310},[144]," scannekre és minden táblázatot tartalmazó dokumentumra.",[313],"Oldalakat számoljon, ne fájlokat, mert az oldalankénti ár egy 400 oldalas PDF-et költségtétellé tesz, nem a dokumentumok számát.",{"type":106,"content":315},[316],"Ebből semmi sem egyedi erre a szolgáltatóra: minden parseoló a recallt adja a számítási időért. Egyedi viszont, hogy a számok egyáltalán megjelennek, egy olyan táblázatban, amelyben a versenytársak nevei is szerepelnek, és ez több, mint amit a mező többi szereplője közöl.",{"type":117,"level":118,"id":93,"text":94},{"type":106,"content":319},[320],"Két termék, egy név. A könyvtár Apache-2.0 és ingyenes: telepíti, a saját gépén futtatja, nincs fiók és nincs oldalszám. A platform ugyanez a feldolgozás kezelt jobokkal, csatlakozókkal és megfelelőséggel, oldalanként mérve.",{"type":155,"ordered":156,"items":322},[323,325,327,329],[324],"Könyvtár: Apache-2.0, telepítés PyPI-ről, korlátlan oldal, saját hardver.",[326],"Ingyenes: 10 000 oldal induláskor, bankkártya nélkül, minden funkció benne van.",[328],"Pay-as-you-go: 0,015 dollár oldalanként az első 10 000 oldal után, minden funkció benne van.",[330],"Business: egyedi ár dedikált példányhoz, VPC-hez vagy bare metal környezethez, többfelhasználós fiókokkal, szerepalapú hozzáférés-vezérléssel és a szolgáltató megfelelőségi tanúsításaival.",{"type":117,"level":118,"id":96,"text":97},{"type":106,"content":333},[334],"Kezdje a gyengeségekkel. Az open-source változat a gyengébb parseoló, és a szolgáltató saját táblázata ezt mondja: 0,426 táblázati cellatartalom szemben 0,820-zal a legjobb platform-pipelinenél, 0,119 kitalált token szemben 0,051-rel. Az ár oldalanként megy, ami a digitálisan született PDF-eket jutalmassa, a scanneket bünteti, és rossz egység az egyik oldal, amelyik egy bekezdést tartalmaz, a következő pedig egy 400 cellás táblázatot. Amiért a platformot éri meg bérelni, a VLM-particionálás, az inkrementális módosításfelismerés, a több mint 40 gondozott csatlakozó és a megfelelőség, éppen az, amit a licenc nem tartalmaz. És a kimenet továbbra is ellenőrzést kíván: az olvasási sorrend és a táblázati szerkezet a két mező, amely hiba nélkül bukik el.",{"type":250,"head":336,"rows":345},[337,339,341,343],[338],"Eszköz",[340],"Mi az",[342],"Hol győz",[344],"Miről mond le",[346,354,363,372],[347,348,350,352],[25],[349],"Könyvtár és hostolt platform",[351],"Helyi futás Apache-2.0 alatt, közzétett minőségi benchmarkkal",[353],"Oldalankénti számlázás, és az erős számokhoz a fizetős pipeline kell",[355,357,359,361],[356],"LlamaParse",[358],"A LlamaIndex csapat hostolt parseolója",[360],"Gyors beállítás és szoros LlamaIndex-integráció",[362],"Csak hostolt, minden oldal elhagyja a hálózatot",[364,366,368,370],[365],"Docling",[367],"Az IBM open-source parseolója",[369],"Egyetlen függőség, MIT-licenc, erős táblázati kimenet",[371],"Kevesebb fájltípus és nincs gondozott csatlakozóréteg",[373,375,377,379],[374],"Reducto",[376],"Hostolt parsing API elrendezés-szabályozással",[378],"Táblázati pontosság és elrendezés-szabályozás szolgáltatásként",[380],"Csak API: nincs helyi futás és nincs bővíthető könyvtár",{"type":106,"content":382},[383,384,387],"A valódi döntés az, ki fizet a minőségért. Ha a korpusz digitálisan született szöveg, és az elfogadható kimenet elég, a ",{"tag":123,"children":385},[386],"strategy=\"fast\""," parancsot használó könyvtár oldalanként ingyenes, és a feladathoz megfelelő méret. Ha a táblázatok, a scannek vagy a szabályozott adatok döntik el, hogy működik-e a pipeline, akkor a platform vagy egy specializált parseoló a vásárlás, és az egyetlen számító teszt az a száz oldal a saját dokumentumokból, amelyet azokon a mezőkön pontoz, amelyeket ténylegesen olvas.",{"type":230,"variant":389,"title":390,"body":391},"warn","Telemetria és ami elhagyja a gépet",[392],[393,394,397,398,401],"A könyvtárral a dokumentumok helyben maradnak, de a csomag alapértelmezésben névtelen használati adatokat küld; a ",{"tag":123,"children":395},[396],"DO_NOT_TRACK=1"," és a ",{"tag":123,"children":399},[400],"SCARF_NO_ANALYTICS=1"," kikapcsolja ezt. A platform eleve a hostolt szolgáltatásnak küldi az oldalakat, a biztonsági oldalak pedig átviteli titkosítást, zero data retentiont és elkülönített inferenciát említenek azoknak a csapatoknak, akik ezt nem tehetik meg.",{"type":117,"level":118,"id":99,"text":100},{"type":106,"content":404},[405],"Az Unstructured a lekérdező pipeline elején a legbiztosabb alapértelmezés, mert unalmas, helyi és mérhető: egyetlen függvény, amely típusszintű elemeket ad vissza, egy benchmark, amellyel lehet vitatkozni, és egy fizetős szint, amelybe át lehet térni az ingestion újraírása nélkül. Valójában az dől el, hogy a terméknek mennyi parsing-minőség kell, a szolgáltató saját számai pedig azt mondják, hogy az ingyenes változat nem ugyanaz, mint a fizetős.",{"type":155,"ordered":407,"items":408},true,[409,411,413,415,421],[410],"Könyvtárat használjon, ha már létezik pipeline, és típusszintű elemek kellenek a nyers szöveg helyett; Apache-2.0, helyben fut, és a stack többi részének megérintése nélkül cserélhető.",[412],"Platformot használjon, ha az oldalak S3-ból, SharePointból vagy Confluence-ből érkeznek, és csatlakozókra, módosításfelismerésre és audit trailre van szükség.",[414],"Ne fogadja el a pénzügyi táblázatok hivatalos parseolójaként a saját dokumentumai kiértékelése nélkül; a stratégiák közti rés egy terméken belül nagyobb, mint a szolgáltatók közti.",[416,417,420],"Ne válassza, ha a nehéz helyi függőségi fa elfogadhatatlan, mert az ",{"tag":123,"children":418},[419],"unstructured[all-docs]"," magával húzza az OCR- és elrendezési csomagot, míg a Docling vagy egy hostolt API jóval könnyebb.",[422],"Már az elején oldalakban költségvetést készítsen; az oldalankénti ár könnyen modellezhető és beszkennelt archívumokkal könnyen túlléphető.",{"type":424,"content":425},"quote",[426],"A dokumentumfeldolgozást mért lépésként kezelje, nem közműként: a stratégiát a saját oldalai mintáján válassza ki, tartsa meg az elem-JSON-t, és a parseolót csak akkor cserélje, amikor a táblázati számok elmozdulnak.",{"type":117,"level":118,"id":102,"text":103},{"type":155,"ordered":407,"items":429},[430,435,439,443,447,451],[431],{"tag":432,"href":30,"children":433},"a",[434],"Unstructured dokumentáció: pipeline áttekintés",[436],{"tag":432,"href":33,"children":437},[438],"Unstructured dokumentáció: transform quickstart",[440],{"tag":432,"href":36,"children":441},[442],"Unstructured árazás: ingyenes oldalak, díj oldalanként és tarifák",[444],{"tag":432,"href":39,"children":445},[446],"Unstructured benchmarkok: több mint 1 000 vállalati oldal más parseolók ellen",[448],{"tag":432,"href":42,"children":449},[450],"Unstructured könyvtár a GitHubon",[452],{"tag":432,"href":45,"children":453},[454],"Unstructured partition endpoint konténer",[456,505,561,604],{"slug":457,"published":458,"minutes":6,"category":7,"tags":459,"keywords":465,"about":474,"sources":478,"cover":497,"og":498,"expertise":48,"locales":499,"lang":52,"title":500,"description":501,"coverAlt":502,"url":503,"pricing":504,"kind":460},"zep","2026-10-06",[460,461,462,463,464],"Agent memory","Knowledge graph","Temporal graph","Context engineering","RAG",[466,467,468,469,470,471,472,473],"zep ai","zep agent memory","graphiti knowledge graph","zep pricing","zep vs mem0","long-term memory for agents","temporal knowledge graph","zep cloud",[475],{"name":476,"url":477},"Zep","https:\u002F\u002Fwww.getzep.com\u002F",[479,482,485,488,491,494],{"title":480,"url":481},"Zep pricing: plans, credits and limits","https:\u002F\u002Fwww.getzep.com\u002Fpricing",{"title":483,"url":484},"Zep documentation","https:\u002F\u002Fhelp.getzep.com\u002F",{"title":486,"url":487},"Graphiti on GitHub","https:\u002F\u002Fgithub.com\u002Fgetzep\u002Fgraphiti",{"title":489,"url":490},"Graphiti product page","https:\u002F\u002Fwww.getzep.com\u002Fplatform\u002Fgraphiti\u002F",{"title":492,"url":493},"Announcing a new direction for Zep's open-source strategy","https:\u002F\u002Fwww.getzep.com\u002Fblog\u002Fannouncing-a-new-direction-for-zeps-open-source-strategy\u002F",{"title":495,"url":496},"Graphiti: temporal knowledge graphs for AI agents (arXiv)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2501.13956","\u002Fimages\u002Fblog\u002Fzep\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fzep\u002Fog.jpg",[50,51,52],"Zep ismertető: ügynök-memory temporális gráfon","A Zep hostolt ügynök-memory API temporális tudásgráfon: kreditek íráskor, lekérdezés ingyen, Flex 125 dollártól havonta, a Graphiti az a rész, amit magunk üzemeltethetünk.","A Zep diagramja arról, hogyan jut el egy tény a promptig: az üzeneteket és tényeket felhasználónkénti entitás- és kapcsolatgráffá bontják, a lekérdezés pedig bejárja a gráfot, és kontextusblokkot ad vissza a támasztó tényekkel.","https:\u002F\u002Fwww.getzep.com","Apache-2.0 core · Cloud from $50 per month",{"slug":506,"published":507,"minutes":508,"category":7,"tags":509,"keywords":513,"about":521,"sources":528,"cover":553,"og":554,"expertise":48,"locales":555,"lang":52,"title":556,"description":557,"coverAlt":558,"url":559,"pricing":560,"kind":523},"lancedb","2026-09-21",9,[510,511,512,464],"Vector search","Hybrid search","Embedded database",[506,514,515,516,517,518,519,520],"lancedb review","lance vector database","embedded vector database","lancedb vs qdrant","hybrid search rrf","lancedb indexing","lance data format",[522,525],{"name":523,"url":524},"Vector database","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FVector_database",{"name":526,"url":527},"Apache Arrow","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FApache_Arrow",[529,532,535,538,541,544,547,550],{"title":530,"url":531},"LanceDB quickstart","https:\u002F\u002Fdocs.lancedb.com\u002Fquickstart",{"title":533,"url":534},"LanceDB vector indexes","https:\u002F\u002Fdocs.lancedb.com\u002Findexing\u002Fvector-index",{"title":536,"url":537},"LanceDB indexing guide","https:\u002F\u002Fdocs.lancedb.com\u002Findexing\u002Findex",{"title":539,"url":540},"LanceDB hybrid search","https:\u002F\u002Fdocs.lancedb.com\u002Fsearch\u002Fhybrid-search",{"title":542,"url":543},"LanceDB Enterprise","https:\u002F\u002Fdocs.lancedb.com\u002Fenterprise",{"title":545,"url":546},"LanceDB frequently asked questions","https:\u002F\u002Fdocs.lancedb.com\u002Ffaq\u002Ffaq-oss",{"title":548,"url":549},"LanceDB pricing","https:\u002F\u002Flancedb.com\u002Fpricing",{"title":551,"url":552},"LanceDB on PyPI","https:\u002F\u002Fpypi.org\u002Fproject\u002Flancedb\u002F","\u002Fimages\u002Fblog\u002Flancedb\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flancedb\u002Fog.jpg",[50,51,52],"LanceDB: vektoros keresés, amely könyvtárként indul","A LanceDB értékelése: Apache-2.0 beágyazott vektoros könyvtár szerver helyett, az IVF és HNSW indexválasztás, hibrid keresés rangsoregyesítéssel, és mit ad hozzá az Enterprise.","A LanceDB teszt borítóképe: egy Lance-tábla vektorindexet és teljes szöveges indexet táplál egy fúziós rangsorba","https:\u002F\u002Flancedb.com","Apache-2.0 · Cloud paid",{"slug":562,"published":507,"minutes":563,"category":7,"tags":564,"keywords":568,"about":575,"sources":581,"cover":596,"og":597,"expertise":48,"locales":598,"lang":52,"title":599,"description":600,"coverAlt":601,"url":577,"pricing":602,"kind":603},"pgvector",10,[510,565,566,464,567],"Postgres","HNSW","Quantisation",[562,569,570,571,572,573,574],"pgvector vs qdrant","postgres vector search","hnsw index postgres","iterative index scans","binary quantization postgres","vector database postgres",[576,578],{"name":562,"url":577},"https:\u002F\u002Fgithub.com\u002Fpgvector\u002Fpgvector",{"name":579,"url":580},"PostgreSQL","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPostgreSQL",[582,584,587,590,593],{"title":583,"url":577},"pgvector README",{"title":585,"url":586},"pgvector changelog","https:\u002F\u002Fgithub.com\u002Fpgvector\u002Fpgvector\u002Fblob\u002Fmaster\u002FCHANGELOG.md",{"title":588,"url":589},"PostgreSQL news: pgvector 0.8.2 released","https:\u002F\u002Fwww.postgresql.org\u002Fabout\u002Fnews\u002Fpgvector-082-released-3245\u002F",{"title":591,"url":592},"AWS: Scale pgvector with binary quantization","https:\u002F\u002Faws.amazon.com\u002Fblogs\u002Fdatabase\u002Fscale-pgvector-with-binary-quantization-on-amazon-aurora-postgresql\u002F",{"title":594,"url":595},"pgvector licence","https:\u002F\u002Fgithub.com\u002Fpgvector\u002Fpgvector\u002Fblob\u002Fmaster\u002FLICENSE","\u002Fimages\u002Fblog\u002Fpgvector\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fpgvector\u002Fog.jpg",[50,51,52],"pgvector, értékelés: az a vektordatázis, amelyet nem kell üzemeltetned","Értékelés a pgvector 0.8.7-ről: iteratív indexszkennelés szűrt kereséshez, HNSW és IVFFlat, bináris kvantizálás 100 millió vektornál, és a CVE, amely az indexépítést javítási tétellé tette.","A lekérdezés felül három útra bontakozik: pontos szekvenciális szkennelés, HNSW gráfjárás és IVFFlat vizsgálat; alul egy iteratív szkennelés folytatódik, amíg a limit kitelik.","PostgreSQL licence","Vector database extension",{"slug":605,"published":606,"minutes":563,"category":7,"tags":607,"keywords":609,"about":615,"sources":619,"cover":647,"og":648,"expertise":48,"locales":649,"lang":52,"title":650,"description":651,"coverAlt":652,"url":618,"pricing":653,"kind":460},"mem0","2026-09-17",[460,608,464,510],"Long-term memory",[605,610,611,612,613,471,614],"mem0 review","agent memory layer","mem0 self-hosted","mem0 pricing","mem0 alternatives",[616],{"name":617,"url":618},"Mem0","https:\u002F\u002Fmem0.ai",[620,623,626,629,632,635,638,641,644],{"title":621,"url":622},"Mem0 documentation","https:\u002F\u002Fdocs.mem0.ai\u002Fintroduction",{"title":624,"url":625},"Mem0 quickstart","https:\u002F\u002Fdocs.mem0.ai\u002Fquickstart",{"title":627,"url":628},"How Mem0 works","https:\u002F\u002Fdocs.mem0.ai\u002Fcore-concepts\u002Fhow-it-works",{"title":630,"url":631},"Mem0 pricing","https:\u002F\u002Fmem0.ai\u002Fpricing",{"title":633,"url":634},"Mem0 on GitHub","https:\u002F\u002Fgithub.com\u002Fmem0ai\u002Fmem0",{"title":636,"url":637},"mem0ai on PyPI","https:\u002F\u002Fpypi.org\u002Fproject\u002Fmem0ai\u002F",{"title":639,"url":640},"Mem0 research and benchmarks","https:\u002F\u002Fmem0.ai\u002Fresearch",{"title":642,"url":643},"Mem0 MCP server","https:\u002F\u002Fdocs.mem0.ai\u002Fplatform\u002Fmem0-mcp",{"title":645,"url":646},"Mem0 paper on arXiv","https:\u002F\u002Farxiv.org\u002Fabs\u002F2504.19413","\u002Fimages\u002Fblog\u002Fmem0\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fmem0\u002Fog.jpg",[50,51,52],"Mem0: mennyibe kerül egy ügynökmemória körönként","A Mem0 elemzése: körönként kinyert tények, az április 2026-i benchmark tábla platformra vonatkozó fenntartása, négy felhő-csomag és ami kimarad az önálló üzemeltetésből.","Hurok, amely a beszélgetésből tárolt tényeket készít, majd visszaolvasja őket a promptba","Free tier · from $19 per month",1791383550435]