[{"data":1,"prerenderedAt":652},["ShallowReactive",2],{"tool-unstructured-de":3},{"slug":4,"published":5,"minutes":6,"category":7,"tags":8,"keywords":14,"about":23,"sources":27,"cover":46,"og":47,"expertise":48,"locales":49,"lang":51,"title":53,"description":54,"coverAlt":55,"url":56,"pricing":57,"kind":58,"metaTitle":59,"takeaways":60,"faq":66,"toc":79,"blocks":104,"others":453},"unstructured","2026-05-21",11,"rag",[9,10,11,12,13],"Document parsing","RAG ingestion","PDF extraction","Chunking","ETL",[15,16,17,18,19,20,21,22],"unstructured.io","unstructured library python","unstructured vs llamaparse","document parsing for rag","pdf partitioning hi_res","unstructured pricing","chunk by title","document ingestion pipeline",[24],{"name":25,"url":26},"Unstructured","https:\u002F\u002Funstructured.io\u002F",[28,31,34,37,40,43],{"title":29,"url":30},"Unstructured documentation: pipelines overview","https:\u002F\u002Fdocs.unstructured.io\u002Fwelcome",{"title":32,"url":33},"Unstructured documentation: transform quickstart","https:\u002F\u002Fdocs.unstructured.io\u002Fapi-reference\u002Ftransform\u002Fquickstart\u002Foverview",{"title":35,"url":36},"Unstructured pricing: free pages, rate per page and plans","https:\u002F\u002Funstructured.io\u002Fpricing",{"title":38,"url":39},"Unstructured benchmarks: 1,000+ enterprise pages against other parsers","https:\u002F\u002Funstructured.io\u002Fbenchmarks",{"title":41,"url":42},"Unstructured library on GitHub","https:\u002F\u002Fgithub.com\u002FUnstructured-IO\u002Funstructured",{"title":44,"url":45},"Unstructured partition endpoint container","https:\u002F\u002Fgithub.com\u002FUnstructured-IO\u002Funstructured-api","\u002Fimages\u002Fblog\u002Funstructured\u002Fcover.webp","\u002Fimages\u002Fblog\u002Funstructured\u002Fog.jpg","ai-engineer",[50,51,52],"en","de","hu","Unstructured-Review: Dokumente für RAG parsen","Unstructured macht aus PDFs, Word-Dateien und Bildern typisierte Elemente für RAG: eine Apache-2.0-Bibliothek und eine Plattform mit 0,015 Dollar pro Seite nach 10.000 freien Seiten.","Diagramm der Unstructured-Pipeline: Quelldateien werden mit Layout und OCR in typisierte Elemente partitioniert, zu Chunks zusammengefasst, mit Metadaten und Tabellen angereichert, eingebettet und in eines von über zwanzig Zielen geladen.","https:\u002F\u002Funstructured.io","Apache-2.0 · paid tiers","Document ingestion","Unstructured-Review: Parsing, Chunking, Preis · Balázs Csorba",[61,62,63,64,65],"Unstructured ist eine Apache-2.0-Python-Bibliothek, die PDFs, Word-Dateien und Bilder in typisierte Elemente wie Titel, Tabellen und Listen verwandelt, dazu eine gehostete Plattform mit Konnektoren und der VLM-Strategie.","Die Plattform berechnet 0,015 Dollar pro Seite nach den ersten 10.000 freien Seiten, die Bibliothek läuft lokal ohne Seitenzahl.","Im eigenen Benchmark des Anbieters über 1.000 Unternehmensseiten erreicht das Open-Source-Bauhaus 0,426 Tabellenzellen-Inhalt gegen 0,820 bei der besten Plattform-Pipeline.","Tabellenstruktur und Leserichtung scheitern ohne Fehler, deshalb sollte eine Stichprobe des Korpus gelesen werden, bevor das Embedding-Modell gewählt wird.","Telemetrie lässt sich mit DO_NOT_TRACK und SCARF_NO_ANALYTICS abschalten; mit der Bibliothek verlassen die Dokumente die Maschine nicht.",[67,70,73,76],{"q":68,"a":69},"Ist die unstructured-Bibliothek kostenlos nutzbar?","Ja. Die Bibliothek ist Apache-2.0, wird von PyPI installiert und läuft ohne Konto und ohne Seitenlimit. Bezahlt wird die gehostete Plattform: 10.000 freie Seiten zum Start, danach 0,015 Dollar pro Seite.",{"q":71,"a":72},"Was unterscheidet Bibliothek und Plattform?","Die Bibliothek partitioniert, chunkt und stapelt Daten im eigenen Prozess. Die Plattform ergänzt verwaltete Jobs, über 40 gepflegte Konnektoren, Änderungserkennung, damit nur neue oder geänderte Dateien laufen, die VLM-Partitionierungs-Strategie und die Compliance-Nachweise. Im Benchmark des Anbieters zeigt sich das als 0,426 gegen 0,820 Tabellenzellen-Inhalt.",{"q":74,"a":75},"Welche Partitionierungs-Strategie ist die richtige?","auto ist die Voreinstellung und wählt pro Datei, fast liest den eingebetteten Text und ist am billigsten, hi_res läuft Layout-Erkennung und OCR und ist die Wahl für Scans und Tabellen, ocr_only behandelt Seiten ohne Textlayer. Die VLM-Strategie gibt es nur auf der Plattform.",{"q":77,"a":78},"Was kostet die Verarbeitung eines großen Dokumentsatzes?","Nach den ersten 10.000 freien Seiten kostet 0,015 Dollar pro Seite ein 500-seitiges Scan im Pay-as-you-go-Tarif 7,50 Dollar. Die Bibliothek selbst zu hosten kostet nur Rechenzeit, deshalb werden große Archive meist lokal geparst und nur schwierige Dokumente gehen an die Plattform.",[80,83,86,89,92,95,98,101],{"id":81,"title":82},"what-it-is","Was es ist",{"id":84,"title":85},"how-it-works","Wie es funktioniert",{"id":87,"title":88},"getting-started","Erste Schritte",{"id":90,"title":91},"performance","Performance und Kosten",{"id":93,"title":94},"pricing","Preise",{"id":96,"title":97},"where-it-shingles","Wo es scheuert",{"id":99,"title":100},"verdict","Fazit",{"id":102,"title":103},"sources","Quellen",[105,113,116,119,154,192,193,205,214,217,218,221,223,229,236,237,249,297,300,314,317,318,321,331,332,335,380,387,400,401,404,421,425,426],{"type":106,"content":107},"paragraph",[108,109],"Unstructured ist die Dokument-Parsing-Schicht, mit der die meisten Retrieval-Pipelines beginnen: eine Apache-2.0-Python-Bibliothek, die PDFs, Word-Dateien, HTML, Bilder und Tabellen in typisierte Elemente verwandelt, Titel, Tabellen, Listen und Fließtext, dazu eine gehostete Plattform, die Konnektoren, Änderungserkennung und die Strategien ergänzt, die die Bibliothek nicht mitliefert. ",{"tag":110,"children":111},"strong",[112],"Die Bibliothek ist für fast jeden der richtige Einstieg; die Plattform lohnt sich nur dann zu bezahlen, wenn Tabellen oder gescannte Archive darüber entscheiden, ob die Pipeline überhaupt funktioniert.",{"type":106,"content":114},[115],"Die Schicht steht vorn im Stack, vor Chunking, Embedding und Retrieval, und konkurriert mit LlamaParse, Docling, Reducto, Azure Document Intelligence und den Parsing-Endpunkten der großen Cloud-Anbieter. Ihr Vorteil ist nicht, dass sie jeden Benchmark gewinnt, die eigenen veröffentlichten Zahlen sagen für das Open-Source-Bauhaus das Gegenteil, sondern dass der Kern lokal unter einer freien Lizenz läuft: Diese Schicht schreibt weder eine Vektordatenbank, noch einen Chunker noch einen Hosting-Ort vor.",{"type":117,"level":118,"id":81,"text":82},"heading",2,{"type":106,"content":120},[121,122,126,127,130,131,134,135,138,139,138,142,145,146,149,150,153],"Installation mit ",{"tag":123,"children":124},"code",[125],"pip install \"unstructured[all-docs]\"",", dann ",{"tag":123,"children":128},[129],"partition()"," auf eine Datei aufrufen und man erhält eine Liste von Element-Objekten mit Typ, Text und Metadaten wie Seitenzahl und Bounding-Box. Das Argument ",{"tag":123,"children":132},[133],"strategy"," wählt die Pipeline: ",{"tag":123,"children":136},[137],"auto",", ",{"tag":123,"children":140},[141],"fast",{"tag":123,"children":143},[144],"hi_res"," und ",{"tag":123,"children":147},[148],"ocr_only"," in der Bibliothek, ",{"tag":123,"children":151},[152],"vlm"," kommt von der Plattform und schickt Seiten durch ein Vision-Modell. Darum herum liegt eine Kette, partition, chunk, enrich, embed und load, die die Plattform als Job ausführt und die Bibliothek als normale Funktionen.",{"type":155,"ordered":156,"items":157},"list",false,[158,160,162,164,178,180,182],[159],"Lizenz und Eigentümer: Apache-2.0 für die Bibliothek; die Plattform ist ein kommerzielles Produkt von Unstructured mit Gratis-Tarif, Pay-as-you-go und individuellem Tarif.",[161],"Abdeckung: die Preisliste nennt über 45 unterstützte Dateitypen und über 40 Konnektoren, verteilt auf mehr als 20 Quellen und mehr als 20 Ziele.",[163],"Ausgabe: typisierte Elemente wie Title, NarrativeText, Table, ListItem und Image, mit Seitenzahlen, Koordinaten und Element-Metadaten statt einer Textwand.",[165,166,138,168,138,170,145,172,174,175,177],"Strategien: ",{"tag":123,"children":167},[137],{"tag":123,"children":169},[141],{"tag":123,"children":171},[144],{"tag":123,"children":173},[148]," lokal, dazu ",{"tag":123,"children":176},[152]," und die Anreicherungsschritte auf der Plattform.",[179],"Chunking: nach Titel, nach Seite, nach Zeichenzahl und nach Ähnlichkeit, kontextuelles Chunking gibt es als Plattform-Funktion.",[181],"Benchmarks: Unstructured veröffentlicht Ergebnisse über 1.000+ Unternehmensseiten gegen Reducto, LlamaParse, Docling, Snowflake, Databricks und NVIDIA.",[183,184,187,188,191],"Telemetrie: die Bibliothek meldet anonyme Nutzungsdaten, solange ",{"tag":123,"children":185},[186],"DO_NOT_TRACK"," oder ",{"tag":123,"children":189},[190],"SCARF_NO_ANALYTICS"," nicht gesetzt ist.",{"type":117,"level":118,"id":84,"text":85},{"type":106,"content":194},[195,196,198,199,201,202,204],"Ein Lauf liest die Datei, rendert die Seiten, wenn die Strategie Pixel braucht, und klassifiziert dann Bereiche in Elemente. ",{"tag":123,"children":197},[141]," nimmt den eingebetteten Text und beschriftet ihn; ",{"tag":123,"children":200},[144]," läuft Layout-Erkennung und OCR über das Seitenbild, deshalb langsamer, deshalb mit installiertem Modell-Stack, und deshalb die Strategie, die noch Tabellen liefert, die sich lohnen; ",{"tag":123,"children":203},[148]," ist die Rückfallebene, wenn eine Seite überhaupt keinen Textlayer hat. Danach fasst das Chunking Elemente unter einem Zeichenbudget zusammen und versucht dabei, eine Überschrift nicht von ihrem Absatz zu trennen.",{"type":206,"attrs":207,"inner":211,"caption":212},"diagram",{"viewBox":208,"role":209,"aria-labelledby":210},"0 0 760 290","img","d-uzz-t d-uzz-d","\u003Ctitle id=\"d-uzz-t\">Wie ein Dokument zu durchsuchbarem Text wird\u003C\u002Ftitle>\u003Cdesc id=\"d-uzz-d\">Quelldateien kommen oben hinein und werden vom Partition-Schritt in typisierte Elemente zerlegt, der das Layout liest und OCR ausführt. Die Elemente werden nach Titel, Seite oder Größe zu Chunks zusammengefasst, mit Metadaten und Tabellenstruktur angereichert, in Vektoren eingebettet und in eines von über zwanzig Ziel-Systemen geladen.\u003C\u002Fdesc>\u003Cdefs>\u003Cmarker id=\"ah-p\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head\" \u002F>\u003C\u002Fmarker>\u003Cmarker id=\"ah-pa\" viewBox=\"0 0 10 10\" refX=\"9\" refY=\"5\" markerWidth=\"7\" markerHeight=\"7\" orient=\"auto-start-reverse\">\u003Cpath d=\"M0 0L10 5L0 10z\" class=\"d-head-accent\" \u002F>\u003C\u002Fmarker>\u003C\u002Fdefs>\u003Crect x=\"260\" y=\"16\" width=\"240\" height=\"42\" rx=\"10\" class=\"d-sky\" \u002F>\u003Ctext x=\"380\" y=\"43\" text-anchor=\"middle\" class=\"d-text\">Quelldateien\u003C\u002Ftext>\u003Crect x=\"40\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"110\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">partition\u003C\u002Ftext>\u003Ctext x=\"110\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Layout + OCR\u003C\u002Ftext>\u003Crect x=\"220\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-accent\" \u002F>\u003Ctext x=\"290\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">chunk\u003C\u002Ftext>\u003Ctext x=\"290\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Titel, Seite, Größe\u003C\u002Ftext>\u003Crect x=\"400\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-box\" \u002F>\u003Ctext x=\"470\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">anreichern\u003C\u002Ftext>\u003Ctext x=\"470\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Metadaten, Tabellen\u003C\u002Ftext>\u003Crect x=\"580\" y=\"118\" width=\"140\" height=\"76\" rx=\"10\" class=\"d-gold\" \u002F>\u003Ctext x=\"650\" y=\"150\" text-anchor=\"middle\" class=\"d-text\">einbetten\u003C\u002Ftext>\u003Ctext x=\"650\" y=\"174\" text-anchor=\"middle\" class=\"d-small\">Vektoren + Keys\u003C\u002Ftext>\u003Cpath d=\"M380 58 L110 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M380 58 L290 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M380 58 L470 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M380 58 L650 114\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M184 156 H214\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M364 156 H394\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M544 156 H574\" class=\"d-line\" marker-end=\"url(#ah-p)\" \u002F>\u003Cpath d=\"M650 198 V242\" class=\"d-line-accent\" marker-end=\"url(#ah-pa)\" \u002F>\u003Ctext x=\"650\" y=\"266\" text-anchor=\"middle\" class=\"d-title\">über 20 Ziele\u003C\u002Ftext>",[213],"Jeder Schritt ist in der Bibliothek ein eigener Aufruf und auf der Plattform ein eigener Schritt, deshalb lässt sich eine Pipeline ab der Mitte neu starten, ohne das gesamte Korpus neu zu parsen.",{"type":106,"content":215},[216],"Das Ergebnis steht und fällt mit der Elementgrenze. Eine Tabelle, die als HTML mit intakter Kopfzeile herauskommt, wird zu einem nützlichen Knoten; dieselbe Tabelle als Fließtext gelesen wird zu mehreren Chunks, von denen jeder die Hälfte einer Zahl enthält. Das ist das ganze Argument für diese Schicht, und zugleich der ganze Grund, das Parser-Ergebnis zu lesen, bevor man das Embedding-Modell wechselt.",{"type":117,"level":118,"id":87,"text":88},{"type":106,"content":219},[220],"Das Quickstart der Bibliothek ist ein einziger Funktionsaufruf. Das Snippet unten parst ein PDF mit der High-Resolution-Strategie, behält die Tabellenstruktur, chunkt nach Titel und schreibt das Ergebnis als JSON.",{"type":123,"code":222},"from unstructured.partition.auto import partition\nfrom unstructured.chunking.title import chunk_by_title\nfrom unstructured.staging.base import elements_to_json\n\n# strategy: auto, fast, hi_res or ocr_only; hi_res is the one that keeps table structure\nelements = partition(\n    filename=\"report.pdf\",\n    strategy=\"hi_res\",\n    infer_table_structure=True,\n)\nchunks = chunk_by_title(elements, max_characters=1_200, combine_under=300)\n\nelements_to_json(chunks, filename=\"report.elements.json\")\nprint(len(elements), \"elements,\", len(chunks), \"chunks\")",{"type":106,"content":224},[225,226,228],"Für alles jenseits eines lokalen Experiments ist die Plattform der gepflegte Weg: derselbe Partition-Schritt hinter einer API oder einem geplanten Job, Konnektoren zu S3, SharePoint, Google Drive und weiteren, Änderungserkennung, damit nur neue oder geänderte Dateien verarbeitet werden, sowie die Strategie ",{"tag":123,"children":227},[152],". Die Bibliothek bleibt der Ort, an dem der eigentliche Parsing-Code lebt, und die Dokumentation ist darum herum geschrieben.",{"type":230,"variant":231,"title":232,"body":233},"callout","tip","Elemente lesen, bevor man Embeddings anfasst",[234],[235],"Hundert Seiten des eigenen Korpus partitionieren und das Ergebnis lesen: Elementtypen, Tabellenstruktur, Leserichtung. Der Fehler in dieser Schicht ist still, ein Parser, der die halbe Tabelle verliert, liefert sauberes JSON, und jede Kennzahl weiter unten beschuldigt stattdessen den Retriever.",{"type":117,"level":118,"id":90,"text":91},{"type":106,"content":238},[239,240,242,243,245,246,248],"Die Plattform rechnet Seiten ab: 10.000 gratis zum Start, danach 0,015 Dollar pro Seite, ein gescanntes Archive mit 400 Seiten kostet also sechs Dollar Parsing, bevor jemand eine Frage gestellt hat. Die Bibliothek rechnet in CPU und Wandzeit ab: ",{"tag":123,"children":241},[141]," ist nahezu I\u002FO-gebunden, ",{"tag":123,"children":244},[144]," führt pro Seite ein Layout-Modell und OCR aus, und ",{"tag":123,"children":247},[152]," verlagert die Rechnung von Rechenzeit auf Modell-Tokens.",{"type":250,"head":251,"rows":260},"table",[252,254,256,258],[253],"Pipeline",[255],"Adjusted CCT",[257],"Tokens added",[259],"Table cell content",[261,270,279,288],[262,264,266,268],[263],"Unstructured Plattform",[265],"0.880",[267],"0.051",[269],"0.820",[271,273,275,277],[272],"Unstructured Open Source",[274],"0.715",[276],"0.119",[278],"0.426",[280,282,284,286],[281],"LlamaParse VLM",[283],"0.835",[285],"0.069",[287],"0.522",[289,291,293,295],[290],"Docling Standard",[292],"0.716",[294],"0.135",[296],"0.657",{"type":106,"content":298},[299],"Die Zahlen stammen aus dem eigenen Benchmark von Unstructured über 1.000+ Unternehmensseiten, gescannte Rechnungen, verschachtelte Tabellen und Handschrift, und ein Anbieter-Vergleich ist Marketing, deshalb ist das brauchbare Signal die Lücke innerhalb eines einzigen Produkts: 0,426 gegen 0,820 Tabellenzellen-Inhalt zwischen dem Open-Source-Bauhaus und der besten Plattform-Pipeline, und 0,715 gegen 0,880 bei der bereinigten Textgenauigkeit. Element Alignment, ob ein Bereich als Überschrift, Tabelle oder Absatz beschriftet wurde, ist der Wert, bei dem alle Werkzeuge dieser Tabelle zwischen 0,53 und 0,61 zusammenliegen, und das ist die ehrliche Schwierigkeit dieser Schicht.",{"type":155,"ordered":156,"items":301},[302,304,312],[303],"Einmal parsen und das Element-JSON behalten: dasselbe Korpus beim Chunking-Experiment neu zu partitionieren, ist der häufigste Weg, auf dem diese Schicht Geld verbrennt.",[305,306,308,309,311],"Die Strategie pro Dokumenttyp wählen und nicht pro Korpus: ",{"tag":123,"children":307},[141]," für digitalen Text, ",{"tag":123,"children":310},[144]," für Scans und alles mit Tabellen.",[313],"Seiten zählen und nicht Dateien, denn ein Preis pro Seite macht aus einer 400-Seiten-PDF den Kostenfaktor, nicht die Zahl der Dokumente.",{"type":106,"content":315},[316],"Nichts davon ist speziell für diesen Anbieter, jeder Parser tauscht Recall gegen Rechenzeit. Speziell ist allein, dass die Zahlen überhaupt veröffentlicht werden, in einer Tabelle mit Namen der Wettbewerber, und das ist mehr, als der Rest der Branche offenlegt.",{"type":117,"level":118,"id":93,"text":94},{"type":106,"content":319},[320],"Zwei Produkte, ein Name. Die Bibliothek ist Apache-2.0 und gratis: installieren, auf der eigenen Maschine laufen lassen, kein Konto und keine Seitenzahl. Die Plattform ist dasselbe Parsing, verpackt in verwaltete Jobs, Konnektoren und Compliance, abgerechnet pro Seite.",{"type":155,"ordered":156,"items":322},[323,325,327,329],[324],"Bibliothek: Apache-2.0, Installation von PyPI, unbegrenzte Seiten, eigene Hardware.",[326],"Gratis: 10.000 Seiten zum Start, keine Karte nötig, alle Funktionen enthalten.",[328],"Pay-as-you-go: 0,015 Dollar pro Seite nach den ersten 10.000 Seiten, alle Funktionen enthalten.",[330],"Business: individueller Preis für eine dedizierte Instanz, VPC oder Bare-Metal, Mehrbenutzerkonten, rollenbasierte Zugriffskontrolle und die Compliance-Nachweise des Anbieters.",{"type":117,"level":118,"id":96,"text":97},{"type":106,"content":333},[334],"Mit den Schwächen beginnen. Das Open-Source-Bauhaus ist der schwächere Parser, und die eigene Tabelle des Anbieters sagt das: 0,426 Tabellenzellen-Inhalt gegen 0,820 bei der besten Plattform-Pipeline, 0,119 erfundene Tokens gegen 0,051. Der Preis geht pro Seite, was geburtsschicke PDFs belohnt und Scans bestraft, und eine Seite ist eine schlechte Einheit, wenn die eine einen Absatz enthält und die nächste eine Tabelle mit 400 Zellen. Die Funktionen, weshalb sich die Plattform mieten lässt, VLM-Partitionierung, inkrementelle Änderungserkennung, über 40 gepflegte Konnektoren und die Compliance-Geschichte, sind genau das, was die Lizenz nicht enthält. Und das Ergebnis braucht weiterhin Stichproben: Leserichtung und Tabellenstruktur sind die beiden Felder, die ohne Fehler still scheitern.",{"type":250,"head":336,"rows":344},[337,339,340,342],[338],"Werkzeug",[82],[341],"Wo es gewinnt",[343],"Was man aufgibt",[345,353,362,371],[346,347,349,351],[25],[348],"Bibliothek plus gehostete Plattform",[350],"Lokaler Lauf unter Apache-2.0 mit veröffentlichtem Qualitäts-Benchmark",[352],"Abrechnung pro Seite, und die starken Zahlen brauchen die bezahlte Pipeline",[354,356,358,360],[355],"LlamaParse",[357],"Gehosteter Parser des LlamaIndex-Teams",[359],"Schneller Start und enge LlamaIndex-Integration",[361],"Nur gehostet, jede Seite verlässt das eigene Netzwerk",[363,365,367,369],[364],"Docling",[366],"Open-Source-Parser von IBM",[368],"Eine Abhängigkeit, MIT-Lizenz, starke Tabellenausgabe",[370],"Weniger Dateitypen und keine verwaltete Konnektorebene",[372,374,376,378],[373],"Reducto",[375],"Gehostete Parsing-API mit Layout-Steuerung",[377],"Tabellengenauigkeit und Layout-Steuerung als Dienst",[379],"Nur API: kein lokaler Lauf und keine Bibliothek zum Erweitern",{"type":106,"content":381},[382,383,386],"Die eigentliche Frage ist, wer die Qualität bezahlt. Wenn das Korpus digitaler Text ist und Ausgabe reicht, kostet die Bibliothek mit ",{"tag":123,"children":384},[385],"strategy=\"fast\""," nichts pro Seite und ist für die Aufgabe die richtige Größe. Wenn Tabellen, Scans oder regulierte Daten darüber entscheiden, ob die Pipeline funktioniert, ist die Plattform oder ein Spezial-Parser der Kauf, und der einzige Test, der zählt, ist einhundert Seiten der eigenen Dokumente, bewertet an genau den Feldern, die man wirklich liest.",{"type":230,"variant":388,"title":389,"body":390},"warn","Telemetrie und was das Gerät verlässt",[391],[392,393,145,396,399],"Mit der Bibliothek bleiben die Dokumente lokal, aber das Paket meldet standardmäßig anonyme Nutzungsdaten; ",{"tag":123,"children":394},[395],"DO_NOT_TRACK=1",{"tag":123,"children":397},[398],"SCARF_NO_ANALYTICS=1"," schalten das ab. Die Plattform schickt Seiten definitionsgemäß an einen gehosteten Dienst, und die Sicherheitsseiten nennen Verschlüsselung beim Transport, Zero Data Retention und dedizierte Inferenz für Teams, die das nicht dürfen.",{"type":117,"level":118,"id":99,"text":100},{"type":106,"content":402},[403],"Unstructured ist der sicherste Standard am Anfang einer Retrieval-Pipeline, weil er langweilig, lokal und messbar ist: eine Funktion, die typisierte Elemente zurückgibt, ein Benchmark, über den man streiten kann, und eine bezahlte Stufe, in die man wechseln kann, ohne die Ingestion umzuschreiben. Tatsächlich entschieden wird, wie viel Parsing-Qualität das Produkt braucht, und die eigenen Zahlen des Anbieters sagen, dass das gratis Bauhaus nicht das bezahlte ist.",{"type":155,"ordered":405,"items":406},true,[407,409,411,413,419],[408],"Bibliothek nutzen, wenn bereits eine Pipeline existiert und typisierte Elemente statt Rohtext braucht; sie ist Apache-2.0, läuft lokal und lässt sich austauschen, ohne den Rest des Stacks anzufassen.",[410],"Plattform nutzen, wenn Seiten aus S3, SharePoint oder Confluence kommen und Konnektoren, Änderungserkennung und ein Audit-Trail gebraucht werden.",[412],"Nicht als Parser of Record für Finanztabellen akzeptieren, ohne die eigenen Dokumente zu bewerten; die Lücke zwischen Strategien in einem Produkt ist größer als die zwischen Anbietern.",[414,415,418],"Nicht wählen, wo ein schwerer lokaler Abhängigkeitsbaum unzulässig ist, denn ",{"tag":123,"children":416},[417],"unstructured[all-docs]"," zieht den OCR- und Layout-Stack mit, während Docling oder eine gehostete API viel leichter sind.",[420],"Von Anfang an in Seiten budgetieren; ein Preis pro Seite ist leicht modelliert und mit gescannten Archiven leicht überschritten.",{"type":422,"content":423},"quote",[424],"Dokument-Parsing als gemessenen Schritt behandeln und nicht als Rohrleitung: die Strategie an einer Stichprobe der eigenen Seiten wählen, das Element-JSON behalten und den Parser erst wechseln, wenn sich die Tabellenzahlen bewegen.",{"type":117,"level":118,"id":102,"text":103},{"type":155,"ordered":405,"items":427},[428,433,437,441,445,449],[429],{"tag":430,"href":30,"children":431},"a",[432],"Unstructured-Dokumentation: Pipeline-Überblick",[434],{"tag":430,"href":33,"children":435},[436],"Unstructured-Dokumentation: Transform-Quickstart",[438],{"tag":430,"href":36,"children":439},[440],"Unstructured-Preise: freie Seiten, Preis pro Seite und Tarife",[442],{"tag":430,"href":39,"children":443},[444],"Unstructured-Benchmarks: 1.000+ Unternehmensseiten gegen andere Parser",[446],{"tag":430,"href":42,"children":447},[448],"Unstructured-Bibliothek auf GitHub",[450],{"tag":430,"href":45,"children":451},[452],"Unstructured Partition-Endpoint-Container",[454,503,559,602],{"slug":455,"published":456,"minutes":6,"category":7,"tags":457,"keywords":463,"about":472,"sources":476,"cover":495,"og":496,"expertise":48,"locales":497,"lang":51,"title":498,"description":499,"coverAlt":500,"url":501,"pricing":502,"kind":458},"zep","2026-10-06",[458,459,460,461,462],"Agent memory","Knowledge graph","Temporal graph","Context engineering","RAG",[464,465,466,467,468,469,470,471],"zep ai","zep agent memory","graphiti knowledge graph","zep pricing","zep vs mem0","long-term memory for agents","temporal knowledge graph","zep cloud",[473],{"name":474,"url":475},"Zep","https:\u002F\u002Fwww.getzep.com\u002F",[477,480,483,486,489,492],{"title":478,"url":479},"Zep pricing: plans, credits and limits","https:\u002F\u002Fwww.getzep.com\u002Fpricing",{"title":481,"url":482},"Zep documentation","https:\u002F\u002Fhelp.getzep.com\u002F",{"title":484,"url":485},"Graphiti on GitHub","https:\u002F\u002Fgithub.com\u002Fgetzep\u002Fgraphiti",{"title":487,"url":488},"Graphiti product page","https:\u002F\u002Fwww.getzep.com\u002Fplatform\u002Fgraphiti\u002F",{"title":490,"url":491},"Announcing a new direction for Zep's open-source strategy","https:\u002F\u002Fwww.getzep.com\u002Fblog\u002Fannouncing-a-new-direction-for-zeps-open-source-strategy\u002F",{"title":493,"url":494},"Graphiti: temporal knowledge graphs for AI agents (arXiv)","https:\u002F\u002Farxiv.org\u002Fabs\u002F2501.13956","\u002Fimages\u002Fblog\u002Fzep\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fzep\u002Fog.jpg",[50,51,52],"Zep-Review: Agenten-Memory auf einem temporalen Graphen","Zep ist eine gehostete Agenten-Memory-API auf einem temporalen Knowledge Graph: Credits beim Schreiben, Retrieval gratis, Flex ab 125 Dollar im Monat, Graphiti als selbst hostbarer Teil.","Diagramm, wie eine Aussage in Zep den Prompt erreicht: Nachrichten und Aussagen werden in einen benutzerspezifischen Context Graph aus Entitäten und Beziehungen extrahiert, und der Retrieval durchläuft den Graphen und liefert einen Kontextblock mit den tragenden Fakten.","https:\u002F\u002Fwww.getzep.com","Apache-2.0 core · Cloud from $50 per month",{"slug":504,"published":505,"minutes":506,"category":7,"tags":507,"keywords":511,"about":519,"sources":526,"cover":551,"og":552,"expertise":48,"locales":553,"lang":51,"title":554,"description":555,"coverAlt":556,"url":557,"pricing":558,"kind":521},"lancedb","2026-09-21",9,[508,509,510,462],"Vector search","Hybrid search","Embedded database",[504,512,513,514,515,516,517,518],"lancedb review","lance vector database","embedded vector database","lancedb vs qdrant","hybrid search rrf","lancedb indexing","lance data format",[520,523],{"name":521,"url":522},"Vector database","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FVector_database",{"name":524,"url":525},"Apache Arrow","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FApache_Arrow",[527,530,533,536,539,542,545,548],{"title":528,"url":529},"LanceDB quickstart","https:\u002F\u002Fdocs.lancedb.com\u002Fquickstart",{"title":531,"url":532},"LanceDB vector indexes","https:\u002F\u002Fdocs.lancedb.com\u002Findexing\u002Fvector-index",{"title":534,"url":535},"LanceDB indexing guide","https:\u002F\u002Fdocs.lancedb.com\u002Findexing\u002Findex",{"title":537,"url":538},"LanceDB hybrid search","https:\u002F\u002Fdocs.lancedb.com\u002Fsearch\u002Fhybrid-search",{"title":540,"url":541},"LanceDB Enterprise","https:\u002F\u002Fdocs.lancedb.com\u002Fenterprise",{"title":543,"url":544},"LanceDB frequently asked questions","https:\u002F\u002Fdocs.lancedb.com\u002Ffaq\u002Ffaq-oss",{"title":546,"url":547},"LanceDB pricing","https:\u002F\u002Flancedb.com\u002Fpricing",{"title":549,"url":550},"LanceDB on PyPI","https:\u002F\u002Fpypi.org\u002Fproject\u002Flancedb\u002F","\u002Fimages\u002Fblog\u002Flancedb\u002Fcover.webp","\u002Fimages\u002Fblog\u002Flancedb\u002Fog.jpg",[50,51,52],"LanceDB: Vektorsuche, die als Bibliothek beginnt","Ein Test von LanceDB: eine Apache-2.0-Bibliothek statt Server, die IVF- und HNSW-Indexwahl, Hybridsuche mit Rangfusion und was Enterprise zusätzlich bringt.","Coverbild zum LanceDB-Test: eine Lance-Tabelle speist einen Vektorindex und einen Volltextindex in eine verschmolzene Rangliste","https:\u002F\u002Flancedb.com","Apache-2.0 · Cloud paid",{"slug":560,"published":505,"minutes":561,"category":7,"tags":562,"keywords":566,"about":573,"sources":579,"cover":594,"og":595,"expertise":48,"locales":596,"lang":51,"title":597,"description":598,"coverAlt":599,"url":575,"pricing":600,"kind":601},"pgvector",10,[508,563,564,462,565],"Postgres","HNSW","Quantisation",[560,567,568,569,570,571,572],"pgvector vs qdrant","postgres vector search","hnsw index postgres","iterative index scans","binary quantization postgres","vector database postgres",[574,576],{"name":560,"url":575},"https:\u002F\u002Fgithub.com\u002Fpgvector\u002Fpgvector",{"name":577,"url":578},"PostgreSQL","https:\u002F\u002Fen.wikipedia.org\u002Fwiki\u002FPostgreSQL",[580,582,585,588,591],{"title":581,"url":575},"pgvector README",{"title":583,"url":584},"pgvector changelog","https:\u002F\u002Fgithub.com\u002Fpgvector\u002Fpgvector\u002Fblob\u002Fmaster\u002FCHANGELOG.md",{"title":586,"url":587},"PostgreSQL news: pgvector 0.8.2 released","https:\u002F\u002Fwww.postgresql.org\u002Fabout\u002Fnews\u002Fpgvector-082-released-3245\u002F",{"title":589,"url":590},"AWS: Scale pgvector with binary quantization","https:\u002F\u002Faws.amazon.com\u002Fblogs\u002Fdatabase\u002Fscale-pgvector-with-binary-quantization-on-amazon-aurora-postgresql\u002F",{"title":592,"url":593},"pgvector licence","https:\u002F\u002Fgithub.com\u002Fpgvector\u002Fpgvector\u002Fblob\u002Fmaster\u002FLICENSE","\u002Fimages\u002Fblog\u002Fpgvector\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fpgvector\u002Fog.jpg",[50,51,52],"pgvector im Review: die Vektordatenbank, die du nicht betreiben musst","Ein Review von pgvector 0.8.7: iterative Index-Scans für gefilterte Suche, HNSW und IVFFlat, Binärquantisierung bei 100 Millionen Vektoren und das CVE im Indexaufbau.","Eine Anfrage teilt sich oben in einen exakten Sequenzscan, einen HNSW-Graphlauf und eine IVFFlat-Sonde; ein Band unten zeigt einen iterativen Scan, der weiterläuft, bis die LIMIT-Zahl erreicht ist.","PostgreSQL licence","Vector database extension",{"slug":603,"published":604,"minutes":561,"category":7,"tags":605,"keywords":607,"about":613,"sources":617,"cover":645,"og":646,"expertise":48,"locales":647,"lang":51,"title":648,"description":649,"coverAlt":650,"url":616,"pricing":651,"kind":458},"mem0","2026-09-17",[458,606,462,508],"Long-term memory",[603,608,609,610,611,469,612],"mem0 review","agent memory layer","mem0 self-hosted","mem0 pricing","mem0 alternatives",[614],{"name":615,"url":616},"Mem0","https:\u002F\u002Fmem0.ai",[618,621,624,627,630,633,636,639,642],{"title":619,"url":620},"Mem0 documentation","https:\u002F\u002Fdocs.mem0.ai\u002Fintroduction",{"title":622,"url":623},"Mem0 quickstart","https:\u002F\u002Fdocs.mem0.ai\u002Fquickstart",{"title":625,"url":626},"How Mem0 works","https:\u002F\u002Fdocs.mem0.ai\u002Fcore-concepts\u002Fhow-it-works",{"title":628,"url":629},"Mem0 pricing","https:\u002F\u002Fmem0.ai\u002Fpricing",{"title":631,"url":632},"Mem0 on GitHub","https:\u002F\u002Fgithub.com\u002Fmem0ai\u002Fmem0",{"title":634,"url":635},"mem0ai on PyPI","https:\u002F\u002Fpypi.org\u002Fproject\u002Fmem0ai\u002F",{"title":637,"url":638},"Mem0 research and benchmarks","https:\u002F\u002Fmem0.ai\u002Fresearch",{"title":640,"url":641},"Mem0 MCP server","https:\u002F\u002Fdocs.mem0.ai\u002Fplatform\u002Fmem0-mcp",{"title":643,"url":644},"Mem0 paper on arXiv","https:\u002F\u002Farxiv.org\u002Fabs\u002F2504.19413","\u002Fimages\u002Fblog\u002Fmem0\u002Fcover.webp","\u002Fimages\u002Fblog\u002Fmem0\u002Fog.jpg",[50,51,52],"Mem0: was eine Agent-Speicherschicht pro Runde kostet","Ein Review von Mem0: extrahierte Fakten pro Runde, die Benchmark-Tabelle vom April 2026 mit Plattform-Vorbehalt, vier Cloud-Stufen und die Lücken beim Self-Hosting.","Eine Schleife, die aus Gespräch gespeicherte Fakten macht und sie zurück in den Prompt liest","Free tier · from $19 per month",1791383550870]