Was ist schemabasierteExtraktion?
Schemabasierte Extraktion heißt: die benötigten Daten einmal als Schema definieren und aus jedem Dokumentlayout nach Bedeutung extrahieren, ohne Vorlagen und ohne Vortraining pro Typ.
Beschreiben Sie die Daten, nicht das Dokument.
Bei schemabasierter Extraktion beschreiben Sie die Ausgabe: welche Felder, welche Typen, welche Struktur. Die Extraktion findet diese Felder im Dokument nach Bedeutung, egal wo das Layout sie platziert. Die alternativen Ansätze beschreiben stattdessen die Eingabe: Vorlagen verankern Pixelpositionen pro Layout, und vortrainierte Modelle legen einen Katalog unterstützter Dokumenttypen fest.
Der Unterschied zeigt sich an den Rändern. Ein neuer Lieferant, eine neu gestaltete Lohnabrechnung oder ein Dokumenttyp, den Ihre eigene Branche erfunden hat, braucht keine neue Einrichtung: Wenn das Schema ihn beschreibt, wird er extrahiert. Die Pflege verlagert sich vom Am-Leben-Halten von Vorlagen zum gelegentlichen Verfeinern eines Schemas.
Eine Definition
Ein Schema beschreibt Felder, Typen und Struktur einmal, für alle Layouts dieser Dokumentklasse.
Extraktion nach Bedeutung
Werte werden semantisch gefunden: gross pay wird als Konzept erkannt, nicht an einer Koordinate.
Keine Kataloggrenzen
Keine vortrainierte Typenliste: Jedes Dokument, das Sie beschreiben können, wird extrahierbar.
Der Kern von MiruIQ.
Schemabasierte Extraktion ist die Gründungsentscheidung von MiruIQ: Schemas entstehen im Studio oder per Wizard, sind versioniert und werden über Pipelines hinweg wiederverwendet, mit Validierung und menschlicher Prüfung darum herum.
Fragen zur schemabasierten Extraktion
Was Evaluierende zum Schema-Ansatz fragen.
Eine Vorlage sagt, wo Werte auf einem bestimmten Layout sitzen; jedes neue Layout braucht also eine neue Vorlage, und jede Layoutänderung bricht eine. Ein Schema sagt, was Werte bedeuten; Layoutvarianz wird von der Extraktion selbst absorbiert. In Vorlagensystemen wächst die Pflege mit der Zahl Ihrer Lieferanten; in Schemasystemen nicht.
In MiruIQ visuell im Studio, unterstützt vom Wizard, oder als JSON Schema über die API. Ein Schema listet Felder mit Namen, Typen und Beschreibungen auf, einschließlich verschachtelter Strukturen für Positionen und Tabellen. Die meisten Teams starten mit einem Beispieldokument und verfeinern nach den ersten Testläufen.
Sehen Sie es auf Ihren eigenen Dokumenten.
Das kostenlose 14-Tage-Trial umfasst 200 Dokumente: genug, um Ihre Schemas zu definieren, echte Dateien zu verarbeiten und die Ergebnisse zu messen, bevor Sie jemand anruft.
