Tabellenextraktion,die die Fußnoten liest.
An komplexen Tabellen scheitert Dokumentenextraktion üblicherweise: mehrseitig, verschachtelt und mit Hinweisen versehen, die verändern, was die Zahlen bedeuten. MiruIQ extrahiert sie zeilengenau und liest sie so, wie es ein sorgfältiger Mensch tun würde.
Vom Tabellenbild zu sauberen Zeilen.
Drei Fähigkeiten entscheiden, ob Tabellenextraktion reale Dokumente übersteht.
Strukturrekonstruktion
Zeilen, Spalten, verbundene Zellen und Fortsetzungsseiten werden zu einer logischen Tabelle rekonstruiert, nicht zu Fragmenten pro Seite.
Interpretierende Hinweise
Ein Hinweis über der Tabelle, dass Beträge in Tausendern angegeben oder Nullen bewusst gekürzt sind, verändert, wie jeder Wert gelesen wird.
Schema-Mapping
Extrahierte Zeilen landen in der Struktur Ihres Schemas: typisierte Beträge, Datumsangaben und Kennungen, bereit für die Validierung.
Nicht die Tabelle ist das Schwierige; ihr Kontext ist es.
Ein sauberes Raster kann jedes moderne Modell lesen. Reale Tabellen kommen mit Legenden, Fußnoten, Währungsangaben im Kopf und Abkürzungen, die die Zellen neu definieren, und naive Extraktion produziert stillschweigend falsche Daten, weil sie die Zahlen wörtlich nimmt.
MiruIQ behandelt diese Hinweise als Teil der Tabelle. Die Extraktion läuft gegen Ihr Schema mit dem umgebenden Text im Blick, und die Validierung rechnet nach, was aufgehen muss; eine falsch gelesene Tabelle fällt so durch eine Prüfung, statt Ihre Systeme zu erreichen. Die unsicheren Fälle parken in der menschlichen Prüfung, mit der Tabelle in der Seitenansicht hervorgehoben.
Fragen zur Tabellenextraktion
Was Teams mit tabellenlastigen Dokumenten am häufigsten fragen.
Ja, genau das ist die Kernfähigkeit: Interpretierende Hinweise über oder unter einer Tabelle (Beträge in Tausendern, Nullen bewusst gekürzt, Währung einmal im Kopf angegeben) werden bei der Extraktion auf die Werte angewendet. Die Ausgabe enthält die Zahlen, wie sie gemeint sind, nicht, wie sie gedruckt sind.
Tabellen, die sich über Seiten fortsetzen, werden zu einer logischen Tabelle zusammengesetzt; verschachtelte Strukturen extrahieren in verschachtelte Schemafelder; und unregelmäßige Layouts (gruppierte Zeilen, Zwischensummen, gemischte Zeilentypen) werden bewältigt, indem die Zielstruktur im Schema beschrieben wird, statt auf ein sauberes Raster zu hoffen.
Den Nachweis erbringt die Validierung: Zeilenbeträge werden gegen ausgewiesene Summen aufsummiert, laufende Salden auf Kontinuität geprüft und Anzahlen mit deklarierten Anzahlen verglichen. Tabellen, die durchfallen, parken in der Prüfung, wo der Prüfer die extrahierten Zeilen neben der hervorgehobenen Quellregion sieht. Korrektheit wird geprüft, nicht angenommen.
Sehen Sie es auf Ihren eigenen Dokumenten.
Das kostenlose 14-Tage-Trial umfasst 200 Dokumente: genug, um Ihre Schemas zu definieren, echte Dateien zu verarbeiten und die Ergebnisse zu messen, bevor Sie jemand anruft.
