Was ist Normalisierungvon Dokumentdaten?
Normalisierung führt denselben Wert hinter verschiedenen Wörtern, Formaten und Layouts in ein konsistentes Feld zusammen: Bruttolohn, Lohn und salario werden zu einer einzigen gross-pay-Spalte.
Viele Schreibweisen, ein Feld.
Dokumente drücken denselben Sachverhalt in endlosen Varianten aus: Daten in sechs Formaten, Beträge mit unterschiedlichen Trennzeichen und vor allem Vokabular, wo das Bruttogehalt je nach Aussteller und Sprache Bruttolohn, Lohn, salario oder gross pay heißen kann. Normalisierung ist der Schritt, der alle Varianten auf ein Schema mit konsistenten Typen, Einheiten und Namen abbildet.
Ohne sie sind extrahierte Daten technisch strukturiert, aber praktisch unbrauchbar: Jeder nachgelagerte Konsument würde das Mapping neu implementieren. Mit ihr landen zehntausend Lohnabrechnungen von tausend Arbeitgebern in einer sauberen Tabelle.
Semantisches Mapping
Werte werden als Konzepte erkannt, sodass Wort- und Sprachunterschiede in einem Feld zusammenfallen.
Formatdisziplin
Daten, Beträge, Währungen und Kennungen kommen typisiert und konsistent formatiert an.
Schema als Vertrag
Die normalisierte Form wird einmal definiert und gilt über jeden Aussteller und jedes Layout hinweg.
Normalisierung in MiruIQ.
Die Normalisierung ist in die schemabasierte Extraktion eingebaut: Das Schema definiert die Zielform, die Extraktion nach Bedeutung erledigt das Mapping, und Live-Mapping-Sammlungen lassen Prüfer Wertzuordnungen erweitern, ohne irgendetwas neu zu deployen.
Fragen zur Normalisierung von Dokumentdaten
Was Datenteams zur Normalisierung fragen.
Auf einer Schweizer Lohnabrechnung steht Bruttolohn, auf einer deutschen Gesamtbrutto, auf einer italienischen salario lordo. Alle drei werden in dasselbe Feld gross_pay extrahiert, als typisierter Betrag mit Währung. Daten kommen unabhängig vom Quellformat als ISO-Daten an, und IBANs werden einheitlich validiert und formatiert. Das empfangende System sieht eine einzige Form.
Ja, das ist ihre Hauptaufgabe in europäischen Dokumentenflüssen: Extraktion nach Bedeutung ist sprachunabhängig, gemischte Zuläufe aus Deutsch, Französisch, Italienisch und Englisch normalisieren also in ein Schema. MiruIQ verarbeitet Dokumente in der Sprache, in der sie eintreffen; die Ausgabesprache ist die Ihres Schemas.
Sehen Sie es auf Ihren eigenen Dokumenten.
Das kostenlose 14-Tage-Trial umfasst 200 Dokumente: genug, um Ihre Schemas zu definieren, echte Dateien zu verarbeiten und die Ergebnisse zu messen, bevor Sie jemand anruft.
