Modulare Verarbeitung,entwickelt für realeDokumente
Jedes Modul läuft DSGVO-konform im Schweizer Hosting oder On-Premises, lokale KI-Modelle inklusive. MiruIQ ist rund um modulare Verarbeitungseinheiten aufgebaut, sogenannte Module. Jedes Modul erfüllt eine klar definierte Aufgabe (Klassifizierung, KI-Datenextraktion oder Verifizierung) und lässt sich frei zu Pipelines kombinieren.
Classifier Module
Classifier-Module sind MiruIQs Software für Dokumentenklassifizierung: Sie bestimmen, was ein Dokument ist oder was es enthält, und ordnen Dokumente einer oder mehreren Gruppen zu, sobald definierte Bedingungen erfüllt sind.
Klassifizierungsergebnisse werden genutzt, um:
Pipeline Control
Pipeline-Verzweigungen zu steuern
Extraction Logic
die Extraktionslogik auszuwählen
Routing
Dokumente an unterschiedliche Ausgaben zu leiten
Mehrere Classifier können nacheinander oder parallel ausgeführt werden.
Simple Structure Classifier
Identifiziert Dokumente durch den Abgleich mit einer einzelnen, klar definierten Struktur.
Der Classifier prüft, ob ein Dokument die erforderlichen Felder, Abschnitte oder Layout-Merkmale enthält, die einen bestimmten Dokumenttyp definieren, unabhängig von Formatierungsdetails wie Positionierung oder visueller Gestaltung.
Simple Structure Classifier werden typischerweise als erster Entscheidungspunkt in einer Pipeline eingesetzt und schaffen eine verlässliche Grundlage für die nachgelagerte Verarbeitung.
Sie ermöglichen die konsistente Verarbeitung von Dokumenten mit derselben logischen Struktur, selbst wenn sich das Erscheinungsbild im Laufe der Zeit verändert.
Multi-Structure Classifier
Identifiziert Dokumente, die mehrere unabhängige Strukturen in einer einzigen Datei enthalten.
Statt ein Dokument als eine flache Einheit zu behandeln, erkennt und validiert der Multi-Structure Classifier mehrere eigenständige Strukturen, etwa mehrere Tabellen, wiederkehrende Abschnitte oder logisch getrennte Datenblöcke.
Jede erkannte Struktur kann unabhängig verarbeitet werden, für eine granularere Extraktion und Validierung, ohne das Dokument manuell aufteilen zu müssen.
Multi-Structure Classifier sind besonders nützlich bei komplexen Dokumenten, in denen relevante Informationen über verschiedene Abschnitte oder wiederkehrende Muster verteilt sind.
Semantic Classifier
Identifiziert Dokumente anhand ihrer Bedeutung, statt anhand von Struktur, Layout oder exaktem Wortlaut.
Der Classifier bewertet den Inhalt eines Dokuments, um zu bestimmen, was es beschreibt. So kann MiruIQ Dokumente unterscheiden, die eine ähnliche Struktur teilen, sich aber in Absicht, Thema oder Kontext unterscheiden.
Im Fokus steht, worum es in einem Dokument geht, nicht, wie es präsentiert wird. Das funktioniert auch dann zuverlässig, wenn die Terminologie variiert oder sich Dokumente weiterentwickeln.
Semantische Klassifizierung ermöglicht es, nachgelagerte Verarbeitung, Routing und Extraktion durch Bedeutung statt durch starre Muster zu steuern.
File Name Classifier
Identifiziert Dokumente durch den Abgleich ihrer Dateinamen mit konfigurierbaren Mustern.
Der Classifier liest den Dateinamen jedes eingehenden Dokuments und prüft ihn gegen benutzerdefinierte Muster oder Namenskonventionen. Bei einem Treffer wird die entsprechende Struktur zugewiesen; so kann die Pipeline routen und extrahieren, ohne die Datei zu öffnen.
File Name Classifier sind ideal, wenn Dokumentlieferanten konsistente Namenskonventionen einhalten; die Klassifizierung wird dadurch schnell und deterministisch.
Sie ermöglichen sofortige Routing-Entscheidungen allein auf Basis von Metadaten, halten die Verarbeitung schlank und erlauben nachgelagerten Modulen, die Extraktion sofort mit dem richtigen Schema zu starten.
Extractor Module
Extractor-Module sind das Werkzeug für Dokumentenextraktion im Kern von MiruIQ: Sie verwandeln klassifizierte Dokumente in strukturierte, normalisierte Daten.
Ein Extractor übernimmt die von vorgelagerten Classifier-Modulen identifizierte Struktur und nutzt sie als Grundlage der Datenextraktion. Die Extraktion arbeitet damit stets auf einer bekannten, validierten Struktur, nicht auf dem rohen Dokumentlayout.
OCR-Datenextraktion, Layoutanalyse und semantisches Mapping finden innerhalb des Moduls statt. Durch die Trennung von Strukturerkennung und Extraktionslogik stellt MiruIQ sicher, dass die Datenaufbereitung stabil bleibt, selbst wenn sich Dokumente weiterentwickeln.
Feldauswahl
Der Extractor erlaubt die präzise Kontrolle darüber, welche Felder ein- oder ausgeschlossen werden.
Wenn Sie Daten aus PDF extrahieren, können Sie die Extraktion gezielt auf die tatsächlich benötigten Informationen fokussieren und verhindern, dass unnötige oder sensible Daten in nachgelagerte Systeme gelangen.
So bleiben Datenmodelle sauber, und eine versehentliche Kopplung zwischen Dokumentinhalt und Anwendungslogik wird vermieden.
Feld-Mapping
Extrahierte Felder können in eine von Ihnen definierte Zielstruktur abgebildet werden.
Dazu gehören das Umbenennen von Feldern, die Ausrichtung an bestehenden Schemas und das Umformen der Daten, sodass sie sich nahtlos in Datenbanken, APIs oder interne Modelle einfügen.
Da dieses Mapping bereits im Extraktionsschritt erfolgt, entfällt bei MiruIQ zusätzliche Transformationslogik später in der Pipeline.
Verschachtelte Daten
Extractor-Module unterstützen verschachtelte und hierarchische Datenstrukturen, einschließlich Arrays und wiederkehrender Elemente.
So können Sie Tabellen aus PDF extrahieren und komplexe Dokumentinhalte wie Positionszeilen oder gruppierte Abschnitte direkt in strukturierte, verschachtelte Ausgaben überführen; Beziehungen bleiben erhalten, statt dass Daten verflacht werden. Genau das macht es zuverlässig, Tabellen aus PDF zu extrahieren: Zeilen, Spalten und Positionen kommen als strukturierte Arrays an, nicht als flacher Text.
Damit lassen sich reale Informationen präzise abbilden, selbst wenn Dokumente sie inkonsistent darstellen.
Konsistente Ausgabe
Der Extractor liefert vorhersehbare, konsistente Ausgabestrukturen über unterschiedlichste Dokumentlayouts hinweg.
Da die Extraktion auf geerbter Struktur und definierter Bedeutung basiert, erhalten nachgelagerte Systeme Daten stets in derselben Form, unabhängig davon, wie das Originaldokument formatiert oder angeordnet war.
Diese Konsistenz ist entscheidend für zuverlässige Automatisierung und langfristige Wartbarkeit.
Module zur Verifizierung
Verifizierungs-Module stellen sicher, dass extrahierte Daten gültig, konsistent und vertrauenswürdig sind, bevor sie an nachgelagerte Systeme übergeben werden.
Sie führen explizite Kontrollpunkte in automatisierte Pipelines ein und ermöglichen sowohl vollautomatische Entscheidungen als auch Human- oder System-in-the-Loop-Prüfungen, für einzelne Dokumente oder ganze Dokumentgruppen.
Verifizierung kann an verschiedenen Stellen einer Pipeline eingesetzt und frei mit Classifiern, Extractors und Connectoren kombiniert werden.
Simple Value Checker
Validiert extrahierte Werte gegen vordefinierte Bedingungen, einschließlich semantischer Äquivalenz.
Dieses Modul arbeitet mit Werten, die bereits aus einem Dokument extrahiert wurden, und stellt sicher, dass sie definierte logische oder fachliche Vorgaben erfüllen, bevor die Verarbeitung fortgesetzt wird.
Neben exakten Vergleichen unterstützt der Simple Value Checker semantische Normalisierung: Unterschiedliche reale Darstellungen desselben Werts werden als gleichwertig behandelt.
Einzelne extrahierte Felder innerhalb eines einzelnen Dokuments.
Bei der Validierung einer Adresse gelten Werte wie "Hausstrasse 24" und "Hausstr. 24" während der Verifizierung als gleichwertig.
API Value Checker
Fügt der Pipeline einen externen, datengetriebenen Verifizierungsschritt hinzu.
Dieses Modul pausiert die Pipeline-Ausführung und wartet, bis ein externes System Referenz- oder Schwellenwerte per API-Aufruf bereitstellt. Extrahierte Werte werden anschließend gegen diese extern gelieferten Eingaben validiert.
So bleibt die Verifizierungslogik dynamisch und kontextbezogen, statt fest in der Pipeline verankert zu sein.
Einzelne extrahierte Felder anhand extern definierter Regeln oder Schwellenwerte.
In einem Kreditantragsprozess variieren die Mindestgehaltsanforderungen je Antragsteller. Ein externes System berechnet den erforderlichen Schwellenwert und übermittelt ihn per API. MiruIQ verifiziert das extrahierte Gehalt, bevor der Prozess fortgesetzt wird.
Simple Cross-Document Checker
Verifiziert die Konsistenz über eine vordefinierte Gruppe zusammengehöriger Dokumente hinweg.
Dieses Modul arbeitet mit Dokumentgruppen fester, bekannter Zusammensetzung. Es wartet, bis alle erwarteten Dokumente einer Gruppe eingetroffen sind, bevor die dokumentübergreifenden Prüfungen ausgeführt werden.
Dokumentgruppen können auf verschiedene Weise definiert werden, für flexible Gruppierungsstrategien ohne Änderung der Pipeline-Logik.
Konsistenz und Kohärenz extrahierter Felder über einen festen Dokumentensatz hinweg.
Ein Kreditantrag muss ein Ausweisdokument, einen Gehaltsnachweis und ein Antragsformular enthalten. Sobald alle Dokumente vorliegen, verifiziert MiruIQ, dass Name und Geburtsdatum des Antragstellers in allen Dateien übereinstimmen.
API-Based Cross-Document Checker
Führt dokumentübergreifende Verifizierung durch, bei der die Vollständigkeit der Dokumentgruppe extern gesteuert wird.
Anders als der Simple Cross-Document Checker ist dieses Modul nicht auf eine vordefinierte Dokumentanzahl angewiesen. Stattdessen signalisiert ein externes System explizit, wann eine Dokumentgruppe vollständig ist.
So integriert sich MiruIQ in dynamische Workflows, in denen der Dokumenteingang unvorhersehbar ist.
Konsistenz und Kohärenz extrahierter Felder über eine dynamisch vervollständigte Dokumentgruppe hinweg.
In einem Kreditmanagementsystem treffen Dokumente über einen längeren Zeitraum ein. Sobald das System den Antrag als vollständig einstuft, signalisiert es dies MiruIQ per API. MiruIQ verifiziert anschließend Identität, Adresse und Finanzdaten, bevor der Antrag weiterläuft.
Simple Acceptance Gate
Pausiert die Pipeline-Ausführung, bis ein Benutzer ein Dokument in MiruIQ manuell bestätigt oder ablehnt.
Dieses Modul fügt einer automatisierten Pipeline einen Human-in-the-Loop-Kontrollpunkt hinzu. Erreicht ein Dokument diesen Schritt, stoppt die Verarbeitung und das Dokument wird in MiruIQ zur manuellen Prüfung vorgelegt.
Der Prüfer kann die extrahierten Daten einsehen, sie mit dem Quelldokument abgleichen und freigeben oder ablehnen; die Pipeline wird entsprechend fortgesetzt oder beendet.
Menschliche Beurteilung von Korrektheit, Vollständigkeit oder Compliance eines Dokuments vor der weiteren Verarbeitung.
Ein Finanzinstitut verarbeitet Kontoeröffnungsunterlagen automatisch, verlangt jedoch, dass ein Compliance-Verantwortlicher jeden Antrag in MiruIQ manuell freigibt, bevor das Konto im Kernbankensystem angelegt wird.
API Acceptance Gate
Pausiert die Pipeline-Ausführung, bis ein externes System per API ein Freigabe- oder Ablehnungssignal sendet.
Dieses Modul hält ein Dokument an einem definierten Pipeline-Schritt an und wartet auf eine externe Entscheidung. Ein Drittsystem, eine Prüfplattform oder eine Automatisierung kann das Dokument unabhängig bewerten und anschließend per Rückmeldung an MiruIQ freigeben oder ablehnen.
So lassen sich externe Prüf-Workflows, Regel-Engines oder KI-basierte Verifizierungssysteme integrieren, ohne dass sie Teil der MiruIQ-Pipeline selbst sein müssen.
Externe Entscheidung darüber, ob ein Dokument weiterverarbeitet wird, auf Basis von Logik, die außerhalb von MiruIQ definiert ist.
Ein Krankenversicherer erhält Anträge auf Vorabgenehmigung. MiruIQ extrahiert die klinischen Daten und übermittelt sie an ein klinisches Prüfsystem. Das Prüfsystem (besetzt mit Pflegefachkräften, gestützt auf Regel-Engines oder unterstützt durch KI) bewertet den Antrag und meldet MiruIQ per API die Genehmigung oder Ablehnung zurück, woraufhin das Dokument in den passenden Workflow übergeben wird.
Entwickelt für das Zusammenspiel
Automatisierung, die Bedeutung folgt, nicht starren Regeln
Die Automatisierung in MiruIQ basiert auf modularen Entscheidungsschritten, nicht auf monolithischen Workflows.
Jedes Modul konzentriert sich auf eine einzige Aufgabe: Struktur verstehen, Bedeutung interpretieren, Daten extrahieren oder Konsistenz verifizieren. Automatisierung entsteht aus der Kombination dieser Module, nicht aus fest programmierten Abläufen.
Das macht die Automatisierung:
Flexibel
Passt sich neuen Anforderungen an, ohne dass Workflows neu aufgebaut werden müssen
Nachvollziehbar
Jeder Entscheidungsschritt ist sichtbar und auditierbar
Robust
Änderungen in einem Modul beeinträchtigen die übrige Pipeline nicht
So funktioniert Automatisierung in der Praxis
Dokumente gelangen als Rohinput in die Pipeline: unsortiert, heterogen und unvorhersehbar.
Von dort wendet MiruIQ schrittweise Automatisierung an:
Jeder Schritt reduziert Mehrdeutigkeit und erhöht die Sicherheit, bevor die nächste Entscheidung getroffen wird.
Verzweigung statt Einheitslösung
Automatisierung in MiruIQ ist von Grund auf verzweigend angelegt.
Sobald ein Dokument klassifiziert ist, kann es automatisch unterschiedlichen Pfaden folgen:
So kann eine einzige Pipeline viele Szenarien abdecken, ohne Logik zu duplizieren oder separate Workflows zu pflegen.
Unabhängige Ausgaben, ein kontrollierter Fluss
Automatisierung endet nicht in einem einzigen Ergebnis.
In einer einzigen Pipeline können:
Jede Ausgabe ist mit einem konkreten Entscheidungsschritt verknüpft; die Automatisierung bleibt transparent und auditierbar.
Automatisierung ohne Lock-in
MiruIQ zwingt Automatisierung nicht in eine feste Abfolge. Module können:
So wächst die Automatisierung mit den Geschäftsanforderungen mit, ohne bestehende Integrationen zu gefährden.
Fragen zur Extraktion
Was Teams vor der Evaluierung von Software zur Datenextraktion aus Dokumenten fragen, beantwortet in klarer Sprache.
Die meisten Tools beherrschen nur eine der drei Aufgaben. MiruIQ deckt die gesamte Sequenz in einer Plattform ab: Classifier-Module identifizieren den Dokumenttyp, Extractor-Module überführen Felder und Tabellen in ein von Ihnen definiertes JSON-Schema, und Verifizierungs-Module validieren das Ergebnis; Datensätze mit niedriger Konfidenz werden in die menschliche Prüfung geleitet, statt ungeprüft in nachgelagerte Systeme zu fließen.
Schemabasierte LLM-Extraktion übertrifft template-basiertes OCR bei realen Tabellen: abgeschnittene Werte, mehrseitige Tabellen, Fußnoten, die die Bedeutung einer Spalte neu definieren. MiruIQ wurde genau um diesen Fall herum gebaut: Sie definieren die Tabellenstruktur einmal, und der Extractor befüllt sie für jedes Dokument, in einer Pipeline, die mit dem Volumen skaliert.
MiruIQ validiert auf drei Ebenen: gegen das JSON-Schema, gegen erwartete Werte eines einzelnen Dokuments und dokumentübergreifend: Namen, Arbeitgeber, Daten und Beträge werden innerhalb eines Bündels verglichen, um Inkonsistenzen und potenziellen Betrug aufzudecken. Datensätze, die eine Prüfung nicht bestehen, parken in der menschlichen Prüfung, statt in Ihre Systeme zu fließen.
Bereit, Ihre Dokumente zu transformieren?
Erfahren Sie, wie MiruIQ-Module Ihre Dokumentverarbeitungs-Workflows optimieren.
