Elaborazione Modulare,Progettata per i Documentidel Mondo Reale
MiruIQ è costruito attorno a unità di elaborazione modulari, chiamate moduli. Ogni modulo svolge un compito chiaramente definito (classificazione, estrazione dati con IA o verifica) e può essere combinato liberamente in pipeline.
Moduli Classificatori
I moduli classificatori sono il software di classificazione documenti di MiruIQ: determinano che cosa è un documento o che cosa contiene e lo assegnano a uno o più gruppi quando le condizioni definite sono soddisfatte.
I risultati della classificazione vengono utilizzati per:
Pipeline Control
controllare le diramazioni della pipeline
Extraction Logic
selezionare la logica di estrazione
Routing
instradare i documenti verso output diversi
Più classificatori possono essere eseguiti in sequenza o in parallelo.
Simple Structure Classifier
Identifica i documenti confrontandoli con una singola struttura ben definita.
Il classificatore valuta se un documento contiene i campi, le sezioni o le caratteristiche di layout richiesti che definiscono un tipo di documento specifico, indipendentemente da dettagli di formattazione come il posizionamento o il design visivo.
I Simple Structure Classifier vengono tipicamente utilizzati come primo punto decisionale in una pipeline, stabilendo una base affidabile per le elaborazioni successive.
Consentono una gestione coerente dei documenti che condividono la stessa struttura logica, anche quando l'aspetto varia nel tempo.
Multi-Structure Classifier
Identifica documenti che contengono più strutture indipendenti all'interno di un unico file.
Invece di trattare un documento come un'unica entità piatta, il Multi-Structure Classifier rileva e convalida diverse strutture distinte, come tabelle multiple, sezioni ripetute o blocchi di dati logicamente separati.
Ogni struttura rilevata può essere elaborata in modo indipendente, consentendo un'estrazione e una convalida più granulari senza dover suddividere manualmente il documento.
I Multi-Structure Classifier sono particolarmente utili per documenti complessi in cui le informazioni rilevanti sono distribuite tra sezioni diverse o schemi ripetuti.
Semantic Classifier
Identifica i documenti in base al significato, anziché alla struttura, al layout o alla formulazione esatta.
Il classificatore valuta il contenuto di un documento per determinare che cosa descrive, consentendo a MiruIQ di distinguere tra documenti che possono condividere una struttura simile ma differire per intento, argomento o contesto.
Si concentrano su ciò di cui tratta un documento, non su come è presentato, rimanendo efficaci anche quando la terminologia varia o i documenti evolvono.
La classificazione semantica consente di guidare l'elaborazione, l'instradamento e l'estrazione a valle in base al significato anziché a schemi rigidi.
File Name Classifier
Identifica i documenti confrontando i loro nomi file con pattern configurabili.
Il classificatore legge il nome file di ogni documento in ingresso e lo valuta rispetto a un insieme di pattern o convenzioni di denominazione definiti dall'utente. Quando viene trovata una corrispondenza, viene assegnata la struttura corrispondente, consentendo alla pipeline di instradare ed estrarre senza aprire il file.
I File Name Classifier sono ideali quando i fornitori di documenti seguono convenzioni di denominazione coerenti, rendendo la classificazione rapida e deterministica.
Consentono decisioni di instradamento istantanee basate esclusivamente sui metadati, mantenendo l'elaborazione leggera e permettendo ai moduli successivi di avviare immediatamente l'estrazione con lo schema corretto.
Moduli Estrattori
I moduli estrattori sono lo strumento di estrazione dati al cuore di MiruIQ: trasformano i documenti classificati in dati strutturati e normalizzati.
Un estrattore eredita la struttura identificata dai moduli classificatori precedenti e la utilizza come base per l'estrazione dati da PDF e altri documenti. Ciò significa che l'estrazione opera sempre su una struttura nota e convalidata, non sul layout grezzo del documento.
L'estrazione dei dati tramite il riconoscimento ottico dei caratteri (OCR), l'analisi del layout e la mappatura semantica avvengono all'interno del modulo. Separando il rilevamento della struttura dalla logica di estrazione, MiruIQ garantisce che la strutturazione dei dati rimanga stabile anche quando i documenti evolvono.
Selezione dei Campi
L'estrattore consente un controllo preciso su quali campi includere o escludere.
Gli utenti possono concentrare l'estrazione sui dati effettivamente necessari, evitando che informazioni superflue o sensibili entrino nei sistemi a valle.
Questo mantiene i modelli di dati puliti e previene accoppiamenti accidentali tra il contenuto dei documenti e la logica applicativa.
Mappatura dei Campi
I campi estratti possono essere mappati in una struttura di destinazione definita dall'utente.
Ciò include la ridenominazione dei campi, l'allineamento a schemi esistenti e la ristrutturazione dei dati affinché si integrino perfettamente in database, API o modelli interni.
Gestendo questa mappatura all'interno della fase di estrazione, MiruIQ elimina la necessità di logiche di trasformazione aggiuntive più avanti nella pipeline.
Dati Annidati
I moduli estrattori supportano strutture dati annidate e gerarchiche, inclusi array ed elementi ripetuti.
Contenuti documentali complessi come tabelle, voci di riga o sezioni raggruppate possono essere mappati direttamente in output strutturati e annidati, preservando le relazioni invece di appiattire i dati. È questo che rende affidabile l'estrazione di tabelle da PDF: righe, colonne e voci arrivano come array strutturati, non come testo appiattito.
Questo rende possibile modellare con precisione le informazioni del mondo reale, anche quando i documenti le rappresentano in modo incoerente.
Output Coerente
L'estrattore produce strutture di output prevedibili e coerenti anche con layout documentali variabili.
Poiché l'estrazione si basa sulla struttura ereditata e su un significato definito, i sistemi a valle ricevono sempre i dati nella stessa forma, indipendentemente da come il documento originale era formattato o ordinato.
Questa coerenza è fondamentale per un'automazione affidabile e per la manutenibilità a lungo termine.
Moduli di Verifica
I moduli di verifica garantiscono che i dati estratti siano validi, coerenti e affidabili prima di essere rilasciati ai sistemi a valle.
Introducono punti di controllo espliciti nelle pipeline automatizzate, abilitando decisioni sia completamente automatizzate sia con intervento umano o di sistema, su singoli documenti o su interi gruppi documentali.
La verifica può essere applicata in fasi diverse di una pipeline e combinata liberamente con classificatori, estrattori e connettori.
Simple Value Checker
Convalida i valori estratti rispetto a condizioni predefinite, inclusa l'equivalenza semantica.
Questo modulo opera su valori già estratti da un documento e garantisce che soddisfino vincoli logici o di business definiti prima che l'elaborazione prosegua.
Oltre ai confronti esatti, il Simple Value Checker supporta la normalizzazione semantica, consentendo di trattare come equivalenti rappresentazioni reali diverse dello stesso valore.
Singoli campi estratti all'interno di un documento individuale.
Nella convalida di un indirizzo, valori come "Hausstrasse 24" e "Hausstr. 24" vengono considerati equivalenti durante la verifica.
API Value Checker
Introduce nella pipeline una fase di verifica esterna e guidata dai dati.
Questo modulo mette in pausa l'esecuzione della pipeline e attende che un sistema esterno fornisca valori di riferimento o soglie tramite una chiamata API. I valori estratti vengono quindi convalidati rispetto agli input forniti dall'esterno.
Ciò consente alla logica di verifica di essere dinamica e sensibile al contesto, invece che codificata in modo fisso nella pipeline.
Singoli campi estratti in base a regole o soglie definite esternamente.
In un processo di richiesta di prestito, i requisiti salariali minimi variano per ciascun richiedente. Un sistema esterno calcola la soglia richiesta e la invia tramite API. MiruIQ verifica il salario estratto prima di procedere.
Simple Cross-Document Checker
Verifica la coerenza all'interno di un gruppo predefinito di documenti correlati.
Questo modulo opera su gruppi documentali con una composizione nota e fissa. Attende che tutti i documenti previsti per un gruppo siano arrivati prima di eseguire i controlli incrociati tra documenti.
I gruppi documentali possono essere definiti in molteplici modi, consentendo strategie di raggruppamento flessibili senza modificare la logica della pipeline.
Coerenza e congruenza dei campi estratti all'interno di un insieme documentale fisso.
Una richiesta di prestito deve contenere un documento d'identità, un certificato di salario e il modulo di domanda. Una volta arrivati tutti i documenti, MiruIQ verifica che il nome del richiedente e la data di nascita coincidano in tutti i file.
API-Based Cross-Document Checker
Esegue la verifica incrociata tra documenti quando il completamento del gruppo documentale è controllato esternamente.
A differenza del Simple Cross-Document Checker, questo modulo non si basa su un numero predefinito di documenti: è un sistema esterno a segnalare esplicitamente quando un gruppo documentale è completo.
Questo consente a MiruIQ di integrarsi con flussi di lavoro dinamici in cui l'arrivo dei documenti è imprevedibile.
Coerenza e congruenza dei campi estratti all'interno di un gruppo documentale completato dinamicamente.
In un sistema di gestione prestiti, i documenti arrivano nel corso del tempo. Quando il sistema determina che la pratica è completa, lo segnala a MiruIQ tramite API. MiruIQ verifica quindi identità, indirizzo e dati finanziari prima di consentire l'avanzamento della pratica.
Simple Acceptance Gate
Mette in pausa l'esecuzione della pipeline finché un utente non conferma o rifiuta manualmente un documento all'interno di MiruIQ.
Questo modulo introduce un punto di controllo con intervento umano in una pipeline automatizzata. Quando un documento raggiunge questa fase, l'elaborazione si interrompe e il documento viene presentato per la revisione manuale all'interno di MiruIQ.
Il revisore può esaminare i dati estratti, verificarli rispetto al documento di origine e approvare o rifiutare, riprendendo o terminando la pipeline di conseguenza.
Il giudizio umano sulla correttezza, la completezza o la conformità del documento prima dell'ulteriore elaborazione.
Un istituto finanziario elabora automaticamente i documenti di apertura conto, ma richiede che un responsabile compliance approvi manualmente ogni pratica all'interno di MiruIQ prima che il conto venga creato nel sistema bancario centrale.
API Acceptance Gate
Mette in pausa l'esecuzione della pipeline finché un sistema esterno non invia un segnale di approvazione o rifiuto tramite API.
Questo modulo trattiene un documento in una fase definita della pipeline e attende una decisione esterna. Un sistema di terze parti, una piattaforma di revisione o un'automazione può valutare il documento in modo indipendente e richiamare MiruIQ con un'approvazione o un rifiuto.
Questo consente l'integrazione con flussi di revisione esterni, motori di regole o sistemi di verifica basati su IA, senza che debbano far parte della pipeline MiruIQ stessa.
La decisione esterna sull'avanzamento di un documento, basata su logiche definite al di fuori di MiruIQ.
Un assicuratore sanitario riceve richieste di autorizzazione preventiva. MiruIQ estrae i dati clinici e li invia a un sistema di revisione clinica. Il sistema di revisione (gestito da personale infermieristico, alimentato da motori di regole o assistito dall'IA) valuta la richiesta e risponde a MiruIQ con un'approvazione o un rifiuto, rilasciando il documento al flusso di lavoro appropriato.
Progettati per Lavorare Insieme
Un'Automazione che Segue il Significato: Non Regole Rigide
L'automazione documentale di MiruIQ si basa su fasi decisionali modulari, non su flussi di lavoro monolitici.
Ogni modulo si concentra su una singola responsabilità: comprendere la struttura, interpretare il significato, estrarre i dati o verificare la coerenza. L'automazione nasce dal modo in cui questi moduli vengono combinati, non da flussi codificati in modo rigido.
Questo rende l'automazione:
Flessibile
Si adatta a nuovi requisiti senza ricostruire i flussi di lavoro
Spiegabile
Ogni fase decisionale è visibile e verificabile
Resiliente
Le modifiche a un modulo non compromettono la pipeline
Come Funziona l'Automazione nella Pratica
I documenti entrano nella pipeline come input grezzo: non ordinati, eterogenei e imprevedibili.
Da lì, MiruIQ applica un'automazione progressiva:
Ogni fase riduce l'ambiguità e aumenta il livello di confidenza prima della decisione successiva.
Diramazioni invece di Soluzioni Uguali per Tutti
L'automazione in MiruIQ è ramificata per progettazione.
Una volta classificato, un documento può seguire automaticamente percorsi diversi:
Questo consente a una singola pipeline di gestire molti scenari, senza duplicare la logica né mantenere flussi di lavoro separati.
Output Indipendenti, un Unico Flusso Controllato
L'automazione non si conclude in un unico risultato.
In una singola pipeline:
Ogni output è collegato a una specifica fase decisionale, mantenendo l'automazione documentale trasparente e verificabile.
Automazione Senza Vincoli
MiruIQ non impone all'automazione una sequenza fissa. I moduli possono essere:
Questo permette all'automazione documentale di evolvere insieme ai requisiti aziendali, senza compromettere le integrazioni esistenti.
Domande frequenti sull'estrazione
Le domande che i team si pongono prima di valutare un software di estrazione dati dai documenti, con risposte in linguaggio chiaro.
La maggior parte degli strumenti copre solo una delle tre funzioni. MiruIQ copre l'intera sequenza in un'unica piattaforma: i moduli classificatori identificano il tipo di documento, i moduli estrattori portano campi e tabelle in uno schema JSON definito da voi, e i moduli di verifica convalidano il risultato, instradando i record a bassa confidenza verso la revisione umana invece di inoltrarli ai sistemi a valle.
L'estrazione con LLM guidata da schema supera l'OCR basato su template sulle tabelle del mondo reale: valori troncati, tabelle su più pagine, note a piè di pagina che ridefiniscono il significato di una colonna. MiruIQ è stato costruito proprio attorno a questo caso: definite la struttura della tabella una sola volta e l'estrattore la riempie per ogni documento, in una pipeline che scala con i volumi.
MiruIQ convalida su tre livelli: rispetto allo schema JSON, rispetto ai valori attesi per il singolo documento e in modo incrociato tra documenti, confrontando nomi, datori di lavoro, date e importi all'interno di un fascicolo per far emergere incongruenze e potenziali frodi. I record che non superano un controllo si fermano in attesa della revisione umana invece di fluire nei vostri sistemi.
Pronto a Trasformare i Suoi Documenti?
Scopra come i moduli di MiruIQ possono semplificare i Suoi flussi di elaborazione documentale.
