Un traitement modulaire,conçu pour les documentsdu monde réel
MiruIQ repose sur des unités de traitement modulaires, appelées modules. Chaque module remplit une tâche clairement définie (classification, extraction de données par IA ou vérification) et se combine librement en pipelines.
Modules de classification
Les modules Classifier constituent le logiciel de classification de documents de MiruIQ : ils déterminent ce qu'est un document ou ce qu'il contient, et l'affectent à un ou plusieurs groupes lorsque des conditions définies sont remplies.
Les résultats de classification servent à :
Pipeline Control
contrôler les embranchements du pipeline
Extraction Logic
sélectionner la logique d'extraction
Routing
acheminer les documents vers différentes sorties
Plusieurs classificateurs peuvent s'exécuter séquentiellement ou en parallèle.
Simple Structure Classifier
Identifie les documents en les confrontant à une structure unique et bien définie.
Le classificateur évalue si un document contient les champs, sections ou caractéristiques de mise en page qui définissent un type de document spécifique, indépendamment des détails de formatage tels que le positionnement ou le design visuel.
Les classificateurs à structure simple servent généralement de premier point de décision dans un pipeline, établissant une base fiable pour les traitements en aval.
Ils garantissent un traitement cohérent des documents partageant la même structure logique, même lorsque leur apparence évolue dans le temps.
Multi-Structure Classifier
Identifie les documents contenant plusieurs structures indépendantes au sein d'un même fichier.
Plutôt que de traiter un document comme une entité unique et plate, le classificateur multi-structure détecte et valide plusieurs structures distinctes, telles que plusieurs tableaux, des sections répétées ou des blocs de données logiquement séparés.
Chaque structure détectée peut être traitée indépendamment, permettant une extraction et une validation plus granulaires sans découper le document manuellement.
Les classificateurs multi-structures sont particulièrement utiles pour les documents complexes où l'information pertinente est répartie entre différentes sections ou motifs répétés.
Semantic Classifier
Identifie les documents d'après leur signification, plutôt que leur structure, leur mise en page ou leur formulation exacte.
Le classificateur évalue le contenu d'un document pour déterminer ce qu'il décrit, permettant à MiruIQ de distinguer des documents à la structure similaire mais dont l'intention, le sujet ou le contexte diffèrent.
Ils se concentrent sur ce dont traite un document, et non sur sa présentation, et restent efficaces même lorsque la terminologie varie ou que les documents évoluent.
La classification sémantique permet de piloter le traitement, le routage et l'extraction en aval par la signification plutôt que par des règles rigides.
File Name Classifier
Identifie les documents en confrontant leur nom de fichier à des motifs configurables.
Le classificateur lit le nom de fichier de chaque document entrant et l'évalue au regard d'un ensemble de motifs ou de conventions de nommage définis par l'utilisateur. En cas de correspondance, la structure associée est attribuée, permettant au pipeline d'acheminer et d'extraire sans ouvrir le fichier.
Les classificateurs par nom de fichier sont idéaux lorsque les fournisseurs de documents suivent des conventions de nommage cohérentes, rendant la classification rapide et déterministe.
Ils permettent des décisions de routage instantanées fondées sur les seules métadonnées, allégeant le traitement et permettant aux modules en aval de démarrer immédiatement l'extraction avec le bon schéma.
Modules Extractor
Les modules Extractor sont l'outil d'extraction de données au cœur de MiruIQ : ils transforment les documents classifiés en données structurées et normalisées.
Un extracteur hérite de la structure identifiée par les modules de classification en amont et l'utilise comme fondation de l'extraction. Celle-ci s'appuie ainsi toujours sur une structure connue et validée, jamais sur la mise en page brute du document.
L'océrisation, l'extraction de données PDF, l'analyse de mise en page et le mapping sémantique s'effectuent au sein du module. En séparant la détection de structure de la logique d'extraction, MiruIQ garantit que la mise en forme des données reste stable même lorsque les documents évoluent.
Sélection des champs
L'extracteur offre un contrôle précis sur les champs à inclure ou à exclure.
Les utilisateurs peuvent concentrer l'extraction sur les données réellement nécessaires, en évitant que des informations superflues ou sensibles n'entrent dans les systèmes en aval.
Les modèles de données restent ainsi propres, sans couplage accidentel entre le contenu des documents et la logique applicative.
Mapping des champs
Les champs extraits peuvent être mappés vers une structure cible définie par l'utilisateur.
Cela inclut le renommage des champs, leur alignement sur des schémas existants et la restructuration des données afin qu'elles s'intègrent parfaitement aux bases de données, aux API ou aux modèles internes.
En prenant en charge ce mapping dès l'étape d'extraction, MiruIQ élimine le besoin d'une logique de transformation supplémentaire plus loin dans le pipeline.
Données imbriquées
Les modules Extractor prennent en charge les structures de données imbriquées et hiérarchiques, y compris les tableaux et les éléments répétés.
Les contenus documentaires complexes (tableaux, lignes de facturation ou sections groupées) peuvent être mappés directement vers des sorties structurées et imbriquées, en préservant les relations au lieu d'aplatir les données. C'est ce qui rend l'extraction de tableaux depuis un PDF fiable : lignes, colonnes et postes arrivent sous forme de tableaux structurés, pas de texte aplati.
Il devient ainsi possible de modéliser fidèlement l'information du monde réel, même lorsque les documents la représentent de manière incohérente.
Sortie cohérente
L'extracteur produit des structures de sortie prévisibles et cohérentes, quelle que soit la mise en page des documents.
L'extraction reposant sur une structure héritée et une signification définie, les systèmes en aval reçoivent toujours des données de forme identique, indépendamment du formatage ou de l'ordre du document d'origine.
Cette cohérence est essentielle pour une automatisation fiable et une maintenabilité à long terme.
Modules de vérification
Les modules de vérification garantissent que les données extraites sont valides, cohérentes et fiables avant leur transmission aux systèmes en aval.
Ils introduisent des points de contrôle explicites dans les pipelines automatisés, permettant des décisions entièrement automatisées ou avec intervention humaine ou système, sur des documents individuels comme sur des groupes de documents entiers.
La vérification peut s'appliquer à différentes étapes d'un pipeline et se combiner librement avec les classificateurs, les extracteurs et les connecteurs.
Simple Value Checker
Valide les valeurs extraites au regard de conditions prédéfinies, y compris l'équivalence sémantique.
Ce module opère sur des valeurs déjà extraites d'un document et s'assure qu'elles respectent les contraintes logiques ou métier définies avant la poursuite du traitement.
Au-delà des comparaisons exactes, le Simple Value Checker prend en charge la normalisation sémantique, permettant de traiter comme équivalentes différentes représentations réelles d'une même valeur.
Des champs extraits individuels au sein d'un même document.
Lors de la validation d'une adresse, des valeurs telles que "Hausstrasse 24" et "Hausstr. 24" sont considérées comme équivalentes lors de la vérification.
API Value Checker
Introduit dans le pipeline une étape de vérification externe, pilotée par les données.
Ce module suspend l'exécution du pipeline et attend qu'un système externe fournisse des valeurs de référence ou des seuils via un appel API. Les valeurs extraites sont ensuite validées au regard de ces données fournies de l'extérieur.
La logique de vérification devient ainsi dynamique et contextuelle, au lieu d'être codée en dur dans le pipeline.
Des champs extraits individuels, selon des règles ou des seuils définis en externe.
Dans un processus de demande de crédit, le salaire minimum requis varie selon le demandeur. Un système externe calcule le seuil applicable et le transmet via API. MiruIQ vérifie le salaire extrait avant de poursuivre.
Simple Cross-Document Checker
Vérifie la cohérence au sein d'un groupe prédéfini de documents liés.
Ce module opère sur des groupes de documents à composition connue et fixe. Il attend l'arrivée de tous les documents attendus d'un groupe avant d'effectuer les contrôles inter-documents.
Les groupes de documents peuvent être définis de plusieurs manières, offrant des stratégies de regroupement flexibles sans modifier la logique du pipeline.
La cohérence des champs extraits au sein d'un ensemble documentaire fixe.
Une demande de crédit doit contenir une pièce d'identité, un justificatif de salaire et un formulaire de demande. Une fois tous les documents reçus, MiruIQ vérifie que le nom du demandeur et la date de naissance concordent dans tous les fichiers.
API-Based Cross-Document Checker
Effectue une vérification inter-documents dans laquelle la complétude du groupe de documents est contrôlée en externe.
Contrairement au Simple Cross-Document Checker, ce module ne repose pas sur un nombre de documents prédéfini. Un système externe signale explicitement quand un groupe de documents est complet.
MiruIQ peut ainsi s'intégrer à des workflows dynamiques où l'arrivée des documents est imprévisible.
La cohérence des champs extraits au sein d'un groupe de documents complété dynamiquement.
Dans un système de gestion de crédits, les documents arrivent au fil du temps. Dès que le système juge le dossier complet, il le signale à MiruIQ via API. MiruIQ vérifie alors l'identité, l'adresse et les données financières avant d'autoriser la poursuite du dossier.
Simple Acceptance Gate
Suspend l'exécution du pipeline jusqu'à ce qu'un utilisateur confirme ou rejette manuellement un document dans MiruIQ.
Ce module introduit un point de contrôle humain dans un pipeline automatisé. Lorsqu'un document atteint cette étape, le traitement s'interrompt et le document est présenté pour revue manuelle dans MiruIQ.
Le relecteur peut examiner les données extraites, les confronter au document source, puis approuver ou rejeter, le pipeline reprenant ou s'arrêtant en conséquence.
Le jugement humain sur l'exactitude, la complétude ou la conformité d'un document avant la poursuite du traitement.
Un établissement financier traite automatiquement les documents d'ouverture de compte, mais exige qu'un responsable conformité approuve manuellement chaque dossier dans MiruIQ avant la création du compte dans le système bancaire central.
API Acceptance Gate
Suspend l'exécution du pipeline jusqu'à ce qu'un système externe envoie un signal d'approbation ou de refus via API.
Ce module retient un document à une étape définie du pipeline et attend une décision externe. Un système tiers, une plateforme de revue ou une automatisation peut évaluer le document de manière indépendante, puis rappeler MiruIQ avec une approbation ou un rejet.
Cela permet l'intégration avec des workflows de revue externes, des moteurs de règles ou des systèmes de vérification basés sur l'IA, sans qu'ils fassent partie du pipeline MiruIQ lui-même.
Une décision externe déterminant si un document peut poursuivre son parcours, selon une logique définie en dehors de MiruIQ.
Un assureur santé reçoit des demandes d'autorisation préalable. MiruIQ extrait les données cliniques et les transmet à un système de revue clinique. Ce système (opéré par du personnel infirmier, propulsé par des moteurs de règles ou assisté par l'IA) évalue la demande et rappelle MiruIQ avec une approbation ou un refus, libérant le document vers le workflow approprié.
Conçus pour fonctionner ensemble
Une automatisation guidée par le sens, pas par des règles rigides
L'automatisation MiruIQ repose sur des étapes de décision modulaires, et non sur des workflows monolithiques.
Chaque module se concentre sur une responsabilité unique : comprendre la structure, interpréter le sens, extraire les données ou vérifier la cohérence. L'automatisation naît de la combinaison de ces modules, et non de flux codés en dur.
L'automatisation devient ainsi :
Flexible
S'adapte aux nouvelles exigences sans reconstruire les workflows
Explicable
Chaque étape de décision est visible et auditable
Résiliente
Une modification dans un module ne casse pas le pipeline
L'automatisation en pratique
Les documents entrent dans le pipeline à l'état brut : non triés, hétérogènes et imprévisibles.
À partir de là, MiruIQ applique une automatisation progressive :
Chaque étape réduit l'ambiguïté et renforce la confiance avant la décision suivante.
Des embranchements plutôt qu'une approche unique
Dans MiruIQ, l'automatisation est conçue pour l'embranchement.
Une fois classifié, un document peut suivre automatiquement différents chemins :
Un seul pipeline peut ainsi gérer de nombreux scénarios, sans dupliquer la logique ni maintenir des workflows séparés.
Des sorties indépendantes, un flux maîtrisé
L'automatisation ne se termine pas par un résultat unique.
Au sein d'un même pipeline :
Chaque sortie est reliée à une étape de décision précise, gardant l'automatisation transparente et auditable.
Une automatisation sans verrouillage
MiruIQ n'impose pas à l'automatisation une séquence figée. Les modules peuvent être :
L'automatisation peut ainsi évoluer au rythme des besoins métier, sans casser les intégrations existantes.
Questions sur l'extraction
Ce que les équipes demandent avant d'évaluer un logiciel d'extraction de données documentaires, expliqué simplement.
La plupart des outils ne couvrent qu'une de ces trois étapes. MiruIQ enchaîne la séquence complète sur une seule plateforme : les modules Classifier identifient le type de document, les modules Extractor extraient champs et tableaux vers un schéma JSON que vous définissez, et les modules de vérification valident le résultat, en acheminant les enregistrements à faible confiance vers la revue humaine au lieu de les transmettre en aval.
L'extraction par LLM pilotée par schéma surpasse l'OCR à base de modèles figés sur les tableaux du monde réel : valeurs tronquées, tableaux sur plusieurs pages, notes de bas de page qui redéfinissent le sens d'une colonne. MiruIQ a été conçu autour de ce cas : définissez la structure du tableau une seule fois, et l'extracteur la remplit pour chaque document, dans un pipeline qui monte en charge avec le volume.
MiruIQ valide à trois niveaux : par rapport au schéma JSON, par rapport aux valeurs attendues pour un document isolé, et entre documents, en comparant noms, employeurs, dates et montants au sein d'un dossier pour révéler les incohérences et les fraudes potentielles. Les enregistrements qui échouent à un contrôle sont mis en attente de revue humaine au lieu d'alimenter vos systèmes.
Prêt à transformer vos documents ?
Découvrez comment les modules MiruIQ peuvent rationaliser vos flux de traitement documentaire, de l'océrisation à l'extraction de données PDF.
