Traiter des documents avec un processeur Document AI

Ce document explique comment mettre à jour des documents existants avec les résultats nouvellement traités d'un autre processeur Document AI.

Limites actuelles

Le pipeline ProcessWithDocAi ne peut fonctionner qu'avec des documents qui ont été traités lors de l'ingestion. Les futures versions du pipeline étendront ce pipeline aux documents qui n'ont pas encore été traités. Nous vous fournirons bientôt plus d'informations dans nos notes de version.

Configurer le mappage de schéma dans le schéma de document (administrateur uniquement)

Le document Définir des schémas avec mappage explique comment configurer les propriétés nouvelles ou existantes d'un schéma Document AI Warehouse pour qu'elles soient mappées avec les entités extraites de Document AI. Nous vous montrons comment procéder dans la console d'administration Document AI Warehouse.

Accéder à la console d'administration Document AI Warehouse

Assurez-vous de disposer d'un accès administrateur. Vous pouvez ensuite accéder à la console d'administration.

Lien vers l'interface administrateur

Créer un schéma avec le mappage de schéma

Vous pouvez créer un schéma avec le mappage de schéma. Les mêmes étapes peuvent s'appliquer aux schémas existants en les mettant à jour dans la vue des détails du schéma. Notez simplement que les fonctionnalités de mise à jour du schéma sont actuellement limitées. Nous ne prenons pas en charge la suppression ni la modification des propriétés existantes.

  1. Cliquez sur Ajouter dans l'onglet "Gestionnaire de schéma" :

    Étape 1

  2. Saisissez un nom et une description à afficher.

    Étape 2

    Notez que vous ne pouvez pas modifier le nom à afficher une fois la clé créée. La description est facultative et peut être modifiée après la création.

  3. Cliquez sur Suivant. L'éditeur JSON du schéma s'affiche, y compris le nom à afficher et la description saisis à l'étape précédente.

    Étape 3

    Dans cet exemple, ajoutez une propriété total_amount à la liste property_definitions :

        {
            "name": "total_amount",
            "display_name": "Total Amount",
            "is_repeatable": false,
            "is_filterable": true,
            "is_searchable": true,
            "is_metadata": false,
            "is_required": false,
            "float_type_options": {},
            "schema_sources": [
                {
                        "name": "total_amount",
                        "processor_type": "INVOICE_PROCESSOR"
                }
            ]
        }
    

    La propriété est configurée pour être mappée au champ total_amount extrait par INVOICE_PROCESSOR. Pour obtenir la liste complète des types de processeurs, vous pouvez utiliser l'API fetchProcessorTypes.

  4. Pour créer un schéma, cliquez sur OK. Un message de confirmation s'affiche une fois l'opération terminée :

    Étape 4

  5. Vous pouvez afficher le schéma en détail.

    Étape 5

Exemple : Utiliser un processeur de factures pour les documents traités par OCR

Grâce au mappage des propriétés défini dans le schéma, vous pouvez retraiter les documents traités par reconnaissance optique des caractères avec un processeur de factures, dont la propriété total_amount est mappée à partir des résultats analysés.

  1. Sélectionnez les documents à retraiter.

    Sélectionnez les documents auxquels vous souhaitez appliquer un autre processeur. Cliquez ensuite sur Extraire avec Document AI dans la barre d'actions.

    Étape 1

    La boîte de dialogue pop-up comporte trois champs de saisie :

    1. ID du processeur : ID du processeur que vous souhaitez utiliser pour traiter les documents.

    2. Chemin d'accès au fichier d'exportation : chemin d'accès à un bucket intermédiaire pour stocker temporairement les documents.

    3. Chemin d'accès au dossier des résultats du processeur : chemin d'accès à un bucket pour stocker les documents analysés par le processeur.

    Étape 2

  2. Obtenez l'ID du processeur de factures.

    Comme pour la création de l'analyseur OCR dans le guide d'importation groupée, vous pouvez créer un processeur de factures à partir de la galerie de processeurs.

    Étape 3

    Recherchez l'ID sur la page "Détails du processeur" :

    Étape 4

  3. Déclenchez le pipeline et suivez son état.

    Après avoir saisi l'ID et les deux chemins de bucket dans la boîte de dialogue, vous pouvez cliquer sur Extraire pour déclencher le pipeline :

    Étape 5

  4. Une fois le pipeline déclenché, une page de suivi de l'état s'affiche :

    Étape 6

    Actuellement, le suivi en cours n'est pas disponible sur la page. La page d'état indique "En attente" jusqu'à ce que le job soit terminé.

  5. Examinez les résultats mis à jour.

    Une fois la tâche terminée, vous pouvez cliquer sur le document pour vérifier si les résultats de l'extraction ont été correctement mis à jour.

    Étape 7

    Vous pouvez constater que la propriété total_amount a été mappée à partir des résultats analysés.

    Étape 8

    Dans la vue IA, vous trouverez la liste complète des entités extraites :

    Étape 9

Étape suivante

Suivez le guide suivant pour exporter les documents vers un extracteur de documents personnalisé dans Document AI Workbench.