Exporter des documents vers Document AI Workbench

Ce document explique comment exporter des documents de Document AI Warehouse vers l'ensemble de données d'un extracteur de documents personnalisé (EDP) dans Document AI Workbench.

L'EDP permet aux utilisateurs de créer des extracteurs de documents. Ils importent des documents dans l'ensemble de données du processeur, puis les libellent avant d'entraîner le modèle. Lorsque les utilisateurs exportent des documents sélectionnés vers l'ensemble de données d'un EDP, ils peuvent créer l'ensemble de données en gérant ou en recherchant les documents dans Document AI Warehouse.

Créer un EDP dans Document AI Workbench

Vous trouverez des instructions complètes sur la création d'un EDP dans ce guide officiel. Nous mettons en évidence quelques étapes clés dans ce guide.

Créer un EDP à partir de la liste des processeurs

  1. Accédez à la page **My processors** (Mes processeurs), puis cliquez sur **Create Custom Processor** (Créer un processeur personnalisé) :

    Étape 1

  2. Choisissez Create Processor (Créer un processeur) sur la fiche Custom Document Extractor (Extracteur de documents personnalisé) :

    Étape 2

  3. Saisissez un nom à afficher, puis cliquez sur Create (Créer) :

    Étape 3

L'EDP devrait être créé rapidement.

Configurer l'ensemble de données de l'EDP

  1. Sur la page des détails du processeur, cliquez sur Set Dataset Location (Définir l'emplacement de l'ensemble de données) :

    Étape 4

  2. Spécifiez un chemin d'accès au bucket à utiliser pour stocker les documents dans l'ensemble de données :

    Étape 5

    La configuration prend quelques minutes. Ensuite, vous pouvez voir le chemin d'accès au bucket et le nombre de documents sur la page de détails :

    Étape 6

    Vous avez besoin de l'ID de processeur ci-dessus pour déclencher le pipeline d'exportation vers Workbench.

Déclencher le pipeline d'exportation vers Workbench

  1. Sélectionnez les documents à exporter, puis cliquez sur Export to Document AI Workbench (Exporter vers Document AI Workbench) dans la barre d'actions :

    Étape 7

  2. Saisissez les paramètres d'entrée et déclenchez le pipeline en copiant l'ID de processeur de l'EDP et en le collant dans la boîte de dialogue.

    Vous avez besoin d'un chemin d'accès à un bucket de préproduction pour stocker temporairement les documents avant de les exporter. L'option Data split (Répartition des données) permet aux utilisateurs de placer aléatoirement le document dans un ensemble d'entraînement ou de test. Le ratio des répartitions est basé sur cette valeur.

    Étape 8

    En cliquant sur Export (Exporter), la tâche de pipeline est déclenchée.

  3. Suivez l'état.

    Une fois le pipeline déclenché, une page de suivi de l'état s'affiche. Actuellement, la page ne dispose pas d'un suivi en cours. La page d'état affiche "Pending" (En attente) jusqu'à ce que la tâche soit terminée.

    Étape 9

  4. Examinez les résultats.

    1. Une fois la tâche terminée, vous pouvez voir les documents qui ont réussi et ceux qui ont échoué.

      Étape 10

    2. Pour vérifier si les documents sont correctement exportés, revenez à la page de détails de l'EDP :

      Étape 11

    3. Si la page est ouverte avant l'exécution du pipeline, actualisez-la pour trouver les statistiques mises à jour. Les distributions des ensembles d'entraînement et de test sont basées sur le ratio de répartition des données.

    4. Pour afficher les documents en détail, accédez à l'onglet Train (Entraîner) :

      Étape 12

Étape suivante

Consultez plus d'informations sur l'API runPipeline.