Fazer upload em massa com o pipeline de ingestão do Cloud Storage

Este documento descreve como fazer upload em massa, o que aciona o pipeline de ingestão do Cloud Storage em segundo plano.

Opções de pré-processamento

No momento, o upload em massa oferece três opções de pré-processamento:

  1. Upload em massa sem pré-processamento: isso aciona a API runPipeline com GcsIngestPipeline sem processar os documentos com os processadores da Document AI.

  2. Extrair entidades com processadores da Document AI: isso aciona a API runPipeline com GcsIngestWithDocAiProcessorsPipeline. O pipeline vai chamar primeiro o processador da Document AI especificado e, em seguida, ingerir os documentos com os resultados processados.

  3. Classificar tipos de documentos e extrair entidades de cada tipo: isso também aciona a API runPipeline com GcsIngestWithDocAiProcessorsPipeline, que primeiro chama um classificador. Em seguida, para cada tipo de documento, você pode especificar um esquema e um processador correspondentes para processar esses tipos de documento específicos. Eles são ingeridos com os resultados e definidos para esse esquema.

Cada um dos tipos de pré-processamento corresponde às seguintes opções na UI:

Etapa 0

Exemplo: acionar o upload em massa com um processador de OCR

Este exemplo ilustra o segundo uso do pipeline.

Criar um processador de OCR e receber o ID dele

Se você já criou um processador de OCR, basta encontrá-lo na lista de processadores, acessar a página de detalhes dele e pegar o ID.

Se você ainda não tiver criado uma, siga estas etapas:

  1. Na parte de cima da lista de operadores, clique na Galeria de operadores:

    Etapa 4

  2. Encontre o processador de OCR de documentos na galeria e, na parte de baixo do card, clique em Criar processador:

    Etapa 5

  3. Insira um nome de exibição do processador:

    Etapa 6

  4. Clique em Criar e, quando você for redirecionado para a página Detalhes do processador, encontre o ID:

    Etapa 7

    É isso que você precisa copiar para os campos de entrada na visualização de upload em massa.

Acionar upload em massa

  1. Abra a visualização de upload em massa.

    Ao lado de Adicionar novo, clique em Upload em massa:

    Etapa 1

  2. Encontre o processador correto.

    1. Selecione a segunda opção de pré-processamento.

    2. Escolha um esquema e especifique um processador e um caminho de bucket do Cloud Storage para salvar os resultados da extração em formato JSON.

  3. Encontre o ID do processador no link no texto da descrição:

    Etapa 2

  4. Acionar upload:

    1. Com o ID do processador copiado da última etapa, especifique os campos de entrada. O caminho do bucket do arquivo de origem pode ser um bucket, uma pasta ou subpasta no bucket.

    2. Quando os campos de entrada forem válidos, clique em Fazer upload no canto superior direito para acionar o upload em massa.

Verificar o progresso na página de status

Depois que o upload em massa for acionado, você será redirecionado para a página de rastreamento de status:

Etapa 9

A primeira tabela mostra os documentos pendentes ou processados. Depois de ingerido, o documento não aparece mais na primeira tabela. Os documentos que não foram enviados aparecem na segunda tabela. À direita, as estatísticas mostram o número de documentos ingeridos, com falha e pendentes.

Etapa 10

Depois que o job for concluído, a página de status vai mostrar 100% sem documentos pendentes:

Etapa 11

Analisar os documentos enviados

  1. Para encontrar os documentos recém-ingeridos, volte para a visualização de pesquisa. Clique no logotipo do Document AI Warehouse ou em Pesquisar na barra de navegação superior:

    Etapa 12

  2. Clique no nome de um dos documentos recém-ingeridos para abri-lo. No leitor de documentos, abra a Visualização de IA.

    Etapa 13

  3. Acesse a guia Bloco de texto. Os resultados do OCR são armazenados no documento:

    Etapa 13

Próxima etapa

Atualize os documentos atuais com o pipeline de extração com a Document AI.