En este documento, se describe cómo realizar la carga masiva, que activa la canalización de ingreso de Cloud Storage en segundo plano.
Opciones de procesamiento previo
Actualmente, la carga masiva proporciona tres opciones de procesamiento previo:
Carga masiva sin procesamiento previo: Esto activa la API de runPipeline con GcsIngestPipeline sin procesar los documentos con los procesadores de Document AI.
Extrae entidades con procesadores de Document AI: Esto activa la API de runPipeline con GcsIngestWithDocAiProcessorsPipeline. La canalización llamará primero al procesador de Document AI determinado y, luego, ingresará los documentos con los resultados procesados.
Clasifica los tipos de documentos y extrae entidades para cada tipo: Esto también activa la API de runPipeline con GcsIngestWithDocAiProcessorsPipeline, que primero llama a un clasificador. Luego, para cada tipo de documento, puedes especificar un esquema y un procesador correspondientes para procesar esos tipos de documentos en particular. Se ingresan con los resultados y se configuran en este esquema.
Cada uno de los tipos de procesamiento previo corresponde a las siguientes opciones en la IU:

Ejemplo: Activa la carga masiva con un procesador de OCR
En este ejemplo, se ilustra el segundo uso de la canalización.
Crea un procesador de OCR y obtén el ID del procesador
Si ya creaste un procesador de OCR, solo búscalo en la lista de procesadores, ve a la página de detalles de l procesador y obtén el ID del procesador.
Si no creaste uno, sigue estos pasos:
En la parte superior de la lista deprocesadores, haz clic en la Galería deprocesadores:

Busca el procesador de OCR para documentos en la galería y, en la parte inferior de la tarjeta, haz clic en Crear procesador:

Ingresa un nombre visible del procesador:

Haz clic en Crear y, cuando se te redireccione a la página Detalles del procesador , busca el ID:

Esto es lo que debes copiar en los campos de entrada de la vista de carga masiva.
Activa la carga masiva
Abre la vista de carga masiva.
Junto a Agregar nuevo, haz clic en Carga masiva:

Busca el procesador correcto.
Selecciona la segunda opción de procesamiento previo.
Elige un esquema y especifica un procesador y una ruta de acceso al bucket de Cloud Storage para guardar los resultados de la extracción en formato JSON.
Busca el ID del procesador a través del vínculo en el texto de la descripción:

Activa la carga:
Con el ID del procesador copiado del último paso, especifica los campos de entrada. La ruta de acceso al bucket del archivo fuente puede ser un bucket, una carpeta o una subcarpeta en el bucket.
Cuando los campos de entrada sean válidos, para activar la carga masiva, en la esquina superior derecha, haz clic en Subir.
Verifica el progreso en la página de estado
Después de que se activa la carga masiva, se te redirecciona a la página de seguimiento de estado:

En la primera tabla, se muestran los documentos pendientes o procesados. Después de que se ingresan, el documento ya no aparece en la primera tabla. Los documentos que no se pudieron subir aparecen en la segunda tabla. A la derecha, las estadísticas muestran la cantidad de documentos ingresados, fallidos y pendientes.

Una vez que se completa el trabajo, la página de estado muestra un 100% sin documentos pendientes:

Examina los documentos subidos
Para encontrar los documentos recién ingresados, vuelve a la vista de búsqueda. Haz clic en el logotipo de Document AI Warehouse o en Buscar en la barra de navegación superior:

Para abrir cualquiera de los documentos recién ingresados, haz clic en el nombre del documento. En el visor de documentos, puedes abrir la vista de IA.

Ve a la pestaña Bloque de texto. Los resultados de OCR se almacenan en el documento:

Próximo paso
Actualiza los documentos existentes con la extracción con Document AI canalización.