Puede convertir cualquier documento PDF o imagen en datos estructurados y utilizables con Azure Content Understanding y Power Automate: contratos, facturas, extracción de tablas de informes, o lectura de PDF con texto escrito a mano. Microsoft Foundry tiene muchas opciones para el procesamiento de documentos, y la API de Content Understanding es una de ellas.
En este blog, hablaremos de qué trata el servicio y mostraremos un recorrido sobre cómo llamar al servicio directamente desde Power Automate.
Tabla de Contenidos
¿Qué es Azure Content Understanding?
Azure Content Understanding es la generación más reciente de servicios de procesamiento de documentos de Microsoft. Actualmente se encuentra dentro Portal de Microsoft Foundry.
La comprensión de contenido evolucionó de lo que antes se llamaba Azure Document Intelligence (anteriormente parte de Azure Cognitive Services, llamado Form Recognizer). La consolidación de servicios en una única plataforma muestra la estrategia de Microsoft para unificar todas las capacidades de IA (agentes, modelos, voz y lectura de documentos) en un solo lugar.
El entendimiento de contenido soporta una amplia variedad de servicios a través de una API unificada.
Puede aprender más sobre los modelos y servicios listos para usar en nuestro blog dedicado a este tema. Para eles blog, estaremos enfócate en el analizador de diseño preconstruido, que puede extrae texto, párrafos e imágenes de PDFs sin necesidad de entrenamiento de modelos.
Paso a paso: usar el servicio de comprensión de contenido de Power Automate
Requisitos previos
Necesitas un recurso de Microsoft Foundry desplegado en el portal de Azure antes de empezar. Para obtener más información sobre la creación de un recurso de Microsoft Foundry en 2026, puede ver este tutorial en nuestro canal de YouTube.
Una vez desplegado, obtén el punto de conexión y la clave de suscripción desde Claves y punto final sección bajo la Servicios de IA pestaña o del recurso gestión sección
Paso 1. Crea un flujo de nube instantáneo nuevo en Power Automate
Ve al portal de Power Automate y crea un flujo instantáneo. Dale un nombre descriptivo como Azure_ContentUnderstanding_Ejemplo.
Paso 2. Obtener el contenido del archivo desde SharePoint
Añadir un Obtener contenido de archivo usando ruta Acción. Selecciona tu sitio de SharePoint y luego proporciona la ruta del archivo a tu PDF.
Paso 3. Añadir una acción HTTP para enviar el documento
añade un HTTP acción y establecer el método a Publicación. La URL sigue este patrón de la documentación de Comprensión de contenido:
{endpoint}/contentunderstanding/analyzers/prebuilt-layout/analyze?api-version=2025-11-01
Encabezados:
Content-Type: application/json
Ocp-Apim-Subscription-Key: {tu clave}
La versión de la API se puede extraer del estudio de comprensión de contenido.
Paso 4. Convierte el archivo a Base64 y configura el cuerpo de la solicitud
La API de Comprensión de Contenido espera el contenido del archivo en formato Base64. En el cuerpo de HTTP, usa el generador de expresiones y envuelve el contenido del archivo de SharePoint con base64() función:
{
"inputs": [
{
"data": "@{base64(body('Get_file_content'))}"
}
]
}
Paso 5. Extraer la ubicación de la operación de las cabeceras de respuesta
La llamada POST no devuelve el contenido extraído inmediatamente. En su lugar, las cabeceras de respuesta contienen un operación-ubicación URL donde estará disponible el resultado.
Extráelo usando esta expresión:
@{outputs('HTTP')?['headers']?['operation-location']}
Paso 6. Agrega un bucle Do Until para esperar a que el resultado esté disponible
Añadir un Haz hasta control acción. Dentro del bucle, coloca una Retraso de 10 segundos seguido de un nuevo HTTP GET acción que llama a la URL de ubicación de la operación (con la misma cabecera de clave de suscripción). Configure el "Hasta que" para que siga ejecutándose mientras el estado del cuerpo de la respuesta sea igual a corriendo:
@{body('HTTP_Get_Responses')?['status']} no es igual a "running"
Así es como debería verse la acción Get para extraer el estado de la respuesta.
Paso 7. Acceder al resultado final
Una vez que el bucle sale (el estado es triunfó), podemos extraer los resultados haciendo referencia al cuerpo de su acción HTTP GET. Esto nos da la respuesta JSON completa que contiene párrafos, contenido de texto, ubicaciones de imágenes, número de páginas y todo lo que necesitamos.
Esta es la función que se puede usar:
@{body('Respuestas_HTTP_GET')}
Ejemplos de entradas y salidas de Azure Content Understanding
Los analizadores precompilados en Content Understanding manejan una variedad de tipos de documentos, cada uno devolviendo JSON estructurado con el que puedes trabajar directamente en Power Automate.
Tipos de entrada admitidos
- Archivos PDF (de una y varias páginas)
- Facturas, recibos, facturas de servicios públicos, abonos
- Formularios fiscales de EE. UU.
- Contratos
- Imágenes (JPEG, PNG, TIFF, BMP)
- Documentos de identidad (pasaportes o documentos de identidad genéricos)
- Archivos de audio para transcripción
- Archivos de video (para análisis multimodal)
- URL de archivos públicos
Qué se extrae
- Texto completo de OCR por página
- Bloques de párrafos con cuadros delimitadores
- Tablas con filas, columnas y valores de celda
- Imágenes detectadas y sus posiciones
- Recuento de páginas y dimensiones
- Pares clave-valor predeterminados (por ejemplo, para facturas o formularios fiscales de EE. UU.)
- Pares clave-valor personalizados (para tus propios modelos entrenados)
- Campos estructurados con puntuaciones de confianza
Después de que la operación asíncrona se completa, el cuerpo se ve así:
{
"status": "succeeded",
"resultado": {
"páginas": [
{
"número de página": 1,
"párrafos": [{ "contenido": "Detalles del evento..." }],
"figuras": [{ "regiones delimitadoras": [] }],
"tablas": [{ "número de filas": 5, "número de columnas": 3 }]
}
],
"content": "Texto completo extraído del documento..."
}
}
En Power Automate, podemos navegar por esta estructura utilizando el ?[‘resultado’]?[‘contenido’] expresión para extraer exactamente el campo que necesitamos para la lógica posterior.
Cada modelo puede devolver una respuesta JSON diferente dependiendo del modelo que se esté llamando. Explotar el estudio de comprensión de contenido es la mejor opción para comprender mejor las entradas y salidas para cada requisito.
Problemas comunes al usarAzure Content Understanding desde Power Automate
El contenido del archivo está en binario: la API devuelve un error
Cuando obtienes un archivo de SharePoint usando Obtener contenido del archivo, la salida es binaria:
Pasarlo directamente al cuerpo de la solicitud HTTP provocará un error de solicitud mal formada en la llamada a la API.
Arreglar: Envuelve el contenido del archivo en el base64() expresión en el interior del cuerpo:
@{base64(body('Get_file_content'))}
Usando una versión de API obsoleta o en vista previa
Versiones de API 01-12-2024 y 2025-05-01-vista_previa serán retirados el 15 de julio de 2026. El uso de una versión preliminar en producción también implica que no habrá cobertura de SLA y posibles cambios disruptivos sin previo aviso.
Arreglar: Usar la versión GA 2025-11-01 en la URL de su punto de conexión. Puede confirmar la versión recomendada actual comprobando la muestra de código que se muestra en Content Understanding Studio en cualquier documento de ejemplo.
El flujo consume demasiadas llamadas a la API al consultar con demasiada frecuencia
Sin demora, el bucle Do Until puede iterar docenas de veces por segundo, consumiendo cuota de acciones de Power Automate y potencialmente alcanzando límites de tasa de Comprensión de Contenido.
Arreglar: comodín Retraso entra en el bucle. Diez segundos es un valor predeterminado práctico; 5 segundos es aceptable para flujos sensibles al tiempo.
Mejores Prácticas para la Automatización de Contenidos con IA
- Utiliza siempre sondeos asíncronos, no retardos fijos. Nunca confíes en que la respuesta estará lista en 5 o 10 segundos, siempre añade un sistema de espera adecuado para los flujos de trabajo de comprensión de documentos.
- Utiliza flujos secundarios para la lógica de extracción reutilizable. Si va a implementar la comprensión de documentos a partir de varios flujos y necesita leer documentos, envuelva el bucle de sondeo en un flujo secundario único que pueda ser llamado desde cualquiera de los otros flujos.
- Guarda tu clave de API y tu endpoint en una variable de entorno. Es mejor no codificar las claves de suscripción directamente en las acciones HTTP.
- Utilice puntuaciones de confianza para dirigir documentos para su revisión. La API devuelve valores de confianza para los campos extraídos. Utilice estos valores para dirigir los resultados de baja confianza a un paso de revisión humana en lugar de que se procesen automáticamente.
- Mantente atento a la versión de la API de Disponibilidad General (GA). Asegúrate de verificar si la versión de la API que se está utilizando será descontinuada o reemplazada y mantén tus flujos de trabajo actualizados.
Tutorial en video: uso del servicio de Comprensión de contenido de Power Automate
También creamos un tutorial paso a paso en nuestro canal de YouTube donde Graciela muestra cómo usar el servicio de comprensión de contenido y cómo implementar el sistema de espera con un bucle Do-while. conjunto de acciones.
Automatiza flujos de trabajo de comprensión de contenido con PowerGI
Ya sea que estés listo para implementar el procesamiento de documentos con IA o explorando lo que es posible, contáctanos y descubre la alegría de automatizar los procesos de comprensión de documentos.