Saltar al contenido principal

Extraer recursos - Extractor de texto e imágenes API

PDF4me Extraer recursos te permite extraer contenido de texto e imágenes incrustadas de PDF documentos. Este API procesos de servicio PDF archivos y extrae recursos de texto e imagen de PDF Los documentos. El API recibe PDF contenido a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Gracias a su compatibilidad con la extracción selectiva de texto e imágenes, esta solución es ideal para flujos de trabajo de procesamiento de contenido y plataformas de extracción de datos.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Autenticando su API Pedido

Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.

Características principales

  • Extracción de texto: Extraer todo el contenido de texto de PDF documentos
  • Extracción de imágenes: Recuperar todas las imágenes y elementos visuales de PDF documentos
  • Extracción selectivaElija extraer solo texto, solo imágenes o ambos según sus necesidades.
  • Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
  • Simple API Integración: RESTful API Diseñado para flujos de trabajo de extracción de contenido automatizados.

REST API Punto final

El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de recursos se realizan a través de un único punto final:

  • Método: POST
  • Punto final: /api/v2/ExtractResources

REST API Parámetros

Lista completa de parámetros para la extracción de recursos REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.

Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.

Parámetros requeridos

ParámetroTipoDescripciónEjemplo
docContent*Base64 (String)El contenido de la entrada PDF archivo codificado en Base64 formato para el procesamiento de extracción de recursos y análisis de contenidoJVBERi...
docName*StringFuente PDF Nombre de archivo con la extensión .pdf adecuada para la identificación del documento y el procesamiento de extracción de recursos.sample.pdf
extractText*BooleanElija si desea extraer el contenido de texto del PDF: verdadero: Extraer todo el contenido de texto con formato, FALSO: Omitir la extracción de texto para el procesamiento solo de imágenestrue
extractImages*BooleanElija si desea extraer imágenes de la PDF: verdadero: Extraer imágenes y elementos visuales, FALSOOmitir la extracción de imágenes para un procesamiento de texto más rápidotrue

Parámetros opcionales

ParámetroTipoDescripciónEjemplo
asyncBooleanHabilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultadotrue

Producción

El PDF4me Extraer recursos REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve el texto y las imágenes extraídos como un JSON respuesta.

Procesamiento síncrono (predeterminado)

Cuando async es false o no proporcionado, el API Devuelve los recursos extraídos inmediatamente.

Código de estado: 200 OK

Formato de respuesta:

{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}

La respuesta contiene texto extraído como una matriz de cadenas e imágenes extraídas como una matriz de objetos con nombres de archivo y Base64-contenido codificado.

Ejemplo de solicitud

Encabezamiento

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Nota:

  • Consigue tu API clave del PDF4me Panel
  • El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
  • Ejemplo: Si su API La clave es abc123, codificarlo a Base64 y usar Authorization: Basic YWJjMTIz

Carga útil

Solicitud básica:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}

Con procesamiento asíncrono:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}

Ejemplos de código

El PDF4me Extraer recursos REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:

C# (CSharp) Muestra

Completo C# implementación para extraer recursos de PDF:

Características de extracción de imágenes

  • Imágenes de alta calidad: Extraer imágenes con resolución y calidad originales
  • Múltiples formatos: Compatibilidad con varios formatos de imagen (JPG, PNG, GIF, etc.)
  • Gráficos vectoriales: Extraer gráficos y diagramas vectoriales escalables
  • Preservación de metadatos: Mantener las propiedades y los metadatos de las imágenes.

Procesamiento avanzado

  • Extracción selectiva: Elija entre extracción solo de texto, solo de imagen o combinada.
  • Procesamiento por lotes: Procesar múltiples PDFs y extraer recursos de manera eficiente
  • Análisis de contenidoAnalizar y categorizar los tipos de contenido extraídos.
  • Resultados profesionalesExtracción de alta calidad adecuada para aplicaciones empresariales.

Casos de uso y aplicaciones en la industria

Casos de uso para la gestión y el procesamiento de documentos

  • Digitalización de contenidos: Extraer texto e imágenes de documentos escaneados para archivos digitales.
  • Análisis de documentosAnalizar PDF contenido para la extracción y procesamiento de información
  • Migración de datos: Extraer contenido durante la migración de documentos y las actualizaciones del sistema.
  • Indexación de contenido: Crear índices de búsqueda desde PDF contenido de texto e imágenes

Obtén ayuda