Extraer recursos - Extractor de texto e imágenes API
PDF4me Extraer recursos te permite extraer contenido de texto e imágenes incrustadas de PDF documentos. Este API procesos de servicio PDF archivos y extrae recursos de texto e imagen de PDF Los documentos. El API recibe PDF contenido a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Gracias a su compatibilidad con la extracción selectiva de texto e imágenes, esta solución es ideal para flujos de trabajo de procesamiento de contenido y plataformas de extracción de datos.
Autenticando su API Pedido
Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.
Características principales
- Extracción de texto: Extraer todo el contenido de texto de PDF documentos
- Extracción de imágenes: Recuperar todas las imágenes y elementos visuales de PDF documentos
- Extracción selectivaElija extraer solo texto, solo imágenes o ambos según sus necesidades.
- Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
- Simple API Integración: RESTful API Diseñado para flujos de trabajo de extracción de contenido automatizados.
REST API Punto final
El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de recursos se realizan a través de un único punto final:
- Método: POST
- Punto final:
/api/v2/ExtractResources
REST API Parámetros
Lista completa de parámetros para la extracción de recursos REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.
Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.
Parámetros requeridos
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| docContent* | Base64 (String) | El contenido de la entrada PDF archivo codificado en Base64 formato para el procesamiento de extracción de recursos y análisis de contenido | JVBERi... |
| docName* | String | Fuente PDF Nombre de archivo con la extensión .pdf adecuada para la identificación del documento y el procesamiento de extracción de recursos. | sample.pdf |
| extractText* | Boolean | Elija si desea extraer el contenido de texto del PDF: verdadero: Extraer todo el contenido de texto con formato, FALSO: Omitir la extracción de texto para el procesamiento solo de imágenes | true |
| extractImages* | Boolean | Elija si desea extraer imágenes de la PDF: verdadero: Extraer imágenes y elementos visuales, FALSOOmitir la extracción de imágenes para un procesamiento de texto más rápido | true |
Parámetros opcionales
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| async | Boolean | Habilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultado | true |
Producción
El PDF4me Extraer recursos REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve el texto y las imágenes extraídos como un JSON respuesta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Procesamiento síncrono (predeterminado)
Cuando async es false o no proporcionado, el API Devuelve los recursos extraídos inmediatamente.
Código de estado: 200 OK
Formato de respuesta:
{
"textList": ["extracted text content...", "more text..."],
"imageList": [
{
"fileName": "image1.png",
"imageContent": "base64-encoded-image-content..."
},
{
"fileName": "image2.jpg",
"imageContent": "base64-encoded-image-content..."
}
]
}
La respuesta contiene texto extraído como una matriz de cadenas e imágenes extraídas como una matriz de objetos con nombres de archivo y Base64-contenido codificado.
Procesamiento asíncrono
Cuando async es true, el API procesa el documento de forma asíncrona.
Respuesta inicial:
Código de estado: 202 Accepted
Encabezados de respuesta:
Location: https://api.pdf4me.com/api/v2/ExtractResourcesStatus/{operationId}
Cuerpo de la respuesta:
{
"traceId": "operation-trace-id"
}
Encuesta para obtener resultados:
Utilice el Location encabezado URL para consultar la finalización:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted resources
}
Respuestas de error
| Código de estado | Descripción | Ejemplo de respuesta |
|---|---|---|
| 400 Bad Request | Parámetros de solicitud no válidos o campos obligatorios faltantes. | {"error": "Missing required parameter: docContent"} |
| 401 Unauthorized | Inválido o faltante API llave | {"error": "Unauthorized"} |
| 408 Tiempo de espera de solicitud agotado | Tiempo de espera agotado para el procesamiento de la solicitud. | {"error": "Request timeout"} |
| 500 Internal Server Error | Error del servidor durante el procesamiento | {"error": "Internal server error"} |
Comprender el JSON Respuesta
La respuesta de extracción de recursos es una JSON objeto que contiene:
- Lista de texto: Array de cadenas que contienen contenido de texto extraído (si
extractTextestrue) - lista de imágenes: Array de objetos de imagen (si
extractImagesestrue) - Nombre del archivo: El nombre del archivo de imagen extraído
- contenido de la imagen: Base64-contenido codificado de la imagen
Decodificación Base64 Contenido de la imagen:
Para decodificar y guardar Base64-imágenes codificadas:
// JavaScript
const decoded = atob(base64String);
const blob = new Blob([decoded], { type: 'image/png' });
const url = URL.createObjectURL(blob);
# Python
import base64
image_data = base64.b64decode(base64_string)
with open('extracted_image.png', 'wb') as f:
f.write(image_data)
Ejemplo de solicitud
Encabezamiento
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Consigue tu API clave del PDF4me Panel
- El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
- Ejemplo: Si su API La clave es
abc123, codificarlo a Base64 y usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitud básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true
}
Con procesamiento asíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "sample.pdf",
"extractText": true,
"extractImages": true,
"async": true
}
Ejemplos de código
El PDF4me Extraer recursos REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
Java Muestra
Java Implementación con manejo completo de errores y procesamiento de respuestas:
JavaScript Muestra
Node.js y compatible con navegadores JavaScript implementación:
Google Apps Script Muestra
Google Apps Script implementación para Google Workspace integración:
Características de extracción de imágenes
- Imágenes de alta calidad: Extraer imágenes con resolución y calidad originales
- Múltiples formatos: Compatibilidad con varios formatos de imagen (JPG, PNG, GIF, etc.)
- Gráficos vectoriales: Extraer gráficos y diagramas vectoriales escalables
- Preservación de metadatos: Mantener las propiedades y los metadatos de las imágenes.
Procesamiento avanzado
- Extracción selectiva: Elija entre extracción solo de texto, solo de imagen o combinada.
- Procesamiento por lotes: Procesar múltiples PDFs y extraer recursos de manera eficiente
- Análisis de contenidoAnalizar y categorizar los tipos de contenido extraídos.
- Resultados profesionalesExtracción de alta calidad adecuada para aplicaciones empresariales.
Casos de uso y aplicaciones en la industria
- Document Management & Processing
- Business & Finance
- Legal & Compliance
- Healthcare & Medical
- Education & Research
- Marketing & Content
Casos de uso para la gestión y el procesamiento de documentos
- Digitalización de contenidos: Extraer texto e imágenes de documentos escaneados para archivos digitales.
- Análisis de documentosAnalizar PDF contenido para la extracción y procesamiento de información
- Migración de datos: Extraer contenido durante la migración de documentos y las actualizaciones del sistema.
- Indexación de contenido: Crear índices de búsqueda desde PDF contenido de texto e imágenes
Casos de uso en negocios y finanzas
- Procesamiento de facturas: Extraer texto e imágenes de las facturas para su procesamiento automatizado.
- Análisis del informe: Extraer datos y gráficos de informes y estados financieros
- Gestión de contratos: Extraer texto y elementos visuales de contratos y acuerdos
- Documentación de cumplimiento: Procesar documentos reglamentarios y extraer la información requerida.
Casos de uso legales y de cumplimiento normativo
- Tramitación de documentos legales: Extraer texto y pruebas de documentos legales
- Gestión de casos: Extraer contenido de expedientes y escritos legales.
- Cumplimiento normativo: Procesar los documentos de cumplimiento y extraer los datos necesarios.
- Recopilación de pruebas: Extraer texto e imágenes para pruebas y documentación legal.
Casos de uso en el sector sanitario y médico
- Registros médicosExtraer texto e imágenes de los registros de pacientes e informes médicos.
- Datos de investigaciónProcesar documentos de investigación y extraer datos y gráficos.
- Ensayos clínicosExtraer información de los documentos de estudios clínicos
- Imágenes médicas: Extraer imágenes médicas y contenido de diagnóstico de PDFs
Casos de uso en educación e investigación
- Artículos académicosExtraer texto y figuras de artículos y publicaciones de investigación.
- Contenido educativo: Procesar libros de texto y materiales educativos
- Datos de investigaciónExtraer datos y gráficos de documentos de investigación.
- Digitalización de bibliotecasDigitalizar las colecciones de la biblioteca y extraer el contenido que se pueda buscar.
Casos de uso de marketing y contenido
- Creación de contenido: Extraer texto e imágenes para marketing de contenidos y redes sociales.
- Activos de marca: Extraer logotipos y elementos de marca de PDF documentos
- Recursos de diseño: Extraer elementos de diseño y gráficos para proyectos creativos
- Reutilización de contenido: Extraer contenido para su reutilización en diferentes formatos y plataformas.