Extraer texto por expresión - Búsqueda con expresiones regulares API
PDF4me Extraer texto por expresión te permite extraer texto específico de PDF documentos que utilizan expresiones regulares. API procesos de servicio PDF archivos y extrae texto que coincida con patrones/expresiones específicos de PDF Los documentos. El API recibe PDF contenido y patrones de expresiones regulares a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Gracias a su compatibilidad con expresiones regulares complejas y la posibilidad de segmentación flexible por página, esta solución es ideal para flujos de trabajo de procesamiento de documentos y extracción de datos.
Autenticando su API Pedido
Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.
Características principales
- Soporte para expresiones regulares: Extraer texto usando patrones de expresiones regulares para una coincidencia de texto precisa
- Segmentación de páginas flexible: Procesar páginas específicas o documentos completos con secuencias de páginas personalizadas
- Coincidencia de patrones: Compatibilidad con expresiones regulares complejas y reconocimiento de patrones.
- Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
- Simple API Integración: RESTful API Diseñado para flujos de trabajo de extracción de texto automatizados.
REST API Punto final
El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de texto mediante expresiones se realizan a través de un único punto final:
- Método: POST
- Punto final:
/api/v2/ExtractTextByExpression
REST API Parámetros
Lista completa de parámetros para la función Extraer texto por expresión. REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.
Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.
Parámetros requeridos
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| docContent* | Base64 (String) | El contenido de la entrada PDF archivo en Base64 formato | JVBERi... |
| docName* | String | Fuente PDF nombre de archivo con la extensión de archivo adecuada | output.pdf |
| expression* | String | Patrón de expresión regular para la extracción de texto. Admite la sintaxis estándar de expresiones regulares, incluyendo grupos, cuantificadores y anclas. | % o [A-Za-z]+ |
| pageSequence* | String | Especifique qué páginas procesar. Use "1-" para todas las páginas, "1-3" para un rango o "1,2,3" para páginas específicas. | 1-3 |
Parámetros opcionales
| Parámetro | Tipo | Descripción | Ejemplo |
|---|---|---|---|
| async | Boolean | Habilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultado | true |
Producción
El PDF4me Extraer texto por expresión REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve coincidencias de texto extraídas como un JSON respuesta.
- Success Response
- Asynchronous Processing
- Error Responses
- Response Format Details
Procesamiento síncrono (predeterminado)
Cuando async es false o no proporcionado, el API Devuelve inmediatamente las coincidencias de texto extraídas.
Código de estado: 200 OK
Formato de respuesta:
{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}
La respuesta contiene una matriz de cadenas de texto que coinciden con el patrón de expresión regular especificado.
Procesamiento asíncrono
Cuando async es true, el API procesa el documento de forma asíncrona.
Respuesta inicial:
Código de estado: 202 Accepted
Encabezados de respuesta:
Location: https://api.pdf4me.com/api/v2/ExtractTextByExpressionStatus/{operationId}
Cuerpo de la respuesta:
{
"traceId": "operation-trace-id"
}
Encuesta para obtener resultados:
Utilice el Location encabezado URL para consultar la finalización:
const response = await fetch(locationUrl, {
headers: { 'Authorization': 'Basic ' + apiKey }
});
// Continue polling until status code is 200
if (response.status === 200) {
const result = await response.json();
// Process extracted text matches
}
Respuestas de error
| Código de estado | Descripción | Ejemplo de respuesta |
|---|---|---|
| 400 Bad Request | Parámetros de solicitud no válidos, campos obligatorios faltantes o patrón de expresión regular no válido. | {"error": "Missing required parameter: expression"} |
| 401 Unauthorized | Inválido o faltante API llave | {"error": "Unauthorized"} |
| 408 Tiempo de espera de solicitud agotado | Tiempo de espera agotado para el procesamiento de la solicitud. | {"error": "Request timeout"} |
| 500 Internal Server Error | Error del servidor durante el procesamiento | {"error": "Internal server error"} |
Comprender el JSON Respuesta
La respuesta de extracción de texto es una JSON objeto que contiene:
- Lista de texto: Array de cadenas que contienen todas las coincidencias de texto que coinciden con el patrón de expresión regular especificado
Formatos de secuencia de páginas:
"1-": Procesar todas las páginas desde la página 1 hasta el final."1-3": Procesar las páginas 1, 2 y 3"1,2,3": Procesar las páginas específicas 1, 2 y 3
Ejemplos de expresiones:
"%": Coincidencia de símbolos de porcentaje"\\d+": Coincidencia de uno o más dígitos"[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\\.[a-zA-Z]{2,}": Coincidencia de direcciones de correo electrónico"https?://[^\\s]+": Coincidencia de URL
Ejemplo de solicitud
Encabezamiento
Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY
Nota:
- Consigue tu API clave del PDF4me Panel
- El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
- Ejemplo: Si su API La clave es
abc123, codificarlo a Base64 y usarAuthorization: Basic YWJjMTIz
Carga útil
Solicitud básica:
{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}
Con procesamiento asíncrono:
{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}
Ejemplos de código
El PDF4me Extraer texto por expresión REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:
- C#
- Java
- JavaScript
- Python
- Salesforce
- n8n
- Google Script
- AWS Lambda
C# (CSharp) Muestra
Completo C# implementación para extraer texto por expresión de PDF:
Java Muestra
Java Implementación con manejo completo de errores y procesamiento de respuestas:
JavaScript Muestra
Node.js y compatible con navegadores JavaScript implementación:
Google Apps Script Muestra
Google Apps Script implementación para Google Workspace integración:
Características de extracción de texto
Procesamiento de expresiones regulares
- Coincidencia de patronesCompatibilidad total con la sintaxis y los patrones de expresiones regulares estándar.
- Patrones complejos: Compatibilidad con funciones avanzadas de expresiones regulares, incluyendo grupos, cuantificadores y anclas.
- Expresiones personalizadas: Creación de patrones flexibles para requisitos específicos de extracción de texto
- Validación de patrones: Validación integrada para la sintaxis y compatibilidad de patrones de expresiones regulares
- Resultados profesionalesExtracción de texto fiable con coincidencia de patrones precisa.
Procesamiento de páginas
- Segmentación de páginas: Extraer texto de páginas específicas o documentos completos
- Secuencias de páginas: Compatibilidad con rangos de páginas personalizados y selección de páginas individuales
- Procesamiento flexible: Procesar cualquier combinación de páginas con control preciso.
- Procesamiento por lotes: Maneje varias páginas de manera eficiente en una sola API llamadas
- Diseño profesionalExtracción de texto consistente en todas las páginas de destino.
Características avanzadas
- Análisis de textoAnálisis e identificación exhaustivos de patrones de texto.
- Filtrado personalizadoOpciones de filtrado avanzadas para necesidades específicas de extracción de texto.
- Extracción profesionalExtracción de texto de alta calidad con visibilidad clara.
- Patrones flexibles: Compatibilidad con cualquier patrón de expresión regular y requisitos de coincidencia de texto.
Casos de uso y aplicaciones en la industria
- Legal & Professional Services
- Finance & Banking
- Business & Enterprise
- Education & Research
- Government & Compliance
Casos de uso de servicios legales y profesionales
- Análisis de documentos: Extraer patrones de datos específicos de contratos, facturas y documentos legales.
- Análisis de contratos: Extraer términos clave y patrones de datos de contratos legales
- Monitoreo del cumplimiento: Extraer información regulatoria y datos de cumplimiento de documentos
- Extracción de datos legales: Extraer patrones de datos específicos de documentos legales
Casos de uso en finanzas y banca
- Procesamiento de facturas: Extraer datos de facturas y valores de campos mediante coincidencia de patrones
- Informes financieros: Extraer métricas y puntos de datos específicos de PDF informes
- Monitoreo del cumplimiento: Extraer información regulatoria y datos de cumplimiento de documentos
- Minería de datos financieros: Extraer datos estructurados de documentos financieros
Casos de uso para empresas y negocios
- Minería de datos: Identificar y extraer datos estructurados de datos no estructurados PDF documentos
- Procesamiento de contenido: Extraer patrones de texto específicos para la gestión y el análisis de contenido.
- Procesamiento de formularios: Extraer datos de formularios y valores de campos mediante coincidencia de patrones
- Inteligencia empresarial: Extraer métricas comerciales clave e indicadores de rendimiento de PDF informes
Casos de uso en educación e investigación
- Aplicaciones de investigación: Extraer patrones de datos específicos de artículos de investigación y documentos académicos.
- Extracción de datos académicosExtraer datos estructurados de artículos de investigación.
- Análisis de la investigaciónExtraer métricas específicas de documentos académicos
- Procesamiento de contenido educativo: Extraer patrones de texto de documentos educativos
Casos de uso en materia de gobierno y cumplimiento normativo
- Monitoreo del cumplimiento: Extraer información regulatoria y datos de cumplimiento de documentos
- Extracción de datos regulatoriosExtraer datos estructurados de documentos regulatorios
- Informes gubernamentalesExtraer métricas específicas de informes gubernamentales
- Registros públicos: Extraer patrones de datos de registros y documentos públicos