Saltar al contenido principal

Extraer texto por expresión - Búsqueda con expresiones regulares API

PDF4me Extraer texto por expresión te permite extraer texto específico de PDF documentos que utilizan expresiones regulares. API procesos de servicio PDF archivos y extrae texto que coincida con patrones/expresiones específicos de PDF Los documentos. El API recibe PDF contenido y patrones de expresiones regulares a través de REST API llamadas, utilizando Base64 Codificación para una transmisión segura. Gracias a su compatibilidad con expresiones regulares complejas y la posibilidad de segmentación flexible por página, esta solución es ideal para flujos de trabajo de procesamiento de documentos y extracción de datos.

Entradas de blog relacionadas
Aún no hay ninguna entrada de blog sobre esta función; estará disponible próximamente.
Mientras tanto, echa un vistazo al blog de PDF4me para encontrar tutoriales y flujos de trabajo para todas las plataformas.
Visita el blog

Autenticando su API Pedido

Para acceder al PDF4me REST APICada solicitud debe incluir las credenciales de autenticación adecuadas. La autenticación garantiza una comunicación segura y valida su identidad como usuario autorizado del sistema. REST API.

Características principales

  • Soporte para expresiones regulares: Extraer texto usando patrones de expresiones regulares para una coincidencia de texto precisa
  • Segmentación de páginas flexible: Procesar páginas específicas o documentos completos con secuencias de páginas personalizadas
  • Coincidencia de patrones: Compatibilidad con expresiones regulares complejas y reconocimiento de patrones.
  • Base64 Codificación: Transmisión segura del contenido de los archivos mediante Base64 codificación
  • Simple API Integración: RESTful API Diseñado para flujos de trabajo de extracción de texto automatizados.

REST API Punto final

El PDF4me REST API utiliza estándar HTTP métodos para interactuar con los recursos. Todas las operaciones de extracción de texto mediante expresiones se realizan a través de un único punto final:

  • Método: POST
  • Punto final: /api/v2/ExtractTextByExpression

REST API Parámetros

Lista completa de parámetros para la función Extraer texto por expresión. REST APILos parámetros están organizados por categoría para una mejor comprensión e implementación.

Importante: Los parámetros marcados con un asterisco (*) son obligatorios y deben proporcionarse para la API para que funcione correctamente.

Parámetros requeridos

ParámetroTipoDescripciónEjemplo
docContent*Base64 (String)El contenido de la entrada PDF archivo en Base64 formatoJVBERi...
docName*StringFuente PDF nombre de archivo con la extensión de archivo adecuadaoutput.pdf
expression*StringPatrón de expresión regular para la extracción de texto. Admite la sintaxis estándar de expresiones regulares, incluyendo grupos, cuantificadores y anclas.% o [A-Za-z]+
pageSequence*StringEspecifique qué páginas procesar. Use "1-" para todas las páginas, "1-3" para un rango o "1,2,3" para páginas específicas.1-3

Parámetros opcionales

ParámetroTipoDescripciónEjemplo
asyncBooleanHabilitar el procesamiento asíncrono. Cuando true, el API devoluciones 202 Accepted con un Location encabezado para sondear el resultadotrue

Producción

El PDF4me Extraer texto por expresión REST API devuelve diferentes respuestas según el modo de procesamiento. API devuelve coincidencias de texto extraídas como un JSON respuesta.

Procesamiento síncrono (predeterminado)

Cuando async es false o no proporcionado, el API Devuelve inmediatamente las coincidencias de texto extraídas.

Código de estado: 200 OK

Formato de respuesta:

{
"textList": ["extracted text 1", "extracted text 2", "extracted text 3"]
}

La respuesta contiene una matriz de cadenas de texto que coinciden con el patrón de expresión regular especificado.

Ejemplo de solicitud

Encabezamiento

Content-Type: application/json
Authorization: Basic YOUR_BASE64_ENCODED_API_KEY

Nota:

  • Consigue tu API clave del PDF4me Panel
  • El API La clave debe ser Base64 codificado y prefijado con "Basic" en el Authorization encabezado
  • Ejemplo: Si su API La clave es abc123, codificarlo a Base64 y usar Authorization: Basic YWJjMTIz

Carga útil

Solicitud básica:

{
"docContent": "JVBERi0xLjQKJeLjz9MKMSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZwovUGFnZXMgMiAwIFIKPj4KZW5kb2JqCjIgMCBvYmoKPDwKL1R5cGUgL1BhZ2VzCi9LaWRzIFszIDAgUl0KL0NvdW50IDEKPD4KZW5kb2JqCjMgMCBvYmoKPDwKL1R5cGUgL1BhZ2UKL1BhcmVudCAyIDAgUgovTWVkaWFCb3ggWzAgMCA2MTIgNzkyXQovUmVzb3VyY2VzIDw8Ci9Gb250IDw8Ci9GMSA0IDAgUgo+Pgo+PgovQ29udGVudHMgNSAwIFIKPj4KZW5kb2JqCjQgMCBvYmoKPDwKL1R5cGUgL0ZvbnQKL1N1YnR5cGUgL1R5cGUxCi9CYXNlRm9udCAvSGVsdmV0aWNhCj4+CmVuZG9iago1IDAgb2JqCjw8Ci9MZW5ndGggNDQKPj4Kc3RyZWFtCkJUCi9GMSAxMiBUZgoxMDAgNzAwIFRkCihIZWxsbyBXb3JsZCkgVGoKRVQKZW5kc3RyZWFtCmVuZG9iagp4cmVmCjAgNgowMDAwMDAwMDAwIDY1NTM1IGYgCjAwMDAwMDAwMDkgMDAwMDAgbiAKMDAwMDAwMDA1NCAwMDAwMCBuIAowMDAwMDAwMTAxIDAwMDAwIG4gCjAwMDAwMDAxNzAgMDAwMDAgbiAKMDAwMDAwMDI0NCAwMDAwMCBuIAp0cmFpbGVyCjw8Ci9TaXplIDYKL1Jvb3QgMSAwIFIKPj4Kc3RhcnR4cmVmCjM0MQolJUVPRg==",
"docName": "output.pdf",
"expression": "%",
"pageSequence": "1-3"
}

Con procesamiento asíncrono:

{
"docContent": "JVBERi0xLjQKJeLjz9MK...",
"docName": "output.pdf",
"expression": "\\d+",
"pageSequence": "1-3",
"async": true
}

Ejemplos de código

El PDF4me Extraer texto por expresión REST API Proporciona ejemplos de código en varios lenguajes de programación. Elija el lenguaje que mejor se adapte a su entorno de desarrollo:

C# (CSharp) Muestra

Completo C# implementación para extraer texto por expresión de PDF:

Características de extracción de texto

Procesamiento de expresiones regulares

  • Coincidencia de patronesCompatibilidad total con la sintaxis y los patrones de expresiones regulares estándar.
  • Patrones complejos: Compatibilidad con funciones avanzadas de expresiones regulares, incluyendo grupos, cuantificadores y anclas.
  • Expresiones personalizadas: Creación de patrones flexibles para requisitos específicos de extracción de texto
  • Validación de patrones: Validación integrada para la sintaxis y compatibilidad de patrones de expresiones regulares
  • Resultados profesionalesExtracción de texto fiable con coincidencia de patrones precisa.

Procesamiento de páginas

  • Segmentación de páginas: Extraer texto de páginas específicas o documentos completos
  • Secuencias de páginas: Compatibilidad con rangos de páginas personalizados y selección de páginas individuales
  • Procesamiento flexible: Procesar cualquier combinación de páginas con control preciso.
  • Procesamiento por lotes: Maneje varias páginas de manera eficiente en una sola API llamadas
  • Diseño profesionalExtracción de texto consistente en todas las páginas de destino.

Características avanzadas

  • Análisis de textoAnálisis e identificación exhaustivos de patrones de texto.
  • Filtrado personalizadoOpciones de filtrado avanzadas para necesidades específicas de extracción de texto.
  • Extracción profesionalExtracción de texto de alta calidad con visibilidad clara.
  • Patrones flexibles: Compatibilidad con cualquier patrón de expresión regular y requisitos de coincidencia de texto.

Casos de uso y aplicaciones en la industria

Casos de uso de servicios legales y profesionales

  • Análisis de documentos: Extraer patrones de datos específicos de contratos, facturas y documentos legales.
  • Análisis de contratos: Extraer términos clave y patrones de datos de contratos legales
  • Monitoreo del cumplimiento: Extraer información regulatoria y datos de cumplimiento de documentos
  • Extracción de datos legales: Extraer patrones de datos específicos de documentos legales

Obtén ayuda