Extraer texto por expresión
Extracto → Extraer texto por expresión
El Extraer texto por expresión API extrae texto de un PDF que coincide con una expresión regular. Usted envía el PDF como Base64 (docContent), docName, expression (patrón de expresión regular), pageSequence (p. ej. 1-, 1-3, 1,2,3) y opcionalmente async. El API devoluciones JSON Con todas las coincidencias. Utilice el probador que aparece a continuación para comprobarlo; encontrará más detalles y ejemplos de expresiones en las secciones siguientes.
Prueba la función Extraer texto por expresión. API
:::nota Referencia rápida
Punto final: POST /api/v2/ExtractTextByExpression · Requerido: api-key, docContent, docName, expression, pageSequence
:::
Utiliza el formulario a continuación para enviar tu solicitud API llave, PDF (Base64), y un patrón de expresión regular (por ejemplo, %, \d+, patrón de correo electrónico). La respuesta es JSON Con todas las coincidencias de texto. No se requiere código, complete los campos y haga clic. Enviar solicitud.
Descripción general, parámetros y casos de uso
- Overview
- Parameters
- Use cases
¿Qué es la extracción de texto mediante expresión?
Este punto final extrae texto de un PDF que coincide con una expresión regular. Usted proporciona la PDF (Base64), expression (patrón de expresión regular), pageSequence (p. ej., 1- para todas las páginas, 1-3 para un rango, 1,2,3 para páginas específicas) y opcionalmente async. El API devoluciones JSON con todas las coincidencias de texto. Úselo para extraer correos electrónicos, números, fechas, URLs, o cualquier patrón de PDFs.
Características principales
- patrones de expresiones regulares: expression: p.ej.
%,\d+, patrón de correo electrónico, patrón de fecha, moneda. - Segmentación de páginas: pageSequence:
1-(todo),1-3(rango),1,2,3(páginas específicas). - JSON respuesta: Todas las coincidencias con el patrón especificado.
- Asíncrono: Usar async para grandes PDFs o muchos partidos.
Utilizar cuando se necesitan datos específicos (correos electrónicos, números, fechas, cantidades) de PDFsPara ver el texto completo o las imágenes, utilice Extraer recursos; para tablas use Extraer tabla del PDF.
API parámetros
| Parámetro | Tipo | Requerido | Descripción |
|---|---|---|---|
| api-key | cadena | Sí | Su PDF4me API llave, Base64 codificado. Consíguelo desde el panel. |
| docContent | base64 | Sí | PDF contenido del archivo (Base64). |
| docName | cadena | Sí | PDF Nombre del archivo con extensión .pdf. |
| expression | cadena | Sí | Patrón de expresión regular (por ejemplo, %, \d+, patrón de correo electrónico). |
| pageSequence | cadena | Sí | Rango de páginas: 1- (todas), 1,2,3, 1-5, etc. |
| async | booleano | No | Habilitar el procesamiento asíncrono. |
Cuándo usar la función Extraer texto por expresión
- Correos electrónicos y URLs: Extraer correos electrónicos, números de teléfono o enlaces de PDFs.
- Números y cantidades: Extraer porcentajes, cantidades monetarias o identificadores.
- Fechas: Extraer fechas en varios formatos (MM/DD/AAAA, ISO, etc.).
- Datos estructurados: Extraer patrones específicos (por ejemplo, números de factura, números de seguridad social) para los flujos de trabajo.
Para ver esquemas de solicitud/respuesta y ejemplos de código, consulte Extraer texto por expresión en el PDF4me API documentos.
Requisitos previos
Antes de utilizar este punto final, asegúrese de tener:
- Un válido PDF4me API llave (Consigue tu API Llave)
- A PDF documento en Base64 formato o público URL a un PDF archivo
- Un patrón de expresión regular para buscar
Ejemplos de expresiones
- Basic Patterns
- Currency & Percentages
- Contact Information
- Dates
- Text Patterns
- Advanced
- Quick Test Examples
Patrones básicos comunes de expresiones regulares:
%- Símbolo de porcentaje de coincidencia (p. ej., 50%, 100%)\d+- Haga coincidir uno o más dígitos (por ejemplo, 123, 4567)\d+\.\d+- Coincidir con números decimales (p. ej., 3.14, 99.99)[A-Za-z]+- Empareja una o más letras\d{4}- Coincide exactamente con 4 dígitos (por ejemplo, años como 2024).
Patrones para la extracción de datos financieros:
\d+%- Asocia los porcentajes con los números (p. ej., 50%, 100%).\$[\d,]+\.?\d*- Igualar las cantidades en dólares estadounidenses (por ejemplo, $100, $1234,56)€[\d,]+\.?\d*- Igualar las cantidades en euros (por ejemplo, 50 €, 1.000,00 €)£[\d,]+\.?\d*- Coincidir con las cantidades en libras esterlinas (por ejemplo, 50 £, 1000,00 £)
Extraer datos de contacto de los documentos:
[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- Coincidir direcciones de correo electrónico (por ejemplo, [email protected])\+?[\d\s\-\(\)]{10,}- Coincidencia de números de teléfono (varios formatos)https?://[^\s]+- Fósforo URLs (p.ej., https://ejemplo.com)
Extraer fechas en varios formatos:
\d{1,2}/\d{1,2}/\d{2,4}- Fechas de partido como 25/12/2024 o 05/01/2024\d{4}-\d{2}-\d{2}- Coincidir con las fechas ISO (por ejemplo, 2024-12-25)[A-Z]{2,3}\s+\d{1,2}\s+\d{4}- Fechas de partido como "25 de diciembre de 2024"
Extraer patrones de texto específicos:
PDF|pdf- Une la palabra "PDF" (patrón que no distingue entre mayúsculas y minúsculas)Chapter\s+\d+- Haga coincidir "Capítulo" seguido de un número (por ejemplo, Capítulo 1).[A-Z][a-z]+\s+[A-Z][a-z]+- Coincidir con nombres en mayúsculas (por ejemplo, John Doe)
Patrones complejos para casos de uso específicos:
\b\d{3}-\d{2}-\d{4}\b- Coincidencia con el formato del número de seguro social (p. ej., 123-45-6789)\b\d{4}\s\d{4}\s\d{4}\s\d{4}\b- Coincidencia de números de tarjeta de crédito (16 dígitos con espacios)[A-Z]{2}\d{2}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}- Fósforo IBAN formato
Expresiones recomendadas para probar con su sample (2).pdf archivo:
%- Encuentra todos los símbolos de porcentaje (empieza con algo sencillo)\d+- Extraer todos los números del documento[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- Extraer direcciones de correo electrónicohttps?://[^\s]+- Extraer enlaces web\d{1,2}/\d{1,2}/\d{2,4}- Fechas de extracción\$[\d,]+\.?\d*- Extraer cantidades en dólares
Ejemplos de secuencias de páginas:
1-- Todas las páginas desde la página 1 hasta el final1-3- Páginas 1, 2 y 31,2,3- Páginas específicas 1, 2 y 3all- Todas las páginas (si son compatibles)
Formato de respuesta
El API devuelve un JSON Respuesta con todas las coincidencias de texto encontradas para el patrón de expresión regular especificado.