Convertir PDF a Excel
PDF4me Convertir PDF a Excel es un REST punto final que extrae tablas y texto de un PDF y devuelve un objeto editable Excel libro de ejercicios. POST a Base64 PDF a /api/v2/ConvertPdfToExcel, seleccione Draft o Alta calidad, habilite OCR para escaneado pagesy guardar el devuelto .xlsx bytes. Una llamada, sin necesidad de volver a escribir manualmente.
Envía uno PDF entra, consigue uno Excel El motor detecta las estructuras de tabla en cada página y las reconstruye como celdas de hoja de cálculo, extrayendo el texto circundante. qualityType cambia entre extracción rápida de capa de texto (Borrador) y reconocimiento por página para escaneos (Alto), y ocrWhenNeeded carreras OCR automáticamente cuando una página no tiene capa de texto. La respuesta es el texto sin procesar. .xlsx binario (200) o un Location encuesta URL (202).
Autenticando su API Pedido
Cada PDF4me REST La llamada debe incluir su API clave en el Authorization Encabezado como autenticación básica. Obtenga o cambie su clave desde el panel de desarrollador.
Punto final
/api/v2/ConvertirPDFaExcelDatos importantes que no debes perderte
outputFormat y ocrWhenNeeded son booleanosverdadero / FALSO JSON booleanos para ambos campos. Las versiones anteriores de esta página mostraban valores de cadena como "Sí"; utilice valores booleanos como en los ejemplos a continuación.asíncrono: verdadero el API puede responder 202 con un Location encabezado. GET eso URL (mismo Authorization) hasta que devuelva 200 con el binario del libro de trabajo. Las muestras oficiales realizan sondeos cada 10 segundos, hasta 10 reintentos.HTTP configuración
Método: POST
URL: https://api.pdf4me.com/api/v2/ConvertPdfToExcel
Tipo de contenido: aplicación/json
Authorization: Básico <tu PDF4me API clave>
Enviar asíncrono: verdadero en el cuerpo. 200 devuelve el convertido .xlsx Libro de trabajo como bytes binarios. 202 devuelve un Location encabezado con una encuesta URL; GET eso URL con el mismo Authorization encabezado hasta que devuelva 200 con el binario del libro de trabajo.
¿Qué modo de calidad debo elegir: Draft o Alto?
Draft lee la capa de texto que ya existe dentro de un documento creado digitalmente. PDF. Alta renderización y reconoce cada página, lo que es más lento y cuesta más, pero es el único modo que funciona con escaneos, fotos de documentos y solo imágenes. pages.
| Draft vs High | Borrador | Alto |
|---|---|---|
| Lo mejor para | Creado digitalmente PDFs con texto seleccionable | Escaneado o basado en imágenes PDFs |
| Costo | 1 API llamada por archivo | 2 API llamadas por página |
| OCR | No se aplica | Aplicado por página (par con ocrWhenNeeded: true) |
| Velocidad | Rápido, pase único | Reconocimiento más lento, página por página |
| Cuando las mesas vuelven vacías | Reintentar con alto | Controlar language si el texto está ilegible |
API campos corporales
| Parámetro | Requerido | Tipo | Lo que hace | Ejemplo |
|---|---|---|---|---|
docContent | Required | string | Base64-encoded bytes of the source PDF. Strip any data:application/pdf;base64, prefix before posting. | JVBERi0xLjcK... |
docName | Required | string | Source filename including the .pdf extension. Used to derive the output filename. | invoice-report.pdf |
qualityType | Required | string | Draft for text-based PDFs (1 API call per file). High for scanned or image-based PDFs (2 API calls per page). | Draft |
language | Conditional | string | Language of the text in the source file. Set only when the converted output is not recognizable; otherwise let the engine detect it. | English |
mergeAllSheets | Optional | boolean | true combines all extracted content into a single worksheet. false keeps content on separate worksheets. | true |
outputFormat | Optional | boolean | Output format flag sent as a JSON boolean in the official samples. | true |
ocrWhenNeeded | Optional | boolean | Runs OCR automatically on pages without a text layer. Keep true unless you explicitly want recognition skipped. | true |
async | Optional | boolean | true enables the 202 + Location polling pattern, recommended for large or scanned files. | true |
Cargas útiles de ejemplo
Modo borrador. digital PDF con texto seleccionable
{
"docContent": "JVBERi0xLjcKJcfsj6IKNSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZw...",
"docName": "invoice-report.pdf",
"qualityType": "Draft",
"mergeAllSheets": true,
"outputFormat": true,
"ocrWhenNeeded": true,
"async": true
}
Modo alto. escaneado PDF con OCR
{
"docContent": "JVBERi0xLjcKJcfsj6IKNSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZw...",
"docName": "scanned-statement.pdf",
"qualityType": "High",
"mergeAllSheets": false,
"language": "English",
"outputFormat": true,
"ocrWhenNeeded": true,
"async": true
}
Consejos para el cobro de carteros
Ejemplo de curl
curl -X POST https://api.pdf4me.com/api/v2/ConvertPdfToExcel \
-H "Content-Type: application/json" \
-H "Authorization: Basic YOUR_API_KEY" \
-d '{
"docContent": "'"$(base64 -w 0 invoice-report.pdf)"'",
"docName": "invoice-report.pdf",
"qualityType": "Draft",
"mergeAllSheets": true,
"outputFormat": true,
"ocrWhenNeeded": true,
"async": true
}' \
--output converted.xlsx
¿Qué significa el API ¿devolver?
Una conversión exitosa devuelve el Excel El libro de trabajo en sí, no un JSON envoltorio. La salida es un moderno Oficina abierta XML libro de trabajo (.xlsx), el valor predeterminado XMLformato basado en compatible con todas las versiones actuales de Excel. Analice los tres casos que se describen a continuación.
| Campo | Tipo | Lo que contiene |
|---|---|---|
| Response body (HTTP 200) | Binary | The converted .xlsx workbook bytes. Write them straight to a file with an .xlsx extension. |
| Location header (HTTP 202) | String (URL) | Poll URL for an async job that is still running. GET it with the same Authorization header. |
| Poll response (HTTP 200) | Binary | The finished workbook, returned once processing completes. The official samples poll every 10 seconds, up to 10 retries. |
| Poll response (HTTP 202) | Empty | Job still processing. Wait and poll the same Location URL again. |
Ejemplos de código
Implementaciones funcionales de extremo a extremo, cada una con un ejemplo. PDF y la carga útil exacta de esta página: