Converter PDF para Excel
PDF4me Converter PDF para Excel é um REST ponto final que extrai tabelas e texto de um PDF e retorna um editável Excel caderno de exercícios. POST a Base64 PDF para /api/v2/ConvertPdfToExcel, selecione Rascunho ou Alta qualidade, habilite OCR para digitalizado pagese salve o valor retornado. .xlsx bytes. Uma única chamada, sem necessidade de redigitação manual.
Envia um PDF entra, recebe um Excel planilha gerada. O mecanismo detecta as estruturas de tabela em cada página e as reconstrói como células de planilha, extraindo o texto ao redor. qualityType alterna entre extração rápida da camada de texto (Rascunho) e reconhecimento por página para digitalizações (Alto), e ocrWhenNeeded corridas OCR automaticamente quando uma página não possui camada de texto. A resposta é o texto bruto. .xlsx binário (200) ou um Location enquete URL (202).
Autenticando seu API Solicitar
Todo PDF4me REST A chamada deve incluir o seu API chave no Authorization Defina o cabeçalho como autenticação básica. Obtenha ou altere sua chave no painel do desenvolvedor.
Ponto final
/api/v2/ConverterPdfParaExcelhttps://api.pdf4me.com/api/v2/ConvertPdfToExcelFatos importantes que você não deve perder
outputFormat e ocrWhenNeeded são booleanosverdadeiro / falso JSON Valores booleanos para ambos os campos. Versões antigas desta página exibiam valores de string como "sim"; utilize valores booleanos como nos exemplos abaixo.assíncrono: verdadeiro o API pode responder 202 com um Location cabeçalho. GET que URL (mesmo Authorization) até que retorne 200 com o binário da planilha. Os exemplos oficiais verificam a cada 10 segundos, até um máximo de 10 tentativas.HTTP configurar
Método: POST
URL: https://api.pdf4me.com/api/v2/ConvertPdfToExcel
Tipo de conteúdo: aplicativo/json
Authorization: Básico <seu PDF4me API chave>
Enviar assíncrono: verdadeiro no corpo. 200 retorna o convertido .xlsx planilha em bytes binários. 202 retorna um Location cabeçalho com uma enquete URL; GET que URL com o mesmo Authorization O cabeçalho deve retornar 200 com o binário da planilha.
Qual modo de qualidade devo escolher: Rascunho ou Alta?
O rascunho lê a camada de texto que já existe dentro de um arquivo criado digitalmente. PDFA opção "Alta qualidade" renderiza e reconhece cada página novamente, o que é mais lento e custoso, mas é o único modo que funciona com digitalizações, fotos de documentos e imagens sem formatação. pages.
| Draft vs High | Rascunho | Alto |
|---|---|---|
| Ideal para | Criado digitalmente PDFs com texto selecionável | Digitalizado ou baseado em imagem PDFs |
| Custo | 1 API chamada por arquivo | 2 API chamadas por página |
| OCR | Não aplicado | Aplicado por página (combine com ocrWhenNeeded: true) |
| Velocidade | Rápido, passagem única | Reconhecimento mais lento, página por página. |
| Quando as mesas voltam a ficar vazias | Tente novamente com alta qualidade | Verificar language se o texto estiver ilegível |
API campos corporais
| Parâmetro | Obrigatório | Tipo | O que faz | Exemplo |
|---|---|---|---|---|
docContent | Required | string | Base64-encoded bytes of the source PDF. Strip any data:application/pdf;base64, prefix before posting. | JVBERi0xLjcK... |
docName | Required | string | Source filename including the .pdf extension. Used to derive the output filename. | invoice-report.pdf |
qualityType | Required | string | Draft for text-based PDFs (1 API call per file). High for scanned or image-based PDFs (2 API calls per page). | Draft |
language | Conditional | string | Language of the text in the source file. Set only when the converted output is not recognizable; otherwise let the engine detect it. | English |
mergeAllSheets | Optional | boolean | true combines all extracted content into a single worksheet. false keeps content on separate worksheets. | true |
outputFormat | Optional | boolean | Output format flag sent as a JSON boolean in the official samples. | true |
ocrWhenNeeded | Optional | boolean | Runs OCR automatically on pages without a text layer. Keep true unless you explicitly want recognition skipped. | true |
async | Optional | boolean | true enables the 202 + Location polling pattern, recommended for large or scanned files. | true |
Exemplos de cargas úteis
Modo rascunho. Digital PDF com texto selecionável
{
"docContent": "JVBERi0xLjcKJcfsj6IKNSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZw...",
"docName": "invoice-report.pdf",
"qualityType": "Draft",
"mergeAllSheets": true,
"outputFormat": true,
"ocrWhenNeeded": true,
"async": true
}
Modo alto. Escaneado PDF com OCR
{
"docContent": "JVBERi0xLjcKJcfsj6IKNSAwIG9iago8PAovVHlwZSAvQ2F0YWxvZw...",
"docName": "scanned-statement.pdf",
"qualityType": "High",
"mergeAllSheets": false,
"language": "English",
"outputFormat": true,
"ocrWhenNeeded": true,
"async": true
}
Dicas de coleta do carteiro
exemplo de curl
curl -X POST https://api.pdf4me.com/api/v2/ConvertPdfToExcel \
-H "Content-Type: application/json" \
-H "Authorization: Basic YOUR_API_KEY" \
-d '{
"docContent": "'"$(base64 -w 0 invoice-report.pdf)"'",
"docName": "invoice-report.pdf",
"qualityType": "Draft",
"mergeAllSheets": true,
"outputFormat": true,
"ocrWhenNeeded": true,
"async": true
}' \
--output converted.xlsx
O que significa o API retornar?
Uma conversão bem-sucedida retorna o Excel livro de exercícios em si, não um JSON wrapper. A saída é um wrapper moderno. Escritório aberto XML livro de exercícios (.xlsx), o padrão XMLformato baseado em suportado por todas as versões atuais de ExcelAnalise os três casos abaixo.
| Campo | Tipo | O que contém |
|---|---|---|
| Response body (HTTP 200) | Binary | The converted .xlsx workbook bytes. Write them straight to a file with an .xlsx extension. |
| Location header (HTTP 202) | String (URL) | Poll URL for an async job that is still running. GET it with the same Authorization header. |
| Poll response (HTTP 200) | Binary | The finished workbook, returned once processing completes. The official samples poll every 10 seconds, up to 10 retries. |
| Poll response (HTTP 202) | Empty | Job still processing. Wait and poll the same Location URL again. |
Exemplos de código
Implementações funcionais de ponta a ponta, cada uma com um exemplo. PDF e a carga útil exata desta página: