Rohstoffgewinnung
Extrakt → Rohstoffgewinnung
Der Rohstoffgewinnung API extrahiert Text und/oder eingebettete Bilder aus einem PDFSie senden die PDF als Base64 (docContent), docName, extractText (wahr/falsch), extractImages (wahr/falsch) und optional async. Der API Rückgaben JSON mit extrahiertem Text und Bildern (Base64Probieren Sie es mit dem unten stehenden Tester aus; weitere Details finden Sie in den folgenden Abschnitten.
Probieren Sie die Extraktionsressourcen aus. API
:::Hinweis Kurzübersicht
Kurzübersicht
Endpunkt: POST /api/v2/ExtractResources · Erforderlich: api-key, docContent, docName, extractText, extractImages
:::
Nutzen Sie das untenstehende Formular, um Ihre Anfrage zu senden API Schlüssel, PDF (Base64), und wählen Sie aus, ob Text, Bilder oder beides extrahiert werden sollen. Die Antwort lautet: JSON mit Text und/oder Bildern in Base64Kein Code erforderlich: Felder ausfüllen und klicken Anfrage senden.
Überblick, Parameter und Anwendungsfälle
- Overview
- Parameters
- Use cases
Was ist Rohstoffgewinnung?
Dieser Endpunkt extrahiert Textinhalte und/oder eingebettete Bilder aus einem PDFSie wählen aus, was extrahiert werden soll über extractText Und extractImages (beides boolesche Werte). API Rückgaben JSON mit extrahiertem Text und Bildern (Bilder in Base64Verwenden Sie es, wenn Sie in einem Anruf sowohl Text als auch Bilder benötigen oder nur eines von beiden.
Hauptmerkmale
- Text und/oder Bilder: extractText Und extractImages Sie können entweder nur Text, nur Bilder oder beides anfordern.
- JSON Antwort: Text und eingebettete Bilder (Base64) in einem strukturierten Format.
- Asynchron: Verwenden async für PDFs mit vielen Seiten oder vielen Bildern.
:::Tipp Am besten geeignet für Verwenden Sie diese Option, wenn Sie sowohl Text als auch Bilder aus einem PDF in einer Anfrage. Für reinen Text mit regulären Ausdrücken verwenden Sie Text nach Ausdruck extrahieren; für Tabellen verwenden Tabelle extrahieren PDF.
:::
API Parameter
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| api-key | Zeichenkette | Ja | Dein PDF4me API Schlüssel, Base64 kodiert. Holen Sie es sich von der ArmaturenbrettDie |
| docContent | base64 | Ja | PDF Dateiinhalt (Base64). |
| docName | Zeichenkette | Ja | PDF Dateiname mit der Erweiterung .pdf. |
| extractText | boolescher Wert | Ja | Extrahieren Sie Textinhalte aus dem PDFDie |
| extractImages | boolescher Wert | Ja | Extrahieren Sie eingebettete Bilder aus dem PDFDie |
| async | boolescher Wert | NEIN | Asynchrone Verarbeitung aktivieren. |
Wann sollte man Ressourcen extrahieren?
- Inhaltsextraktion: Sowohl Text als auch Bilder aus einem PDF in einem Aufruf zur Analyse oder Wiederverwendung.
- Bildgewinnung: Eingebettete Bilder (Logos, Diagramme) zur Wiederverwendung oder Indexierung extrahieren.
- Text + Assets: Texte und Bilder für die Suche, Archivierung oder Migration zusammenführen.
Für Anfrage-/Antwortschemata und Codebeispiele siehe Rohstoffgewinnung im PDF4me API Dokumente.
Voraussetzungen
Bevor Sie diesen Endpunkt verwenden, stellen Sie sicher, dass Sie Folgendes haben:
- Ein gültiger PDF4me API Schlüssel (Hol dir deins API Schlüssel)
- A PDF Dokument in Base64 Format oder ein öffentliches URL zu einem PDF Datei
Antwortformat
Der API gibt ein zurück JSON Antwort mit extrahiertem Textinhalt und eingebetteten Bildern in Base64 Format.