Text nach Ausdruck extrahieren
Extrakt → Text nach Ausdruck extrahieren
Der Text nach Ausdruck extrahieren API extrahiert Text aus einem PDF das einem regulären Ausdruck entspricht. Sie senden das PDF als Base64 (docContent), docName, expression (Regex-Muster), pageSequence (z. B. 1-, 1-3, 1,2,3) und optional async. Der API Rückgaben JSON mit allen Übereinstimmungen. Verwenden Sie den Tester unten, um es auszuprobieren; weitere Details und Ausdrucksbeispiele finden Sie in den folgenden Abschnitten.
Probieren Sie die Funktion „Text nach Ausdruck extrahieren“ aus. API
:::Hinweis Kurzübersicht
Kurzübersicht
Endpunkt: POST /api/v2/ExtractTextByExpression · Erforderlich: api-key, docContent, docName, expression, pageSequence
:::
Nutzen Sie das untenstehende Formular, um Ihre Anfrage zu senden API Schlüssel, PDF (Base64), und ein reguläres Ausdrucksmuster (z.B. %, \d+(E-Mail-Muster). Die Antwort lautet JSON Alle Textübereinstimmungen werden angezeigt. Kein Code erforderlich, Felder ausfüllen und klicken. Anfrage senden.
Überblick, Parameter und Anwendungsfälle
- Overview
- Parameters
- Use cases
Was ist „Text durch Ausdruck extrahieren“?
Dieser Endpunkt extrahiert Text aus einem PDF das einem regulären Ausdruck entspricht. Sie geben den PDF (Base64), expression (Regex-Muster), pageSequence (z. B. 1- für alle Seiten, 1-3 für einen Bereich, 1,2,3 für bestimmte Seiten) und optional async. Der API Rückgaben JSON mit allen Textübereinstimmungen. Verwenden Sie es, um E-Mails, Nummern, Datumsangaben usw. zu extrahieren. URLsoder irgendein Muster von PDFsDie
Hauptmerkmale
- Regex-Muster: expressionz.B.
%,\d+E-Mail-Muster, Datumsmuster, Währung. - Seitenausrichtung: pageSequence:
1-(alle),1-3(Reichweite),1,2,3(spezifische Seiten). - JSON AntwortAlle Treffer für das angegebene Muster.
- Asynchron: Verwenden async für große PDFs oder viele Spiele.
:::Tipp Ideal für Verwenden Sie diese Option, wenn Sie bestimmte Daten (E-Mails, Zahlen, Daten, Beträge) benötigen von PDFsFür den vollständigen Text oder Bilder verwenden Sie bitte Rohstoffgewinnung; für Tabellen verwenden Tabelle aus PDF extrahieren.
:::
API Parameter
| Parameter | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
| api-key | Zeichenkette | Ja | Dein PDF4me API Schlüssel, Base64 kodiert. Holen Sie es sich von der ArmaturenbrettDie |
| docContent | base64 | Ja | PDF Dateiinhalt (Base64). |
| docName | Zeichenkette | Ja | PDF Dateiname mit der Erweiterung .pdf. |
| expression | Zeichenkette | Ja | Reguläres Ausdrucksmuster (z. B. %, \d+, E-Mail-Muster). |
| pageSequence | Zeichenkette | Ja | Seitenbereich: 1- (alle), 1,2,3, 1-5 usw. |
| async | boolescher Wert | NEIN | Asynchrone Verarbeitung aktivieren. |
Wann sollte man „Text nach Ausdruck extrahieren“ verwenden?
- E-Mails und URLs: E-Mails, Telefonnummern oder Links extrahieren von PDFsDie
- Zahlen und Beträge: Prozentsätze, Währungsbeträge oder IDs extrahieren.
- Termine: Datumsangaben in verschiedenen Formaten extrahieren (MM/TT/JJJJ, ISO usw.).
- Strukturierte Daten: Spezifische Muster (z. B. Rechnungsnummern, Sozialversicherungsnummern) für Arbeitsabläufe extrahieren.
Für Anfrage-/Antwortschemata und Codebeispiele siehe Text nach Ausdruck extrahieren im PDF4me API Dokumente.
Voraussetzungen
Bevor Sie diesen Endpunkt verwenden, stellen Sie sicher, dass Sie Folgendes haben:
- Ein gültiger PDF4me API Schlüssel (Hol dir deins API Schlüssel)
- A PDF Dokument in Base64 Format oder ein öffentliches URL zu einem PDF Datei
- Ein regulärer Ausdruck, nach dem gesucht werden soll
Ausdrucksbeispiele
- Basic Patterns
- Currency & Percentages
- Contact Information
- Dates
- Text Patterns
- Advanced
- Quick Test Examples
Gängige grundlegende Muster für reguläre Ausdrücke:
%- Prozentuales Übereinstimmungssymbol (z. B. 50 %, 100 %)\d+- Eine oder mehrere Ziffern übereinstimmen (z. B. 123, 4567)\d+\.\d+- Dezimalzahlen anpassen (z. B. 3,14, 99,99)[A-Za-z]+- Ordnen Sie einen oder mehrere Buchstaben einander zu\d{4}- Genau 4 Ziffern übereinstimmen (z. B. Jahreszahlen wie 2024)
Muster zur Extraktion von Finanzdaten:
\d+%- Prozentangaben den entsprechenden Zahlen zuordnen (z. B. 50 %, 100 %)\$[\d,]+\.?\d*- Beträge in US-Dollar angeben (z. B. 100 $, 1.234,56 $)€[\d,]+\.?\d*- Euro-Beträge einzahlen (z. B. 50 €, 1.000,00 €)£[\d,]+\.?\d*- Beträge in britischen Pfund (z. B. 50 £, 1.000,00 £) einzahlen
Kontaktdaten aus Dokumenten extrahieren:
[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- E-Mail-Adressen abgleichen (z.B. [email protected])\+?[\d\s\-\(\)]{10,}- Telefonnummern abgleichen (verschiedene Formate)https?://[^\s]+- Übereinstimmen URLs (z.B., https://example.com)
Datumsangaben in verschiedenen Formaten extrahieren:
\d{1,2}/\d{1,2}/\d{2,4}- Passende Daten wie 25.12.2024 oder 05.01.2024\d{4}-\d{2}-\d{2}- ISO-Datumsangaben anpassen (z. B. 2024-12-25)[A-Z]{2,3}\s+\d{1,2}\s+\d{4}- Passende Daten wie "25. Dezember 2024"
Spezifische Textmuster extrahieren:
PDF|pdf- Ordnen Sie das Wort "PDF" (Muster ohne Berücksichtigung der Groß-/Kleinschreibung)Chapter\s+\d+- Passen Sie "Kapitel" gefolgt von einer Zahl an (z. B. Kapitel 1)[A-Z][a-z]+\s+[A-Z][a-z]+- Großgeschriebene Namen berücksichtigen (z. B. John Doe)
Komplexe Muster für spezifische Anwendungsfälle:
\b\d{3}-\d{2}-\d{4}\b- SSN-Format beachten (z. B. 123-45-6789)\b\d{4}\s\d{4}\s\d{4}\s\d{4}\b- Kreditkartennummern abgleichen (16 Ziffern mit Leerzeichen)[A-Z]{2}\d{2}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}\s?\d{4}- Übereinstimmen IBAN Format
Empfohlene Ausdrücke zum Testen mit Ihrem sample (2).pdf Datei:
%- Finde alle Prozentzeichen (fange mit den einfachsten an)\d+- Alle Zahlen im Dokument extrahieren[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}- E-Mail-Adressen extrahierenhttps?://[^\s]+- Weblinks extrahieren\d{1,2}/\d{1,2}/\d{2,4}- Datumsangaben extrahieren\$[\d,]+\.?\d*- Dollarbeträge extrahieren
Beispiele für Seitenfolgen:
1-- Alle Seiten von Seite 1 bis zum Ende1-3- Seiten 1, 2 und 31,2,3- Spezielle Seiten 1, 2 und 3all- Alle Seiten (sofern unterstützt)
Antwortformat
Der API gibt ein zurück JSON Antwort mit allen gefundenen Textübereinstimmungen für das angegebene reguläre Ausdrucksmuster.