IronPDF for Python kann den Textinhalt eines PDF-Dokuments - entweder aus dem gesamten Dokument auf einmal oder aus einzelnen Seiten - mit den Methoden ExtractAllText und ExtractTextFromPage extrahieren.
Einstieg
Laden Sie ein PdfDocument aus einer Datei mit PdfDocument.FromFile, dann rufen Sie die entsprechende Extraktionsmethode auf. Beide Methoden geben einen Python-String zurück, der den extrahierten Text enthält.
Den Code verstehen
PdfDocument.FromFile(path): Öffnet ein vorhandenes PDF-Dokument vom angegebenen Dateipfad. Für passwortgeschützte Dateien geben Sie das Passwort als zweites Argument an.ExtractAllText(): Gibt eine einzelne Zeichenkette zurück, die den Text enthält, der aus allen Seiten des Dokuments extrahiert wurde, in Seitenreihenfolge.ExtractTextFromPage(pageIndex): Gibt den Textinhalt einer einzelnen Seite zurück. DaspageIndex-Argument ist nullbasiert - übergeben Sie0für die erste Seite,1für die zweite usw.
Anwendungsfälle
Textextraktion ist nützlich für:
- Suchindizierung - macht PDF-Inhalte in einer Datenbank oder Suchmaschine durchsuchbar.
- Datenanalyse - extrahiert strukturierte Daten wie Rechnungsnummern, Daten oder Adressen aus PDF-Berichten.
- Inhaltsverifizierung - prüft programmatisch, ob generierte PDFs den erwarteten Text enthalten.
- Barrierefreiheit - konvertiert PDF-Inhalt in Klartext für Bildschirmlesegeräte oder nachgelagerte Verarbeitung.