Text extrahieren

IronPDF for Python kann den Textinhalt eines PDF-Dokuments — entweder aus dem gesamten Dokument auf einmal oder aus einzelnen Seiten — mit den Methoden ExtractAllText und ExtractTextFromPage extrahieren.

Einstieg

Laden Sie ein PdfDocument aus einer Datei mit PdfDocument.FromFile, dann rufen Sie die entsprechende Extraktionsmethode auf. Beide Methoden geben einen Python-String zurück, der den extrahierten Text enthält.

Den Code verstehen

  • PdfDocument.FromFile(path): Öffnet ein vorhandenes PDF-Dokument vom angegebenen Dateipfad. Für passwortgeschützte Dateien geben Sie das Passwort als zweites Argument an.
  • ExtractAllText(): Gibt eine einzelne Zeichenkette zurück, die den Text enthält, der aus allen Seiten des Dokuments extrahiert wurde, in Seitenreihenfolge.
  • ExtractTextFromPage(pageIndex): Gibt den Textinhalt einer einzelnen Seite zurück. Das pageIndex-Argument ist nullbasiert — übergeben Sie 0 für die erste Seite, 1 für die zweite usw.

Anwendungsfälle

Textextraktion ist nützlich für:

  • Suchindizierung — macht PDF-Inhalte in einer Datenbank oder Suchmaschine durchsuchbar.
  • Datenanalyse — extrahiert strukturierte Daten wie Rechnungsnummern, Daten oder Adressen aus PDF-Berichten.
  • Inhaltsverifizierung — prüft programmatisch, ob generierte PDFs den erwarteten Text enthalten.
  • Barrierefreiheit — konvertiert PDF-Inhalt in Klartext für Bildschirmlesegeräte oder nachgelagerte Verarbeitung.

Lernen Sie, wie man Inhalte mit IronPDF for Python aus PDFs extrahiert!

Bereit anzufangen?
Version: 2026.6 gerade veröffentlicht
Still Scrolling Icon

Scrollst du immer noch?

Sie brauchen schnell einen Beweis?
Führen Sie eine Probe aus Sehen Sie zu, wie Ihr HTML-Code in eine PDF-Datei umgewandelt wird.