IRONSOFTWAREHOME
VERWENDUNG VON IRONPDF FOR PYTHON

Wie man mit Python PDF zu Text konvertiert (Tutorial)

Curtis Chau
Curtis Chau
Updated: 21. April 2026

Dieser Artikel zeigt, wie Sie IronPDF for Python, eine der leistungsstärksten PDF-Bibliotheken, verwenden, um beliebigen Text aus einem PDF-Dokument zu extrahieren.

2.0 Wie man Text aus einem PDF mit Python extrahiert?

  1. Installieren Sie die neueste Version von Python von der Python-Download-Seite
  2. Öffnen Sie beliebige IDE-Tools for Python
  3. .NET Core-Laufzeit installieren
  4. Installieren Sie die IronPDF for Python Bibliothek oder laden Sie sie von der PyPI-Download-Seite herunter
  5. Extrahieren Sie Text aus dem PDF

2.1 Was ist IronPDF for Python?

Es ist einfach, die IronPDF-Bibliothek in Python zu integrieren, da es sich um eine dynamischere Sprache handelt als andere und Entwicklern ermöglicht, grafische Benutzeroberflächen schnell und einfach zu erstellen. Es verfügt über eine Vielzahl vorinstallierter Tools, darunter PyQT, wxWidgets, kivy und zahlreiche zusätzliche Pakete und Bibliotheken, die alle verwendet werden können, um schnell und sicher eine vollständig ausgefüllte GUI zu erstellen.

IronPDF for Python ist eine äußerst effiziente Bibliothek, die besonders für die Webentwicklung nützlich ist. Die Verfügbarkeit so vieler Python-Webentwicklung-Pradigmen, wie Django, Flask und Pyramid, ist teilweise dafür verantwortlich. Diese Frameworks wurden von zahlreichen Websites und Online-Diensten verwendet, einschließlich Reddit, Mozilla und Spotify.

2.2 Funktionen von IronPDF

  • Eine PDF-Datei kann aus verschiedenen Quellen erstellt werden, einschließlich HTML, HTML5, ASP und PHP-Websites. Neben HTML-Dateien ist es auch möglich, Bilddateien in PDF zu konvertieren.
  • IronPDF ermöglicht es Ihnen, interaktive PDF-Dokumente zu erstellen, interaktive Formulare auszufüllen und zu senden, PDF-Dateien zu teilen und kombinieren, Text und Bilder aus PDF-Dateien extrahieren, nach bestimmten Wörtern innerhalb einer PDF-Datei suchen, PDF-Seiten in Bilder rasterisieren, PDF in HTML konvertieren und PDF-Dateien drucken.
  • IronPDF kann PDF-Dateien öffnen und von einer URL drucken. Darüber hinaus ermöglicht es Benutzeragenten, sich hinter HTML-Login-Formularen, Proxys, Cookies, HTTP-Headern, benutzerdefinierten Netzwerk-Anmeldedaten, Formularvariablen und Benutzeragenten anzumelden.
  • Bilder können aus Dokumenten mit IronPDF extrahiert werden.
  • Mit IronPDF ist es sehr einfach, Kopf- und Fußzeilen, Text und Bilder, Lesezeichen und Wasserzeichen hinzuzufügen und mehr zu Dokumenten.
  • Es ist möglich, Seiten mit einem neuen oder bestehenden Dokument mit IronPDF zu kombinieren und zu trennen.
  • Ohne einen Acrobat-Viewer zu verwenden, können Dokumente in PDF-Objekte umgewandelt werden.
  • Eine CSS-Datei kann ein PDF-Dokument erstellen.
  • Die Erstellung von Dokumenten ist mit medienbezogenen CSS-Dateien möglich.

2.3 IronPDF-Bibliothek importieren

Schließen Sie die folgenden Import-Anweisungen am Anfang der Quelldateien ein, in denen IronPDF verwendet werden soll, um IronPDF zu importieren:

from ironpdf import *
Python

2.4 Lizenzschlüssel einrichten (falls erforderlich)

Obwohl IronPDF for Python kostenlos nutzbar ist, versieht es PDF-Dateien für kostenlose Nutzer mit einem gekachelten Hintergrund. Sie müssen der Bibliothek einen gültigen Lizenzschlüssel geben, um IronPDF zur Erstellung von PDFs ohne Wasserzeichen nutzen zu können. Wie die Bibliothek mit einem Lizenzschlüssel eingerichtet wird, wird im folgenden Codeschnipsel gezeigt:

# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
Python

Bevor Sie PDF-Dateien erstellen oder Inhalte ändern, stellen Sie sicher, dass der Lizenzschlüssel konfiguriert ist. Die Methode LicenseKey sollte vor allen anderen Codezeilen aufgerufen werden. Um einen kostenlosen Testlizenzschlüssel zu erhalten, besuchen Sie die Lizenzseite.

2.5 Protokolldateien einrichten

Eine Textdatei mit dem Namen "Default" kann Protokollnachrichten speichern, die von Custom.log innerhalb des Verzeichnisses des Python-Skripts erzeugt werden. Das untenstehende Code-Snippet kann verwendet werden, um die Eigenschaft LogFilePath festzulegen und den Namen und den Speicherort der Log-Datei zu anpassen:

# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
Python

3.0 PDF-Text mit IronPDF extrahieren

Die IronPDF for Python Bibliothek kann PDF-Seiten in PDF-Objekte umwandeln und ermöglicht die Textextraktion aus PDF-Dateien, einschließlich gescannter PDF-Dateien. Hier ist ein Beispiel, das zeigt, wie man ein vorhandenes PDF mit IronPDF liest.

Die erste Methode beinhaltet das Extrahieren aller im PDF verfügbaren Texte; ein Beispielcode wird unten bereitgestellt.

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()

# Display the extracted text
print(all_text)
Python

Wie im obigen Code dargestellt, ist die Methode FromFile ein PDF-Lesegerät-Objekt, das die bestehende PDF-Datei lädt und in PDF-Dokument-Objekte umwandelt. Dieses Objekt kann verwendet werden, um den Text und die Bilder zu lesen, die auf den PDF-Seiten verfügbar sind. Das Objekt stellt eine Methode namens ExtractAllText bereit, die jeden Text aus der gesamten PDF-Datei extrahiert und den Text in einem String hält, der verarbeitet werden kann. Und dann verwenden Sie die Funktion print, um den Text anzuzeigen.

Wie man PDF in Text in Python konvertiert (Tutorial), Abbildung 1: Anzeige des Textes Text anzeigen

Das Code-Beispiel für die zweite Methode, die seitenweise verwendet werden kann, um Text aus einer PDF-Datei zu extrahieren. Es wird unten bereitgestellt.

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)

# Display the extracted text from the specified page
print(page_text)
Python

Die Methode FromFile wird verwendet, um die PDF-Datei aus einer bestehenden Datei zu laden und in ein PDF-Datei-Objekt umzuwandeln, wie im obenstehenden Code gezeigt. Eine Methode auf dem PDF-Seitenobjekt namens ExtractTextFromPage zieht den gesamten Text von einer Seite in einer PDF-Datei. Die Seitenzahl muss als Parameter angegeben werden, um Text von dieser speziellen Seite zu extrahieren. Dann, nach dem Extrahieren des Textes, kann page_text verwendet werden, um die Informationen zu halten, die verarbeitet werden können.

Weitere Beispiele zum Extrahieren von Text aus einem PDF finden Sie hier.

4.0 Fazit

Die IronPDF-Bibliothek bietet im Gegensatz dazu starke Sicherheitsmaßnahmen zur Verringerung potenzieller Risiken. Es ist nicht auf einen bestimmten Browser zugeschnitten und funktioniert mit allen gängigen. IronPDF ermöglicht es Programmierern, mit nur wenigen Zeilen Code PDF-Dateien einfach zu erstellen und zu lesen. Die IronPDF-Bibliothek bietet verschiedene Lizenzoptionen, einschließlich einer kostenlosen Entwicklerlizenz sowie kostenpflichtiger Lizenzen für unterschiedliche Entwicklungsbedürfnisse.

IronPDF umfasst eine unbefristete Lizenz, eine 30-tägige Geld-zurück-Garantie, ein Jahr Software-Support und Upgrade-Optionen. Es fallen keine zusätzlichen Kosten nach dem Erstkauf an. Diese Lizenzen können in Entwicklungs-, Staging- und Produktionsumgebungen eingesetzt werden. Erfahren Sie mehr über die Produktlizenzierung.

Laden Sie das Softwareprodukt herunter.

Curtis Chau
Technischer Autor

Curtis Chau hat einen Bachelor-Abschluss in Informatik von der Carleton University und ist spezialisiert auf Frontend-Entwicklung mit Expertise in Node.js, TypeScript, JavaScript und React. Leidenschaftlich widmet er sich der Erstellung intuitiver und ästhetisch ansprechender Benutzerschnittstellen und arbeitet gerne mit modernen Frameworks sowie der Erstellung gut strukturierter, optisch ansprechender Handbücher.

...
Weiterlesen

Verwandte Artikel

Key in blue circle

Holen Sie sich sofort Ihren kostenlosen 30-Tage-Testschlüssel.

Your trial license will be sent to your email address

Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.

OR
bullet_checkedIhr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
AWS-Logo
Booking Badge

Von Millionen von Ingenieur*innen weltweit vertraut

Azure (WebApps, Funktionen v3)
Erhalten Sie Ihre unverbindliche Beratung
Füllen Sie das Formular unten aus oder senden Sie eine E-Mail an sales@ironsoftware.com
Ihre Daten werden immer vertraulich behandelt.
Von Millionen von Ingenieur*innen weltweit vertraut
Azure (WebApps, Funktionen v3)
Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.
C# NuGet-Bibliothek für PDF
Installation mit NuGet

Version: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. Rechtsklick auf Referenzen, NuGet-Pakete verwalten
  2. Wählen Sie Durchsuchen und suchen Sie nach 'IronPDF'
  3. Paket auswählen und installieren
C# PDF DLL
Download DLL

Version: 2026.9

oder laden Sie den Windows-Installer hier herunter.

  1. Laden Sie IronPDF herunter und entpacken Sie es in ein Verzeichnis wie ~/Libs innerhalb Ihres Lösungsverzeichnisses
  2. Im Visual Studio-Projektmappen-Explorer klicken Sie mit der rechten Maustaste auf Referenzen. Wählen Sie Durchsuchen, "IronPDF.dll"

Lizenzen ab 749 $