
Wie man mit Python PDF zu Text konvertiert (Tutorial)
Dieser Artikel zeigt, wie Sie IronPDF for Python, eine der leistungsstärksten PDF-Bibliotheken, verwenden, um beliebigen Text aus einem PDF-Dokument zu extrahieren.
Konvertieren von PDF in Text in Python
- Installation einer Python-Bibliothek zur Konvertierung von PDF in Text
- Laden Sie ein vorhandenes PDF-Dokument oder rendern Sie ein Neues
- Verwenden Sie die Methode
ExtractAllText, um Text aus der geöffneten Datei zu lesen - Verwenden Sie eine andere Überladung der Methode, um Text von bestimmten Seiten zu lesen.
- Drucken Sie den extrahierten Text in die Konsole oder speichern Sie ihn in einer Textdatei
2.0 Wie man Text aus einem PDF mit Python extrahiert?
- Installieren Sie die neueste Version von Python von der Python-Download-Seite
- Öffnen Sie beliebige IDE-Tools for Python
- .NET Core-Laufzeit installieren
- Installieren Sie die IronPDF for Python Bibliothek oder laden Sie sie von der PyPI-Download-Seite herunter
- Extrahieren Sie Text aus dem PDF
2.1 Was ist IronPDF for Python?
Es ist einfach, die IronPDF-Bibliothek in Python zu integrieren, da es sich um eine dynamischere Sprache handelt als andere und Entwicklern ermöglicht, grafische Benutzeroberflächen schnell und einfach zu erstellen. Es verfügt über eine Vielzahl vorinstallierter Tools, darunter PyQT, wxWidgets, kivy und zahlreiche zusätzliche Pakete und Bibliotheken, die alle verwendet werden können, um schnell und sicher eine vollständig ausgefüllte GUI zu erstellen.
IronPDF for Python ist eine äußerst effiziente Bibliothek, die besonders für die Webentwicklung nützlich ist. Die Verfügbarkeit so vieler Python-Webentwicklung-Pradigmen, wie Django, Flask und Pyramid, ist teilweise dafür verantwortlich. Diese Frameworks wurden von zahlreichen Websites und Online-Diensten verwendet, einschließlich Reddit, Mozilla und Spotify.
2.2 Funktionen von IronPDF
- Eine PDF-Datei kann aus verschiedenen Quellen erstellt werden, einschließlich HTML, HTML5, ASP und PHP-Websites. Neben HTML-Dateien ist es auch möglich, Bilddateien in PDF zu konvertieren.
- IronPDF ermöglicht es Ihnen, interaktive PDF-Dokumente zu erstellen, interaktive Formulare auszufüllen und zu senden, PDF-Dateien zu teilen und kombinieren, Text und Bilder aus PDF-Dateien extrahieren, nach bestimmten Wörtern innerhalb einer PDF-Datei suchen, PDF-Seiten in Bilder rasterisieren, PDF in HTML konvertieren und PDF-Dateien drucken.
- IronPDF kann PDF-Dateien öffnen und von einer URL drucken. Darüber hinaus ermöglicht es Benutzeragenten, sich hinter HTML-Login-Formularen, Proxys, Cookies, HTTP-Headern, benutzerdefinierten Netzwerk-Anmeldedaten, Formularvariablen und Benutzeragenten anzumelden.
- Bilder können aus Dokumenten mit IronPDF extrahiert werden.
- Mit IronPDF ist es sehr einfach, Kopf- und Fußzeilen, Text und Bilder, Lesezeichen und Wasserzeichen hinzuzufügen und mehr zu Dokumenten.
- Es ist möglich, Seiten mit einem neuen oder bestehenden Dokument mit IronPDF zu kombinieren und zu trennen.
- Ohne einen Acrobat-Viewer zu verwenden, können Dokumente in PDF-Objekte umgewandelt werden.
- Eine CSS-Datei kann ein PDF-Dokument erstellen.
- Die Erstellung von Dokumenten ist mit medienbezogenen CSS-Dateien möglich.
2.3 IronPDF-Bibliothek importieren
Schließen Sie die folgenden Import-Anweisungen am Anfang der Quelldateien ein, in denen IronPDF verwendet werden soll, um IronPDF zu importieren:
from ironpdf import *
2.4 Lizenzschlüssel einrichten (falls erforderlich)
Obwohl IronPDF for Python kostenlos nutzbar ist, versieht es PDF-Dateien für kostenlose Nutzer mit einem gekachelten Hintergrund. Sie müssen der Bibliothek einen gültigen Lizenzschlüssel geben, um IronPDF zur Erstellung von PDFs ohne Wasserzeichen nutzen zu können. Wie die Bibliothek mit einem Lizenzschlüssel eingerichtet wird, wird im folgenden Codeschnipsel gezeigt:
# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
Bevor Sie PDF-Dateien erstellen oder Inhalte ändern, stellen Sie sicher, dass der Lizenzschlüssel konfiguriert ist. Die Methode LicenseKey sollte vor allen anderen Codezeilen aufgerufen werden. Um einen kostenlosen Testlizenzschlüssel zu erhalten, besuchen Sie die Lizenzseite.
2.5 Protokolldateien einrichten
Eine Textdatei mit dem Namen "Default" kann Protokollnachrichten speichern, die von Custom.log innerhalb des Verzeichnisses des Python-Skripts erzeugt werden. Das untenstehende Code-Snippet kann verwendet werden, um die Eigenschaft LogFilePath festzulegen und den Namen und den Speicherort der Log-Datei zu anpassen:
# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
3.0 PDF-Text mit IronPDF extrahieren
Die IronPDF for Python Bibliothek kann PDF-Seiten in PDF-Objekte umwandeln und ermöglicht die Textextraktion aus PDF-Dateien, einschließlich gescannter PDF-Dateien. Hier ist ein Beispiel, das zeigt, wie man ein vorhandenes PDF mit IronPDF liest.
Die erste Methode beinhaltet das Extrahieren aller im PDF verfügbaren Texte; ein Beispielcode wird unten bereitgestellt.
from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()
# Display the extracted text
print(all_text)
Wie im obigen Code dargestellt, ist die Methode FromFile ein PDF-Lesegerät-Objekt, das die bestehende PDF-Datei lädt und in PDF-Dokument-Objekte umwandelt. Dieses Objekt kann verwendet werden, um den Text und die Bilder zu lesen, die auf den PDF-Seiten verfügbar sind. Das Objekt stellt eine Methode namens ExtractAllText bereit, die jeden Text aus der gesamten PDF-Datei extrahiert und den Text in einem String hält, der verarbeitet werden kann. Und dann verwenden Sie die Funktion print, um den Text anzuzeigen.
Text anzeigen
Das Code-Beispiel für die zweite Methode, die seitenweise verwendet werden kann, um Text aus einer PDF-Datei zu extrahieren. Es wird unten bereitgestellt.
from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)
# Display the extracted text from the specified page
print(page_text)
Die Methode FromFile wird verwendet, um die PDF-Datei aus einer bestehenden Datei zu laden und in ein PDF-Datei-Objekt umzuwandeln, wie im obenstehenden Code gezeigt. Eine Methode auf dem PDF-Seitenobjekt namens ExtractTextFromPage zieht den gesamten Text von einer Seite in einer PDF-Datei. Die Seitenzahl muss als Parameter angegeben werden, um Text von dieser speziellen Seite zu extrahieren. Dann, nach dem Extrahieren des Textes, kann page_text verwendet werden, um die Informationen zu halten, die verarbeitet werden können.
Weitere Beispiele zum Extrahieren von Text aus einem PDF finden Sie hier.
4.0 Fazit
Die IronPDF-Bibliothek bietet im Gegensatz dazu starke Sicherheitsmaßnahmen zur Verringerung potenzieller Risiken. Es ist nicht auf einen bestimmten Browser zugeschnitten und funktioniert mit allen gängigen. IronPDF ermöglicht es Programmierern, mit nur wenigen Zeilen Code PDF-Dateien einfach zu erstellen und zu lesen. Die IronPDF-Bibliothek bietet verschiedene Lizenzoptionen, einschließlich einer kostenlosen Entwicklerlizenz sowie kostenpflichtiger Lizenzen für unterschiedliche Entwicklungsbedürfnisse.
IronPDF umfasst eine unbefristete Lizenz, eine 30-tägige Geld-zurück-Garantie, ein Jahr Software-Support und Upgrade-Optionen. Es fallen keine zusätzlichen Kosten nach dem Erstkauf an. Diese Lizenzen können in Entwicklungs-, Staging- und Produktionsumgebungen eingesetzt werden. Erfahren Sie mehr über die Produktlizenzierung.
Laden Sie das Softwareprodukt herunter.

Curtis Chau hat einen Bachelor-Abschluss in Informatik von der Carleton University und ist spezialisiert auf Frontend-Entwicklung mit Expertise in Node.js, TypeScript, JavaScript und React. Leidenschaftlich widmet er sich der Erstellung intuitiver und ästhetisch ansprechender Benutzerschnittstellen und arbeitet gerne mit modernen Frameworks sowie der Erstellung gut strukturierter, optisch ansprechender Handbücher.
Verwandte Artikel


