Text aus PDF extrahieren
Als Teil von IronPDFs umfangreicher Sammlung von Funktionen zur Erstellung und Bearbeitung von PDFs erleichtert IronPDF auch die granulare Verarbeitung des Inhalts eines PDF-Dokuments durch seine Inhaltsextraktionsmethoden.
Verfügbar auf allen PdfDocument Objekten ist die extractAllText Methode. Das String, das von extractAllText zurückgegeben wird, enthält den gesamten Text, der sich auf jeder Seite des PDF befindet.
Diese Methode ist eine bequeme Möglichkeit, Dokumentenebenen-Text-Extraktion aus PDFs mit vielen Seiten durchzuführen. Um Text auf Seitenebene zu extrahieren (d. h. nur von einem bestimmten Satz von Seiten), verwenden Sie stattdessen die extractTextFromPage Methode.
Das kurze Code-Beispiel unten zieht den Text von der ersten Seite eines PDF-Dokuments.
Wie extrahiere ich Text aus PDF in Java?
- Installieren Sie IronPDF for Java Library für PDF Textextraktion
- Ziel-PDF-Dokument importieren oder von URL in Java rendern
- Nutzen Sie die
extractAllText-Methode, um Text aus PDF-Dateien zu extrahieren - Verwenden Sie die Methode
extractTextFromPage, um die Extraktion auf einer bestimmten Seite durchzuführen - Extrahieren von Text ohne Beeinträchtigung der Original-PDF-Datei


