IRONSOFTWAREHOME
VERWENDUNG VON IRONPDF FOR JAVA

Wie man Daten aus PDF in Java extrahiert

Curtis Chau
Curtis Chau
Updated: 21. April 2026

Dieses Tutorial zeigt Ihnen, wie Sie IronPDF for Java verwenden, um Daten aus einer PDF-Datei zu extrahieren. Die Einrichtung der Umgebung, das Importieren der Bibliothek, das Lesen der Eingabedatei und das Extrahieren der benötigten Daten werden alle mit Codebeispielen erläutert.

2. IronPDF for Java PDF-Bibliothek

IronPDF ist eine Softwarebibliothek, die Entwicklern die Möglichkeit bietet, Daten aus PDF-Dateien mit IronPDF for Java innerhalb ihrer Java-Anwendungen zu erstellen, zu bearbeiten und zu extrahieren. Es ermöglicht Ihnen, PDFs aus HTML-Dokumenten, Bildern und mehr zu erstellen, sowie mehrere PDFs zusammenzuführen, PDF-Dateien zu teilen und bestehende PDFs zu bearbeiten. IronPDF bietet auch die Möglichkeit, PDFs mit Passwortschutzfunktionen zu sichern und digitale Signaturen zu PDFs hinzuzufügen, unter anderen Funktionen.

IronPDF for Java wird von Iron Software entwickelt und gepflegt. Eine seiner am besten bewerteten Funktionen ist das Extrahieren von Text und Daten aus PDF-Dateien sowie aus HTML und URLs.

3. Voraussetzungen

Um IronPDF zum Extrahieren von Daten aus PDF-Dateien zu verwenden, müssen Sie die folgenden Voraussetzungen erfüllen:

  1. Java-Installation: Stellen Sie sicher, dass Java auf Ihrem System installiert ist und dass sein Pfad in den Umgebungsvariablen festgelegt ist. Wenn Sie Java noch nicht installiert haben, wenden Sie sich für Anweisungen an diese Download-Seite auf der Java-Website.
  2. Java-IDE: Haben Sie eine Java-IDE wie Eclipse oder IntelliJ installiert. Sie können Eclipse von dieser Eclipse-Downloadseite und IntelliJ von dieser IntelliJ-Downloadseite herunterladen.
  3. IronPDF-Bibliothek: Laden Sie die IronPDF-Bibliothek herunter und fügen Sie sie als Abhängigkeit in Ihrem Projekt hinzu. Besuchen Sie die IronPDF-Einrichtungsanweisungsseite für die Einrichtungshinweise.
  4. Maven-Installation: Maven sollte installiert und mit Ihrer IDE integriert sein, bevor Sie den PDF-Konvertierungsprozess starten. Lesen Sie dieses Maven-Installations-Tutorial auf JetBrains zur Installierung und Integration von Maven.

4. IronPDF for Java Installation

Die Installation von IronPDF for Java ist einfach und unkompliziert, vorausgesetzt, alle Anforderungen sind erfüllt. Diese Anleitung verwendet JetBrains' IntelliJ IDEA, um die Installation zu demonstrieren und Beispielcode auszuführen.

So gehen Sie vor:

  • Öffnen Sie IntelliJ IDEA: Starten Sie JetBrains IntelliJ IDEA auf Ihrem System.
  • Erstellen Sie ein Maven-Projekt: Erstellen Sie in IntelliJ IDEA ein neues Maven-Projekt. Dies bietet eine geeignete Umgebung für die Installation von IronPDF for Java.

So extrahieren Sie Daten aus PDFs in Java, Abbildung 1: Neues Maven-Projekt in IntelliJ Neues Maven-Projekt in IntelliJ

  • Es erscheint ein neues Fenster. Geben Sie den Namen des Projekts ein und klicken Sie auf Fertig stellen.

So extrahieren Sie Daten aus PDFs in Java, Abbildung 2: Benennen Sie das Maven-Projekt und klicken Sie auf Fertigstellen Benennen Sie das Maven-Projekt und klicken Sie auf Fertig stellen

  • Es öffnet sich ein neues Projekt mit einer pom.xml, sobald Sie auf Fertig stellen klicken. Dies wird verwendet, um die IronPDF for Java Maven-Abhängigkeiten hinzuzufügen.

So extrahieren Sie Daten aus PDFs in Java, Abbildung 3: Die pom.xml-Datei Die pom.xml Datei

Fügen Sie die folgenden Abhängigkeiten in die pom.xml Datei hinzu oder laden Sie die JAR-Datei von der IronPDF-Bibliotheksseite auf Sonatype Central herunter.

<dependency>
    <groupId>com.ironsoftware</groupId>
    <artifactId>ironpdf</artifactId>
    <version>1.0.0</version> <!-- replace with the latest version -->
</dependency>
XML

Sobald Sie die Abhängigkeiten in die pom.xml Datei eingefügt haben, erscheint in der rechten oberen Ecke der Datei ein kleines Symbol.

So extrahieren Sie Daten aus PDFs in Java, Abbildung 4: Klicken Sie auf das schwebende Symbol, um die Maven-Abhängigkeiten automatisch zu installieren Klicken Sie auf das schwebende Symbol, um die Maven-Abhängigkeiten automatisch zu installieren

Installieren Sie die Maven-Abhängigkeiten von IronPDF for Java, indem Sie diese Schaltfläche anklicken. Je nach Geschwindigkeit Ihrer Internetverbindung sollte dies nur wenige Minuten dauern.

5. Datenextraktion

IronPDF ist eine Java-Bibliothek zum Erstellen, Bearbeiten und Extrahieren von Daten aus PDF-Dokumenten. Sie bietet eine einfache API, um Text aus PDF-Dateien, URLs und Tabellen zu extrahieren.

5.1. Daten aus PDF-Dokumenten extrahieren

Mit IronPDF for Java können Sie ganz einfach Textdaten aus PDF-Dokumenten extrahieren. Unten folgt das Beispielcode zur Extraktion von Daten aus einer PDF-Datei.

So extrahieren Sie Daten aus PDFs in Java, Abbildung 5: PDF-Eingabe PDF-Eingabe

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Load the PDF document from the specified file
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("business plan.pdf"));
        
        // Extract all text from the PDF document
        String text = pdf.extractAllText();
        
        // Print the extracted text to the console
        System.out.println("Text extracted from the PDF: " + text);
    }
}
Java

Der Quellcode ergibt die unten aufgeführte Ausgabe:

> Text extracted from the PDF:
> 
> CRAFT-ARENA
> 
> Muhammad Waleed Butt
> 
> Hassan Khan
> 
> ABOUT US
> 
> Craft-Arena is a partnership based business that will help local crafters of Pakistan to sell their handicrafts at good prices and helps them earn a good living.
Text

5.2. Daten aus URLs extrahieren

IronPDF for Java konvertiert die URL zur Laufzeit in PDF und extrahiert Text daraus. Dieses Beispiel zeigt den Quellcode zum Extrahieren von Text aus URLs.

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;

public class Main {
    public static void main(String[] args) throws IOException {
        // Convert a URL to a PDF and load it into a PdfDocument
        PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");
        
        // Extract all text from the PDF document
        String text = pdf.extractAllText();
        
        // Print the extracted text to the console
        System.out.println("Text extracted from the URLs: " + text);
    }
}
Java

So extrahieren Sie Daten aus PDFs in Java, Abbildung 6: Extrahierte Webseitendaten Extrahierte Webseitendaten

5.3. Daten aus Tabellendaten extrahieren

Um Tabellendaten aus einem PDF mit IronPDF for Java zu extrahieren, ist sehr einfach; Alles, was Sie brauchen, ist ein PDF mit einer Tabelle und den folgenden Code auszuführen.

So extrahieren Sie Daten aus PDFs in Java, Abbildung 7: Beispiel-PDF-Tabelleneingabe Beispieldateneingabe für PDF-Tabelle

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Load the PDF document from the specified file
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("table.pdf"));
        
        // Extract all text from the PDF document, including table data
        String text = pdf.extractAllText();
        
        // Print the extracted table data to the console
        System.out.print("Text extracted from the Marked tables: " + text);
    }
}
Java
> Test Case Description Expected Result Actual Result Status
> 
> 1 Test login functionality User should be able to log in with valid credentials
> 
> User log in successfully Pass
> 
> 2 Test search functionality Search results should be relevant and accurate
> 
> Search is accurate and provide relevant products Pass
> 
> 3 Test checkout process User should be able to complete a purchase successfully
> 
> User can purchase successfully Pass
Text

6. Fazit

Abschließend hat dieses Tutorial gezeigt, wie man Daten, insbesondere Tabellendaten, aus einer PDF-Datei mit IronPDF for Java extrahiert.

Für weitere Informationen beachten Sie bitte das Beispiel zum Extrahieren von Text aus PDF auf der IronPDF-Website.

IronPDF ist eine Bibliothek mit kommerziellen Lizenzdetails, beginnend bei $999. Sie können es jedoch in der Produktion mit einer kostenlosen Testversion mit der IronPDF-Testlizenz auswerten.

Curtis Chau
Technischer Autor

Curtis Chau hat einen Bachelor-Abschluss in Informatik von der Carleton University und ist spezialisiert auf Frontend-Entwicklung mit Expertise in Node.js, TypeScript, JavaScript und React. Leidenschaftlich widmet er sich der Erstellung intuitiver und ästhetisch ansprechender Benutzerschnittstellen und arbeitet gerne mit modernen Frameworks sowie der Erstellung gut strukturierter, optisch ansprechender Handbücher.

...
Weiterlesen

Verwandte Artikel

Key in blue circle

Holen Sie sich sofort Ihren kostenlosen 30-Tage-Testschlüssel.

Your trial license will be sent to your email address

Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.

OR
bullet_checkedIhr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.Keine Einschränkungen. 100 % freigeschaltet. Keine Kreditkarte.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
AWS-Logo
Booking Badge

Von Millionen von Ingenieur*innen weltweit vertraut

Azure (WebApps, Funktionen v3)
Erhalten Sie Ihre unverbindliche Beratung
Füllen Sie das Formular unten aus oder senden Sie eine E-Mail an sales@ironsoftware.com
Ihre Daten werden immer vertraulich behandelt.
Von Millionen von Ingenieur*innen weltweit vertraut
Azure (WebApps, Funktionen v3)
Erhalten Sie sofort Ihren kostenlosen 30-Tage-Testschlüssel.
Ihr Testlizenzschlüssel wurde Ihnen per E-Mail gesendet.
C# NuGet-Bibliothek für PDF
Installation mit NuGet

Version: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. Rechtsklick auf Referenzen, NuGet-Pakete verwalten
  2. Wählen Sie Durchsuchen und suchen Sie nach 'IronPDF'
  3. Paket auswählen und installieren
C# PDF DLL
Download DLL

Version: 2026.9

oder laden Sie den Windows-Installer hier herunter.

  1. Laden Sie IronPDF herunter und entpacken Sie es in ein Verzeichnis wie ~/Libs innerhalb Ihres Lösungsverzeichnisses
  2. Im Visual Studio-Projektmappen-Explorer klicken Sie mit der rechten Maustaste auf Referenzen. Wählen Sie Durchsuchen, "IronPDF.dll"

Lizenzen ab 749 $