IRONSOFTWAREHOME
UTILISATION D'IRONPDF FOR JAVA

Comment extraire des données d'un PDF en Java

Curtis Chau
Curtis Chau
Updated: 21 avril 2026

Ce tutoriel vous montrera comment utiliser IronPDF for Java pour extraire des données d'un fichier PDF. La configuration de l'environnement, l'importation de la bibliothèque, la lecture du fichier d'entrée et l'extraction des données nécessaires sont toutes expliquées avec des exemples de code.

2. Bibliothèque PDF Java IronPDF

IronPDF est une bibliothèque logicielle qui permet aux développeurs de générer, modifier et extraire des données de fichiers PDF avec IronPDF for Java dans leurs applications Java. Il vous permet de créer des PDFs à partir de documents HTML, d'images et bien plus, ainsi que de fusionner plusieurs PDFs, diviser des fichiers PDF et manipuler des PDFs existants. IronPDF offre également la possibilité de sécuriser des PDFs avec des fonctionnalités de protection par mot de passe et d'ajouter des signatures numériques aux PDFs, entre autres fonctionnalités.

IronPDF for Java est développé et maintenu par Iron Software. L'une de ses fonctions les mieux notées est d'extraire du texte et des données de fichiers PDF ainsi que de HTML et d'URL.

3. Prérequis

Pour utiliser IronPDF pour extraire des données de fichiers PDF, vous devez répondre aux prérequis suivants :

  1. Installation de Java : Assurez-vous que Java est installé sur votre système et que son chemin est défini dans les variables d'environnement. Si vous n'avez pas encore installé Java, consultez cette page de téléchargement sur le site Java pour des instructions.
  2. IDE Java : Ayez un IDE Java comme Eclipse ou IntelliJ installé. Vous pouvez télécharger Eclipse depuis cette page de téléchargement Eclipse et IntelliJ depuis cette page de téléchargement IntelliJ.
  3. Bibliothèque IronPDF : Téléchargez et ajoutez la bibliothèque IronPDF en tant que dépendance dans votre projet. Consultez la page des instructions de configuration d'IronPDF pour les instructions d'installation.
  4. Installation de Maven : Maven doit être installé et intégré à votre IDE avant de commencer le processus de conversion de PDF. Référez-vous à ce tutoriel d'installation de Maven sur JetBrains pour l'installation et l'intégration de Maven.

4. Installation d'IronPDF for Java

L'installation d'IronPDF for Java est simple et facile, à condition que toutes les exigences soient remplies. Ce guide utilisera IntelliJ IDEA de JetBrains pour démontrer l'installation et exécuter un code d'exemple.

Voici ce qu'il faut faire :

  • Ouvrez IntelliJ IDEA : Lancez JetBrains IntelliJ IDEA sur votre système.
  • Créez un projet Maven : Dans IntelliJ IDEA, créez un nouveau projet Maven. Cela fournira un environnement adéquat pour l'installation d'IronPDF for Java.

Comment extraire des données d'un PDF en Java, Figure 1 : Nouveau projet Maven dans IntelliJ Nouveau projet Maven dans IntelliJ

  • Une nouvelle fenêtre apparaîtra. Entrez le nom du projet et cliquez sur Terminer.

Comment extraire des données d'un PDF en Java, Figure 2 : Nommez le projet Maven et cliquez sur Terminer Nommez le projet Maven et cliquez sur Terminer

  • Un nouveau projet avec un pom.xml s'ouvrira une fois que vous aurez cliqué sur Terminer. Cela sera utilisé pour ajouter les dépendances Maven d'IronPDF for Java.

Comment extraire des données d'un PDF en Java, Figure 3 : Le fichier pom.xml Le fichier pom.xml

Ajoutez les dépendances suivantes dans le fichier pom.xml ou vous pouvez télécharger le fichier JAR depuis la page de la bibliothèque IronPDF sur Sonatype Central.

<dependency>
    <groupId>com.ironsoftware</groupId>
    <artifactId>ironpdf</artifactId>
    <version>1.0.0</version> <!-- replace with the latest version -->
</dependency>
XML

Une fois que vous avez placé les dépendances dans le fichier pom.xml, une petite icône apparaîtra dans le coin supérieur droit du fichier.

Comment extraire des données d'un PDF en Java, Figure 4 : Cliquez sur l'icône flottante pour installer automatiquement les dépendances Maven Cliquez sur l'icône flottante pour installer automatiquement les dépendances Maven

Installez les dépendances Maven d'IronPDF for Java en cliquant sur ce bouton. En fonction de la vitesse de votre connexion Internet, cela ne devrait prendre que quelques minutes.

5. Extraction de données

IronPDF est une bibliothèque Java pour créer, modifier et extraire des données de documents PDF. Elle fournit une API simple pour extraire du texte de fichiers PDF, d'URL et de tableaux.

5.1. Extraire des données de documents PDF

En utilisant IronPDF for Java, vous pouvez facilement extraire des données de texte des documents PDF. Ci-dessous se trouve le code d'exemple pour extraire des données d'un fichier PDF.

Comment extraire des données d'un PDF en Java, Figure 5 : Entrée PDF Entrée PDF

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Load the PDF document from the specified file
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("business plan.pdf"));
        
        // Extract all text from the PDF document
        String text = pdf.extractAllText();
        
        // Print the extracted text to the console
        System.out.println("Text extracted from the PDF: " + text);
    }
}
Java

Le code source produit la sortie donnée ci-dessous :

> Text extracted from the PDF:
> 
> CRAFT-ARENA
> 
> Muhammad Waleed Butt
> 
> Hassan Khan
> 
> ABOUT US
> 
> Craft-Arena is a partnership based business that will help local crafters of Pakistan to sell their handicrafts at good prices and helps them earn a good living.
Text

5.2. Extraire des données d'URL

IronPDF for Java convertit l'URL en PDF à l'exécution et en extrait le texte. Cet exemple montrera le code source pour extraire du texte d'URL.

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;

public class Main {
    public static void main(String[] args) throws IOException {
        // Convert a URL to a PDF and load it into a PdfDocument
        PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");
        
        // Extract all text from the PDF document
        String text = pdf.extractAllText();
        
        // Print the extracted text to the console
        System.out.println("Text extracted from the URLs: " + text);
    }
}
Java

Comment extraire des données d'un PDF en Java, Figure 6 : Données extraites d'une page Web Données de page web extraites

5.3. Extraire des données de tableaux

Pour extraire des données de tableaux d'un PDF avec IronPDF for Java est très simple ; il suffit d'avoir un PDF contenant un tableau et d'exécuter le code ci-dessous.

Comment extraire des données d'un PDF en Java, Figure 7 : Exemple d'entrée de tableau PDF Exemple d'entrée tableau PDF

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Load the PDF document from the specified file
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("table.pdf"));
        
        // Extract all text from the PDF document, including table data
        String text = pdf.extractAllText();
        
        // Print the extracted table data to the console
        System.out.print("Text extracted from the Marked tables: " + text);
    }
}
Java
> Test Case Description Expected Result Actual Result Status
> 
> 1 Test login functionality User should be able to log in with valid credentials
> 
> User log in successfully Pass
> 
> 2 Test search functionality Search results should be relevant and accurate
> 
> Search is accurate and provide relevant products Pass
> 
> 3 Test checkout process User should be able to complete a purchase successfully
> 
> User can purchase successfully Pass
Text

6. Conclusion

En conclusion, ce tutoriel a démontré comment extraire des données, spécifiquement des données tabulaires, d'un fichier PDF avec IronPDF for Java.

Pour plus d'informations, veuillez consulter l'exemple d'extraction de texte d'un PDF sur le site IronPDF.

IronPDF est une bibliothèque avec des détails de licence commerciale, commençant à $999. Cependant, vous pouvez l'évaluer en production avec un essai gratuit en utilisant la licence d'essai d'IronPDF.

Curtis Chau
Rédacteur technique

Curtis Chau détient un baccalauréat en informatique (Université de Carleton) et se spécialise dans le développement front-end avec expertise en Node.js, TypeScript, JavaScript et React. Passionné par la création d'interfaces utilisateur intuitives et esthétiquement plaisantes, Curtis aime travailler avec des frameworks modernes et créer des manuels bien structurés et visuellement attrayants.

...
Lire la suite

Articles connexes

Key in blue circle

Obtenez votre clé d'essai de 30 jours instantanément.

Your trial license will be sent to your email address

Aucune restriction. 100 % débloqué. Pas de carte bancaire.

OR
bullet_checkedAucune carte de crédit ou création de compte requiseAucune restriction. 100 % débloqué. Pas de carte bancaire.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
Réservez votre Démonstration en direct gratuite
Booking Badge

De confiance par des millions d'ingénieurs dans le monde entier

Logos des clients d'Iron Software
Obtenez Votre Consultation sans Engagement
Remplissez le formulaire ci-dessous ou envoyez un email à sales@ironsoftware.com
Vos informations seront toujours gardées confidentielles.
De confiance par des millions d'ingénieurs dans le monde entier
Logos des clients d'Iron Software
Obtenez votre clé d'essai 30 jours gratuitement.
Aucune carte de crédit ou création de compte requise
Bibliothèque C# NuGet pour PDF
Installer avec NuGet

Version : 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. Dans l'explorateur de solutions, faites un clic droit sur Références, Gestion des packages NuGet
  2. Sélectionnez Parcourir et recherchez « IronPDF »
  3. Sélectionnez le package et installez
C# PDF DLL
Télécharger DLL

Version : 2026.9

ou téléchargez l'installateur Windows ici.

  1. Téléchargez et décompressez IronPDF à un emplacement tel que ~/Libs dans votre répertoire de solution
  2. Dans l'explorateur de solutions Visual Studio, faites un clic droit sur Références. Sélectionnez Parcourir, « IronPDF.dll »

Licences à partir de 749 $