
Comment retirer un mot de passe d'un fichier PDF
Votre entreprise dépense trop pour des abonnements annuels pour la sécurité et la conformité PDF. Envisagez IronSecureDoc, qui fournit des solutions pour gérer les services SaaS comme la signature numérique, la suppression, le chiffrement et la protection, le tout pour un paiement unique. En savoir plus sur IronSecureDoc
Extraire des données des PDF est crucial pour gagner du temps sur la saisie manuelle. Cet article explique comment les développeurs peuvent utiliser la bibliothèque IronPDF pour extraire du texte et des images des documents PDF.
Comment extraire des données d'un PDF en C#
- Téléchargement de la bibliothèque Extract Data from PDF C#
- Créer un Nouveau Projet dans Visual Studio
- Installer la Bibliothèque dans votre Projet
- Extraire les données de pages spécifiques et extraire des données spécifiques d'un PDF
- Voir la sortie des données du document PDF
IronPDF : Bibliothèque PDF en C#
IronPDF est une bibliothèque .NET qui peut être utilisée pour créer, éditer et convertir des fichiers PDF. Elle offre une API facile à utiliser pour les développeurs à utiliser dans leurs applications. C'est l'une des bibliothèques les plus populaires pour créer, éditer et convertir des fichiers PDF à l'échelle mondiale. Avec IronPDF, vous pouvez créer une solution simple et rapide pour les PDF. Votre texte sera personnalisé pour chaque document, votre mise en page sera configurée pour une lecture facile, et vos graphiques seront conçus avec l'aide du programme .NET accompagnant.
La bibliothèque IronPDF a une fonctionnalité fantastique pour extraire des données des fichiers PDF. Cet article examinera comment extraire des données à l'aide de IronPDF. Tout d'abord, un Projet C# doit être créé ou ouvert. Passons à la section suivante.
Créer ou ouvrir un projet C# dans Visual Studio
Ce tutoriel recommande d'utiliser la dernière version de Visual Studio.
Une fois Visual Studio ouvert, suivez les étapes ci-dessous pour créer un nouveau Projet C#. Si vous avez un projet existant que vous souhaitez utiliser, alors passez ces prochaines étapes et passez directement à la section suivante.
- Ouvrir Visual Studio
- Cliquez sur le bouton "Créer un nouveau projet".
Interface d'ouverture de Visual Studio
- Sélectionnez l'"Application Console C#" parmi les modèles.
Créer un nouveau projet
- Donnez un nom au Projet et cliquez sur le bouton Suivant.
- Sélectionnez un Framework .NET selon les besoins de votre projet et cliquez sur le bouton Créer.
Sélection du framework .NET
Visual Studio va maintenant générer un nouveau projet C# .NET.
Installer la Bibliothèque IronPDF
La bibliothèque IronPDF peut être installée de plusieurs manières.
Utilisation de la console du gestionnaire de packages
- Ouvrez la Console du Package Manager en allant dans Outils > Package Manager NuGet > Console du Package Manager.
- Exécutez la commande suivante pour installer la bibliothèque IronPDF :
Progression de l'installation dans l'onglet Console du Package Manager
Après l'installation, vous verrez la dépendance IronPDF dans la section dependencies de l'Explorateur de solutions, comme indiqué ci-dessous.
Référencer le package IronPDF dans l'Explorateur de solutions
Utilisation du Package Manager NuGet
Une autre manière d'installer la bibliothèque IronPDF est d'utiliser l'interface utilisateur intégrée du Package Manager NuGet dans Visual Studio.
- Allez dans les Outils du menu principal. Passez la souris sur "Package Manager NuGet" dans le menu déroulant et sélectionnez "Gérer les Packages NuGet pour la Solution...".
Accéder au gestionnaire de package NuGet
- Cela ouvrira la fenêtre du gestionnaire de packages NuGet. Allez à l'onglet Parcourir, écrivez
IronPdfdans la recherche, et appuyez sur Entrée. - Sélectionnez IronPDF parmi les résultats de recherche et cliquez sur le bouton "Installer" pour commencer l'installation.
Installer le package IronPDF à partir du gestionnaire de packages NuGet
Extraire les Données des Fichiers PDF
Voyons le code suivant pour extraire des données à l'aide d'IronPDF :
// Import necessary namespaces
using IronPdf;
using System.Collections.Generic;
using System.Drawing;
public class PDFExtractor
{
public void ExtractDataFromPDF()
{
// Open a 128-bit encrypted PDF file by providing the filename and password
using PdfDocument pdf = PdfDocument.FromFile("encrypted.pdf", "password");
// Extract all text from the PDF document
string allText = pdf.ExtractAllText();
// Extract all images from the PDF document
IEnumerable<Image> allImages = pdf.ExtractAllImages();
// Iterate over each page in the PDF document
for (var index = 0; index < pdf.PageCount; index++)
{
int pageNumber = index + 1;
// Extract text from the specific page
string text = pdf.ExtractTextFromPage(index);
// Extract images from the specific page
IEnumerable<Image> images = pdf.ExtractImagesFromPage(index);
// Code to process the extracted text and images
//...
}
}
}' Import necessary namespaces
Imports IronPdf
Imports System.Collections.Generic
Imports System.Drawing
Public Class PDFExtractor
Public Sub ExtractDataFromPDF()
' Open a 128-bit encrypted PDF file by providing the filename and password
Using pdf As PdfDocument = PdfDocument.FromFile("encrypted.pdf", "password")
' Extract all text from the PDF document
Dim allText As String = pdf.ExtractAllText()
' Extract all images from the PDF document
Dim allImages As IEnumerable(Of Image) = pdf.ExtractAllImages()
' Iterate over each page in the PDF document
For index = 0 To pdf.PageCount - 1
Dim pageNumber As Integer = index + 1
' Extract text from the specific page
Dim text As String = pdf.ExtractTextFromPage(index)
' Extract images from the specific page
Dim images As IEnumerable(Of Image) = pdf.ExtractImagesFromPage(index)
' Code to process the extracted text and images
'...
Next index
End Using
End Sub
End ClassDans cet exemple de code :
- La méthode
FromFileest utilisée pour charger le document PDF à traiter, qui est chiffré et requiert un mot de passe. - La méthode
ExtractAllTextextrait tout le contenu textuel du PDF. - La méthode
ExtractAllImagesrécupère toutes les images intégrées. - Une boucle itère sur chaque page du document pour extraire le texte et les images de cette page spécifique en utilisant
ExtractTextFromPageetExtractImagesFromPage.
Conclusion
IronPDF permet aux développeurs d'extraire facilement du texte et des images des fichiers PDF. En utilisant ExtractAllText et ExtractAllImages, tout le contenu d'un fichier PDF peut être extrait instantanément. Alternativement, ces méthodes peuvent être utilisées pour extraire le contenu d'une page spécifique. Le code précédent a démontré comment utiliser les deux méthodes pour lire texte et images sur un ensemble de pages.
De plus, IronPDF offre des fonctionnalités comme rendre des graphiques, ajouter des codes-barres, améliorer la sécurité avec des mots de passe, ajouter des filigranes, et gérer des formulaires PDF de manière programmée.
IronPDF est disponible gratuitement pendant le développement, avec paiement requis pour un usage commercial. Une version d'essai gratuite de IronPDF est disponible pour une utilisation en production sans paiement.
Achetez la [suite complète des bibliothèques de documents de Iron Software](Iron Suite) pour le coût de deux Licences IronPDF Lite.
Téléchargez IronPDF maintenant pour commencer à extraire des données des PDF aujourd'hui !

Curtis Chau détient un baccalauréat en informatique (Université de Carleton) et se spécialise dans le développement front-end avec expertise en Node.js, TypeScript, JavaScript et React. Passionné par la création d'interfaces utilisateur intuitives et esthétiquement plaisantes, Curtis aime travailler avec des frameworks modernes et créer des manuels bien structurés et visuellement attrayants.
Articles connexes


