
Comment supprimer une page dans un document PDF
L'extraction de texte à partir de documents PDF est une exigence courante dans les projets logiciels modernes - du traitement des factures à l'exploration de contenu pour les moteurs de recherche. Les développeurs ont besoin de bibliothèques fiables qui offrent non seulement des résultats précis mais aussi une expérience d'intégration efficace dans les applications C# .NET. Certains développeurs utilisent des outils OCR (reconnaissance optique de caractères) pour extraire des données de documents numérisés et d'images, mais parfois le travail nécessite un outil d'extraction de texte robuste.
Mais avec plusieurs bibliothèques PDF sur le marché, choisir le bon outil peut être accablant. Deux bibliothèques qui reviennent souvent dans les conversations sont iText et IronPDF. Les deux peuvent extraire du texte à partir de PDF, mais elles diffèrent significativement en matière de convivialité, de support, de performance et de tarification. Cet article compare les deux bibliothèques, en examinant différents exemples de code pour montrer comment elles gèrent l'extraction de texte, afin de vous aider à décider laquelle convient le mieux à votre projet.
Vue d'ensemble d'IronPDF et de la bibliothèque iText
iText a longtemps été une bibliothèque PDF open source populaire pour .NET, offrant des outils puissants pour générer, manipuler et extraire du contenu. En tant que portage C# du iText basé sur Java, il offre un contrôle approfondi des structures PDF - idéal pour les utilisateurs avancés. Cependant, cette flexibilité s'accompagne d'une courbe d'apprentissage abrupte et de contraintes de licence ; l'utilisation commerciale nécessite souvent une licence payante pour éviter les obligations AGPL.
Découvrez IronPDF - une bibliothèque PDF moderne et conviviale pour les développeurs, conçue pour .NET. Il simplifie les tâches courantes comme l'extraction de texte avec une API intuitive, une documentation claire et un support réactif. Avec cet outil, les développeurs peuvent extraire des images et du texte à partir de documents PDF avec facilité, créer de nouveaux fichiers PDF, mettre en œuvre la sécurité des PDF, et plus encore.
Contrairement à iText, IronPDF évite les structures complexes de bas niveau, vous permettant de travailler plus rapidement et plus efficacement. Que vous traitiez une seule page ou des centaines de PDF, il garde les choses simples.
Il est également activement maintenu, avec des mises à jour régulières et un modèle de licence simple, y compris un essai gratuit et des plans abordables pour les équipes et les développeurs en solo.
Installation et utilisation d'IronPDF
IronPDF peut être installé via NuGet en exécutant la commande suivante dans la console du gestionnaire de packages NuGet :
Alternativement, vous pouvez l'installer via le Package Manager NuGet pour l'écran de la solution. Pour ce faire, naviguez vers "Outils > Package Manager NuGet > Gérer les paquets NuGet pour la solution". Ensuite, recherchez IronPDF, et cliquez sur "Installer".
Extraire du texte de fichiers PDF avec IronPDF
Une fois installé, l'extraction de texte est simple :
using IronPdf;
// Load the PDF document
var pdf = PdfDocument.FromFile("invoice.pdf");
// Extract text from the PDF
string extractedText = pdf.ExtractAllText();
// Output the extracted text
Console.WriteLine(extractedText);Imports IronPdf
' Load the PDF document
Private pdf = PdfDocument.FromFile("invoice.pdf")
' Extract text from the PDF
Private extractedText As String = pdf.ExtractAllText()
' Output the extracted text
Console.WriteLine(extractedText)Note : Cette méthode lit l'intégralité du fichier PDF et renvoie le texte dans l'ordre de lecture, vous faisant gagner des heures par rapport aux bibliothèques traditionnelles.
Pas besoin de gérer les encodages, les flux de contenu ou le parsing manuel. IronPDF gère tout cela en interne, fournissant une sortie propre et précise avec un minimum de configuration. Vous pourriez alors facilement enregistrer le texte extrait dans un nouveau fichier texte pour une manipulation ou une utilisation ultérieure.
Installation de la bibliothèque PDF iText
Pour télécharger le package principal d'iText pour la génération de PDF, utilisez la commande suivante :
Vous pouvez également installer iText via la page de gestionnaire de packages pour les solutions. Pour ce faire, allez d'abord dans le menu déroulant Outils, puis trouvez "Package Manager NuGet > Gérer les paquets NuGet pour la solution". Ensuite, recherchez simplement iText et cliquez sur 'Installer'.
Extraire du texte de documents PDF avec iText
Voici un exemple pour extraire du texte d'une seule page PDF :
using iText.Kernel.Pdf;
using iText.Kernel.Pdf.Canvas.Parser;
using iText.Kernel.Pdf.Canvas.Parser.Listener;
// Define the path to your PDF
string path = "sample.pdf";
// Open the PDF reader and document
using (PdfReader reader = new PdfReader(path))
using (PdfDocument pdf = new PdfDocument(reader))
{
// Use a simple text extraction strategy
var strategy = new SimpleTextExtractionStrategy();
// Extract text from the first page
string pageText = PdfTextExtractor.GetTextFromPage(pdf.GetPage(1), strategy);
// Output the extracted text
Console.WriteLine(pageText);
}Imports iText.Kernel.Pdf
Imports iText.Kernel.Pdf.Canvas.Parser
Imports iText.Kernel.Pdf.Canvas.Parser.Listener
' Define the path to your PDF
Dim path As String = "sample.pdf"
' Open the PDF reader and document
Using reader As New PdfReader(path)
Using pdf As New PdfDocument(reader)
' Use a simple text extraction strategy
Dim strategy = New SimpleTextExtractionStrategy()
' Extract text from the first page
Dim pageText As String = PdfTextExtractor.GetTextFromPage(pdf.GetPage(1), strategy)
' Output the extracted text
Console.WriteLine(pageText)
End Using
End UsingCet exemple démontre la capacité d'iText, mais notez la verbosité et les objets supplémentaires nécessaires pour effectuer une tâche simple.
Comparaison détaillée
Maintenant que nous avons couvert l'installation et l'utilisation de base, examinons une comparaison plus approfondie de la manière dont ces deux bibliothèques gèrent l'extraction de texte en les faisant extraire du texte d'un document PDF multipage.
Exemple avancé : Extraire du texte d'une plage de pages avec IronPDF
IronPDF prend en charge le contrôle granulaire de la sélection des pages et l'extraction de texte sensible à la mise en page.
using IronPdf;
// Load the PDF document
var pdf = PdfDocument.FromFile("longPdf.pdf");
// Define the page numbers to extract text from
int[] pages = new[] { 2, 3, 4 };
// Extract text from the specified pages
var text = pdf.ExtractTextFromPages(pages);
// Output the extracted text
Console.WriteLine("Extracted text from pages 2, 3, and 4:\n" + text);Imports Microsoft.VisualBasic
Imports IronPdf
' Load the PDF document
Private pdf = PdfDocument.FromFile("longPdf.pdf")
' Define the page numbers to extract text from
Private pages() As Integer = { 2, 3, 4 }
' Extract text from the specified pages
Private text = pdf.ExtractTextFromPages(pages)
' Output the extracted text
Console.WriteLine("Extracted text from pages 2, 3, and 4:" & vbLf & text)Exemple Avancé : Extraction de Texte à Partir d'une Plage de Pages en utilisant iText
Dans iText, vous devrez spécifier manuellement la plage de pages et extraire le texte en utilisant PdfTextExtractor :
using iTextSharp.text.pdf;
using iTextSharp.text.pdf.parser;
using System.IO;
using System.Text;
// Load the PDF document
PdfReader reader = new PdfReader("longPdf.pdf");
StringBuilder textBuilder = new StringBuilder();
// Extract text from pages 2–4
for (int i = 2; i <= 4; i++)
{
string pageText = PdfTextExtractor.GetTextFromPage(reader, i, new LocationTextExtractionStrategy());
textBuilder.AppendLine(pageText);
}
// Output the extracted text
Console.WriteLine(textBuilder.ToString());
// Close the PDF reader
reader.Close();Imports iTextSharp.text.pdf
Imports iTextSharp.text.pdf.parser
Imports System.IO
Imports System.Text
' Load the PDF document
Private reader As New PdfReader("longPdf.pdf")
Private textBuilder As New StringBuilder()
' Extract text from pages 2–4
For i As Integer = 2 To 4
Dim pageText As String = PdfTextExtractor.GetTextFromPage(reader, i, New LocationTextExtractionStrategy())
textBuilder.AppendLine(pageText)
Next i
' Output the extracted text
Console.WriteLine(textBuilder.ToString())
' Close the PDF reader
reader.Close()Résumé de la comparaison de code
IronPDF et iText sont tous deux capables d'extraction textuelle avancée des PDF, mais leurs approches diffèrent significativement en termes de complexité et de clarté :
-
IronPDF garde les choses propres et accessibles. Ses méthodes de haut niveau comme PdfDocument.ExtractAllText() vous permettent d'extraire du contenu structuré avec un minimum de configuration. Le code est simple, ce qui le rend facile à mettre en œuvre même pour les développeurs novices en traitement PDF.
-
iText, d'autre part, exige une compréhension plus profonde de la structure PDF. L'extraction de texte implique la configuration d'écouteurs de rendu personnalisés, la gestion manuelle des pages et l'interprétation des données de mise en page ligne par ligne. Bien que puissant, il est plus verbeux et moins intuitif, ce qui fait d'IronPDF une option plus rapide et plus maintenable pour la plupart des projets .NET.
Mais notre comparaison ne s'arrête pas là. Ensuite, regardons comment ces deux bibliothèques se comparent dans d'autres domaines.
Comparaison détaillée : IronPDF vs iText
Lors de l'évaluation des bibliothèques d'extraction de texte PDF for .NET, les développeurs pèsent souvent l'équilibre entre simplicité, performance et support à long terme. Analysons comment IronPDF et iText se comparent dans l'usage réel, notamment pour l'extraction de texte à partir de PDF en C#.
1. Facilité d'utilisation
IronPDF : API propre et moderne
IronPDF met l'accent sur l'expérience développeur. L'installation est facile via NuGet, et la syntaxe est intuitive :
using IronPdf;
// Load the PDF
var pdf = PdfDocument.FromFile("sample.pdf");
// Extract all text from every page
string extractedText = pdf.ExtractAllText();
// Output the extracted text
Console.WriteLine(extractedText);Imports IronPdf
' Load the PDF
Private pdf = PdfDocument.FromFile("sample.pdf")
' Extract all text from every page
Private extractedText As String = pdf.ExtractAllText()
' Output the extracted text
Console.WriteLine(extractedText)IronPDF abstrait la complexité derrière des appels de méthode simples comme ExtractAllText(), ne nécessitant aucun template de code ou logique de parsing.
iText : Plus Verbeux et Bas-Niveau
iText nécessite une analyse manuelle de chaque page et plus d'efforts pour extraire du texte brut.
using iTextSharp.text.pdf;
using iTextSharp.text.pdf.parser;
using System.IO;
using System.Text;
// Load the PDF
var reader = new PdfReader("sample.pdf");
StringBuilder text = new StringBuilder();
for (int i = 1; i <= reader.NumberOfPages; i++)
{
text.Append(PdfTextExtractor.GetTextFromPage(reader, i));
}
// Output the extracted text
Console.WriteLine(text.ToString());Imports iTextSharp.text.pdf
Imports iTextSharp.text.pdf.parser
Imports System.IO
Imports System.Text
' Load the PDF
Private reader = New PdfReader("sample.pdf")
Private text As New StringBuilder()
For i As Integer = 1 To reader.NumberOfPages
text.Append(PdfTextExtractor.GetTextFromPage(reader, i))
Next i
' Output the extracted text
Console.WriteLine(text.ToString())Les développeurs doivent parcourir manuellement les pages, ce qui introduit plus de code et de potentiel d'erreurs si des cas limites surviennent.
2. Performance et fiabilité
-
IronPDF est basé sur un moteur de rendu moderne (Chromium), ce qui le rend bien adapté aux PDF modernes, même ceux avec des polices intégrées, du texte tourné et plusieurs dispositions. L'extraction de texte est sensible à la mise en page et préserve plus naturellement les espacements.
-
iText, bien que puissant, peut éprouver des difficultés avec le formatage complexe. Les fichiers PDF avec orientation mixte ou encodages non standards peuvent produire du texte brouillé ou mal ordonné.
3. Coût et licences
| Fonctionnalité | IronPDF | iText |
|---|---|---|
| Type de licence | Commerciale (Essai gratuit disponible) | AGPL (Gratuit) / Commercial (Payant) |
| Transparence des tarifs | Tarification publique & licences perpétuelles | Paliers complexes et règles de redistribution |
| Support | Équipe de support dédiée | Soutien communautaire (sauf autorisation) |
| Utilisation dans une appli source fermée | Oui (avec licence) | Pas avec AGPL |
4. Support développeur et documentation
-
IronPDF: Comprend une documentation moderne, des tutoriels vidéo et une assistance rapide par tickets.
-
iText : Bonne documentation, mais support gratuit limité sauf si vous êtes un client payant.
5. Résumé inter-bibliothèques
| Critère | IronPDF | iText |
|---|---|---|
| Simplicité | Élevée – Extraction de texte en une ligne | Moyen – Itération manuelle de la page |
| Performance | Analyse rapide et moderne | Plus lent avec les PDF complexes ou numérisés |
| Compatible commerciaux | Oui, pas de restrictions AGPL | L'AGPL limite l'utilisation dans les applications source fermée |
| Support & Docs | Dédié, réactif | Dépendant de la communauté |
| Support .NET Core | Full | Complet |
Conclusion
En ce qui concerne l'extraction de texte à partir de PDF en C#, IronPDF et iText sont tous deux des outils capables - mais ils servent différents types de développeurs. Si vous recherchez une solution moderne, facile à intégrer avec un excellent support, des fonctionnalités activement maintenues et une préservation de mise en page homogène, IronPDF se démarque clairement. Il réduit le temps de développement, offre des API intuitives, et fonctionne bien sur une large gamme d'applications dans le framework .NET, des applications web aux systèmes d'entreprise.
D'autre part, iText reste une option forte pour les développeurs déjà intégrés dans son écosystème, ou pour ceux qui exigent un contrôle granulaire sur les stratégies d'extraction de texte. Cependant, sa courbe d'apprentissage plus raide et son manque de support commercial peuvent ralentir les projets qui doivent s'étendre rapidement ou maintenir des bases de code propres.
Pour les développeurs .NET qui valorisent la rapidité, la clarté, et des résultats fiables, IronPDF fournit un chemin prêt pour le futur. Que vous construisiez des outils d'automatisation de documents, des moteurs de recherche ou des tableaux de bord internes, les fonctionnalités robustes et les performances d'IronPDF vous aideront à livrer plus rapidement et plus intelligemment.
Essayez IronPDF dès aujourd'hui en téléchargeant l'essai gratuit et expérimentez la différence par vous-même. Avec un essai gratuit et une API conviviale pour les développeurs, vous pouvez commencer en quelques minutes.

Curtis Chau détient un baccalauréat en informatique (Université de Carleton) et se spécialise dans le développement front-end avec expertise en Node.js, TypeScript, JavaScript et React. Passionné par la création d'interfaces utilisateur intuitives et esthétiquement plaisantes, Curtis aime travailler avec des frameworks modernes et créer des manuels bien structurés et visuellement attrayants.
Articles connexes


