
Wie man eine Seite in PDF-Dokumenten löscht
Das Extrahieren von Text aus PDF-Dokumenten ist in modernen Softwareprojekten eine häufige Anforderung – vom Verarbeiten von Rechnungen bis zum Durchsuchen von Inhalten für Suchmaschinen. Entwickler benötigen zuverlässige Bibliotheken, die nicht nur genaue Ergebnisse liefern, sondern auch eine effiziente Integrationserfahrung in C# .NET-Anwendungen bieten. Einige Entwickler verwenden OCR (optische Zeichenerkennung) Tools, um Daten aus gescannten Dokumenten und Bildern zu extrahieren, aber manchmal erfordert die Aufgabe ein robustes Texteingabetool.
Aber bei den vielen auf dem Markt verfügbaren PDF-Bibliotheken kann die Auswahl des richtigen Werkzeugs überwältigend sein. Zwei Bibliotheken, die häufig im Gespräch sind, sind iText und IronPDF. Beide können Text aus PDFs extrahieren, unterscheiden sich jedoch erheblich in Benutzerfreundlichkeit, Support, Leistung und Preisgestaltung. Dieser Artikel vergleicht die beiden Bibliotheken, schaut sich verschiedene Codebeispiele an, um zu zeigen, wie sie mit der Textextraktion umgehen, und hilft Ihnen zu entscheiden, welche am besten zu Ihrem Projekt passt.
Ein Überblick über IronPDF und die iText-Bibliothek
iText ist seit langem eine beliebte Open-Source-PDF-Bibliothek für .NET und bietet leistungsstarke Werkzeuge für die Erstellung, Bearbeitung und Extraktion von Inhalten. Als C# Port der Java-basierten iText bietet es umfassende Kontrolle über PDF-Strukturen – ideal für fortgeschrittene Benutzer. Diese Flexibilität bringt jedoch eine steile Lernkurve und Lizenzierungsbeschränkungen mit sich; Die kommerzielle Nutzung erfordert oft eine kostenpflichtige Lizenz, um AGPL-Verpflichtungen zu vermeiden.
Enter IronPDF – eine moderne, entwicklerfreundliche PDF-Bibliothek für .NET. Es vereinfacht häufige Aufgaben wie die Textextraktion mit einer intuitiven API, klarer Dokumentation und reaktionsschnellem Support. Mit diesem Tool können Entwickler problemlos Bilder und Text aus PDF-Dokumenten extrahieren, neue PDF-Dateien erstellen, PDF-Sicherheit implementieren und mehr.
Im Gegensatz zu iText vermeidet IronPDF komplexe tiefgehende Strukturen und erlaubt es Ihnen, schneller und effizienter zu arbeiten. Egal, ob Sie eine einzelne Seite oder Hunderte von PDFs verarbeiten, es bleibt einfach.
Es wird auch aktiv gepflegt, mit regelmäßigen Updates und einem unkomplizierten Lizenzierungsmodell, einschließlich einer kostenlosen Testversion und erschwinglichen Plänen für Teams und Einzelentwickler.
Installation und Verwendung von IronPDF
IronPDF kann über NuGet installiert werden, indem Sie den folgenden Befehl in der NuGet-Paket-Manager-Konsole ausführen:
Alternativ können Sie es über den NuGet-Paketmanager für Lösungen installieren. Navigieren Sie dazu zu "Tools > NuGet Paketmanager > NuGet-Pakete für Lösung verwalten". Dann suchen Sie nach IronPDF und klicken Sie auf "Installieren".
Mit IronPDF Text aus PDF-Dateien extrahieren
Nach der Installation ist das Extrahieren von Text einfach:
using IronPdf;
// Load the PDF document
var pdf = PdfDocument.FromFile("invoice.pdf");
// Extract text from the PDF
string extractedText = pdf.ExtractAllText();
// Output the extracted text
Console.WriteLine(extractedText);Imports IronPdf
' Load the PDF document
Private pdf = PdfDocument.FromFile("invoice.pdf")
' Extract text from the PDF
Private extractedText As String = pdf.ExtractAllText()
' Output the extracted text
Console.WriteLine(extractedText)Hinweis: Diese Methode liest die gesamte PDF-Datei und gibt den Text in Lesereihenfolge zurück und spart Stunden an Parsing-Zeit im Vergleich zu herkömmlichen Bibliotheken.
Keine Handhabung von Encodings, Streams oder Parsing nötig. IronPDF kümmert sich intern um alles und bietet eine saubere und genaue Ausgabe mit minimalem Setup. Sie könnten dann den extrahierten Text einfach in einer neuen Textdatei speichern, um ihn weiter zu bearbeiten oder zu verwenden.
Installation der iText-PDF-Bibliothek
Um das Kernpaket von iText zur PDF-Erstellung herunterzuladen, verwenden Sie den folgenden Befehl:
Sie können iText auch über den Paketmanager für Bildschirm der Lösung installieren. Gehen Sie dazu zuerst zum Tools-Dropdown-Menü und dann zu "NuGet-Paketmanager > NuGet-Pakete für die Lösung verwalten". Dann einfach nach iText suchen und auf "Installieren" klicken.
Text aus PDF-Dokumenten mit iText extrahieren
Hier ist ein Beispiel, um Text von einer einzelnen PDF-Seite zu extrahieren:
using iText.Kernel.Pdf;
using iText.Kernel.Pdf.Canvas.Parser;
using iText.Kernel.Pdf.Canvas.Parser.Listener;
// Define the path to your PDF
string path = "sample.pdf";
// Open the PDF reader and document
using (PdfReader reader = new PdfReader(path))
using (PdfDocument pdf = new PdfDocument(reader))
{
// Use a simple text extraction strategy
var strategy = new SimpleTextExtractionStrategy();
// Extract text from the first page
string pageText = PdfTextExtractor.GetTextFromPage(pdf.GetPage(1), strategy);
// Output the extracted text
Console.WriteLine(pageText);
}Imports iText.Kernel.Pdf
Imports iText.Kernel.Pdf.Canvas.Parser
Imports iText.Kernel.Pdf.Canvas.Parser.Listener
' Define the path to your PDF
Dim path As String = "sample.pdf"
' Open the PDF reader and document
Using reader As New PdfReader(path)
Using pdf As New PdfDocument(reader)
' Use a simple text extraction strategy
Dim strategy = New SimpleTextExtractionStrategy()
' Extract text from the first page
Dim pageText As String = PdfTextExtractor.GetTextFromPage(pdf.GetPage(1), strategy)
' Output the extracted text
Console.WriteLine(pageText)
End Using
End UsingDieses Beispiel demonstriert die Fähigkeiten von iText, aber beachten Sie die Ausführlichkeit und die zusätzlichen Objekte, die erforderlich sind, um eine einfache Aufgabe auszuführen.
Detaillierter Vergleich
Da wir nun die Installation und grundlegende Verwendung behandelt haben, werfen wir einen genaueren Blick darauf, wie diese beiden Bibliotheken mit der Textextraktion umgehen, indem wir Text aus einem mehrseitigen PDF-Dokument extrahieren.
Erweitertes Beispiel: Extrahieren von Text aus einem Seitenbereich mit IronPDF
IronPDF unterstützt die granulare Kontrolle über die Seitenauswahl und Layout-abhängige Textextraktion.
using IronPdf;
// Load the PDF document
var pdf = PdfDocument.FromFile("longPdf.pdf");
// Define the page numbers to extract text from
int[] pages = new[] { 2, 3, 4 };
// Extract text from the specified pages
var text = pdf.ExtractTextFromPages(pages);
// Output the extracted text
Console.WriteLine("Extracted text from pages 2, 3, and 4:\n" + text);Imports Microsoft.VisualBasic
Imports IronPdf
' Load the PDF document
Private pdf = PdfDocument.FromFile("longPdf.pdf")
' Define the page numbers to extract text from
Private pages() As Integer = { 2, 3, 4 }
' Extract text from the specified pages
Private text = pdf.ExtractTextFromPages(pages)
' Output the extracted text
Console.WriteLine("Extracted text from pages 2, 3, and 4:" & vbLf & text)Erweitertes Beispiel: Text aus einem Seitenbereich mit iText extrahieren
In iText müssen Sie manuell den Seitenbereich angeben und Text mit PdfTextExtractor extrahieren:
using iTextSharp.text.pdf;
using iTextSharp.text.pdf.parser;
using System.IO;
using System.Text;
// Load the PDF document
PdfReader reader = new PdfReader("longPdf.pdf");
StringBuilder textBuilder = new StringBuilder();
// Extract text from pages 2–4
for (int i = 2; i <= 4; i++)
{
string pageText = PdfTextExtractor.GetTextFromPage(reader, i, new LocationTextExtractionStrategy());
textBuilder.AppendLine(pageText);
}
// Output the extracted text
Console.WriteLine(textBuilder.ToString());
// Close the PDF reader
reader.Close();Imports iTextSharp.text.pdf
Imports iTextSharp.text.pdf.parser
Imports System.IO
Imports System.Text
' Load the PDF document
Private reader As New PdfReader("longPdf.pdf")
Private textBuilder As New StringBuilder()
' Extract text from pages 2–4
For i As Integer = 2 To 4
Dim pageText As String = PdfTextExtractor.GetTextFromPage(reader, i, New LocationTextExtractionStrategy())
textBuilder.AppendLine(pageText)
Next i
' Output the extracted text
Console.WriteLine(textBuilder.ToString())
' Close the PDF reader
reader.Close()Zusammenfassung des Code-Vergleichs
Sowohl IronPDF als auch iText sind in der Lage, fortschrittliche PDF-Textraktionen durchzuführen, aber ihre Ansätze unterscheiden sich signifikant in Komplexität und Klarheit:
-
IronPDF hält alles sauber und zugänglich. Seine hochentwickelten Methoden wie PdfDocument.ExtractAllText() erlauben es Ihnen, strukturierten Inhalt mit minimalem Setup zu extrahieren. Der Code ist klar und einfach zu implementieren, selbst für Entwickler, die neu in der PDF-Verarbeitung sind.
-
iText, dagegen erfordert ein tiefes Verständnis der PDF-Struktur. Text extrahieren erfordert das Einrichten von benutzerdefinierten Render-Listenern, manuelle Seitenverwaltung und Interpreten der Layout-Daten Zeile für Zeile. Während es leistungsfähig ist, ist es umständlicher und weniger intuitiv, wodurch IronPDF für die meisten .NET-Projekte eine schnellere und besser wartbare Option ist.
Aber unser Vergleich endet hier nicht. Schauen wir uns an, wie diese Bibliotheken in anderen Bereichen abschneiden.
Detaillierter Vergleich: IronPDF vs iText
Bei der Evaluation von PDF-Textextraktionsbibliotheken für .NET wägen Entwickler oft das Gleichgewicht zwischen Einfachheit, Leistung und langfristiger Unterstützung ab. Lassen Sie uns analysieren, wie IronPDF und iText in der realen Nutzung abschneiden, insbesondere bei der Textextraktion aus PDFs mit C#.
1. Benutzerfreundlichkeit
IronPDF: Eine saubere und moderne API
IronPDF legt Wert auf das Entwicklererlebnis. Die Installation ist einfach über NuGet und die Syntax ist intuitiv:
using IronPdf;
// Load the PDF
var pdf = PdfDocument.FromFile("sample.pdf");
// Extract all text from every page
string extractedText = pdf.ExtractAllText();
// Output the extracted text
Console.WriteLine(extractedText);Imports IronPdf
' Load the PDF
Private pdf = PdfDocument.FromFile("sample.pdf")
' Extract all text from every page
Private extractedText As String = pdf.ExtractAllText()
' Output the extracted text
Console.WriteLine(extractedText)IronPDF abstrahiert die Komplexität hinter einfachen Methodenaufrufen wie ExtractAllText(), ohne dass Boilerplate- oder Parsing-Logik erforderlich ist.
iText: Ausführlicher und tiefer gehend
iText erfordert manuelles Parsen jeder Seite und mehr Anstrengung, um einfachen Text zu extrahieren.
using iTextSharp.text.pdf;
using iTextSharp.text.pdf.parser;
using System.IO;
using System.Text;
// Load the PDF
var reader = new PdfReader("sample.pdf");
StringBuilder text = new StringBuilder();
for (int i = 1; i <= reader.NumberOfPages; i++)
{
text.Append(PdfTextExtractor.GetTextFromPage(reader, i));
}
// Output the extracted text
Console.WriteLine(text.ToString());Imports iTextSharp.text.pdf
Imports iTextSharp.text.pdf.parser
Imports System.IO
Imports System.Text
' Load the PDF
Private reader = New PdfReader("sample.pdf")
Private text As New StringBuilder()
For i As Integer = 1 To reader.NumberOfPages
text.Append(PdfTextExtractor.GetTextFromPage(reader, i))
Next i
' Output the extracted text
Console.WriteLine(text.ToString())Entwickler müssen Seiten manuell durchlaufen, was zu mehr Code und potenziellen Fehlern führt, wenn Randfälle auftreten.
2. Leistung und Zuverlässigkeit
-
IronPDF basiert auf einer modernen Rendering-Engine (Chromium) und ist gut geeignet für moderne PDFs, selbst solche mit eingebetteten Schriftarten, gedrehten Texten und mehreren Layouts. Die Textextraktion ist layoutabhängig und behält die Abstände natürlicher bei.
-
iText, obwohl mächtig, kann bei komplexer Formatierung Schwierigkeiten haben. PDF-Dateien mit gemischter Ausrichtung oder nicht standardisierten Encodings können falsch angeordneten oder unsortierten Text liefern.
3. Kosten und Lizenzierung
| Merkmal | IronPDF | iText |
|---|---|---|
| Lizenztyp | Kommerziell (Kostenlose Testversion verfügbar) | AGPL (kostenlos) / Kommerziell (kostenpflichtig) |
| Preisgestaltungstransparenz | Öffentliche Preisgestaltung & Perpetuelle Lizenzierung | Komplexe Stufen und Umverteilungsregeln |
| Support | Dediziertes Support-Team | Unterstützung durch die Gemeinschaft (sofern nicht lizenziert) |
| Verwendung in geschlossenen Apps | Ja (mit Lizenz) | Nicht mit AGPL |
4. Entwicklerunterstützung und Dokumentation
-
IronPDF: Bietet moderne Dokumentation, Video-Tutorials und schnellen Support per Ticketsystem.
-
iText: Gute Dokumentation, aber begrenzter kostenloser Support, es sei denn, Sie sind zahlender Kunde.
5. Bibliotheksübergreifende Zusammenfassung
| Kriterium | IronPDF | iText |
|---|---|---|
| Einfachheit | Hoch – Einzeilige Texterextraktion | Medium – Manuelle Seiteniteration |
| Leistung | Schnelles und modernes Parsing | Langsamer bei komplexen oder gescannten PDFs |
| Kommerzielle Freundlichkeit | Ja, keine AGPL-Einschränkungen | AGPL beschränkt die Verwendung in geschlossenen Apps |
| Support & Docs | Dediziert, reaktionsschnell | Gemeinschaftsabhängig |
| .NET Core Unterstützung | Full | Voll |
Abschluss
Wenn es darum geht, Text aus PDFs in C# zu extrahieren, sind sowohl IronPDF als auch iText fähige Werkzeuge – aber sie dienen unterschiedlichen Arten von Entwicklern. Wenn Sie nach einer modernen, einfach zu integrierenden Lösung mit exzellentem Support, aktiv gepflegten Funktionen und nahtloser Layout-Wahrung suchen, sticht IronPDF klar heraus. Es reduziert die Entwicklungszeit, bietet intuitive APIs und funktioniert gut über eine breite Palette von Anwendungen innerhalb des .NET-Frameworks, von Web-Apps bis zu Unternehmenssystemen.
Andererseits bleibt iText eine starke Option für Entwickler, die bereits in dessen Ökosystem eingebunden sind oder eine detaillierte Kontrolle über Textextraktionsstrategien benötigen. Allerdings kann seine steilere Lernkurve und der Mangel an kommerzieller Unterstützung Projekte bremsen, die schnell skalieren oder sauber gehaltene Codebasen beibehalten müssen.
Für .NET-Entwickler, die Wert auf Geschwindigkeit, Klarheit und zuverlässige Ergebnisse legen, bietet IronPDF einen zukunftssicheren Weg. Egal, ob Sie Dokumentautomatisierungstools, Suchmaschinen oder interne Dashboards erstellen, die robusten Funktionen und die Leistung von IronPDF helfen Ihnen dabei, schneller und intelligenter zu liefern.
Probieren Sie IronPDF noch heute aus, indem Sie die kostenlose Testversion herunterladen und erleben Sie den Unterschied selbst. Mit einer kostenlosen Testversion und einer entwicklerfreundlichen API können Sie in wenigen Minuten loslegen.

Curtis Chau hat einen Bachelor-Abschluss in Informatik von der Carleton University und ist spezialisiert auf Frontend-Entwicklung mit Expertise in Node.js, TypeScript, JavaScript und React. Leidenschaftlich widmet er sich der Erstellung intuitiver und ästhetisch ansprechender Benutzerschnittstellen und arbeitet gerne mit modernen Frameworks sowie der Erstellung gut strukturierter, optisch ansprechender Handbücher.
Verwandte Artikel


