
Generowanie PDF w C# z użyciem IronPDF
W tym artykułe opisano proces konwersji plików PDF do formatu TXT przez programistów .NET w celu uzyskania bardziej efektywnego dostępu.
Jak przekonwertować plik PDF na plik tekstowy za pomocą języka C#
- Pobierz bibliotekę Convert PDF to Text C#
- Utwórz nowy projekt w Visual Studio
- Zainstaluj bibliotekę w swoim projekcie
- Otwórz dokument PDF za pomocą funkcji PdfDocument.FromFile
- Wyświetl wyodrębniony tekst wyjściowy
Tematy poruszane w samouczku
- IronPDF
- Kroki tworzenia plików PDF programowo
- Krok 1: Utwórz projekt w języku C#
- Krok 2: Zainstaluj bibliotekę IronPDF
- Metoda 1: Menedżer pakietów NuGet
- Metoda 2: Konsola menedżera pakietów NuGet
- Metoda 3: Korzystanie z pliku DLL
- Krok 3: Dodaj przestrzeń nazw IronPDF
- Krok 4: Konwersja pliku PDF na tekst
- Wynik
- Wnioski
IronPDF
IronPDF to biblioteka .NET do generowania plików PDF. Jest to natywna biblioteka .NET i nie opiera się na zewnętrznych bibliotekach DLL ani innych narzędziach. IronPDF to wielopłatformowa biblioteka napisana w języku C# i .NET, która oferuje wszystkie funkcje niezbędne do pracy z dokumentami PDF. Obejmuje renderowanie dokumentów, edycję formularzy, ekstrakcję tekstu, szyfrowanie plików oraz inne funkcje. Wszystkie te operacje można wykonać za pomocą intuicyjnego interfejsu API, który został dokładnie przetestowany na różnych platformach, takich jak Windows Forms, WPF, ASP.NET MVC itp.
Aktualna wersja IronPDF zapewnia łatwy dostęp do tych funkcji:
- Generowanie plików PDF
- Szyfrowanie plików PDF
- Pola formularzy PDF z szablonami i logiką walidacji
- Pobieranie tekstu z plików PDF (OCR)
- Formularze do wypełnienia
Dostęp tylko do odczytu do elementów wewnętrznych dokumentu (podgląd, nawigacja, adnotacje):
Dostęp do metadanych i właściwości dokumentu (tytuł, słowa kluczowe, autor, temat):
IronPDF zawiera również dodatkowe klasy pomocnicze, które ułatwiają konwersję dokumentów HTML na w pełni sformatowane pliki PDF z możliwością wyodrębniania tekstu. IronPDF udostępnia bardzo proste interfejsy API do konwersji plików PDF na pliki tekstowe.
Zacznijmy od tego, jak używać biblioteki IronPDF do konwersji dokumentu PDF na plik tekstowy.
Kroki konwersji dokumentu PDF na plik tekstowy
Pierwszym krokiem jest utworzenie projektu C# w programie Visual Studio. Możesz wybrać dowolny szablon aplikacji C# zgodnie ze swoimi potrzebami. Dla uproszczenia w tym samouczku zostanie użyty szablon aplikacji konsolowej. Możesz użyć istniejącego projektu C# do konwersji plików PDF na pliki TXT.
Krok 1: Stworz projekt C#
Utwórz projekt C# w Visual Studio lub otwórz istniejący projekt. Aby zapewnić płynną pracę, zalecana jest najnowsza wersja programu Visual Studio. Wykonaj podane kroki, aby utworzyć projekt C# w Visual Studio.
- Otwórz program Visual Studio.
- Wybierz szablon aplikacji konsolowej C# lub otwórz istniejący projekt.
- Nadaj projektowi odpowiednią nazwę.
- Wybierz wersję .NET Framework 6.0. Jest to najnowsza i najbardziej stabilna wersja platformy .NET, ale możesz wybrać dowolną inną wersję .NET Framework w zależności od swoich potrzeb.
Krok 2: Zainstaluj bibliotekę IronPDF
IronPDF charakteryzuje się również łatwym procesem instalacji, co przyspiesza czas tworzenia oprogramowania, a także zmniejsza ryzyko nieporozumień. Biblioteka IronPDF oferuje wiele sposobów instalacji:
- Korzystanie z menedżera pakietów NuGet
- Korzystanie z konsoli menedżera pakietów NuGet
- Autor: DLL File
Metoda 1: Menedżer pakietów NuGet
Aby skorzystać z menedżera pakietów NuGet, wykonaj podane kroki, aby otworzyć kartę menedżera pakietów.
Otwórz projekt C# i kliknij Narzędzia > Menedżer pakietów NuGet > Zarządzaj pakietami NuGet dla rozwiązania.
Przejdź do menedżera pakietów NuGet
- Teraz przejdź do zakładki Przeglądaj i wyszukaj IronPDF.
- Wybierz IronPDF z wyników wyszukiwania i kliknij Zainstaluj. Spowoduje to zainstalowanie biblioteki IronPDF, umożliwiającej korzystanie z projektu z biblioteką IronPDF.
Pakiet IronPDF z wyniku wyszukiwania Menedzera pakietow NuGet
Metoda 2: Konsola menedżera pakietów NuGet
Najłatwiejszym sposobem jest instalacja biblioteki IronPDF za pomocą konsoli menedżera pakietów. Postępuj zgodnie z poniższymi prostymi wskazówkami:
- Otwórz konsolę menedżera pakietów.
- Wpisz poniższy wiersz w konsoli i naciśnij Enter. Spowoduje to natychmiastową instalację biblioteki IronPDF.
Postęp instalacji pokazany w interfejsie użytkownika konsoli NuGet Package Manager
Metoda 3: Korzystanie z pliku DLL
Plik DLL IronPDF można pobrać ze strony internetowej Iron Software. Po zakończeniu pobierania należy wykorzystać go w swoim projekcie jako punkt odniesienia.
Więcej szczegółowych informacji na temat instalacji znajdziesz w instrukcji instalacji IronPDF.
Instalacja biblioteki IronPDF została zakończona. Poniższe kroki pomogą Ci przekonwertować plik PDF na plik tekstowy.
Krok 3: Dodaj przestrzeń nazw IronPDF
Aby korzystać z IronPDF, konieczne jest dodanie przestrzeni nazw IronPDF do każdego pliku kodu. Na początku każdego powiązanego pliku kodu należy wpisać poniższy wiersz kodu. Umożliwi to korzystanie z funkcji IronPDF w programie.
using IronPdf;Imports IronPdfKrok 4: Konwersja dokumentu PDF na plik tekstowy
Teraz musimy przekonwertować plik PDF na plik TXT lub wyodrębnić tylko tekst. Wpisz więc poniższy przykładowy kod do swojego pliku:
using IronPdf;
using System;
class Program
{
static void Main()
{
// Extracting image and text content from PDF Document
// Open a 128-bit encrypted PDF
using PdfDocument pdf = PdfDocument.FromFile("encrypted.pdf", "password");
// Get all text to put in a search index
string allText = pdf.ExtractAllText();
// Display the extracted text in the console
Console.WriteLine(allText);
}
}Imports IronPdf
Imports System
Module Program
Sub Main()
' Extracting image and text content from PDF Document
' Open a 128-bit encrypted PDF
Using pdf As PdfDocument = PdfDocument.FromFile("encrypted.pdf", "password")
' Get all text to put in a search index
Dim allText As String = pdf.ExtractAllText()
' Display the extracted text in the console
Console.WriteLine(allText)
End Using
End Sub
End ModuleNajpierw otwórz dokument PDF przy użyciu FromFile function z PdfDocument class. W parametrach należy podać nazwę pliku i hasło (jeśli istnieje). Nastepnie, uzyj ExtractAllText function, aby wyodrebnic caly tekst z pliku PDF i zapisac go w zmiennej o nazwie allText. Następnie wyświetl tekst wyjściowy w konsoli.
Wynik
Tekst wyodrębniony z dokumentu PDF
Oto tekst wyjściowy wyodrębniony przez IronPDF. Jest to ten sam tekst, co w pliku PDF, co pokazuje, że dokładność IronPDF jest bardzo wysoka.
Wnioski
W tym artykułe pokazano, jak w prosty sposób wyodrębnić tekst z plików PDF przy użyciu biblioteki IronPDF .NET PDF. Osiągnięto to, pisząc zaledwie kilka linii kodu i zachowując wysoki poziom dokładności. Ponadto IronPDF oferuje wiele przydatnych funkcji, takich jak konwersja HTML do PDF, narzędzia do formatowania plików PDF oraz liczne inne podstawowe funkcje niezbędne do edycji plików PDF. IronPDF eliminuje również zależność od programu Adobe Acrobat.
IronPDF jest bezpłatny do celów programistycznych i oferuje również bezpłatną wersję próbną do testów produkcyjnych. IronPDF oferuje różne plany cenowe, które można dostosować do swoich potrzeb. Cena IronPDF jest stosunkowo znacznie niższa niż u konkurencji. Biorąc pod uwagę zróżnicowanie cenowe, od klientów indywidualnych po duże firmy, okazuje się to atrakcyjnym zakupem o imponującej wydajności.
Plany cenowe Suite Iron Software
Ponadto firma Iron Software oferuje Suite pięciu produktów Iron Software w cenie zaledwie dwóch. Więcej informacji można znaleźć w szczegółach licencji Iron Software.

Curtis Chau posiada tytuł licencjata z informatyki (Uniwersytet Carleton) i specjalizuje się w front-endowym rozwoju, z ekspertką w Node.js, TypeScript, JavaScript i React. Pasjonuje się tworzeniem intuicyjnych i estetycznie przyjemnych interfejsów użytkownika, Curtis cieszy się pracą z nowoczesnymi frameworkami i tworzeniem dobrze zorganizowanych, atrakcyjnych wizualnie podręczników.
Powiązane artykuły


