IRONSOFTWAREHOME
KORZYSTANIE Z IRONPDF FOR PYTHON

Jak analizować plik PDF w Python

Curtis Chau
Curtis Chau
Updated: 20 czerwca 2026

1.0 Wprowadzenie

Nowoczesne biblioteki usprawniły tworzenie plików PDF. Wybierając bibliotekę do projektów związanych z plikami PDF, należy wziąć pod uwagę możliwości kompilacji, odczytu i konwersji, aby zapewnić optymalną integrację i wydajność. Python oferuje narzędzia takie jak IronPDF, które mogą efektywnie analizować istniejące pliki PDF.

2.0 IronPDF

Python to język programowania, który umożliwia programistom szybkie i łatwe tworzenie graficznych interfejsów użytkownika. W porównaniu z innymi językami oferuje programistom większą dynamikę. Dlatego integracja biblioteki IronPDF z Pythonem jest prostym procesem.

Aby szybko i bezpiecznie stworzyć w pełni funkcjonalny interfejs graficzny, programiści mogą skorzystać z kilku preinstalowanych narzędzi, w tym PyQt, wxWidgets, Kivy oraz wielu innych pakietów i bibliotek. Warto zauważyć, że IronPDF nie jest biblioteką PDF napisana wyłącznie w języku Python; zamiast tego umożliwia włączenie różnych funkcji z innych frameworków, takich jak .NET Core.

IronPDF upraszcza projektowanie i tworzenie stron internetowych w języku Python, zwłaszcza ze względu na popularność paradygmatów tworzenia stron internetowych w tym języku, takich jak Django, Flask i Pyramid. Z tych frameworków korzystają znane serwisy internetowe i usługi online, w tym Reddit, Mozilla i Spotify. Więcej informacji na temat języka Python w IronPDF można znaleźć na stronie internetowej IronPDF dla Python.

2.1 Funkcje IronPDF

3.0 Konfiguracja w języku Python

3.1 Konfiguracja środowiska

Upewnij się, że na Twoim komputerze zainstalowany jest Python. Odwiedź oficjalną stronę Pythona, aby pobrać i zainstalować najnowszą wersję Pythona odpowiednią dla Twojego systemu operacyjnego. Po zainstalowaniu języka Python skonfiguruj środowisko wirtualne, aby odizolować zależności dla swojego projektu. Użyj modułu "venv" do tworzenia i zarządzania środowiskami wirtualnymi, zapewniając projektowi konwersji czystą i niezależną przestrzeń roboczą.

3.2 Nowy projekt w PyCharm

W tej demonstracji użyjemy PyCharm, środowiska IDE do pisania kodu w języku Python.

Po uruchomieniu środowiska PyCharm kliknij "Nowy projekt".

Jak analizować plik PDF w Pythonie, Rysunek 1: Ekran powitalny PyCharm Ekran powitalny PyCharm

Po wybraniu opcji "Nowy projekt" pojawi się nowe okno, w którym można określić lokalizację projektu i jego środowisko. To nowe okno można zobaczyć na poniższym zrzucie ekranu.

Jak analizować plik PDF w Pythonie, Rysunek 2: Ekran nowego projektu w PyCharm Ekran nowego projektu w PyCharm

Kliknij przycisk Utwórz, aby rozpocząć nowy projekt, po ustawieniu lokalizacji projektu i ścieżki środowiska. Otworzy to nowe okno, w którym będzie można rozwijać program. W tym samouczku zalecano użycie języka Python 3.9.

Jak analizować plik PDF w Pythonie, Rysunek 3: Otwarty główny plik w PyCharm Główny plik otwarty w PyCharm

3.3 Wymagania dotyczące biblioteki IronPDF

IronPDF, biblioteka języka Python, opiera się głównie na platformie .NET 6.0. W związku z tym, aby korzystać z IronPDF for Python, na komputerze musi być zainstalowane środowisko uruchomieniowe .NET 6.0. Aby użytkownicy systemów Linux i Mac mogli korzystać z tego modułu Python, może być konieczne zainstalowanie platformy .NET. Wymagane środowisko uruchomieniowe można pobrać ze strony internetowej .NET.

3.4 Konfiguracja biblioteki IronPDF

Pakiet 'IronPDF' musi być zainstalowany, aby tworzyć, edytować i otwierać pliki z rozszerzeniem ".pdf". Aby zainstalować pakiet w PyCharm, otwórz okno terminala i wpisz następujące polecenie:

pip install ironpdf

Zrzut ekranu poniżej pokazuje konfigurację pakietu 'IronPDF'.

Jak analizować plik PDF w Pythonie, Rysunek 4: Terminal pokazujący instalację IronPDF za pomocą pip Terminal pokazujący instalację IronPDF za pomocą pip

4.0 Analiza plików PDF za pomocą IronPDF

Dzięki bibliotekom IronPDF możliwe jest wyodrębnianie tekstu z plików PDF. IronPDF oferuje różne techniki ekstrakcji tekstu. Pierwsze podejście polega na pobraniu całej zawartości strony jako pojedynczego ciągu znaków. Drugie podejście polega na czytaniu treści strona po stronie, zaczynając od pierwszej strony. Poniższy fragment kodu ilustruje wzorzec sprawdzania bieżących plików PDF przy użyciu IronPDF.

Dostępne są dwie metody pobierania danych z pliku PDF:

  1. Pobieranie danych z pliku PDF strona po stronie.
  2. Wyodrębnianie całego pliku PDF jako tekstu.

Poniżej znajduje się plik PDF, którego będziemy używać w tym artykułe. Dokument składa się z dwóch stron.

Jak analizować plik PDF w Pythonie, Rysunek 5: PDF z numerem strony na górze każdej strony Plik PDF z numerem strony u góry każdej strony

4.0.1 WYCIĄGANIE TEKSTU Z POJEDYNCZYCH STRON

Poniższy przykładowy kod pokazuje, jak wykorzystać numer strony do pobrania danych z pliku PDF.

from ironpdf import PdfDocument

# Open a PDF file and create a PDF document object
pdfDocument = PdfDocument.FromFile("F:\\PDF\\1.pdf")

# Extract text from the first page (index 0)
AllText = pdfDocument.ExtractTextFromPage(0)

# Print the extracted text from the first page
print(AllText)
Python

Fragment kodu demonstruje użycie funkcji FromFile do odczytania pliku PDF i stworzenia obiektu dokumentu PDF. Ten obiekt umożliwia dostęp do tekstów i obrazów zawartych w pliku PDF. Aby wyodrębnić tekst z konkretnej strony, można użyć metody ExtractTextFromPage, podając numer strony jako parametr. Ta metoda zwróci ciąg znaków zawierający wszystkie słowa na określonej stronie. Wynik zostanie wyświetlony w sposób przedstawiony poniżej.

How to Parse A PDF File in Python, Figure 6: A screenshot of the terminal with text output "Page 1" Zrzut ekranu terminala z tekstem "Strona 1"

Pudełko prostokątne zaznaczone w wyniku to dane wyodrębniony tekst z pliku PDF na stronie nr 1, której indeks wynosi 0.

4.0.2 FRAGMENT ZE WSZYSTKICH STRON

Pierwsze podejście do szybkiego i łatwego uzyskania całej zawartości pliku PDF w postaci ciągu znaków przedstawiono w poniższym przykładzie kodu.

from ironpdf import PdfDocument

# Create a PDF file object from the file path
pdf = PdfDocument.FromFile('F:\\PDF\\1.pdf')

# Extract all text from the entire PDF
all_text = pdf.ExtractAllText()

# Print the extracted text from the entire PDF
print(all_text)
Python

Powyższy przykład kodu pokazuje, jak odczytać PDF z istniejącej ścieżki pliku i przekształcić go w obiekt pliku PDF za pomocą funkcji FromFile. Prosty tekst PDF zostanie wyodrębniony i zamieniony na ciąg znaków przy użyciu funkcji ExtractAllText obiektu, a wyodrębniony tekst zostanie wydrukowany w terminalu. Wynik zostanie wyświetlony w sposób przedstawiony poniżej.

How to Parse A PDF File in Python, Figure 7: A screenshot of the terminal with text output "Page 1", and "Page 2" Zrzut ekranu terminala z tekstem "Strona 1" i "Strona 2"

Prostokątne ramki, które są podświetlone w wyniku, zawierają dane wyodrębnione ze wszystkich stron pliku PDF.

Jesteśmy w stanie tworzyć pliki PDF przy użyciu języka C# z pomocą biblioteki IronPDF. Aby dowiedzieć się więcej o IronPDF, odwiedź stronę internetową IronPDF.

5.0 Podsumowanie

Aby zminimalizować ryzyko i zapewnić ochronę danych, biblioteka IronPDF zapewnia solidne zabezpieczenia. Jest kompatybilny ze wszystkimi powszechnie używanymi przeglądarkami i nie jest ograniczony do żadnej z nich. IronPDF umożliwia programistom łatwe tworzenie i odczytywanie plików PDF za pomocą zaledwie kilku linii kodu. Aby zaspokoić różnorodne potrzeby programistów, biblioteka IronPDF oferuje szereg opcji licencyjnych, w tym bezpłatną licencję dla programistów oraz dodatkowe licencje programistyczne dostępne w sprzedaży.

Pakiet $999 Lite zawiera licencję wieczystą, 30-dniową gwarancję zwrotu pieniędzy, rok wsparcia dla oprogramowania i możliwości aktualizacji. Poza kosztem pierwszego zakupu nie ma żadnych dodatkowych opłat. Środowiska produkcyjne, testowe i programistyczne korzystają z tych licencji. IronPDF oferuje również bezpłatne licencje z niewielkimi ograniczeniami czasowymi i dotyczącymi redystrybucji. W trakcie bezpłatnego okresu próbnego użytkownicy mogą przetestować produkt w rzeczywistych warunkach użytkowania bez znaku wodnego. Aby uzyskać więcej informacji na temat kosztów i licencji wersji próbnej IronPDF, odwiedź stronę licencyjną IronPDF.

Curtis Chau
Autor tekstów technicznych

Curtis Chau posiada tytuł licencjata z informatyki (Uniwersytet Carleton) i specjalizuje się w front-endowym rozwoju, z ekspertką w Node.js, TypeScript, JavaScript i React. Pasjonuje się tworzeniem intuicyjnych i estetycznie przyjemnych interfejsów użytkownika, Curtis cieszy się pracą z nowoczesnymi frameworkami i tworzeniem dobrze zorganizowanych, atrakcyjnych wizualnie podręczników.

...
Czytaj więcej

Powiązane artykuły

Key in blue circle

Uzyskaj natychmiast swój darmowy 30-dniowy Klucz Testowy.

Brak ograniczeń. 100% dostępności. Bez karty kredytowej.

bullet_checkedNie wymaga karty kredytowej ani tworzenia kontaBrak ograniczeń. 100% dostępności. Bez karty kredytowej.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Zarezerwuj swoje darmowe Demo na żywo
Booking Badge

Zaufane przez miliony inżynierów na całym świecie

Logotypy klientów Iron Software
Otrzymaj swoje Konsultacja Bez Zobowiązań
Wypełnij poniższy formularz lub wyślij e-mail na sales@ironsoftware.com
Twoje dane zawsze będą utrzymywane w tajemnicy.
Zaufane przez miliony inżynierów na całym świecie
Logotypy klientów Iron Software
Otrzymaj swój darmowy Klucz Próbny na 30 dni natychmiast.
Nie wymaga karty kredytowej ani tworzenia konta