
Jak wyodrębnić dane z faktury z PDF w Python
W tym artykułe omówimy, jak można wyodrębnić dane tekstowe z plików PDF zawierających faktury przy użyciu biblioteki IronPDF dla Python.
Jak wyodrębnić dane z faktury z pliku PDF w języku Python
- Zainstaluj bibliotekę Python do wyodrębniania danych z faktur w formacie PDF.
- Użyj metody
PdfDocument.FromFile, aby otworzyć plik PDF. - Wyciągnij wszystkie dane z faktury za pomocą metody
ExtractAllText. - Użyj metody
print, aby wydrukować wszystkie wyciągnięte dane z faktury. - Wyodrębnij określone dane z danych faktury.
1. IronPDF
IronPDF for Python to solidna biblioteka wykorzystująca język Python, która służy jako pomost między aplikacjami w Pythonie a dokumentami PDF. To wszechstronne narzędzie zapewnia programistom możliwość łatwego tworzenia, edycji i pracy z plikami PDF w ramach projektów w języku Python. Oto kilka wyróżniających się funkcji, które sprawiają, że IronPDF jest cennym narzędziem:
- Generowanie plików PDF: IronPDF umożliwia dynamiczne generowanie plików PDF od podstaw, pozwalając programistom na programowe tworzenie plików PDF z niestandardową treścią, stylem i układem.
- Konwersja HTML do PDF: Umożliwia konwersję treści HTML, w tym stron internetowych, do wysokiej jakości plików PDF, zachowując układ i styl oryginalnego kodu HTML, co jest szczególnie przydatne przy generowaniu raportów i dokumentacji.
- Edycja plików PDF: Programiści mogą z łatwością edytować istniejące pliki PDF, dodając, modyfikując lub usuwając tekst, obrazy i elementy interaktywne, co czyni to narzędzie potężnym narzędziem do manipulacji dokumentami.
- Łączenie i dzielenie plików PDF: IronPDF pozwala na połączenie wielu dokumentów PDF w jeden plik lub podzielenie pliku PDF na wiele plików, zapewniając elastyczność w zarządzaniu dużymi zbiorami plików PDF.
- Formularze PDF: Obsługuje tworzenie i wypełnianie interaktywnych formularzy PDF, dzięki czemu idealnie nadaje się do aplikacji wymagających wprowadzania danych przez użytkownika i gromadzenia danych.
- Podpisy cyfrowe: Możesz dodawać podpisy cyfrowe do dokumentów PDF, zapewniając integralność i autentyczność plików, co ma kluczowe znaczenie z punktu widzenia prawa i bezpieczeństwa.
- Pobieranie danych z plików PDF: IronPDF oferuje funkcje pobierania danych, które pozwalają chronić informacje zawarte w plikach PDF.
2. Konfiguracja środowiska
Konfiguracja środowiska dla IronPDF w języku Python wymaga wykonania kilku kroków, aby zapewnić efektywne korzystanie z biblioteki. Oto przewodnik krok po kroku:
- Utwórz nowy projekt w języku Python w PyCharm i stwórz środowisko wirtualne lub skorzystaj z istniejącego interpretera.
- Zainstaluj IronPDF za pomocą terminala wiersza poleceń, uruchamiając w nim następujące polecenie:
Instalacja IronPDF z wiersza poleceń
3. Pobieranie danych z faktury za pomocą IronPDF
W tej sekcji zobaczymy, jak wyodrębnić dane z formatu faktury i formatu wyjściowego przy użyciu biblioteki IronPDF dla języka Python. Poniższy kod wyodrębni wszystkie dane z faktury i PRINTuje je w konsoli.
Przykładowa faktura
Przykładowa faktura
from ironpdf import PdfDocument
# Load the PDF using the PdfDocument.FromFile method
pdf = PdfDocument.FromFile("INV_2022_00001.pdf")
# Extract all text from the PDF
all_text = pdf.ExtractAllText()
# Print the extracted text
print(all_text)
Powyższy kod ładuje określony plik PDF o nazwie "INV_2022_00001.pdf" za pomocą metody PdfDocument.FromFile. Następnie wyodrębnia całą zawartość tekstową z załadowanego dokumentu PDF i zapisuje ją w zmiennej all_text. Na koniec, wyodrębniony tekst jest drukowany na konsoli za pomocą funkcji print. Zasadniczo kod ten automatyzuje proces wyodrębniania ustrukturyzowanych i nieustrukturyzowanych danych tekstowych z pliku PDF, udostępniając je do dalszego przetwarzania lub analizy w środowisku Python.
3.1. Wynik
Tekst z faktury wyświetlany w konsoli
4. Wyodrębnianie określonych danych z faktury
Wykorzystanie IronPDF do wyodrębniania danych z faktur jest dość prostym procesem. Wyodrębnianie danych, takich jak numer faktury i kwota z danych faktury PDF, może być trudnym procesem, ale używając IronPDF w połączeniu z biblioteką open-source Python re, można tego dokonać. Poniższy kod wyodrębni określone dane z faktur w formacie PDF i PRINTuje je w konsoli.
from ironpdf import PdfDocument
import re
# Define regex patterns to find invoice number and amount
invoice_number_pattern = r"Invoice\s+(INV/\d{4}/\d{5})"
amount_pattern = r"Total\s+\$\s*([\d,.]+(?:\.\d{2})?)"
# Load the PDF using the PdfDocument.FromFile method
pdf = PdfDocument.FromFile("INV_2022_00001.pdf")
# Extract all text from the PDF
all_text = pdf.ExtractAllText()
# Search for the invoice number and amount in text
invoice_number_match = re.search(invoice_number_pattern, all_text)
amount_match = re.search(amount_pattern, all_text)
# Extract the matching groups if matches are found
invoice_number = invoice_number_match.group(1) if invoice_number_match else "Not found"
amount = amount_match.group(1) if amount_match else "Not found"
# Print the extracted data
print('Invoice Number: ' + invoice_number + '\nAmount: $' + amount)
Ten fragment kodu wykorzystuje język Python i bibliotekę IronPDF do wyodrębniania danych z dokumentu PDF. Zaczyna się od zaimportowania niezbędnych bibliotek i zdefiniowania wzorców wyrażeń regularnych do identyfikacji numeru faktury i kwoty całkowitej w treści tekstowej pliku PDF. Następnie kod ładuje docelowy plik PDF, wyodrębnia cały jego tekst i przystępuje do wyszukiwania dopasowań do zdefiniowanych wzorców.
Jeśli zostaną znalezione pasujące wyniki, zapisuje odpowiednie wartości dla numeru faktury i kwoty; w przeciwnym razie zwraca komunikat "Nie znaleziono". Na koniec skrypt PRINTuje na konsoli wyodrębniony numer faktury i kwotę, zapewniając usprawniony sposób automatyzacji wyodrębniania określonych danych z dokumentów PDF, co jest zadaniem często spotykanym w różnych aplikacjach do przetwarzania danych i księgowości.
4.1. Wynik
Tekst docelowy
5. Podsumowanie
W dzisiejszym dynamicznym świecie biznesu Python stanowi potężnego sprzymierzeńca dla organizacji pragnących usprawnić swoje operacje finansowe poprzez automatyzację procesu pozyskiwania kluczowych danych z faktur w formacie PDF. Wykorzystując możliwości języka Python i bibliotekę IronPDF, firmy mogą znacznie ograniczyć ręczne wprowadzanie danych, zmniejszyć liczbę błędów, zaoszczędzić czas i zwiększyć ogólną wydajność procesu księgowego związanego z zarządzaniem fakturami. IronPDF, dzięki swoim wszechstronnym funkcjom, takim jak generowanie plików PDF, konwersja HTML do PDF, edycja plików PDF, scałanie, dzielenie, obsługa formularzy, podpisy cyfrowe i dokładne wyodrębnianie danych, staje się potężnym narzędziem do realizacji tych zadań.
Postępując zgodnie z prostymi procedurami konfiguracyjnymi, programiści Python mogą szybko zintegrować IronPDF ze swoimi projektami, rewolucjonizując procesy przetwarzania faktur i sprawiając, że pozyskiwanie danych z faktur stanie się płynnym i wydajnym procesem. Przykładowy kod dotyczący pozyskiwania danych przy użyciu IronPDF można znaleźć w szczegółowym przykładzie kodu. Pełny samouczek dotyczący pozyskiwania danych przy użyciu IronPDF for Python jest dostępny w poniższym samouczku dotyczącym języka Python, a w przypadku pozyskiwania faktur przy użyciu języka C# — w samouczku dotyczącym IronOCR.

Curtis Chau posiada tytuł licencjata z informatyki (Uniwersytet Carleton) i specjalizuje się w front-endowym rozwoju, z ekspertką w Node.js, TypeScript, JavaScript i React. Pasjonuje się tworzeniem intuicyjnych i estetycznie przyjemnych interfejsów użytkownika, Curtis cieszy się pracą z nowoczesnymi frameworkami i tworzeniem dobrze zorganizowanych, atrakcyjnych wizualnie podręczników.
Powiązane artykuły


