
Jak wyodrębniać dane z PDF w Java
W tym samouczku dowiesz się, jak używać IronPDF dla Java do wyodrębniania danych z pliku PDF. Konfiguracja środowiska, import biblioteki, odczyt pliku wejściowego i wyodrębnianie potrzebnych danych są wyjaśnione na przykładach kodu.
2. Biblioteka IronPDF Java PDF
IronPDF to biblioteka oprogramowania, która zapewnia programistom możliwość generowania, edytowania i wyodrębniania danych z plików PDF przy użyciu IronPDF for Java w ramach ich aplikacji Java. Umożliwia tworzenie plików PDF z dokumentów HTML, obrazów i innych materiałów, a także łączenie wielu plików PDF, dzielenie plików PDF oraz edycję istniejących plików PDF. IronPDF oferuje również możliwość zabezpieczenia plików PDF za pomocą funkcji ochrony hasłem oraz dodawania do nich podpisów cyfrowych, a także wiele innych funkcji.
IronPDF for Java jest tworzony i utrzymywany przez Iron Software. Jedną z jego najlepiej ocenianych funkcji jest wyodrębnianie tekstu i danych z plików PDF, a także z HTML i adresów URL.
3. Wymagania wstępne
Aby używać IronPDF do wyodrębniania danych z plików PDF, musisz spełnić następujące wymagania wstępne:
- Instalacja Javy: Upewnij się, że Java jest zainstalowana w Twoim systemie, a jej ścieżka jest ustawiona w zmiennych środowiskowych. Jeśli nie zainstalowałeś jeszcze Javy, zapoznaj się z instrukcjami na tej stronie pobierania na stronie internetowej Javy.
- Środowisko IDE dla języka Java: Zainstaluj środowisko IDE dla języka Java, takie jak Eclipse lub IntelliJ. Eclipse można pobrać z tej strony pobierania Eclipse, a IntelliJ z tej strony pobierania IntelliJ.
- Biblioteka IronPDF: Pobierz i dodaj bibliotekę IronPDF jako zależność w swoim projekcie. Odwiedź stronę z instrukcjami konfiguracji IronPDF, aby uzyskać instrukcje dotyczące konfiguracji.
- Instalacja Mavena: Przed rozpoczęciem procesu konwersji plików PDF należy zainstalować i zintegrować Maven z używanym środowiskiem IDE. Zapoznaj się z tym samouczkiem dotyczącym instalacji Maven na stronie JetBrains, aby dowiedzieć się, jak zainstalować i zintegrować Maven.
4. Instalacja IronPDF for Java
Instalacja IronPDF for Java jest łatwa i nieskomplikowana, pod warunkiem spełnienia wszystkich wymagań. W niniejszym przewodniku wykorzystamy IntelliJ IDEA firmy JetBrains do zademonstrowania instalacji i uruchomienia przykładowego kodu.
Oto, co należy zrobić:
- Otwórz IntelliJ IDEA: Uruchom JetBrains IntelliJ IDEA na swoim komputerze.
- Utwórz projekt Maven: W IntelliJ IDEA utwórz nowy projekt Maven. Zapewni to odpowiednie środowisko do instalacji IronPDF for Java.
Nowy projekt Maven w IntelliJ
- Pojawi się nowe okno. Wpisz nazwę projektu i kliknij przycisk "Zakończ".
Nadaj nazwę projektowi Maven i kliknij Zakończ
- Po kliknięciu przycisku "Zakończ" otworzy się nowy projekt z plikiem pom.xml. Zostanie to wykorzystane do dodania zależności IronPDF Java Maven.
Plik pom.xml
Dodaj następujące zależności do pliku pom.xml lub możesz pobrać plik JAR ze strony biblioteki IronPDF na Sonatype Central.
<dependency>
<groupId>com.ironsoftware</groupId>
<artifactId>ironpdf</artifactId>
<version>1.0.0</version> <!-- replace with the latest version -->
</dependency>
Po umieszczeniu zależności w pliku pom.xml, w prawym górnym rogu pliku pojawi się mała ikona.
Kliknij pływającą ikonę, aby automatycznie zainstalować zależności Maven
Zainstaluj zależności IronPDF for Java dla Maven, klikając ten przycisk. W zależności od szybkości połączenia internetowego powinno to zająć tylko kilka minut.
5. Pobieranie danych
IronPDF to biblioteka Java służąca do tworzenia, edycji i wyodrębniania danych z dokumentów PDF. Zapewnia proste API do wyodrębniania tekstu z plików PDF, adresów URL i tabel.
5.1. Pobieranie danych z dokumentów PDF
Korzystając z IronPDF for Java, można łatwo wyodrębnić dane tekstowe z dokumentów PDF. Poniżej znajduje się przykładowy kod służący do wyodrębniania danych z pliku PDF.
Plik wejściowy PDF
// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;
import java.io.IOException;
import java.nio.file.Paths;
public class Main {
public static void main(String[] args) throws IOException {
// Load the PDF document from the specified file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("business plan.pdf"));
// Extract all text from the PDF document
String text = pdf.extractAllText();
// Print the extracted text to the console
System.out.println("Text extracted from the PDF: " + text);
}
}
Kod źródłowy generuje poniższy wynik:
> Text extracted from the PDF:
>
> CRAFT-ARENA
>
> Muhammad Waleed Butt
>
> Hassan Khan
>
> ABOUT US
>
> Craft-Arena is a partnership based business that will help local crafters of Pakistan to sell their handicrafts at good prices and helps them earn a good living.
5.2. Pobieranie danych z adresów URL
IronPDF for Java konwertuje adres URL na plik PDF w czasie wykonywania i wyodrębnia z niego tekst. Ten przykład pokaże kod źródłowy służący do wyodrębniania tekstu z adresów URL.
// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;
import java.io.IOException;
public class Main {
public static void main(String[] args) throws IOException {
// Convert a URL to a PDF and load it into a PdfDocument
PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");
// Extract all text from the PDF document
String text = pdf.extractAllText();
// Print the extracted text to the console
System.out.println("Text extracted from the URLs: " + text);
}
}
Wyodrębnione dane ze stron internetowych
5.3. Wyodrębnianie danych z tabeli
Wyodrębnianie danych z tabel w pliku PDF za pomocą IronPDF for Java jest bardzo proste; Wystarczy plik PDF zawierający tabelę oraz uruchomienie poniższego kodu.
Przykładowa tabela w formacie PDF
// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;
import java.io.IOException;
import java.nio.file.Paths;
public class Main {
public static void main(String[] args) throws IOException {
// Load the PDF document from the specified file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("table.pdf"));
// Extract all text from the PDF document, including table data
String text = pdf.extractAllText();
// Print the extracted table data to the console
System.out.print("Text extracted from the Marked tables: " + text);
}
}
> Test Case Description Expected Result Actual Result Status
>
> 1 Test login functionality User should be able to log in with valid credentials
>
> User log in successfully Pass
>
> 2 Test search functionality Search results should be relevant and accurate
>
> Search is accurate and provide relevant products Pass
>
> 3 Test checkout process User should be able to complete a purchase successfully
>
> User can purchase successfully Pass
6. Podsumowanie
Podsumowując, w tym samouczku pokazano, jak wyodrębnić dane, a konkretnie dane tabelaryczne, z pliku PDF przy użyciu biblioteki IronPDF for Java.
Więcej informacji można znaleźć w przykładzie wyodrębniania tekstu z pliku PDF na stronie internetowej IronPDF.
IronPDF to biblioteka z szczegółami licencji komercyjnej, zaczynająca się od $999. Można jednak ocenić go w środowisku produkcyjnym, korzystając z bezpłatnej wersji próbnej na licencji IronPDF.

Curtis Chau posiada tytuł licencjata z informatyki (Uniwersytet Carleton) i specjalizuje się w front-endowym rozwoju, z ekspertką w Node.js, TypeScript, JavaScript i React. Pasjonuje się tworzeniem intuicyjnych i estetycznie przyjemnych interfejsów użytkownika, Curtis cieszy się pracą z nowoczesnymi frameworkami i tworzeniem dobrze zorganizowanych, atrakcyjnych wizualnie podręczników.
Powiązane artykuły


