
Jak wyodrębnić obraz z pliku PDF w Javie
W tym artykułe omówimy, jak wyodrębnić obrazy z istniejącego dokumentu PDF i zapisać je w jednym folderze przy użyciu języka programowania Java. W tym celu do wyodrębniania obrazów wykorzystywana jest biblioteka IronPDF for Java.
Jak wyodrębnić obraz z pliku PDF w Javie
- Zainstaluj bibliotekę Java, aby wyodrębnić obrazy z plików PDF
- Załaduj plik PDF lub renderuj z adresu URL
- Użyj metody
extractAllImages,aby wyodrębnić obrazy - Zapisywanie wyodrębnionych obrazów do plików lub strumieni w Javie
- Sprawdź wyodrębnione obrazy w podanym katalogu
Biblioteka IronPDF Java PDF
IronPDF to biblioteka Java zaprojektowana, aby pomóc programistom w generowaniu, modyfikowaniu i wyciąganiu danych z plików PDF w ramach ich aplikacji Java. Dzięki IronPDF możesz tworzyć dokumenty PDF z różnych źródeł, takich jak HTML, obrazy i inne. Dodatkowo masz możliwość łączenia, dzielenia i edytowania istniejących plików PDF. IronPDF zawiera również funkcje bezpieczeństwa, takie jak ochrona hasłem i podpisy cyfrowe.
Opracowany i utrzymywany przez Iron Software, IronPDF jest znany ze swojej zdolności do wyodrębniania tekstu z plików PDF, HTML i adresów URL. To sprawia, że jest to wszechstronne i potężne narzędzie do różnych zastosowań, niezależnie od tego, czy tworzysz pliki PDF od podstaw, czy pracujesz z już istniejącymi.
Wymagania wstępne
Przed użyciem IronPDF do wyodrębniania danych z pliku PDF należy spełnić kilka warunków wstępnych:
- Instalacja Javy: Upewnij się, że Java jest zainstalowana w Twoim systemie i że jej ścieżka została ustawiona w zmiennych środowiskowych. Jeśli nie zainstalowałeś jeszcze Javy, postępuj zgodnie z instrukcjami na poniższej stronie pobierania ze strony internetowej Javy.
- Środowisko IDE dla języka Java: Zainstaluj Eclipse lub IntelliJ jako swoje środowisko IDE dla języka Java. Eclipse można pobrać z tego linku, a IntelliJ z tej strony pobierania.
- Biblioteka IronPDF: Pobierz i dodaj bibliotekę IronPDF do swojego projektu jako zależność. Instrukcje dotyczące konfiguracji można znaleźć na stronie internetowej IronPDF.
- Instalacja Mavena: Przed rozpoczęciem procesu konwersji plików PDF upewnij się, że Maven jest zainstalowany i zintegrowany z Twoim środowiskiem IDE. Aby uzyskać pomoc w instalacji i integracji Mavena, skorzystaj z samouczka zawartego w poniższym przewodniku firmy JetBrains.
Instalacja IronPDF for Java
Instalacja IronPDF for Java jest prosta, o ile spełnione są wszystkie wymagania. W niniejszym przewodniku wykorzystamy JetBrains IntelliJ IDEA do zademonstrowania instalacji i uruchomienia przykładowego kodu.
-
Uruchom IntelliJ IDEA: Otwórz JetBrains IntelliJ IDEA na swoim komputerze.
-
Utwórz projekt Maven: W IntelliJ IDEA utwórz nowy projekt Maven. Zapewni to odpowiednie środowisko do instalacji IronPDF for Java.
Utwórz nowy projekt Maven
Pojawi się nowe okno. Wpisz nazwę projektu i kliknij przycisk "Zakończ".
Wpisz nazwę projektu
Po kliknięciu Zakończ, nowy projekt otworzy się na plik pom.xml, aby dodać zależności Maven IronPDF for Java.
Następnie dodaj następujące zależności w pliku pom.xml lub możesz pobrać plik JAR z poniższego repozytorium Maven.
<dependency>
<groupId>com.ironsoftware</groupId>
<artifactId>ironpdf</artifactId>
<version>YOUR_VERSION_HERE</version>
</dependency>
Gdy umieścisz zależności w pliku pom.xml, w prawym górnym rogu pliku pojawi się mała ikona.
Plik pom.xml z małą ikoną do instalacji zależności
Kliknij tę ikonę, aby zainstalować zależności Maven dla IronPDF for Java. W zależności od szybkości połączenia internetowego zajmie to tylko kilka minut.
Wyodrębnij obrazy
Możesz wyodrębnić obrazy z dokumentu PDF za pomocą IronPDF za pomocą jednej metody o nazwie extractAllImages. Ta metoda zwraca wszystkie dostępne obrazy w pliku PDF. Następnie możesz zapisać wszystkie wyodrębnione obrazy w ścieżce plików według własnego wyboru, używając metody ImageIO.write, podając ścieżkę i format obrazu wyjściowego.
5.1. Wyodrębnianie obrazów z dokumentu PDF
W poniższym przykładzie obrazy z dokumentu PDF zostaną wyodrębnione i zapisane w systemie plików jako obrazy PNG.
import com.ironsoftware.ironpdf.PdfDocument;
import javax.imageio.ImageIO;
import java.awt.image.BufferedImage;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.util.List;
public class Main {
public static void main(String[] args) throws Exception {
// Load PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("Final Project Report Craft Arena.pdf"));
// Extract all images from the PDF document
List<BufferedImage> images = pdf.extractAllImages();
int i = 0;
// Save each extracted image to the filesystem as a PNG
for (BufferedImage image : images) {
ImageIO.write(image, "PNG", Files.newOutputStream(Paths.get("image" + ++i + ".png")));
}
}
}
Program powyżej otwiera plik "Final Project Report Craft Arena.pdf" i używa metody extractAllImages do wyodrębnienia wszystkich obrazów w pliku do listy obiektów BufferedImage. Następnie zapisuje każdy nowy obraz pliku w osobnych plikach PNG o unikalnej nazwie.
Wyodrębnianie obrazów z plików PDF
Wyodrębnianie obrazów z adresów URL
W tej sekcji omówimy, jak wyodrębniać obrazy bezpośrednio z adresów URL. W poniższym kodzie adres URL jest konwertowany na stronę PDF, a następnie za pomocą przełącznika nawigacyjnego wyodrębniane są obrazy z pliku PDF.
import com.ironsoftware.ironpdf.PdfDocument;
import javax.imageio.ImageIO;
import java.awt.image.BufferedImage;
import java.io.IOException;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.util.List;
public class Main {
public static void main(String[] args) throws IOException {
// Render PDF from a URL
PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://www.amazon.com/?tag=hp2-brobookmark-us-20");
// Extract all images from the rendered PDF document
List<BufferedImage> images = pdf.extractAllImages();
int i = 0;
// Save each extracted image to the filesystem as a PNG
for (BufferedImage image : images) {
ImageIO.write(image, "PNG", Files.newOutputStream(Paths.get("image" + ++i + ".png")));
}
}
}
W powyższym kodzie jako dane wejściowe podano adres URL strony głównej serwisu Amazon, a wynik to 74 obrazy.
Wyodrębnianie obrazów z plików PDF
Wnioski
Wyodrębnianie obrazów z dokumentu PDF można wykonać w Javie przy użyciu biblioteki IronPDF. Aby zainstalować IronPDF, musisz mieć zainstalowane i zintegrowane z projektem środowisko Java, IDE Java (Eclipse lub IntelliJ), Maven oraz bibliotekę IronPDF. Proces wyodrębniania obrazów z dokumentu PDF za pomocą IronPDF jest prosty i wymaga tylko jednego wywołania metody do extractAllImages. Następnie możesz zapisać obrazy w ścieżce plików według własnego wyboru, używając metody ImageIO.write.
W tym artykułe znajdziesz szczegółowy przewodnik, jak wyodrębnić obrazy z dokumentu PDF przy użyciu Javy i biblioteki IronPDF. Więcej szczegółów, w tym informacje o tym, jak wyodrębnić tekst z plików PDF, można znaleźć w przykładowym kodzie wyodrębniania tekstu.
IronPDF to biblioteka z licencją komercyjną, zaczynającą się od $999. Można jednak przetestować go w środowisku produkcyjnym, korzystając z bezpłatnej wersji próbnej.

Curtis Chau posiada tytuł licencjata z informatyki (Uniwersytet Carleton) i specjalizuje się w front-endowym rozwoju, z ekspertką w Node.js, TypeScript, JavaScript i React. Pasjonuje się tworzeniem intuicyjnych i estetycznie przyjemnych interfejsów użytkownika, Curtis cieszy się pracą z nowoczesnymi frameworkami i tworzeniem dobrze zorganizowanych, atrakcyjnych wizualnie podręczników.
Powiązane artykuły


