IRONSOFTWAREHOME
USING IRONPDF FOR JAVA

如何在 Java 中解析 PDF(開發人員教程)

Curtis Chau
Curtis Chau
Updated: 2026年4月21日

這篇文章將使用IronPDF程式庫以高效的方法在Java中建立一個PDF解析器。

IronPDF - Java PDF程式庫

IronPDF for Java 是一個Java PDF程式庫,它能夠輕鬆且準確地建立、閱讀和操作PDF文件。 它建立在IronPDF for .NET的成功之上,並提供跨不同平台的高效功能。 IronPDF for Java利用IronPdfEngine,該引擎速度快且為性能優化。

使用IronPDF,您可以從PDF文件提取文字和圖像,並且還可以從包括HTML字串、文件、URL和圖像在內的各種來源建立PDF。 此外,您還可以輕鬆地新增新內容,使用IronPDF插入簽名,並將元資料嵌入PDF文件中。 IronPDF專為Java 8+、Scala和Kotlin設計,並相容於Windows、Linux和Cloud平台。

在Java程式中使用IronPDF建立PDF文件解析器

先決條件

要在Java中製作PDF解析專案,您將需要以下工具:

  1. **Java IDE:**您可以使用任何支援Java的IDE。目前有多種Java IDE可供開發使用。 這裡這篇教程將使用IntelliJ IDE。 您可以使用NetBeans、Eclipse等。

  2. **Maven專案:**Maven是一個依賴管理工具,可控制Java專案。 Java的Maven可以從Maven官方網站下載。 IntelliJ Java IDE內建支援Maven。

  3. IronPDF - 您可以透過多種方式下載和安裝IronPDF for Java。

    • 在Maven專案中的pom.xml文件中新增IronPDF依賴。

      <dependency>
          <groupId>com.ironsoftware</groupId>
          <artifactId>ironpdf</artifactId>
          <version>[LATEST_VERSION]</version>
      </dependency>
      XML
    • 造訪Maven儲存庫網站以獲取最新的Java IronPDF包。

    • 從Iron Software 官方下載頁面直接下載。

    • 在您的簡單Java應用程式中手動安裝IronPDF JAR文件。

  4. **Slf4j-Simple:**此依賴性也需要來將內容印到現有文件。 它可以使用IntelliJ中的Maven依賴管理器新增,也可以直接從Maven網站下載。將以下依賴新增到pom.xml文件中:

    <dependency>
        <groupId>org.slf4j</groupId>
        <artifactId>slf4j-simple</artifactId>
        <version>2.0.5</version>
    </dependency>
    XML

新增必要的導入

安裝所有先決條件後,第一步是導入必要的IronPDF包以處理PDF文件。 在Main.java文件的頂部新增以下程式碼:

import com.ironsoftware.ironpdf.*;
import java.io.IOException;
import java.nio.file.Paths;
Java

授權金鑰

IronPDF中的某些方法需要授權才能使用。 您可以購買授權或在免費試用中免費試用IronPDF。 您可以按以下方式設置金鑰:

License.setLicenseKey("YOUR-KEY");
Java

步驟1:解析現有的PDF文件

為了解析現有文件以提取內容,使用PdfDocument類。 它的靜態[fromFile](/java/object-reference/api/com/ironsoftware/ironpdf/PdfDocument.html#fromFile(java.nio.file.Path)方法用於在Java程式中從特定路徑含有特定文件名解析PDF文件。 程式碼如下:

PdfDocument parsedDocument = PdfDocument.fromFile(Paths.get("sample.pdf"));
Java

How to Parse PDF in Java (Developer Tutorial), Figure 1: Parsed document Parsed document

步驟2:從解析的PDF文件提取文字資料

IronPDF for Java提供了一種簡單方法來從PDF文件中提取文字。 下面的程式碼片段是用來從PDF文件中提取文字的程式碼:

String extractedText = parsedDocument.extractAllText();
Java

上述程式碼生成的輸出如下:

How to Parse PDF in Java (Developer Tutorial), Figure 2: Output 輸出

步驟3:從URL或HTML字串提取文字資料

IronPDF for Java的功能不僅限於現有的PDF,它還可以建立並解析新的文件以提取內容。 這裡這篇教程將建立一個從URL生成的PDF文件並從中提取內容。 以下範例展示了如何完成此任務:

public class Main {
    public static void main(String[] args) throws IOException {
        License.setLicenseKey("YOUR-KEY");

        PdfDocument parsedDocument = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");
        String extractedText = parsedDocument.extractAllText();
        System.out.println("Text Extracted from URL:\n" + extractedText);
    }
}
Java

輸出如下:

How to Parse PDF in Java (Developer Tutorial), Figure 3: Output 輸出

步驟4:從解析的PDF文件提取圖片

IronPDF還提供了一種簡便的方法提取所有解析文件中的圖片。 這裡教程將使用前面的範例來看看如何從PDF文件中輕鬆提取圖片。

import com.ironsoftware.ironpdf.*;

import javax.imageio.ImageIO;
import java.awt.image.BufferedImage;
import java.io.IOException;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.util.List;

public class Main {
    public static void main(String[] args) throws IOException {
        License.setLicenseKey("YOUR-KEY");

        PdfDocument parsedDocument = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");

        try {
            List<BufferedImage> images = parsedDocument.extractAllImages();
            System.out.println("Number of images extracted from the website: " + images.size());

            int i = 0;
            for (BufferedImage image : images) {
                ImageIO.write(image, "PNG", Files.newOutputStream(Paths.get("assets/extracted_" + ++i + ".png")));
            }
        } catch (Exception exception) {
            System.out.println("Failed to extract images from the website");
            exception.printStackTrace();
        }
    }
}
Java

方法BufferedImages列表。 然後每個ImageIO.write儲存為PNG圖片在一個位置。 解析的PDF文件中有34張圖片,每張圖片均完美提取。

How to Parse PDF in Java (Developer Tutorial), Figure 4: Extracted images Extracted images

步驟5:從PDF文件中的表格提取資料

從PDF文件中的表格界限提取內容僅需一行程式碼即可完成,使用[extractAllText方法](/java/object-reference/api/com/ironsoftware/ironpdf/PdfDocument.html#extractAllText()。 下面的程式碼片段演示了如何從PDF文件中的表格提取文字:

How to Parse PDF in Java (Developer Tutorial), Figure 5: Table in PDF Table in PDF

PdfDocument parsedDocument = PdfDocument.fromFile(Paths.get("table.pdf"));
String extractedText = parsedDocument.extractAllText();
System.out.println(extractedText);
Java

輸出如下:

How to Parse PDF in Java (Developer Tutorial), Figure 6: Output 輸出

結論

這篇文章展示了如何解析現有的PDF文件或從URL建立新的PDF解析文件,以使用IronPDF從中提取資料。 打開文件後,它可以從PDF中提取制表資料、圖像和文字,並可以將提取的文字新增到文字文件中以便日後使用。

有關如何在Java中程式化處理PDF文件的更多詳細資訊,請造訪這些PDF文件建立範例。

IronPDF for Java程式庫可免費用於開發目的,並提供免費試用。 然而,商業使用可以透過Iron Software獲取授權,價格從$999起。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

...
閱讀更多

相關文章

Key in blue circle

立即免費取得 30 天試用金鑰。

Your trial license will be sent to your email address

無任何限制。100% 解鎖。無需信用卡。

OR
bullet_checked無需信用卡或建立帳號無任何限制。100% 解鎖。無需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
預訂您的免費 即時演示
Booking Badge

全球數百萬工程師的信任

Iron Software的客戶商標
獲取您的無義務諮詢
填寫以下表格或發送電子郵件至sales@ironsoftware.com
您的詳細資訊始終保持機密。
全球數百萬工程師的信任
Iron Software的客戶商標
立即獲取您的30天試用金鑰。
無需信用卡或帳戶建立
C# 用於PDF的NuGet程式庫
使用NuGet安裝

版本: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. 在解決方案資源管理器,右鍵點選參考,管理NuGet包
  2. 選擇瀏覽並搜尋"IronPdf"
  3. 選擇套件並安裝
C# PDF DLL
下載DLL

版本: 2026.9

或者點擊此處下載Windows安裝程式。

  1. 下載並解壓IronPDF到類似~/Libs的位置,位於您的解決方案目錄中
  2. 在Visual Studio解決方案資源管理器,右鍵點選參考。選擇瀏覽,"IronPdf.dll"

授權從$999起