IRONSOFTWAREHOME
在 JAVA 中使用 IRONPDF

如何在 Java 中解析 PDF (开发人员教程)

Curtis Chau
Curtis Chau
Updated: 2026年4月21日

本文将使用IronPDF库以高效的方法在Java中创建一个PDF解析器。

IronPDF - Java PDF 库

IronPDF 适用于 Java是一个Java PDF库,可以轻松准确地创建、读取和操作PDF文档。 它建立在IronPDF for .NET的成功基础上,并在不同平台上提供高效的功能。 IronPDF for Java利用IronPdfEngine,速度快且性能优化。

使用IronPDF,您可以从PDF文件中提取文本和图像,还可以从各种来源创建PDF,包括HTML字符串、文件、URL和图像。 此外,您还可以轻松添加新内容,插入IronPDF签名,并将元数据嵌入PDF文档。 IronPDF专为Java 8+,Scala和Kotlin设计,并且兼容Windows、Linux和云平台。

使用Java程序中的IronPDF创建PDF文件解析器

前提条件

要在Java中制作一个PDF解析项目,您将需要以下工具:

  1. **Java IDE:**您可以使用任何支持 Java 的 IDE。目前有多种 Java IDE 可用于开发。 本教程将使用IntelliJ IDE。 你可以使用 NetBeans、Eclipse 等等。
  2. Maven 项目: Maven 是一个依赖管理器,可以控制 Java 项目。 可以从Maven官方网站下载用于Java的Maven。 IntelliJ Java IDE内置对Maven的支持。
  3. IronPDF - 您可以通过多种方式下载并安装IronPDF 适用于 Java。
    • 在Maven项目中的pom.xml文件中添加IronPDF依赖。

      <dependency>
          <groupId>com.ironsoftware</groupId>
          <artifactId>ironpdf</artifactId>
          <version>[LATEST_VERSION]</version>
      </dependency>
      XML
    • 访问Maven存储库网站以获取最新的IronPDF for Java软件包。

  • 从Iron Software 官方下载页面直接下载。
    • 使用JAR文件在简单的Java应用程序中手动安装IronPDF。
  1. **Slf4j-Simple:**此依赖项也是将内容添加到现有文档所必需的。 可以通过IntelliJ中的Maven依赖管理器添加,或者直接从Maven网站下载。将以下依赖添加到pom.xml文件中:

    <dependency>
        <groupId>org.slf4j</groupId>
        <artifactId>slf4j-simple</artifactId>
        <version>2.0.5</version>
    </dependency>
    XML

添加必要的导入

安装完所有必需组件后,第一步是导入必要的IronPDF包以处理PDF文档。 在Main.java文件顶部添加以下代码:

import com.ironsoftware.ironpdf.*;
import java.io.IOException;
import java.nio.file.Paths;
Java

许可证密钥

IronPDF 中提供的一些方法需要许可证才能使用。 您可以购买许可证或在免费试用中尝试IronPDF免费。 您可以按如下所示设置密钥:

License.setLicenseKey("YOUR-KEY");
Java

步骤1:解析现有的PDF文档

要解析现有文件以提取内容,使用PdfDocument类。 其静态[fromFile](/java/object-reference/api/com/ironsoftware/ironpdf/PdfDocument.html#fromFile(java.nio.file.Path)方法用于从特定路径解析Java程序中的PDF文件。 代码如下:

PdfDocument parsedDocument = PdfDocument.fromFile(Paths.get("sample.pdf"));
Java

如何在Java中解析PDF(开发者教程),图1:解析后的文档 已解析文档

步骤2:从解析好的PDF文件中提取文本数据

IronPDF for Java提供了一种简单方法来从PDF文档中提取文本。 以下是用于从PDF文件中提取文本数据的代码片段如下:

String extractedText = parsedDocument.extractAllText();
Java

上述代码生成的输出如下所示:

如何在Java中解析PDF(开发者教程),图2:输出 输出

步骤3:从URL或HTML字符串中提取文本数据

IronPDF for Java的功能不仅限于现有的PDF,它还可以创建并解析新文件以提取内容。 本教程将在这里从URL中创建PDF文件并从中提取内容。 以下示例显示如何实现此任务:

public class Main {
    public static void main(String[] args) throws IOException {
        License.setLicenseKey("YOUR-KEY");

        PdfDocument parsedDocument = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");
        String extractedText = parsedDocument.extractAllText();
        System.out.println("Text Extracted from URL:\n" + extractedText);
    }
}
Java

译文如下:

如何在Java中解析PDF(开发者教程),图3:输出 输出

步骤4:从解析好的PDF文档中提取图像

IronPDF还提供了一种简单的方法来提取已解析文档中的所有图像。 此教程将使用前面的示例来看图像如何轻松地从PDF文件中提取出来。

import com.ironsoftware.ironpdf.*;

import javax.imageio.ImageIO;
import java.awt.image.BufferedImage;
import java.io.IOException;
import java.nio.file.Files;
import java.nio.file.Paths;
import java.util.List;

public class Main {
    public static void main(String[] args) throws IOException {
        License.setLicenseKey("YOUR-KEY");

        PdfDocument parsedDocument = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");

        try {
            List<BufferedImage> images = parsedDocument.extractAllImages();
            System.out.println("Number of images extracted from the website: " + images.size());

            int i = 0;
            for (BufferedImage image : images) {
                ImageIO.write(image, "PNG", Files.newOutputStream(Paths.get("assets/extracted_" + ++i + ".png")));
            }
        } catch (Exception exception) {
            System.out.println("Failed to extract images from the website");
            exception.printStackTrace();
        }
    }
}
Java
BufferedImages的列表。 每个ImageIO.write方法存储为PNG图像。 解析的PDF文件中有34张图像,每张图像都被完美提取。

如何在Java中解析PDF(开发者教程),图4:提取的图像 提取的图像

步骤5:从PDF文件中的表格中提取数据

只需一行代码即可轻松从PDF文件的表格边界中提取内容,使用extractAllText方法。 以下代码片段展示了如何从PDF文件中的表格中提取文本:

如何在Java中解析PDF(开发者教程),图5:PDF中的表格 PDF中的表格

PdfDocument parsedDocument = PdfDocument.fromFile(Paths.get("table.pdf"));
String extractedText = parsedDocument.extractAllText();
System.out.println(extractedText);
Java

译文如下:

如何在Java中解析PDF(开发者教程),图6:输出 输出

结论

本文演示了如何在Java中使用IronPDF解析现有的PDF文档或从URL创建一个新的PDF解析器文件以从中提取数据。 打开文件后,它可以从PDF中提取表格数据、图像和文本,还可以将提取的文本添加到文本文件中以备后用。

有关如何在Java中以编程方式处理PDF文件的更多详细信息,请访问这些PDF文件创建示例。

IronPDF for Java库对于开发用途是免费的,提供免费试用。 然而,商用需要通过Iron Software获得授权,起价为$999。

Curtis Chau
技术作家

Curtis Chau 拥有卡尔顿大学的计算机科学学士学位,专注于前端开发,精通 Node.js、TypeScript、JavaScript 和 React。他热衷于打造直观且美观的用户界面,喜欢使用现代框架并创建结构良好、视觉吸引力强的手册。

...
阅读更多

相关文章

Key in blue circle

立即获取免费的 30 天试用版密钥。

Your trial license will be sent to your email address

无任何限制。100% 解锁。无需信用卡。

OR
bullet_checked无需信用卡或创建账户无任何限制。100% 解锁。无需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
预约您的免费现场演示
Booking Badge

深受全球数百万工程师信赖

Iron Software 的客户徽标
获取您的无义务咨询
填写下面的表格或通过sales@ironsoftware.com
您的资料将始终保密。
深受全球数百万工程师信赖
Iron Software 的客户徽标
立即获取您的免费30 天试用密钥。
无需信用卡或创建账户
C# 用于 PDF 的 NuGet 库
通过 NuGet 安装

版本: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. 在解决方案资源管理器中,右键点击引用,管理 NuGet 包
  2. 选择浏览并搜索 “IronPDF”
  3. 选择包并安装
C# PDF DLL
下载 DLL

版本: 2026.9

或在此处下载 Windows 安装程序。

  1. 下载并解压 IronPDF 到您的解决方案目录中的 ~/Libs 之类的位置
  2. 在 Visual Studio 解决方案资源管理器中,右键点击引用。选择浏览,“IronPDF.dll”

$999 起