IRONSOFTWAREHOME
在 JAVA 中使用 IRONPDF

如何在 Java 中读取 PDF 文件

Curtis Chau
Curtis Chau
Updated: 2026年4月21日

这篇文章将探讨如何创建一个PDF阅读器,以编程方式在您的软件应用程序中打开PDF文件。 要有效地执行此任务,IronPDF 适用于 Java 是一款有助于在Java程序中使用文件名打开和读取PDF文件的系统库。

IronPDF

IronPDF - Java Library 构建在已成功的.NET Framework之上。 与Apache PDFBox等其他类库相比,这使得IronPDF成为处理PDF文档的多功能工具。 它提供了提取和解析内容、加载文本和加载图片的功能。 它还提供了自定义PDF页面的选项,比如页面布局、边距、页眉和页脚、页面方向,等等。

除此之外,IronPDF还支持从其他文件格式转换、使用密码保护PDF、数字签名、合并和拆分PDF文档。

在Java中如何读取PDF文件

前提条件

要使用IronPDF制作Java PDF阅读器,必须确保计算机上安装了以下组件:

  1. JDK - Java开发工具包是构建和运行Java程序所需的。 如果未安装,请从Oracle网站下载。
  2. IDE - 集成开发环境是一种帮助编写、编辑和调试程序的软件。 下载任何用于Java的IDE,例如Eclipse、NetBeans、IntelliJ。
  3. Maven - Maven是一种自动化工具,帮助从中央仓库下载库。 从Apache Maven网站下载。
  4. IronPDF - 最后,需要IronPDF来在Java中读取PDF文件。 需要将该项添加为Java Maven项目中的依赖项。 在pom.xml文件中包括IronPDF工件以及slf4j依赖项,如下例所示:
<!-- Add Maven dependencies for IronPDF -->
<dependencies>
    <!-- IronPDF Dependency -->
    <dependency>
        <groupId>com.ironsoftware</groupId>
        <artifactId>ironpdf</artifactId>
        <version>your-version-here</version>
    </dependency>

    <!-- SLF4J Dependency necessary for logging -->
    <dependency>
        <groupId>org.slf4j</groupId>
        <artifactId>slf4j-api</artifactId>
        <version>1.7.32</version>
    </dependency>
</dependencies>
XML

添加必要的导入

首先,在Java源文件顶部添加以下代码,以引用来自IronPDF的所有必需方法:

import com.ironsoftware.ironpdf.*;
// Necessary imports from IronPDF library
Java

接下来,配置IronPDF并使用有效的许可证密钥以使用其方法。 在主方法中调用setLicenseKey方法。

License.setLicenseKey("Your license key");
// Set your IronPDF license key - required for full version
Java

**注意:**您可以获得一个试用许可证密钥来创建、读取和打印PDF。

在Java中读取现有的PDF文件

要读取PDF文件,必须有PDF文件,或者可以创建一个。 本文将使用已创建的PDF文件。代码简单,是从文档中提取文本的两步过程:

// Load the PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
// Extract all text from the PDF
String text = pdf.extractAllText();
// Print the extracted text
System.out.println(text);
Java

在上述代码中,fromFile打开PDF文档。 Paths.get方法获取文件目录并准备从文件中提取内容。然后,[extractAllText](/java/object-reference/api/com/ironsoftware/ironpdf/PdfDocument.html#extractAllText()读取文档中的所有文本。

输出如下:

如何在Java中读取PDF文件,图1:读取PDF文本输出 读取PDF文本输出

从特定页面读取文本

IronPDF还可以从PDF的特定页面读取内容。 PageSelection对象接受要读取文本的页面范围。

在下面的示例中,从PDF文档的第二页提取文本。 PageSelection.singlePage获取需要提取的页面的索引(索引从0开始)。

// Load the PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
// Extract text from the second page (page index based, starts at 0, so 1 means second page)
String text = pdf.extractTextFromPage(PageSelection.singlePage(1));
// Print the extracted text from the specified page
System.out.println(text);
Java

如何在Java中读取PDF文件,图2:读取PDF文本输出 读取PDF文本输出

在PageSelection类中还有其他方法可用于从各种页面提取文本,包括:firstPage、[lastPage](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#firstPage()、[pageRange](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#pageRange(int,int)和[allPages](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#allPages()。

从新生成的PDF文件读取文本

还可以从HTML文件或URL生成的新PDF文件中执行搜索文本。 下面的示例代码从URL生成PDF并从网站提取所有文本。

// Generate PDF from a URL
PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://unsplash.com/");
// Extract all text from the generated PDF
String text = pdf.extractAllText();
// Print the extracted text from the URL
System.out.println("Text extracted from the website: " + text);
Java

如何在Java中读取PDF文件,图3:从新文件中读取 从新文件读取

IronPDF还可以用于从PDF文件中提取图像。

完整代码如下:

import com.ironsoftware.ironpdf.License;
import com.ironsoftware.ironpdf.PdfDocument;
import com.ironsoftware.ironpdf.edit.PageSelection;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Set the IronPDF license key for commercial use
        License.setLicenseKey("YOUR LICENSE KEY HERE");

        // Read text from a specific page in an existing PDF
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
        String text = pdf.extractTextFromPage(PageSelection.singlePage(1));
        System.out.println(text);

        // Read all text from a PDF generated from a URL
        pdf = PdfDocument.renderUrlAsPdf("https://unsplash.com/");
        text = pdf.extractAllText();
        System.out.println("Text extracted from the website: " + text);
    }
}
Java

摘要

本文解释了如何使用IronPDF在Java中打开和读取PDF。

IronPDF可以轻松地从HTML或URL创建PDF,并从不同的文件格式进行转换。 它还帮助快速且轻松地完成PDF任务。

试用IronPDF30天免费试用,了解它在生产环境中如何为您有效工作。 探索IronPDF的商业许可证选项,起价仅为$999。

Curtis Chau
技术作家

Curtis Chau 拥有卡尔顿大学的计算机科学学士学位,专注于前端开发,精通 Node.js、TypeScript、JavaScript 和 React。他热衷于打造直观且美观的用户界面,喜欢使用现代框架并创建结构良好、视觉吸引力强的手册。

...
阅读更多

相关文章

Key in blue circle

立即获取免费的 30 天试用版密钥。

Your trial license will be sent to your email address

无任何限制。100% 解锁。无需信用卡。

OR
bullet_checked无需信用卡或创建账户无任何限制。100% 解锁。无需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
预约您的免费现场演示
Booking Badge

深受全球数百万工程师信赖

Iron Software 的客户徽标
获取您的无义务咨询
填写下面的表格或通过sales@ironsoftware.com
您的资料将始终保密。
深受全球数百万工程师信赖
Iron Software 的客户徽标
立即获取您的免费30 天试用密钥。
无需信用卡或创建账户
C# 用于 PDF 的 NuGet 库
通过 NuGet 安装

版本: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. 在解决方案资源管理器中,右键点击引用,管理 NuGet 包
  2. 选择浏览并搜索 “IronPDF”
  3. 选择包并安装
C# PDF DLL
下载 DLL

版本: 2026.9

或在此处下载 Windows 安装程序。

  1. 下载并解压 IronPDF 到您的解决方案目录中的 ~/Libs 之类的位置
  2. 在 Visual Studio 解决方案资源管理器中,右键点击引用。选择浏览,“IronPDF.dll”

$999 起