
JavaでPDFファイルを読む方法
この記事では、プログラムによってソフトウェアアプリケーション内でPDFファイルを開くためのPDFリーダーを作成する方法を探ります。 このタスクを効果的に実行するために、IronPDF for JavaはJavaプログラム内でファイル名を使用してPDFファイルを開き、読み取るのに役立つシステムライブラリの1つです。
JavaでPDFファイルを読む方法
- IronPDF for Javaライブラリをダウンロードしてください。
- 既存のPDF文書を読み込むには
fromFileメソッドを使用します。 - PDFに埋め込まれたテキストを抽出するために
extractAllTextメソッドを呼び出します。 extractTextFromPageメソッドで特定のページからテキストを抽出します。- URLからレンダリングされたPDFからテキストを取得する
IronPDF
IronPDF - Java Library は、すでに成功を収めている.NET Frameworkの上に構築されています。 これにより、IronPDFはApache PDFBoxのような他のクラスライブラリと比較して、PDFドキュメントを操作するための多用途なツールとなります。 それはコンテンツの抽出と解析、テキストの読み込み、画像の読み込みを提供します。 また、ページレイアウト、マージン、ヘッダーとフッター、ページの向きなど、PDFページをカスタマイズするためのオプションも提供しています。
これに加えて、IronPDFは他のファイル形式からの変換、パスワードによるPDF保護、デジタル署名、PDF文書の結合、分割もサポートしています。
JavaでPDFファイルを読む方法
前提条件
IronPDFを使用してJava PDFリーダーを作成するには、コンピュータに次のコンポーネントがインストールされている必要があります:
- JDK - Java Development KitはJavaプログラムの構築と実行に必要です。 インストールされていない場合は、Oracleウェブサイトからダウンロードしてください。
- IDE - Integrated Development Environmentはプログラムの作成、編集、デバッグをサポートするソフトウェアです。 Eclipse、NetBeans、IntelliJなど、Java用の任意のIDEをダウンロードしてください。
- Maven - Mavenはライブラリを中央リポジトリからダウンロードするのを助ける自動化ツールです。 Apache Maven Websiteからダウンロードしてください。
- IronPDF - 最後に、JavaでPDFファイルを読み取るためにIronPDFが必要です。 これをJava Mavenプロジェクトに依存関係として追加する必要があります。 以下の例のように、
pom.xmlファイルにIronPDFアーティファクトとslf4j依存関係を含めます。
<!-- Add Maven dependencies for IronPDF -->
<dependencies>
<!-- IronPDF Dependency -->
<dependency>
<groupId>com.ironsoftware</groupId>
<artifactId>ironpdf</artifactId>
<version>your-version-here</version>
</dependency>
<!-- SLF4J Dependency necessary for logging -->
<dependency>
<groupId>org.slf4j</groupId>
<artifactId>slf4j-api</artifactId>
<version>1.7.32</version>
</dependency>
</dependencies>
必要なインポートの追加
まず、Javaソースファイルの最初に以下のコードを追加して、IronPDFからのすべての必要なメソッドを参照してください:
import com.ironsoftware.ironpdf.*;
// Necessary imports from IronPDF library
次に、有効なライセンスキーでIronPDFを設定して、そのメソッドを使用します。 メインメソッドでsetLicenseKeyメソッドを呼び出します。
License.setLicenseKey("Your license key");
// Set your IronPDF license key - required for full version
注意: PDFを作成、読み取り、印刷するための無料試用ライセンスキーを取得できます。
既存のPDFファイルをJavaで読み取る
PDFファイルを読むには、PDFファイルが存在するか、作成する必要があります。 この記事では、すでに作成されたPDFファイルを使用します。コードはシンプルで、ドキュメントからテキストを抽出するための2ステッププロセスです:
// Load the PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
// Extract all text from the PDF
String text = pdf.extractAllText();
// Print the extracted text
System.out.println(text);
上記のコードで、fromFileはPDFドキュメントを開きます。 Paths.getメソッドはファイルのディレクトリを取得し、ファイルからコンテンツを抽出する準備を整えます。その後、[extractAllText](/java/object-reference/api/com/ironsoftware/ironpdf/PdfDocument.html#extractAllText()はドキュメント内のすべてのテキストを読み取ります。
出力は以下の通りです:
JavaでPDFファイルを読む方法 図1: PDFテキスト出力を読む PDFテキストの出力を読み取る
特定のページからテキストを読む
IronPDFはPDF内の特定のページからのコンテンツを読み取ることもできます。 PageSelectionオブジェクトを使用します。
次の例では、PDFドキュメントの2ページ目からテキストが抽出されています。 PageSelection.singlePageは、抽出が必要なページのインデックスを取得します(インデックスは0から始まります)。
// Load the PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
// Extract text from the second page (page index based, starts at 0, so 1 means second page)
String text = pdf.extractTextFromPage(PageSelection.singlePage(1));
// Print the extracted text from the specified page
System.out.println(text);
JavaでPDFファイルを読む方法 図2: PDFテキスト出力を読む PDFテキストの出力を読み取る
さまざまなページからテキストを抽出するために使用できるPageSelectionクラスの他のメソッドには、firstPage、[lastPage](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#firstPage()、[pageRange](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#pageRange(int,int)、および[allPages](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#allPages()があります。
新しく生成されたPDFファイルからテキストを読む
検索テキストはHTMLファイルまたはURLから新しく生成されたPDFファイルからも実行できます。 次のサンプルコードでは、URLからPDFを生成し、ウェブサイトからすべてのテキストを抽出します。
// Generate PDF from a URL
PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://unsplash.com/");
// Extract all text from the generated PDF
String text = pdf.extractAllText();
// Print the extracted text from the URL
System.out.println("Text extracted from the website: " + text);
JavaでPDFファイルを読む方法 図3: 新しいファイルから読み取る 新しいファイルから読む
IronPDFはPDFファイルから画像を抽出することもできます。
完全なコードは次のとおりです。
import com.ironsoftware.ironpdf.License;
import com.ironsoftware.ironpdf.PdfDocument;
import com.ironsoftware.ironpdf.edit.PageSelection;
import java.io.IOException;
import java.nio.file.Paths;
public class Main {
public static void main(String[] args) throws IOException {
// Set the IronPDF license key for commercial use
License.setLicenseKey("YOUR LICENSE KEY HERE");
// Read text from a specific page in an existing PDF
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
String text = pdf.extractTextFromPage(PageSelection.singlePage(1));
System.out.println(text);
// Read all text from a PDF generated from a URL
pdf = PdfDocument.renderUrlAsPdf("https://unsplash.com/");
text = pdf.extractAllText();
System.out.println("Text extracted from the website: " + text);
}
}
まとめ
この記事では、IronPDFを使用してJavaでPDFを開き、読む方法を説明しました。
IronPDFはHTMLやURLから簡単にPDFを作成したり、異なるファイル形式から変換したりするのに役立ちます。 それはまた、PDFタスクを迅速かつ容易に完了するのに役立ちます。
IronPDFを30日間無料で試用して、生産環境でどのように機能するかを確かめてみてください。 IronPDFの商用ライセンスオプションを調査する。それは$999からのみ始まります。

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。
関連する記事


