IRONSOFTWAREHOME
IRONPDF FOR NODE.JS の使用

Node.js で PDF ドキュメントを解析する方法

Curtis Chau
Curtis Chau
Updated: 2026年6月20日

この記事では、PDF パーサー Node.js ライブラリである IronPDF を使用して Node.js で PDF を解析する方法を説明します。

ノードとは何ですか?

クロスプラットフォームのオープンソース Node.js JavaScript ランタイム環境により、JavaScript コードを Web ブラウザー外部で実行できるようになります。 プログラマーは、サーバー側の JavaScript または JS モジュールの実行を有効にすることで、スケーラブルで高速かつ効果的なネットワーク アプリケーションを作成できます。 Node.js はイベント駆動型の非ブロッキング I/O モデルであるため、インタラクティブなフォーム要素を使用して複数の接続を同時に管理するリアルタイム アプリケーションの開発に最適です。

Node.js は、Web サーバー、API、データ構造ストリーミング アプリケーション、リアルタイム チャット アプリケーション、モノのインターネット (IoT) デバイスなど、幅広いアプリケーションの作成に頻繁に使用されます。 総合的に考えると、Node.js は、その有効性、速度、フロントエンドとバックエンドの両方における JavaScript の互換性により人気が高まっており、フルスタック開発のための単一の言語を提供しています。 Node.js について詳しくは、この説明 Web サイトのドキュメント ページを参照してください。

Node.jsでPDFドキュメントを解析する方法

  1. PDF を解析して読み取り可能なストリームを作成するには、Node.js パッケージをダウンロードします。
  2. Node.js ライブラリ用の IronPDF をインストールします。
  3. 解析されたドキュメント データを使用して新しい PDF を作成するか、既存の PDF をインポートします。
  4. すべてのテキスト行を抽出するには、extractText メソッドを使用します。
  5. 解析された PDF コンテンツを表示して、生の PDF を読み取ります。

IronPDF Node.js 向け

2022 年 1 月の私の最後の知識更新の時点では、IronPDF は主に .NET Framework 内で動作するように構築された .NET ライブラリであり、開発者は C# または VB.NET を使用して PDF ドキュメントを操作できるようになりました。 しかし、Node.js 専用に作られた IronPDF のネイティブ バージョンまたは直接バージョンはありませんでした。

IronPDF は Node.js のバインディングをサポートして組み込むように拡張されたため、Node.js アプリケーションで PDF ドキュメントを作成、編集、および処理するためのツールが Node.js 用の IronPDF で利用できるようになると考えられます。

IronPDFの特長

IronPDF が製品範囲を拡張して Node.js バージョンを含めると、Node.js アプリを作成する開発者は IronPDF の PDF 操作機能を利用できるようになります。 これは、.NET 環境で IronPDF と同様の機能を提供するライブラリを使用したい開発者にとって役立つ可能性があります。

IronPDF の機能、互換性、および Node.js のサポートに関する最新の情報については、常に IronPDF チームからの公式ドキュメント、リリース ノート、またはアップデートを参照してください。 IronPDF と各リリースの新機能の詳細については、こちらをご覧ください。 IronPDF の詳細については、この公式ドキュメント ページを参照してください。

パッケージ要件

  • IDEとしてのVisual Studio Code
  • Node.js
  • パッケージのインストールに必要なパッケージ管理には、Yarn または npm を使用できます。

Node.js用のIronPDFパッケージをインストールする

コマンド プロンプトまたはターミナルを起動します。コマンド プロンプトまたはターミナルを開きます。 オペレーティング システムに応じて、さまざまなアクセス方法があります。

  • Windows: PowerShellまたはコマンドプロンプト
  • macOSのターミナル
  • Linux上のターミナル

パッケージをインストールするには、パッケージ名と npm install コマンドを使用します。 例えば、パッケージ @ironsoftware/ironpdf をインストールするには、次のコマンドをターミナルで実行してください。

npm i @ironsoftware/ironpdf

異なる場合は、インストールしたいパッケージ名で @ironsoftware/ironpdf を置換してください。

Node.jsでPDFドキュメントを解析する方法、図1:IronPDFのインストール IronPDFをインストールする

PDFファイルを解析してデータを抽出する

実験してみると、IronPDF には Node.js で PDF を扱いやすくする多くの機能が提供されていることがわかります。 必要な形式であらゆる PDF ドキュメントを生成、表示、変更することに重点を置いています。 PDF ファイルの解析は非常に簡単です。

const { PdfDocument } = require("@ironsoftware/ironpdf");

const pdfProcess = async () => {
  // Load the existing PDF document
  const pdf = await PdfDocument.fromFile("Demo.pdf");
  // Extract text data from the loaded PDF
  const data = await pdf.extractText();
  // Output the extracted text to the console
  console.log(data);
};

pdfProcess();
JavaScript

上記のコードで、fromFile 関数の重要性が示されています。 fromFile メソッドはPDFドキュメントを読み取り、PdfDocument オブジェクトにPDFファイルを変換し、既存のファイルシステムからファイルを読み込みます。 よって、PdfDocument はPDFのメタデータを保持します。 pdf オブジェクト内のファイル メタデータは、ユーザーの希望に応じて使用できます。 このオブジェクトが解析したドキュメントデータは、PDFページオブジェクト内に含まれるテキストとグラフィックスです。 extractText 関数は指定されたPDFファイルからすべてのテキストを抽出するために使用されます。その後、取得したテキストは文字列として保存され、JSON形式の作成などの追加処理の準備が整います。

ページごとのテキスト抽出

以下は、PDF ファイルの各ページからテキストを明示的に抽出する別のアプローチのコードです。

const pdf = await PdfDocument.fromFile("Demo.pdf");
// Get the total number of pages in the PDF
const pageCount = await pdf.getPageCount();

// Loop through each page to extract text
for (let i = 0; i < pageCount; i++) {
  const pageText = await pdf.extractText(i);
  // Output the text of each page
  console.log(pageText);
}
JavaScript

メモリ内にある既存のPDFからの生のPDF読み取りは、指定されたディレクトリからその全体を読み込み、その後 pdf という名前の PdfDocument オブジェクトを作成します。 PDF文書は、複数の基本データオブジェクト型で構成されるデータ構造です。PDFファイル内の各ページデータは、PDFオブジェクト内のページ番号またはページインデックスを使用して取得され、順番に処理されることが保証されます。 まず、そのPDFオブジェクトのgetPageCount メソッドを使用して、提供されたPDFの総ページ数を確認します。

for ループはこのページ数を使用して各ページを繰り返し、各PDFページからテキストを取得するために extractText 関数を呼び出します。 抽出されたテキストは、ユーザーの画面に表示することも、文字列変数に保存することもできます。 この技術により、個々の PDF ページからテキストを体系的に抽出することが可能になります。 これらの手法は、PDF タスク専用に作成された Node.js ライブラリである IronPDF を使用して、PDF ファイルからテキストを簡単かつ徹底的に抽出する方法を示しています。 このアクセシビリティにより、さまざまなコンテキストでの PDF の有用性が向上し、数多くの実用的なアプリケーションが実現します。

Node.jsでPDFドキュメントを解析する方法、図2:ページごとにPDFを読む PDFをページごとに読む

上記の両方のコードは同じ出力を実現しますが、唯一の違いはユーザーの要件に基づいたコードの実装にあります。 IronPDF の詳細については、この詳細なドキュメント ページを参照してください。

結論

IronPDF ライブラリは、リスクを軽減し、データのセキュリティを確保するための強力なセキュリティ対策を提供します。 すべての一般的なブラウザと互換性があり、いずれかのブラウザに限定されません。 開発者のさまざまな要求に応えるため、ライブラリでは、無料の開発者ライセンスや購入可能な追加の開発ライセンスなど、幅広いライセンス オプションを提供しています。

永久ライセンスに加えて、1年間のソフトウェアメンテナンス、および30日間の返金保証に加え、$999 Liteバンドルにはアップグレードの可能性が含まれています。 ユーザーは、透かし入りの試用期間中、実際のアプリケーション状況で製品を評価する機会があります。 IronPDF のコスト、ライセンス、試用版の詳細については、提供されているライセンス ページを確認してください。 Iron Software が提供するその他の製品については、公式 Web サイトをご覧ください。

Iron Softwareの価格

Curtis Chau
テクニカルライター

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。

...
詳しく読む

関連する記事

Key in blue circle

無料の30日間トライアルキーをすぐに入手してください。

Your trial license will be sent to your email address

制限なし。100% ロック解除済み。クレジットカード不要。

bullet_checkedクレジットカードやアカウントの作成は不要です。制限なし。100% ロック解除済み。クレジットカード不要。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
無料のライブデモを予約する
Booking Badge

世界中の数百万人のエンジニアから信頼されています。

ライセンスはより安く
義務のない相談を受ける
下記のフォームを記入するか、sales@ironsoftware.comにメールしてください。
あなたの詳細は常に守秘されます。
世界中の数百万人のエンジニアから信頼されています。
ライセンスはより安く
あなたの無料30日間の試用キーをすぐに入手。
クレジットカードやアカウントの作成は不要です。