IRONSOFTWAREHOME
USING IRONPDF FOR NODE.JS

如何在 Node.js 中將 PDF 轉換為文字

Curtis Chau
Curtis Chau
Updated: 2026年4月21日

在Node.js中,PDF轉換為文字在許多應用程式中是一項常見任務,尤其是處理資料分析、內容管理系統或甚至是簡單的轉換工具時。 在Node.js環境和IronPDF程式庫的支持下,開發者可以輕鬆地將PDF文件轉換為可用的文字資料。 本教程旨在指導初學者如何使用IronPDF設置Node.js專案,以從PDF頁面文件中提取文字,並針對安裝細節、PDF解析實現、錯誤處理和實際應用等關鍵方面進行重點介紹。

如何在Node.js中將PDF轉換為文字

  1. 在您的IDE中建立一個Node.js應用程式。
  2. 使用npm安裝PDF程式庫。
  3. 將PDF頁面載入應用程式中。
  4. 使用extractText方法提取文字。
  5. 使用提取的文字進行處理並返回資料。

先決條件

在開始這段旅程之前,請確保您具備以下條件:

  • 您的機器上已安裝Node.js。
  • 對JavaScript有基本瞭解。
  • 測試提取過程的PDF文件。

設置您的Node.js專案

步驟1:初始化您的Node.js應用程式

為您的專案建立一個新目錄並初始化Node.js應用程式:

mkdir pdf-to-text-node
cd pdf-to-text-node
npm init -y
SHELL

步驟2:安裝IronPDF

使用npm安裝IronPDF:

npm install ironpdf
SHELL

使用IronPDF實現PDF到文字的轉換

步驟1:導入必要的模組

import { PdfDocument } from "@ironpdf/ironpdf";
import { IronPdfGlobalConfig } from "@ironpdf/ironpdf";
import fs from "fs";
JavaScript

在這第一步中,您需要導入必要的模組。 PdfDocument和IronPdfGlobalConfig是從**@IronPDF/ironpdf包中導入的,這些對於處理PDF文件和配置IronPDF是必不可少的。 核心Node.js模組fs**也被導入用來處理文件系統操作。

步驟2:設置異步函式

(async function createPDFs() {
  // ...
})();
JavaScript

在這裡,定義了一個名為createPDFs的異步匿名函式並立即調用。 這種設置允許在函式中使用await,從而更好地處理異步操作,這在處理文件I/O和像IronPDF這樣的外部程式庫時尤其常見。

步驟3:應用授權金鑰

const IronPdfConfig = {
  licenseKey: "Your-License-Key",
};
IronPdfGlobalConfig.setConfig(IronPdfConfig);
JavaScript

在這一步中,您需要為IronPDF建立包含授權金鑰的配置物件,並使用IronPdfGlobalConfig.setConfig應用此配置。 這對於啟用IronPDF的所有功能至關重要,尤其是在使用授權版本時。

步驟4:載入PDF文件

const pdf = await PdfDocument.fromFile("old-report.pdf");
JavaScript

在這一步中,程式碼正確地使用PdfDocument類中的fromFile方法載入現有的PDF文件。 這是一個異步操作,因此使用了await。 通過指定PDF文件的路徑(在本例中為"old-report.pdf"),pdf變數成為您PDF文件的表示,完整載入並準備好進行文字提取。 這一步至關重要,因為這是PDF文件解析並準備進行任何您希望對其進行的操作(例如提取文字)。

步驟5:從PDF中提取文字

const text = await pdf.extractText();
JavaScript

在這裡,extractText方法被調用至pdf物件上。 這種異步操作會將所有文字從載入的PDF文件中提取出來,並儲存在text變數中。

步驟6:處理提取的文字

const wordCount = text.split(/\s+/).length;
console.log("Word Count:", wordCount);
JavaScript

在此步驟中,提取的文字將被處理以計算字數。 這是通過使用正則表達式將文字字串拆分為單詞陣列,該正則表達式匹配一個或多個空白字元,然後計算所得陣列的長度。

步驟7:將提取的文字儲存到文件

fs.writeFileSync("extracted_text.txt", text);
JavaScript

這行更正程式碼使用fs模組的writeFileSync方法同步地將提取的文字寫入文件。

步驟8:錯誤處理

} catch (error) {
  console.error("An error occurred:", error); // Log error
}
JavaScript

最後,程式碼包含一個try-catch塊進行錯誤處理。 如果try塊中的任何異步操作失敗,catch塊將捕獲錯誤,並將資訊記錄到控制台。 這對於除錯以及確保您的應用程式能夠優雅地處理意外問題非常重要。

完整程式碼

以下是使用IronPDF在Node.js環境下從PDF文件中提取文字的完整程式碼,涵蓋了我們討論的所有步驟:

import { PdfDocument } from "@ironpdf/ironpdf";
import { IronPdfGlobalConfig } from "@ironpdf/ironpdf";
import fs from "fs";

(async function createPDFs() {
  try {
    // Input the license key
    const IronPdfConfig = {
      licenseKey: "Your-License-Key",
    };
    // Set the config with the license key
    IronPdfGlobalConfig.setConfig(IronPdfConfig);

    // Import existing PDF document
    const pdf = await PdfDocument.fromFile("old-report.pdf");

    // Get all text to put in a search index
    const text = await pdf.extractText();

    // Process the extracted text
    // Example: Count words
    const wordCount = text.split(/\s+/).length;
    console.log("Word Count:", wordCount);

    // Save the extracted text to a text file
    fs.writeFileSync("extracted_text.txt", text);
    console.log("Extracted text saved to extracted_text.txt");
  } catch (error) {
    // Handle errors here
    console.error("An error occurred:", error);
  }
})();
JavaScript

這個腳本包括了從PDF文件中提取文字所需要的所有必要組件:使用授權金鑰設置IronPDF,載入PDF文件,提取文字,進行簡單的文字分析(例如詞數計算),並將提取的文字儲存到文件。該程式碼被封裝在一個異步函式中,以便處理Node.js中文件操作和PDF處理的異步性。

分析輸出:PDF和提取文字

一旦您運行了腳本,您將擁有兩個關鍵組件需要分析:原始PDF文件和包含提取文字的文字文件。 本節將指導您理解和評估腳本的輸出。

原始PDF文件

您選擇進行此過程的PDF文件,在本例中名為"old-report.pdf",是起點。 PDF文件可能在複雜性和內容上有很大差異。 它們可能包含簡單、直白的文字,也可能充滿圖片、表格和各種文字格式。 您的PDF結構和複雜性將直接影響提取過程。

<NL=IMG-290-BG>如何在Node.js中將PDF轉換為文字:圖1 - 原始PDF<NL=IMG-290-EG>

提取的文字文件

在運行腳本後,將建立一個名為"extracted_text.txt"的新文字文件。 該文件包含了從PDF文件中提取的所有文字。

<NL=IMG-291-BG>如何在Node.js中將PDF轉換為文字:圖2 - 提取的文字<NL=IMG-291-EG>

這是控制台上的輸出:

<NL=IMG-292-BG>如何在Node.js中將PDF轉換為文字:圖3 - 控制台輸出<NL=IMG-292-EG>

實際應用和用例

資料挖掘和分析

從PDF中提取文字在資料挖掘和分析中特別有用。 無論是提取財務報告、研究論文,還是其他任何PDF文件,將PDF轉換為文字的能力對於資料分析任務至關重要。

內容管理系統

在內容管理系統中,您常常需要處理各種文件格式。 IronPDF可以成為管理、歸檔和檢索以PDF格式儲存的內容的系統中的關鍵組件。

結論

<NL=IMG-293-BG>如何在Node.js中將PDF轉換為文字:圖4 - 授權<NL=IMG-293-EG>

這份全面指南帶您完成了使用IronPDF設置Node.js專案以從PDF文件中提取文字的過程。 從處理基本文字提取到深入探索更複雜的功能(如文字物件提取和性能優化),您現在具備了在Node.js應用程式中實現高效PDF文字提取的知識。

請記住,這趟旅程並未在此結束。 PDF處理和文字提取的領域廣闊,還有許多功能和技術等待探索。 迎接挑戰,繼續在這個激動人心的軟體開發領域中提升您的技能。

值得注意的是,IronPDF提供使用者免費試用。 對於希望將IronPDF整合到專業環境中的人員來說,也提供授權選項。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

...
閱讀更多

相關文章

Key in blue circle

立即免費取得 30 天試用金鑰。

Your trial license will be sent to your email address

無任何限制。100% 解鎖。無需信用卡。

OR
bullet_checked無需信用卡或建立帳號無任何限制。100% 解鎖。無需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
預訂您的免費線上演示
Booking Badge

獲得來自全球數百萬工程師的信賴

Iron Software的客戶徽標
獲取您的無義務諮詢
填寫以下表格或發送電子郵件至sales@ironsoftware.com
您的資料將始終保密。
獲得來自全球數百萬工程師的信賴
Iron Software的客戶徽標
立即獲取您的30天試用金鑰。
無需信用卡或帳戶建立
C# 用於PDF的NuGet程式庫
使用NuGet安裝

版本: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. 在解決方案資源管理器,右鍵點選參考,管理NuGet包
  2. 選擇瀏覽並搜尋"IronPdf"
  3. 選擇套件並安裝
C# PDF DLL
下載DLL

版本: 2026.9

或者點擊此處下載Windows安裝程式。

  1. 下載並解壓IronPDF到類似~/Libs的位置,位於您的解決方案目錄中
  2. 在Visual Studio解決方案資源管理器,右鍵點選參考。選擇瀏覽,"IronPdf.dll"

授權從$999起