IRONSOFTWAREHOME
USING IRONPDF FOR PYTHON

如何在 Python 中從 PDF 提取文字

Curtis Chau
Curtis Chau
Updated: 2025年6月22日

本文將示範如何使用IronPDF在Python中從PDF文件中提取所有文字,提供您完成此任務所需的知識和Python程式碼範例,以提高效率。

IronPDF - Python 程式庫

IronPDF for Python是一個強大的Python PDF程式庫,允許開發者從PDF文件中提取文字。 使用IronPDF,您可以自動化PDF文件中文字內容的資料提取,使處理和分析PDF文件中的資訊更加容易。

IronPDF為Python程式設計師提供操縱、提取資料和與PDF文件互動的能力,使自動化各種與PDF相關的任務更為方便。 無論您需要生成PDF、修改現有PDF、提取內容資料或進行其他PDF操作,IronPDF都能通過其直觀的API和強大功能簡化流程。

主要特點

IronPDF for Python程式庫的一些特點包括:

先決條件

在使用IronPDF提取文字之前,確保您已具備以下先決條件:

  1. **Python安裝:**確保您的系統上已安裝Python。 IronPDF與Python 3.x版本相容,因此確保您擁有相容的Python安裝。

  2. **IronPDF程式庫:**使用pip(Python軟體包管理器)安裝IronPDF程式庫。 打開命令行介面並執行以下命令:

    > pip install ironpdf

    **注意:**必須將Python新增到PATH環境變數中才能使用pip命令。

  3. **整合開發環境(IDE):**雖然不是必須的,但使用IDE可以大大提升您的開發體驗。 它提供程式碼補全、除錯與更流暢的工作流程等功能。 Python開發中一個受歡迎的IDE是PyCharm。 您可以從JetBrains網站下載並安裝PyCharm https://www.jetbrains.com/pycharm/。

  4. **文字編輯器:**或者,如果您偏好使用輕量級文字編輯器,可以選擇任意您喜歡的文字編輯器,如Visual Studio Code、Sublime Text或Atom。 這些編輯器提供語法高亮和其他有用的Python開發功能。 您還可以使用Python自己的IDLE應用程式。

使用PyCharm建立Python專案

安裝PyCharm IDE後,按照以下步驟建立PyCharm Python專案:

  1. **啟動PyCharm:**從系統的應用啟動器或桌面快捷方式中打開PyCharm。

  2. **建立新專案:**點擊"建立新專案"或者打開已存在的Python專案。

    如何在Python中將PDF轉換為文字(教程),圖1:PyCharm IDE PyCharm IDE

  3. **配置專案設置:**為專案提供一個名稱,並選擇建立專案目錄的位置。 選擇專案的Python解釋器。 然後點擊"建立"。

    如何在Python中將PDF轉換為文字(教程),圖2:在Pycharm中建立新Python專案 在Pycharm中建立新Python專案

  4. **建立源文件:**PyCharm將建立專案結構,包括主Python文件和附加源文件的目錄。 開始編寫程式碼,點擊運行按鈕或按Shift+F10執行程式。

在Python中使用IronPDF提取PDF中的文字

現在讓我們深入了解使用Python編程語言的IronPDF從PDF文件中提取純文字所涉及的步驟。

導入所需的程式庫

首先,在Python腳本中導入所需的程式庫。 在這種情況下,程式範例需要導入IronPDF程式庫,這提供了操作PDF文件的功能。

import ironpdf
Python

設置許可金鑰

要使用IronPDF從PDF文件中提取全文,您需要獲得IronPDF許可。 使用以下命令應用許可或試用金鑰:

# Apply your license key
License.LicenseKey = "YOUR-LICENSE-KEY-HERE"
Python

**注意:**沒有許可金鑰,IronPDF提取資料僅限於從PDF擴展文件中提取少數字元。通過購買IronPDF或註冊免費試用獲取許可金鑰。

載入PDF文件

接下來,使用IronPDF中的PdfDocument.FromFile()方法載入PDF文件。 將PDF文件的路徑作為該方法的參數。 這將把PDF文件載入到PdfDocument物件中。

pdf = ironpdf.PdfDocument.FromFile("path/to/your/pdf_file.pdf")
Python

輸入文件

要從輸入PDF文件中提取文字並顯示在畫面上,使用下面的文件:

如何在Python中將PDF轉換為文字(教程),圖3:輸入文件 輸入文件

從PDF文件提取文字

一旦載入了PDF文件,您可以使用ExtractText方法提取文字內容。 此方法將作為字串返回提取的文字。

text = pdf.ExtractText()
Python

處理和使用提取的文字

現在您已經從PDF提取了文字,您可以根據需要處理和使用它。 您可以執行解析文字、分析、儲存在資料庫中或用於進一步資料處理等任務。

# Process and utilize the extracted text
print(text)
# Perform other operations with the extracted text
Python

輸出

如何在Python中將PDF轉換為文字(教程),圖4:從控制台提取的文字 從控制台提取的文字

從PDF文件的特定頁面提取文字

IronPDF還提供了一種方便的方法,從PDF文件的特定頁面提取文字。本節將探討如何使用IronPDF提供的ExtractTextFromPage方法從特定頁面提取文字。

以下程式碼顯示了如何從特定頁面提取文字:

# Extract text from a specific page in the document
page_2_text = pdf.ExtractTextFromPage(1)
Python

在上面的範例程式碼中,PdfDocument物件。 ExtractTextFromPage()方法用於從特定頁面提取文字,由作為參數傳遞的頁面索引表示。 在此情況下,文字從第二頁或頁面編號2中提取,對應於頁面索引1。

如何在Python中將PDF轉換為文字(教程),圖5:從頁面2提取文字 從頁面2提取文字

結論

本文探討了如何使用IronPDF在Python中從PDF文件中提取文字。 它涵蓋了必要的步驟,包括導入所需程式庫、載入PDF文件、提取文字內容及處理提取的文字。

憑藉IronPDF強大的文字提取功能,您可以自動化PDF中文字的提取和進一步處理,輕鬆處理並分析PDF文件中的文字資訊。 其直觀的API和廣泛的功能使其成為Python開發中廣泛PDF任務的理想選擇。

IronPDF免費供開發使用,但商業用途需要許可。 要在生產模式中測試它,請獲取免費試用。 下載並安裝最新版本的IronPDF for Python並試試看。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

...
閱讀更多

相關文章

Key in blue circle

立即免費取得 30 天試用金鑰。

Your trial license will be sent to your email address

無任何限制。100% 解鎖。無需信用卡。

OR
bullet_checked無需信用卡或建立帳號無任何限制。100% 解鎖。無需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
預約您的免費即時演示
Booking Badge

全球數百萬工程師的信賴

Iron Software的客戶標誌
獲取您的無義務諮詢
填寫以下表格或發送電子郵件至sales@ironsoftware.com
您的詳細資訊將始終保密。
全球數百萬工程師的信賴
Iron Software的客戶標誌
立即獲取您的30天試用金鑰。
無需信用卡或帳戶建立
C# 用於PDF的NuGet程式庫
使用NuGet安裝

版本: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. 在解決方案資源管理器,右鍵點選參考,管理NuGet包
  2. 選擇瀏覽並搜尋"IronPdf"
  3. 選擇套件並安裝
C# PDF DLL
下載DLL

版本: 2026.9

或者點擊此處下載Windows安裝程式。

  1. 下載並解壓IronPDF到類似~/Libs的位置,位於您的解決方案目錄中
  2. 在Visual Studio解決方案資源管理器,右鍵點選參考。選擇瀏覽,"IronPdf.dll"

授權從$999起