IRONSOFTWAREHOME
USING IRONPDF FOR PYTHON

如何在 Python 中將 PDF 轉換為文字(教程)

Curtis Chau
Curtis Chau
Updated: 2026年4月21日

本文將展示如何使用IronPDF for Python,一種最強大的PDF程式庫之一,從PDF文件中提取任何可用的文字。

2.0 如何使用Python從PDF中提取文字?

  1. 從Python下載頁面安裝Python的最新版本
  2. 打開任何Python IDE工具
  3. 安裝.NET Core運行時
  4. 安裝IronPDF for Python庫或從PyPI下載頁面下載
  5. 從PDF中提取文字

2.1 IronPDF for Python是什麼?

將IronPDF程式庫整合到Python中非常簡單,因為相比其它語言,Python是一種更加動態的語言,允許開發者快速且輕鬆地建立圖形使用者介面。 它擁有許多預先安裝的工具,包括PyQT、wxWidgets、kivy,還有大量其他的套件和庫,這些都可以用來快速且安全地建立完整的GUI。

IronPDF for Python是一個非常高效的程式庫,尤其適用於網頁開發。 這歸功於大量Python網頁開發的範例存在,如Django、Flask和Pyramid的廣泛使用。 這些框架已被包括Reddit、Mozilla和Spotify在內的諸多網站和線上服務使用。

2.2 IronPDF的功能

  • 可以從多種來源建立PDF文件,包括HTML、HTML5、ASP和PHP網站。 除了HTML文件之外,也可以將圖片文件轉換為PDF。
  • IronPDF允許您構建互動式PDF文件,填寫和發送互動表單,分割和合併PDF文件,從PDF文件中提取文字和圖片,在PDF文件中搜尋特定詞語,將PDF頁面點陣化為圖片,將PDF轉換為HTML,並列印PDF文件。
  • IronPDF可以打開PDF文件並從URL列印。 此外,它還允許使用者代理在HTML登錄表單、代理、Cookie、HTTP標頭、自定義網路登錄憑據、表單變數和使用者代理後登錄。
  • 圖片可以通過IronPDF從文件中提取出來。
  • 使用IronPDF,您可以非常輕鬆地在文件中新增頁眉和頁腳、文字和圖片、書籤以及水印等。
  • 可以使用新的或現有的文件結合和分離頁面。
  • 不必使用Acrobat查看器,也可以將文件轉換為PDF物件。
  • 一個CSS文件可以用來製作PDF文件。
  • 使用媒體型別CSS文件可以製作文件。

2.3 匯入IronPDF庫

在IronPDF將被使用的源文件的開始處包含以下匯入語句以匯入IronPDF:

from ironpdf import *
Python

2.4 設置授權金鑰(如果需要)

雖然IronPDF for Python可免費使用,但它會對自由使用者的PDF文件進行帶瓷磚背景的水印處理。 您必須提供該庫一個合法的授權金鑰才能使用IronPDF建立不帶水印的PDF。 以下程式碼片段顯示如何用授權金鑰設置庫:

# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
Python

在建立PDF文件或更改其內容之前,確保配置好授權金鑰。 應在其他任何程式碼行之前調用LicenseKey方法。 要獲取免費試用授權金鑰,請存取授權頁面。

2.5 設置日誌文件

一個名為"Default"的文字文件可以儲存在Python腳本目錄內由Custom.log生成的日誌消息。 可以使用以下程式碼片段設置LogFilePath屬性並自定義日誌文件的名稱和位置:

# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
Python

3.0 使用IronPDF提取PDF文字

IronPDF for Python庫可以將PDF頁面轉換為PDF物件,並允許從PDF文件中提取文字,這包括掃描的PDF文件。 這裡有一個例子,展示如何使用IronPDF讀取現有的PDF。

第一個方法涉及提取PDF中的所有可用文字; 下面提供了一個程式碼樣本。

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()

# Display the extracted text
print(all_text)
Python

如上面的程式碼所示,FromFile方法是一個PDF閱讀器物件,用於載入現有的PDF文件並將其轉換為PDF文件物件。 此物件可用於讀取PDF頁面上的文字和圖像。 該物件提供一個名為ExtractAllText的方法,該方法從整個PDF文件中提取每一段文字,並將其保存在一個可處理的字串中。 然後使用print函式顯示文字。

如何在Python中將PDF轉換為文字(教程),圖1:顯示文字 顯示文字

第二種方法的程式碼範例提供了按頁按頁提取PDF文件中文字的功能。下面提供了該範例。

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)

# Display the extracted text from the specified page
print(page_text)
Python

如上程式碼所示,FromFile方法用於從現有文件載入PDF文件,並將其轉換為PDF文件物件。 PDF頁面物件上的一個名為ExtractTextFromPage的方法從PDF文件中的頁面中檢索所有文字。必須將頁碼作為參數提供以提取特定頁面的文字。 然後,提取文字後,可以使用page_text來儲存可被處理的資訊。

查看更多例子以提取PDF中的文字。

4.0 結論

另一方面,IronPDF程式庫提供強大的安全措施以減少潛在風險。 它不針對任何特定的瀏覽器設置,可以與所有常用瀏覽器一起使用。 IronPDF允許程式設計師只需幾行程式碼即可輕鬆地建立和讀取PDF文件。 IronPDF程式庫提供了各種授權選項,包括免費開發者授權和可購買的額外開發授權,以滿足不同開發者的需求。

IronPDF包括永久授權、30天退款保證、一年的軟體支援和升級選項。 首次購買後不再有其他費用支出。 這些授權可以在開發、測試和生產環境中使用。 了解更多有關產品授權的資訊。

下載軟體產品。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

...
閱讀更多

相關文章

Key in blue circle

立即免費取得 30 天試用金鑰。

Your trial license will be sent to your email address

無任何限制。100% 解鎖。無需信用卡。

OR
bullet_checked無需信用卡或建立帳號無任何限制。100% 解鎖。無需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
預約您的免費即時演示
Booking Badge

全球數百萬工程師的信賴

Iron Software的客戶標誌
獲取您的無義務諮詢
填寫以下表格或發送電子郵件至sales@ironsoftware.com
您的詳細資訊將始終保密。
全球數百萬工程師的信賴
Iron Software的客戶標誌
立即獲取您的30天試用金鑰。
無需信用卡或帳戶建立
C# 用於PDF的NuGet程式庫
使用NuGet安裝

版本: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. 在解決方案資源管理器,右鍵點選參考,管理NuGet包
  2. 選擇瀏覽並搜尋"IronPdf"
  3. 選擇套件並安裝
C# PDF DLL
下載DLL

版本: 2026.9

或者點擊此處下載Windows安裝程式。

  1. 下載並解壓IronPDF到類似~/Libs的位置,位於您的解決方案目錄中
  2. 在Visual Studio解決方案資源管理器,右鍵點選參考。選擇瀏覽,"IronPdf.dll"

授權從$999起